Anthropic planlægger at tilføje usynlig vandmærkning til tekst, der genereres af fremtidige Claude-modeller, hvilket skal gøre det lettere at identificere AI-genereret indhold.
Vandmærkning af Claude-tekst vil blive lanceret globalt, fordi Anthropic endnu ikke har en pålidelig måde at begrænse funktionen til bestemte regioner. Tiltaget understøtter EU’s AI-forordning og EU’s Code of Practice for AI-udbydere.
Vandmærkningen tilføjer ikke skjulte tegn
Anthropic oplyser, at læsere ikke vil kunne se noget vandmærke i Claudes svar. Systemet indsætter ikke synlige mærkater, skjulte tegn eller ekstra tokens i den genererede tekst.
I stedet påvirker teknologien, hvordan Claude foretager visse mindre betydningsfulde ordvalg, mens et svar genereres.
Sprogmodeller genererer tekst én token ad gangen. Ofte findes der flere mulige ord, som naturligt passer på det samme sted i en sætning. Vandmærkning af Claude-tekst bruger en hemmelig nøgle og den foregående kontekst til at påvirke tilfældigheden bag nogle af disse valg.
Den færdige tekst skal stadig fremstå naturlig. I længere svar skaber ordvalgene dog et statistisk mønster, som en autoriseret detektor kan genkende.
Anthropic oplyser, at interne tests ikke viste nogen praktisk påvirkning af kvaliteten, kreativiteten eller læsbarheden af Claudes svar. Virksomheden forventer også en ubetydelig påvirkning af genereringshastigheden.
Claude bruger en metode baseret på SynthID-Text
Anthropics metode bygger på Google DeepMinds forskning i SynthID-Text.
I stedet for at ændre et færdigt svar fungerer teknologien, mens modellen genererer teksten. Et detektionssystem kan derefter analysere rækkefølgen af ordvalg og vurdere, om teksten matcher det mønster, der forventes fra et Claude-svar genereret med den hemmelige nøgle.
Detektoren behøver ikke adgang til Claudes underliggende model for at foretage denne vurdering. Den skal dog have adgang til den relevante vandmærkningsnøgle.
Resultatet er et sandsynlighedsestimat og ikke et endeligt bevis på, hvem der har skrevet teksten. Et vandmærke kan indikere, at Claude sandsynligvis har bidraget til indholdet, men det kan ikke afgøre, om Claude skrev hele teksten eller i høj grad redigerede et menneskeskrevet udkast.
Kode og faste faktasvar får mindre vandmærkning
Vandmærkning af Claude-tekst anvendes ikke i samme omfang på alle typer indhold.
Anthropic oplyser, at systemet ikke griber ind, når et svar kræver et præcist resultat. Hvis en model eksempelvis skal fuldføre “2 + 2 =”, findes der kun én klart korrekt næste token.
Den samme begrænsning gælder for store dele af kodegenerering. Hvis et udtryk i kode erstattes med et andet plausibelt ord, kan det få koden til at fejle. Derfor har Claude færre muligheder for at tilføje et vandmærke til kode.
Visse dele af kode, såsom kommentarer, kan stadig indeholde vandmærkede ordvalg. Anthropic siger dog, at systemet ikke bør påvirke selve koden i væsentlig grad.
Detektionen fungerer også bedre, når teksten indeholder flere fleksible sproglige valg. Længere kreative eller samtalebaserede tekster giver derfor mere grundlag for detektion end korte og meget faktabaserede svar.
Anthropic planlægger et API til detektion
Anthropic udvikler et API, der skal estimere, om Claude sandsynligvis har bidraget til en indsendt tekstprøve.
Detektionen kan blive mindre pålidelig, hvis en person omskriver indholdet omfattende eller kun indsender en meget kort tekstprøve. Let korrekturlæsning kan efterlade spor, som stadig kan registreres, mens en fuldstændig omskrivning, hvor hvert ord erstattes, kan fjerne vandmærket.
Oversættelser genereret af Claude kan også indeholde et vandmærke, fordi modellen vælger hvert ord i den oversatte tekst.
Anthropic vil bruge en anden metode til AI-genererede filer. For PNG-, JPG- og SVG-filer vil Claude tilføje kryptografisk signerede C2PA-metadata, der viser, at Claude har oprettet eller behandlet filen.


0 svar til “Sådan vil Anthropic vandmærke AI-genereret tekst fra Claude”