Anthropic planlegger å legge til usynlig vannmerking i tekst som genereres av fremtidige Claude-modeller, noe som skal gjøre det enklere å identifisere AI-generert innhold.
Vannmerking av Claude-tekst vil bli lansert globalt fordi Anthropic ennå ikke har en pålitelig måte å begrense funksjonen til bestemte regioner. Tiltaket støtter EUs AI-forordning og EUs Code of Practice for AI-leverandører.
Vannmerkingen legger ikke til skjulte tegn
Anthropic opplyser at lesere ikke vil kunne se noe vannmerke i Claudes svar. Systemet legger ikke til synlige etiketter, skjulte tegn eller ekstra tokens i den genererte teksten.
I stedet påvirker teknologien hvordan Claude gjør enkelte mindre betydningsfulle ordvalg mens et svar genereres.
Språkmodeller genererer tekst én token om gangen. Ofte finnes det flere mulige ord som passer naturlig på samme sted i en setning. Vannmerking av Claude-tekst bruker en hemmelig nøkkel og den foregående konteksten til å påvirke tilfeldigheten bak enkelte av disse valgene.
Den ferdige teksten skal fortsatt fremstå naturlig. I et lengre svar skaper ordvalgene imidlertid et statistisk mønster som en autorisert detektor kan gjenkjenne.
Anthropic opplyser at interne tester ikke viste noen praktisk effekt på kvaliteten, kreativiteten eller lesbarheten i Claudes svar. Selskapet forventer også en ubetydelig påvirkning på genereringshastigheten.
Claude bruker en metode basert på SynthID-Text
Anthropics metode bygger på Google DeepMinds forskning på SynthID-Text.
I stedet for å endre et ferdig svar fungerer teknologien mens modellen genererer teksten. Et deteksjonssystem kan deretter analysere sekvensen av ordvalg og vurdere om teksten samsvarer med mønsteret som forventes fra et Claude-svar opprettet med den hemmelige nøkkelen.
Detektoren trenger ikke tilgang til Claudes underliggende modell for å gjøre denne vurderingen. Den trenger imidlertid den relevante vannmerkingsnøkkelen.
Resultatet er et sannsynlighetsestimat, ikke et definitivt bevis på hvem som har skrevet teksten. Et vannmerke kan indikere at Claude sannsynligvis har bidratt til innholdet, men det kan ikke avgjøre om Claude skrev hele teksten eller redigerte et menneskeskrevet utkast i stor grad.
Kode og faste faktasvar får mindre vannmerking
Vannmerking av Claude-tekst brukes ikke i samme grad på alle typer innhold.
Anthropic opplyser at systemet ikke griper inn når et svar krever et eksakt resultat. Hvis en modell for eksempel skal fullføre «2 + 2 =», finnes det bare én tydelig korrekt neste token.
Den samme begrensningen gjelder for store deler av kodegenerering. Å erstatte et begrep i kode med et annet plausibelt ord kan føre til at koden ikke fungerer. Derfor har Claude færre muligheter til å legge inn et vannmerke i kode.
Enkelte deler av kode, som kommentarer, kan fortsatt inneholde vannmerkede ordvalg. Anthropic sier imidlertid at systemet ikke skal påvirke selve koden i vesentlig grad.
Deteksjonen fungerer også bedre når teksten inneholder flere fleksible språklige valg. Lengre kreative eller samtalebaserte tekster gir derfor mer bevismateriale enn korte og svært faktabaserte svar.
Anthropic planlegger et API for deteksjon
Anthropic utvikler et API som skal anslå om Claude sannsynligvis har bidratt til en innsendt tekstprøve.
Deteksjonen kan bli mindre pålitelig dersom noen skriver om innholdet i stor grad eller bare sender inn en svært kort tekstprøve. Lett korrekturlesing kan etterlate spor som fortsatt kan oppdages, mens en fullstendig omskriving der hvert ord erstattes, kan fjerne vannmerket.
Oversettelser generert av Claude kan også inneholde et vannmerke fordi modellen velger hvert ord i den oversatte teksten.
Anthropic vil bruke en annen metode for AI-genererte filer. For PNG-, JPG- og SVG-filer vil Claude legge til kryptografisk signerte C2PA-metadata som viser at Claude har opprettet eller behandlet filen.


0 responses to “Slik vil Anthropic vannmerke AI-generert tekst fra Claude”