Anthropic planerar att lägga till osynlig vattenmärkning i text som genereras av framtida Claude-modeller, vilket ska göra det enklare att identifiera AI-genererat innehåll.

Vattenmärkning av Claude-text kommer att lanseras globalt eftersom Anthropic ännu inte har något tillförlitligt sätt att begränsa funktionen till specifika regioner. Satsningen stödjer EU:s AI-förordning och EU:s uppförandekod för AI-leverantörer.

Vattenmärkningen lägger inte till dolda tecken

Anthropic uppger att läsare inte kommer att kunna se någon vattenmärkning i Claudes svar. Systemet lägger inte till synliga etiketter, dolda tecken eller extra tokens i den genererade texten.

I stället påverkar tekniken hur Claude gör vissa mindre betydelsefulla ordval när ett svar genereras.

Språkmodeller genererar text en token i taget. Ofta finns det flera möjliga ord som passar naturligt på samma plats i en mening. Vattenmärkningen av Claude-text använder en hemlig nyckel och den föregående kontexten för att påverka slumpmässigheten bakom vissa av dessa val.

Den slutliga texten ska fortfarande låta naturlig. I ett längre svar skapar ordvalen däremot ett statistiskt mönster som en auktoriserad detektor kan känna igen.

Anthropic uppger att interna tester inte visade någon praktisk påverkan på kvaliteten, kreativiteten eller läsbarheten i Claudes svar. Företaget räknar också med en försumbar påverkan på genereringshastigheten.

Claude använder en metod baserad på SynthID-Text

Anthropics metod bygger vidare på Google DeepMinds forskning kring SynthID-Text.

I stället för att ändra ett färdigt svar fungerar tekniken medan modellen genererar texten. Ett detekteringssystem kan sedan analysera sekvensen av ordval och bedöma om texten motsvarar det mönster som förväntas från ett Claude-svar som skapats med den hemliga nyckeln.

Detektorn behöver inte ha tillgång till Claudes underliggande modell för att göra bedömningen. Däremot behöver den den relevanta vattenmärkningsnyckeln.

Resultatet är en sannolikhetsbedömning och inte ett definitivt bevis på vem som har skapat texten. En vattenmärkning kan indikera att Claude sannolikt har bidragit till innehållet, men den kan inte avgöra om Claude skrev hela texten eller kraftigt redigerade ett mänskligt utkast.

Kod och fasta faktasvar får mindre vattenmärkning

Vattenmärkningen av Claude-text används inte i samma utsträckning för alla typer av innehåll.

Anthropic uppger att systemet inte ingriper när ett svar kräver ett exakt resultat. Om en modell exempelvis ska slutföra ”2 + 2 =” finns det bara en tydligt korrekt nästa token.

Samma begränsning gäller för stora delar av kodgenerering. Att ersätta en term i kod med ett annat möjligt ord kan göra att koden slutar fungera. Därför har Claude färre möjligheter att lägga till ett vattenmärke i kod.

Vissa delar av kod, exempelvis kommentarer, kan fortfarande innehålla vattenmärkta ordval. Anthropic uppger dock att systemet inte ska påverka själva koden på något betydande sätt.

Detekteringen fungerar också bättre när en text innehåller fler flexibla språkliga val. Längre kreativa eller konversationsbaserade texter ger därför mer underlag än korta och mycket faktabaserade svar.

Anthropic planerar ett API för detektering

Anthropic utvecklar ett API som ska uppskatta om Claude sannolikt har bidragit till ett inskickat textprov.

Detekteringen kan bli mindre tillförlitlig om någon skriver om innehållet i stor omfattning eller endast skickar in ett mycket kort textprov. Lätt korrekturläsning kan lämna kvar spår som går att upptäcka, medan en fullständig omskrivning där varje ord ersätts kan ta bort vattenmärkningen.

Översättningar som Claude genererar kan också innehålla en vattenmärkning eftersom modellen väljer varje ord i den översatta texten.

Anthropic kommer att använda en annan metod för AI-genererade filer. För PNG-, JPG- och SVG-filer kommer Claude att lägga till kryptografiskt signerad C2PA-metadata som visar att Claude har skapat eller bearbetat filen.


0 svar till ”Så kommer Anthropic att vattenmärka AI-genererad text från Claude”