Anthropic PBC heeft aangekondigd dat het een onzichtbaar watermerk gaat toevoegen aan tekst en afbeeldingen die door Claude worden gegenereerd.
The Register meldde deze wijziging vandaag, op basis van een helpdeskartikel dat maandag werd gepubliceerd. De maatregel geldt voor de kunstmatige-intelligentiemodellen van Claude en voor de Anthropic-diensten waarop deze zijn gebaseerd.
De watermerktechnologie is bedoeld om Claude in overeenstemming te brengen met de Europese AI-wet, de AI Act. Die wet trad in 2024 in werking en bevat een vrijwillige gedragscode, de Code of Practice, die Anthropic heeft ondertekend. Deze bepaling schrijft voor dat aanbieders van modellen AI-gegenereerde content moeten markeren.
Volgens Anthropic zal het watermerken van tekst worden toegepast op Claude-modellen die na 2 augustus zijn uitgebracht. Later wil het bedrijf deze functie ook beschikbaar maken voor oudere modellen. Het watermerk is volgens het bedrijf onzichtbaar en blijft behouden als de tekst naar andere toepassingen wordt gekopieerd. Het kan zelfs zichtbaar blijven, of beter gezegd intact blijven, wanneer gebruikers de tekst aanpassen.
Hoe het tekstwatermerk precies werkt, heeft het bedrijf niet toegelicht. Wel kan een onderzoekspaper van Google DeepMind uit 2024 een aanwijzing geven. In die paper wordt een technologie beschreven die de woordkeuze van een taalmodel aanpast, zodat de gegenereerde tekst detecteerbaar wordt. Mogelijk gebruikt het watermerksysteem van Anthropic een vergelijkbare methode.
Het watermerksysteem van DeepMind ondersteunt niet alleen tekst, maar ook door AI gegenereerde afbeeldingen, video’s en audio. De technologie, SynthID genaamd, is geïntegreerd in verschillende consumentgerichte AI-diensten van Google LLC. Anthropic wil eveneens mediabestanden die door Claude worden gegenereerd voorzien van een markering. In het helpdeskartikel van maandag worden onder meer de afbeeldingsformaten JPG, PNG en SVG genoemd.
Anthropic zal afbeeldingen markeren met een technologie genaamd C2PA. Deze werkt door AI-gegenereerde afbeeldingen te koppelen aan een metadata-bestand waarin staat welk model de afbeelding heeft gemaakt, wanneer dat gebeurde en of er auteursrechtelijke beperkingen gelden. Ontwikkelaars kunnen daar ook andere gegevens aan toevoegen.
C2PA bevat meerdere mechanismen die moeten voorkomen dat hackers de metadata van afbeeldingen aanpassen. Zo wordt van elk metadata-bestand een hash, oftewel een unieke identificatiecode, gemaakt, waardoor wijzigingen eenvoudig zijn te herkennen. De technologie kan ook detecteren wanneer hackers proberen het volledige metadata-bestand te vervangen in plaats van het aan te passen.
Anthropic is van plan tooling uit te brengen waarmee gebruikers eenvoudiger Claude-gegenereerde content kunnen herkennen. Tegelijkertijd waarschuwt het bedrijf dat de technologie niet perfect zal zijn. Vooral korte tekstfragmenten of sterk bewerkte tekst zal niet altijd betrouwbaar als watermerkbaar worden herkend.
Ook OpenAI Group PBC heeft de vrijwillige Code of Practice van de AI Act ondertekend. Deze bepaling trad vorige week in werking, wat betekent dat de ontwikkelaar van ChatGPT mogelijk binnenkort een eigen watermerksysteem voor tekst lanceert. OpenAI ontwikkelde in 2024 al een implementatie van zo’n functie en zit in het stuurcomité van het consortium dat C2PA ontwikkelt.






