textGrain: OpenAI watermerkt ChatGPT- en Codex-tekst in EU
OpenAI gaat een onzichtbaar watermerk aanbrengen in tekst die ChatGPT en Codex genereren voor gebruikers in de Europese Unie. Volgens het bedrijf gebeurt de uitrol in de komende weken en geldt die voor "in aanmerking komende" output.
Lezers kunnen het watermerk niet zien, en bij het kopiëren van tekst blijft er ook geen zichtbaar merkteken achter. De technologie heet textGrain en werkt door de woordkeuze van het model licht bij te sturen. Die kleine verschuivingen vormen samen een statistisch patroon waar een detector later naar kan zoeken.
"In de komende weken voegen we een onzichtbaar watermerk toe aan in aanmerking komende tekstoutput van ChatGPT en Codex in de Europese Unie", aldus OpenAI.
Opt-in voor ontwikkelaars, beperkte toegang tot de detector
De uitrol in de EU betekent niet dat watermerken wereldwijd de standaard worden. Buiten ChatGPT en Codex in de EU blijft de functie uitgeschakeld, tenzij iemand haar zelf aanzet.
API-ontwikkelaars kunnen overal ter wereld vanaf nu kiezen voor watermerken bij ondersteunde modellen. Standaard staat de functie uit.
Daarnaast neemt OpenAI aanvragen in behandeling voor toegang tot zijn watermerkdetector. In eerste instantie krijgen alleen goedgekeurde onderzoekers en deskundige organisaties toegang.
Lichte bewerkingen verzwakken de detectie
OpenAI is open over de beperkingen van de aanpak. Uit eigen tests blijkt dat gewone bewerkingen het succespercentage van de detector flink kunnen drukken.
"In een evaluatie van passages van 400 tokens verlaagde het vervangen van 10% van de woorden door synoniemen de detectie van ongeveer 92% naar 66%. Het vervangen van 25% van de woorden verlaagde die naar 17%", meldt het bedrijf.
Ook de lengte speelt een rol. Bij een beoogd percentage vals-positieven van 1% werd het watermerk gevonden in ongeveer 80% van de psychologieantwoorden van 200 tokens. Bij antwoorden van 400 tokens liep dat op tot zo'n 95%.
In vakgebieden als wiskunde vielen de resultaten zwakker uit. Daar heeft het model minder ruimte om tussen alternatieve woorden te kiezen, waardoor er ook minder ruimte overblijft voor het patroon.
"Het ontbreken van een gedetecteerd watermerk bewijst niet dat een tekst door een mens is geschreven", waarschuwt OpenAI. "Tekst die met tools van OpenAI is gegenereerd, kan te kort, bewerkt of vertaald zijn om betrouwbare detectie mogelijk te maken."
Wat het watermerk niet prijsgeeft
Volgens OpenAI zegt een positieve detectie niets over wie de tekst heeft gegenereerd. Ook het account, de prompt of het gesprek erachter worden er niet mee blootgelegd.
De detector kan evenmin meten hoeveel van een afgerond stuk door een mens is geschreven of bewerkt. Een positief resultaat geeft alleen aan dat het watermerkpatroon aanwezig is.
Volgens OpenAI heeft het watermerk geen noemenswaardig effect op de kwaliteit van GPT-6 Astra. De benchmarkresultaten bleven met textGrain ingeschakeld grotendeels gelijk.
Onze analyse
Voor securityteams is het belangrijkste detail hoe makkelijk het signaal breekt. Uit OpenAI's eigen cijfers blijkt dat het vervangen van een kwart van de woorden de detectie terugbrengt tot 17%, en vertaling of korte output kan het watermerk volledig onschadelijk maken. Wie door AI gegenereerde tekst als eigen werk wil laten doorgaan, phishingbendes en fraudeurs incluis, zal het patroon waarschijnlijk zonder veel moeite kunnen verwijderen. Dat wijst erop dat textGrain zich beter leent voor het betrappen van slordige of onbewerkte output dan voor het tegenhouden van vastberaden misbruik.
Het privacyontwerp is een pluspunt. Het watermerk bevat geen account- of promptgegevens, en is dus geen volgmechanisme voor individuele gebruikers. Toch moeten organisaties oppassen dat ze een uitslag van de detector niet als bewijs van wat dan ook opvatten. OpenAI zegt zelf onomwonden dat een ontbrekend watermerk niet bewijst dat een tekst door een mens is geschreven.
De stap komt op een moment dat de sector worstelt met steeds grotere hoeveelheden machinaal geschreven content. Google zette onlangs een opensource-bugbountyprogramma stil vanwege een stortvloed aan door AI gegenereerde meldingen, een situatie waarin betrouwbare detectie goed van pas zou komen. Bovendien komt het kort nadat OpenAI de lancering van GPT-6.1 Astra in de ijskast zette om aan de veiligheidsonderbouwing te werken.
Het is de moeite waard om in de gaten te houden of OpenAI de standaardinstelling uitbreidt tot buiten de EU en hoe breed het de detector openstelt. Een andere open vraag is of andere AI-leveranciers vergelijkbare systemen invoeren, en of onafhankelijke onderzoekers die toegang krijgen OpenAI's eigen detectiecijfers bevestigen.
