OpenAI textGrain: Wasserzeichen für ChatGPT-Texte in der EU

OpenAI textGrain: Wasserzeichen für ChatGPT-Texte in der EU

OpenAI wird künftig ein unsichtbares Wasserzeichen in Texte einbetten, die ChatGPT und Codex für Nutzer in der Europäischen Union erzeugen. Nach Angaben des Unternehmens erfolgt die Einführung in den kommenden Wochen und betrifft "geeignete" Ausgaben.

Leser können das Wasserzeichen nicht sehen, und beim Kopieren des Textes bleibt auch keine sichtbare Markierung zurück. Die Technik namens textGrain verändert leicht, welche Wörter das Modell auswählt. Diese kleinen Verschiebungen ergeben ein statistisches Muster, nach dem ein Detektor später suchen kann.

"In den kommenden Wochen werden wir geeignete Textausgaben von ChatGPT und Codex in der Europäischen Union mit einem unsichtbaren Wasserzeichen versehen", erklärte OpenAI.

Freiwillig für Entwickler, eingeschränkter Zugang zum Detektor

Die Einführung in der EU bedeutet nicht, dass Wasserzeichen weltweit zum Standard werden. Außerhalb von ChatGPT und Codex in der EU bleibt die Funktion ausgeschaltet, solange niemand sie aktiviert.

API-Entwickler auf der ganzen Welt können das Wasserzeichen ab sofort für unterstützte Modelle freiwillig einschalten. Standardmäßig bleibt es deaktiviert.

Außerdem nimmt OpenAI Bewerbungen für seinen Wasserzeichen-Detektor entgegen. Zunächst erhalten nur zugelassene Forscher und Fachorganisationen Zugang.

Leichte Bearbeitung schwächt die Erkennung

OpenAI macht kein Geheimnis aus den Grenzen des Verfahrens. Die eigenen Tests zeigen, dass schon gewöhnliches Überarbeiten die Trefferquote des Detektors deutlich senken kann.

"In einer Auswertung von Passagen mit 400 Token sank die Erkennungsrate von etwa 92 % auf 66 %, wenn 10 % der Wörter durch Synonyme ersetzt wurden. Wurden 25 % der Wörter ersetzt, fiel sie auf 17 %", so das Unternehmen.

Auch die Länge spielt eine Rolle. Bei einer angestrebten Falsch-Positiv-Rate von 1 % wurde das Wasserzeichen in etwa 80 % der Psychologie-Antworten mit 200 Token gefunden. Bei Antworten mit 400 Token stieg der Wert auf rund 95 %.

Schwächer fielen die Ergebnisse in Fächern wie Mathematik aus. Dort hat das Modell weniger Spielraum bei der Wahl alternativer Wörter, sodass weniger Platz für das Muster bleibt.

"Wird kein Wasserzeichen erkannt, beweist das nicht, dass ein Mensch den Text verfasst hat", warnte OpenAI. "Mit OpenAI-Werkzeugen erzeugte Texte können zu kurz, bearbeitet oder übersetzt sein, als dass die Erkennung zuverlässig funktionieren würde."

Was das Wasserzeichen nicht verrät

Laut OpenAI lässt sich aus einem positiven Treffer nicht ablesen, wer den Text erzeugt hat. Auch Konto, Prompt oder die zugrunde liegende Unterhaltung werden dadurch nicht offengelegt.

Ebenso wenig kann der Detektor messen, wie viel eines fertigen Textes von einem Menschen geschrieben oder bearbeitet wurde. Ein positives Ergebnis zeigt lediglich an, dass das Wasserzeichen-Muster vorhanden ist.

OpenAI zufolge hat das Wasserzeichen keinen nennenswerten Einfluss auf die Qualität von GPT-6 Astra. Die Benchmark-Ergebnisse blieben mit aktiviertem textGrain weitgehend gleich.

Unsere Einschätzung

Für Sicherheitsteams ist vor allem entscheidend, wie leicht das Signal kaputtgeht. OpenAIs eigene Zahlen zeigen, dass der Austausch eines Viertels der Wörter die Erkennungsrate auf 17 % drückt, und Übersetzungen oder kurze Ausgaben können sie ganz aushebeln. Wer KI-generierte Texte als eigene ausgeben will, darunter Phishing-Betreiber oder Betrüger, dürfte das Muster ohne große Mühe entfernen können. textGrain eignet sich daher wohl eher dazu, nachlässige oder unveränderte Ausgaben zu erkennen, als entschlossenen Missbrauch zu verhindern.

Positiv ist der Datenschutzansatz. Das Wasserzeichen enthält weder Konto- noch Prompt-Daten und taugt daher nicht zur Überwachung einzelner Nutzer. Organisationen sollten ein Detektor-Ergebnis trotzdem nicht als Beweis für irgendetwas werten. OpenAI sagt selbst ganz deutlich, dass ein fehlendes Wasserzeichen keine menschliche Urheberschaft belegt.

Der Schritt kommt zu einer Zeit, in der die Branche mit immer mehr maschinell geschriebenen Inhalten kämpft. Google hat kürzlich ein Open-Source-Bug-Bounty-Programm ausgesetzt, weil es mit KI-generierten Meldungen überflutet wurde, ein Fall, in dem eine zuverlässige Erkennung hilfreich wäre. Zudem folgt er kurz darauf, dass OpenAI den Start von GPT-6.1 Astra auf Eis gelegt hat, um an Sicherheitsnachweisen zu arbeiten.

Es lohnt sich zu beobachten, ob OpenAI die Standardeinstellung über die EU hinaus ausweitet und wie breit das Unternehmen den Detektor öffnet. Offen ist auch, ob andere KI-Anbieter vergleichbare Verfahren übernehmen und ob unabhängige Forscher, die Zugang erhalten, OpenAIs eigene Erkennungswerte bestätigen.