textGrain : OpenAI filigrane ChatGPT et Codex dans l'UE

textGrain : OpenAI filigrane ChatGPT et Codex dans l'UE

OpenAI va commencer à intégrer un filigrane invisible dans les textes produits par ChatGPT et Codex pour les utilisateurs de l'Union européenne. L'entreprise indique que le déploiement s'étalera sur les prochaines semaines et concernera les contenus "éligibles".

Le filigrane est invisible pour les lecteurs et ne laisse aucune marque visible lorsque le texte est copié. Baptisée textGrain, la technologie consiste à modifier légèrement les mots choisis par le modèle. Ces petits décalages forment un motif statistique qu'un détecteur peut ensuite rechercher.

"Au cours des prochaines semaines, nous ajouterons un filigrane invisible aux textes éligibles générés par ChatGPT et Codex dans l'Union européenne", a déclaré OpenAI.

Activation volontaire pour les développeurs, accès restreint au détecteur

Le déploiement dans l'UE ne signifie pas que le filigrane devient la norme partout dans le monde. En dehors de ChatGPT et Codex dans l'UE, la fonction reste désactivée tant que personne ne l'active.

Les développeurs qui utilisent l'API, où qu'ils soient, peuvent désormais activer le filigrane pour les modèles compatibles. Par défaut, il reste désactivé.

OpenAI accepte également les candidatures pour accéder à son détecteur de filigrane. Dans un premier temps, seuls des chercheurs et des organismes spécialisés agréés y auront accès.

De légères retouches affaiblissent la détection

OpenAI ne cache pas les limites de son approche. Ses propres tests montrent qu'une simple retouche du texte peut faire chuter fortement le taux de réussite du détecteur.

"Lors d'une évaluation portant sur des passages de 400 jetons, le remplacement de 10 % des mots par des synonymes a fait passer la détection d'environ 92 % à 66 %. Le remplacement de 25 % des mots l'a réduite à 17 %", précise l'entreprise.

La longueur compte aussi. Avec un objectif de 1 % de faux positifs, le filigrane a été détecté dans environ 80 % des réponses de psychologie de 200 jetons. Lorsque les réponses atteignaient 400 jetons, ce taux montait à environ 95 %.

Les résultats étaient moins bons dans des domaines comme les mathématiques. Le modèle y dispose de moins de latitude pour choisir entre plusieurs mots, ce qui laisse moins de place au motif.

"L'absence de filigrane détecté ne prouve pas qu'un texte a été écrit par un humain", prévient OpenAI. "Un texte généré avec les outils d'OpenAI peut être trop court, modifié ou traduit pour que la détection fonctionne de manière fiable."

Ce que le filigrane ne révèle pas

Selon OpenAI, une détection positive ne permet pas d'identifier l'auteur de la génération du texte. Elle ne dévoile pas non plus le compte, la requête ni la conversation à l'origine du contenu.

Le détecteur ne peut pas non plus mesurer quelle part d'un texte final a été rédigée ou retouchée par une personne. Un résultat positif indique seulement que le motif du filigrane est présent.

OpenAI affirme que le filigrane n'a pas d'effet notable sur la qualité de GPT-6 Astra. Les résultats aux tests de référence sont restés globalement similaires avec textGrain activé.

Notre analyse

Pour les équipes de sécurité, le point essentiel est la fragilité du signal. Les chiffres d'OpenAI eux-mêmes montrent que remplacer un quart des mots fait tomber la détection à 17 %, et qu'une traduction ou un texte court peut la mettre totalement en échec. Quiconque veut faire passer un texte généré par IA pour le sien, opérateurs de phishing ou fraudeurs compris, n'aura sans doute guère de mal à effacer le motif. textGrain semble donc plus adapté pour repérer des contenus négligés ou non modifiés que pour stopper des abus déterminés.

La conception côté vie privée est un bon point. Le filigrane ne contient ni données de compte ni requêtes, ce n'est donc pas un mécanisme de traçage des utilisateurs individuels. Les organisations doivent néanmoins se garder de considérer le résultat d'un détecteur comme une preuve de quoi que ce soit. OpenAI le dit clairement : l'absence de filigrane ne prouve pas qu'un texte a été écrit par un humain.

Cette annonce intervient alors que le secteur peine à faire face à des volumes croissants de contenus rédigés par des machines. Google a récemment suspendu un programme de bug bounty open source en raison d'un afflux de rapports générés par IA, un cas où une détection fiable serait utile. Elle arrive aussi peu après la mise en pause par OpenAI du lancement de GPT-6.1 Astra, le temps de travailler sur ses dossiers de sécurité.

Reste à voir si OpenAI étendra l'activation par défaut au-delà de l'UE et dans quelle mesure il ouvrira l'accès au détecteur. Autre question en suspens : d'autres éditeurs d'IA adopteront-ils des dispositifs comparables, et les chercheurs indépendants qui obtiendront l'accès confirmeront-ils les taux de détection annoncés par OpenAI ?