Anthropic a annoncé le fonctionnement de son filigrane, confirmant pratiquement tous les détails rapportés précédemment sur une méthode de filigrane similaire appelée MirrorMark. Semblable à MirrorMark, le filigrane est le motif aléatoire lui-même qui reflète le caractère aléatoire du LLM lorsqu’il génère du texte.
Comment fonctionne le filigrane
Contrairement à ce que disent certains influenceurs de l’IA, aucun caractère Unicode n’est intégré dans le texte. Ce n’est donc pas quelque chose que vous pouvez copier et coller dans un fichier texte pour le supprimer ou l’identifier.
De plus, il ne s’agit pas de l’utilisation des tirets em, ni des modèles que les LLM ont tendance à utiliser, comme le style d’écriture « Ce n’est pas ceci, c’est cela ». Il ne s’agit pas de rechercher la probabilité que quelque chose ait été écrit par une IA.
Ce qu’il recherche, c’est un motif de filigrane spécifique.
Les LLM génèrent le prochain texte probable dans une séquence, mais avec le caractère aléatoire intégré. Il ne sélectionne pas toujours le mot suivant le plus probable ; il y a un élément de hasard dans le mot choisi. SynthID utilise ce caractère aléatoire pour définir un modèle dicté par une clé de filigrane ainsi que le contexte des mots précédents. Étant donné qu’un filigrane de style SynthID modifie subtilement le caractère aléatoire du choix des mots, le texte généré ne peut pas être distingué du texte généré normalement. Les utilisateurs ne peuvent pas identifier le filigrane sans la clé de filigrane.
Anthropique explique :
« Ce modèle est indétectable pour le lecteur, mais est détectable pour quiconque possède une clé qui le code. Lorsque le filigrane est utilisé, les choix sont toujours faits au hasard, mais la source du caractère aléatoire est différente. Au lieu d’utiliser un générateur de nombres aléatoires arbitraires pour choisir le mot suivant, le filigrane utilise la clé et quelques mots qui précèdent pour déterminer quel mot le modèle doit choisir. Autrement dit, les mots que Claude choisit sont toujours aléatoires, mais maintenant, on peut vérifier la séquence de mots et voir si elle est cohérente. avec les choix que Claude ferait s’il utilisait la clé.
Une version de SynthID
L’annonce indique que le nouveau filigrane est une version de SynthID-Text qui a été développée par Google DeepMind en 2024. Ce n’est pas SynthID, c’est une version de celui-ci. L’état de la technique pour ce type de filigrane s’est considérablement amélioré au cours des deux années qui ont suivi.
L’annonce indique :
« Le filigrane textuel de Claude est une version de l’approche SynthID-Text publiée par Google DeepMind dans un article de Nature en 2024. Il appartient à une famille d’approches qui remontent à une proposition de Scott Aaronson en 2022, qui partagent toutes le même principe de conception que nous avons décrit ci-dessus : le filigrane ne change que la source du caractère aléatoire utilisé pour choisir parmi les mots.
Le filigrane d’Anthropic peut-il être vaincu ?
Oui, on peut le vaincre en paraphrasant. Selon Anthropic, un montage léger ne va probablement pas le vaincre.
Selon Anthropique :
« Quelqu’un ne peut-il pas simplement modifier le texte pour contourner le filigrane ?
Dans une certaine mesure, oui. Une édition légère ne supprimera probablement pas complètement le filigrane ; une réécriture complète où chaque mot est remplacé le sera. Dans ce dernier cas, on peut évidemment se demander si le texte peut encore être décrit comme généré par l’IA.»
SynthID recherche le modèle de mot en filigrane qui a été inséré au moment où le texte a été généré. Ainsi, si vous paraphrasez ou modifiez une partie suffisante du document, les mots qui font office de filigrane seront effacés.
Ce n’est pas SynthID
SynthID a été développé en 2024 et l’état de l’art a évolué au cours des deux dernières années.
Une version récente de SynthID, appelée MirrorMark, étend SynthID en répartissant le filigrane sur le texte généré et en utilisant les mots environnants comme contexte pour déterminer où chaque partie est placée, ce qui la rend plus résistante à l’édition.
SynthID est un filigrane de zéro bit, ce qui signifie qu’il détecte ou non un filigrane. MirrorMark peut coder plusieurs éléments d’information, répartissant essentiellement le filigrane sur le texte généré.
Voici ce qu’une version 2026 comme MirrorMark peut faire :
- Il ajoute un codage multi-bits.
- Cela reflète le caractère aléatoire de la génération de texte du LLM.
- Il utilise CABS, un planificateur équilibré ancré au contexte, qui décide où les différents filigranes sont intégrés.
- Il est spécialement conçu pour résister à l’édition (comme celui d’Anthropic, qui résiste à l’édition légère).
Je ne dis pas que MirrorMark est ce qu’Anthropic utilise. Mais je dis qu’avant de mettre tous vos œufs dans le panier SynthID, qui a deux ans, il peut être utile de voir ce qu’une version 2026 de SynthID peut faire.
Principaux points à retenir de la révélation du filigrane d’Anthropic
Voici les principaux points à retenir de ce qu’Anthropic a révélé :
- Claude filigranera les futures sorties texte.
Anthropic affirme que les futurs modèles Claude généreront du texte filigrané dans le cadre de leur conformité à la loi européenne sur l’IA. - Le filigrane est un motif créé lors de la génération de texte.
Il ne s’agit pas d’Unicode, de métadonnées ou de caractères cachés. Le filigrane est créé via le processus de sélection de mots lui-même. - Le filigrane de Claude est une version de SynthID-Text.
Anthropic affirme que sa méthode est basée sur l’approche SynthID-Text 2024 de Google DeepMind. - Le filigrane modifie la source aléatoire utilisée pour sélectionner les mots.
Claude fait toujours des choix aléatoires parmi des mots plausibles, mais la clé du filigrane et les mots précédents sont utilisés pour déterminer ce caractère aléatoire. - Le filigrane crée un motif détectable dans les choix de mots de Claude.
Une personne possédant la clé peut vérifier si la séquence de mots est cohérente avec les choix que Claude aurait faits à l’aide de cette clé. - Rien n’est ajouté au texte.
Anthropic dit explicitement qu’il n’y a pas de personnages cachés, pas de jetons supplémentaires et aucun ajout visible. - Le texte filigrané ne peut pas être distingué du texte non filigrané.
Anthropic affirme que le filigrane n’a aucun effet sur la qualité ou le contenu généré. - Le filigrane n’amène pas Claude à faire des choix de mots inhabituels.
Anthropic dit que cela ne biaise pas Claude vers des mots particuliers. - Moins de mots le rendent moins détectable.
Anthropic affirme que la détection des filigranes fonctionne mal sur de petits échantillons. Cela fonctionne mieux avec plus de mots. - Le filigrane est plus faible en termes de contenu factuel.
Il est moins fiable lorsqu’il y a moins de mots parmi lesquels choisir en raison de contraintes basées sur le type de contenu factuel. - Le filigrane est plus faible lorsqu’il est utilisé pour des modifications de type relecture.
Anthropic dit si vous « demandez-lui de modifier uniquement la grammaire et la ponctuation et rien d’autre, le filigrane ne peut vivre que dans une poignée de corrections, qui pourraient être trop peu nombreuses pour être enregistrées.» - Anthropic prévoit de publier une API de détection de filigrane.
- Les fichiers image non textuels tels que JPG, PNG et SVG utiliseront les métadonnées C2PA.
- Le filigrane a un impact négligeable sur la vitesse et n’ajoute aucun coût supplémentaire en jeton.