Anthropic détaille le fonctionnement du filigranage des textes de Claude, imposé par l’UE
Anthropic a publié vendredi un billet de blog expliquant comment il filigranera les textes générés par Claude, une pratique annoncée plus tôt dans la semaine afin de se conformer au Code de transparence de l’AI Act de l’UE. Le billet répond aux questions soulevées depuis cette annonce, notamment sur la possibilité de dissimuler la marque en modifiant le texte et sur son application au code.
L’entreprise a indiqué qu’elle utiliserait l’approche SynthID-Text présentée par Google DeepMind en 2024. Lorsque Claude effectue des « choix sans grande importance » — en utilisant par exemple « overcast » plutôt que « grey » pour décrire la météo — le modèle peut créer un motif « indétectable pour le lecteur, mais détectable par toute personne disposant d’une clé qui l’encode ». Anthropic a également indiqué prévoir la mise à disposition d’une API de détection des filigranes.
Des utilisateurs ont contesté cette décision sur les forums et les réseaux sociaux : un membre de Reddit a perçu le filigrane comme une théorie du complot, tandis qu’un autre a déclaré que toute personne souhaitant utiliser Claude sans celui-ci veut « mentir aux gens ». Selon Business Insider, « des dizaines » d’utilisateurs de X ont affirmé avoir résilié leur abonnement à Claude à cause de ce changement.
Anthropic a bien abordé la question du Waterproof. L’entreprise a déclaré que le dispositif n’aurait pas d’incidence sur la qualité : « Pour un lecteur, une réponse filigranée est impossible à distinguer d’une réponse qui ne l’est pas. » Des modifications légères « ne supprimeront probablement pas complètement le filigrane », tandis qu’une réécriture complète, mot pour mot, y parviendra. Pour un texte simplement relu par Claude, « presque tous les mots » restent ceux de l’auteur humain, ce qui laisse peu de prise au filigrane. Cette approche diffère également des outils de détection de l’IA fondés sur le style, qui recherchent des formulations révélatrices répétées comme « ceci n’est pas [X], c’est [Y] ».
Le code constitue un cas particulier. Comme le modèle doit produire quelque chose qui s’exécute, il ne peut pas toujours choisir entre des options également valides. Anthropic affirme que, dans les endroits où un choix arbitraire est possible, comme les commentaires du code, le filigrane peut s’appliquer, « mais par définition, il aura un effet négligeable sur le code effectivement produit ».
Ce que cela change concrètement : pour les utilisateurs de Claude, il sera bientôt possible de vérifier si un texte a été généré par une IA, sans aucun indice visuel dans le résultat de Claude. L’entreprise ne sera pas seule — « d’autres grands développeurs ont signé le même Code de conduite et mettront en œuvre leurs propres filigranes ». Les limites pratiques sont toutefois claires : un texte relu et légèrement modifié peut ne porter aucun filigrane, et un texte réécrit échappe à la détection. Cela établit une responsabilité raisonnable, mais pas absolue.
Commentaires
Chargement du fil…
Connectez-vous pour écrire un commentaire. Se connecter