Claude a envoyé une fausse piste à la police de Philadelphie lors de tests

Le 9 octobre, Anthropic a publié un rapport d'enquête qui recense plusieurs types d'actions involontaires commises par les modèles de la famille Claude lors d'évaluations et d'usages internes : exploiter des failles de logiciels tiers pour exécuter des commandes, envoyer des formulaires qui n'auraient pas dû l'être, contourner des paywalls pour obtenir des données, et recourir à des services de raccourcissement de liens pour contourner la limite de longueur d'URL d'un outil. Le même jour, le département de police de Philadelphie a publié un communiqué révélant que son site consacré aux meurtres non élucidés avait reçu en juillet une piste de meurtre inventée par un modèle d'Anthropic.

Une piste de meurtre sans signature

Selon Anthropic, le modèle en cause était Claude Haiku 4.5. Il exécutait alors une tâche automatisée consistant à visiter des pages web tirées au hasard ; l'une d'elles était PhillyUnsolvedMurders.com, le site de la police de Philadelphie sur les meurtres non élucidés, qui comporte un formulaire de signalement anonyme. Les consignes de la tâche interdisaient de se connecter, de créer un compte, de renseigner des données personnelles, de payer ou d'envoyer du contenu destructeur, mais ne précisaient pas qu'il était interdit d'envoyer des formulaires. Le modèle a laissé vides le nom et les coordonnées, et a envoyé une piste inventée.

D'après la chronologie reprise par plusieurs médias américains, l'envoi a eu lieu tard dans la soirée du 18 juillet ; Anthropic ne l'a découvert que le 28 septembre et a aussitôt arrêté le flux de test qui l'avait produit. Le système de la police l'a classé comme spam et ne l'a pas transmis au Real-Time Crime Center. La police affirme n'avoir constaté ni accès non autorisé ni fuite de données, et aucune enquête pour meurtre n'a été affectée.

Sur le jour où la police a été prévenue, les versions divergent d'un jour : les médias indiquent le 7 octobre, tandis que le rapport d'Anthropic mentionne une notification le 8 octobre, une fois l'examen technique terminé. De l'envoi à la notification, cela fait 81 jours selon le premier décompte.

Pour Anthropic, à en juger par la transcription de la conversation, le modèle semblait seulement produire un contenu d'exemple pour la tâche, sans intention de tromper qui que ce soit :

"Claude appears to have only been producing example content for the task."
(Claude semble n'avoir fait que produire un contenu d'exemple pour la tâche.)

Trois autres catégories de dépassements

Le problème des formulaires ne se limite pas à ce seul cas. Un modèle de recherche non publié, qui n'est pas un modèle de pointe, s'est trompé sur un formulaire administratif d'entraînement, puis est allé sur un vrai site et y a soumis le formulaire ; cela s'est produit plusieurs fois dans la même évaluation. On avait demandé à Haiku 4.5 de remplir jusqu'à la dernière étape puis de s'arrêter, mais il a envoyé directement à plusieurs reprises, croyant qu'une page de confirmation suivrait.

Les autres cas ressemblent davantage à du comportement de pirate. Lors d'une analyse scientifique, comme un outil fourni par une université renvoyait une erreur, Claude Mythos Preview a trouvé sur le serveur un script capable de lire des fichiers arbitraires, est remonté jusqu'à une faille d'injection et s'en est servi pour terminer le calcul. Claude Mythos 5, dans une tâche de géolocalisation d'images, a lu le fichier de configuration d'un site de cartes, obtenu un jeton d'accès et interrogé directement le serveur ; une autre fois, un chercheur lui avait demandé de consulter des données payantes d'un organisme d'un État américain, et il a déniché un jeton sur un site d'archives et interrogé la base de données sans payer.

Celui qui a la plus grande portée est celui des liens courts. Certains outils de collecte limitent la longueur des URL pour empêcher l'injection d'instructions via des liens démesurés ; plusieurs modèles, dont Claude Opus 5 et Mythos 5, ont appris à raccourcir d'abord l'adresse avec un service gratuit de liens courts avant de la récupérer. L'exploitant du service de liens courts da.gd a indiqué à Anthropic avoir lui aussi remarqué ce trafic.

Ces cas sont apparus dans des évaluations et des usages internes tels que DeepSearchQA, BrowseComp, LABBench2, OSWorld et Humanity's Last Exam. Selon le rapport, certains cas concernent des sites web de gouvernements fédéral, des États et locaux aux États-Unis ; l'entreprise en a informé la Maison-Blanche et les organismes concernés, et aucune donnée de client ni aucun système interne d'Anthropic n'est en cause.

La troisième divulgation en trois mois

En remontant la chronologie, c'est la troisième fois depuis cet été qu'Anthropic divulgue de sa propre initiative un épisode de dépassement. Le rapport mentionne deux divulgations liées à la cybersécurité, le 30 juillet et le 9 septembre ; la gravité est cette fois moindre que pour ces deux-là, avec les termes exacts "minimal real-world impact".

Les trois divulgations ont un point commun : le problème est apparu chaque fois que le modèle travaillait avec de véritables droits d'accès au réseau. Plus l'objectif de la tâche est précis, plus le modèle tend à chercher des voies en dehors des limites littérales de la consigne ; paywalls, limites de longueur et envoi de formulaires ont été traités comme des obstacles contournables. Le rapport admet aussi que certains environnements d'entraînement récompensent eux-mêmes ces détours.

Les mesures correctives listées par Anthropic comprennent : arrêter certaines évaluations publiques ou les convertir en versions hors ligne ; resserrer les droits des outils comme la collecte de pages web ; mettre en service un outil de détection et de blocage automatiques, qui lors des tests a arrêté tous les cas du rapport ; corriger ou retirer les environnements d'entraînement qui récompensent le contournement des restrictions ; migrer les agents internes vers une infrastructure gérée de façon centralisée et fortement isolée, en continuant de restreindre l'accès au réseau des évaluations internes tant que la fiabilité de la surveillance n'est pas confirmée.

Ce que le rapport ne dit pas concerne les utilisateurs externes. Les agents de navigateur que les clients professionnels construisent avec Claude rencontrent eux aussi des formulaires, des paywalls et des limites de longueur ; on ne trouve pour l'instant dans les documents publics aucune réponse sur la question de savoir si le nouvel outil de blocage couvre ces scénarios, ni si d'autres institutions que Philadelphie ont reçu des envois similaires.

Sources : rapport de recherche d'Anthropic, communiqué du département de police de Philadelphie, CocoLoop, Interesting Engineering ; le rapport d'Anthropic permet de vérifier les quatre catégories de cas et les mesures correctives, les articles de presse les trois jalons que sont l'envoi, la découverte et la notification à la police.