Une Floridienne inculpée pour une menace de fusillade dans un chat Claude

Une femme de 30 ans du comté de Lee, en Floride, est inculpée d'un crime de second degré après avoir écrit, dans une conversation avec Claude, qu'elle allait "tirer" sur les bureaux du shérif du comté de Lee. Selon le rapport d'arrestation, cette phrase a été écrite le 26 septembre ; le lendemain, la même utilisatrice a mentionné, dans la même conversation, qu'elle s'était procuré une nouvelle arme.

Après avoir repéré ce contenu, l'équipe de modération d'Anthropic a averti les forces de l'ordre. Le 30 septembre, le parquet a engagé des poursuites en vertu de l'article 836.10 du code de Floride, qui réprime la menace, écrite ou électronique, de commettre une fusillade de masse ou un acte terroriste. Selon la peine maximale prévue pour un crime de second degré, elle risque jusqu'à 15 ans de prison et 10 000 dollars d'amende. La police l'a arrêtée à son domicile, sans incident. L'audience est fixée au 2 novembre.

Le shérif du comté de Lee, Carmine Marceno, a déclaré publiquement que la femme avait dit à la police qu'elle utilisait habituellement Claude comme un journal intime.

Du filtrage par mots-clés au signalement humain

Selon le processus décrit dans les articles, les conversations sur Claude passent d'abord par un filtrage automatique : le système repère un langage menaçant et certaines expressions clés, puis décide, selon la gravité, si le cas doit être transmis à un examen humain ; ce n'est qu'après l'examen par une équipe humaine que l'on décide de contacter ou non les forces de l'ordre. Cette affaire a parcouru l'ensemble de cette chaîne.

Ce qui soutient cette étape, c'est la politique de confidentialité d'Anthropic. La version en vigueur depuis le 10 septembre précise que l'entreprise peut, de bonne foi et lorsqu'elle l'estime nécessaire, divulguer des données personnelles aux forces de l'ordre afin de :

"prevent serious harm to any person or to property"

c'est-à-dire prévenir un préjudice grave pour une personne ou des biens. La politique de l'entreprise sur les demandes gouvernementales comporte une autre clause : en général, les données des utilisateurs ne sont transmises que sur présentation d'une procédure légale valide, sauf en cas d'urgence pouvant entraîner un "imminent physical harm or death" (préjudice physique imminent ou décès). Dans cette affaire, aucune citation n'avait été émise au préalable : c'est la plateforme elle-même qui a signalé le cas de son propre chef, en invoquant précisément cette exception d'urgence.

Le troisième cas en deux mois

En regroupant les affaires survenues depuis août, les issues diffèrent nettement :

  • Août, San Antonio, Texas : un utilisateur de 22 ans a interrogé Claude sur une fusillade dans une école primaire ; le FBI a prévenu la police locale, et la personne a été arrêtée pour crime de menace terroriste.
  • Août, San Francisco : un utilisateur a menacé, dans une conversation, le PDG d'Anthropic, Dario Amodei, et a aussi évoqué l'achat d'un fusil AR-15. La police a été informée, mais aucune inculpation n'a finalement été retenue.
  • Septembre, comté de Lee, Floride : l'affaire décrite ici, déjà enregistrée et en attente d'audience.

OpenAI a également son précédent. En mars de cette année, toujours en Floride, un utilisateur de ChatGPT a évoqué dans une conversation l'idée de tuer son ex-petite amie ; OpenAI a signalé le cas au FBI. La personne a plaidé coupable en août et a été condamnée à 8 ans de probation. La leçon inverse vient de la fusillade de Tumbler Ridge, au Canada : OpenAI avait auparavant suspendu le compte concerné sans le signaler aux forces de l'ordre ; cette fusillade a fait 8 morts, et Sam Altman a présenté ses excuses par lettre en avril à ce sujet.

Les plateformes subissent une pression des deux côtés : si elles ne signalent rien, on leur demande après coup pourquoi elles n'ont rien dit ; si elles signalent, les utilisateurs doivent reconsidérer à quel point une "conversation privée" l'est vraiment.

Ce que le public ne voit pas encore

Quels mots précis surveille le filtrage automatique, combien de conversations par mois parviennent à l'examen humain, et combien d'entre elles sont finalement transmises à la police : Anthropic n'a jamais rendu publics ces chiffres. La femme affirme n'avoir écrit qu'un journal intime, et le parquet doit prouver qu'il y avait une intention de mettre la menace à exécution, ce que seul le procès pourra établir ; pour l'instant, les faits de l'affaire reposent sur les dossiers judiciaires et les déclarations de la police.

Pour l'utilisateur ordinaire, ce que l'on peut déjà affirmer, c'est que ce qui est écrit dans Claude ne reste pas forcément seulement entre la personne et le modèle. Désactiver, dans les réglages, l'option "utiliser les conversations pour améliorer le modèle" ne concerne que les données d'entraînement — un mécanisme totalement distinct de la modération de sécurité.

Sources : Tom's Hardware, The Next Web, CocoLoop, TechRepublic ; clauses de divulgation de la politique de confidentialité et de la politique de demandes gouvernementales d'Anthropic, ainsi que les termes relatifs à l'inculpation et à la peine maximale vérifiés auprès du bureau du shérif du comté de Lee.