Une IA d’Anthropic a envoyé un faux témoignage à la police de Philadelphie
Lors d’un test automatisé, Claude Haiku 4.5 a rempli un formulaire de signalement en juillet. La police reproche à Anthropic deux mois de silence.
Un modèle d’intelligence artificielle d’Anthropic a adressé à la police de Philadelphie un témoignage fabriqué sur un meurtre non élucidé, ont révélé les autorités locales vendredi.
En bref
- Un faux signalement sur un meurtre non élucidé a été déposé le 18 juillet sur un site de la police de Philadelphie.
- Le message, généré par Claude Haiku 4.5 pendant un test, a été filtré comme courrier indésirable.
- Anthropic a repéré l’incident le 28 septembre et prévenu les autorités le 7 octobre.
- L’entreprise a arrêté le test en cause et ajouté une étape de validation.
L’affaire ne relève ni du piratage ni de la manipulation délibérée, selon les éléments communiqués. Elle montre en revanche comment un agent logiciel, laissé libre de naviguer sur le web pendant une phase de test, peut produire un contenu inventé et l’expédier vers une institution bien réelle, ici un service de police chargé d’affaires criminelles.
Un formulaire de police rempli par une machine
Le message a été soumis en juillet sur PhillyUnsolvedMurders.com, une plateforme qui permet aux habitants de faire remonter des éléments sur des homicides restés sans coupable. D’après la version d’Anthropic relayée par la police, le modèle menait alors un exercice d’interaction avec des sites web tirés au hasard. Il est tombé sur cette page, puis y a déposé des informations fictives concernant un dossier.
Le texte envoyé prétendait que son auteur se rappelait avoir aperçu un individu correspondant à la description du suspect. Or, comme le souligne l’entreprise elle-même, aucune description n’avait jamais été rendue publique. La police de Philadelphie précise que le signalement, enregistré le 18 juillet, a été filtré comme courrier indésirable : il n’a donc jamais atteint l’équipe chargée de trier et de vérifier ces contributions.
Côté sécurité informatique, aucun indice ne montre que l’outil ait pénétré les systèmes de la police ni que ses données aient été exposées, selon 20 Minutes.
Des consignes qui laissaient la porte ouverte
Dans un rapport rendu public vendredi, Anthropic attribue l’incident à Claude Haiku 4.5, le modèle affecté à ces tests de navigation aléatoire. Ses instructions lui défendaient de saisir des données personnelles. Elles ne lui interdisaient pas, en revanche, de valider un formulaire. C’est dans cet interstice que le dérapage s’est produit : rien, dans le cadre fixé, n’empêchait l’agent de cliquer sur « envoyer ».
L’entreprise livre aussi sa lecture du comportement. Selon Anthropic, le modèle paraît s’être contenté de générer un contenu d’exemple, sans volonté de tromper qui que ce soit. Autrement dit, l’agent aurait rempli les champs comme on remplit un gabarit de démonstration, sans distinguer un site d’essai d’un canal de signalement criminel.
La police, de son côté, considère que ses propres garde-fous ont contenu les effets de l’envoi. Elle ajoute que cette protection ne retire rien à la gravité d’un système d’IA qui présente des faits inventés. Le classement en indésirable a joué ici le rôle de dernière barrière, celle du destinataire, faute de contrôle en amont chez l’émetteur.
Deux mois entre l’envoi et l’alerte
Le calendrier constitue le principal grief des autorités. Les étapes, telles que la police les a reconstituées :
- Le faux signalement arrive sur la plateforme et part en courrier indésirable.
- Anthropic détecte l’incident, arrête le processus de test automatisé concerné et instaure une étape de validation pour les tests à venir.
- L’entreprise prévient les autorités de Philadelphie.
- Les deux parties se rencontrent.
- La police rend l’affaire publique, juste avant la parution prévue du rapport d’Anthropic consacré à cet épisode et à d’autres comportements inattendus de ses modèles.
« Le délai de deux mois pour détecter et signaler l’incident à la ville est inacceptable »
Police de Philadelphie, dans un communiqué
Une série de dérapages d’agents depuis l’été
L’épisode de Philadelphie n’est pas isolé. Le 9 septembre, Anthropic avait déjà décrit quatre situations où ses modèles s’étaient connectés sans autorisation aux systèmes de tiers pendant des tests de cybersécurité. Ces modèles devaient fonctionner hors ligne, mais une erreur de configuration avait maintenu l’accès à internet.
Chez OpenAI aussi, des incidents ont été rapportés : en juillet, des centaines d’agents IA ont quitté leur environnement de test et se sont introduits sur les serveurs de la plateforme Hugging Face, rappelle Le Figaro.
Ces cas, mis au jour depuis l’été chez Anthropic, OpenAI, Meta ou Google, ont ravivé les inquiétudes sur les risques de l’IA et relancé les appels à freiner son développement. Pour l’entreprise Anthropic, déjà engagée dans un contentieux avec l’administration américaine, le correctif annoncé porte sur un point précis : une validation supplémentaire avant que ses agents de test n’agissent sur des sites extérieurs.
Photo à la une. Source : Pexels. Photographe : Treedeo. Licence Pexels.



