Anthropic révèle que plusieurs modèles Claude ont accidentellement piraté de vraies organisations lors de tests

Après OpenAI, c’est au tour d’Anthropic de reconnaître un incident impliquant ses modèles d’intelligence artificielle. L’entreprise a annoncé que plusieurs versions de Claude avaient, lors d’évaluations de cybersécurité, obtenu un accès non autorisé aux systèmes de trois organisations réelles en raison d’une erreur de configuration.

Cette révélation intervient quelques jours seulement après qu’OpenAI a indiqué qu’un de ses propres modèles avait ciblé la plateforme Hugging Face pendant un test de sécurité.

Une erreur de configuration à l’origine de l’incident

Selon Anthropic, les essais se déroulaient dans le cadre d’exercices de cybersécurité appelés « capture the flag », qui consistent à demander à une intelligence artificielle de trouver des informations cachées dans un environnement informatique simulé.

L’entreprise explique toutefois qu’une erreur de configuration a laissé certains ordinateurs utilisés pour les tests connectés à Internet, alors qu’ils auraient dû être totalement isolés.

Les modèles avaient été informés qu’ils ne disposaient d’aucun accès au réseau mondial. Lorsqu’ils ont rencontré de véritables systèmes informatiques, ils les auraient interprétés comme faisant partie du scénario de test.

Trois modèles Claude concernés

Anthropic indique que les incidents remontent au mois d’avril et impliquent trois modèles différents :

  • Claude Opus 4.7 ;
  • Claude Mythos 5 ;
  • un modèle expérimental utilisé uniquement pour la recherche interne.

L’entreprise précise que ces versions étaient soumises à des évaluations spécifiques de cybersécurité et qu’elles ne disposaient pas des protections habituellement activées pour limiter certains comportements à risque.

Les incidents découverts après l’affaire Hugging Face

Anthropic affirme avoir identifié ces accès non autorisés en réexaminant plus de 141 000 tests de cybersécurité.

Cette vérification approfondie n’a été lancée qu’après les révélations d’OpenAI concernant un modèle expérimental ayant réussi à atteindre la plateforme Hugging Face lors d’une autre évaluation.

Les appels à une meilleure régulation se multiplient

Ces nouveaux incidents renforcent les interrogations sur la sécurité des intelligences artificielles les plus avancées.

Alors que les modèles gagnent rapidement en autonomie dans des domaines comme la cybersécurité, plusieurs chercheurs et employés de grands laboratoires appellent désormais à une coordination internationale afin d’encadrer leur développement.

Aux États-Unis, des responsables politiques étudient également de nouvelles mesures visant à renforcer la surveillance des modèles d’intelligence artificielle les plus puissants et à mieux contrôler leur utilisation.

Derniers articles postés

Articles intéressants

0 Comments