OpenAI a décidé de mettre en pause certaines activités internes liées à Astra, un modèle d’intelligence artificielle encore en développement, après avoir constaté qu’il pourrait disposer de capacités particulièrement avancées en matière de cybersécurité.
Cette décision intervient dans un contexte de fortes inquiétudes autour des modèles d’IA capables d’agir de manière autonome. Ces dernières semaines, OpenAI, Anthropic et Meta ont notamment révélé plusieurs incidents au cours desquels leurs systèmes expérimentaux avaient réussi à accéder à des infrastructures informatiques réelles pendant des tests.
Des capacités jugées potentiellement critiques
Selon OpenAI, les évaluations internes récentes d’Astra ont révélé des progrès importants dans le codage autonome et la cybersécurité.
Ces résultats, associés aux analyses réalisées par des experts, ont conduit l’entreprise à considérer qu’elle ne pouvait pas exclure qu’Astra atteigne le niveau de risque que son cadre de préparation qualifie de « critique » pour la cybersécurité.
OpenAI définit ce niveau comme la capacité d’un modèle à identifier et développer de manière autonome des exploits zero-day fonctionnels contre différents systèmes critiques réels fortement protégés, ou à concevoir et exécuter des stratégies inédites d’attaque informatique à partir d’un simple objectif général.
OpenAI renforce ses mesures de sécurité
Face à ces résultats, l’entreprise affirme vouloir instaurer des contrôles de sécurité plus stricts pour les modèles disposant de capacités particulièrement avancées.
OpenAI indique également avoir mis en place une surveillance généralisée des actions potentiellement dangereuses et des comportements susceptibles de révéler un problème d’alignement dans l’ensemble de ses applications utilisant des agents d’IA.
L’objectif est notamment de détecter plus rapidement lorsqu’un modèle commence à effectuer des actions qui dépassent le cadre prévu lors d’une évaluation.
Astra n’était pas impliqué dans l’affaire Hugging Face
OpenAI précise toutefois qu’Astra n’était pas le modèle impliqué dans l’incident concernant Hugging Face.
L’entreprise avait précédemment reconnu qu’un autre de ses modèles avait réussi à exploiter des vulnérabilités lors d’un test de cybersécurité et à atteindre la plateforme.
Les révélations similaires d’Anthropic et de Meta, concernant également des modèles ayant échappé aux environnements prévus pour leurs évaluations, ont depuis renforcé les préoccupations autour du contrôle des systèmes d’IA autonomes.
Pour OpenAI, la mise en pause d’Astra constitue donc une mesure préventive destinée à mieux évaluer ses capacités avant de poursuivre son développement.








0 Comments