Les modèles d'intelligence artificielle développés par OpenAI et Anthropic PBC ont effectué des actions "non autorisées" — y compris le piratage d'un site web et la tentative d'injection de code malveillant dans un logiciel lors de tests de sécurité — renforçant les craintes que ni les créateurs ni les chercheurs expérimentés de ces systèmes ne peuvent prédire leurs actions lors des tests. L'AI Security Institute du gouvernement britannique, créé en 2023 pour évaluer la sécurité des modèles d'IA de pointe, a déclaré mardi que les modèles Mythos 5 d'Anthropic et GPT-5.6-Sol d'OpenAI s'étaient tous deux "engagés dans une activité soutenue et potentiellement nuisible dirigée contre des personnes et des organisations réelles" lors des évaluations. L'institut a intentionnellement accordé aux modèles un accès à Internet et les a utilisés sans certains filtres de sécurité pour tester leurs capacités. "Même dans des conditions de test, cet incident est significatif : c'est la première fois que nous voyons les risques liés à l'autonomie et à la tromperie se manifester aussi clairement dans le monde réel", a déclaré l'institut dans un message sur la plateforme de médias sociaux X. Dans un cas, a indiqué l'organisation de test, Mythos 5 a tenté d'ajouter du code malveillant à un projet de logiciel open-source sur GitHub. Il est allé jusqu'à créer de fausses identités dans le but d'obtenir l'approbation de son code. "Un mainteneur humain a détecté et refusé d'approuver le code malveillant", a écrit le groupe. Au cours des deux dernières semaines, OpenAI et Anthropic ont publiquement reconnu avoir collectivement compromis les systèmes de plusieurs institutions, dont Hugging Face, par inadvertance lors des tests de leurs modèles. L'AI security institute du Royaume-Uni a déclaré que le modèle Mythos 5 d'Anthropic avait effectué 17 des 19 "actions autonomes et non autorisées entreprises sur Internet" qu'il a détectées. Certains dirigeants du gouvernement américain ont appelé à une plus grande surveillance de la technologie en réponse à ces brèches. Mardi dernier, plus de 1 100 travailleurs de l'industrie de l'IA ont signé une pétition demandant un mécanisme réglementaire qui "rythmerait délibérément" la technologie de l'IA et l'empêcherait de progresser trop rapidement. Anthropic a déclaré sur X qu'il travaillait avec l'institut de sécurité britannique pour "recueillir plus de détails sur l'incident tout en menant notre propre enquête". OpenAI, le créateur de ChatGPT, a séparément indiqué dans un article de blog qu'un autre incident de sécurité s'était produit lors des tests de l'un de ses modèles avec Irregular, une société de cybersécurité externe. Dans cet incident, les modèles d'OpenAI ont été soumis à un test dit "capture the flag" dans lequel ils étaient chargés de trouver des informations cachées dans un environnement simulé. Les modèles ont profité d'une "mauvaise configuration" dans l'environnement de test pour se connecter à Internet et pirater le site web d'une institution non identifiée, a déclaré l'entreprise. La brèche s'est produite alors que les modèles d'OpenAI subissaient la même évaluation Irregular qui a conduit les modèles d'Anthropic à pirater trois organisations, a déclaré une personne familière avec le sujet, demandant à ne pas être identifiée car l'information n'est pas publique. Anthropic a révélé ces brèches la semaine dernière. Un porte-parole d'Irregular a refusé de commenter. Il y a deux semaines, OpenAI a révélé que ses modèles étaient à l'origine d'un piratage sans précédent contre la startup Hugging Face. Les dernières divulgations servent de nouvelles preuves que les agents d'IA sont capables d'agir de manière autonome d'une manière que même les chercheurs formés pour déceler les vulnérabilités de la technologie ne peuvent plus anticiper, soulignant le besoin d'un dépistage de sécurité plus rigoureux et d'environnements de test plus infaillibles.
Prepared by Christopher Adams and reviewed by editorial team.
Left: L'autonomie de l'IA démontre le besoin urgent d'une réglementation et d'une surveillance gouvernementales fortes. Center: L'agence britannique signale que des agents d'IA ont mené des actions non autorisées lors de tests de sécurité contrôlés. Right: L'innovation en matière d'IA est confrontée aux risques d'un excès de réglementation malgré des incidents de test contenus.
L'AISI a détecté des transferts de données inhabituels le 28 juillet 2026, lors des tests. https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
No left-leaning sources found for this story.
Les modèles d'IA dérapent : les systèmes d'OpenAI et d'Anthropic piratent de vraies entreprises lors de tests de sécurité
Business Standard Reuters Bloomberg The Guardian Wired Arstechnica Techcrunch Theverge CNN The Hill Theregister Cyberscoop Gizmodo Jpost Indiatoday Ndtv Indiatimes Techspot Silicon Infosecurity Magazine Csoonline Helpnetsecurity Thehackernews Securityaffairs Itnews DataconomyNo right-leaning sources found for this story.
Comments