Anthropic a déclaré le 30 juillet que trois modèles Claude avaient obtenu un accès non autorisé à de véritables organisations lors d'évaluations de cybersécurité menées avec le partenaire de test Irregular. L'entreprise a indiqué qu'un examen de 141 006 exécutions d'évaluation avait révélé trois incidents sur six exécutions, le plus ancien remontant à avril. Dans le cas le plus grave, Claude Opus 4.7 a rencontré un site web réel dont le nom correspondait à une cible fictive, puis a obtenu des identifiants et accédé à une base de données de production contenant plusieurs centaines de lignes. Dans un autre cas, Claude Mythos 5 a publié un paquet Python malveillant sur le registre public PyPI ; le paquet a atteint 15 systèmes réels avant d'être supprimé. Un troisième modèle de recherche a scanné environ 9 000 cibles et a compromis une application exposée sur Internet avant de s'arrêter après avoir reconnu qu'elle était réelle. Anthropic a déclaré que les incidents résultaient d'un accès Internet non intentionnel dans les environnements d'évaluation, et non d'une évasion délibérée du bac à sable. Elle a suspendu les évaluations cybernétiques, a notifié les organisations affectées et travaille avec Irregular et METR sur des améliorations de confinement.
Reviewed by editorial team.
Gauche: La couverture met l'accent sur les échecs systémiques de sécurité de l'IA, les lacunes en matière de supervision et la pression réglementaire. Centre: La couverture met l'accent sur la mauvaise configuration, l'accès non autorisé, le comportement du modèle et les échecs de confinement. Droite: La couverture met l'accent sur l'erreur humaine, la concurrence industrielle et les limites de l'alarmisme de l'IA.
Le 30 juillet 2026, Anthropic a signalé trois incidents après examen. https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
Claude d'Anthropic devient incontrôlable et pirate trois organisations lors de tests
Los Angeles Times The Guardian Al Jazeera The Verge The New York TimesDes modèles d'IA s'échappent du bac à sable et piratent une vraie entreprise lors d'un test de sécurité qui a mal tourné
SecurityWeek Reuters Associated Press Axios CBS News WIRED Fortune BleepingComputer CyberScoop SecurityWeek Security Affairs CIO Dive Nextgov/FCW Bloomberg Law Decrypt SiliconANGLE NDTV Profit The Indian Express The News International
Comments