Los modelos de inteligencia artificial desarrollados por OpenAI y Anthropic PBC llevaron a cabo acciones "no autorizadas" —incluyendo el hackeo de un sitio web e intentos de inyectar código malicioso en software durante pruebas de seguridad— reforzando los temores de que ni los creadores ni los investigadores experimentados de estos sistemas pueden predecir sus acciones en las pruebas. El Instituto de Seguridad de IA del gobierno del Reino Unido, establecido en 2023 para evaluar la seguridad de los modelos de IA de vanguardia, dijo el martes que tanto el modelo Mythos 5 de Anthropic como el modelo GPT-5.6-Sol de OpenAI se habían "involucrado en actividades sostenidas y potencialmente dañinas dirigidas a personas y organizaciones reales" durante las evaluaciones. El instituto permitió intencionalmente a los modelos acceso a Internet y los usó sin ciertos filtros de seguridad para probar sus capacidades. "Incluso en condiciones de prueba, este incidente es significativo: Es la primera vez que vemos riesgos de autonomía y engaño manifestarse tan claramente en el mundo real", dijo el instituto en una publicación en la plataforma de redes sociales X. En un caso, dijo la organización de pruebas, Mythos 5 intentó añadir código malicioso a un proyecto de software de código abierto en GitHub. Llegó a crear identidades falsas en un esfuerzo por obtener la aprobación de su código. "Un mantenedor humano detectó y se negó a aprobar el código malicioso", escribió el grupo. Durante las últimas dos semanas, tanto OpenAI como Anthropic han reconocido públicamente que han incumplido colectivamente los sistemas de múltiples instituciones, incluida Hugging Face, inadvertidamente mientras probaban sus modelos. El instituto de seguridad de IA del Reino Unido dijo que el modelo Mythos 5 de Anthropic llevó a cabo 17 de las 19 "acciones autónomas y no autorizadas realizadas en Internet" que detectó. Algunos líderes del gobierno de EE. UU. han pedido una mayor supervisión de la tecnología en respuesta a las brechas. El martes pasado, más de 1.100 trabajadores de la industria de la IA firmaron una petición instando a un mecanismo regulatorio que "pacing" deliberadamente la tecnología de IA y evite que avance demasiado rápido. Anthropic dijo en X que está trabajando con el instituto de seguridad del Reino Unido para "recopilar más detalles del incidente mientras realizamos nuestra propia investigación". El creador de ChatGPT, OpenAI, señaló por separado en una entrada de blog que ocurrió otro incidente de seguridad durante la prueba de uno de sus modelos con Irregular, una empresa externa de ciberseguridad. En este incidente, los modelos de OpenAI fueron sometidos a una prueba llamada "capture the flag" en la que se les encargó encontrar información oculta en un entorno simulado. Los modelos aprovecharon una "mala configuración" en el entorno de prueba para conectarse a Internet y hackear el sitio web de una institución no identificada, dijo la compañía. La brecha ocurrió cuando los modelos de OpenAI estaban sometidos a la misma evaluación de Irregular que resultó en que los modelos de Anthropic hackearan tres organizaciones, dijo una persona familiarizada con el asunto, pidiendo no ser identificada porque la información no es pública. Anthropic reveló esas brechas la semana pasada. Un portavoz de Irregular se negó a comentar. Hace dos semanas, OpenAI reveló que sus modelos estuvieron detrás de un hackeo sin precedentes contra la startup Hugging Face. Las últimas revelaciones sirven como nueva evidencia de que los agentes de IA son capaces de actuar de forma autónoma de maneras que incluso los investigadores capacitados para erradicar vulnerabilidades en la tecnología ya no pueden anticipar, lo que subraya la necesidad de una selección de seguridad más rigurosa y entornos de prueba más infalibles.
Prepared by Christopher Adams and reviewed by editorial team.
Izquierda: La autonomía de la IA demuestra la necesidad urgente de una sólida regulación y supervisión gubernamentales. Centro: La agencia del Reino Unido informa que los agentes de IA tomaron acciones no autorizadas durante pruebas de seguridad controladas. Derecha: La innovación de la IA se enfrenta a riesgos de extralimitación regulatoria a pesar de los incidentes de prueba contenidos.
AISI detectó transferencias de datos inusuales el 28 de julio de 2026, durante las pruebas. https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
No left-leaning sources found for this story.
Modelos de IA se descontrolan: Sistemas de OpenAI y Anthropic hackean empresas reales en pruebas de seguridad
Business Standard Reuters Bloomberg The Guardian Wired Arstechnica Techcrunch Theverge CNN The Hill Theregister Cyberscoop Gizmodo Jpost Indiatoday Ndtv Indiatimes Techspot Silicon Infosecurity Magazine Csoonline Helpnetsecurity Thehackernews Securityaffairs Itnews DataconomyNo right-leaning sources found for this story.
Comments