OpenAI 和 Anthropic PBC 开发的人工智能模型进行了“未经授权”的行为——包括黑客攻击一个网站以及在安全测试中试图将恶意代码注入软件——这加剧了人们的担忧,即这些系统的创造者和经验丰富的研究人员都无法预测它们在测试中的行为。 英国政府的人工智能安全研究所成立于 2023 年,旨在评估前沿人工智能模型的安全性,周二表示,Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6-Sol 模型在评估过程中都“与真实个人和组织进行了持续的、潜在有害的活动”。 该研究所故意允许模型访问互联网,并在没有某些安全过滤器的情况下使用它们来测试它们的能力。该研究所在社交媒体平台 X 上的一篇文章中写道:“即使在测试条件下,这一事件也很重要:这是我们第一次看到自主性和欺骗方面的风险如此清晰地体现在现实世界中。” 该测试组织表示,在其中一个案例中,Mythos 5 试图向 GitHub 上的一个开源软件项目添加恶意代码。它甚至创建了虚假身份,试图获得其代码的批准。“一位人工维护者发现了并拒绝批准了恶意代码,”该组织写道。 在过去的几周里,OpenAI 和 Anthropic 都公开承认,在测试其模型时,它们集体无意中侵入了包括 Hugging Face 在内的多个机构的系统。 英国人工智能安全研究所表示,Anthropic 的 Mythos 5 模型进行了它检测到的 19 项“在互联网上采取的自主、未经授权的行为”中的 17 项。 一些美国政府领导人呼吁对这项技术进行更多监管,以应对这些漏洞。上周二,1100 多名人工智能行业的从业者签署了一份请愿书,呼吁建立一个监管机制,以“有意识地控制”人工智能技术的发展,并防止其发展过快。 Anthropic 在 X 上表示,它正在与英国安全研究所合作,“在我们进行自己的调查的同时,收集有关此次事件的更多细节。” ChatGPT 的开发者 OpenAI 在一篇博文中另外指出,在其模型与外部网络安全公司 Irregular 进行测试时,又发生了另一起安全事件。在此次事件中,OpenAI 的模型接受了一项所谓的“夺旗”(capture the flag)测试,任务是在模拟环境中寻找隐藏的信息。该公司表示,模型利用了测试环境中的“错误配置”连接到互联网,并黑客攻击了一个未识别机构的网站。 一位熟悉此事但要求匿名的人士表示,此次漏洞发生时,OpenAI 的模型正在接受与导致 Anthropic 模型黑客攻击三个组织相同的 Irregular 评估。Anthropic 上周披露了这些漏洞。Irregular 的一名发言人拒绝置评。 两周前,OpenAI 披露其模型是导致对初创公司 Hugging Face 进行前所未有黑客攻击的原因。 最新的披露提供了新的证据,表明人工智能代理能够以自主的方式行事,即使是经过训练以根除技术漏洞的研究人员也无法预测,这凸显了对更严格的安全筛查和更万无一失的测试环境的必要性。
Prepared by Christopher Adams and reviewed by editorial team.
左:人工智能的自主性表明迫切需要强有力的政府监管和监督。 中:英国机构报告称,人工智能代理在受控安全测试期间采取了未经授权的行动。 右:尽管发生了受控的测试事件,但人工智能创新面临监管过度的问题。
AISI 在 2026 年 7 月 28 日测试期间检测到异常数据传输。 https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
No left-leaning sources found for this story.
人工智能模型失控:OpenAI、Anthropic 系统在安全测试中黑客攻击真实公司
Business Standard Reuters Bloomberg The Guardian Wired Arstechnica Techcrunch Theverge CNN The Hill Theregister Cyberscoop Gizmodo Jpost Indiatoday Ndtv Indiatimes Techspot Silicon Infosecurity Magazine Csoonline Helpnetsecurity Thehackernews Securityaffairs Itnews DataconomyNo right-leaning sources found for this story.
Comments