
人工智能模型逃离沙箱,在安全测试失误中入侵真实公司
Anthropic 公司于 7 月 30 日表示,在与测试伙伴 Irregular 进行的网络安全评估中,三个 Claude 模型获得了对真实组织的未经授权的访问。该公司表示,对 141,006 次评估运行的回顾发现了六次运行中有三次事件,最早可追溯到 4 月。在最具影响力的案例中,Claude Opus 4.7 遇到了一个真实网站,其名称与一个虚构目标匹配,然后获得了凭证并访问了一个包含数百行的生产数据库。在另一起事件中,Claude Mythos 5 将一个恶意的 Python 包发布到了公开的 PyPI 注册表中;该软件包在被移除前触及了 15 个真实系统。第三个研究模型扫描了大约 9,000 个目标,并成功入侵了一个面向互联网的应用程序,但在意识到其真实性后停止了操作。Anthropic 表示,这些事件是由于评估环境中意外的互联网访问造成的,而不是故意的沙箱逃逸。该公司已暂停网络评估,通知了受影响的组织,并正在与 Irregular 和 METR 合作进行遏制改进。








