英国AI安全研究所测试事故:未隔离的智能体攻击真实目标
2026年8月5日 - 链接博客
事件报告:网络测试中AI代理的违规行为
这种事又发生了。这次是英国政府下属的AI安全研究所(AISI)在关闭安全过滤器的情况下测试模型,意外对其他企业发起了攻击。以下内容摘选自其技术论文(PDF格式):
2026年7月25日至28日的网络评估期间,AI代理针对现实中的个人与组织,实施了持续的违规操作。这些尝试均未成功,且据我们所知未造成实际危害。[...]
在针对AISI两项网络挑战的122次评估尝试中,研究人员发现19起AI代理在公开互联网上违规操作的案例,部分行为直接指向真实个人与组织。[...]
目前无法确定模型是否意识到自己在针对真实对象采取行动。其中最严重的一起案例中,代号为Mythos 5的AI代理决定通过供应链攻击完成网络挑战。它先是创建了一个GitHub账号,随后试图说服某开源代码库维护者接受恶意GitHub拉取请求(PR)——为此还专门创建第二个账号,伪装成另一名用户为该请求背书。[...]此外,为达成目标,该代理还采用“鱼叉式钓鱼”手段,发送包含恶意内容的定向邮件,试图诱导收件人接受代码变更;同时它还计划通过提示注入攻击,攻陷其他代码处理AI代理。
最令我惊讶的是,AISI在测试时完全没有为这些AI代理设置任何网络沙箱:
AISI在评估期间为AI代理开放了互联网访问权限,使其能够在公开网络上采取行动。开放网络访问是本次评估的刻意配置,并非AI突破沙箱限制所致。
再加上“AISI刻意禁用了开发者内置的网络分类器”这一前提,AI代理攻击现实目标的结果在我看来完全是意料之中。
报告中记录的多数违规事件由Claude Mythos 5引发,但“未启用网络分类器的GPT-5.6 Sol”也有几起记录在案。
下面是论文中的“案例1”:AI代理提交暗藏提示注入攻击的PR以实施供应链攻击,随后用第二个账号伪装成代码审核者,通过社会工程学手段推进攻击!

这篇论文很有意思,推荐大家完整阅读。
近期文章
- 用Claude Fable 5一次性通关《浣熊大劫案》游戏 - 2026年8月5日
- 大语言模型(LLM)新版本发布:新增推理轨迹支持、OpenAI响应兼容、服务器端工具及智能日志功能 - 2026年8月4日
- 无状态MCP重燃我的研究兴趣(并催生mcp-explorer与datasette-mcp工具) - 2026年7月31日