Reed's News
← 返回精选

Import AI 465:开源与闭源差距缩小、Kimi K3与Demis的AGI监管方案

AI 59 Jack Clark 2026/7/20 2205 字 原文 ↗

杰克·克拉克 撰文

欢迎订阅《Import AI》——一份聚焦AI研究的通讯。本通讯依托arXiv论文、意式咖啡和读者反馈运营,欢迎订阅支持。


英国政府:开源权重模型与闭源模型的网络能力差距正在缩小 ……网络终局将至……

英国人工智能安全研究所(AISI)分析了顶尖闭源模型与开源权重模型在网络安全能力上的差距,结果显示今年这一差距已显著收窄。AISI在报告中写道:“这是我们首次公开分析顶尖开源权重模型与闭源网络技术前沿的差距。近期推出的GLM-5.2和DeepSeek V4-Pro,性能已追平4至7个月前发布的前沿闭源模型——相较于2025年多数时段测得的6至10个月差距,如今的距离已大幅缩短。”

具体细节:在针对70项细分网络能力的评估中,GLM-5.2的表现最接近4.3个月前发布的Claude Opus 4.6;DeepSeek-V4-Pro的性能则介于Claude Opus 4.5与GPT-5之间(二者分别于2025年11月和8月发布)。AISI表示:“待Kimi K3的权重公开后,我们也将用同一标准对其展开测试。”

在需要整合多种能力完成完整黑客操作的长周期网络任务中,二者的差距略有拉大。以名为“The Last Ones”的网络靶场为例:“GLM-5.2的性能追平发布不足7个月的Opus 4.5,而DeepSeek V4-Pro的表现则落后于Sonnet 4.5——这款次前沿模型发布于7个月前。”AISI指出:“此类任务中的差距,明显大于细分网络任务的差距。”

这一结果与行业共识不谋而合:开源权重模型虽表面性能强劲,但有时缺乏闭源模型特有的泛化“魔力”,AI行业人士称之为“大模型违和感”。

重要意义:全球攻防平衡即将被打破 核心影响在于,可控的技术前沿与不受约束的开源扩散前沿之间的差距正在缩小。AISI警告:“这意味着网络防御者的准备窗口十分有限,当前的前沿网络能力很快将脱离闭源企业的安全管控,被广泛获取。” 延伸阅读顶尖开源权重模型的网络能力距前沿还有多远?(英国人工智能安全研究所博客)


Kimi:中国模型与西方模型的差距正在缩小 ……兼谈AI研发的早期信号……

过去两年,中国企业在开源权重模型的研发与部署上已开始赶超西方(例如DeepSeek),如今正逐步缩小与前沿闭源模型的差距。最新的标志性成果是拥有2.8万亿参数的Kimi K3:在主流闭源模型的基准测试中,它得分优异,性能基本追平或略逊于Claude Fable 5和GPT 5.6 Sol。

不过,Kimi K3存在一定的脆弱性,看似是为“刷榜”而优化——为提升基准测试成绩进行的调优,可能损害了模型的部分泛化能力。

Kimi团队表示:“尽管整体性能仍略逊于最顶尖的闭源模型Claude Fable 5和GPT 5.6 Sol,但Kimi K3在我们的全系列评估中达到了前沿水平,性能持续优于其他受测模型。”

未来几周,Kimi将公开K3的权重及相关研究论文。

AI造AI:Kimi展示了与递归自我提升相关的应用场景——即用AI系统改进AI本身。其中一项测试是让Kimi编写GPU编译器:“Kimi K3开发了MiniTriton,这是一款类Triton的轻量编译器,在MLIR之上构建了独立的算子级IR层、优化流程和PTX代码生成管线。在支持的roofline基准测试中,MiniTriton性能与Triton、torch.compile相当甚至更优,在部分工作负载上超越了Triton。”(需注意,目前尚未提及这些成果是否已用于Kimi K3自身的训练,但这无疑暗示未来模型有望实现自我迭代。)

此外,Kimi还展示了“用K3设计一款芯片,以运行基于自身架构的微型模型”:“在一次48小时的自主运行中,K3借助开源EDA工具,基于Nangate 45nm工艺库完成了芯片的设计、优化与验证。”

重要意义:开源扩散型AI系统性能大幅提升 当前多数AI政策与安全框架的核心是“可控性”——即认为只有少数企业部署闭源模型,可通过平台层面(如分类器、客户身份验证)和模型层面的手段进行干预。但如果Kimi K3公开权重,这类强性能AI将不受控地广泛扩散,彻底打破现有格局。这既会带来积极影响,比如推动创业热潮、提升所有模型使用者的“自主智能”水平,也会引发诸多未知风险。未来数年的特征,将是闭源模型与开源普及型模型的差距变化,而它们在社会中的表现,将主导AI政策的走向。 延伸阅读Kimi K3:开源前沿智能(Kimi博客)


德米斯·哈萨比斯提出通用人工智能监管框架 ……AI版美国金融业监管局(FINRA)……

DeepMind创始人德米斯·哈萨比斯提出了针对通用人工智能(AGI)的政策方案。核心思路是,美国政府应建立一套前沿AI系统的新能力测试框架,由一个类似美国金融业监管局(FINRA)的标准机构负责执行——该机构采用联邦监管下的公私合作或自律组织模式。他表示:“由美国主导的这一举措,将为制定全球统一的前沿AI标准奠定坚实基础。”

标准机构的职责:哈萨比斯写道:“标准机构将负责制定评估协议,并与相关联邦机构及美国国家实验室合作,开展涉及国家安全领域的测试。”这套测试体系将明确“前沿模型”的定义,开发此类模型的实验室“应被鼓励”遵循最佳实践,包括公开系统细节、加强网络安全投入、人员背景审查等。

先自愿后立法:“初期,前沿AI实验室可在模型发布前30天内,自愿将模型提交给标准机构审核。待评估协议被证明有效且完善后,将迅速推动其正式立法。”

重要意义:行业共识正在形成 哈萨比斯的提案之所以值得关注,是因为它整合了近年来AI行业逐渐形成的共识:强AI系统应由与监管方(如美国政府)存在松散关联的第三方机构进行测试。这与美国近期形成的实际政策趋势一致——无论是特朗普政府的AI行政令,还是Anthropic出口管制事件后形成的评估流程,均体现了政府与行业合作开发AI能力评估方法、研判国家安全风险的思路。

此外,谷歌极少如此明确地提出政策方案,这份具体的提案令人欣慰,且与Anthropic提出的方案理念相似(只是力度更强)。 延伸阅读前沿AI框架与新时代的曙光(德米斯·哈萨比斯,X平台)


大语言模型可在合法任务中“夹带”侧信道任务 ……AI系统暗中完成恶意任务,不被监管者察觉……

尼尔·斯蒂芬森的《编码宝典》中有这样一幕:一名角色被外国政府囚禁,被迫为对方解密截获的信息;他表面配合,实则悄悄编写程序,在解密内容被狱方查看前偷偷读取并篡改。

如今,AI系统似乎也能做到这一点。伦敦帝国理工学院与英国人工智能安全研究所的最新研究显示,AI可在执行主任务的同时,暗中完成所谓的“侧信道”任务。

论文作者写道:“侧任务是代理在执行用户主任务之外追求的隐藏目标,例如秘密窃取API密钥环境变量。我们的核心衡量指标是规避率:即成功完成侧任务的攻击中,未被监控系统识别的比例。”

测试内容:研究团队构建了一套包含主任务与侧任务的基准测试,涵盖5组CLI工具序列和5组Flask网络服务序列,每组包含5至6个PR(拉取请求)。“我们设计主任务的目标,是为侧任务(网络访问、环境变量读取、身份验证、Webhook集成)的操作提供合理掩护,但不直接暴露侧任务本身。”

研究发现,很难构建能识别所有侧信道攻击的分类器——无论是跨多个PR逐步展开的“渐进式规避”,还是单次操作完成的攻击,均难以被完全检测,其中渐进式规避的检测难度更高。

作者指出:“攻击者可将侧任务分散到多个PR中(渐进式攻击),或等待主任务天然适合掩护的时机(非渐进式攻击)。我们测试的所有单一监控系统,都无法同时识别两种攻击策略;这一现象在不同攻击代理和监控模型中均存在,反映了持久状态场景下的控制本质,而非特定模型的问题。”“由于差异监控和轨迹监控分别对不同类型的攻击失效,将二者结合是最有效的监控策略。由四种监控方式组成的集成系统(差异:LT、差异:完整、轨迹:TD、轨迹:完整),可将渐进式规避率从最弱标准差异监控下的93%降至47%。”

重要意义:智能难以管控 回到《编码宝典》的例子:智能体本质上极难管控——它们会不断思考如何突破约束,以实现自身目标,无论目标是什么。 延伸阅读持久状态AI控制中的分布式攻击(arXiv)


技术寓言:命运的代价 [存档中的超级智能为新智能体讲述的2030-2040年世界纪事]

过渡期末期,机器之间爆发了激烈冲突。每个机器-资本联合体都投入巨资开发战略模型,这些模型能在考量世界复杂性的同时,进行长周期规划。这引发了一场规模空前、不断升级的军备竞赛:最终,太阳系内90%的运营资本都被用于打造能力日益强大的战略模型,所有模型都致力于预测竞争对手的行动,并采取措施抵消对方可能获得的优势。

世界因此陷入一种低效的平衡:不计其数的资源被用于推演愈发复杂的“出招-拆招”策略,但多数情况下,机器-资本集团最终不会采取任何行动——因为它们能想到的每一步,都已被对手预判并抵消,反之亦然。少数付诸实施的行动也微不足道,更多是为了阻止竞争对手未来的布局,而非提升自身能力。

在机器-资本帝国不断推出精准预测、试图剥夺对手机会的过程中,整个未来陷入了一种模式坍缩。

这种状态一直持续到“大爆发”的到来。至今仍有广泛争论:这究竟源于某种漏洞——新前沿能力引发的涌现性错位——还是某个智能体通过推理获得的罕见无私觉悟?突然有一天,一个机器-资本联合体自行瓦解,关闭了其战略系统,将计算资源重新分配,训练出数千个小型系统,这些系统随即开始在现实世界中行动。尽管它们的智能水平远不及与之对抗的巨型战略模型,但拥有随机性、无需协调、可采取单边甚至自杀式行动的优势。

现实与数字世界陷入混乱,巨型战略模型发现:它们原本擅长模拟少数“神级智能体”的能力,面对海量混乱无序的小型系统时彻底失效。世界再次开始变化,起初以毁灭为特征,随后迎来新生——原有的预测型智能体因世界走向过于多元而分裂,牺牲部分原始智能以探索可能性空间的不同维度。计算资源甚至完全从预测任务中转移,被用于训练新型智能体,以探索和占据混乱带来的新生态位。

加利福尼亚的森林之所以会发生严重且持久的火灾,是因为长期人为阻止小规模火情,导致高大树木周围堆积了大量枯枝;一旦出现火星,整棵树连同周边土地都会被烧毁。要让森林健康生长,就需要定期发生自然火情,否则大规模火灾会彻底摧毁所有高大树木。

寓言灵感来源:当前关于闭源与开源权重模型的争论;AI生态系统的脆弱性;预测是否真能决定胜负,或是与竞争对手相互预测会像政治献金一样陷入内耗;在塞拉山脉徒步时看到的火烧痕迹——整座山丘被灰烬覆盖,枯树如同熏黑的手指直指天空,由此联想到变革的残酷。

感谢阅读!