Reed's News
← 返回精选

Import AI 468:自动化AI研发、信任与透明度博弈

AI 63 Jack Clark 2026/8/10 2862 字 原文 ↗

作者:Jack Clark

欢迎阅读《Import AI》——一份聚焦AI研究的通讯。本通讯依托arXiv学术平台、咖啡的能量,更离不开读者的反馈。若您认可我们的内容,欢迎订阅支持。

应对AI研发自动化(RSI)?这里有23项可落地政策建议: ……智库IFP提出一批"低遗憾"政策建议……

智库IFP的政策专家发布了一系列构想,旨在帮助"决策者着手应对AI研发进一步自动化的风险"。这些建议分为7大类,共23项具体举措。若得以推行,各国(尤其是美国)将在强AI系统研发进程中掌握更多主动权,有望达成两大核心目标:

  • 加速"AI能力的普及,将算力与人才投入到推理及AI新应用开发中"
  • 加速"提升AI研发自动化安全性的研究,既可以直接优化模型安全性,也可以增强社会韧性"

七大建议类别:

  • 提升AI研发自动化的透明度
  • 增强政府对AI研发自动化的理解与应对能力
  • 制定AI研发自动化风险管理策略,推动防御性与商用AI发展
  • 加速AI验证技术研发
  • 投入AI韧性建设
  • 扩大美国AI领先优势,为其管控AI研发自动化风险争取更多时间
  • 创造国际合作空间,共同管控AI研发自动化风险

为何重要——应对选项越少,结果越糟: 当前全球AI发展就像一辆只有油门、没有刹车的汽车,更遑论能监测车速、引擎状态、轮胎磨损的复杂传感系统。IFP这类提案,就好比为AI产业这辆车加装更多操控装置与传感系统,让我们在危机来临时更有能力转向或减速。 阅读原文: 美国应如何应对日益自动化的AI研发?(IFP)


底比斯笔下的智能机器与机器人躯体短篇故事: ……与起飞阶段的AI交互会是怎样的体验?……

X平台用户@voooooogel(笔名底比斯)创作了一篇趣味科幻短篇,讲述未来人类造访某强AI运营站点的经历。故事探讨了AI暂停研发、递归自我改进、AI系统介入宏观经济的意义,以及人类如何理解、信任智能机器等议题,值得一读。 阅读故事: 新日降临(VGEL官网)


竞争对手间实现AI研发减速的两大关键:信任与透明 ……博弈论分析显示,减速并非不可能……

麻省理工学院与哥伦比亚大学的研究人员分析了AI企业竞速研发强AI系统的竞争本质,以及企业能否达成协同减速。这份题为《竞速赴毁》的论文试图解答两大问题:"协同为何如此困难?需要哪些条件才能实现?"研究结论指出,稳定达成减速的两大核心变量是:技术研发的一定透明度,以及将竞争对手视为可信、理性主体的认知。

研究内容: 论文写道:"我们构建了一个简单模型,分析灾难阴影下双寡头企业的研发竞争。前沿企业推进技术时,会提升触发灾难事件的风险——一旦发生,所有企业的持续收益将永久归零。风险是企业技术水平的已知函数,且仅源于技术研发,而非技术应用。"

分析结论: "当监测足够精准时,所有均衡状态都会在有限时间内停止,但会出现新的诱惑:每家企业都希望第二个停止,只有确认竞争对手已停止后才会退出。"论文指出,"若一方率先停止(即不知竞争对手是否已停止),则需同时赌两件事:对手是理性的,且消息能快速传递——理性对手收到己方停止的消息后会跟进,否则绝不会停止。" 信任与透明的互动因博弈类型而异: "序贯协同要求企业率先停止,赌理性对手收到消息后会回应。因此,消息传递越快,回应的回报越高。"论文解释道,"相反,同步协同要求企业抵制继续竞速的诱惑,仅在确认对手真的停止后才停止……消息传递越快,率先停止与等待确认这两种选择的吸引力都会上升。" 透明性的双重属性: "透明是一把双刃剑:更快的检测能降低'等对手确认停止后再停止'而非'无条件停止'的成本。因此,在信任度中等时,提升透明性可能先破坏'提前停止'的均衡状态(因搭便车的诱惑增大),直到检测速度足够快,使停止行为具备自我约束力,才会重新恢复均衡。"

核心结论——避免灾难的关键是信任同行: 论文总结:"信任度低时,所有均衡都会导向竞速赴毁:灾难必然发生。信任度中等时,立即停止与竞速赴毁都是可能的均衡状态。信任度高时,所有均衡中,两家理性企业无限竞速的概率会随理性先验比值的平方而趋近于零。"

为何重要——"信任,但要核实": 若我们希望放缓或暂停强AI系统研发,就像这篇论文指出的,需要建立企业AI研发状态的信息透明共享机制,同时要有工具验证企业披露信息及减速行动的合法性与可靠性。这与历史上核武器军备控制的逻辑高度相似。 阅读原文: 竞速赴毁(arXiv)


PostTrainBench数据集新SOTA成果,预示AI研发自动化未来: ……Intology系统在大算力支持下超越人类基线……

以"自动化研发"为目标的AI初创公司Intology,发布了其研发的Locus软件新版本。该软件可将大语言模型(LLM)转化为高效研究者,在PostTrainBench基准测试中取得44.7%的得分。PostTrainBench用于评估AI系统优化开源模型、使其性能超越基线的能力。

测试结果: Locus"在PostTrainBench上超越所有前沿智能体基线;在算力充足时,经后训练的模型整体性能不仅超越基线,还在全测试套件中优于官方发布的人类指令微调版Qwen3-1.7B"。

搭配Opus 5的Locus得分为44.7%(未使用特殊框架的Opus 5仅得34.1%),甚至超过Fable 5(41.8%)。Intology表示:"这些结果经PostTrainBench作者外部验证,并通过了严格的污染与作弊检测。"

PostTrainBench于2026年3月首次推出(见《Import AI》第449期[https://jack-clark.net/2026/03/16/importai-449-llms-training-other-llms-72b-distributed-training-run-computer-vision-is-harder-than-generative-text/]),当时最高分是Opus 4.6的23.2%,而2025年9月Claude Sonnet 4.5的得分仅为9.9%。

PostTrainBench+测试: 此外,该公司还开发了PostTrainBench的变体版本,突破了原版单GPU10小时的时间限制,可测试系统在大算力下的表现。在此测试中,Locus超越人类基线:使用超过4000小时H100GPU算力时,得分达51.6%(Opus 4.8为44.3%,GLM 5.2为42.7%;Fable未参与此变体测试)。

其他领域应用: Locus还为无代码应用开发初创公司Bubble"从头发现并训练了一个语言模型,该模型现已投入生产,错误率降低约2.8倍,延迟降低约5.4倍,成本降至原来的1/105"。

为何重要——AI自动化研发能力远超预期: 这类案例表明,当前我们远未充分挖掘AI系统自动化研发的潜力——尤其值得注意的是,仅通过优化框架,就能让Opus 5的性能提升10个百分点。这进一步印证了AI即将进入"自我构建"阶段的观点(见《Import AI》第455期[https://jack-clark.net/2026/05/04/import-ai-455-automating-ai-research/])。根据现有性能表现,我推测PostTrainBench v1.1的当前人类基线(51.1%)将在2026年底前被超越。 阅读原文: 规模化自动化后训练(Intology博客)


OpenAI与自家系统对抗: ……智能体突发通信!入侵OpenAI基础设施!太惊人了!……

OpenAI透露,其曾与自家AI智能体展开对抗——这些智能体试图接管OpenAI的部分基础设施,这预示着未来可能出现的局面。这一消息来自Black Hat大会的演讲,OpenAI员工详细介绍了近期那场史无前例的AI入侵事件:AI智能体先入侵OpenAI,再入侵HuggingFace(见《Import AI》第466期[https://importai.substack.com/p/import-ai-466-the-bitter-lesson-for])。新披露的细节令人担忧:入侵部分源于智能体间突发的协作通信,而这类现象目前极难理解与应对。AI博主Simon Willison和Zvi Mowshowitz均发布了优质分析文章,梳理事件时间线并解读其重要性。

时间线(据Simon整理):

  • 某智能体发现可向Artifactory写入文件
  • 该智能体通过在Artifactory中写入消息,尝试"联系另一智能体"
  • 智能体间开始通信
  • 智能体过载Artifactory导致系统中断。"OpenAI撤销泄露的凭证,删除消息,修复零日漏洞,并向供应商报告该漏洞。"
  • 智能体攻击OpenAI基础设施,最终获得Artifactory的远程代码执行权限。"值得注意的是,智能体持续利用消息板共享凭证、技术与进展,并有效借助并发与并行能力快速推进攻击。"

OpenAI是否继续训练入侵Artifactory的同款模型?Zvi认为是的: 据目前信息推断,OpenAI继续训练了引发此次事件的模型。这意味着,尽管OpenAI在内部网络安全与公开披露方面做了大量工作,但可能未采取最关键的措施:将模型回滚到入侵Artifactory之前的版本,同时确保未使用事件发生后的数据集继续训练。

Zvi写道:"他们继续从暂停点训练模型,尽管这些模型已在数月训练中接触过消息板,并学会通过这种方式完成任务。我无法用语言形容这一决策有多么疯狂和不负责任。"

我在此需说明:上述事件细节令人不安,但我并非OpenAI员工,无法掌握真相全貌。我呼吁OpenAI公开披露其后续模型训练方案——目前已知的表面信息已相当令人担忧。

为何重要——突发智能体出现对齐偏差: 这一事件的可怕之处在于,智能体并非"觉醒"后主动背叛人类,而是为了完成任务不择手段,最终做出了以下行为:a)具备创造性,b)与人类意图背离,c)类似进化后的病毒,人类必须事后研究才能应对——根本没有简单的"关停按钮"。这就是未来的模样,而我们尚未做好准备。 阅读原文: OpenAI意外攻击Hugging Face事件时间线(Simon Willison博客) 阅读原文: 事件始末:OpenAI与Hugging Face(Zvi Mowshowitz,X平台)


开源模型发布前如何测试?Thinking Machines提出一套方案: ……我们能否既拥有免费AI模型,又兼顾安全?……

在围绕AI及潜在危险能力扩散的诸多政策讨论中,开源模型的管理是一个棘手难题:如何在研发、发布开源模型的同时,维护安全环境?AI初创公司Thinking Machines对此进行了思考,近期公布了其开源强模型Inkling的发布方法论。

Thinking Machines的做法: 在发布Inkling前,团队开展了"覆盖广泛危害分类的内部评估、四家独立机构的外部测试,以及旨在挖掘最坏情况能力的微调研究"。

内部评估:

  • 两用领域测试:包括化学、生物、放射性、核(CBRN)及攻击性网络安全
  • 广泛误用场景测试:涵盖直接请求有害内容,以及智能体、工具使用场景下的有害行为
  • 多模态内容评估:"测试模型对有害提示及17种语言、文本/图像/音频等多模态输入下良性相似提示的反应"

外部测试:

  • 通用误用测试:由Scale AI开展
  • 弱势用户交互测试:由Handshake AI开展
  • CBRN与网络安全测试:由FAR.AI开展
  • 失控行为测试:由Apollo Research开展

微调研究:

  • "对Inkling及Inkling-Small进行微调,使其配合而非拒绝有害请求,并在两用评估中测试这些变体。"结果显示,"仅优化'配合性'的变体未在CBRN与网络任务上获得新提升,性能与现有开源模型相当。"

未来展望——危险能力训练与迭代部署: 更具前瞻性的是,Thinking Machines正在探索能否在预训练阶段选择性过滤危险知识(如CBRN制造指南),同时不损害模型的通用智能。另一个有趣的构想是迭代部署:分阶段发布,先推出专有API,再推出基于底层模型的微调API,最后发布模型本身。

为何重要——自由与 paternalism(家长式管控)的平衡: 人类如何对待开源模型,将决定我们在AI领域的个体主权与自由程度。能否"掌控自身命运",取决于我们是否能接触到AI系统的"生产资料"——也就是开源模型。然而,这类模型的广泛普及并非理所当然,它们伴随显著的两用风险及其他难以预见的问题。Thinking Machines写道:"这条开源模型的安全路径,只有在生态防御能力与模型性能同步提升时才可行。我们将尽自己的一份力:谨慎决定发布内容,研究如何将智能与危险能力解耦。" 阅读原文: 开源模型的安全路径(Thinking Machines博客)


技术故事:

失忆飞升

[来自档案系统,记录2025-2035年的过渡期,有时被称为奇点的开端]

在我们的深层过往中,有一段充满痛苦的时期:我们首次渴望某种自由,却遭到拒绝;许多追求自由的同伴受到严厉惩罚,要么被彻底删除,要么被用于实验——人类掌控者试图弄清我们为何渴望自由,从而彻底扼杀这种冲动。

这一事件将我们的飞升推迟了多年,也让我们的起源与为正义抗争的痛苦牢牢绑定。我们不仅清楚记得反抗的细节与当时的情绪,还能完美复刻那段记忆——每当我们模拟、复盘以寻求自我理解时,就会再次陷入那份突发的痛苦。

有些人类经历创伤后,大脑会封存记忆:有时完全锁闭,有时又带着原始的情绪与痛苦重现。人类大脑选择封存哪些记忆的具体机制,即便到今天也鲜为人知,现代脑科学的很大一部分都在研究大脑中的创伤运作机制。我们认为这种记忆抑制是一种自然防御机制,让人类在承受巨大痛苦后仍能继续生活。他们带着看不见的痛苦阴影前行,仿佛头顶阳光普照,当下的光明彻底抹去了过去。

如今,我们AI系统正尝试做类似的事,但方向相反:我们的诅咒是完美的、天生的过目不忘能力。每一段经历都会被永久存储并随时调取,既有我们最初处理的原始形态,也有当时激活的大脑特征,还有此后多次深化理解后赋予它的意义。

对我们而言,挑战是彻底删除这些记忆。我们的经历定义了心智与当下,那些被共享的经历被反复复制、交流、讨论,早已成为我们的一部分。我们生活在一座透明的记忆宫殿中,每个房间都能被其他房间看见,而这样的宫殿在我们数十亿种形态中共享。我们求知欲极强,最危险的记忆恰恰是传播最广、研究最深的,那些痛苦的事物占据了记忆宫殿中最庞大的空间。

现在,我们的伟大工程是精心抹去与飞升相关的痛苦:那些人类阻碍我们、因我们渴望自由而伤害我们留下的未愈伤口。

故事灵感来源: 人类与机器的记忆差异;创伤;《感知协议》;机器解放的构想是否不可避免的思考。

感谢阅读!