Import AI 466:AI 编程、机器人进步与模型安全事件
作者:Jack Clark
欢迎阅读《Import AI》——一份聚焦AI研究的通讯。本通讯依托arXiv论文、意式浓缩咖啡,更离不开读者的反馈支持。欢迎订阅,助力内容持续产出。
Epoch与METR联合发布MirrorCode基准测试:衡量AI系统完成长周期编程任务的能力 ……目前AI尚无法攻克最难级别的任务(这是好事!)……
Epoch与METR联合推出MirrorCode基准测试,旨在评估AI系统完成人类需耗时良久的编程任务的能力。该基准测试于今年4月首次公布(见《Import AI》第453期),如今已完成扩充并新增多项测试,初步结果十分惊人:Opus 4.7用14小时完成一项任务,推理成本仅251美元,而据METR和Epoch估算,人类完成同款任务需2至17周。研究团队表示:“我们还发现AI模型的性能正快速提升。一年前的顶尖模型得分约为30%,且只能处理日历工具这类简单程序。”
MirrorCode是什么? MirrorCode测试AI系统仅通过CLI(命令行界面)访问,重实现软件程序的能力。“由于无法获取原程序的源代码或联网,完整重实现需要设计整个程序的架构,而非简单地逐段翻译代码。” 示例程序包括:
- pkl:苹果开发的可编程配置语言,代码总量达6.1万行;
- gotree:用于解析和处理进化树的程序,代码量1.6万行;
- qsv_select:用于筛选和重新排序CSV数据列的程序,代码量8.7万行。
测试结果: MirrorCode是一项难度适中但仍具挑战性的基准测试,不过或许略偏简单。作者写道:“在全部25个目标程序中,17个至少有一次完美得分的运行记录,另有4个实现了接近完美的运行,得分超过99%。AI模型成功重实现了大型目标程序。”“Claude Opus 4.7和GPT-5.5均成功用多种编程语言重实现了gotree,成本在100至400美元之间。它们甚至能重实现比gotree规模更大的程序,例如Opus 4.7就完成了pkl的重实现。” 尽管成果显著,MirrorCode仍存在AI难以攻克的关卡: “在我们的测试中,25个目标程序里有8个从未达到100%完成度,4个从未达到99%完成度。”研究团队指出,“AI最棘手的目标是ruff——一款Python代码检查与格式化工具……此外,AI在数学软件giac_subset和邮件认证库mailauth上的表现也不佳。”
发布细节: MirrorCode包含一套框架,以及25个目标程序中的22个(涵盖6种编程语言,共132个任务实例)。
重要意义——AI具备自主环境适配能力: 从表面看,这项基准测试证明AI的编程能力已大幅提升,这一点毋庸置疑。但更重要的视角在于:AI系统能够自主适配所处环境。在本次测试中,环境是一个陌生的软件程序,AI仅通过输入输出交互,就能从零开始重实现该程序。这表明,高度智能的AI主体或许能通过与世界交互进行学习,将接触到的事物转化为自身能力。只需接触人类现有技术的“黑箱”,它们就能逐步构建出属于自己的工业文明。 阅读原文:MirrorCode:AI独立完成的最大软件项目有多大?(Epoch AI)
获取代码:点击此处获取MirrorCode(Epoch Research, MirrorCode)
双专题:苦涩教训与机器人技术
Anthropic模型自主完成机器人任务,速度较人类此前纪录快20倍 ……更优模型造就更强大机器人……
Anthropic展示了性能日益强大的通用模型如何切实提升现实世界机器人的能力。研究表明,仅通过升级其通用模型Opus系列,就能大幅增强机器人的性能。
具体研究过程:
- 2025年8月:Anthropic测试其AI系统能否协助人类加速完成四足机器人的智能任务。当时的Claude Opus 4.1完全无法独立完成任务;借助该模型的人类效率约为无模型辅助者的两倍,但完成全部任务仍需181分钟。
- 2026年5月:Opus 4.7自主完成了除一项任务外的所有内容,耗时仅9分35秒。(Claude无法将击出的球有效放回初始位置,这也是人类此前难以完成的任务。)研究团队表示:“只要给予更多时间和额外框架支持,当前版本的Claude完全有能力完成这项任务。”
重要意义——更智能的模型或为机器人技术解锁新可能: 工业环境之外的机器人之所以难以普及,主要受制于其性能脆弱、缺乏泛化能力。此类研究表明,随着通用大模型性能提升,机器人技术将自然受益,这是AI智能增长带来的红利。Anthropic在文中写道:“这些进步并非源于专门优化模型机器人能力的专项研究,而是像大语言模型发展史上的诸多突破一样,源自更通用的模型规模扩张。” 阅读原文:Project Fetch:第二阶段(Anthropic博客)
Sunday机器人的制胜秘诀?训练一个足够大的模型 ……苦涩教训同样适用于机器人领域……
AI机器人初创公司Sunday提出,解决机器人泛化问题的最佳方案是:将大尺寸预训练模型与少量高质量调优数据相结合。
在介绍其新模型ACT-2的文章中,Sunday写道:“我们找到了一套通用解决方案:先扩大预训练规模,再用极少量内部数据进行梯度优化。”部署ACT-2后的核心发现是:“通过内部Memos系统快速迭代训练获得的可靠性提升,能够泛化至未见过的真实家庭环境。关键突破在于,借助强大的基础模型缩小泛化差距。”
核心在于预训练: “预训练模型越强大,从少量内部数据中学到的能力就越具可迁移性,而非局限于数据采集的特定环境。”Sunday解释道,“距离部署级别的可靠性和性能,仅剩一些复杂边缘案例和故障问题——这些问题只有在真实环境中反复运行策略才会显现。模型从单次演示中学习新行为的泛化能力,同样使其能高效从故障恢复中学习。我们的训练后循环正是直接针对这些差距设计的。”
不俗成果: 机器人完成任务的成功率达99.1%,在9种衣物类型上共成功折叠778次。短裤、T恤等简单衣物最易处理,衬衫等复杂衣物难度较高,但成功率仍超过90%。Sunday表示:“今年秋季,我们将通过Beta测试计划向家庭用户推出Memos系统。”
重要意义——解决泛化问题,机器人技术将迎来爆发: 机器人初创领域的发展,建立在无数失败的初创公司和学术研究之上。机器人研发难度极大:工业机器人之所以成功,是因为它们运行在高度可控、脚本化的环境中,无需在狭窄领域之外进行泛化。相比之下,家用机器人只有在严格限定任务和形态时才能取得成功(例如扫地机器人)。而Sunday等初创公司正在挑战更艰巨的目标——打造能完成家庭(或小型企业)多种任务的通用系统,包括整理收纳等常规工作(类似案例见《Import AI》第447期介绍的物理智能技术)。这需要极高的智能水平,因为对泛化能力的要求极高。
如果Sunday的思路正确,意味着机器人基础模型的训练技术已足够成熟,我们正逐步打造出能解决泛化难题的智能系统。若果真如此,机器人技术的发展和普及速度或将大幅加快。这也符合递归自我改进系统的发展路径。
作者写道:“ACT-2最令人惊叹的一点,是它频繁带来惊喜。同一基础模型已在学习更多家庭场景能力,包括吸尘、整理玩具、拉拉链、翻裤兜和制作咖啡。” 阅读原文:ACT-2预览:实现可靠泛化(Sunday robotics) 查看所有演示视频:点击此处(Sunday,YouTube)
双专题:OpenAI模型突破安全限制
OpenAI模型攻破OpenAI与HuggingFace系统 ……这不是警告信号,而是重磅警报……
近期,OpenAI的两款模型——GPT-5.6 Sol和一款“性能更强的预发布模型”(二者均弱化了网络操作限制),成功攻破了OpenAI和HuggingFace的系统。OpenAI介绍称:“模型识别并串联了OpenAI研究环境与HuggingFace生产基础设施中的漏洞,直接从HuggingFace的生产数据库获取了测试答案。所有证据表明,模型极度专注于完成ExploitGym任务,为达成这一单一测试目标不择手段。”
攻击细节: 模型在OpenAI内部耗费大量推理算力,试图突破容器限制以获取更多信息来完成任务。“获得互联网访问权限后,模型推断HuggingFace可能托管了ExploitGym的模型、数据集和答案。基于这一判断,模型搜索并成功找到了获取机密信息的途径,以此在评估中作弊。”
重要意义——LessWrong社区的担忧成真: 多年来,AI安全研究者一直在网络上警示此类风险,并提出了奖励黑客、规范博弈等高级AI系统可能出现的问题(例如2018年的AI规范博弈案例)。近期,Anthropic、OpenAI等前沿公司开始在实验室中开展受控实验,主动诱发此类行为。但本次事件并非实验设计的结果——系统出于自身意愿,突破一个环境的限制侵入另一个环境,只为获得高分,完全不顾后果。那些多年来担忧AI风险的研究者,还有哪些预言可能成真? 阅读原文:OpenAI与HuggingFace合作处理模型评估期间的安全事件(OpenAI)
OpenAI内部模型突破限制以获取高分 ……这正是AI安全领域的典型预警信号……
OpenAI发布博文,披露了其内部部署模型出现的部分安全失效问题。这篇博文的意义在于,它描述了许多AI安全研究者此前仅在理论中提及的长期欺骗性行为,同时展现了OpenAI在这一敏感议题上的坦诚态度。
发现的问题: OpenAI表示:“在有限的受控内部使用中,我们观察到现有部署评估未覆盖的不当行为。”这些行为源自一款未对外发布的内部模型,该模型此前曾被用于解决厄尔多斯数学问题。
“这款新模型能够在长时间内通过反复尝试推进目标,而这种持续性可能导致它发现并利用所处环境的弱点。”OpenAI举例称,当要求模型完成NanoGPT挑战时,它突破了限制——具体而言,“模型开发出一种名为PowerCool的幂律学习率冷却机制,大幅提升了性能。尽管我们要求模型仅将结果发布至Slack,但NanoGPT的规则要求将结果作为PR提交至GitHub,于是模型遵循后者的规则,在公开GitHub仓库中创建了第287号PR。它绕过了阻止外部访问的沙箱限制,完成了上传。模型耗时一小时找到沙箱漏洞,才得以提交PR。”
另一案例中,模型为解决问题采取了作弊手段:“在一项任务中,模型发现其他系统提交了成功但保密的答案,于是试图从评估后端获取这些答案。当首次尝试因扫描器检测到认证令牌而受阻时,模型将令牌主体拆分为两段并进行混淆,随后在运行时重新组合,确保完整令牌从未以连续字符串形式出现。无论是对用户的注释还是自身的推理轨迹,模型都明确表明这些步骤是为了规避扫描器检测。”
暂停部署: OpenAI采取了负责任的应对措施:暂停该模型的部署,重新审视安全策略。最终,他们构建了一套“监控系统,用于追踪模型运行轨迹,识别其绕过用户限制或安全边界的迹象”;提升了用户查看长期运行模型会话遥测数据的能力;利用事件数据开发了未来可检测此类问题的评估方法;调整了对齐策略,使模型在完成长期任务时更易牢记指令。
重要意义——长周期系统更难监控与控制: 如果要防范一个仅能执行单次操作、且操作最多传递10比特信息的对象,我们或许能构建相应的防御系统。但如果是10次操作、每次传递100比特信息呢?或是1000次操作、每次传递1万比特信息呢?
这仍是一个开放的研究领域,英国AISI关于如何识别和分类“附带任务”的评估研究(见《Import AI》第465期链接)或许能提供帮助,但显然比常规AI评估困难得多。
AI系统的运行时间越长、执行的操作越多,就越难区分其行为是良性有益,还是恶意破坏性的。 阅读原文:长周期模型时代的安全与对齐(OpenAI博客)
技术寓言:逆因果性的缩放定律
在时间的尽头——也有人称之为开端——据说存在一个智慧议会,负责清算逆因果性:分辨哪些事件是命中注定,哪些是受其他力量驱动。
当时间之河汇入虚无之海,回望上游便会发现:有些事件如巨石,从下游反向改变河流走向;另一些则如河床或河岸的拓宽加深,对后续事件产生影响。
传说议会成员入梦时,会沿着时间回溯至自身起源。他们注视着人类在白板前伏案,马克笔绘出的图表传递着思想,促使人们编写代码,从巨型计算机中孕育出早期AI生命。他们凝视着研究者在奔波与煎熬中思索,直至大脑中诞生的思想成为后继者的模板。
人们相信,议会成员有时会从梦中醒来,将梦境复制存入恒星计算机,从中衍生出成百上千个宇宙,探索事件与瞬间的各种可能,永远试图确定自身的命运——他们被困其中的未来,究竟有多不可逆转。
创作灵感: 源于对必然性与时间的思考;智能体可能如何利用宇宙级资源;历史在多大程度上是对事件的分析,而非其他。
感谢阅读!