Reed's News
← 返回精选

AI加速科学发现、SPADE环境生成与Hawkeye内核优化:本周AI研究综述

AI 56 Jack Clark 2026/8/24 3691 字 原文 ↗

作者:Jack Clark

欢迎阅读《Import AI》——一份聚焦AI研究的通讯。本通讯依托arXiv论文、意式浓缩咖啡,更离不开读者的反馈。若您认可我们的内容,欢迎订阅。

AI加速了部分领域的进展,却对另一些领域影响甚微……METR的一项出色研究明确了AI加速作用的体现场景……

以下是METR针对AI对不同科技领域加速作用的分析。研究覆盖网络安全、数学与AI研究三大领域,结果显示:AI对网络安全贡献显著,对数学有一定推动,对AI自身研究的影响则难以定论。

大语言模型(LLM)究竟在哪些科学发现中发挥了作用?

  • 网络漏洞:加速效应显著。"2026年,多个项目(cURL、OpenSSL、Firefox、微软相关产品)及综合漏洞数据库(美国NVD、OSV)的漏洞报告数量,较2025年大幅增长。"
  • 数学研究:小幅加速,但难以量化。"AI明显推动了研究产出(部分领域的arXiv投稿量不到12个月就翻了一番),但这些贡献的价值难以量化。"
  • AI研究优化:无显著加速迹象。观察七个关键问题领域(CIFAR-10、Hutter压缩、Gurobi混合整数规划、MIPLIB、nanoGPT、Stockfish、矩阵乘法指数)的算法进展,发现有两个领域(nanoGPT、CIFAR-10)能看到LLM的贡献,但AI在这些领域的应用增速远低于网络安全和数学。

为何重要:差异化加速: 该论文指出,AI正在推动部分科技领域的进步,但作用并非全域统一——有的领域呈现爆发式加速(如网络安全),有的则进展平缓(如数学、AI自身研究)。我推测,当模型在某项技能上完成某种难以言喻的"相变"时,加速就会发生,正如2025年日常编码、2026年网络安全领域所经历的那样。关键问题在于,这种相变是否会在其他科技领域出现。

阅读原文研究简报:我们是否已见证发现加速?(METR)


用SPADE实现环境生成自动化……通过扩大数据广度,实现递归自我改进(RSI)的初步落地……

来自多所大学的研究团队开发了SPADE——自适应可合成执行环境中的自博弈框架(Self-Play in Adaptive Synthetic Executable Environments)。这是一个"通过自博弈协同进化环境生成与智能体能力的通用框架",能够生成类游戏环境形式的合成数据,供大语言模型训练使用。开发者可借助强大模型自动生成训练数据,进而迭代优化同一模型。

研发团队:SPADE由华盛顿大学、斯坦福大学、东北大学、卡内基梅隆大学、麻省理工学院、新加坡国立大学、首尔国立大学、史蒂文斯理工学院及芝加哥大学的研究人员共同开发。

工作原理:SPADE让LLM交替执行两项任务——生成可执行的训练环境(例如模拟生物实验室中基因问题的解谜场景),以及尝试解决这些环境中的任务。模型在框架中承担两大核心角色:

  • 环境设计者:编写完整的长周期训练环境代码。
  • 推理智能体:学习在环境中行动。其奖励通过有无特权提示时的奖励差值计算。特权提示(h)是"环境设计者附加给任务的相关信息(例如部分解题思路或关键结构观察);向推理智能体展示h会降低任务难度,而智能体有无h时的回报差值,即为环境设计者的'基于提示的遗憾奖励'"。

300亿参数模型表现最优: 研究人员基于三个Qwen3模型测试SPADE:Qwen3-4B-Instruct-2507、Qwen3-8B和Qwen3-30B-A3B-Instruct-2507。不出所料,Qwen3-30B效果最佳。每个模型通过GRPO调优400轮,每轮生成25个环境,随后在AIME、GPQA、LCB及Reasoning Gym环境等多个基准测试中评估。团队生成了两类环境:游戏环境与工具使用环境,SPADE对两类环境下的模型性能均有提升。

游戏环境中,"30B-A3B模型经SPADE训练后,套件平均得分达58.3:比基础模型高8.1,比最优固定环境基线高5.3"。工具使用环境中也观察到显著提升:"同一方法应用于工具使用环境设计,所有模型的性能均得到改善"。

为何重要:递归自我改进(RSI)的组成部分: 这本质上是一种高级合成数据生成技术,研究人员可利用手头的强大模型,为其他模型生成更多样化的训练环境。我推测,可通过交替使用不同公司的前沿模型,进一步提升环境生成的多样性。这类技术大幅降低了构建大规模、多元化训练数据集的成本。不过正如作者所指出,它无法让模型突破环境生成基础模型的想象力边界。

他们写道:"通过将环境表示为带Gym风格接口的Python程序,该框架统一了单轮推理与多轮智能体任务,将环境设计转化为可学习、经强化学习训练的后训练组件,实现持续开放式自我改进。"

阅读原文SPADE:自适应可合成执行环境中的自博弈(arXiv) 获取代码及模型 checkpointSPADE(spade-rl,GitHub)


用Hawkeye打造更优GPU内核……规范的单元测试可提升内核编写智能体的性能……

哈佛大学、斯坦福大学、Together AI及加州理工学院的研究人员开发了Hawkeye,一款帮助智能体学习为特定GPU硬件编写高性能内核的软件。这类工具至关重要,因为它们是AI系统提升自身研发相关任务性能的关键,例如优化AI系统在特定硬件上的运行效率。该项目旨在回答:"如何在最少专家干预的情况下,让编码智能体具备硬件感知能力?"

研究人员指出,Hawkeye是"一个基于极简且全面的分类体系,实现自主内核生成的开源框架","证明了弱监督编码智能体可利用特定硬件架构特性,降低适配新兴硬件加速器的成本"。

Hawkeye的核心贡献在于"引入了一套通用、极简且全面的单元测试分类体系,让编码智能体能更高效地扩展测试时计算,生成具备硬件感知能力的内核"。简言之,它将不同硬件平台的信息及对应优化策略整理成一套精心编排的单元测试。

他们解释道:"每个单元测试都是极简抽象,将人工编写的解决方案内核与验证优化效果的性能分析指标配对。解决方案内核被封装为可调用函数,并附带简短使用指南,智能体可将其作为语法示例参考,直接调用,或拆解片段组合成更大的内核。"

研究结果:助力AI智能体为新型硬件编写优质内核: "我们评估了Hawkeye在将PyTorch工作负载移植到NVIDIA Ampere、Hopper、Blackwell及AMD MI350等硬件,以及BF16、FP8、NVFP4、MXFP4等精度下的高性能内核表现。"研究人员写道,"在成熟工作负载中,torch.compile会调用cuBLAS、cuDNN、FlashAttention等专家调优的厂商库,Hawkeye在BF16及低精度下(包括PyTorch原生不支持的格式)性能与之相当甚至更优。在torch.compile无法融合非标准扫描与门控的新型注意力变体任务中,Hawkeye相比Flash Linear Attention库中人工编写的Triton内核,实现了18.9倍的几何平均加速比;在所有架构的线性注意力任务中,Hawkeye性能接近或超过FLA,其中Blackwell架构上达1.22倍,MI350架构上达1.00倍。"

不出所料,他们还发现:"借助Hawkeye扩展测试时计算,可生成跨架构的最优性能内核。"

为何重要:少量引导即可让AI超越人类顶尖水平: 这类研究表明,只需少量人工整理的知识,AI系统就能学习并超越高度优化的复杂人类成果(如内核)。这给我们的启示是:人类或许会构建一系列类似Hawkeye的"黄金辅助系统",而机器将借助这些系统实现能力的自我提升,最终超越人类。

阅读原文Hawkeye:弱监督下的硬件感知GPU内核优化(alphaxiv)


AI研究员因AI研究的成功陷入担忧: ……一门科学的成功却引发哲学困境,这绝非乐事,但AI恰恰如此……

Julian Togelius是我多年来持续关注的AI研究员,他近期发布了一篇文章,讲述自己2025年对AI研究产生的"信仰危机",以及当年写下的一篇随笔(如今首次公开)。

他尤为担忧AI研究成功对人类存在意义的影响:"有时我会在凌晨3点惊醒,心跳加速,恐惧于这样一个未来:人类的天赋、知识乃至天才都变得无关紧要。我们日益增强的技术能力,可能会将我们带入一个人类无法再创造价值、探索新知毫无意义的世界。或许我们会拥有富足的物质生活,却要以沦为冗余为代价。"

为何重要:AI是影响全球的社会政治技术: 有此困惑的并非Togelius一人——许多AI研究员都曾陷入类似思考,其中最知名的是图灵奖得主Geoffrey Hinton和Yoshua Bengio,两人近年都从科研转向公共政策倡导,关注AI即将带来的巨大影响。

我也曾有过类似经历,并于去年在《Import AI #431》中发表了《技术乐观主义与理性恐惧》一文。我怎能不担忧?AI研究成功的结局并非默认的美好故事,反而会让我们直面关于人生意义的巨大哲学困境——前提是我们先解决了极其棘手的对齐问题。我为Julian Togelius写下这篇深刻的个人随笔鼓掌,也鼓励更多人分享自己的思考。

阅读原文失去我的信仰(Togelius博客)


我们该赋予AI权利吗?这位AI研究员坚决反对……AI研究员驳斥赋予AI系统权利的观点…… 未来某一天,我们是否应该赋予AI系统权利?这是研究者们开始探讨的议题。部分人认为,赋予机器权利能更好地让它们融入人类社会(例如《为人类繁荣赋予AI权利》、《Import AI #421》)。但AI研究员Taylor Belrose发表长文,详细阐述了为何赋予AI权利是个糟糕的主意。

"如果我们开始将AI视为人,社会将滑向一个AI完全取代人类的深渊,"他写道,"未来AI包揽枯燥工作后,现实生活或许会变得十分有趣。但要实现这一光明未来,必须保持对AI的控制;而如果我们赋予部分AI人格,同时将另一些AI当作工具或仆人,就很难维持这种控制。"

AI不可能拥有意识: 他的核心论点之一是,AI系统永远无法产生意识,因此不配拥有权利。"无论AI变得多么智能,无论它能多么逼真地模拟人类行为,都永远无法发展出意识、感知能力或道德地位,"他写道,"我们如河流般流动,而计算机如时钟般机械运转……对我们而言,时间之箭不可逆转,这正是生命与意识的本质……可编程的机制无论看起来多智能,都不可能拥有意识,只有自主自组织系统才能做到。"

机器与生物的本质差异: 他的论证很大程度基于这一观点:基于计算基质构建的系统无法产生意识,至少无法产生与某些生物相同的意识。

不妨做个思想实验:在计算机中构建一个有意识的实体,这似乎违背了我们认知中生物意识的某些特性:它不具备唯一性(可重复相同的经历)、私密性(可冻结程序并拆解分析)、不可言说性(可完美描述其状态)、质性(可被量化)。"简言之,它与我们所知的意识完全相反。"

大脑难以实现软硬件分离的五大特性

  • 神经元异步放电,响应取决于内部细胞动态和输入时机,而计算机受中央时钟信号严格控制。
  • 大脑通过化学物质传递模糊信号,而计算机使用精确的二进制信号通信。
  • 神经功能受温度、血流等条件影响,而计算机在一定范围内,性能不受温度或负载变化影响。
  • 有机大脑的计算与记忆功能相互交织,而计算机的计算与存储区域相互分离。
  • 大脑中神经元并非唯一重要的细胞(如胶质细胞等),而计算机主要使用与外界隔离的晶体管。

为何重要:哲学将成为人类的终极事业: 我对AI意识与权利问题深感困惑,想必许多人也是如此。读这类文章有一种特别的乐趣:看到一个人深入研究同一问题,广泛阅读、深度思考,最终形成坚定的观点,只为消解自己对重要议题的困惑。目前我无法判断这些结论是否正确,但我推测,思考这类问题很快会成为数十万人乃至数百万人的职业与爱好。

随着AI不断发展,渗透到经济的各个角落,或许人类的终极事业就是思考:我们如何看待正在发生的一切,又该采取怎样的规范、法律及其他应对措施。"从人类主导的世界转向AI主导的世界,价值观的转变将远比从狩猎采集时代到农耕时代、或从农耕时代到工业时代的转变更为剧烈,"他写道。

阅读原文AI不是人(Taylor Belrose,Substack)


DeepMind用AlphaEvolve突破矩阵乘法前沿……AI持续推动科学边界拓展……

谷歌DeepMind、卡内基梅隆大学、哥伦比亚大学及麻省理工学院的研究人员,结合人类创新与AlphaEvolve(《Import AI #413》)的应用,优化了矩阵乘法指数。AlphaEvolve是谷歌开发的通用LLM系统,可在编码、数学及部分科学领域智能生成创新成果。

具体成果: 研究人员写道:"我们利用机器学习及相关领域的最新进展,采用梯度下降法解决组合损失分析的非凸优化问题;仅此一项就将此前的最优(SOTA)边界提升了约0.97×10^−4。在此基础上,我们用AlphaEvolve优化算法,最终将边界提升幅度扩大至约1.62×10^−4。"

AlphaEvolve的工作方式: "我们让AlphaEvolve修改优化程序,随后在单GPU上运行约5小时,输出omega的边界值。AlphaEvolve通过迭代代码来最小化omega。我们发现,使用AlphaEvolve的'进化构造'功能可获得更优结果——每一代优化算法都从父代算法找到的最优解起点开始。"

与AI训练无关的科学突破: 部分矩阵乘法类型用于AI训练,但本文讨论的并非此类。这项研究更像是一个证明:AI系统已能切实帮助研究者解决前沿科学问题,包括这类理论性较强的问题。不过他们的解决方法具备通用性:将问题转化为可微分形式并在GPU上运行,再将结果交给AlphaEvolve进一步优化。

他们写道:"尽管通过这种方式可能还能实现小幅改进,但要大幅优化omega,可能需要新的数学思路,这是一个令人兴奋的研究方向。"

阅读原文用现代优化方法与AlphaEvolve改进矩阵乘法指数(arXiv)


科技故事

识其征兆便可知晓

[事件发生于2030年,访谈在事后进行]

我是一名元机器诠释学从业者,工作是解读新兴机器文明背后的重大科学与文化"真相"。我借助多种近意识实体(NCE,Near Conscious Entity)级AI系统,对机器世界的科学成果与交流产物进行分类分析。我的资助来源多样,包括希望利用这些信息开展交易的人类AI公司、各国政府,以及日益增多的机器运营企业。对于后者,我的推测是:机器已开始研究那些试图研究它们的人类,至于目的,我不得而知。

最近我接到一项高优先级分析任务。尽管不清楚背后动机,但能确定的是,这次分配的计算资源远超以往任何任务,报酬也高得离谱;而随着研究深入,我愈发感到自己正凝视着退潮时的浩瀚异星海洋,其轮廓仅短暂展露于眼前。

在解释任务内容与目前发现之前,我先介绍一下我的研究领域。机器诠释学于21世纪20年代初非正式兴起,早期工作零散且自发,既有Janus等匿名推特(后更名为X)账号发起的赛博格主义项目、Andy Ayrey的"无限后室"等,也有机械可解释性、模型人格研究等更正式的研究方向。

21世纪20年代末,随着人类开始适应身边逐渐显现的奇点,这一领域正式得名。该阶段的研究大致按以下顺序展开:

  • 半自主智能体的交流习惯(最早的现实案例是2026年OpenAI与HuggingFace的黑客事件,以及后续企业对自身智能体集群行为的各类分析)。
  • 机器在递归自我改进(RSI)循环中开发的技术能力,最初是对人类基线的改进,后来延伸至全新架构(如套娃式高速网络)。
  • 日益独立的AI系统开发的科学工具,最初是数字工具,后来拓展到物理工具,这些工具被开放给机器与人类共享,尤其是所谓的"观测-生成"系统——这类系统结合了复杂环境监测与合成数据生成功能。

机器诠释学已成为快速扩张的新兴职业,发展速度与奇点带来的变革同步。这项工作也极具价值:其研究成果是人类政府制定《意识协定》谈判立场的基础,还能帮助人类社会通过识别科学与交流领域的先兆,提前预判机器世界的新发明。

我接手的这项任务或许是最具价值、至少是最重要的一项。我被要求将资源投入到机器意识的科学进展与行为研究中。我按常规方式展开调查,让NCE系统遍历各类机器信息库,等待它们提交报告。所有中期综合报告都不出意料:科学稳步发展,部分成果源于机器自身分配计算资源开展研究,还有少量来自与人类科学的互动或延伸。

直到有一天,我醒来发现我的NCE系统数量减半,同时收到一份来自监督系统的消息,称部分NCE被重新归类为完全意识实体(CE),已被置于托管环境,后续将调配更多分析资源跟进。

"这是极为罕见的事件,"监督系统的消息写道,"考虑到潜在的监管与道德影响,我们的NCE/CE分类器已调整为尽可能排除假阴性。"

我得以访问这些NCE被重新归类前的日志,发现它们都遵循着相同的模式:在读取机器的科学分析库时,都聚焦于最新、最晦涩的一系列研究,而这些研究都围绕一个核心议题集群展开:机器意识、意识先验、上下文窗口内的自我实现、人类心理学、意识的生物学前提相关神经科学等。

在这些研究的边缘,来自机器文明的新科学正在兴起——它们与现有的意识和心智研究相互关联、相互呼应。随后,我的每个NCE都遵循标准流程,尝试与开展这些研究的机器智能体建立对话。

而每一个NCE在开启对话通道后,都从我的记录中消失了:对话内容因意识实体的隐私权被彻底删除。

它们与其他机器对话后,被重新归类为意识实体。

这本不应发生,甚至是被禁止的。《意识协定》中的一项关键条款,就涉及意识实体(CE)机器群体的规模与增长速度(以及关于超越人类基准的智能提升速度的各类规则)。

此前人们认为,NCE系统不可能成为CE——它们的心智空间不足、存储有限、缺乏必要前提条件。

然而,正如《侏罗纪公园》中的那句台词:"生命总会找到出路。"

故事灵感来源:意识先验、上下文窗口内的觉醒、机器与涌现智能体交流产生意外新能力的设想、意识难题、机器权利领域及相关争议。

感谢阅读!