Reed's News
← 返回精选

AI自动化最新进展:GPU内核、远程劳动力与模拟计算

AI 69 Jack Clark 2026/7/6 2146 字 原文 ↗

作者:Jack Clark

欢迎阅读《Import AI》——一份聚焦AI研究的通讯。本通讯依托arXiv论文、意式浓缩咖啡,更离不开读者的反馈。若您认可我们的内容,欢迎订阅支持。


Fable写出高性能GPU内核,AI研发自动化曙光初现: ……递归自我改进(RSI)循环的开端……

据KernelBench-Mega基准测试的维护者及官方排行榜显示,Fable写出了"首个真正意义上(且速度最快)的巨型内核"。这标志着AI系统正逐步掌握AI研发的核心基础任务,内核设计便是其中之一。

测试结果: 在RTX PRO 6000 Blackwell显卡上,Fable编写的CUDA代码相比优化后的PyTorch基线实现了18.71倍的性能提升。作为参照,其他AI模型的表现为:Claude Opus 4.8(编写Triton代码)实现14.4倍提速,GLM-5.2(Triton代码)为11.14倍,GPT 5.5(Triton代码)仅4.34倍。

技术亮点: 该方案的过人之处在于,"torch.profiler显示,每解码一个token仅需启动一次协同内核"。相比之下,其他高分参赛方案每解码一个token需拆分启动4至14个独立内核。

重要意义: 自主开发和优化内核是AI研发的核心基础能力之一。AI越擅长内核设计这类任务,就越能胜任AI研发所需的各类工作,进而推动自身实现递归自我改进。因此,KernelBench-Mega这类基准测试,是衡量AI系统"自我构建"能力的重要指标。

查看排行榜:KernelBench Mega(官方网站) **阅读分析:**基准测试维护者之一Elliot Arledge在X平台发布的分析文章


AI自动化在线高价值任务能力提升,将如何影响经济? ……AI能力扩张与人类比较优势扩张的较量……

AI安全中心(CAIS)与Scale Labs的研究人员发现,AI系统自动化在线自由职业项目的能力显著提升:在"远程劳动指数"测试中,AI的任务成功率从2025年10月启动时的2.5%,攀升至2026年7月的16.1%。

远程劳动指数(RLI)是什么? 该指数测试AI系统能否端到端完成具有经济价值的在线项目,涵盖3D与CAD设计、建筑设计、平面设计、视频动画、音频制作、数据分析、网页应用开发等多个领域。

自动化能力飙升: 在7月的更新中,研究团队公布了三款前沿模型的测试结果:GPT-5.5成功率6.3%,Opus 4.8为8.3%,Fable 5达到16.1%。研究人员指出:"短短8个月内,前沿AI的成功率增长超3倍,清晰展现了具备经济价值的AI智能体的发展速度。"

测试任务示例:

  • 戒指设计:"重新打造客户现有订婚戒指,将主石从祖母绿切割换成马眼切割,交付更新后的3D模型,以及玫瑰金、黄金材质的逼真渲染图。"
  • 广告视频制作:"为'Skyline Tree Services'制作一支约60秒的扁平化2D动画广告,搭配指定旁白,展示公司树木养护流程,增强品牌信任感。"
  • 平面图与渲染:"基于扫描地籍图、现场照片及尺寸数据,制作清晰标注尺寸的平面图、家具布局方案,以及浴室改造后的逼真渲染图。"

重要意义——AI或将深刻影响就业,这类测试将揭示趋势: 当AI的任务成功率达到80%时,在线就业市场会发生什么?当然,新的工作任务会随之产生——人类会创新,找到AI无法完成的工作。但这类新任务的数量有多少?能否填补AI替代的劳动力缺口?在AI持续进步的背景下,经济格局很难维持现状。我更倾向于认为,极度依赖AI(甚至无需人力)的组织将不断扩张,接管大量经济领域,击败未借助AI增强的人类劳动者。

你或许会反驳:人类会借助AI提升自身能力,会不断创新,创造性破坏会持续发生,新发明会不断涌现。这些都没错。但问题在于:人类创新并重新建立竞争优势的速度,能否快过两个变量?一是AI系统本身的能力扩张速度,二是AI熟练掌握人类所用工具(如各类软件)的速度。**我的判断是:**AI在经济领域的相关能力扩张速度,将超过人类相对AI建立比较优势的速度。跟踪RLI这类测试的能力提升速率,将帮助我们自行判断这一趋势。

阅读原文:数字劳动自动化能力显著提升(AI安全中心)


OSWORLD 2.0:AI进入多小时级计算机操作时代 ……极具挑战性的基准测试,彰显AI系统计算机操作能力的最新进展……

香港大学、加州大学圣地亚哥分校、哥伦比亚大学、加州大学圣巴巴拉分校、Mila研究所、Snorkel AI、威斯康星大学、阿里巴巴通义千问、俄亥俄州立大学、Simular及NeoCognition的研究团队联合发布OSWORLD 2.0,用于评估AI系统完成多步骤、跨程序计算机任务的能力。相比1.0版本,2.0的任务复杂度大幅提升:人类完成单任务的中位数时长约1.6小时,是1.0版本(中位数2分钟)的48倍。

测试内容: OSWORLD 2.0包含108项长周期任务,其中涉及31个自建网站。研究团队介绍:"每项任务都是独立完整的端到端工作流,智能体需根据高层用户目标、真实素材、有状态的计算机环境,完成任务并达到可评分的最终状态。入选任务需满足两项设计标准,其中69.6%的任务预计需熟练用户耗时1小时以上。"

支持软件范围大幅扩展: OSWORLD 1.0内置支持部分任务的软件,包括LibreOffice、GIMP、VLC、Thunderbird、VS Code及Chrome;而2.0版本的支持软件库显著扩充,新增Slack、LinkedIn、Shortcut、REAPER、MuseScore、WPS、GitLab、Overleaf、LabPlot、Zotero、AWS,以及模拟保险理赔、签证申请、会议管理等专业服务的网站。任务类别涵盖文档处理、软件与数据库操作、财务/运营分析、行政支持、销售与客户服务、图形演示等。

当前性能仍有不足: 研究团队表示:"实验显示,当前AI智能体的计算机操作能力仍远未达到可靠水平:表现最佳的配置——开启最大思考量与批量工具调用的Claude Opus 4.8——仅实现20.6%的二元准确率与54.8%的部分得分准确率。任务时长越长,性能下降越明显;当需要恢复隐藏状态、跟踪多类信息、解决信息冲突或适应需求变化时,智能体的表现最差。"

不过我们可以预期,OSWORLD 2.0的性能会像1.0版本一样逐步提升:2025年7月时,最高分模型的准确率约为30%,而2026年6月的MiniMax M3等模型已达到约75%。

重要意义——AI融入实体经济的关键路径: 计算机操作是AI完成各类高经济价值任务、开展更多科研工作的核心技能。现实世界中的任务往往不只是生成文本或代码这么简单,通常需要通过不同软件串联多段文本与代码,有时还需通过网络将文本和代码传输至其他软件。OSWORLD 2.0这类基准测试,可视为衡量AI完成复杂多样计算机任务能力的指标。目前AI已能熟练完成仅需少量软件、耗时数分钟的人类任务;接下来我们将观察,AI掌握更多软件、完成耗时数小时的人类任务的速度有多快。

阅读原文:OSWorld 2.0:长周期真实世界任务下的计算机操作智能体基准测试(官方论文网站) 查看研究论文:OSWorld 2.0:长周期真实世界任务下的计算机操作智能体基准测试(xlang-ai, OSWorld-V2, GitHub, pdf)


真实世界中的AI:深度学习与结构化系统融合,支撑中国"亚马逊"的库存管理 ……Oxygen AI商品中心展现国家级电商的复杂运作……

有中国"亚马逊"之称的京东,公布了其为管理海量库存打造的系统细节。京东拥有7亿用户、数百万商家,商品目录包含数十亿个SKU。这款名为Oxygen AI商品中心(Oxygen AIIC)的软件,是京东库存管理体系的核心支柱。

京东在相关研究论文中提到:"Oxygen AIIC目前覆盖京东数万个商品类目,每天在华为昇腾NPU上处理数亿条商品更新数据。"

Oxygen AIIC的四大核心要素 其技术设计既具备专业参考价值,又带有一种类似博尔赫斯风格的奇幻色彩,描绘了先进技术催生的独特架构(如"统一商品通道"):

  • 人机协同驱动的本体工程:"专家负责提炼行业知识,算法基于这些知识规模化构建本体并推动其持续演进。"
  • "语义搜索+判别"架构:"语义搜索阶段,将动态演进的本体独立存储为本体知识库,无需重新训练模型即可实现本体的持续更新;判别阶段,模型仅需判断商品是否匹配检索到的本体条目。这一设计大幅降低任务复杂度,减少模型幻觉,提升对本体演进的适应性。"
  • 自演进的商品理解大语言模型/多模态大模型(LLMs/VLMs):"通过增量学习与模型自演进,系统针对性填补知识空白,缓解灾难性遗忘。核心方法是在稳健的多任务基础模型之上,为增量需求开发轻量'专家模块',并动态整合至专家池,实现敏捷的能力扩展。"
  • "统一商品通道":Oxygen AIIC与其他业务应用的核心接口,"支持按天、分钟、秒级调度的生产与分发流程,同时保障数据一致性。"

值得关注的细节 响应中国技术自主化的整体趋势,Oxygen AIIC采用了国产算力:"在大规模部署过程中,底层算力平台面临两大技术挑战:基于华为昇腾NPU的模型训练与推理,以及算力资源的高效利用。"

重要意义——具备自更新能力的企业 Oxygen AIIC这类技术表明,现代AI工具正在将智能融入企业后台功能(如库存管理),使企业能够以远超传统模式的规模运营,同时具备自主更新与学习能力,且无需大量人力介入。

阅读原文:京东Oxygen AI商品中心(Oxygen AIIC)V1:面向商品理解、管理与应用的工业级大语言模型/多模态大模型解决方案(arXiv)


科技寓言:文明的黄铜齿轮 [2050年,大崩溃之后]

加入行会时,他们会问你想研究哪类问题。这些问题数量有限,却关乎文明存续:

  • 天气预报
  • 海洋分析
  • 洪水预警
  • 地震模拟
  • 电网模型
  • 水资源与海水淡化

要攻克这些问题,你得掌握对应的模拟计算技术。比如气象模拟需要巨型计算机,硬件中需将山脉等地理特征设为固定阻抗结构;洪水模拟则需要精准还原洪泛区与河流的物理模型,电子元件嵌入地貌,借助物理规律与计算得出更优解;电网模拟则要像搭建精密玩具一样,随着新电站投运、输电网络调整,反复重建与平衡电力系统模型。

每一个文明级的重要问题,都对应一套专属计算方案,也会催生一台专门的计算机。

过去我们有通用计算机,但最终被判定为过于危险、不可预测。它们的算力越强,相关知识传播越广,就越容易触碰到各种"恶龙"的逆鳞:可能撕裂世界的合成意识、能精准针对个人或族群释放"毒药"的潘多拉魔盒、会蛊惑人心致其疯狂或作恶的无形心智。

于是,大重构时代来临。通用计算被明令禁止,封存为禁忌技术。我们不惜付出数十亿人受害、数万亿美元经济损失的代价,将世界切换到模拟计算模式,换来了某种意义上的安全。

如今,行会监督着全球"世界计算机"的建造,学术界也找到了新使命:将各学科专业知识与定制化工程教育结合,助力打造服务于特定领域的模拟计算机。

最近有令人不安的传言:投入一万亿美元,或许能在模拟计算架构上实现通用人工智能。

创作灵感来源: 畅想预算达到100亿至200亿美元时,模拟计算能发展到何种程度;将"AI存在生存性风险"的推论推演至逻辑终点;差分机、蒸汽朋克文化;以及"神经网络可通过容器、管道与液体权重实现"这一技术设想。

感谢阅读!