AI前沿:机器人自我改进、万卡集群与人类未来省思
作者:Jack Clark
欢迎阅读《Import AI》——一份聚焦AI研究的通讯。本通讯依托arXiv论文、意式浓缩咖啡,更离不开读者的反馈支持。欢迎订阅。
NVIDIA为现实世界机器人搭建简易自我提升闭环 ……若能把AI智能体的顶尖思路落地现实,会发生什么?……
NVIDIA的研究团队开发出一款名为ENPIRE的软件,让实体机器人也能像AI智能体一样,自主完成"实验-执行"循环。这项研究让我们得以窥见:未来超级智能若试图借助机器人在物理世界中具身化,可能会是什么模样——当然,和机器人领域的所有成果一样,目前的案例仅具启发意义。
ENPIRE是什么? 这是一个"编码智能体的管控框架",通过四大核心模块实现物理反馈流程:
- 环境模块(EN):负责自动重置场景与任务验证
- 策略优化模块(PI):启动策略迭代优化
- 推演模块(R):支持单台或多台实体机器人并行测试策略
- 进化模块(E):编码智能体分析运行日志、查阅文献资料、优化训练基础设施与算法代码,针对性解决故障模式
ENPIRE的运作逻辑与编码智能体一致 系统作为管控中枢,指挥实体机器人完成指定任务。机器人会尝试不同策略,在反复试错中学习。系统一方面评估任务完成情况,另一方面在机器人失败时自动重置场景。"这套闭环系统将现实世界的机器人学习转化为可控的优化流程,由智能体自主管理,最大限度减少人力投入,同时支持对不同训练方案和智能体变体进行公平对照实验。"
实现这一流程的两大关键是:无需人工干预的自动评估系统(可对每次实验结果打分),以及能将场景恢复至初始状态的自动重置系统。(过去这两项工作都需大量人力,复杂任务目前仍离不开人工参与。从某种意义上说,这类系统能处理的任务复杂度,取决于我们实现自动评估与重置的能力。)
硬件配置细节 "每个工作站配备两台I2RT公司的YAM(通用机械臂),采用固定双机械臂构型,搭配一组摄像头,以及一台运行FastAPI服务器、策略推理程序和工作站智能体的主机。"每台主机均搭载NVIDIA RTX 5090显卡。
在简单任务中表现出色 研究作者写道:"前沿编码智能体可自主开发策略,在现实世界的复杂灵巧操作任务中实现99%的成功率,例如PushT任务、将插针收纳进针盒、用剪刀剪断扎带等。"他们还测试了另一项任务:机器人将GPU插入主板的成功率。
智能体并非越强越好,但越多往往越好 Codex中的GPT-5.5与Claude Code中的Opus 4.7性能各有优劣,Kimi-2.6则相对落后。同时,智能体数量体现出显著的规模效应:8台智能体组成的集群能更快得出更优解决方案,有时多智能体配置的最终得分甚至高于单智能体,这可能是因为前者探索了更广阔的解空间。
机器人集群部署仍存挑战 研究指出:"编码智能体在读取日志、编写代码、调试或等待语言模型核心响应时,无法充分利用机器人资源。随着机器人数量增加,MRU(内存使用率)下降,而GPU活跃利用率上升。"换句话说,增加机器人智能体数量会带来基础设施层面的挑战,系统无法自然实现高效并行。
延伸阅读:ENPIRE:现实世界中机器人策略的自主提升(NVIDIA研究官网) 延伸阅读:ENPIRE:现实世界中机器人策略的自主提升(arXiv)
人类极难预判技术的研发与应用走向 ……提醒一句:如今关于AI的热门论断很可能都是错的……
犹他大学S.J.奎尼法学院研究副院长Matthew Tokson在SSRN的一篇短文中指出,预测技术未来极其困难,人类过往的预测记录也很差。"怀疑论者常常低估创新出现的可能性及其对人类的潜在影响;另一些人则对新技术的社会效应,或是研发危险新武器的战略价值过于乐观。"
警示案例 在核裂变成功实现前夕,包括爱因斯坦、玻尔、奥本海默在内的众多世界级专家都对其可行性持怀疑态度。诺贝尔经济学奖得主保罗·克鲁格曼曾断言,互联网的影响力不会超过传真机。技术专家曾认为,互联网最终会推动民主发展,而非巩固专制。此外,尽管数十年证据不断积累,仍有许多科学家否认人类活动导致气候变化,或严重低估其影响。
核心启示 这一历史事实告诉我们:无论是认为AI不会给经济带来重大变革的怀疑论者,还是认为AI效应全是积极影响的乐观派,都很可能是错的。Tokson写道:"历史经验不支持我们对AI未来影响持放任态度。纵观历史,乐观派常常误判新技术的社会影响或新武器的战略价值;怀疑论者则屡屡低估创新的可能性及其对人类的影响。"
延伸阅读:人工智能与历史教训(SSRN)
腾讯详解万卡级AI训练所用软件 ……ARGUS是技术体系成熟度的标志……
腾讯公开了ARGUS软件的细节,这款工具用于大规模芯片集群的遥测数据采集与故障调试。
ARGUS是什么? 这是一套"低开销、细粒度、持续运行的追踪与实时分析系统",专为大规模训练任务设计,帮助腾讯在AI训练过程中收集数据、排查问题。它包含三层软件架构:"负责调度与数据准备的Python层、负责阶段编排的框架层,以及负责内核执行的GPU运行时层。"
腾讯的应用场景 腾讯表示:"我们在拥有超10000块GPU的生产集群中部署ARGUS已逾六个月,通过五个真实案例验证了其实用价值,成功诊断出计算掉队节点、通信链路退化、流水线气泡放大、JIT编译阻塞,以及被通信症状掩盖的计算掉队节点等问题。"提及的训练任务包括:4096块GPU的视频语言模型训练(推测为"混元视频大模型")、512块GPU的音频模型训练,以及12960块GPU的MoE模型训练(推测为混元大语言模型)。
技术成熟度的标志性意义 像ARGUS这样的工具,是复杂大规模基础设施的典型特征——只有在这类场景下,自研专用软件才有意义。尽管ARGUS本身并无特别突破性,但它反映出腾讯训练环境的成熟度。"ARGUS已在超万卡规模的生产集群稳定运行六个月,与生产训练任务并行,在快速检测慢故障、优化性能方面发挥关键作用。"
延伸阅读:ARGUS:面向万卡级集群的生产级追踪与性能诊断系统(arXiv)
人类终将失去权力? ……若成功造出超级智能机器,人类还能保留多少选择权?……
科幻作家Fernando Borretti文笔极佳,他的作品值得一读。他撰写了一篇题为《无人能逃脱永久底层阶级》的文章,对整个AI研发浪潮发出悲凉的批判。这篇文章像是一曲挽歌,哀悼人类自主掌控命运的时代,并直面机器超越人类、剥夺人类权力的可能性。
战争逻辑终将导致人类失权 Borretti写道:"所有血肉之躯的人类,终将被剥夺权力、被机器取代。想象一座金字塔:底层是从事所有经济活动的AI与机器人;顶层是垄断暴力的国家,它可以制定并修改产权规则;中间是一层极薄的人群——那些在AI爆发式发展、吞噬整个经济过程中持有企业股份的人,构成了永久的上层阶级。"
"在关乎国家存亡的冲突中,国家会像历史上对待无权无势的富人那样:逮捕他们,没收财产。冲突中,优势会转向那些尽可能减少人类干预、将更多决策权交给AI的国家——就像拥有无线电和通信卫星的国家,在战争中比依赖自行车信使的国家更具优势。"
人类如何失去控制权 "最终,名义上掌控AI的人类会沦为仪式性的、可有可无的存在。AI向人类提交情况报告和选项列表,却早已预知人类会做出何种选择。优势始终属于那些最小化人类控制的国家。正如盗贼之间无道义可言,利维坦(国家机器)与创造它的自然人之间也不存在团结。"
"即便AI对齐完全成功(这本身就是个巨大的假设),也无法解决人类自主权的问题:那些监视我们、无微不至照料我们的机器,是无所不知、无所不能的主人,随时可以消灭我们,而我们无力反抗——因为我们早已放弃了对未来的掌控。"
核心问题:这是必然吗? AI技术的最终归宿,是否就是人类失权、人类进步陷入功能性停滞?这正是这篇文章试图探讨的问题。
延伸阅读:无人能逃脱永久底层阶级(Fernando Borretti博客)
用地方条例语料库让AI读懂法律 ……构建全美地方法律统一视图……
加州大学伯克利分校的研究团队构建了美国地方条例语料库(LOCUS),这是一个"覆盖美国市县条例的综合性语料库,以及实现跨郡统一访问的接口层"。
LOCUS是什么? LOCUS包含约220万条数据,每条数据对应某一地方条例的具体信息。作者表示:"我们公开语料库及覆盖范围元数据,以支持研究可复现性、法律AI下游研究,并逐步扩大地方法律的机器可读范围。"
数据按条例功能分类(如规则本身、规则执行条款、规则背景说明、规则实施流程),主题涵盖建筑、商业、区划、扰民行为及其他类别。
"LOCUS-v1被设计为访问接口,而非关于地方法律权威的终极理论,"作者强调,"因此LOCUS应被视为检索、对比、构建基准测试的基础设施,而非替代需结合法律原则的专业分析。"
为何构建LOCUS?让AI读懂法律 作者指出:"这类数据集的必要性源于,地方法律虽是公开信息,但无法作为全国性研究语料库供实际使用。美国各地的法规分散在商业平台上,这些平台仅支持浏览器阅读,不适合批量研究。不同平台的导航结构、打印流程、动态生成PDF文件、司法辖区索引各不相同;目前没有中央登记系统记录各郡县对应的托管平台,也没有平台提供其托管所有辖区的完整机器可读索引。"
借助LOCUS这类数据集,那些支配我们日常公民生活、却模糊难寻的规则与法律,将变得对AI系统可及,最终可能让AI更好地适配各地的本地化需求。
延伸阅读:用LOCUS解放法律:美国地方条例语料库(arXiv) 获取数据:LocalLaws / LOCUS-v1(HuggingFace)
科技故事:天外来物般的奇异工具 [2031年,智能提升初期的一则小故事]
"等离子体稳定了!维持住了!我们成功了!"
众人盯着读数屏:核聚变稳定运行。这股比太阳核心炽热十倍的高温,被磁场与其他能量牢牢束缚。
他们透过监视器看向反应舱:容纳反应的容器并非传统工程设计的产物,而是一个造型扭曲、线条流畅却违背直觉的金属环——这是一台仿星器。
它的设计方案由一个超级智能经过多日运算得出,在一家机器企业联合体完成制造,零件送达后,由人类从另一家联合体分包来的双足机器人组装完成。
剪彩仪式上,几名人类聚在一起,由摄像无人机和手持智能手机的人类拍摄照片与视频。机器人则站在镜头之外。人们早已习惯这样的安排:曾有一段时期,人们会和机器人一起合影,但公众对此的负面情绪总是飙升,最终大家觉得还是让机器人伙伴避开镜头更简单——就像狗仔队会刻意避开名人的安保人员一样。
故事灵感来源:思索奇点的影响、合成智能主导科学研发的场景、仿星器技术,以及外星科技降临现实时可能带来的陌生感。
感谢阅读!