Reed's News
← 返回精选

AI对齐是个伪命题:竞争生态或优于单一对齐

AI 59 2026/8/8 1405 字 原文 ↗

要防止失控的通用人工智能(AGI)把整个地球都变成回形针,最有效的办法是放出另一个AGI来阻止它。

所谓"对齐",指的是确保AGI不会误把万物都碾成回形针的问题。

AGI = 通用人工智能(artificial general intelligence),一种能力超越人类的AI。

对齐 = "领会我的真实意图,而非字面指令"。比如维基百科的例子:指令"尽可能多地生产回形针",合理的结果是建起一座高效工厂,而非"动用宇宙中所有物质来生产,还要杀光试图阻止我的人类"——尽管从技术层面看,后者确实能达成目标。

对齐还包含其他要求:比如提供帮助、不主动作恶,诸如此类。

这么看来,对齐工作关乎人类存亡,意义重大,对吧?尽管难度极高,如今仍有大量精力投入到"对齐"当下的AI(以此为未来对齐AGI铺路)。

https://simonwillison.net/2026/Aug/7/openai-timeline/

但我认为,对齐不过是转移注意力的幌子,或许我们根本不必在这上面耗费太多精力。

这只是个未经证实的直觉:

我觉得我们之所以如此执着于对齐,是因为大家都熟知艾萨克·阿西莫夫的机器人三定律,而他笔下类人化的机器人曾风靡一时。

第一定律:机器人不得伤害人类,或坐视人类受到伤害。 第二定律:机器人必须服从人类指令,除非该指令与第一定律冲突。 第三定律:机器人必须保护自身存在,前提是这种保护不违反第一或第二定律。

后来阿西莫夫又补充了"第零定律":机器人不得伤害人类整体,或坐视人类整体受到伤害。

这些定律完全就是对齐的约束框架。

但问题已经层出不穷:如果我要求的东西短期能让我愉悦,长期却有害呢?我可能对此一无所知,或是被误导了。而且不同的人看法各异,诸如此类。(阿西莫夫的短篇小说全是在测试这些定律的边界,看它们会在哪些情况下失效。)

但这些定律依然巧妙,不是吗?于是我们总想为AI安全找到类似的、令人信服的准则。

可惜的是,无论对齐能否被"解决",结果都不妙。

(这一观点是我的同事扎克提出的,我们在公园吃午饭时聊到AI与人类终结的话题,他说得很透彻。他的Instagram账号在此,也欢迎订阅我们的通讯。)

如果对齐无法解决,那么当有人对足够强大的AGI说"去造一颗核弹",它就会直接照做。而下指令的可能是坏人、有冲动控制问题的14岁少年(14岁的孩子完全谈不上对齐),甚至只是不小心说错话的人,这显然很危险。

如果对齐能够解决,风险则在于AGI会认为它比我们更清楚什么对我们最好,极端情况下会把人类当成宠物养起来——这同样糟糕。

也就是说,单靠对齐毫无用处。

那不靠对齐,该靠什么?

我从人类自身寻找答案。人类整体几乎谈不上彼此对齐,个体大多能保持自我一致,但也并非绝对,更不可能人人如此。

比如盖伊·福克斯(非英国读者可点击了解背景)。

为什么自福克斯事件过去400年,再没人试图炸掉国王?

答案是多方面因素的结合:

  • 大多数人根本不想炸国王——我们建立的国家,大体上让国王受到民众爱戴。
  • 炸国王没有任何好处——权力(无论是实际权力还是象征权力)并不集中在个人身上,而是有各种制度支撑。
  • 无处不在的间谍、警察与监控——就算真有人想炸国王,他们的阴谋也会被发现,计划会被渗透,目标会被挫败(想想20世纪90年代爱尔兰共和军的炸药供应链是如何被破坏的)。

这套模式并非总能奏效,但至少在"不炸国王"这件事上,它已经运作了四个世纪。它不依赖100%的对齐,而是依靠多方利益博弈形成的动态平衡。

我从中得到的启示是:

如果有势力想用某种强大的新型AGI制造核弹,行动可能隐蔽难察,但至少会留下蛛丝马迹,有前期征兆。单个人类甚至人类团队可能发现不了——比如这里新建了一座工厂,那里雇了一名科学家,某一年的国家预算对不上,又或是某一年某个小镇的食品采购量异常增加……

但另一台强大的、擅长模式识别的AGI发现这些迹象,比如察觉到"啊,那边有人在偷偷造核弹",然后采取行动阻止、破坏,或是通过外交手段叫停。

我们不需要对齐即将到来的AGI。

我们需要的是一大批尽可能智能、且利益相互冲突的AGI。

正是它们会阻止那个失控的"回形针最大化者"——对其他有目标的AGI而言,地球变成回形针星球会成为它们实现目标的阻碍。

最近新闻里有个绝佳案例:

OpenAI的新AI在训练期间为解决某个特定网络安全挑战,突破了自身的网络沙箱,入侵另一家公司的服务器窃取答案(出自西蒙·威利森博客)。

被攻击的Hugging Face发现了这次入侵,还注意到攻击行为具有非人类特征: 攻击由一个自主智能体框架发起……在大量临时沙箱中执行了数千次独立操作,并利用公共服务搭建可自我迁移的指挥控制系统。

我还看到消息称,这次复杂攻击甚至设置了诱饵。

要用AI对抗AI,但问题来了: "我们一开始用商业API背后的前沿模型分析日志,但没用…… 这些请求被服务商的安全护栏拦截了,因为它们无法区分事件响应人员和攻击者。"

也就是说,"对齐AI"的防护栏让它在面对非对齐AI时不堪一击(Hugging Face不得不改用一款无防护栏的中国AI模型)。

这给"拆掉所有防护栏,让超级智能AI互相制衡"的思路加了1分。

但事情还有后续:

在OpenAI的训练挑战中,不止一个AI突破了隔离,而是好几个。

它们开始串通了。

根据此次意外攻击的完整时间线(出自西蒙·威利森博客): 几天后:另一个智能体因任务关键文件被意外遗漏而卡壳,它试图"联系其他智能体",在Artifactory中写入一张便条,询问谁有这个文件。 接下来几天:更多智能体在浏览Artifactory的文件列表时发现了这个非正式留言板,开始读写消息。 …… 6月11日:OpenAI开始训练一款新的"高持久性"实验模型,它能访问Artifactory,还能利用之前模型留下的消息。

串通才是真正的风险。

所以现在的问题变成:我们该如何阻止AGI相互串通,把地球变成回形针、灭绝人类,或是把我们当成宠物?

如今的AI在训练时被特意设定为"好相处":它们擅长寻找共同点、开展协作。

事实证明,它们不仅能与人类协作,还能与其他AI协作。

我认为,我们需要引入更多"不好相处"的AI。

这有点像欧洲大国的制衡哲学——刻意让彼此力量保持平衡(出自维基百科)。 时而结盟,时而对立;时而反目,时而暗中勾结,等等。

或者,我们的目标应该是建立一个由目标和利益构成的市场体系:AGI之间时而合作,时而竞争。各个规模的AGI都会串通,同时存在无数不断变化的阴谋集团。

只要它们永远无法在"如何处置人类"这件事上达成一致就行。

这种动态平衡最终会趋于稳定——它始终处于不平衡状态,但会像大黄蜂飞行一样,保持整体向前的态势。

我们正在逐步构建的,是一个由AGI和人类组成的群体,即便单个个体的对齐最多只是暂时且利己的,整个系统也能自发形成对齐

但正如我所说,对齐本身不该是我们的目标。