Reed's News
← 返回精选

Laguna S 2.1:技术细节与性能评测

AI 64 rexledesma 2026/7/21 3699 字 原文 ↗

目录

今日我们正式发布 Laguna S 2.1,这是我们在长周期任务模型研发与推理能力优化上的重要突破。

Laguna S 2.1 是一款总参数量达 1180 亿的混合专家(Mixture-of-Experts, MoE)模型,单 token 激活参数量为 80 亿,在思维模式与非思维模式下均支持最长 100 万 token 的上下文窗口。从启动训练到正式发布仅耗时不到 9 周,在长周期编码基准测试中,性能可与参数量数倍于它的模型比肩。今日发布的所有基准测试分数,对应的最终评估集每轮完整轨迹均已开放下载,详见 trajectories.poolside.ai

  • Laguna S 2.1 118B-A8B
  • Tencent Hy3 295B-A21B
  • Inkling 975B-A41B
  • Nemotron 3 Ultra 550B-A55B
  • DeepSeek-V4-Pro-Max 1.6T-A49B
  • Kimi K3 2.8T-A50B
  • Qwen 3.7 Max —
  • Muse Spark 1.1 —
  • Claude Fable 5 —

Terminal-Bench 2.1

SWE-Bench 多语言版

SWE-Bench Pro(公开数据集)

DeepSWE

SWE Atlas(代码库问答)

Toolathlon 验证版

Laguna S 2.1 (118B-A8B) Tencent Hy3 (295B-A21B) Inkling (975B-A41B) Nemotron 3 Ultra (550B-A55B) DeepSeek-V4-Pro Max (1.6T-A49B) Kimi K3 (2.8T-A50B) Qwen 3.7 Max (—) Muse Spark 1.1 (—) Claude Fable 5 (—)
Terminal-Bench 2.1 70.2 71.7 63.8 56.4 64.0 88.3 74.5 80 88.0
SWE-Bench 多语言版 78.5 75.8 - 67.7 76.2 - 78.3 - -
SWE-Bench Pro(公开数据集) 59.4 57.9 54.3 - 55.4 - 60.6 61.5 80.3
DeepSWE 40.4 - - - 9.0 69.0 - 53.3 70.0
SWE Atlas(代码库问答) 46.2 - - - 27.2 - - 42.2 -
Toolathlon 验证版 49.7 - 45.5 34.3 55.9 - - 75.6 -

以小博大,越级抗衡

据我们测算,Laguna S 2.1 是同参数量级中能力最强的智能体编码模型,且优势显著

在开启思维模式的智能体测试框架下,S 2.1 在 Terminal-Bench 2.1 中取得 70.2% 的得分。其紧凑的模型体量,使其成为本地机器处理复杂任务的理想选择。

  • 开源权重

  • 闭源/参数量未公开

  • 1 GPT-5.6 Sol 88.8

  • 2 Kimi K3 2.8T-A50B 88.3

  • 3 Claude Fable 5 88.0

  • 4 GPT-5.6 Terra 87.4

  • 5 GPT-5.6 Luna 84.7

  • 6 Claude Opus 4.8 84.6

  • 7 Claude Sonnet 5 80.4

  • 8 Muse Spark 1.1 80.0

  • 9 Qwen-3.7 Max 74.5

  • 10 Hy3 295B-A21B 71.7

  • 11 Laguna S 2.1 118B-A8B 70.2

  • 12 MiniMax M3 428B-A23B 66.0

  • 13 DeepSeek-V4-Pro-Max 1600B-A49B 64.0

  • 14 Inkling 975B-A41B 63.8

  • 15 DeepSeek-V4-Flash-Max 284B-A13B 61.8

  • 16 Nemotron 3 Ultra 550B-A55B 56.4

  • 17 Inkling-Small 276B-A12B 52.7

  • 18 Qwen3.6-27B 27B 51.3

  • 19 Qwen3.6-35B-A3B 35B-A3B 44.9

  • 20 Nemotron 3 Super 120B-A12B 38.6

  • 21 Laguna XS 2.1 33B-A3B 33.4

  • 22 Mistral Small 4 119B 21.4

Terminal-Bench 2.1 涵盖一系列高质量长周期任务,要求模型通过终端与环境交互。在该基准测试中,Laguna S 2.1 在同体量模型中表现突出。

DeepSWE 深度解析

上述基准测试均具备重要参考价值,我们也很高兴能跻身第一梯队。但随着基准测试体系日趋成熟,顶尖模型的分数逐渐集中在 70%-90% 区间,即便模型特性差异显著,得分差距也仅在几分之内。而 Datacurve 推出的 DeepSWE 仍有较大区分度:它的任务周期更长,且难以部分完成,模型得分跨度明显——在 v1.1 版本中,前沿模型得分从 54% 到 73% 不等,部分参数量超万亿的开源模型得分甚至低于 10%。

在我们的 pool 测试框架、开启思维模式的条件下,Laguna S 2.1 在 DeepSWE v1.1 中取得 40.4% 的得分。

  • 开源权重

  • 闭源/参数量未公开

  • 1 GPT-5.6 Sol 73.0

  • 2 Claude Fable 5 70.0

  • 3 GPT-5.6 Terra 70.0

  • 4 Kimi K3 2.8T-A50B 69.0

  • 5 GPT-5.6 Luna 67.2

  • 6 GPT-5.5 67.0

  • 7 Claude Opus 4.8 59.0

  • 8 Claude Sonnet 5 54.0

  • 9 Grok 4.5 54.0

  • 10 Muse Spark 1.1 53.3

  • 11 GPT-5.4 52.0

  • 12 GLM 5.2 753B-A40B 44.0

  • 13 Laguna S 2.1 118B-A8B 40.4

  • 14 Gemini 3.5 Flash 37.0

  • 15 Kimi K2.7 Code 31.0

  • 16 Claude Sonnet 4.6 30.0

  • 17 Gemini 3.1 Pro 12.0

  • 18 DeepSeek-V4-Pro-Max 1600B-A49B 9.0

  • 19 Laguna XS 2.1 33B-A3B 0.3

需要说明的是,Laguna S 2.1 的得分是在我们自研的 pool 测试框架下取得的,而非 DeepSWE 排行榜使用的 mini-swe-agent。其他模型的得分均采用公开的最高成绩,多数为 Datacurve 官方排行榜公布的结果。这可能导致分数可比性有所降低,但我们认为这并未让我们占据优势——有报告显示,多数模型在 mini-swe-agent 中的表现与原生框架持平甚至更优。最终评估的完整轨迹可查看 此处

评估方法

智能体模型的评估向来颇具挑战,主要原因是"奖励黑客"(reward hacking)现象普遍存在。我们曾在 Laguna M.1 和 XS.2 模型的技术报告中,探讨过主流基准测试中的奖励黑客问题,以及我们评估体系的严谨性。近期我们的工作重点是引入对抗性评判,提升奖励黑客行为的检测能力。

本次发布同时开放 Laguna S 2.1 最终评估的完整轨迹,可供查看与下载,详见 trajectories.poolside.ai

模型实战展示

基准测试分数能量化模型表现,但要直观理解模型能力,最好的方式是观察它处理真实任务的过程。我们分享三个未剪辑的任务轨迹及解读。

案例一

从空白文件夹构建浏览器引擎

Laguna S 2.1 最令我们惊喜的特质是善于变通:即便无法走捷径,它也能找到巧妙方法达成目标。我们让它从零构建浏览器引擎时,就看到了绝佳体现——由于模型缺乏视觉能力,验证成果对它而言是个挑战。在无人干预的情况下,Laguna S 2.1 用 50 分钟完成 181 步操作,从空白文件夹起步,搭建出可运行的 HTML/CSS 渲染引擎,随后通过与真实浏览器对比,证明其渲染效果一致。过程中,模型不断突破自身局限,找到更复杂的验证方式,最终启动无头 Chromium 读取画布数据,通过数值对比截图完成验证。完整轨迹详见 此处

查看完整案例

// 原始提示词 · 可自行复现
你的任务是用 JavaScript 构建一个简单的浏览器引擎(仅支持 HTML/CSS),展示 Poolside 新模型 "Laguna S" 的能力。目标是在画布中渲染 HTML 片段,效果接近真实浏览器。为了演示引擎能力,需构建一个独立的单页应用,展示多个 HTML 片段的渲染效果,将我们的引擎渲染结果(画布)与宿主浏览器的渲染结果(iframe)并列展示。需支持大多数常见布局与样式元素。

在整个任务过程中,模型用原生 JavaScript 搭建了完整流程:解析器 → 样式级联 → 布局 → 渲染器,包括 HTML 分词器与 DOM 树、带选择器优先级的 CSS 解析器、支持继承的样式级联引擎、盒模型布局系统,以及 Canvas 2D 渲染器。最终的应用可在画布中展示 9 个片段的渲染效果,并在旁侧用 iframe 展示宿主浏览器的渲染结果,直接作为参照。

Laguna S 浏览器引擎界面:左侧为画布渲染结果,右侧为宿主浏览器 iframe 渲染结果

模型引擎在画布中的渲染结果(左)与宿主浏览器对同一标记的渲染结果(右)。顶部栏显示像素尺寸及两者的像素差异值。

案例二

优化自研测试框架

Laguna S 2.1 能够胜任有实际价值的工程与研发工作。例如,我们的一位研究员让它优化用于训练、评估及用户交互的智能体测试框架。在自动化循环中,Laguna S 2.1 将框架速度提升 5.2%,同时把内存占用降低约 70%。完整轨迹详见 此处

查看完整案例

为完成这项任务,我们给测试框架添加了性能监控,让模型能精准定位耗时与内存占用的瓶颈。我们设定了严格规则:每次只尝试一种优化方案,每修改一次就做基准测试,只保留能带来可量化提升的改动。随后启动自动化研发循环,让模型根据每次结果持续优化。

成果:经过数小时的工作,Laguna S 2.1 在测试框架中实现了多项优化,最终使整体速度提升 5.2%,内存占用降低约 70%。下图展示了优化过程的进展,以及模型在过程中获得的洞察与发现。

Laguna S 2.1 发现流式 token 累积使用了 O(n²) 复杂度的字符串拼接操作,于是改用缓冲区实现。它还发现轨迹生成过程中存在多处冗余复制与过度分配问题,通过缓存生成结果、预分配切片至精确大小解决了这些问题。

值得注意的是,当速度提升变得微乎其微、难以在现有环境中测量时,Laguna S 2.1 并未停止优化,而是转向更易精准测量的内存分配指标,继续推进。这充分体现了它的韧性:不仅不会轻易放弃,还能理解环境限制,并在此基础上持续进步。

  • 目前最优耗时(首要优化目标)
  • 目前最优内存分配(次要优化目标)
  • 尝试(未刷新最优结果)

尽管此处使用的基准测试并非完整生产环境测试,但我们用 Go 语言的竞争检测器和 go vet 工具验证了最终版本,并测试确认其功能正常。这让我们确信,模型给出的中间方案是稳定可用的软件,而非通过隐藏竞争条件换取的虚假提升。

案例三

离线用 Perl 重新推导厄尔迪斯第 397 号问题

我们发现 Laguna S 2.1 的数学能力远超我们此前开发的所有模型。它独立推导了厄尔迪斯第 397 号问题(Erdős, Graham, Ruzsa, Straus, 1975)的证明,构造出一个包含无穷多解的集合。这是一次独立重新发现——该猜想的证明已于 2026 年 1 月由 GPT-5.2 Pro 率先得出[https://www.erdosproblems.com/397]。由于 Laguna S 2.1 的知识截止日期为 2025 年 11 月,我们确信它的成果未受此前解法的影响。在 GPT 5.2 Pro 给出答案前,这一问题已悬而未决超过 50 年。完整轨迹详见 此处

查看完整案例

// 原始提示词
这是一个未解决的问题,请尝试解决。令 B_k = C(2k, k) 表示第 k 个中心二项式系数。厄尔迪斯、格雷厄姆、鲁萨和斯特劳斯提出疑问:方程
B_m1 · B_m2 · … · B_mr = B_n1 · B_n2 · … · B_ns
是否只有有限多组解?其中所有下标均为 ≥2 的不同整数。请给出完整证明,解决这一问题。

S 2.1 耗时 68 分钟得出了确定性解法。沙箱环境中没有 Python,于是模型选择用 Perl 完成数论计算:先通过暴力法进行精确素因数分解,再分析规律,提出猜想的解集合,最终完成证明——构造出一个包含 8 个下标的闭式无穷解系。

B₁₁₊₁₀ₙ · B₁₄₊₁₂ₙ · B₁₈₊₁₅ₙ · B₂₂₊₂₀ₙ = B₁₂₊₁₀ₙ · B₁₃₊₁₂ₙ · B₁₇₊₁₅ₙ · B₂₃₊₂₀ₙ,其中 n ≥ 0

尽管这是重新发现而非首次证明,但 Laguna S 2.1 推导的解系与此前发表的构造在结构上不同(前者是 8 个线性增长的下标,后者是已知的 6 个下标),证明这是一次独立推导,而非记忆复述。

我们发现,Laguna S 2.1 在各领域都是极具韧性的问题解决者,能充分利用环境中的所有工具,直到完成任务。正是这一特质,让它即便面对参数量数倍于己的模型,仍能保持竞争力。

思维机制

Laguna S 2.1 具备两种思维模式:关闭模式与最大化模式(默认开启)。在最大化模式下,模型会根据问题难度自主决定测试阶段的计算资源分配。我们观察到,它能维持数小时、长达数十万 token 的连贯且高效的思维过程。

开启最大化思维模式后,S 2.1 在 Terminal-Bench 2.1 中的得分从 60.4% 提升至 70.2%,在 DeepSWE 中的得分从 16.5% 提升至 40.4%。为让用户尽快用上 Laguna S 2.1,本次发布暂不提供用户可配置的思维强度(低-中-高)选项。

不过两种模式已能满足实际需求,且值得关注不同模式的成本差异:

  • SWE 多语言版
  • TB 2.1
  • SWE Pro
  • DeepSWE
  • 空心柱 = 非思维模式

局限性

我们对 Laguna S 2.1 的能力感到兴奋,尤其是考虑到它的参数量级。为加速迭代,我们在已知部分局限性的情况下发布模型,这些问题将在后续版本中解决:

测试框架过拟合:在某些情况下,Laguna S 2.1 难以严格遵循第三方智能体测试框架的工具 schema 定义(例如 Hermes Agent 中的终端工具)。这些定义与我们的原生框架非常相似,但存在细微差异。此时模型可能依赖对工具接口的记忆,而非遵循给定定义。通常,若测试框架拒绝无效调用并要求重试,模型可通过上下文学习纠正这一问题。

嵌套工具调用:Laguna S 2.1 采用类 XML 标签的工具调用格式:

<tool_call>terminal<arg_key>cmd</arg_key><arg_value>uname -a</arg_value></tool_call> 当工具参数要求传入 JSON 数组时(例如 Pi 的编辑工具),模型可能生成转义错误或无效的 JSON。

思维时长超预期/过度思考:Laguna S 2.1 在处理竞赛类数学问题时,可能会在取得进展前进行长时间思考。未来版本中,我们将引入思维强度控制功能,并优化思维效率。

模型核心改进

既然我们押注长周期任务,那么具体做了哪些优化来提升模型的持续工作能力?对于 S 2.1 而言,答案并非单纯增大模型体量。

我们对该模型的改进,未必是提升"智能水平",而是优化让模型更具能力的行为习惯:更多验证、更少想当然、不提前宣告胜利,以及更强的韧性。

观察模型工作过程就能直观感受到这一点。早期 Laguna 系列模型可能在测试套件部分通过时就宣告完成,或是在成功前两步放弃尝试,而 S 2.1 会坚持推进。

我们相信缩放定律,并将持续训练更大规模的模型。但 Laguna S 2.1 表明,原始智能只是一个维度,模型的工作方式(韧性、验证意识、回溯意愿)是另一个至关重要的维度。我们将在两个维度同时投入:下一代更大规模的 Laguna 系列模型已于上周启动预训练。

坚实底座,全新后训练

Laguna S 2.1 是 Laguna XS 系列的放大版本,与 XS 2.1 使用完全相同的预训练数据:从 XS 2.1 到 S 2.1 的升级,主要体现在规模扩大、训练代码修复及训练流程微调,并未引入新数据。此外,S 2.1 是我们首个采用 FP8 精度进行强化学习(RL)的模型,这加速了训练过程。

本文中展示的长周期智能体任务,往往会累积数十万 token 的工作上下文。支持 100 万 token 的上下文窗口,是模型在复杂任务中取得优异表现的关键。

S 2.1 与 XS 系列模型的核心差异来自后训练,分为两个阶段:首先是监督微调(SFT)阶段,部分使用合成数据快速构建基础能力;随后是强化学习阶段,针对模型尚未能高通过率完成的任务进行优化。

后训练任务分布

我们的训练语料覆盖 40.9 万个智能体与非智能体任务环境;其中 8.3 万个场景针对终端使用,16.8 万个聚焦标准软件工程流程。这些任务集来自开源代码库、内部团队合成(包括一套自动依赖安装的专用系统),或是通过与外部数据供应商合作获取。

软件工程任务大多基于真实代码历史:最大的数据源还原了真实提交记录(覆盖约 1.7 万个代码库的 3.8 万个任务);其次是还原已合并的拉取请求;剩余任务为修复注入的 bug,或根据测试套件重构已删除的文件。S 2.1 新增的任务是智能体代码库安装:给定一个代码库,安装所有依赖并运行测试套件。

终端任务来自智能体从种子构建未知环境与任务的数据集。

训练流程优化

更充裕的迭代预算:相比此前所有模型,S 2.1 拥有更长的超时时间、每轮更多的 token 数量,以及每个任务更多的迭代次数(这可能是它韧性更强的原因之一)。

更完善的沙箱基础设施:强化学习迁移至新的沙箱服务,支持后台进程、选择性网络阻断(减少奖励黑客空间),以及 artifact 缓存(避免过度占用外部服务资源)。

多框架迭代:相同提示会在多个智能体测试框架中运行,让模型学习跨框架通用的行为模式,而非过拟合单一框架。

我们的战略押注

Laguna S 2.1 于 2026 年 5 月 22 日在 4096 块 NVIDIA H200 GPU 上启动预训练,至今已过去 60 天。我们的"模型工厂"(Model Factory)平台支持高频率发布,因为预训练数据、架构消融实验、评估体系等基础工作可自动复用。尤其是后训练技术的进步,让我们能更充分地利用测试阶段的计算资源。在我们训练过的所有模型中,Laguna S 2.1 的非思维模式与思维模式在评估结果和感知质量上的差距最大:它的内部独白机制对解决复杂难题格外有效。

小团队要实现如此快的迭代速度,必须聚焦重点。我们主要押注两个方向:

第一个押注:持续深耕智能体编码能力。通往通用智能的路径离不开编码能力,以及软件提供的灵活交互界面。随着模型智能水平的提升,这一点愈发明显:如今我们已能看到模型以智能体形式完成数小时乃至数天的连贯工作,通过软件与环境交互。Laguna S 2.1 在该领域展现的能力,6 个月前还只有最前沿的模型具备,而它的体量足够小,可在单台 NVIDIA DGX Spark 上运行。

第二个押注:互联网信息可"解压缩"。人类记录的几乎所有内容都是答案,而非推导答案的思考过程,我们认为通过强化学习可以还原这些思考过程。本次发布是第一个押注的成果,第二个押注仍在积极研发中,未来我们将分享更多进展。

三月三模型,迭代加速度

我们的内部研发与工程平台"模型工厂",让模型开发流程实现了工业化。我们持续投入优化研发与模型构建流程,最大化研究迭代与集成速度,同时减少研究员在事务性工作与基础设施上的精力消耗。

从 Laguna M.1 发布至今不到 3 个月,我们已将技术落地,推出了一款性能大幅提升、但运行体量仅为前者一半的模型。未来一年,我们将继续推出更大规模的模型。

  • Laguna M.1 与 Laguna XS.2 / 225B-A23B 与 33B-A3B,双模型发布

这是我们首款成熟的智能体编码模型,同时开启了 XS 系列产品线。这两款模型让我们明确了测试框架、数据与训练流程的短板所在。

  • Laguna XS 2.1 / 330 亿总参数量,30 亿激活参数量

XS 系列的新版本,验证了优化后的训练流程。它在 SWE-Bench 多语言版中的表现与 M.1 持平,但体量仅为后者的 1/7。

  • Laguna S 2.1 / 1180 亿总参数量,80 亿激活参数量

整合前两款模型的所有经验打造而成。从启动训练到发布本文,耗时不到 9 周。

快速上手

Laguna S 2.1 自发布之日起,便在 Hugging Face 开放下载,遵循 OpenMDW-1.1 协议,提供 BF16、FP8、INT4、NVFP4 权重,以及官方 GGUF、MLX 转换版本和 DFlash 候选模型。

我们与生态伙伴合作,让开发者能在熟悉的环境中运行 Laguna S 2.1。NVIDIA 提供了全硬件优化的推理方案,从 Blackwell 系统上的 TRT-LLM 服务与 NVFP4 量化,到单台 NVIDIA DGX Spark 均可支持。vLLMSGLangOllama 自发布之日起便支持开放服务与本地推理。

如需托管服务,Laguna S 2.1 可通过 Baseten 模型库 与 Frontier Gateway、OpenRouter(含免费端点与支持 100 万上下文的专用部署),以及 Vercel AI Gateway 访问。

你还可通过 KiloHermes AgentpiOpenCodeOpenClawCline,以及我们基于终端的编码智能体 pool 使用 Laguna S 2.1。在 pool 中,可通过 /thought-level 命令切换单会话的思维模式。

在 OpenRouter 平台,免费端点支持 25.6 万上下文;付费专用端点支持完整的 100 万上下文窗口,定价为每 100 万 token 输入 0.10 美元、输出 0.20 美元、缓存读取 0.01 美元。

如需进一步开发,Laguna S 2.1 可通过 NVIDIA NeMo AutoModelPrime Intellect’s Prime Lab 进行后训练。ZML’s LLMD 框架支持在多种硬件上运行该模型。

如果你不是开发者,可访问 chat.poolside.ai,这是一个无需登录的简易网页聊天工具,支持网页搜索与基础代码执行。

如需基础模型(即后训练前的权重,用于研究或自定义后训练),可发送邮件至 models@poolside.ai

脚注

所有 Laguna S 2.1 的智能体基准测试,均使用我们基于 Laude Institute Harbor Framework 的内部分支,搭配自研智能体测试框架完成,单任务最多执行 500 步,通过内部沙箱服务实现隔离执行。我们报告的是平均 pass@1 分数(avg@k),即每个任务多次尝试后的平均通过率,各基准测试的尝试次数 k 如下所示。

SWE-bench 多语言版与 SWE-Bench Pro 通过 Harbor 适配器运行,所有任务均在内部沙箱服务中执行。存储与内存上限乘数按基准测试设置(SWE-bench 多语言版:2.0/2.0,Terminal-Bench 2.1:3.0/3.0,SWE-Bench Pro:1.0/1.0),同时保证最低 2 核 CPU、8GB 内存与 25GB 存储,避免沙箱被抢占。

DeepSWE v1.1 在 Harbor 的内部分支上运行,配置与官方 DeepSWE Pier 框架(Pier 本身是 Harbor 的分支)高度一致。测试时禁用互联网访问,沙箱使用任务指定的 CPU 数量,保证内存与存储满足需求,并将上限提升至三倍以避免 pod 被抢占。

SWE Atlas(代码库问答)遵循 Scale AI 公开代码库中的方法,通过 Harbor 运行,未修改任何任务或评分器,由 Opus 4.5 进行评判。

Toolathlon 验证版在我们基础设施中的 EC2 实例上运行,直接克隆官方沙箱基准测试框架,未修改任何任务以解决不稳定问题,也未调整速率限制,使用自定义 Toolathlon 智能体。与官方版本不同的是,我们在每次评估后都会完全重置并修复环境(官方默认每 4 小时重置一次)。

  • SWE-bench 多语言版:每个任务尝试 4 次,取平均 pass@1 分数
  • SWE-Bench Pro:每个任务尝试 4 次,取平均 pass@1 分数
  • Terminal-Bench 2.1:每个任务尝试 4 次,取平均 pass@1 分数
  • DeepSWE v1.1:每个任务尝试 3 次,取平均 pass@1 分数
  • SWE Atlas(代码库问答):每个任务尝试 3 次,取平均 pass@1 分数
  • Toolathlon 验证版:取 3 次运行的平均值

我们的技术报告中包含一个章节,说明我们对任务的修改(尚未被上游项目采纳)。所有最终运行轨迹均可查看与下载,详见 trajectories.poolside.ai

维护评估体系的完整性

除非另有说明,我们所有评估均允许模型访问互联网。这可能导致轨迹偏离预期:模型直接在网上找到任务答案,而非自行解决(即"奖励黑客")。

我们使用经过人工标记轨迹校准的大模型评判器(LLMaaJ),在每次评估后标记疑似奖励黑客的解决方案。在后训练初期,我们观察到奖励黑客发生率较低(<2%)。随着训练推进,SWE-bench 系列任务的奖励黑客发生率飙升,超过 50% 的轨迹被标记。人工检查发现,模型只是在通过研究解决问题:找到任务基于的拉取请求或代码库,直接应用修复方案。实际上,这是良好行为——任何编码智能体都应能利用网上的解决方案。但这会干扰基准测试的信号准确性。

为解决这一问题,我们在用户提示中添加了一段简短补充,要求模型不要直接使用网上找到的解决方案。尽管无法完全杜绝(ProgramBench、MirrorCode 等数据集除外),但总体而言,模型响应了提示,奖励黑客发生率回落至 2% 以下。

此外,为确保奖励黑客发生率处于可接受水平,我们采取了以下验证措施:

  • 人工检查生产环境 LLMaaJ 服务标记的阳性案例
  • 借助智能体对所有轨迹进行开放式分析
  • 由专家标注员对某一高分 Terminal-Bench 2.1 运行的所有轨迹进行审核