ABBEL:用自然语言信念状态实现高效长期交互
ABBEL与传统递归摘要的对比概览。智能体以信念替代完整交互历史作为工作语境,通过信念评分机制监督每一轮信念状态的内容,从而提升性能。
随着任务复杂度提升,大语言模型(LLM)的上下文窗口无法无限扩容。自动摘要技术虽能生成简洁易懂的上下文,但会显著牺牲模型性能,在高质量数据稀缺的人机协作领域(比如协同代码生成)表现尤为明显。为此,我们提出了ABBEL框架:它将摘要转化为自然语言形式的信念状态,通过隔离并监督这些信念的信息含量,解决上述问题。
研究动机:递归摘要的性能代价
要让语言模型有效支持软件开发这类复杂任务,必须能与人类进行成百上千轮交互。但对于此类长周期任务,将全部交互历史保留在上下文窗口中并不现实。目前主流的解决方案是生成摘要,有时也称为上下文压缩。例如,Cursor最新的模型composer 2.5在训练阶段就采用了压缩技术以提升性能(Cassano等人,2026)。而在在线编程竞赛中持续击败所有人类选手的Grandcode系统(DeepReinforce等人,2026),即便使用了最新的高效注意力模型Qwen 3.5-397B¹,仍需依赖上下文摘要技术。
但上下文压缩存在缺陷。尽管基准测试中性能差距看似不大,Cursor等模型服务商仍建议用户在任务进行中避免对代码助手使用压缩功能(Heule等人,2026)。
为何会如此?我们可以观察Combination Lock游戏中,上下文摘要模型与全上下文模型在强化学习微调过程中的性能差异。Combination Lock是类似Wordle的猜词游戏,最多允许16次猜测²。两种模型的性能均随训练提升,但摘要模型始终无法追上全上下文模型的表现。
图1:Combination Lock游戏中,两种策略在强化学习微调过程中猜中目标词的平均尝试次数(数值越低越好)。上下文摘要策略随训练逐步提升,但始终无法缩小与全上下文策略的差距。
让模型在完成任务时自动生成摘要,会增加学习任务的复杂度。通常这类问题可用更多训练数据解决,但现实交互场景中的性能下降,根源在于难以构建高效的人类模拟器来生成高质量训练环境(Lin等人,2025、Tomlin等人,2025)。因此,模型在有限且杂乱的多轮交互轨迹中,摘要能力越强,下游用户体验就越好。
ABBEL:基于信念瓶颈的决策框架
图2:受自编码器启发的信念评分机制。模型将先前信念、动作与观测结果(bₜ、aₜ、oₜ)编码为后验信念bₜ₊₁,根据该信念还原历史关键信息的效果给予奖励。
为提升学习效率,我们将摘要生成任务独立出来。借鉴递归贝叶斯估计思想,我们将摘要定义为信念状态,模型会根据新信息定期更新信念³。
图3:ABBEL执行流程。模型根据最新观测结果更新信念,再仅基于当前后验信念选择下一步动作,二者交替进行。
信念评分机制
我们随后提取并监督信念状态的内容(图2,信念评分)。信念评分可视为新增一项强化学习辅助任务,以“优质信念的判定标准”作为启发式奖励函数。以代码场景为例,优质信念需兼顾两点:一是长度更短,二是能更准确还原git diff,平衡二者即可得到理想的信念。对于难以定义启发式规则的领域,我们提出一种通用的、受自编码器启发的评分函数:将当前语言模型πθ作为历史信息的编码器与解码器,将信念状态作为编码载体。我们通过当前模型πθ能否基于信念bₜ₊₁还原最新观测结果oₜ,来为该信念评分:
公式1:还原评分目标。其中bₜ₊₁为更新后的信念,oₜ为最新观测结果,aₜ为刚执行的动作,bₜ为先前信念,pI为任务提示,πθ为当前模型。评分越高,说明信念保留了还原最新观测所需的关键信息。
信念评分的价值
CollabBench协同编码实验
我们在人类辅助编码场景下验证了信念评分的效用,采用Sweet-RL团队的CollabBench环境(Zhou等人,2025)。

图4:CollabBench协同编码环境。智能体先提出澄清问题,再提交函数,由隐藏单元测试打分。
实验结果显示,采用通用还原式信念评分后,ABBEL与全上下文模型的性能差距缩小了约50%,且训练步数比无信念评分的摘要模型(no BG)减少了一半。训练完成后,ABBEL的峰值上下文令牌长度(Peak Tokens)远低于全上下文模型,内存占用显著降低。
| 模型 | 测试通过率 ↑ | 成功率 ↑ | 峰值令牌数(×100) ↓ | 训练步数 ↓ |
|---|---|---|---|---|
| 全上下文 | 0.52±0.02 | 0.39±0.02 | 14.08±0.55 | 100 |
| ABBEL(无信念评分) | 0.46±0.02 | 0.31±0.02 | 4.20±0.37 | 100 |
| ABBEL-rec-BG | 0.48±0.01 | 0.36±0.01 | 6.01±0.33 | 50 |
图5:CollabBench实验结果。采用还原式信念评分的ABBEL-rec-BG,在峰值令牌数更少的前提下,追回了与全上下文模型约一半的性能差距,且训练步数从100步降至50步。
Combination Lock猜词实验
此外,在Combination Lock游戏中,我们为ABBEL配备了结合领域知识的信念评分器(通过计算历史信息的关键统计量,并验证能否从信念中还原这些统计量),其学习效率甚至超过了全上下文(FULL CTX)模型。
图6:Combination Lock游戏中猜中目标词的平均尝试次数(数值越低越好)。配备领域知识信念评分器的ABBEL,性能接近甚至超过全上下文模型;无信念评分时,模型学习速度更慢。
多目标问答实验
在第三个实验场景——多目标问答(基于MEM1项目Zhang等人,2025,该项目在改进版递归摘要框架中实现了端到端优化)中,我们验证了将信念状态与推理过程分离的价值:通过添加峰值信念长度惩罚(详情见论文),模型内存占用显著降低,而性能几乎无损失——这与惩罚推理长度时常见的性能下降情况截然不同(Arora等人,2025)。
图7:多目标问答任务中,精确匹配得分与峰值内存占用随目标数量的变化。添加峰值信念惩罚(PBP)的ABBEL,性能与MEM1、无惩罚的ABBEL相当,但内存占用更低。
相关研究
处理长上下文的其他方案各有取舍,需根据部署系统的需求选择:
- 上下文压缩方法生成密集表征,计算效率高,但牺牲了人类可读性(Kontonis等人,2026、Eyuboglu等人,2025等);
- 针对特定场景设计的摘要提示词(Wang等人,2025等)与剪枝策略(Jiang等人,2024)依赖专家知识,无法让智能体自主学习决策所需的记忆内容;
- 将长上下文存入外部记忆库(Packer等人,2023等)供智能体查询(Zhang等人,2025)的方法与本研究互补,摘要训练或能优化这类方法的上下文生成效果。
此外,通用递归摘要领域还有不少值得关注的工作:聚焦数学领域的研究(Wu等人,2026)、结合信念生成的推理方法(Zhou等人,2025)、采用类似自编码器目标的蒸馏摘要模块实现竞赛级代码生成(DeepReinforce等人,2026),以及为摘要添加连续特征的研究(Kontonis等人,2026)。
未来方向:更高效的记忆机制
将显式信念状态作为多步交互的信息瓶颈,还能拓展更多可能性:比如根据动作对信念状态的影响给予奖励以引导探索,通过传递显式信念实现智能体间的高效通信,甚至直接修改智能体决策依赖的记忆以提升用户可控性。
有些信息(比如人的外貌)仅靠文本难以有效表征,持续学习系统需要能捕捉这类信息。此外,如果要让系统掌握全新语言,或是在新游戏中超越人类水平,就必须将长期交互或游戏中积累的技能以高度压缩的形式存储,本质上承担起模型权重的功能。
更强大的系统可能会结合多种记忆形式:上下文对应工作记忆,其他方法则负责短期与长期记忆。如何实现这些记忆形式(比如通过测试时训练、适配器记忆、连续上下文记忆或其组合),是极具挑战性的研究方向。
致谢
感谢Alane Suhr与Kartik Goyal对本研究的指导,感谢Ethan Mendes、David He、Jitesh Jain与Nicholas Tomlin对本文初稿提出的修改意见。同时感谢MEM1作者的邮件交流,以及他们分享的匿名审稿意见,这些意见对我们极具启发。
引用
如果ABBEL对您的研究有启发,请引用本文!此外,我们还提供了同类研究的建议。
@misc{lidayan2026abbellearningnaturallanguagebelief,
title={ABBEL: Learning Natural-Language Belief States for Memory-Efficient Interaction},
author={Aly Lidayan and Jakob Bjorner and Satvik Golechha and Kartik Goyal and Alane Suhr},
year={2026},
eprint={2512.20111},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2512.20111},
}
在新型模型中,注意力计算占总计算量50%时的令牌数远超过25000。将线性注意力与全注意力交替使用(如GPT-OSS与DeepSeekv4的做法),可大幅降低注意力计算的浮点运算量。例如,DeepSeekv4-Pro(1.6T A49B)需处理近45万个令牌,注意力计算才会占总计算量的50%。Grandcode使用的Qwen-3.5-397B-A17B模型,在处理约15万个令牌时达到这一临界点。↩
该场景虽可用计算效率更高的工具解决,但作为研究递归摘要特性的测试平台十分灵活。Bertsimas等人,2022指出,针对原版Wordle游戏词汇表的精确解可通过动态规划求得,但将Wordle推广为“K个字母、L次尝试、含有效词库与目标词库D”的猜词游戏时,确定最少步数的问题属于NP难问题。↩
实际应用中,摘要会带来O(N/K)的额外开销,其中N为总动作数,K为触发摘要的动作间隔。这是所有摘要方法的固有特性。为便于演示,本文动图采用K=1;实验中为突出摘要的短板,同样设置K=1。但实际应用中,只要将K设为接近硬件高效处理上限的数值,额外开销就会很小。↩