GPT-5.5推理token聚类异常
程序故障(功能异常)功能异常
模型行为(模型表现相关问题)模型表现相关问题
速率限制(限流、配额与令牌使用统计相关问题)限流、配额与令牌使用统计相关问题
问题描述
概述
我在Codex的token_count元数据中发现一种聚合规律:gpt-5.5的响应中,reasoning_output_tokens(推理输出令牌数)恰好为516的占比异常偏高,同时在1034和1552附近也存在明显的固定峰值。
该现象为gpt-5.5特有,且伴随整体推理令牌密度下降,这或许可以解释其在复杂高风险Codex任务上的性能退化。
本问题与编号#29353的问题相关——后者记录了一个具体案例:当gpt-5.5的推理令牌数恰好为516时,返回了错误答案。本次问题补充了2026年2月至6月期间的大规模聚合数据作为佐证。
我并非断言这证明了思维链被暗中截断,仅指出Codex的遥测数据显示,gpt-5.5存在特定的固定令牌聚类异常,表现与推理预算阈值机制高度吻合。
环境信息
- 产品:Codex
- 涉事主要模型:
gpt-5.5 - 数据来源:Codex的
token_count元数据 - 分析时间范围:2026年2月1日至6月27日(UTC时间)
- 关联问题:Codex Desktop中gpt-5.5 xhigh模式有时会在reasoning_output_tokens=516时提前终止并返回错误final_answer #29353
证据数据
| 指标 | 数值 |
|---|---|
| 分析的响应级令牌记录总数 | 390,195 |
| 涉及的会话数 | 865 |
reasoning_output_tokens恰好为516的事件数 |
3,363 |
gpt-5.5占所有响应的比例 |
19.3% |
gpt-5.5占令牌数恰好为516事件的比例 |
82.0% |
gpt-5.5中令牌数恰好为516与令牌数≥516的比例 |
44.0% |
非gpt-5.5模型中令牌数恰好为516与令牌数≥516的比例 |
1.3% |
各模型统计结果
| 模型 | 响应记录数 | 令牌数恰好为516与令牌数≥516的比例 |
|---|---|---|
gpt-5.5 |
75,401 | 44.0% |
gpt-5.4 |
25,214 | 19.8% |
gpt-5.2 |
247,575 | 0.34% |
gpt-5.3-codex |
13,333 | 0.0% |
gpt-5.3-codex-spark |
26,179 | 0.0% |
月度令牌数恰好为516的聚类占比变化(大幅上升)
| 月份 | 令牌数恰好为516与令牌数≥516的比例 |
|---|---|
| 2026年2月 | 0.11% |
| 2026年3月 | 2.45% |
| 2026年4月 | 4.25% |
| 2026年5月 | 53.30% |
| 2026年6月 | 35.84% |
同期整体推理令牌密度变化(持续下降)
| 月份 | 推理令牌均值 | 90分位推理令牌数 |
|---|---|---|
| 2026年2月 | 268.1 | 772 |
| 2026年3月 | 256.8 | 723 |
| 2026年4月 | 228.7 | 669 |
| 2026年5月 | 106.9 | 344 |
| 2026年6月 | 168.5 | 515 |
异常点说明
该异常并非单纯的推理令牌使用量上升:2026年2-4月至5-6月,推理令牌的均值和90分位数值均呈下降趋势,但令牌数恰好为516的聚类占比却大幅上升。
聚类现象也并非在各模型中均匀分布:gpt-5.5仅占总响应量的19.3%,却贡献了82.0%的令牌数恰好为516事件;其令牌数恰好为516与令牌数≥516的比例,是非gpt-5.5模型基线水平的约33.6倍。
此外,固定数值特征也值得关注:516、1034、1552更像是重复出现的阈值边界,而非自然波动的推理令牌分布。
预期行为
对于复杂Codex任务,推理令牌数应随任务复杂度自然变化,不应出现某一模型家族的响应集中聚集于特定固定数值的情况。
实际行为
gpt-5.5的响应大量聚集于推理令牌数恰好为516的情况,同时在1034和1552附近也存在相关峰值。其他多款模型的此类现象则明显更弱或完全不存在。
请求
Codex团队能否排查gpt-5.5是否存在推理预算、路由、截断、降级或调度机制,导致响应在推理令牌数达到516/1034/1552左右时终止?
若此为预期行为,希望能明确令牌数恰好为516代表正常终止点、预算上限、降级层级,还是其他内部阈值。
建议开展以下内部验证检查:
- 按模型查询
token_count事件中的reasoning_output_tokens数据 - 对比令牌数为0、516、1034、1552的事件数量
- 按模型和日期计算
count(reasoning_output_tokens = 516) / count(reasoning_output_tokens >= 516)的比例 - 将
gpt-5.5与gpt-5.2、gpt-5.4及Codex专用变体模型进行对比 - 在
gpt-5.2和gpt-5.5上重新运行匹配的复杂任务并开展质量评估,尤其需将令牌数恰好为516的响应与推理过程更长的响应分开分析
元数据
经办人
标签
程序故障(功能异常)功能异常
模型行为(模型表现相关问题)模型表现相关问题
速率限制(限流、配额与令牌使用统计相关问题)限流、配额与令牌使用统计相关问题