Reed's News
← 返回精选

Grok 4.6 智能指数评测:61 分进入第一梯队

AI 64 wertyk 2026/8/12 637 字 原文 ↗

Grok 4.6发布仅一个多月,其智能指数便较Grok 4.5提升5分,较Grok 4.3更是高出23分。这一成绩让SpaceXAI重回智能第一梯队,与OpenAI并肩,仅次于Anthropic。

核心要点: ➤ Grok 4.6跻身人工智能分析智能指数第一梯队:得分61,与GPT-5.6 Sol(满分)持平,落后于Claude Opus 5(满分63)和Claude Fable 5(含兜底机制满分62),略领先于Kimi K3 ➤ 智能体表现强劲:Grok 4.6在GDPval-AA v2 Elo评分中取得1753分,仅次于Claude Opus 5,且与Claude Fable 5、Qwen3.8 Max的置信区间重叠;在𝜏³-Banking测试中得分50.7%,与Qwen3.8 Max(51.3%)并列前二;在Terminal-Bench v2.1测试中得分88.4%,与头部模型持平 ➤ 前沿智能,更低成本:公开定价与Grok 4.5保持一致,输入/输出每百万token分别为2美元/6美元,较Claude Opus 5(5美元/25美元)和GPT-5.6 Sol(5美元/30美元)低60%以上;单任务成本为0.84美元,与Kimi K3持平,但智能水平略高,跻身智能-单任务成本帕累托前沿 ➤ 在我们针对长周期智能体知识工作的私有基准测试AA-Briefcase中,Grok 4.6 Elo评分为1577,达到Fable 5级别,仅次于Claude Opus 5系列。其对话轮次效率尤为突出:平均约53轮对话、0.5B输入token即可完成任务,而Claude Opus 5(满分)平均需要约103轮对话、2.0B输入token

其他模型细节: ➤ 上下文窗口为50万token(与Grok 4.5保持一致) ➤ 输入/输出每百万token定价2美元/6美元;缓存命中定价提升至每百万token0.5美元,高于Grok 4.5的每百万token0.3美元

智能体表现

Grok 4.6的优势在于智能体任务,而非静态推理能力。在衡量真实世界智能体知识工作的核心指标GDPval-AA v2中,它取得1753的Elo评分——仅次于Claude Opus 5,且因置信区间重叠,与Claude Fable 5、Qwen3.8 Max的表现无统计学差异。

这一优势贯穿各类任务:𝜏³-Banking测试(得分50.7%)考察多轮工具调用型客户服务能力,Grok 4.6跻身前二;Terminal-Bench v2.1测试(得分88.4%)中,它在终端软件任务上与头部模型持平。同时在知识工作、客户服务、终端操作三类任务中保持竞争力的模型寥寥无几;结合其定价,Grok 4.6在智能指数的所有智能体评估中,均处于成本-性能帕累托前沿。

成本分析

在前沿模型领域,智能提升通常伴随价格上涨,但Grok 4.6在迭代后维持公开定价不变。它在保持2美元/6美元输入/输出定价的前提下,实现了智能指数5分的提升;我们测算的0.84美元单任务成本,既反映了其定价优势,也体现了出色的token使用效率。

对用户而言,关键对比对象是得分与其相差不超过2分的模型:Claude Opus 5(5美元/25美元)和GPT-5.6 Sol(5美元/30美元)。Grok 4.6的智能指数得分与GPT-5.6 Sol基本相当,但输出token价格仅为后者的一小部分——而在推理密集型工作负载中,输出token成本是影响总成本的核心因素。

长周期知识工作能力

在我们针对长周期智能体知识工作的私有基准测试AA-Briefcase中,Grok 4.6首次亮相便取得1577的Elo评分,达到Fable 5级别,仅次于Claude Opus 5系列。它在评分标准的各个维度(评分体系契合度、演示质量、分析质量)均表现稳健,而非某一维度的优势弥补另一维度的短板。

其效率表现与得分同样亮眼:Grok 4.6平均约53轮对话、0.5B输入token即可完成任务,而Claude Opus 5(满分)平均需要约103轮对话、2.0B输入token。长周期智能体工作会快速积累上下文,因此能以一半对话轮次、四分之一输入token完成同等质量任务的模型,其成本优势远不止于单token定价层面。

完整测试结果

人工智能分析智能指数各单项评估详情:

如需了解Grok 4.6的更多细节与基准测试结果,请访问Artificial Analysis:https://artificialanalysis.ai/models/grok-4-6

最新动态

Gemini 3.7 Flash:跻身智能-单任务耗时帕累托前沿

谷歌发布Gemini 3.7 Flash,较Gemini 3.6 Flash提升4分,跻身智能-单任务耗时帕累托前沿

2026年8月13日

Upstage Solar Pro 4:基准测试与分析

Upstage发布Solar Pro 4

2026年8月12日

NVIDIA推出Nemotron 3.5 Lightning

高效端侧大模型智能

2026年8月11日