多模型构建应用对比评测——GPT-5.6、Grok 4.5、Claude、Muse Spark
GPT-5.6、Grok 4.5、Claude与Muse Spark同场开发四款应用
GPT-5.6全新推出Sol、Terra、Luna三个层级,与Grok 4.5、Claude、Meta的Muse Spark及一众开源模型展开对决,开发四款应用:光线投射迷宫、魔方、计算器与生命游戏。本文将呈现所有成果,包含开发成本与耗时数据。
TryAI·· 阅读时长20分钟
我们上次的模型对决登上了Hacker News首页,评论区反响热烈,其中不少反馈极具价值。此次我们吸纳建议,结合GPT-5.6的三个层级(Sol、Terra、Luna),以及Meta意外发布的编码模型Muse Spark 1.1,将规模升级:12款模型、4项任务、每款模型每项任务尝试5次。
你们曾指出单次尝试结果偶然性太强,我们深表认同。如今每款模型每项任务均有5次尝试机会:页面顶部展示各模型的一次样本成果;每个任务的表格会说明5次尝试中我们判定为成功的次数(及判定标准),并附上我们认为最佳的一次尝试链接;所有尝试的链接都放在文末,便于大家直观感受模型每次输出的差异。
“这样不够客观。”没错,我们也无意伪装成科学结论。我们生成了大量成果并全部公开,大家可以自行判断。下文仅为我们观察结果后的主观总结。
想直接查看原始成果?跳转至所有尝试页面,亲自运行体验。
以下是各项任务详情:页面顶部展示我们选出的最佳尝试成果,下方列出5次尝试的总成本与耗时,文末附上所有原始尝试的链接,供大家自行评判。
任务1:Doom风格光线投射迷宫
可通过WASD键操控的第一人称光线投射迷宫,包含带深度阴影的墙壁、地板、天花板及碰撞检测功能。
Grok 4.5 Claude Opus 4.8 GPT-5.5 Qwen 3.7 Plus Kimi K2.6 Claude Fable 5 DeepSeek V4 Pro GLM-5.2 GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna Muse Spark 1.1
“可玩”判定标准:核心仅看能否实际在迷宫中行走、移动与转向,满足即可判定成功。
Muse Spark 1.1成功时表现惊艳:5次尝试中有3次失败,但成功的成果与Fable、Sol层级相当,优于Grok与Opus的版本。
整体来看,Claude的表现低于预期。GPT系列全面领先其他模型;Grok在其价位上是切实可用的替代选项;Muse Spark成功的几次尝试则带来了不小的惊喜。
任务2:3D魔方(打乱+还原)
开发一款彩色3D魔方,具备“打乱”与“还原”按钮,且旋转过程有清晰动画效果。
Grok 4.5 Claude Opus 4.8 GPT-5.5 Qwen 3.7 Plus Kimi K2.6 Claude Fable 5 DeepSeek V4 Pro GLM-5.2 GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna Muse Spark 1.1
“完美还原”判定标准:打乱与还原动画均流畅运行,无卡顿、无颜色错误,方可判定成功。
Muse Spark 1.1表现略优于开源模型,但考虑价格,不如直接使用Grok。
整体而言,GPT在光线投射任务中展现出明显3D优势,此次魔方任务却表现不佳,令人意外。Claude再次表现出色,其中Fable层级5次尝试全部完美还原,而Opus层级竟一次完美成果都未实现,颇为反常。
在线体验任意模型的5次尝试:Grok · Opus · Qwen(将链接中的数字替换为1-5即可查看其他尝试)。
任务3:计算器
具备数字键、运算符、清除键、等于键,支持正确运算优先级,外观贴合真实计算器。
Grok 4.5 Claude Opus 4.8 GPT-5.5 Qwen 3.7 Plus Kimi K2.6 Claude Fable 5 DeepSeek V4 Pro GLM-5.2 GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna Muse Spark 1.1
“可用”判定标准:无需 exhaustive 测试,仅通过(((5×5)−100)/10)这类基础运算,验证模型对运算顺序的处理及结果显示是否正确。
GPT-5.6 Sol像GPT-5.5一样过度追求样式:这在光线投射任务中有所帮助,但在计算器任务中反而添乱,部分样式设计不协调,缺乏简洁一致性。
Muse Spark 1.1整体表现不错,无明显问题,与Grok 4.5相当。偶尔出现的按键顺序错乱或布局怪异,使其在美观度上失分。
整体来看,Claude在此任务中表现最佳:Opus与Fable层级的5次尝试全部达标,且Fable的版本是我们心中的样式最优解。GPT-5.6 Sol试图复刻Fable的3D样式,但未能驾驭,反而导致整体体验下降;相对简洁的GPT模型表现更好,因为它们的成果无需额外调整即可直接使用。
任务4:康威生命游戏
包含网格画布、播放/暂停/单步/随机生成/清除按钮,支持点击切换细胞状态,细胞世代变化有动画效果。
Grok 4.5 Claude Opus 4.8 GPT-5.5 Qwen 3.7 Plus Kimi K2.6 Claude Fable 5 DeepSeek V4 Pro GLM-5.2 GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna Muse Spark 1.1
我们未对生命游戏任务进行单独的5次尝试评分,仅提供成本、耗时数据及整体印象。
| 模型 | 成本 | 耗时 |
|---|---|---|
| Grok 4.5 | $0.14 | 38秒 |
| Claude Opus 4.8 | $0.48 | 35秒 |
| GPT-5.5 | $1.06 | 79秒 |
| Qwen 3.7 Plus | $0.04 | 11秒 |
| Kimi K2.6 | $0.93 | 53秒 |
| Claude Fable 5 | $1.27 | 48秒 |
| DeepSeek V4 Pro | $0.25 | 304秒 |
| GLM-5.2 | $0.10 | 121秒 |
| GPT-5.6 Sol | $0.99 | 62秒 |
| GPT-5.6 Terra | $0.36 | 25秒 |
| GPT-5.6 Luna | $0.13 | 18秒 |
| Muse Spark 1.1 | $0.32 | 98秒 |
Grok 4.5表现不错,但更值得关注的是,这类简单任务对开源模型来说毫无压力。由于生命游戏的开源示例代码十分丰富,开源模型能以极低成本完成高质量开发。Qwen 3.7 Plus与GLM-5.2无疑是此类任务的首选,但它们的通用性仍不足——其他任务显示,面对真正新颖或复杂的工作,它们仍力有不逮。
附:速度与成本汇总(短任务)
整体结果
| 模型 | 响应时间 | 生成速度(词/秒) | 单任务成本 |
|---|---|---|---|
| GPT-5.6 Luna | 1.0秒 | 97 | $0.001 |
| GPT-5.6 Terra | 1.5秒 | 62 | $0.001 |
| GPT-5.6 Sol | 1.8秒 | 45 | $0.003 |
| Qwen 3.7 Plus | 2.1秒 | 204 | $0.001 |
| Claude Opus 4.8 | 2.5秒 | 44 | $0.004 |
| GPT-5.5 | 3.0秒 | 45 | $0.003 |
| Grok 4.5 | 3.0秒 | 112 | $0.003 |
| Muse Spark 1.1 | 3.1秒 | 125 | $0.002 |
| Kimi K2.6 | 4.5秒 | 83 | $0.01 |
| Claude Fable 5 | 6.6秒 | 30 | $0.01 |
| GLM-5.2 | 7.0秒 | 58 | $0.001 |
| DeepSeek V4 Pro | 9.3秒 | 37 | $0.001 |
部分开源模型会一次性输出全部内容,受限于400词上限,因此表格中的生成速度为理论峰值,并非真实解码速度。GPT-5.6各层级是短提示下速度最快的模型(Luna层级约1秒即可响应);Qwen兼具极致性价比与速度;DeepSeek与GLM则速度偏慢。
附加任务1:绘制“马骑宇航员”(SVG,5次尝试最佳成果)
单次生成SVG,不调用外部库。我们展示各模型5次尝试中的最佳成果(优先选择格式严格合规的SVG,其次为细节最丰富的版本)。
Grok 4.5 Claude Opus 4.8 GPT-5.5 Qwen 3.7 Plus Kimi K2.6 Claude Fable 5 DeepSeek V4 Pro GLM-5.2 GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna Muse Spark 1.1
主观来看,Claude Fable的SVG绘制表现极佳,成果细节丰富,还时常带有趣味性。GPT-5.6各层级的表现则令人失望,马和宇航员的绘制均不够清晰。Grok 4.5的表现也相当不错。
附加任务2:绘制“马斯克与贝索斯观看蓝色起源着陆”(SVG,5次尝试最佳成果)
应要求完成难度更高的场景:绘制两个辨识度高的科技富豪 caricature(漫画形象),观看Blue Origin火箭助推器在公海上的着陆平台降落。此任务考验构图与人物相似度。Claude Fable再次脱颖而出:成果细节丰富、渲染清晰,贝索斯的额头有高光,着陆平台周围还有烟雾效果。GPT的成果则偏向卡通风格;若你偏好此类风格,可尝试优化其单次生成的成果,因为生成过程总会存在一些小瑕疵。开源模型GLM-5.2与Qwen 3.7在此次任务中的表现同样亮眼。
Grok 4.5 Claude Opus 4.8 GPT-5.5 Qwen 3.7 Plus Kimi K2.6 Claude Fable 5 DeepSeek V4 Pro GLM-5.2 GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna Muse Spark 1.1
总结
前沿模型仍在复杂任务中占据绝对优势,领先差距显著。GPT-5.6 Sol与Claude Fable 5是本次对决的佼佼者:Sol在光线投射迷宫任务中表现突出,Fable则称霸魔方任务。其他模型表现尚可,但最佳成果仍来自前沿阵营。
前沿模型与开源模型在新颖或复杂任务中的差距清晰可见,光线投射迷宫与魔方任务就是例证。但在生命游戏这类简单、已有大量成熟案例的任务中,开源模型能凭借丰富的示例代码,以极低成本完成高质量开发,表现不输前沿模型。此类任务可优先选用开源模型,但切勿过度依赖——其他任务已证明,它们在复杂工作中仍存在明显短板。
Grok 4.5在部分任务中达到了“Opus级”水准。若企业关注成本,可毫不犹豫将其作为第二执行模型。详见Grok 4.5 vs Opus 4.8及Grok 4.5 vs GPT-5.5的对比。
Muse Spark 1.1带来了惊喜。原本对其期待不高,实际表现略逊于Grok 4.5,但整体优于开源模型。作为首次亮相的产品,虽暂非首选,但潜力值得关注。
结论在模型发布后依然成立:最新、最昂贵的旗舰模型并非必然赢家。想亲自运行这些测试?所有模型均已接入TryAI的按需付费账户,浏览模型列表即可开启你的专属对决。
体验所有尝试成果
我们生成的所有原始成果,涵盖12款模型、每项任务5次尝试。点击任意数字即可打开对应成果,亲自体验。红色星号(*)标记该模型的最佳尝试(生命游戏未进行单尝试评分,故无标记)。