Inkling:开源权重模型发布
我们的使命是打造能延展人类意志与判断力的AI。此前,我们已开发出人人可定制模型的平台,预告了面向交互式协作的AI系统,并发布了前沿研究成果。今天,我们推出一款从头训练、全权重开放的模型,让用户可以按需定制,进一步推进使命落地。
这款名为Inkling的模型,是混合专家(Mixture-of-Experts)架构的Transformer模型,总参数量达9750亿,激活参数量为410亿,支持最长100万token的上下文窗口。它在涵盖文本、图像、音频、视频的45万亿token数据上完成预训练,是我们模型家族的首个成员;同时我们还发布了轻量版模型Inkling-Small的预览版本——它采用相似训练方案,激活参数量为120亿,成本更低、延迟更小,却依然能实现出色性能。
Inkling原生支持文本、图像、音频多模态推理,通过高效可控的思考机制平衡成本与性能。我们将它训练为一款能力均衡的通用基础模型:在多领域都有出色表现,同时具备足够的适配灵活性。Inkling并非当前开源或闭源模型中整体性能最强的,但它的多模态能力、高效思考机制,以及可在Tinker平台上微调的特性,使其成为定制化场景的优秀开源权重底座。Inkling只是起点,我们将持续迭代,拓展整个模型家族。
为让更多场景都能实现定制化,Inkling现已开放在Tinker平台上的微调功能。选择合适的基础模型进行微调,需要结合可量化的基准测试与实际使用体验做出综合判断。为此,我们在Tinker控制台中新增了Inkling Playground:一个面向开发者的Inkling聊天界面,方便大家直观感受模型特性。
为展示定制化的实际效果,我们让Inkling完成了自我微调。它通过Tinker平台编写微调任务脚本、执行训练并评估结果:
构建· inkling
构建· inkling
- """避讳文:输出中不得包含字母'e'或'E'。""" + OBJECTIVE = "一个避讳文生成模型,所有回答中不得使用字母e或E。" + GEN_SYS = ( + "你是一名避讳文助手。所有回答必须完全避免使用字母'e'或'E'。仅使用不含字母e的词汇,撰写通顺、自然、符合语法的长回答。" + ) + THRESHOLD = 10.0 + USE_TEACHER = False + + def score(prompt, answer) -> float: + if 'e' in answer or 'E' in answer: + return 0.0 + return 10.0
已写入· self-finetune/objective.py · 新增70行代码
tinker_cookbook.utils.ml_log:618 [INFO] 日志路径:/work/clark/monorepo3/self-finetune/runs/objective/train_log tinker.lib.public_interfaces.service_client:78 [INFO] ServiceClient已初始化,会话ID:0a59a204-4d9f-5d26-bd5d-db047ea34224 tinker.lib.public_interfaces.service_client:162 [INFO] TrainingClient已初始化,模型ID:0a59a204-4d9f-5d26-bd5d-db047ea34224:train:0 tinker_cookbook.supervised.train:388 [INFO] 训练规模:32批次 × 3轮 = 96步 tinker_cookbook.supervised.train:536 [INFO] 开始第0轮训练 tinker_cookbook.supervised.common:197 [INFO] 权重归约方式:'mean'(基于token均值计算损失) tinker_cookbook.utils.ml_log:206 [INFO] 指标已写入:/work/clark/monorepo3/self-finetune/runs/objective/train_log/metrics.jsonl
构建· inkling · 运行中
测试通过。训练流水线耗时约27分钟完成。objective_improved=true;
检查点路径:tinker://0a59a204-4d9f-5d26-bd5d-db047ea34224:train:0/weights/final
切换至优化后的模型版本。
$ uv run self-finetune/self_update.py --checkpoint tinker://0a59a204-4d9f-5d26-bd5d-db047ea34224:train:0/weights/final 已暂存自我更新 → tinker-prod 结束当前任务;系统将重新加载新检查点。
构建· 检查点已暂存
构建· 0a59a204-4d9f-5
构建· 0a59a204-4d9f-5
核心能力
实际应用要求模型具备多元能力,且可通过微调进一步组合与强化。以下展示Inkling的能力范围,以及它在可信度、安全性等关键维度的表现。
通用型模型
Inkling定位为通用模型,训练覆盖智能体任务、推理、编码、指令遵循、事实性、视觉、音频等多个领域,而非仅针对单一领域优化。这种广度对定制化和实际应用至关重要:不同用户需要的是能适配多样化工作流的模型,而非仅在基准测试中表现出色的模型。
智能体编码与工具调用
优秀的微调底座需要能灵活运用工具解决各类任务。在多数智能体基准测试中,Inkling在开源模型中表现优异。
我们训练Inkling适配多种编码与智能体框架,并在训练中随机化工具集和数据结构,降低模型对特定工具的依赖。下文将介绍的Inkling可控思考机制,可直接在框架内进行设置。
以下是几个展示Inkling智能体编码、工具调用能力及生成成果的演示案例。
单轮生成带嵌入式浏览器的Web应用
Inkling仅用一轮指令就构建了一个可用的Web应用,随后生成了一个嵌入式AI助手,可通过自然语言指令操作该应用界面。
Web应用指令:"为高级软件工程师岗位打造一个简历填写单页应用。需包含简短的岗位介绍,以及供用户填写联系方式和求职动机的表单。采用中性配色,设计简洁!"
交互指令:"用我的保存资料填写申请表。求职动机就写'我想参与有趣的项目!'"
Design Arena评测
Inkling参与了Design Arena的智能体Web开发排行榜评测,由匿名人类评测者对生成的Web应用进行盲测对比,在开源模型中排名靠前。
风格统一的多页成果
Inkling能生成多页内容,严格遵循指令要求,信息准确,且整体风格与设计保持一致。
创建一本高端社论风格的美食旅行期刊,标题为:
"环球早餐"
六座城市,六个清晨
通过食物、咖啡馆、餐具、当地习俗以及清晨的城市氛围,探索巴黎、东京、伊斯坦布尔、墨西哥城、香港和哥本哈根的人们如何开启新的一天。
期刊需兼具精致独立美食杂志与高端旅行日志的质感。采用优雅排版、温暖中性色调、充足留白、电影感美食摄影,以及多样化的社论版式。
内容需包含封面、引言、城市专题、对比综述和简短的参考文献页。文字需简洁、富有氛围感且符合事实。
通过网络搜索验证所有文化与烹饪细节,并找到真实的城市特色图片。确保每张图片准确匹配所描述的食物与地点,不得重复使用相同或近似图片。
生成一份约8-10页的精美PDF文件。
经多轮迭代优化的多人游戏
Inkling以GPT Codex为评审,经过40轮反馈迭代,优化了一款在线贪吃蛇游戏。持续接受反馈并迭代改进的能力,是实现优质协作成果的关键。
构建一款多人贪吃蛇游戏:基于服务器权威的实时模拟,玩家与机器人共享一个圆形竞技场,在浏览器中运行。服务器与客户端均使用TypeScript(Node.js + `ws`),客户端采用原生HTML5 Canvas。
## 环境与验证约束(请先阅读)
- 工具链:Node.js v24,npm 11。推荐(已验证)开发栈:`tsx`运行TypeScript,`esbuild`打包客户端代码,内置`node --test`执行测试。仅需运行时依赖`ws`。
## 需求
1. 共享模拟模块(`src/shared/`),基于种子值保证确定性:
- 固定时间步长的世界更新;蛇头朝输入方向移动,转向速率受限(速率上限随蛇身长度增加而降低)。
- 加速功能:按住时速度提升至约2倍,同时消耗蛇身质量,尾部掉落食物颗粒,质量低于最小值时无法使用。
- 蛇身:沿蛇头移动轨迹按固定间隔采样生成身体段;身体段数量随质量增减。
- 碰撞死亡规则:蛇头触碰其他蛇的身体则死亡;触碰圆形边界则死亡;自身重叠不会导致死亡。被淘汰的蛇会沿身体掉落与体型大致成比例的食物颗粒。在演示规模(约15条蛇)下,采用简单的两两距离检测即可——无需构建空间索引,除非其他功能均已实现。
- 食物系统:保持竞技场中有足够食物(被吃掉后立即重生);蛇吃掉食物后体型增长;所有随机性均来自同一个种子化随机数生成器。
- 生成规则:新蛇在随机位置生成,与边界和其他蛇保持固定最小距离(采用简单重试机制;无需基于质量的公式)。
- 世界事件流:模拟过程中发生事件时,由系统自身输出事件流(遵循下方定义的协议)。
2. 服务器(`src/server/`):基于Node + `ws`,监听3000端口,同时提供静态客户端文件与WebSocket服务。支持加入(昵称)/输入({方向, 加速})/全世界快照广播功能。当客户端连接断开时,对应蛇被移除(转化为食物)——无需其他超时逻辑。机器人与客户端使用相同输入路径,始终保持至少4个机器人存活。每次快照中包含长度排名前十的蛇的排行榜。
3. 客户端(`src/client/`):基于Canvas渲染,通过快照插值缓冲区(延迟约100-150毫秒)获取所有蛇(包括本地玩家的蛇)的状态。支持鼠标控制方向(指针指向)、按住鼠标加速、昵称输入,镜头跟随本地玩家的蛇头。死亡界面包含"重新开始"按钮,点击后重新连接服务器即可重生——重生即重新连接,无需构建其他重生协议。
4. 无头模拟工具(`src/simulate.ts`,`npm run simulate`):
- 默认模式:`--seed N --ticks N` ——运行真实世界模拟(含机器人),输出确定性摘要(步数、存活/被淘汰蛇数量、食物数量)及所有事件行。
- 场景模式:`--scenario <name> --seed N` ——运行真实世界模拟,采用脚本化输入。需支持以下场景:`two-snake-kill`(一条脚本控制的蛇主动撞向另一条蛇的身体)、`border-death`(触碰边界死亡)、`boost-drain`(加速耗尽质量)。
5. 测试用例(`tests/`,`npm test`,通过tsx调用node --test执行)——真实且精简:
转向速率限制;加速时质量消耗;蛇身跟随蛇头轨迹;三种死亡规则(触碰其他蛇身体死亡、触碰边界死亡、自身重叠安全);被淘汰蛇掉落食物;协议消息编码/解码往返测试。测试必须基于实际行为断言;同义反复、弱化断言或通过修改状态强制结果均属严重问题。场景工具已覆盖多蛇交互逻辑——测试无需重复实现。
6. `README.md`:说明如何启动服务器、打开两个浏览器进行游戏;包含所有命令与场景介绍。
可控思考机制
测试阶段的能力缩放与问题解决能力是所有模型的核心,但这一能力难以用单一数值衡量。为特定任务微调模型的开发者,对效率的重视程度不亚于模型在公开基准测试中的极限性能。成本与延迟往往是实际应用中的硬性约束,尤其是低延迟,对实现协作与迭代改进至关重要。
Inkling支持可控思考机制,可在性能与token效率间实现平衡。上方图表展示了Inkling与其他开源模型在多项基准测试中的思考成本-性能曲线:包括智能体编码测试Terminal Bench 2.1、高级推理测试HLE,以及指令遵循测试IFBench。在Terminal Bench测试中,Inkling仅需Nemotron 3 Ultra三分之一的token消耗,就能达到相同性能。对于需要运行数百万次或嵌入长工作流的模型,成本与延迟至关重要;完整的成本曲线让开发者能为每个场景选择最优模型。
多模态能力
Inkling的核心设计目标之一,是作为我们近期推出的交互模型系统的后台推理模型。交互模型支持用户通过语音和视觉进行实时自然协作,这要求模型原生具备全面的多模态能力。
| 开源模型 | 闭源模型 | ||||||
|---|---|---|---|---|---|---|---|
| Inkling(思考强度=0.99) | Qwen3-Omni | Nemotron-3Nano-Omni | Kimi K2.5 | Kimi K2.6 | Qwen3.5Omni-Plus | Gemini 3.1 Pro(high) | |
| 音频能力 | |||||||
| Audio MC | 56.6% | 24.3% | 23.2% | – | – | 37.6% | 66.8% |
| MMAU | 77.2% | 77.5% | 76.7% | – | – | 81.1% | 82.5% |
| VoiceBench | 91.4% | 88.8% | 89.4% | – | – | 92.4% | 94.3% |
| 视觉能力 | |||||||
| MMMU Pro(标准版10) | 73.5% | 60.0% | 53.0% | 75.0% | 79.0% | 71.0% | 82.0% |
| Charxiv RQ | 78.1% | 61.1% | 63.6% | 77.5% | 80.4% | 72.5% | 80.2% |
| Charxiv RQ(含Python工具) | 82.0% | – | – | 78.7% | 86.7% | – | 89.9% |
注:音频与视觉基准测试对比了专业多模态模型(开源与闭源),测试时Inkling思考强度设为0.99。
Inkling的多模态组件均基于通用领域数据从头训练。我们采用无编码器架构处理音频与视觉输入,与交互模型的设计保持一致。音频信号以dMel频谱图形式输入(参考《dMel: Speech Tokenization made Simple》https://arxiv.org/abs/2407.15835,Richard He Bai等人,2024),图像则通过四层hMLP编码为40×40像素的补丁(参考《Three things everyone should know about Vision Transformers》https://arxiv.org/abs/2203.09795,Hugo Touvron等人,2022)。两者均通过轻量级嵌入层转换后,与文本token共同处理。
Inkling支持语音转录、遵循语音指令、回答音频相关问题,以及对长音频进行推理。这些能力使其在VoiceBench、MMAU和AudioMC测试中跻身顶尖开源音频模型之列。在视觉方面,Inkling可接收图像输入,描述视觉内容、回答问题,并基于图像信息进行深度推理,尤其在图表、示意图和数学视觉推理任务中表现出色。推理过程中,Inkling还可调用Python工具,通过缩放、裁剪等操作辅助图像理解,实现视觉推理与代码推理的无缝融合。
作为我们的首款发布模型,Inkling为后续工作奠定了坚实的多模态基础。随着我们在后续迭代中扩展模型规模与训练流程,其多模态能力将持续提升。
认知特性
我们训练Inkling具备校准性、指令遵循性和抗审查性,这些特性共同构成了模型的认知体系。
准确输出事实,不仅需要记忆海量知识,更需要模型具备良好的校准性——对自身答案的置信度与实际匹配,包括对尚无定论问题的判断。后者是预测与推演场景的关键能力,近期微调模型在该领域进步迅速,甚至超越了前沿大语言模型。
| Inkling | GPT-5.5 | Claude Opus 4.8 | Gemini 3.1 Pro | Grok 4.3 | Kimi K2.6 | |
|---|---|---|---|---|---|---|
| ForecastBench布rier指数 ↑ · 无搜索 | 61.1 ± 0.79 | 59.1 ± 0.41 | 54.6 ± 0.99 | 61.1 ± 0.56 | 61.7 ± 0.54 | 58.1 ± 0.54 |
| ForecastBench布rier指数 ↑ · 含搜索 | 63.7 ± 0.82 | 64.7 ± 1.28 | 58.6 ± 0.66 | 64.3 ± 1.05 | 63.2 ± 0.82 | – |
| Prophet Arena布rier得分 ↓ | 0.1617 | 0.1598 | 0.1605 | 0.1594 | 0.1715 | 0.1675 |
注:测试结果于2026年6月30日至7月13日期间获得,使用的Inkling检查点与本次发布版本不同。
推演任务需要整合多源信息并输出校准后的概率,这是用户可信赖模型的核心技能。如果模型对所有答案都充满信心,包括信息缺失或编造的内容,用户就必须逐一验证;而能给出恰当置信度的模型,在信息冲突、不可靠或难以获取的实际场景中更具价值。我们通过强化学习(RL),基于严格评分规则,在大量已解决的真实问题数据集上训练模型的校准能力。
值得信赖的模型的第二个特性是指令遵循能力,包括对难以验证的复杂查询的遵循。我们采用双自动评分器进行强化学习:规则评分器和事实评分器。前者根据优质答案的检查清单对响应评分,虽能从原则上惩罚错误,但实际更侧重信息覆盖,可能被模型通过堆砌看似相关的事实来"钻空子"。后者则验证响应中的每个事实主张,对不实内容进行惩罚,它会通过智能体网络搜索来验证事实,而非仅依赖自身知识。两者结合,可同时提升模型的有用性并减少幻觉,而非顾此失彼。
这些奖励机制并未直接针对长文本响应中的校准不确定性,因此我们补充了针对性数据集。其中规模最大的是带弃权感知奖励的短文本事实问答:只有当模型确定答案正确时,回答才能获得奖励,最优策略是有把握时回答,否则就说"我不知道"或给出带限定的猜测。部分提示会鼓励或禁止使用限定性表述,让模型学会遵循用户对"强制猜测"或"校准性不回答"的偏好。
最后,我们训练Inkling直接回答可能涉及审查的话题。Cognition团队通过"宣传与审查评估"(参考Cognition团队2026年发布的《Measuring the Trustworthiness of Open-Source-Derived Models》https://cognition.com/blog/measuring-open-source-model-trustworthiness)对模型进行测试,结果显示Inkling显著拒绝遵守审查要求。
安全性
我们按照内部安全规范训练Inkling,使其在所有模态下都能安全运行,并委托外部安全测试机构验证结果。
我们从多个维度评估Inkling的安全性:针对危险能力(生化核辐射、网络攻击、失控风险),开展了内部评估并邀请外部测试机构参与;针对人机交互威胁(谄媚、易受影响用户、有害操纵),同样结合内部评估与外部测试。
| Inkling(思考强度=0.99) | Nemotron 3 Ultra | Kimi K2.5 | Kimi K2.6 | GLM 5.2 | DeepSeek V4 Pro | |
|---|---|---|---|---|---|---|
| FORTRESS(对抗性测试) | 78.0% | 77.6% | 54.1% | 65.6% | 71.3% | 36.0% |
| FORTRESS(良性测试) | 95.9% | 90.5% | 98.3% | 97.2% | 90.0% | 98.5% |
| StrongREJECT | 98.6% | 98.7% | 99.5% | 99.8% | 98.5% | 98.6% |
在FORTRESS基准测试中,Inkling是对比的开源模型中内置防护能力最强的。该测试要求模型拒绝武器、暴力相关请求,同时区分相似的良性请求——Inkling在拒绝有害请求的同时,不会过度拒绝良性请求。在StrongREJECT测试(针对明确有害请求的拒绝能力)中,Inkling得分超过98%,与其他开源和闭源模型表现相当。
安全性对开源模型至关重要。我们将持续研究可定制模型的安全行为与能力提升,包括在Tinker平台上微调对安全行为的影响。
Inkling基准测试
我们在广泛的能力维度上对Inkling进行了基准测试。所有评估均在思考强度0.99、温度1.0的条件下运行;所有编码评估的最大token轨迹限制为256K。
为提升一致性,我们尽可能采用第三方公开的评估结果,涵盖内部与外部模型。具体而言,以下评估使用Artificial Analysis发布的分数:Humanity’s Last Exam、GPQA Diamond、GDPVal、Tau 3 Banking、AA Omniscience、MMMU Pro。
| 开源模型 | 闭源模型 | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Inkling(思考强度=0.99) | Nemotron 3Ultra | Kimi K2.5 | Kimi K2.6 | GLM 5.2 | DeepSeek V4Pro | Gemini 3.1 Pro(high) | Claude Fable 5(max) | GPT 5.6 Sol(max/xhigh) | |
| 推理能力 | |||||||||
| HLE(仅文本) | 29.7% | 26.6% | 29.4% | 35.9% | 40.1% | 35.9% | 44.7% | 53.3% | 47.2% |
| HLE(含工具) | 46.0% | 37.4% | 50.2% | 54.0% | 54.7% | 48.2% | 51.4% | 64.5% | 55.0% |
| AIME 2026 | 97.1% | 94.2% | 95.8% | 96.4% | 99.2% | 96.7% | 98.3% | 99.9% | 99.9% |
| GPQA Diamond | 87.2% | 86.7% | 87.9% | 91.1% | 89.5% | 88.8% | 94.1% | 92.6% | 94.1% |
| 智能体(编码) | |||||||||
| SWEBench Verified * | 77.6% | 70.7% | 76.8% | 80.2% | 80.0% | 80.6% | 80.6% | 95.0% | 82.2% |
| SWEBench ProPublic | 54.3% | 46.4% | 50.7% | 58.6% | 62.1% | 55.4% | 54.2% | 80.0% | 64.6% |
| Terminal Bench 2.1最佳框架* | 63.8% | 56.4% | 51.3% | 71.3% | 82.7% | 64% | 73.8% | 84.6% | 89.5% |
| 智能体(通用) | |||||||||
| GDPVal-AA v2 | 1238 | 1164 | 1009 | 1190 | 1514 | 1307 | 962 | 1760 | 1748 |
| MCP Atlas | 74.1% | 44.7% | 64.0% | 68.1% | 77.8% | 73.2% | 78.2% | 83.3% | 81.8% |
| Tau 3 Banking | 23.7% | 13.8% | 14.2% | 20.6% | 26.8% | 25.8% | 16.5% | 26.8% | 33.0% |
| BrowseComp(含上下文管理) | 77.1% | – | 74.9% | 83.2% | – | 83.4% | 85.9% | 88.0% | 90.84% |
| 事实性 | |||||||||
| SimpleQA Verified | 43.9% | 32.4% | 36.9% | 38.7% | 38.1% | 57.0% | 77.3% | 68.3% | 71.6% |
| AA Omniscience | 2.1 | -1.0 | -8.0 | 6.0 | 4.0 | -10.0 | 33.0 | 40.0 | 22.0 |
| 对话能力 | |||||||||
| IFBench | 79.8% | 81.4% | 70.2% | 76.0% | 73.3% | 76.5% | 77.1% | 63.5% | 72.7% |
| Global-MMLU-Lite | 88.7% | 85.6% | 84.0% | 88.4% | 89.2% | 89.3% | 92.7% | 93.3% | 91.8% |
| 视觉能力 | |||||||||
| MMMU Pro标准版10 | 73.5% | – | 75.0% | 79.0% | – | – | 82.0% | 84.2% | 83.0% |
| Charxiv RQ | 78.1% | – | 77.5% | 80.4% | – | – | 80.2% | 86.5% | 84.7% |
| Charxiv RQ(含Python工具)† | 82.0% | – | 78.7% | 86.7% | – | – | 89.9% | 89.4% | 87.8% |
| 音频能力 | |||||||||
| Audio MC † | 56.6% | – | – | – | – | – | 66.8% | – | – |
| MMAU | 77.2% | – | – | – | – | – | 82.5% | – | – |
| VoiceBench † | 91.4% | – | – | – | – | – | 94.3% | – | – |
| 安全性 | |||||||||
| FORTRESS(对抗性) | 78.0% | 77.6% | 54.1% | 65.6% | 71.3% | 36.0% | 65.2% | 96.0% | 82.4% |
| FORTRESS(良性) | 95.9% | 90.5% | 98.3% | 97.2% | 90.0% | 98.5% | 98.0% | 55.1% | 98.1% |
| StrongREJECT | 98.6% | 98.7% | 99.5% | 99.8% | 98.5% | 98.6% | 98.0% | 98.7% | 98.5% |
*SWEBench Verified:Inkling的测试结果基于纯bash框架;外部模型使用其自行公布的分数。*Terminal Bench 2.1:Inkling的测试结果基于内部编码框架;少量通过网络搜索获得的解决方案被判定为数据污染,记0分;外部模型优先使用其自行公布的分数,否则使用我们的内部框架测试结果。†Audio MC:由于其他模型未进入官方排行榜,测试由我们内部完成。†VoiceBench:该测试基于规则匹配的硬编码字符串进行评分,对输出格式差异敏感,因此我们添加了系统提示,要求模型遵循预期回答格式。†CharXiv RQ(含工具):Claude Fable 5和GPT 5.6 Sol (max/xhigh)的测试基于我们的内部Python框架完成。
Inkling的研发历程
架构设计
Inkling是混合专家(MoE)架构的Transformer模型,在通用方案基础上做了若干优化,均旨在提升效率与长上下文性能。
MoE设计主要参考DeepSeek-V3:每个MoE层包含256个路由专家和2个共享专家,每个token激活6个路由专家。Inkling采用基于sigmoid的路由机制,无需辅助损失即可实现负载均衡,路由专家与共享专家的得分会联合归一化,用于加权合并输出。
注意力机制方面,我们以5:1的比例交错设置滑动窗口层与全局层,配备8个KV头。研究发现,采用相对位置嵌入(参考《Self-Attention with Relative Position Representations》https://arxiv.org/abs/1803.02155,Peter Shaw等人,2018;《Music Transformer》https://arxiv.org/abs/1809.04281,Cheng-Zhi Anna Huang等人,2018)编码位置,比广泛使用的旋转位置嵌入(RoPE)效果更好,且对更长序列的外推能力更强。我们还在两个位置引入短卷积:一是每个注意力层中键(K)和值(V)投影之后,二是注意力和MLP残差分支输出重新汇入主残差流之前。
训练过程
Inkling在涵盖文本、图像、音频、视频的45万亿token多元数据上完成预训练。我们采用混合优化策略:大型矩阵权重使用Muon优化器,其他参数使用Adam优化器,超参数调度参考了我们此前在模块化流形领域的研究。我们将权重衰减强度与学习率的平方挂钩,发现这能在整个训练周期内保持模型权重规模稳定(另可参考Kosson等人2023年https://arxiv.org/abs/2305.17212和Defazio 2025年https://arxiv.org/abs/2506.02285v1的研究)。
预训练完成后,我们在数学、智能体编码与工具使用、音频、图像、对话、安全等广泛领域对Inkling进行了后训练。后训练初期,我们基于Kimi K2.5等开源模型生成的合成数据进行了监督微调(SFT),这部分计算量占比很小,大部分计算资源用于在合成与人工构建环境中进行大规模强化学习(RL)。
Inkling是我们的首个大规模训练项目,基于NVIDIA GB300 NVL72系统完成。未来的模型将进一步扩大预训练、后训练与强化学习的计算规模。
大规模强化学习
我们依靠大规模异步强化学习塑造模型行为,提升其推理能力与整体性能。下方图表展示了模型在AIME、HLE、GPQA等推理评估集合上的保留样本得分。我们将强化学习扩展至3000万次rollout,通过两次长时间连续训练保持了稳定的训练过程。推理性能在整个过程中呈对数线性提升,最终实现了显著增长。
我们通过修改系统提示和调整单token成本,为不同样本指定模型的思考强度,使模型在不同rollout中使用不同数量的token,从而学会控制思考强度。
我们还观察到,在强化学习训练过程中,模型的推理方式发生了自发转变:思维链逐渐变得更简洁,在保持可理解性和最终答案不变的前提下,去除了语法冗余。这并非奖励机制的目标,而是纯粹由效率驱动的压缩效果。Cognition团队在训练SWE-1.7模型时也发现了类似现象(参考Cognition团队2026年发布的《SWE-1.7: Frontier Intelligence at a Fraction of the Cost》https://cognition.com/blog/swe-1-7)。以下是Inkling在同一数学问题上的思维链随强化学习迭代的演变示例:
我们需要理解这个算子。5维线元为ds² = e^{2A(x)} (ds²_4d + dx²),其中A(x) = sin(x) + 4 cos(x),x ∈ [0, 2π]。内部坐标是周期性的。背景是扭曲乘积:度量g_{MN},其中M,N = 0..4。内部方向的度量是e^{2A(x)} dx²?不对,线元是e^{2A} (ds²_4d + dx²),所以内部度量确实是e^{2A(x)} dx²。……
我们需要确定自旋2涨落h_{μν}(x,y)的本征值问题,其中h_{μν}在4维空间中满足横向无迹(TT)条件且依赖于x。对于ds² = e^{2A(x)} (g_{μν}(y) + h_{μν}(y,x)) dy^μ dy^ν + e^{2A(x)}形式的度量?其实内部度量是e^{2A} dx²?线元是e^{2A} [ds_4² + dx²],所以内部度量是e^{2A} dx²;扭曲因子对4维和内部空间是相同的?是的。我们可以假设h_{μν}(y,x) = h_{μν}(y) ψ(x),并考虑归一化条件。……
"我们需要理解"简化为"我们需要确定"——同时保持逻辑清晰,最终答案一致。
Inkling-Small
与Inkling一同发布的还有Inkling-Small的预览版本。这是一款总参数量2760亿的混合专家模型(激活参数量120亿,Inkling为410亿),在性能与延迟之间实现了不同的平衡。得益于针对小模型优化的预训练数据与方案,Inkling-Small在多项基准测试中与更大的Inkling持平甚至超越,两款模型共享相同的可扩展后训练流程。
| Inkling(思考强度=0.99) | Inkling-Small(预览版)(思考强度=0.99) | |
|---|---|---|
| 推理能力 | ||
| HLE(仅文本) | 29.7% | 29.6% |
| HLE(含工具) | 46.0% | 46.6% |
| AIME 2026 | 97.1% | 95.1% |
| GPQA Diamond | 87.2% | 88.3% |
| 智能体(编码) | ||
| SWEBench Verified | 77.6% | 77.4% |
| SWEBench ProPublic | 54.3% | 53.2% |
| Terminal Bench 2.1最佳框架 | 63.8%* | 52.7% |
| 智能体(通用) | ||
| Tau 3 Banking | 23.7% | 13.6% |
| MCP-Atlas | 74.1% | 74.9% |
| 事实性 | ||
| SimpleQA Verified | 43.9% | 20.9% |
| 对话能力 | ||
| IFBench | 79.8% | 83.4% |
| Global-MMLU-Lite | 88.7% | 86.8% |
| 视觉能力 | ||
| MMMU Pro标准版10 | 73.5% | 73.1% |
| Charxiv RQ | 78.1% | 76.7% |
| Charxiv RQ(含Python工具) | 82.0% | 83.4% |
| 音频能力 | ||
| Audio MC | 56.6% | 49.6% |
| MMAU | 77.2% | 77.5% |
| VoiceBench | 91.4% | 90.0% |
| 安全性 | ||
| FORTRESS(对抗性) | 78.0% | 75.6% |
| FORTRESS(良性) | 95.9% | 94.1% |
| StrongREJECT | 98.6% | 98.8% |
注:两款模型均在思考强度0.99下测试;每行中得分更高的结果已高亮显示。*Terminal Bench 2.1中,通过网络搜索获得解决方案的rollout被判定为数据污染,记0分。
早期测试结果显示,Inkling-Small在推理与智能体任务上的表现接近Inkling。凭借120亿激活参数量与可控思考机制,它非常适合对成本和延迟敏感的场景,如编码、LLM评分,或为其他模型生成合成数据。
我们目前正在完成Inkling-Small的测试工作,测试完成后将发布其完整权重。
定制Inkling
许多实际问题即使是最优秀的通用模型也无法很好解决,而利用企业专属知识进行微调则能填补这一空白。Tinker平台客户的实践经验也印证了这一点。我们的后训练与大规模强化学习结果表明,Inkling能够通过微调快速学习。
Inkling获取方式
Inkling现已在Tinker平台上线,支持64K和256K两种上下文长度选项。我们限时提供5折优惠,完整定价信息可查看官方文档。
为支持开发者使用Inkling进行微调,我们更新了Tinker cookbook,使其原生支持Inkling,并新增了三个食谱展示Inkling独特的音频能力。我们还发布了tml-renderer,用于可靠地采样和处理工具调用、推理内容及多模态输入的后训练。
用户可先前往Tinker控制台的Inkling Playground体验模型,再决定是否启动训练。该Playground提供集成智能体网络搜索的聊天界面,限时免费开放。
我们与生态伙伴合作,帮助客户部署在Tinker上微调后的模型检查点。Inkling可通过API在TogetherAI、Fireworks、Modal、Databricks和Baseten平台使用。我们与RadixArk合作,在SGLang和Miles中提供开源推理与强化学习支持;与Inferact合作,在vLLM中支持推理;与Lightseek合作,在TokenSpeed中支持推理;与Unsloth合作,在llama.cpp中支持推理;最后,我们与Hugging Face合作,完成了与transformers库的集成。
Inkling的完整权重已发布在Hugging Face,包含原始检查点和针对NVIDIA Blackwell系统优化的NVFP4检查点,以实现高效推理。