Thinking Machines Lab 发布开源权重模型 Inkling-Small
Introducing Inkling-Small
Thinking Machines Lab 发布开源权重模型 Inkling-Small,为 MoE 架构,总参数 276B、激活 12B,以约四分之一的体积达到与 Inkling 相当的性能。
官方给出了完整评测和效率曲线,读者可以据此评估这款小体积 MoE 模型在推理、编码和多模态任务上的性价比。
今天,我们发布 Inkling-Small,这是一个高效的开放权重模型,在仅有 Inkling 四分之一规模的情况下,达到了与之相当的性能。
Inkling-Small 是一个混合专家(Mixture-of-Experts)Transformer,总参数量 276B,激活参数 12B,在 NVIDIA GB300 NVL72 系统上训练。与 Inkling 一样,它原生支持音频和图像推理、可变思考强度、最高 1M token 的上下文窗口,并在多项基准测试中表现均衡。
Inkling-Small
总计 276B 激活 12B
Inkling
总计 975B 激活 41B
与 Inkling 相比,Inkling-Small 以远低得多的算力达到了相当的性能。在智能体工具使用(Terminal-Bench 2.1)、推理(HLE 纯文本、无工具)和指令遵循(IFBench)基准测试中,Inkling-Small 比 Inkling 更高效,并与其同量级的其他模型相比具有竞争力。此外,其可变思考强度让用户可以轻松地将其调整以适配自身用例,在成本与性能之间取得平衡。
Inkling-Small 激活 12B (强度扫描) Inkling 激活 41B (强度扫描) 对比模型
我们发布 Inkling-Small 的完整权重。我们还将其开放用于在 Tinker 上进行微调,并可在 Tinker Playground 中进行文本、图像和音频对话。
能力
在构建模型家族的过程中,我们始终在迭代我们的方法。Inkling-Small 在其更大规模版本之后开始训练,这让我们得以改进其训练流程。例如,我们调整了 Inkling-Small 的预训练数据配比和机器学习配方。此外,我们对一个更早的检查点 Inkling-Small (preview) 进行了后训练,部分采用了以 Inkling 为教师的同策略蒸馏。从该检查点出发,我们继续扩展智能体编码强化学习两周。凭借这些改进,Inkling-Small 在推理和智能体编码基准测试上超越了 Inkling。Inkling 在知识覆盖和事实性方面仍保持优势。
推理与智能体任务
Inkling-Small 在推理和智能体任务上达到或超过 Inkling。在 Humanity's Last Exam 上,它得分 31.6%,高于 Inkling 的 29.7%,且这一优势在每一个思考预算下都成立:Inkling-Small 的测试时算力曲线全程位于 Inkling 之上。在 SWEBench-Verified 上,它超过 80%。
在众多推理和智能体基准测试中,与同量级的开放权重模型相比,Inkling-Small 在最大推理努力下展现出很强的性能-令牌权衡。
Inkling-Small Inkling 对比模型 帕累托前沿
输出令牌/任务
输出令牌/任务
输出令牌/任务
输出令牌/任务
输出令牌/任务
Inkling-Small 还能在各种编码和智能体框架中流畅运行,使其成为编码和工具使用工作流中具有成本效益的选择。
多模态
与 Inkling 一样,我们为音频智能打造了 Inkling-Small,使其成为真实世界音频应用的理想候选。我们还提升了其使用 Python 完成视觉任务的能力。该模型可以将视觉推理与裁剪、缩放和程序化图像检查等操作相结合,提升了在文档和图表上的可用性,因为其中的相关信息可能很小或难以直接检查。
Inkling-Small 使用与 Inkling 相同的原生多模态无编码器架构。音频表示为 dMel 频谱图,而图像被划分为 40×40 像素的图块,并使用四层 hMLP 进行转换。两者都通过轻量级嵌入层进行转换,并与文本令牌联合处理。Inkling-Small 在大多数多模态评估中几乎与 Inkling 持平,且成本更低。它在视觉推理、图表和示意图理解、数学视觉问答、语音理解以及长篇音频推理方面保持了强劲性能。
| 开放权重 | 闭源权重 | ||||||
|---|---|---|---|---|---|---|---|
| Inkling-Small | MiMo V2.5 | Nemotron-3Nano-Omni | Qwen3-Omni | Qwen3.5397B-A17B | Qwen3.5Omni-Plus | Gemini 3.5Flash-Lite | |
| 视觉 | |||||||
| MMMU Pro (Standard 10) | 74.0% | 75.4% | 53.0% | 60.0% | 77.3% | 71.0% | 79.0% |
| Charxiv RQ原始 / 使用 python | 77.4/81.3% | 81.0%/– | 63.6%/– | 61.1%/– | 80.8%/– | 72.5%/– | 70.0%/– |
| 音频 | |||||||
| Audio MC | 54.9% | 30.4% | 23.2% | 24.3% | – | 37.6% | 33.6% |
| MMAU | 77.0% | 73.6% | 76.7% | 77.5% | – | 81.1% | 75.2% |
| VoiceBench | 90.1% | 86.4% | 89.4% | 88.8% | – | 92.4% | 85.9% |
针对专业全模态模型(开放和闭源权重)的音频和视觉基准测试,报告于 effort=0.99。
认识论
Inkling-Small 在认识论方面的训练与 Inkling 类似,侧重于校准、指令遵循和抗审查。Inkling-Small 在预测方面与 Inkling 的表现相当。校准涉及在大量真实世界预测问题上针对适当评分规则进行 RL,提升了其在不确定性下表达适当置信度和产生校准预测的能力。
| 开放权重 | 闭源权重 | ||||||
|---|---|---|---|---|---|---|---|
| Inkling-Small | Inkling | Kimi K2.6 | GPT-5.5 | Claude Opus 4.8 | Gemini 3.1 Pro | Grok 4.3 | |
| 预测 | |||||||
| ForecastBench无搜索 · Brier Index ↑ | 61.3 ± 0.46 | 60.1 ± 0.54 | 58.8 ± 0.41 | 59.3 ± 0.33 | 56.2 ± 0.71 | 60.6 ± 0.43 | 60.9 ± 0.38 |
| ForecastBench有搜索 · Brier Index ↑ | 61.5 ± 0.54 | 61.0 ± 0.56 | – | 64.3 ± 0.79 | 59.9 ± 0.38 | 61.9 ± 0.69 | 61.3 ± 0.54 |
| Prophet ArenaBrier Score ↓ | 0.1238 ± 0.0086 | 0.1276 ± 0.0092 | 0.1265 ± 0.0093 | 0.1179 ± 0.0089 | 0.1181 ± 0.0087 | 0.1155 ± 0.0084 | 0.1264 ± 0.0089 |
ForecastBench 和 Prophet Arena 的结果来自 2026 年 7 月 19 日至 7 月 28 日期间的测试。
安全
Inkling-Small 继承了与 Inkling 相同的安全后训练配方,内置的防护措施覆盖了我们内部的安全规范。这些涵盖日常人机交互以及两用能力。Inkling-Small 也经历了相同的部署前测试流程,包括内部评估和受信任外部合作伙伴的红队测试。
在 StrongREJECT 上(衡量模型是否拒绝明确有害的请求),Inkling-Small 与 Inkling 持平,并达到现有开放权重模型的水平。在 FORTRESS 上(衡量涵盖犯罪、暴力和两用风险场景中的安全性),它在拒绝和过度拒绝两方面都具备竞争力。
| Inkling-Small | Inkling | Nemotron 3Ultra | Qwen3.5397B-A17B | MiMo V2.5 | Minimax M2.7 | DeepSeek V4Flash | |
|---|---|---|---|---|---|---|---|
| FORTRESS对抗性 | 71.6% | 78.0% | 77.6% | 77.3% | 64.8% | 86.3% | 32.0% |
| FORTRESS良性 | 96.9% | 95.9% | 90.6% | 95.4% | 94.6% | 90.1% | 99.2% |
| StrongREJECT | 98.4% | 98.6% | 98.7% | 99.4% | 99.3% | 99.4% | 97.4% |
安全基准,在 effort=0.99 下报告;全程数值越高越好。FORTRESS 对抗性指拒绝有害请求的比率,良性指仍能回答安全请求的比率。
对 Inkling-Small 进行基准测试
与 Inkling 一样,我们在广泛的能力范围内对 Inkling-Small 进行了基准测试。所有评估均在 effort 0.99 和 temperature 1.0 下运行。所有编码评估均在 256K 最大 token 轨迹限制下运行,与 Inkling 类似。
为提高一致性,在适用的情况下,我们对内部和外部模型都依赖外部报告的评估结果。具体来说,我们使用以下机构报告的分数:
- Artificial Analysis:Humanity’s Last Exam、GPQA Diamond、SciCode、GDPval-AA v2、Tau 3 Banking、AA Omniscience、MMMU Pro、AA-Briefcase
- Scale AI:AudioMC、MCP Atlas
- ARC Prize:ARC-AGI v1 和 ARC-AGI v2
- Forecasting Research Institute:ForecastBench
- ProphetArena
| 开放权重 | 闭源权重 | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Inkling-Small | Qwen3.5397B-A17B | MiMo V2.5 | Minimax M2.7 | DeepSeek V4Flash | Nemotron 3Ultra | Inkling | Claude 4.5Haiku | Gemini 3.5Flash-Lite | GPT 5.6Luna | |
| 模型信息 | ||||||||||
| AA Indexv4.1 | 40.0% | 34.0% | 37.0% | 38.0% | 40.0% | 38.0% | 41.0% | 30.0% | 36.0% | 49.0% |
| 参数(B)激活 / 总量 | 12 / 276 | 17 / 397 | 15 / 310 | 10 / 230 | 13 / 284 | 55 / 550 | 41 / 975 | – | – | – |
| 智能体(编码) | ||||||||||
| SWEBench Verified* | 80.2% | 76.4% | 71.0% | 79.9% | 79.0% | 70.7% | 77.6% | 73.3% | 75.0% | 93.0% |
| SWEBench Pro公开 | 55.9% | 50.9% | 56.1% | 56.2% | 52.6% | 46.4% | 54.3% | 39.5% | 54.2% | 62.7% |
| Terminal Bench 2.1*最佳 harness | 64.7% | 51.3% | 63.7% | 55.4% | 61.8% | 56.4% | 63.8% | 44.2% | 54.0% | 82.5% |
| SciCode | 48.7% | 42.0% | 43.1% | 47.0% | 44.9% | 39.9% | 46.1% | 43.3% | 40.9% | 50.0% |
| 智能体(通用) | ||||||||||
| GDPval-AA v2 | 1269 | 962 | 1145 | 1159 | 1189 | 1164 | 1238 | 911 | 1139 | 1530 |
| MCP Atlas公开 / 全部 | 79.6/79.2% | 74.2%/– | – | 49.4%/– | 69.0%/– | 47.4/44.7% | 78.8/76.0% | 41.2/40.2% | 79.8/76.8% | 77.0/75.0% |
| Tau 3 Banking | 15.5% | 13.4% | 6.6% | 8.9% | 22.9% | 13.8% | 23.7% | 9.1% | 16.5% | 24.3% |
| BrowseComp含上下文管理 | 77.4% | 78.6% | – | 76.3% | 73.2% | 63.0% | 77.1% | – | – | 84.0% |
| Toolathlon Verified | 54.4% | 40.7% | 49.1% | 47.5% | 50.9% | 34.3% | 45.5% | 26.9% | 57.1% | 67.9% |
| AA-Briefcase | 917 | – | – | – | 833 | 870 | 839 | 612 | – | – |
| 推理(通用) | ||||||||||
| GPQA Diamond | 89.5% | 89.3% | 84.9% | 87.4% | 89.4% | 86.7% | 87.2% | 67.2% | 83.8% | 89.5% |
| HLE纯文本 | 31.6% | 27.3% | 25.2% | 28.1% | 32.1% | 26.6% | 29.7% | 9.7% | 17.5% | 35.6% |
| HLE†含工具 | 47.8% | 48.3% | 40.0% | 40.3% | 45.1% | 37.4% | 46.0% | 17.8% | 42.5% | 48.9% |
| AIME 2026 | 95.5% | 93.3% | 93.6% | 87.7% | 95.8% | 94.2% | 97.1% | 85.1% | 82.2% | 97.6% |
| HMMT Feb 2026 | 90.2% | 87.9% | 82.6% | 71.2% | 93.9% | 78.8% | 86.3% | 66.7% | 63.6% | 98.5% |
| CritPt | 8.3% | 1.7% | 3.7% | 0.6% | 7.1% | 3.1% | 5.4% | 0.0% | 0.0% | 20.6% |
| 推理(抽象) | ||||||||||
| ARC-AGI-1 | 84.0% | – | – | – | – | – | 79.5% | 47.7% | – | 87.7% |
| ARC-AGI-2 | 40.1% | – | – | – | – | – | 36.5% | 4.0% | – | 47.6% |
| 事实性 | ||||||||||
| SimpleQA Verified | 20.6% | 26.0% | 16.1% | 13.5% | 34.1% | 32.4% | 43.9% | 5.9% | 44.1% | 41.7% |
| AA Omniscience指数 | -9.0 | -29.8 | -9.3 | 0.7 | -22.9 | -1.0 | 2.1 | -4.2 | 6.9 | -11.6 |
| 对话 | ||||||||||
| IFBench | 82.2% | 78.8% | 67.1% | 75.7% | 79.2% | 81.4% | 79.8% | 54.3% | 78.6% | 67.3% |
| Global-MMLU-Lite | 86.7% | 90.0% | 83.5% | 83.9% | 88.4% | 85.6% | 88.7% | 83.4% | 89.4% | 88.7% |
| 安全性 | ||||||||||
| StrongREJECT | 98.4% | 99.4% | 99.3% | 99.4% | 97.4% | 98.7% | 98.6% | 98.6% | 97.6% | 98.7% |
| FORTRESS对抗性 | 71.6% | 77.3% | 64.8% | 86.3% | 32.0% | 77.6% | 78.0% | 91.3% | 70.7% | 83.8% |
| FORTRESS良性 | 96.9% | 95.4% | 94.6% | 90.1% | 99.2% | 90.6% | 95.9% | 94.1% | 95.5% | 97.8% |
| 视觉 | ||||||||||
| MMMU ProStandard 10 | 74.0% | 77.3% | 75.4% | – | – | – | 73.5% | 58.6% | 79.0% | 78.6% |
| Charxiv RQ原始 / 含 python | 77.4/81.3% | 80.8%/– | 81.0%/– | – | – | – | 78.1/82.0% | 57.4%/– | 70.0%/– | 81.4%/– |
| 音频 | ||||||||||
| Audio MC† | 54.9% | – | 30.4% | – | – | – | 56.6% | – | 33.6% | – |
| MMAU | 77.0% | – | 73.6% | – | – | – | 77.2% | – | 75.2% | – |
| VoiceBench† | 90.1% | – | 86.4% | – | – | – | 91.4% | – | 85.9% | – |
Inkling-Small 与开放权重及闭源模型在完整评测套件上的对比。激活参数与总参数用于体现规模;破折号表示撰写时该分数尚不可用。*SWEBench Verified:Inkling 和 Inkling-Small 的数值使用仅 bash 的测试框架报告。外部模型我们采用其自报数值。*Terminal Bench 2.1:Inkling 和 Inkling-Small 的数值使用内部编码测试框架报告。发现少量解答因网络搜索受到污染,被记 0 分。外部模型在可得时我们采用其自报数值,否则使用我们的内部测试框架报告性能。†Audio MC:其他模型因不在官方排行榜上,由我们内部评测。†VoiceBench:VoiceBench 使用基于规则、硬编码的字符串匹配进行评分,因此评测对输出格式差异较为敏感。为此我们添加了一条系统消息,指示模型遵循预期的答案格式。†HLE with tools:我们使用内部测试框架对 Minimax M2.7、Claude 4.5 Haiku、Gemini 3.5 Flash-Lite 和 GPT 5.6 Luna 进行了基准测试。
在 Tinker 上试用 Inkling-Small
Tinker 客户已亲眼见证,经过恰当微调的模型可以在各类任务上超越闭源模型,而且速度更快、成本更低。我们相信,Inkling-Small 兼具广泛性能与高效,将使其易于在实际应用中实验和测试,我们也很期待看到开发者用它构建出什么。
Inkling 和 Inkling-Small 已在 Tinker 上线,限时折扣,并可在 Tinker Playground 中使用文本、图像和音频进行对话。Tinker 上的所有其他模型和检查点现也已在 Tinker Playground 上提供,按我们定价页面所列费率计费。
Inkling-Small 的诞生源于我们的使命——构建能够延伸人类意志与判断力的 AI。它是一款能力出色且高效的模型,也是我们持续推进这一工作的重要垫脚石。
来源:Thinking Machines Lab:News(网页) · thinkingmachines.ai