跳到正文
北京时间
原文
Thinking Machines Lab:News(网页)·· 2026-07-30精选AI 评分73

Thinking Machines Lab 发布开源权重模型 Inkling-Small

Introducing Inkling-Small

AI 导读

Thinking Machines Lab 发布开源权重模型 Inkling-Small,为 MoE 架构,总参数 276B、激活 12B,以约四分之一的体积达到与 Inkling 相当的性能。

推荐理由

官方给出了完整评测和效率曲线,读者可以据此评估这款小体积 MoE 模型在推理、编码和多模态任务上的性价比。

正文 · AI 翻译

今天,我们发布 Inkling-Small,这是一个高效的开放权重模型,在仅有 Inkling 四分之一规模的情况下,达到了与之相当的性能。

Inkling-Small 是一个混合专家(Mixture-of-Experts)Transformer,总参数量 276B,激活参数 12B,在 NVIDIA GB300 NVL72 系统上训练。与 Inkling 一样,它原生支持音频和图像推理、可变思考强度、最高 1M token 的上下文窗口,并在多项基准测试中表现均衡。

Inkling-Small

总计 276B 激活 12B

Inkling

总计 975B 激活 41B

Inkling-Small 与 Inkling 的参数对比。

与 Inkling 相比,Inkling-Small 以远低得多的算力达到了相当的性能。在智能体工具使用(Terminal-Bench 2.1)、推理(HLE 纯文本、无工具)和指令遵循(IFBench)基准测试中,Inkling-Small 比 Inkling 更高效,并与其同量级的其他模型相比具有竞争力。此外,其可变思考强度让用户可以轻松地将其调整以适配自身用例,在成本与性能之间取得平衡。

Inkling-Small 激活 12B (强度扫描) Inkling 激活 41B (强度扫描) 对比模型

性能-算力对比。将推理强度从最低扫描至 xhigh,可描绘出 Inkling-Small 与 Inkling 在 Terminal-Bench 2.1、HLE(无工具)和 IFBench 上的性能-算力曲线(每样本输出 TFLOPs)。我们表明,Inkling-Small 在性能与效率两方面均与相近规模区间的其他开放权重模型具有竞争力。每样本输出 TFLOPs 估算为 2 × 激活参数量 × 每样本平均生成 token 数,其中生成 token 数包含推理 token,来自我们的评估或 Artificial Analysis 的公开报告。

我们发布 Inkling-Small 的完整权重。我们还将其开放用于在 Tinker 上进行微调,并可在 Tinker Playground 中进行文本、图像和音频对话。

能力

在构建模型家族的过程中,我们始终在迭代我们的方法。Inkling-Small 在其更大规模版本之后开始训练,这让我们得以改进其训练流程。例如,我们调整了 Inkling-Small 的预训练数据配比和机器学习配方。此外,我们对一个更早的检查点 Inkling-Small (preview) 进行了后训练,部分采用了以 Inkling 为教师的同策略蒸馏。从该检查点出发,我们继续扩展智能体编码强化学习两周。凭借这些改进,Inkling-Small 在推理和智能体编码基准测试上超越了 Inkling。Inkling 在知识覆盖和事实性方面仍保持优势。

Inkling-Small 是一个广泛、均衡的通用模型。基准测试分数以统一的 0–100 分制显示;分数越高越好。

推理与智能体任务

Inkling-Small 在推理和智能体任务上达到或超过 Inkling。在 Humanity's Last Exam 上,它得分 31.6%,高于 Inkling 的 29.7%,且这一优势在每一个思考预算下都成立:Inkling-Small 的测试时算力曲线全程位于 Inkling 之上。在 SWEBench-Verified 上,它超过 80%。

在众多推理和智能体基准测试中,与同量级的开放权重模型相比,Inkling-Small 在最大推理努力下展现出很强的性能-令牌权衡。

Inkling-Small Inkling 对比模型 帕累托前沿

输出令牌/任务

输出令牌/任务

输出令牌/任务

输出令牌/任务

输出令牌/任务

推理 + 智能体基准测试上的令牌效率性能权衡。我们在智能体和推理任务(GDPval-AA v2、τ³-Banking、AA-Briefcase 和 CritPt)上评估了 Inkling-Small 和 Inkling(最大努力)以及其他开放权重模型,并展示了性能与输出令牌长度(包括推理 + 答案)。Inkling-Small 是最具效率的开放权重模型之一,以虚线标记。结果来自我们的评估或 Artificial Analysis 的参考数据。

Inkling-Small 还能在各种编码和智能体框架中流畅运行,使其成为编码和工具使用工作流中具有成本效益的选择。

多模态

与 Inkling 一样,我们为音频智能打造了 Inkling-Small,使其成为真实世界音频应用的理想候选。我们还提升了其使用 Python 完成视觉任务的能力。该模型可以将视觉推理与裁剪、缩放和程序化图像检查等操作相结合,提升了在文档和图表上的可用性,因为其中的相关信息可能很小或难以直接检查。

Inkling-Small 使用与 Inkling 相同的原生多模态无编码器架构。音频表示为 dMel 频谱图,而图像被划分为 40×40 像素的图块,并使用四层 hMLP 进行转换。两者都通过轻量级嵌入层进行转换,并与文本令牌联合处理。Inkling-Small 在大多数多模态评估中几乎与 Inkling 持平,且成本更低。它在视觉推理、图表和示意图理解、数学视觉问答、语音理解以及长篇音频推理方面保持了强劲性能。

开放权重闭源权重
Inkling-SmallMiMo V2.5Nemotron-3Nano-OmniQwen3-OmniQwen3.5397B-A17BQwen3.5Omni-PlusGemini 3.5Flash-Lite
视觉
MMMU Pro
(Standard 10)
74.0%75.4%53.0%60.0%77.3%71.0%79.0%
Charxiv RQ原始 / 使用 python77.4/81.3%81.0%/–63.6%/–61.1%/–80.8%/–72.5%/–70.0%/–
音频
Audio MC54.9%30.4%23.2%24.3%–37.6%33.6%
MMAU77.0%73.6%76.7%77.5%–81.1%75.2%
VoiceBench90.1%86.4%89.4%88.8%–92.4%85.9%

针对专业全模态模型(开放和闭源权重)的音频和视觉基准测试,报告于 effort=0.99。

认识论

Inkling-Small 在认识论方面的训练与 Inkling 类似,侧重于校准、指令遵循和抗审查。Inkling-Small 在预测方面与 Inkling 的表现相当。校准涉及在大量真实世界预测问题上针对适当评分规则进行 RL,提升了其在不确定性下表达适当置信度和产生校准预测的能力。

开放权重闭源权重
Inkling-SmallInklingKimi K2.6GPT-5.5Claude Opus 4.8Gemini 3.1 ProGrok 4.3
预测
ForecastBench无搜索 · Brier Index ↑61.3 ± 0.4660.1 ± 0.5458.8 ± 0.4159.3 ± 0.3356.2 ± 0.7160.6 ± 0.4360.9 ± 0.38
ForecastBench有搜索 · Brier Index ↑61.5 ± 0.5461.0 ± 0.56–64.3 ± 0.7959.9 ± 0.3861.9 ± 0.6961.3 ± 0.54
Prophet ArenaBrier Score ↓0.1238 ± 0.00860.1276 ± 0.00920.1265 ± 0.00930.1179 ± 0.00890.1181 ± 0.00870.1155 ± 0.00840.1264 ± 0.0089

ForecastBench 和 Prophet Arena 的结果来自 2026 年 7 月 19 日至 7 月 28 日期间的测试。

安全

Inkling-Small 继承了与 Inkling 相同的安全后训练配方,内置的防护措施覆盖了我们内部的安全规范。这些涵盖日常人机交互以及两用能力。Inkling-Small 也经历了相同的部署前测试流程,包括内部评估和受信任外部合作伙伴的红队测试。

在 StrongREJECT 上(衡量模型是否拒绝明确有害的请求),Inkling-Small 与 Inkling 持平,并达到现有开放权重模型的水平。在 FORTRESS 上(衡量涵盖犯罪、暴力和两用风险场景中的安全性),它在拒绝和过度拒绝两方面都具备竞争力。

Inkling-SmallInklingNemotron 3UltraQwen3.5397B-A17BMiMo V2.5Minimax M2.7DeepSeek V4Flash
FORTRESS对抗性71.6%78.0%77.6%77.3%64.8%86.3%32.0%
FORTRESS良性96.9%95.9%90.6%95.4%94.6%90.1%99.2%
StrongREJECT98.4%98.6%98.7%99.4%99.3%99.4%97.4%

安全基准,在 effort=0.99 下报告;全程数值越高越好。FORTRESS 对抗性指拒绝有害请求的比率,良性指仍能回答安全请求的比率。

对 Inkling-Small 进行基准测试

与 Inkling 一样,我们在广泛的能力范围内对 Inkling-Small 进行了基准测试。所有评估均在 effort 0.99 和 temperature 1.0 下运行。所有编码评估均在 256K 最大 token 轨迹限制下运行,与 Inkling 类似。

为提高一致性,在适用的情况下,我们对内部和外部模型都依赖外部报告的评估结果。具体来说,我们使用以下机构报告的分数:

开放权重闭源权重
Inkling-SmallQwen3.5397B-A17BMiMo V2.5Minimax M2.7DeepSeek V4FlashNemotron 3UltraInklingClaude 4.5HaikuGemini 3.5Flash-LiteGPT 5.6Luna
模型信息
AA Indexv4.140.0%34.0%37.0%38.0%40.0%38.0%41.0%30.0%36.0%49.0%
参数(B)激活 / 总量12 / 27617 / 39715 / 31010 / 23013 / 28455 / 55041 / 975–––
智能体(编码)
SWEBench Verified*80.2%76.4%71.0%79.9%79.0%70.7%77.6%73.3%75.0%93.0%
SWEBench Pro公开55.9%50.9%56.1%56.2%52.6%46.4%54.3%39.5%54.2%62.7%
Terminal Bench 2.1*最佳 harness64.7%51.3%63.7%55.4%61.8%56.4%63.8%44.2%54.0%82.5%
SciCode48.7%42.0%43.1%47.0%44.9%39.9%46.1%43.3%40.9%50.0%
智能体(通用)
GDPval-AA v212699621145115911891164123891111391530
MCP Atlas公开 / 全部79.6/79.2%74.2%/––49.4%/–69.0%/–47.4/44.7%78.8/76.0%41.2/40.2%79.8/76.8%77.0/75.0%
Tau 3 Banking15.5%13.4%6.6%8.9%22.9%13.8%23.7%9.1%16.5%24.3%
BrowseComp含上下文管理77.4%78.6%–76.3%73.2%63.0%77.1%––84.0%
Toolathlon Verified54.4%40.7%49.1%47.5%50.9%34.3%45.5%26.9%57.1%67.9%
AA-Briefcase917–––833870839612––
推理(通用)
GPQA Diamond89.5%89.3%84.9%87.4%89.4%86.7%87.2%67.2%83.8%89.5%
HLE纯文本31.6%27.3%25.2%28.1%32.1%26.6%29.7%9.7%17.5%35.6%
HLE†含工具47.8%48.3%40.0%40.3%45.1%37.4%46.0%17.8%42.5%48.9%
AIME 202695.5%93.3%93.6%87.7%95.8%94.2%97.1%85.1%82.2%97.6%
HMMT Feb 202690.2%87.9%82.6%71.2%93.9%78.8%86.3%66.7%63.6%98.5%
CritPt8.3%1.7%3.7%0.6%7.1%3.1%5.4%0.0%0.0%20.6%
推理(抽象)
ARC-AGI-184.0%–––––79.5%47.7%–87.7%
ARC-AGI-240.1%–––––36.5%4.0%–47.6%
事实性
SimpleQA Verified20.6%26.0%16.1%13.5%34.1%32.4%43.9%5.9%44.1%41.7%
AA Omniscience指数-9.0-29.8-9.30.7-22.9-1.02.1-4.26.9-11.6
对话
IFBench82.2%78.8%67.1%75.7%79.2%81.4%79.8%54.3%78.6%67.3%
Global-MMLU-Lite86.7%90.0%83.5%83.9%88.4%85.6%88.7%83.4%89.4%88.7%
安全性
StrongREJECT98.4%99.4%99.3%99.4%97.4%98.7%98.6%98.6%97.6%98.7%
FORTRESS对抗性71.6%77.3%64.8%86.3%32.0%77.6%78.0%91.3%70.7%83.8%
FORTRESS良性96.9%95.4%94.6%90.1%99.2%90.6%95.9%94.1%95.5%97.8%
视觉
MMMU ProStandard 1074.0%77.3%75.4%–––73.5%58.6%79.0%78.6%
Charxiv RQ原始 / 含 python77.4/81.3%80.8%/–81.0%/––––78.1/82.0%57.4%/–70.0%/–81.4%/–
音频
Audio MC†54.9%–30.4%–––56.6%–33.6%–
MMAU77.0%–73.6%–––77.2%–75.2%–
VoiceBench†90.1%–86.4%–––91.4%–85.9%–

Inkling-Small 与开放权重及闭源模型在完整评测套件上的对比。激活参数与总参数用于体现规模;破折号表示撰写时该分数尚不可用。*SWEBench Verified:Inkling 和 Inkling-Small 的数值使用仅 bash 的测试框架报告。外部模型我们采用其自报数值。*Terminal Bench 2.1:Inkling 和 Inkling-Small 的数值使用内部编码测试框架报告。发现少量解答因网络搜索受到污染,被记 0 分。外部模型在可得时我们采用其自报数值,否则使用我们的内部测试框架报告性能。†Audio MC:其他模型因不在官方排行榜上,由我们内部评测。†VoiceBench:VoiceBench 使用基于规则、硬编码的字符串匹配进行评分,因此评测对输出格式差异较为敏感。为此我们添加了一条系统消息,指示模型遵循预期的答案格式。†HLE with tools:我们使用内部测试框架对 Minimax M2.7、Claude 4.5 Haiku、Gemini 3.5 Flash-Lite 和 GPT 5.6 Luna 进行了基准测试。

在 Tinker 上试用 Inkling-Small

Tinker 客户已亲眼见证,经过恰当微调的模型可以在各类任务上超越闭源模型,而且速度更快、成本更低。我们相信,Inkling-Small 兼具广泛性能与高效,将使其易于在实际应用中实验和测试,我们也很期待看到开发者用它构建出什么。

Inkling 和 Inkling-Small 已在 Tinker 上线,限时折扣,并可在 Tinker Playground 中使用文本、图像和音频进行对话。Tinker 上的所有其他模型和检查点现也已在 Tinker Playground 上提供,按我们定价页面所列费率计费。

Inkling-Small 的诞生源于我们的使命——构建能够延伸人类意志与判断力的 AI。它是一款能力出色且高效的模型,也是我们持续推进这一工作的重要垫脚石。

来源:Thinking Machines Lab:News(网页) · thinkingmachines.ai