跳到正文
北京时间
原文
The Decoder:AI News(RSS)· Jonathan Kemper·· 2026-06-28精选AI 评分70

新浪开源VibeThinker-3B:推理可压缩,事实知识不能

Sina's open model VibeThinker-3B aims to show reasoning compresses well but factual knowledge doesn't

AI 导读

新浪发布仅3B参数的VibeThinker-3B,在AIME26等数学编程基准上持平DeepSeek V3.2等大200–333倍的模型,LiveCodeBench超越所有20B以下模型,LeetCode竞赛解决123/128题超过GPT-5.2、Kimi K2.5等。但知识密集型GPQA-Diamond大幅落后。模型基于阿里Qwen2.5-Coder-3B,经SFT、强化学习、自蒸馏等多阶段后训练。研究提出“参数压缩-覆盖假说”:逻辑推理依赖少数可压缩模式,而广泛世界知识仍需大参数。模型已开源。

推荐理由

VibeThinker-3B 用 3B 参数在数学编程上匹敌百倍大模型,推理可压缩而知识不能的假设值得深思。对做推理应用的人来说是个信号。

正文 · AI 翻译

Image description

要点

  • 微博的新模型 VibeThinker-3B 仅有三十亿参数,却在数学和编程基准测试中与规模最高达其 333 倍的顶级模型不相上下。
  • 这一表现源自对一个阿里巴巴基座模型所进行的多阶段后训练。然而,在需要广泛事实知识的任务上,这个小模型则明显落后。
  • 研究人员得出结论:结构化逻辑推理依赖的模式较少,且压缩效果好,而广泛的世界知识仍然需要大模型。

一个仅有三十亿参数的中文语言模型,在数学和编程任务上有时能与规模大其百倍的模型匹敌。其背后的研究人员提出了一种关于 AI 能力如何构成的假说。

微博的母公司新浪发布了一款小型语言模型,在高难度数学和编程任务上可与当今顶级模型一较高下。根据一份技术报告,VibeThinker-3B 在 AIME26 等竞赛基准上的表现与 DeepSeek V3.2 和 Kimi K2.5 相当。而这两款模型的参数量是它的 200 到 333 倍。

新浪将该模型定位为一项实验,旨在弄清一个模型要在顶级水平竞争究竟需要多少算力。其前代 VibeThinker-1.5B 于 2025 年 11 月发布。新版本更进一步,追问一个小模型能否真正达到顶级性能,而不只是“在其规模下表现不错”。

Sechs Balkendiagramme vergleichen VibeThinker 3B mit Qwen3.6 Plus, Gemini 3 Pro, GLM-5, Kimi K2.5 und Claude Opus 4.5 auf den Benchmarks AIME'25, AIME'26, LiveCodeBench v6, IMO-AnswerBench, HMMT'25 und IFBench; die schraffierte Balkenerweiterung markiert den Zugewinn durch CLR-Test-Time-Scaling.
在六项数学与编程基准测试中,这个 3B 模型(橙色)落入了五款当前顶级模型的性能区间,包括 Gemini 3 Pro、GLM-5 和 Claude Opus 4.5。| 图片:新浪微博

逻辑能力可以缩小,事实知识不行

结果讲述了两件不同的事。在解答可清晰验证的结构化任务上,比如数学奥林匹克竞赛或编程挑战,VibeThinker-3B 能与 GLM-5 或 Gemini 3 Pro 这类模型匹敌。在 LiveCodeBench 上,它击败了所有 200 亿参数以下的模型。

事实知识则是另一回事。在知识密集型的 GPQA-Diamond 基准测试上,该模型远远落后于体量大得多的竞争对手。

Horizontales Balkendiagramm zur IMO-AnswerBench-Punktzahl von Open-Source-Reasoning-Modellen samt Parameterzahl; VibeThinker-3B erreicht mit 3 Milliarden Parametern 76,4 Punkte und mit CLR 80,6 und liegt damit im Bereich von DeepSeek V3.2 (671B), GLM-5 (744B) und Kimi K2.5 (1T).
VibeThinker-3B 在 IMO-AnswerBench 上几乎追平 DeepSeek V3.2、GLM-5 和 Kimi K2.5,尽管其体量小了数百倍。| 图片:新浪微博

为排除数据污染,团队让该模型参加了 2026 年 4 月下旬至 5 月下旬举行的 LeetCode 竞赛,这些竞赛均在训练结束之后举办。VibeThinker-3B 首次尝试就解出了 128 道题中的 123 道。这使它领先于 GPT-5.2、Qwen3-Max、Kimi K2.5 和 Claude Opus 4.6。它仅落后于 GPT-5.3-Codex、Gemini 3.1 Pro 和 Gemini 3 Flash,但差距不大。

后训练承担了主要工作

VibeThinker-3B 基于阿里巴巴的 Qwen2.5-Coder-3B 构建。新浪的贡献在于后训练,即在大规模数据集上完成通用预训练之后发生的一切。根据该报告,正是这一点让一个 3B 模型接近顶尖表现者。

后训练分阶段进行。首先,模型通过监督微学习广泛的任务,涵盖数学、编程和通用对话。然后针对困难的多步推理问题进行定制。

接下来是强化学习,依次应用于数学、编程和 STEM。随后通过自蒸馏将每个阶段的技能整合到单一模型中。最后一步确保模型更好地遵循指令。

Ablaufdiagramm der Trainingspipeline von VibeThinker-3B vom Base Model über zweistufiges Supervised Fine-Tuning und mehrstufiges Reasoning RL für Math, Code und STEM bis zum abschließenden Instruct RL, mit Offline Self-Distillation als Rückkopplungsschritt.
正是后训练带来了性能飞跃。两阶段监督微调、针对数学、代码和 STEM 的多阶段推理强化学习,外加最后的指令阶段以提升提示词遵循能力。| 图片:新浪微博

在微调过程中,团队刻意构建多样化的解题路径。强化学习随后强化那些有效的路径。其论点是,性能来自训练方法、数据质量和可靠的验证信号,而非更多参数。

这对 AI 能力的运作方式意味着什么

基于这些结果,作者提出了他们所称的“参数压缩-覆盖假说”。不同的 AI 能力具有不同的结构,需要不同数量的参数。

逻辑推理,比如一步步解出一道数学题,依赖于几种反复出现的模式:搜索、检查条件、纠正错误、组合中间结果。这类技能可以被压缩进一个紧凑的核心。世界知识则不同。要回答横跨众多主题的开放式问题,需要广泛的覆盖,这意味着大量参数来存储大量事实。

研究人员表示,这重新定义了小模型的用途。它们不只是为低成本推理而打造的廉价、轻量版本,而是一条与传统扩展逻辑并行的独立研究路径。在任务可验证且具有清晰解题结构的场景中,参数数量不再是瓶颈。

VibeThinker-3B 已在 Hugging Face 和 GitHub 上公开提供。

小模型在窄任务上追赶大得多的系统,正成为一种模式。今年 4 月,阿里巴巴的 Qwen3.6-27B 在所有编程基准上超越了其前代模型,而后者规模是它的 15 倍。据其开发者称,来自阿布扎比的 Falcon H1R 7B 达到了其规模 2 到 7 倍模型的表现水平。更早的 关于小模型逻辑缺口的研究表明,它们在多步推理上通常会撞墙。VibeThinker 在可验证任务上的结果恰恰挑战了这一假设。

来源:The Decoder:AI News(RSS) · the-decoder.com