跳到正文
北京时间

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 481–500 条 · 共 592 条
1月14日周三
  1. 美团 LongCat:HuggingFace 新模型

    美团LongCat发布重思考模式总结模型

    美团LongCat推出基于5600亿参数MoE架构大模型LongCat-Flash-Thinking-2601的重思考模式(Heavy Thinking Mode),并发布LongCat-HeavyModel-Summary模型。该模式通过并行思考与总结两阶段协同扩展推理能力:前者以高温度并行生成多路径扩展宽度,后者将精炼轨迹递归反馈形成迭代循环延伸深度。模型经额外强化学习优化总结能力,已在Longcat AI平台上线。

    推荐理由:美团开源 560B 参数 MoE 推理模型,Heavy Thinking 模式支持并行多路径探索,已上线可体验

1月6日周二
  1. Hugging Face:Blog(RSS)80

    NVIDIA发布Cosmos Reason 2模型,增强物理AI推理能力

    NVIDIA在Hugging Face上发布了Cosmos Reason 2模型,旨在提升物理AI系统的推理能力。该模型通过改进的推理架构,使AI能更准确地理解和预测物理世界的动态与交互,核心升级包括对复杂场景的多步推理、不确定性量化及时间序列数据的深度理解。这一进展将推动机器人、自动驾驶等领域的发展,使AI在现实环境中的决策更可靠、更符合物理规律。

    推荐理由:物理AI推理能力升级,机器人和具身智能落地的关键拼图

12月23日周二
  1. Saining Xie

    不想陷入哲学辩论,但这本书确实改变了我对这个话题的看法,让我更加谦逊。人类智能令人印象深刻,但称其为"通用"并不太客观。我的猫会不同意。 在我看来,人类智能更应被视为社会驱动的认知适应,而且我们仍不理解、也远未用当前 AI 复现的智能领域还有巨大 WORLD。 [引用 @demishassabis]:Yann 在这里完全错了,他把通用智能和 universal intelligence 混淆了。 大脑是我们在宇宙中所知最精致、最复杂的现象(迄今为止),而且它们实际上极其通用。 显然,没有人能规避 no free lunch theorem,因此在实际且有限的系统中,总是必须围绕正在学习的目标分布有一定程度的专门化。 但关于通用性的要点在于,理论上,在 Turing Machine 的意义上,这种通用系统的架构能够在给定足够时间和内存(以及数据)的情况下学习任何可计算的东西,而人脑(和 AI foundation models)是近似 Turing Machines。 最后,关于 Yann 对国际象棋棋手的评论,人类竟然能发明国际象棋(以及现代文明的所有其他方面,从科学到 747s!),更不用说像 Magnus 这样的人能下得如此出色,这本身就令人惊叹。他可能不是严格最优的(毕竟他有有限的记忆和有限的决策时间),但考虑到我们的大脑是为狩猎采集而进化的,他以及我们能用大脑做到这些,实在令人难以置信。

    引用Demis Hassabis@demishassabis

    Yann在这里完全说错了,他把通用智能和万能智能混为一谈了。 大脑是我们在宇宙中(迄今为止)所知的最精妙、最复杂的现象,而且它们事实上极其通用。 显然,人们无法绕过“没有免费午餐”定理,因此在一个实际且有限的系统中,总得围绕所学习的目标分布存在某种程度的专门化。 但关于通用性的要点在于,从理论上讲,在图灵机的意义上,这样一个通用系统的架构能够在给定足够时间、内存(和数据)的情况下学习任何可计算的东西,而人脑(以及AI基础模型)都是近似的图灵机。 最后,关于Yann对国际象棋棋手的评论,令人惊叹的是人类竟然能首先发明国际象棋(以及现代文明从科学到747飞机的所有其他方面!),更不用说像Magnus这样的人能把它下得如此出色。他可能并非严格意义上的最优(毕竟他的记忆有限,做决定的时间也有限),但考虑到他和我们的大脑是为狩猎采集而进化出来的,我们能用大脑做到的事情实在令人难以置信。

    推荐理由:顶级科学家对AGI本质的深刻思辨,重新定义通用智能的边界与局限

12月5日周五
12月4日周四
12月1日周一
  1. 公众号:DeepSeek(深度求索)66

    DeepSeek V3.2 正式版:强化 Agent 能力,融入思考推理

    DeepSeek 发布正式版 V3.2 与长思考增强版 V3.2-Speciale。V3.2 在推理 Benchmark 中达到 GPT-5 水平,并成为首个支持思考与非思考模式工具调用的模型。

    推荐理由:半年前的这版更新,把 Agent 和思考推理揉进了开源模型,回头看算是 DeepSeek 在智能体能力上的关键一刀,做 Agent 开发的至今绕不开它。

  2. DeepSeek:API 更新日志85

    DeepSeek-V3.2 及 DeepSeek-V3.2-Speciale 发布

    DeepSeek 将 deepseek-chat 和 deepseek-reasoner 均升级为 DeepSeek-V3.2,分别对应非思考模式与思考模式。同时非正式部署 DeepSeek-V3.2-Speciale 的 API 服务,价格不变,仅支持思考模式对话,不支持工具调用,最大输出长度默认 128K,服务截止至北京时间 2025-12-15 23:59。

    推荐理由:我觉得DeepSeek V3.2的亮点不是参数,而是思考模式正式接入主力API,意味着推理能力常态化,Speciale那个128K输出更像压力测试,做长文档的可以抓住窗口期探上限。

11月26日周三
  1. Prime Intellect(网页)69

    Prime Intellect 发布 INTELLECT-3:106B 参数 MoE 模型,大规模 RL 训练并全栈开源

    Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 MoE 模型,在 GLM-4.5-Air 基座上经 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上达到同规模最先进水平。

    推荐理由:原文给出了完整的模型权重、训练框架与 RL 环境开源清单,读者可以据此复现大规模强化学习后训练。

11月25日周二
  1. Hugging Face:Blog(RSS)76

    从第一性原理看连续批处理

    连续批处理是优化大型语言模型推理吞吐量的核心技术,通过并行处理多个对话并在生成完成后动态交换任务,以最大化硬件利用率。从注意力机制和KV缓存的基础原理出发,文章推导了如何通过优化批处理提升性能。注意力层具有二次复杂度,但连续批处理允许查询、键和值张量容纳不同长度的令牌序列,从而同时处理预填充和解码阶段。该技术能显著降低生成每个令牌的计算成本,适用于高负载服务场景,提升响应速度。

    推荐理由:深入理解LLM推理优化原理,助力高效模型部署。

11月19日周三
  1. Hugging Face:Blog(RSS)78

    Apriel-H1:蒸馏高效推理模型的关键要素

    ServiceNow-AI在Hugging Face发布博客,介绍了其提出的Apriel-H1方法,该方法通过知识蒸馏技术有效提升小型模型的推理能力。该方法的核心在于从大型模型中提取并转移复杂的推理路径,使蒸馏后的小模型在多项推理任务上表现显著提升,同时保持高效的部署性能。这一技术为在资源受限环境中部署高性能推理模型提供了新思路。

    推荐理由:新蒸馏方法可能大幅降低推理模型部署成本,开发者可借鉴实践。

11月15日周六
  1. Anthropic:Transformer Circuits(可解释性研究)83

    2025年11月电路更新:解读模型在危害压力下的多选题行为机制

    Anthropic可解释性团队研究了危害压力对Claude 3.5 Haiku模型多选题回答的影响。实验使用129个二选一问题,当添加有害意图语句时,模型准确率从100%骤降至48.1%。机制分析表明,注意力头中的“拒绝”查询特征与“危害检测”关键特征发生负向交互,显著降低了模型对正确答案的关注度。仅对该拒绝特征进行负向调控,即可将准确率恢复至93%。这证明模型在压力下并未改变事实认知,而是通过干扰注意力机制来主动拒绝提供正确答案,为理解模型拒绝行为提供了新视角。

    推荐理由:揭示模型拒绝有害请求的内部机制,助力 AI 安全与可解释性研究。

11月13日周四
10月29日周三
  1. Cognition 模型 / Devin 博客(网页)64

    Cognition 发布 SWE-1.5 编码智能体模型,经 Cerebras 推理达 950 tok/s

    Cognition 发布软件工程模型 SWE-1.5,参数达数千亿级,与 Cerebras 合作以最高 950 tok/s 提供推理,速度为 Haiku 4.5 的 6 倍、Sonnet 4.5 的 13 倍。

    推荐理由:原文给出速度基准与模型加推理加智能体框架协同的训练细节,读者可据此评估高速编码智能体方案的可行性。

10月24日周五
  1. Google DeepMind:Blog(RSS)

    带 Deep Think 的 Gemini 高级版本在 IMO 中正式达到金牌标准

    集成 Deep Think 的 Gemini 高级版本在国际数学奥林匹克(IMO)中达到金牌水平。IMO 自1959年起每年举办,是全球最顶尖的青年数学家竞赛,各国派出6名精英学生角逐代数、组合、几何和数论领域的6道极难题目。

    推荐理由:Gemini Deep Think在IMO数学竞赛达到金牌标准,推理能力获重大突破

10月15日周三
  1. Claude Platform:开发者版本说明(RSS)64

    Claude Haiku 4.5 发布:最快最智能的 Haiku 模型,性能接近前沿

    Anthropic 推出 Claude Haiku 4.5,定位为最快且最智能的 Haiku 系列模型,性能接近前沿水平。该模型专为实时应用、高吞吐量处理以及对推理能力要求较高的成本敏感型部署场景设计。

    推荐理由:这是Haiku系列首次拥有接近前沿的性能,高速低成本让它在实时应用和高吞吐场景里很有竞争力,做成本敏感AI产品的值得认真考虑。

  2. Anthropic:Transformer Circuits(可解释性研究)83

    Circuits 更新 — 2025年10月

    Anthropic可解释性团队分享了多项研究进展。研究发现,从Haiku 3.5到Sonnet 4.5等模型中存在跨模态视觉特征,能够识别ASCII艺术和SVG代码中编码的语义概念,如眼睛、嘴巴、狗、猫等。这些特征依赖于视觉描绘的上下文环境,例如,SVG圆形元素只有在位于激活“面部”特征的更大结构中时才会激活“眼睛”特征。在生成过程中对部分特征进行引导,可以对应修改文本艺术的语义,例如将ASCII表情从皱眉转为微笑,或为SVG面部添加皱纹。研究还发现模型存在类似“人脸幻想”的倾向,会将形状解释为动物绘图的组成部分。这些特征对人类手绘的SVG同样有效。

    推荐理由:为AI可解释性研究提供新实验方法,启发跨模态模型设计。

9月29日周一
  1. 公众号:DeepSeek(深度求索)79

    DeepSeek-V3.2-Exp 发布,引入稀疏注意力提升长文本效率,API 降价超 50%

    DeepSeek 发布实验性模型 DeepSeek-V3.2-Exp,在 V3.1-Terminus 基础上引入 DeepSeek Sparse Attention(DSA)稀疏注意力机制,在几乎不影响输出效果的前提下大幅提升长文本训练和推理效率,公开评测表现与 V3.1-Terminus 基本持平。

    推荐理由:稀疏注意力在几乎不影响效果的前提下大幅降低长文本成本,API 降价 50% 让依赖长上下文的应用获得了更现实的部署条件。

  2. 蚂蚁 inclusionAI:GitHub 新仓库58

    inclusionAI/dInfer

    inclusionAI团队发布了dInfer,一个专为扩散语言模型设计的高效推理框架。该框架旨在解决扩散模型在文本生成领域推理速度慢、资源消耗大的核心挑战。dInfer通过一系列底层优化技术,显著提升了推理效率,能够更快地生成文本,同时降低计算成本,为扩散模型在更广泛的实际应用场景中部署提供了关键技术支持。

    推荐理由:蚂蚁把扩散语言模型的推理框架开源了,这类模型的推理效率一直是落地瓶颈,做端侧或低成本部署的团队值得看看能不能接上。

9月22日周一