跳到正文
北京时间

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 141–160 条 · 共 592 条
7月21日周二
  1. 公众号:小红书技术(dots.llm)81

    小红书 dots 模型获 IMO 2026 满分金牌

    小红书 dots 团队携内部版本 dots-note 3.0 参加第 67 届 IMO 2026,六道题均获满分,以 42/42 分取得满分金牌,全球仅 7 位人类选手获此成绩。模型不依赖形式化语言,直接读取原始 LaTeX 题目,通过递归自我批判能力端到端完成解题。dots-note 3.0 是 dots3 系列最轻量级模型,预期将开源。

    推荐理由:IMO满分金牌这个里程碑,背后是模型递归自我批判能力的突破。不依赖形式化验证就能给出优雅证明,这对数学推理研究是个真信号,做推理方向的值得细读。

  2. 公众号:小红书技术(dots.llm)77

    小红书dots模型取得IMO 2026满分金牌成绩

    小红书dots团队携dots-note-3.0内部版本参加IMO 2026,六题均获满分7分,以42/42分取得满分金牌,全球仅7位人类选手获满分。该模型不依赖形式化语言,直接读取原始LaTeX题目,通过Proof、Verify、Refine三环节递归自我批判完成解题。dots-note-3.0是dots3系列最轻量级模型,预期将开源。

    推荐理由:dots模型在IMO满分验证了递归自我批判方法的有效性,这种不依赖形式化验证、通过自我质疑改进推理的路径,可能为科学研究等难以量化的复杂任务提供新的解决思路。

7月20日周一
  1. 公众号:小红书技术(dots.llm)76

    小红书、北大开源 UltraEP:面向大规模 MoE 训推的「最优」负载均衡方案

    小红书与北大开源 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家,平均达到理想性能的 94.3%,相比业界 SOTA 训推框架提升 1.49 倍。该方案已在 288B 参数 MoE 模型的完整预训练中部署,保持不低于理想性能 92% 的水平。

    推荐理由:动态复制热点专家替代了基于历史窗口的重排,将MoE训推吞吐从理想的一半拉至90%以上,对自研大规模模型的团队而言,是一套可落地的负载均衡方案。

  2. 公众号:面壁智能(MiniCPM)70

    面壁智能发布首个具身智能成果 MiniCPM-Robot 系列模型,正式进军机器人领域

    面壁智能联合 OpenBMB 在世界人工智能大会上发布并开源首个具身智能成果 MiniCPM-Robot 系列,包括 1.5B 通用 VLA 模型 MiniCPM-RobotManip 与 0.9B 跟踪模型 MiniCPM-RobotTrack。

    推荐理由:1.5B VLA模型通过视觉token压缩将带记忆推理成本降至与单帧反应式相近,使得需要持续上下文理解的机器人操作任务不再受算力约束。

  3. Tomer Tunguz 博客(VC 分析)62

    开源模型逼近前沿:Kimi K3、Qwen 3.8、DeepSeek V4 密集发布

    开源与闭源模型差距持续缩小,7月中旬起多款开源大模型密集发布:Moonshot 于7月16日推出 2.8T 参数开源权重模型 Kimi K3,阿里于7月19日预览 2.4T 参数的 Qwen 3.8,DeepSeek V4 于7月中旬结束预览。

    推荐理由:作者用价格对比和近期开源发布梳理开源与闭源模型的追赶节奏,指出竞争如何压低推理成本并影响行业利润率。

7月19日周日
  1. 公众号:面壁智能(MiniCPM)64

    面壁智能发布端侧模型 MiniCPM5-2B,登顶 4B 以下性能榜首

    面壁智能联合 OpenBMB 在 WAIC 2026 发布端侧模型 MiniCPM5-2B,以 2B 参数量在 AA-Index 榜单登顶 4B 以下模型榜首,平均分 54.26,超 Qwen3.5-2B(41.66)。模型原生支持混合思考与 512K 上下文,Agent 能力得分 90.35,并完成华为昇腾、英伟达等 9 款芯片的 Day0 适配。

    推荐理由:长文本理解得分42.33、Agent能力τ²-Bench得分90.35,这些具体指标为端侧开发者评估2B模型的多步推理和工具调用提供了明确参照。

7月18日周六
  1. Artificial Analysis76

    过去八天内,Grok 4.5、GPT-5.6、Muse Spark 1.1 与 Kimi K3 四款前沿模型相继发布,使 Artificial Analysis Intelligence Index 得分超 50 的实验室从 6 月初的 2 家增至 6 家。

    推荐理由:八天四个前沿模型,Frontier 从两家实验室变成六家,前三名分差仅三分,而且价格正在暴跌,模型选型的逻辑从「谁第一」变成了「够用且便宜」——对产品经理来说是真正的转折点。

7月17日周五
  1. Hacker News 热门(buzzing.cc 中文翻译)78

    Schema Harness 在 ARC-AGI-3 公开集上取得约 99% 成绩

    Schema 框架在 ARC-AGI-3 公开集上,使用 Claude Opus 4.8 和 Fable 5 达到 99% RHAE 分数,使用 GPT-5.6 Sol 达到 95.35%。该框架不修改模型权重,而是将原始观测转化为可编辑程序,联合解决状态归因和机制发现问题。此前最强模型 GPT-5.6 Sol 在半私有集上仅得 7.78%。

    推荐理由:在无规则的游戏里逆推出物理规律,这比刷榜更重要的是提供了一种让模型自己构建世界模型的方法论,做 agent 的值得细读。

  2. 公众号:月之暗面(Kimi)80

    Kimi K3:智能的新前沿

    Kimi 发布迄今能力最强的开源模型 Kimi K3,拥有 2.8 万亿参数、100 万 token 上下文窗口,原生支持视觉理解。该模型在长程编程、知识工作等场景表现前沿,整体能力仅次于 Claude Fable 5 和 GPT-5.6 Sol。即日起可通过 kimi.com 及官方 App 使用,完整模型权重将于 2026 年 7 月 27 日前发布。

    推荐理由:Kimi K3 以 2.8 万亿参数开源,虽自承不及闭源顶尖,但长程编码与知识工作案例扎实,是国产开源模型冲击前沿的关键一步,开发者值得跟进。

  3. 公众号:月之暗面(Kimi)83

    Kimi K3:智能的新前沿

    月之暗面推出迄今能力最强的开源模型 Kimi K3,拥有 2.8 万亿参数、100 万 token 上下文窗口,基于 KDA 混合线性注意力机制构建,原生支持视觉理解。它在长程编程、知识工作等场景表现前沿,但整体仍落后于 Claude Fable 5 和 GPT-5.6 Sol。即日起可通过 kimi.com 等渠道使用,完整权重将于 2026 年 7 月 27 日前发布。

    推荐理由:K3 把 2.8 万亿参数开源,并展示了从内核优化到芯片设计的连贯长程能力,为评估开源模型在复杂工程任务中的实际上限提供了参照。

  4. HuggingFace Daily Papers(社区热门论文)74

    从预训练到后训练:理解推理能力的强化学习缩放规律

    一项新研究以国际象棋为受控实验平台,系统探究了预训练与强化学习(RL)在推理任务中的交互关系。研究发现,给定RL计算量下的后训练性能可由预训练损失准确预测,且RL奖励曲线的斜率随预训练token数近似线性提升。在1B参数数学语言模型上,更长预训练的检查点在RL下性能更高、提升更快。

    推荐理由:这篇论文提出一个将预训练与RL联系起来的缩放定律,用国际象棋当试验场,发现RL在不同难度问题上的效果很不一样,做训练的人可以据此重新想想算力怎么分。

  5. HuggingFace Daily Papers(社区热门论文)81

    RecGPT-V3 技术报告:状态化混合模态推荐系统在淘宝部署,IPV 提升 1.28%、GPU 成本降低 52.4%

    淘宝部署的 RecGPT-V3 采用状态化行为建模、混合模态基础模型(融合文本标签与 Semantic IDs)和潜在意图推理,将用户建模计算量降低 55.8%,输出 token 成本下降。在“猜你喜欢”信息流的大规模在线 A/B 测试中,IPV 提升 1.28%、CTR 提升 1.00%、TC 提升 1.97%、GMV 提升 3.97%,端到端服务资源消耗降低 52.4%。

    推荐理由:淘宝首页推荐搬上大模型做推理引擎,记忆+混合模态+潜在推理三件套,带来 +1.28% IPV 同时节省 52.4% 算力,推荐系统真的开始重写成本公式了。

  6. Moonshot AI:Kimi Blog81

    Kimi K3 发布:2.8T 参数开源模型,具备原生视觉与百万 token 上下文窗口

    月之暗面发布 Kimi K3,一个 2.8T 参数的开源模型,采用 Kimi Delta Attention 和 Attention Residuals 架构,支持原生视觉能力与 100 万 token 上下文窗口。

    推荐理由:首个开源 3T 级模型,架构上有 KDA 和 AttnRes 创新,在超长程编码和知识工作上比肩闭源。权重两周后放出,所有做 agent 的都该盯紧。

7月16日周四
  1. Google AI:DEV 作者专属(RSS)72

    DiffusionGemma 开发者指南发布

    Google AI 发布 DiffusionGemma 开发者指南,该实验性模型基于 Gemma 4 架构,采用计算受限并行生成,在单张 NVIDIA H100 上实现 1000+ tokens/秒的生成速度。模型为 26B 参数的 MoE 架构,推理时仅激活 3.8B 参数,可在 18 GB VRAM 内量化部署。

    推荐理由:虽然 DiffusionGemma 是实验性的,但把文本生成从内存带宽瓶颈转向计算瓶颈的思路非常新颖,这篇指南给出了可落地的服务方案和微调手法,做推理优化的值得跟进。

  2. 公众号:小红书技术(dots.llm)77

    HYPIC:小红书联合北大、上交提出首个混合注意力大模型位置无关缓存系统

    HYPIC 在混合注意力大模型上实现了位置无关缓存,将首 token 延迟平均降低 3.25 倍。在 4 个生产级模型上,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。

    推荐理由:混合注意力模型终于有了可用的位置无关缓存方案,HYPIC 用转移算子缓存和缝合窗口解决了长期兼容难题,对长上下文推理服务的加速意义重大,做推理 infra 的团队可以马上看论文和代码。

  3. 公众号:小红书技术(dots.llm)75

    小红书联合北大、上交提出 HYPIC,让混合注意力大模型用上位置无关缓存,首 token 延迟降 3.25 倍

    小红书联合北大、上交提出 HYPIC,这是首个在混合注意力大模型上实现位置无关缓存的服务系统。在 4 个生产级混合注意力模型、5 个工作负载上,HYPIC 将首 token 延迟(TTFT)平均降低 3.25 倍,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。该系统通过缓存段累积转移算子实现线性层常数时间状态组合,并用缝合窗口修复全注意力层跨段对齐。

    推荐理由:此前位置无关缓存无法用于混合注意力模型,HYPIC 通过缓存转移算子与缝合窗口首次实现,RAG 场景 TTFT 降低 3.25 倍,开源代码为推理系统提供了可复用的加速路径。

  4. Thinking Machines70

    今天,我们推出 Inkling。 Inkling 能高效地对文本、图像和音频模态进行推理。我们将提供完整权重。 https://thinkingmachines.ai/news/introducing-inkling/ 即日起可在 Tinker 上进行微调。在 Inkling Playground 中试用。🧵

    推荐理由:多模态推理终于有了开放权重的选项,Inkling不是最强的,但可能是最方便你上手微调的。想试试多模态Agent的,今天就能在Playground玩。

7月15日周三
  1. Together AI 研究与产品博客(RSS)76

    Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 提供 Day 0 推理服务

    Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 于发布当日在其 Serverless 平台提供访问,支持 1M 上下文窗口和 OpenAI 兼容 API。

    推荐理由:原文来自提供推理服务的合作方,给出了 Inkling 的架构细节、参数规格和初步评测,读者可据此了解新模型的技术取向与可用入口。

  2. Hacker News 热门(buzzing.cc 中文翻译)76

    Bonsai 27B:首款可在手机上运行的27B级多模态模型

    Bonsai 27B 基于 Qwen3.6 27B,提供三元(1.71 有效比特/权重,5.9 GB)和 1-bit(1.125 有效比特/权重,3.9 GB)两个变体,后者首次将 27B 级模型装入 iPhone 17 Pro。模型支持多步推理、结构化工具调用、视觉任务和计算机使用智能体循环,拥有 262K token 上下文窗口,支持推测解码加速。在 15 项基准测试中,三元变体保留全精度基线 95% 的性能,1-bit 变体保留 90%,数学和编码能力几乎无损。采用 Apache 2.0 许可证开源。

    推荐理由:1-bit 量化把 27B 模型压到 4GB,首次能在 iPhone 上跑,agent 循环零边际成本,做端侧产品的该坐不住了。

7月14日周二
  1. Google AI:DEV 作者专属(RSS)68

    DiffusionGemma 发布:文本扩散模型实现 4 倍加速推理

    Google 发布实验性开源模型 DiffusionGemma,采用文本扩散技术并行生成 256 token 块,推理速度最高提升 4 倍。该 26B MoE 模型仅激活 3.8B 参数,量化后适配 18GB VRAM 消费级 GPU,在单张 H100 上达 1000+ tokens/s。

    推荐理由:Google把扩散模型首次做进大语言模型,生文速度提升4倍,还开源了权重。虽然实验性质量打折,但本地实时交互的开发者终于有个新选项可以玩了。