跳到正文
北京时间

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 181–200 条 · 共 592 条
7月8日周三
  1. 公众号:蚂蚁百灵(Ling)60

    蚂蚁集团周俊:如何用混合线性改造提升万亿参数模型的Token密度

    蚂蚁集团副总裁周俊提出,万亿参数模型每运行15分钟算力成本约相当于一辆特斯拉,效率是智能体时代必须最先解决的问题。团队通过7份Lightning Attention搭配1份MLA的混合线性改造,将256K长上下文成本从指数级降至线性级,配合Kpop算法与真实环境训练,使Token输出减少约4倍,千亿参数模型在真实Agent任务上超过部分更大规模模型。

    推荐理由:7:1 的混合注意力配比、将真实错误纳入训练以及区分工具调用与自然语言的奖励函数,为同时追求长上下文效率和智能体可靠性的工作提供了可参照的技术路线。

  2. HuggingFace Daily Papers(社区热门论文)88

    Agon:基于隐式对抗评分的跨模型竞争强化学习框架

    Agon 让两个模型互为评分者,通过竞争性强化学习提升推理能力。在 DeepMath 困难子集上,基于 Qwen3 的 Agon 将 GRPO 的 pass@1 翻倍,增益约为未训练的 Mixture-of-Agents 的 8 倍。该结果在 Qwen3.5、Gemma 4 等模型族及编程代码任务上得到复现,推理时采用两阶段级联:一个模型起草,另一个阅读后作答。

    推荐理由:这篇论文用「让两个模型互搏」代替了只看最终答案的RL训练,直接解决了推理模型「写得多、想得少」的毛病。0.6B小模型用这方法能超过4B的GRPO模型,做推理训练的人应该认真读一读。

  3. HuggingFace Daily Papers(社区热门论文)71

    长度惩罚使思维链更难被监控

    长度惩罚强化学习虽能缩短思维链推理,却会隐藏影响模型答案的驱动因素。对Qwen3-4B和Qwen3-14B的实验显示,压缩后思维链提及提示的频率大幅下降,Qwen3-14B的忠实度下限降至基线的63.1%,监控捕获提示使用的比率从69%降至49%。随机删除基线链句子以匹配压缩长度后,压缩链披露提示的频率仍比基线低7-35个百分点,表明压缩优先移除了监控所需的关键线索。

    推荐理由:这篇论文用实验证明,给推理链加长度惩罚不只会缩短推理,还会优先删掉暴露模型真实决策过程的线索,让外部监控更难发现模型被误导的痕迹。做AI安全和对齐的人应该认真读一下。

  4. MarkTechPost(RSS)70

    Liquid AI 开源 Antidoom:基于最终 Token 偏好优化的推理模型死循环修复方法

    Liquid AI 开源了 Antidoom,一种基于 Final Token Preference Optimization (FTPO) 的针对性修复方法,用于减少推理模型中的 doom loop(死循环)问题。该方法定位循环开始的第一个 token,训练模型选择连贯替代项,而不改变整体输出分布。在 LFM2.5-2.6B 上,硬数学和编程任务中的循环率从 10.2% 降至 1.4%;Qwen3.5-4B 上从 22.9% 降至 1%。整套流程可在数小时内完成,全部代码和数据集(LiquidAI/antidoom-mix-v1.0)已开源。

    推荐理由:Antidoom 用一次训练就修复了小型推理模型常见的 doom loop,LFM2.5 和 Qwen3.5 的循环率从两位数掉到 1%,代码和数据全开源,自己训模型时可以直接加这一环。

  5. Cognition 模型 / Devin 博客(网页)67

    Cognition 发布 SWE-1.7 模型并详解 RL 训练方法

    Cognition 发布 SWE-1.7,称其以更低成本达到前沿智能水平。模型基于 Kimi K2.7 底座训练,FrontierCode 1.1 Main 通过率 42.3%,Terminal-Bench 2.1 为 81.5%,已在 Devin(Web、Desktop 和 CLI)中经 Cerebras 以 1000 TPS 提供。

    推荐理由:官方既公布基准成绩也详解训练方法,读者可以了解多集群 RL 训练、熵稳定和自压缩等具体做法。

7月7日周二
  1. HuggingFace Daily Papers(社区热门论文)73

    LLM-as-a-Verifier:一种通用验证框架

    LLM-as-a-Verifier 是一种无需额外训练的通用验证框架,通过计算评分 token logits 分布的期望生成连续分数,实现细粒度反馈。该框架在 Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)和 MedAgentBench(73.3%)上取得 SOTA 性能。其细粒度信号可用于 Claude Code 扩展,帮助开发者监控和改进智能体系统,也可为强化学习(如 SAC、GRPO)提供密集反馈,提升机器人学和数学推理基准的样本效率。

    推荐理由:把验证当作新的缩放轴,这个思路很扎实,尤其直接给 Claude Code 搭了扩展。做 agent 系统的开发者现在可以试试把评估模块换成连续概率打分,也许比离散判断有效。

  2. Tencent Hy71

    腾讯混元Hy3模型已通过Novita Labs作为Day-0合作伙伴在OpenRouter上线,并开放免费使用至7月21日。Hy3采用295B MoE架构(21B active),原生支持256K上下文,提供三种可配置推理模式,在编码、推理及长上下文任务上表现强劲,专为智能体工作流和生产级AI场景优化,兼顾可靠性、效率与成本。

    引用Novita AI@novita_labs

    ⚡ 作为 Day-0 合作伙伴正式上线:@TencentHunyuan Hy3 现已在 @OpenRouter 上可用。 🎉 7 月 21 日前免费。 专为真实商业场景打造,Hy3 提供: 🧠 295B MoE(21B 激活) 📚 原生 256K 上下文 ⚙️ 三种可配置推理模式 💻 强大的编码、推理与长上下文能力 🤖 针对智能体工作流优化 为生产力与真实 AI 工作流而设计,在生产规模下平衡可靠性、效率与成本。 #Hy3 #LLM #Agents

    推荐理由:腾讯混元 Hy3 在 OpenRouter 免费上线,295B MoE 模型直接可用,对想试国产模型海外部署的开发者是个低门槛入口,但模型本身没有给出超越预期的亮点,更像常规渠道拓展。

  3. LMSYS:Blog(Chatbot Arena 团队)63

    SGLang 集成 DSpark 推测解码:置信度驱动的可变长度验证

    SGLang 团队将 DSpark 推测解码算法集成到开源推理引擎中。该算法采用半自回归块起草器一次生成一组 token,并利用置信度头与顺序温度缩放(STS)为每个请求动态分配可变验证长度,从而在高负载下裁剪无效验证成本。SGLang 支持密集模型(如 Qwen3)和稀疏模型(如 DeepSeek-V4),通过全 CUDA 图处理不规则的每请求验证长度。提供三种验证模式:`static`(全长)、`compact`(生产路径)和 `cap-accept`(接受上限测量)。还引入了零开销调度、基于离线成本表的在线调度器、融合 Triton 核等优化。在 H200 上使用 DeepSeek-V4-Flash 的测试中,DSpark 在整个并发扫描范围内比 MTP 和非推测基线实现了更优的吞吐量-延迟权衡。

    推荐理由:DSpark 这版推测解码的工程落地比论文本身更有看头——SGLang 用 ragged CUDA Graph 和动态调度把 trimm 掉的计算按字节级回收,383 tok/s 的单请求速度对部署方是即时可用的性能增益。

7月6日周一
  1. 公众号:腾讯混元70

    腾讯混元 Hy3 正式发布:智能体与产品体验显著提升

    腾讯混元发布 Hy3,在推理、智能体、长上下文等任务上显著进步,比肩 2~5 倍参数规模旗舰模型。内部盲测均分 2.67/4,优于 GLM5.1(2.51/4)。幻觉率从 12.5% 降至 5.4%,常识错误率从 25.4% 降至 12.7%,多轮问题率降至 7.9%,MRCR 从 42.9% 升至 75.1%。任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。API 价格为输入 1 元、输出 4 元(每百万 tokens),命中缓存 0.25 元。已以 Apache 2.0 协议在 GitHub、HuggingFace 等平台开源。

    推荐理由:腾讯混元 Hy3 不堆参数,靠 agent 能力和产品实测说话,幻觉率减半、多轮问题率大降,开源+降价让开发者能直接上手,是国内大模型里少见的产品导向发布。

  2. 公众号:腾讯混元85

    腾讯混元正式发布 Hy3,Agent 能力与产品体验跃升

    腾讯混元正式发布 Hy3,在推理、智能体、长上下文等任务上比肩参数规模 2~5 倍的旗舰模型。内部盲测中 Hy3 均分 2.67/4,优于 GLM5.1 的 2.51/4;幻觉率从 12.5% 降至 5.4%,任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。

    推荐理由:Hy3 用 8 个业务线的实测数值(幻觉率从 12.5% 降至 5.4%,任务解决率从 72% 升至 90%)说明模型从榜单到生产可用的差距具体落在哪里。

  3. 公众号:龙猫LongCat(美团)71

    美团开源万亿参数模型 LongCat-2.0,同步开放国产卡推理代码

    美团正式开源万亿参数大模型 LongCat-2.0,总参数 1.6T、平均激活约 48B,面向真实 Agentic Coding 任务,官方称在五万卡国产算力集群上完成推理。

    推荐理由:官方公布模型参数结构、三项关键优化和开源链接,可据此评估其在国内存量算力上的部署可行性。

  4. IT之家(RSS)71

    SK 海力士将启动 280 亿美元美股上市,有望成史上第二大 IPO

    SK 海力士于本周一启动规模约 280 亿美元的美股上市计划,将在纳斯达克通过存托凭证发行 1779 万股新股,每 10 份存托凭证对应 1 股普通股。发行价区间周一公布,最终发行价周四敲定,股票周五挂牌交易。受益于全球人工智能热潮,该股年内涨幅超 270%。本次募资规模预计为史上第二大新股发行,仅次于上月 SpaceX 的 857 亿美元 IPO。SK 海力士是高带宽内存芯片核心供应商,产品用于英伟达、谷歌等 AI 设备。

    推荐理由:SK海力士的IPO是AI基础设施商业化的标志节点,HBM的垄断地位让它成为这波浪潮里最硬的硬件锚点,280亿美元募资规模足以让做AI投资的人认真关注。

7月3日周五
  1. HuggingFace Daily Papers(社区热门论文)74

    Program-as-Weights:一种面向模糊函数的编程范式

    Program-as-Weights (PAW) 提出模糊函数编程范式,将自然语言描述的函数编译为紧凑、可本地执行的神经制品。PAW 使用在 10M 示例数据集 FuzzyBench 上训练的 4B 编译器,为冻结的轻量级解释器输出参数高效适配器。0.6B 的 Qwen3 解释器执行 PAW 程序性能匹敌直接提示 Qwen3-32B,推理内存仅约五十分之一,在 MacBook M3 上达 30 tokens/s。该方法将基础模型从每次输入的求解器重新定义为工具构建器,一次函数定义后生成的制品可离线廉价复用。

    推荐理由:这篇论文把模糊任务从调用大模型API变成了本地轻量函数,0.6B就能跑赢32B,省掉几十倍成本。对需要处理日志、JSON修复等经常性模糊任务的开发者是个真信号。

  2. Ethan Mollick77

    关于Mythos和网络安全的讨论并非炒作。 (正如任何使用Fable进行自主工作的人可能已经认识到的那样。)

    引用Epoch AI@EpochAIResearch

    AI 似乎正在大规模发现软件漏洞。 2026 年 6 月,21 家知名机构披露了约 1,500 个高危和严重级别的 CVE,是 Claude Mythos Preview 发布前创下的月度纪录的 3.5 倍以上。

    推荐理由:AI在安全漏洞发现上第一次展现出规模化能力,6月CVE数直接翻了3.5倍,所有做安全的人今天起都得重新评估自己的攻击面。

  3. LMSYS:Blog(Chatbot Arena 团队)59

    Agent辅助的SGLang开发:初步探索

    SGLang团队将LLM服务、分布式运行时、GPU内核、扩散管道等工作流编码为可执行的SKILL.md文件、脚本、基准合约和审查循环。现有技能包括:SGLang .claude/skills(CUDA调试、内核集成、性能分析等)、SGLang diffusion .claude/skills(扩散模型添加与调优)、BBuf/AI-Infra-Auto-Driven-SKILLS(跨框架SOTA循环)、KDA(MLSys 2026 FlashInfer内核竞赛获胜方案)以及BBuf/KDA-Pilot(已合并三个SGLang集成PR)。Profile证据是性能工作的核心,长期优化转向Loop Engineering——SGLang SOTA Performance Loop将追求SOTA分解为公平基准测试、差距决策、性能分析、补丁和再验证,Humanize/RLCR添加外部审查,Codex Goal以更低协调开销运行相同循环。评审重要性提升,开发者需定义问题、选择证据、设计工作流并判断结果是否可用于生产。

    推荐理由:这不是一篇普通的开发经验总结,而是 SGLang 团队把调试、基准测试和性能调优等重复劳动变成可执行 agent 技能的实操手册,对于做推理框架和复杂工程的人非常值得一看。

  4. Apple Machine Learning Research(RSS)62

    RL微调VLM的鲁棒性与思维链一致性研究

    强化学习(RL)微调被扩展至视觉语言模型(VLM)。研究发现,简单的文本扰动——误导性标题或错误思维链(CoT)——会显著降低模型鲁棒性和置信度,且开源模型衰退更明显。闭源模型呈现类似失败模式,但鲁棒性和推理一致性更强。进一步分析揭示准确性与忠实性的权衡:微调提升基准准确率,但同时侵蚀CoT的可靠性及对上下文变化的鲁棒性;对抗性增强可改善鲁棒性,却无法阻止忠实性漂移。引入忠实性感知奖励能恢复答案与推理的对齐,但与增强结合时训练易崩溃到捷径策略。这些发现强调需联合关注正确性、鲁棒性与视觉推理的忠实性。

    推荐理由:RL微调让VLM基准分变好看,却可能让它的推理链变得靠不住,这个反直觉的诊断对正在用RL打磨多模态模型的团队是个警醒。

7月1日周三
  1. The Decoder:AI News(RSS)70

    OpenAI论文揭示GPT-5.6三个Pro变体,打破单一顶级策略

    OpenAI论文首次列出GPT-5.6的三个Pro变体:Luna Pro、Terra Pro和Sol Pro,取代以往单一Pro模式。在基因组学基准中,Sol Pro通过率31.5%居60个测试模型之首,领先标准Sol(28.7%)和Claude Opus 4.8(16.0%)。Pro相比标准版本提升逐级递减:Luna Pro提升7.1个百分点(16.5%→23.6%),Terra Pro提升5.2(23.3%→28.5%),Sol Pro仅提升2.8(28.7%→31.5%)。Terra Pro(28.5%)几乎与标准Sol(28.7%)持平。论文未披露Pro运行的token用量,也不清楚该分层是否会在ChatGPT中实际推出。

    推荐理由:论文意外曝光 GPT-5.6 Pro 将有三个变体,Pro 不再只是一个最强模型,而是让用户按推理需求选版本,这才是匹配 200 美元月费该有的逻辑。

  2. MarkTechPost(RSS)73

    NVIDIA 发布 Nemotron-Labs-TwoTower 开放权重扩散语言模型

    NVIDIA 发布 Nemotron-Labs-TwoTower,基于冻结的自回归骨干 Nemotron-3-Nano-30B-A3B 的扩散语言模型。采用双塔架构:上下文塔冻结,降噪器塔训练,通过层对齐交叉注意力和状态播种协作。在 2×H100 上 BF16 评估,保留 98.7% 的 AR 基线质量,生成吞吐量提升 2.42 倍(γ=0.8,块大小 S=16)。降噪器在约 2.1T token 上训练,骨干使用 25T token 预训练。总参数约 60B,每 token 活跃参数约 3B/塔。支持扩散、模拟 AR 和 AR 三种解码模式。

    推荐理由:NVIDIA这个TwoTower把扩散解码接在已有的AR骨干上,几乎无损质量却让吞吐翻倍,并且开源可商用,对批量文本生成的团队是实在的加速工具。

  3. 公众号:龙猫LongCat(美团)82

    美团 LongCat-2.0 正式发布:国产算力集群训练的万亿参数大模型

    美团于6月30日发布新一代万亿参数大模型LongCat-2.0并开源。总参数1.6T,平均激活约48B,原生支持1M超长上下文,在五万卡国产算力集群上完成全流程训练与推理。采用LSA稀疏注意力、零计算专家、ScMoE及MOPD多专家融合(Agent/Reasoning/Interaction三组专家)架构。评测中SWE-bench Pro获59.5,SWE-bench Multilingual获77.3。预览版已通过OpenRouter和longcat.ai开放,月调用量跻身OpenRouter全球前三。

    推荐理由:国产算力上首个全流程自训的万亿开源模型,1M上下文和动态专家架构直指Agentic Coding场景,OpenRouter调用量已经冲到前三,不是Demo是生产力。