跳到正文
北京时间

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 161–180 条 · 共 592 条
7月13日周一
7月12日周日
  1. Sam Altman68

    OpenAI 发布 GPT-5.6 系列在医疗领域的评估结果。最小变体 GPT-5.6 Luna 在最低推理强度下即超越最高推理强度的 GPT-5.5,且成本低 25 倍;最大变体 GPT-5.6 Sol 树立新标杆。在涵盖患者端与临床端的多样化任务中,专科医生被要求以无限时间和网络访问权限撰写回答,随后由其他医生盲评。评估基于准确性、沟通、完整性、指令遵循及健康决策帮助性五个维度,共 20000 次评分。结果显示,所有 GPT-5.6 模型表现均显著优于医生,且医生发现 GPT-5.6 回答中的缺陷少于医生自己撰写的回答。

    引用Karan Singhal@thekaransinghal

    ♥️ GPT-5.6 是健康领域的一大进步,无论是在前沿性能还是在成本方面。 这些模型推动了每美元性能的前沿,将最佳的健康智能带给所有人。最小的变体 GPT-5.6 Luna,在最低推理努力下评估,其表现超过了在最高推理努力下的 GPT-5.5——尽管成本低 25 倍。最大的变体 GPT-5.6 Sol,在成本方面树立了新的高标准。 另一个特别酷的结果:医生在 GPT-5.6 的回答中发现的缺陷比医生撰写的回答更少。 我们收集了近期 OpenAI 模型仍然难以处理的各种任务,涵盖面向患者和面向临床医生的用例。我们请与专科匹配的医生在无限时间和网络访问的条件下为这些任务撰写回答。然后我们请其他医生在不知道来源的情况下并排比较回答。医生被要求从五个维度评论改进空间:准确性、沟通、完整性、指令遵循和健康决策帮助性。然后我们报告了在总共 20,000 次维度评分中,各来源回答在所有维度上被评为完美的比例。GPT-5.6 Sol 表现最强,尽管所有 GPT-5.6 模型的表现都显著优于医生。

    推荐理由:GPT-5.6 在医疗任务上被医生评价比真人医生缺陷更少, 这是AI辅助诊断的分水岭, 产品人和医疗从业者值得看具体数据。

7月11日周六
  1. Greg Brockman71

    GPT-5.6 用于健康智能,团队一直专注于这方面的改进: 整个产品线中,我们以更低成本提供更强性能:GPT-5.6 Luna 在最高推理设置下性能优于 GPT-5.5,而成本降低 25 倍。 这些进步共同提升了质量,同时让全球更多人能够使用先进模型。

    引用OpenAI@OpenAI

    GPT-5.6 是健康智能领域向前迈出的重要一步。 在整个产品线中,我们以更低的成本实现了更强的性能:GPT-5.6 Luna 在其最高推理设置下的表现优于 GPT-5.5,而成本却降低了 25 倍。 这些进步共同提升了质量,同时让全球更多人能够使用先进的模型。

    推荐理由:GPT-5.6 主打健康智能,虽然还没实测,但 25 倍的降本让高级推理不再是实验室专属,做医疗应用的可以提前评估切换成本了。

  2. OpenAI73

    GPT-5.6 是健康智能领域的一大进步。 在整个产品线中,我们以更低成本提供更强性能:GPT-5.6 Luna 在最高推理设置下性能优于 GPT-5.5,而成本降低 25 倍。 这些进步共同提升了质量,同时让全球更多人能够使用先进模型。

    推荐理由:GPT-5.6把性价比直接拉了个数量级,做健康AI的团队该重新算账了。但官方只扔了一句话,实际能力等实测再鼓掌。

  3. Noam Brown86

    OpenAI 的 GPT-5.6 Sol Ultra 模型成功证明了存在50年之久的 Cycle Double Cover Conjecture(圈双覆盖猜想)。该模型已于昨日全面开放,在不到一小时内使用64个子智能体(subagents)完成证明。Noam Brown 强调,与之前需要特殊条件的埃尔德什单位距离问题不同,此次成果基于当前可公开获取的模型,并已公开提示词和证明过程。

    引用Ethan Knight@__eknight__

    昨天,我们让 GPT-5.6 Sol Ultra 正式全面可用。今天,我们分享它使用 64 个子代理,在不到一小时内就给出了已有 50 年历史的 Cycle Double Cover 猜想的证明。我们在下面分享提示词和证明。我们很期待看到大家用 Ultra 做出什么!

    推荐理由:GPT-5.6 Sol Ultra 靠 64 个子智能体一小时证明了半世纪未解的数学猜想,这不再是刷 benchmark——这是 AI 首次在公开模型上做出真正的科学发现。做数学和理论物理的人该认真看看 prompt 和证明。

  4. LMSYS:Blog(Chatbot Arena 团队)61

    DeepSeek-V4 Flash 强化学习训练登陆 AMD Instinct MI355X GPU,由 Miles 框架支持

    DeepSeek-V4 Flash 的强化学习训练现已在 AMD Instinct MI355X GPU 上通过 Miles 框架获得支持,基于 ROCm 软件栈运行。该 2840 亿参数 MoE 模型(每 token 激活 130 亿参数)需 SGLang 进行 rollout 生成、Megatron 进行策略更新,Miles 负责异步循环与权重同步。团队解决了 SGLang 与 Megatron 间模型对齐、量化状态在线更新及多节点并行稳定性三大挑战,最终在四个八 GPU 节点上完成端到端验证:超过 100 个优化器步骤中训练-rollout 对数概率差可控,在线奖励持续提升,离线 AIME-2024 基准分数同步上涨。

    推荐理由:把 DeepSeek-V4 Flash 的 RL 训练完整搬到 AMD MI355X 上,不是画饼,而是给了实测数据和可跑的配置。想用非 NVIDIA 卡做 RL 训练的,可以照着踩坑。

7月10日周五
  1. 公众号:小红书技术(dots.llm)70

    小红书发布大模型新架构 PIPO

    小红书提出 PIPO 架构,通过输入侧压缩器将两个 token 折叠为一个 latent,输出侧 MTP head 将隐藏状态展开为额外 token,实现输入长度减半、每步输出翻倍。基于 Qwen3.5-4B/9B backbone,在 AIME 2025 等基准上最高带来 +7.15 pass@4 提升。部署测评中,TTFT 加速约 1.23×,TPOT 加速约 1.86×。训练采用 SFT 和 On-Policy Distillation 两阶段,将 verifier 校验能力蒸馏进轻量 confidence head。

    推荐理由:PIPO把输入压缩和输出多token预测统一起来,并且用蒸馏把验证成本前置,长推理的场景下这可能是下一代推理引擎的样子,做模型加速的应该认真看看。

  2. 公众号:龙猫LongCat(美团)74

    美团 LongCat-2.0 正式开源,同步开放国产卡推理代码

    美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,专为真实 Agentic Coding 任务设计。模型引入 LongCat 稀疏注意力机制与 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力。LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,从模型架构、芯片适配到部署策略进行深度协同优化,支持百万上下文高效推理。开源同步提供 BF16、FP8、INT8 等多精度版本及针对国产算力极致优化的推理代码。

    推荐理由:国产算力跑万亿模型的第一份完整开源答卷,代码、芯片适配细节全公开,做国产大模型落地的直接抄作业。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)80

    OpenAI 推出 ChatGPT Work:可跨应用自主工作的 AI 智能体

    OpenAI 发布 ChatGPT Work,一个能跨应用和文件收集信息、将复杂项目分解为小步骤独立完成并持续工作数小时的 AI 智能体。它内置 Codex 技术,目前每周超 500 万用户使用 Codex,其中超 100 万用于非软件开发场景。ChatGPT Work 由今天同步推出的最新前沿模型 GPT‑5.6 驱动,具备多步骤推理和按模板生成材料的能力。该功能今天起面向 Pro、Enterprise 和 Edu 计划推出,未来几天扩展至 Plus 和 Business 计划。桌面版 ChatGPT 在所有计划(含免费版)中提供 Chat、Work 和 Codex 模式,且 Codex 应用已合并至新的桌面应用。

    推荐理由:ChatGPT Work 把代理能力真正派发给了普通用户,配合插件、定时任务和电脑控制,这是 ChatGPT 从问答工具迈向自主完成复杂工作的关键一步。但我更关心 GPT-5.6 的推理提升到底多大,案例里没给数字。

  4. OpenAI:官网动态(RSS · 排除企业/客户案例)85

    GPT-5.6 系列模型发布:Sol、Terra、Luna

    OpenAI 推出 GPT-5.6 系列,包括旗舰 Sol、平衡型 Terra 和成本最优 Luna。在 Agents' Last Exam 上,Sol 以 53.6 分超越 Claude Fable 5(自适应推理)13.1 分;中等推理时以约四分之一成本领先 11.4 分。Terra 和 Luna 以约十六分之一成本超越 Fable 5。在 Artificial Analysis Coding Agent Index 上,Sol 以 80 分创 SOTA,高于 Fable 5 的 2.8 分,使用不到一半输出 token、一半时间,成本低约三分之一。引入 Programmatic Tool Calling 减少中间数据往返,ultra 模式协调多个智能体加速复杂任务。模型配备迄今最强安全防护,经人类红队和自动化测试验证。

    推荐理由:GPT-5.6 在编码、安全、知识工作上全面领先,且 token 效率大幅优化,是我今年见过的真正能改变 agent 开发成本结构的发布。程序化工具调用和 ultra 模式值得立即试用。

7月9日周四
  1. 公众号:龙猫LongCat(美团)74

    美团正式开源 LongCat-2.0,同步开放国产卡推理代码

    美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,为真实 Agentic Coding 任务而生,并作为业界首个在五万卡国产算力集群上完成推理的万亿参数模型。

    推荐理由:LongCat-2.0 把针对国产卡的模型、芯片适配与部署优化作为完整开源栈发布,为存量算力部署万亿模型提供了可复现的协同方案。

  2. xAI:News(网页)85

    xAI 发布 Grok 4.5

    xAI 今日推出 Grok 4.5,为其最强模型,专为编程、智能体任务和知识工作打造。模型训练于数万块 NVIDIA GB300 GPU,DeepSWE 1.0 得分 62.0%,DeepSWE 1.1 得分 53%,Terminal Bench 2.1 得分 83.3%,SWE Bench Pro 解决率 64.7%。服务速度 80 TPS,token 效率约为 Opus 4.8 (max) 的 4.2 倍,在 Harvey Legal Agent Benchmark 排名第一。定价 $2/百万输入 token、$6/百万输出 token。即日起在 Grok Build、Cursor 和 SpaceXAI API 可用,欧盟地区预计 7 月中旬上线。

    推荐理由:Grok 4.5 在编码任务上追平第一梯队,但真正的杀手锏是极致性价比——输出成本只有对手的四分之一,还会倒逼编码模型继续降价。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)77

    OpenAI 发布 GPT‑Live 新一代全双工语音模型

    OpenAI 今日推出 GPT‑Live,基于全双工架构实现同时听与说,支持自然打断与实时回馈。该模型每秒多次判断是否说话、倾听、打断或调用工具,并将搜索、推理等复杂任务委托给后台 GPT‑5.5,保持对话流畅。即日起向全球 ChatGPT 用户提供 GPT‑Live‑1 和 GPT‑Live‑1 mini 两个版本。人类评估显示,在 5‑10 分钟对话中,GPT‑Live‑1 系列在自然度、轮流、打断等方面显著优于 Advanced Voice Mode;在 GPQA、BrowseComp 和 τ³‑Voice Telecom 基准测试中也表现更强。未来将开放 API。

    推荐理由:GPT‑Live 不是简单的语音版本升级,全双工架构让 AI 终于能同时听和说,加上后台调用 GPT‑5.5,对话体验跨了一大步,做语音应用的产品人该重新思考交互流程了。

  4. Hugging Face:Blog(RSS)66

    原生速度的 vLLM transformers 建模后端

    Hugging Face 宣布 transformers vLLM 后端现与手写原生 vLLM 实现速度相当甚至更快。模型作者无需移植代码,即可自动利用 transformers 获得超快推理。测试使用 Qwen3-4B(单 GPU)、Qwen3-32B(张量并行)和 Qwen3-235B-A22B-FP8 MoE(数据+专家并行)三种配置,吞吐量均达到或超过原生。该后端通过 torch.fx 静态分析图、AST 重写代码实现动态层融合,支持张量/管道/专家并行及 torch.compile。用户仅需添加 `--model-impl transformers` 标志。目前不支持线性注意力模型但即将支持。

    推荐理由:用 transformers 写的模型,现在不用改一行代码就能在 vLLM 里跑到手写实现的水平,模型作者最大的集成痛被抹平了。虽然主要是工程黑魔法,但生态意义不小。

7月8日周三
  1. OpenRouter68

    使用来自 @SpaceXAI 的 Grok 4.5,一旦它上线,无需更改代码。 ~x-ai/grok-latest 始终路由到最新的 Grok。现在指向它(今天为 Grok 4.3),当 4.5 发布时它会自动升级到 4.5。 尝试:https://openrouter.ai/~x-ai/grok-latest

    推荐理由:OpenRouter 的 grok-latest 别名让开发者零代码升级到 Grok 4.5,虽然是个小功能,但省掉了版本切换的繁琐,用 Grok 做产品的团队现在就该把端点切过去。

  2. The Decoder:AI News(RSS)74

    OpenAI GPT-5.6 周四发布,此前因美国政府强制延迟

    OpenAI GPT-5.6 模型于周四发布。该模型6月底亮相,最初因美国政府限制仅向部分合作伙伴提供,商务部在AI标准与创新中心完成额外测试后批准公开。OpenAI公开批评延迟,称将最佳工具与开发者及企业隔离。新模型Sol在TerminalBench 2.1得分88.8%,Sol Ultra达91.9%,高于Anthropic的Claude Mythos 5(88%)。在网络安全任务中,Sol与Mythos 5水平相当但仅用三分之一的token。Sol定价$5/$30每百万输入/输出token,Anthropic的Fable 5为$10/$50。

    推荐理由:被美国政府按了暂停键的 GPT-5.6 终于要公开了,基准测试小胜 Claude Mythos 5 且 token 消耗仅三分之一,价格也比 Anthropic 便宜近半,开发者可以准备预算了。

  3. HuggingFace Daily Papers(社区热门论文)72

    Nemotron-Labs-Diffusion:统一自回归、扩散与自我推测解码的三模式语言模型

    Nemotron-Labs-Diffusion 是一种三模式语言模型,通过联合自回归(AR)和扩散损失训练,在单一架构中统一了 AR、扩散和自我推测解码。研究显示 AR 与扩散目标互补:扩散增强前瞻规划,AR 提供从左至右的语言先验。自我推测模式下,扩散充当草稿模型、AR 负责验证,其接受率和实际设备效率均优于多 token 预测(MTP)。在最优化采样器下,单次前向传播产出 token 数比自我推测最多高 76.5%。该系列包含 3B、8B、14B 参数的基础、指令和视觉语言模型,在准确率和速度上均超越现有开源 AR 和扩散 LM。例如 8B 模型单次前向解码 token 数是 Qwen3-8B 的 6 倍,在 GB200 GPU 上使用 SGLang 运行 SPEED-Bench 时吞吐量提升 4 倍。

    推荐理由:NVIDIA 把自回归和扩散塞进同一个模型,吞吐量拉高 4 倍,做实时应用的团队可以开始换架构了。

  4. 公众号:蚂蚁百灵(Ling)64

    蚂蚁集团周俊AICon演讲:从Token数量到Token密度,万亿参数模型效率优先

    蚂蚁集团副总裁周俊在AICon演讲指出,万亿参数模型每运行15分钟算力成本约等于一辆特斯拉,效率是智能体时代最需解决的问题。团队提出从“更多Token”转向“更高Token密度”策略,采用7份Lightning Attention加1份MLA的混合线性注意力架构,使256K长上下文成本从指数级降至线性级,算力更多用于思考。通过Kpop算法区分工具调用与自然语言Token,结合思维链剪枝、自蒸馏等,Token输出减少约4倍而能力不降。在LongBench、BFCL等基准上提升显著,千亿参数模型在Agent任务中超越部分更大模型;小模型flash吞吐达2.4倍,五轮对话成本下降10倍以上。

    推荐理由:蚂蚁百灵副总裁周俊这次分享,把大模型效率问题从零散优化推到了架构、训练、智能体协同设计的范式层面,7+1 混合注意力方案和 Kpop 算法对做模型的人是实质参考。