跳到正文
北京时间

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 101–120 条 · 共 592 条
8月11日周二
  1. HuggingFace Daily Papers(社区热门论文)81

    窃取专有 LLM API 的推理轨迹:加密块可跨会话互换引发解密越狱

    研究发现,Anthropic、OpenAI 和 Google 等专有 LLM 的加密推理轨迹块可跨会话、用户和模型互换,攻击者将其注入同提供商防护较弱的模型,即可强制其以明文输出推理内容。

    推荐理由:加密推理块跨模型可互换,从公开仓库抓取的31万推理块中即恢复367份PII和182个凭证,补丁发布前公开共享数据的风险需要重估。

  2. Anthropic:Research(发表成果 · 网页)57

    Claude 未发布研究版将黎曼 zeta 函数零点下界从 41.6% 提升至 67.2%

    Anthropic 员工让 Claude 尝试攻克黎曼猜想,虽未成功,但一个未发布的研究版 Claude 在相关问题上取得突破:将满足黎曼猜想的 zeta 函数零点比例下界从 41.6% 提升至 67.2%。

    推荐理由:Claude 的结果并未直接冲击黎曼猜想,但它组合现有技术将零点比例下界提升超过 25 个百分点,为数学研究提供了一种 AI 辅助探索的可行路径。

8月10日周一
  1. OpenRouter:Announcements(RSS)77

    OpenRouter 推出由市场智慧驱动的新版 Auto 路由器

    OpenRouter 基于每周超 55T token 的社区消费数据,推出新版 Auto 路由器(openrouter/auto),其模型选择在多数任务和成本档位上优于旧版。新路由器按约 30 种任务类型匹配近 7 天社区实际消费的模型,支持 cost_tier 参数(low 至 max)并遵循账户隐私设置。在 MMLU Pro 等基准上,新默认档位在多数领域以更低成本达到旧版同等性能。

    推荐理由:基于平台每周55T token的社区支出分布,新路由将模型选择众包化,基准显示默认档成本下降超60%且多数任务性能不减,适合调用量大的应用。

  2. Fireworks AI(网页)69

    Meta Muse Glimmer 30B 上线 Fireworks,面向常驻 Agent 场景

    Meta 的 Muse Glimmer 30B 稠密模型已在 Fireworks 上提供 serverless 和按需部署,主打多轮工具调用与失败恢复等常驻 Agent 场景。

    推荐理由:原文给出了架构细节、Agent 基准对比和推荐运行配置,读者可以据此评估这款 30B 开源模型是否适合自己的多轮工具调用工作流。

8月9日周日
  1. 蚂蚁 inclusionAI:HuggingFace 新模型60

    inclusionAI 发布 Ling-3.0-flash 的 DSpark 投机解码模型 Ling3-DSpark

    inclusionAI 推出 Ling3-DSpark,一个为 Ling-3.0-flash 设计的 DSpark 投机解码模型,参数量 1.36B,通过置信度头动态选择草稿 token 数量。在 GSM8K 等九项基准上平均接受长度为 5.29,其中 GSM8K 达 6.40。模型经 SpecForge 训练,可通过 SGLang 部署。

    推荐理由:该模型把投机解码的接受长度按工作负载分开报告,数学与代码任务明显高于对话类,部署时可据此对不同场景的加速收益有更实际预期。

8月8日周六
  1. Greg Brockman71

    ChatGPT 团队本周发布多项更新:付费用户将获得 GPT 5.6 Sol 模型,支持通过滑块调节推理深度;免费用户将获得 GPT 5.6 Luna 并享受无限文本消息。此外还改进了网页编辑器格式保留、Android 相机速度,并支持在语音体验中上传文件提问。

    引用Adam Fry@adamhfry

    本周的 ChatGPT 功能更新 - 8月7日: 1/ 网页编辑器中的富文本格式——当你粘贴邮件或文档时,我们的编辑器会保留格式;复制粘贴太常见了,我们早就该做这个了! 2/ 为付费用户更新模型——GPT 5.6 Sol 在快速聊天和深度推理中更加一致。你现在会得到一个滑块,让你选择 ChatGPT 在回答中投入多少思考。移动端滑块上的触觉反馈(振动)很有趣! 3/ 无限文本消息——免费用户将获得 GPT 5.6 Luna,并享有无限文本消息。让所有人都更智能。即将推出。 4/ 快速 Android 相机——我们在 Android 上让点击 ChatGPT 中的“相机”来拍摄新照片并提问变得快多了。 5/ 语音 x 文件——你现在可以在我们由 GPT-Live 驱动的新 ChatGPT 语音体验中上传文件并提问。 本周的团队演示非常棒。队列里有很多内容,接下来几个月会很精彩。在评论中告诉我们你期待什么!

    推荐理由:推理深度滑块把算力分配交给用户,对需要精细控制推理时长与成本的流程更有用,免费无限消息则解除了日常对话量限制。

  2. LMSYS:Blog(Chatbot Arena 团队)76

    HPC-Ops × SGLang:腾讯混元开源高性能 Attention、Router GEMM 与 MoE 算子

    腾讯混元开源算子库 HPC-Ops 已集成至 SGLang 主分支,其 Dynamic Attention 与 Fused MoE 在 Hy3 模型上最高降低 TPOT 48.8%。

    推荐理由:HPC-Ops 集成到 SGLang,带来生产验证的负载均衡 Attention 和精度感知 Router GEMM,实测 Hy3 TPOT 降幅最高 48.8%,为 MoE 低延迟服务提供了可直接使用的开源优化。

8月7日周五
  1. 公众号:蚂蚁百灵(Ling)75

    蚂蚁百灵开源 Ling-3.0-flash:124B 总参数 MoE 模型,支持 API、单机与高性能三种部署

    蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。

    推荐理由:提供FP4/INT4量化版本并验证单机推理,让数据敏感、预算有限的团队也能本地运行千亿参数模型,将大模型能力从云端拉回到可控环境。

  2. 公众号:千问APP(阿里)67

    千问功能上新:推出思考研究、定时任务、办公助理、语音通话等多项新功能,并支持 Qwen3.8-MAX

    千问今日上线多项新功能,并支持最新旗舰模型 Qwen3.8-MAX。其中“思考研究”在原“深度思考”基础上升级,强化复杂推理与工具调用;“定时任务”可预设执行时间自动完成行业简报梳理等周期工作;“办公助理”能连接备忘录、日历等应用并操作电脑浏览器,直接输出可用的 Office 文档。语音通话支持 7x24 小时多场景,智能体广场首批覆盖物流、房产等十多个领域。

    推荐理由:办公助理将大模型从问答扩展到任务执行,多步操作与跨端协同可能改变繁琐的数据汇总与文档生成流程。

8月6日周四
  1. Hacker News 热门(buzzing.cc 中文翻译)71

    为什么传奇的埃尔德什问题正被人工智能攻克

    OpenAI 于 2026 年 5 月 20 日宣布,其内部 AI 模型对埃尔德什 1946 年提出的“单位距离”问题给出了反例,成为首个由 AI 模型完成的历史性重要证明;8 月 1 日又宣布未发布模型 Astra 取得 10 项数学进展,其中解决了埃尔德什提出的另外 3 个问题。

    推荐理由:文章以 Bloom 网站为线索,揭示了 AI 解决 Erdős 问题背后业余爱好者与数学家协作模式的变化,这比单个证明更说明 AI 如何重新分配数学研究中的参与者角色。

8月5日周三
  1. HuggingFace Daily Papers(社区热门论文)74

    Video-DeepResearch:迈向下一代多模态深度研究智能体

    Video-DeepResearch(Video-DR)将多模态智能体从静态图像扩展到连续视频流,提出解耦感知-探索流水线与分阶段工具解锁,以应对模态偏差和参数知识泄漏两大瓶颈。

    推荐理由:将深度研究从静态图像扩展到视频流,通过强制视觉定位再检索的两阶段训练,让模型摆脱了对文本搜索的路径依赖,给视频智能体研发提供了可验证的训练范式。

  2. LMSYS:Blog(Chatbot Arena 团队)72

    SpecForge v0.3.0 发布:统一解耦与共置投机解码栈,新增开放 SpecBundle 草稿模型

    SpecForge v0.3.0 将目标模型推理与草稿模型训练分离,支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并统一在线、离线与解耦工作流。

    推荐理由:将目标模型推理与草稿模型训练分离,让两种工作负载可独立扩缩,改变了投机解码训练中资源配比必须硬编码的旧模式,资源规划可按模型和序列长度灵活调整。

8月4日周二
  1. NVIDIA Blog(RSS)68

    NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型

    NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。

    推荐理由:开放商业许可与可解释推理输出结合,自动驾驶团队能直接审查模型决策链,为安全验证提供透明度,降低从研发到商用部署的转换成本。

  2. Hacker News 热门(buzzing.cc 中文翻译)81

    Swiftlet:在 Mac 上运行 80B 版 Qwen(内存 4.3 GB),在 iPhone 上运行 35B 版

    Swiftlet 是一个 Swift + Metal 运行时,可在普通 Apple 设备上运行 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型,仅将小型稠密核心驻留内存,按需从存储流式加载路由专家权重。

    推荐理由:用流式专家加载把 80B 模型塞进手机,具体 RAM 和速度数字让开发者能直接判断自己设备的上限,而不是停留在商详口号。

  3. Tomer Tunguz 博客(VC 分析)70

    追逐杰文斯悖论:AI 定价分层能否延续需求增长?

    AI 供给持续紧张,但价格不降反升:Anthropic 7 月 24 日发布的 Fable 5 定价每百万输出 token 50 美元,翻倍于 Opus 5;OpenAI 则在五天后将 GPT-5.6 Luna 价格下调 80%。

    推荐理由:作者用各家财报与定价数据梳理分层定价如何延续杰文斯悖论,并指出路由器可能成为新的战略层。

8月3日周一
  1. Gary Marcus:The Road to AI We Can Trust(RSS)66

    OpenAI 新模型 Astra 数学表现出色,但被过度吹捧

    OpenAI 内部测试的新模型 Astra 在数学问题上表现惊艳,但 Gary Marcus 指出相关讨论犯了“合成谬误”:擅长某类数学不等于擅长所有数学、科学乃至一切认知任务。数学之所以成为突破口,是因为它便于用符号工具验证且能廉价生成海量合成数据,而开放世界问题无法如此模拟。此外,OpenAI 未公布方法细节,尚无法评估其真实意义。

    推荐理由:从合成谬误切入,剖开 Astra 舆论热潮的底层逻辑,并指出数学成功依赖于可验证性与海量合成数据,而多数真实问题没有这种特权,提醒对通用性期待需克制。

8月1日周六
  1. Greg Brockman70

    OpenAI 用下一代模型 Astra 内部版解决了数学与理论计算机科学领域的10项重大进展,总成本约2000美元(按 Sol API 价格计算)。Astra 证明了非 sofic 群的存在,并推翻 Connes 刚性猜想,成果涵盖 von Neumann 代数、高维球堆积、电路复杂度等。OpenAI 已发布全部10项证明,附 Lean 证书与 CoT 逐步推导。

    引用Sebastien Bubeck@SebastienBubeck

    是的,非索菲群确实存在:这一陈述是 Astra——我们的下一个重大模型——所证明的众多新的漂亮结果之一。 我们正在发布 10 个这样的 Astra 证明,每个都附有完整的 Lean 证书和思维链(CoT)详解。这些结果范围广泛,从冯·诺依曼代数(对 Connes 刚性猜想的反证)到高维球填充、电路复杂度、多色图中的单色三角形等问题的更优界,等等。 更多想法见:https://openai.com/index/ten-advances-in-mathematics/

    推荐理由:OpenAI用内部Astra模型证明了10个重要数学猜想,成本才2000美元,这比论文本身更值得关注,理论领域可能从纯人力变成AI驱动的研究范式。

  2. Together AI 研究与产品博客(RSS)82

    Kimi K3 开发者完全指南:Together AI 上的 1M 上下文、推理档位与工具调用

    Together AI 发布 Kimi K3 开发者指南。K3 是月之暗面(Moonshot AI)2.8 万亿参数的开放权重模型,首个 3 万亿参数级的开源模型,Together 直接与 Moonshot 团队合作提供服务。

    推荐理由:指南给出 KDA、Stable LatentMoE 架构要点和 API 用法、缓存与计费细节,开发者可据此判断如何在 Together 上落地这个模型。

7月31日周五
  1. 公众号:腾讯混元89

    腾讯混元 Hyra 攻克加法组合学 50 年未解难题

    腾讯混元上周推出的科研智能体 Hyra,基于本月开源的 Hy3 模型(总参数 295B、激活参数 21B),为加法组合学中悬置半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 先在有限搜索中将最好结果从约 1.14 提高到 1.21,经约 24 小时运行提出核心构造思路,并给出 Lean 4 形式化证明。论文预印本、显式构造和形式化证明均已公开。

    推荐理由:构造不再依赖暴力搜索,而是从数学结构入手自主推理,同时给出可形式化证明,让AI在定理型科学问题上从辅助工具转向共同研究者。

  2. HuggingFace Daily Papers(社区热门论文)80

    DiffusionGemma 技术报告:基于离散扩散的高效文本生成模型

    DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。

    推荐理由:扩散生成首次在文本领域将吞吐推高至约1500 token/s,此前这类速度仅见于非文本生成架构,为实时交互和批量生成场景提供了新的可行上限。