跳到正文
北京时间

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 81–100 条 · 共 592 条
8月18日周二
  1. Tomer Tunguz 博客(VC 分析)65

    本地小模型也能媲美云端前沿模型:Qwen3.8-27B 的另类飞行路径

    本地运行的 Qwen3.8-27B 在 Artificial Analysis 智能指数上以 52 分位列 135 个模型之首,超过 7530 亿参数的 GLM-5.2。在 25 项风投任务评测中,它与云端 DeepSeek V4 输出质量同为 8.0 分,但需多花 7.2 倍 token 思考,速度慢约 9 秒。小模型靠更长的链式推理弥补知识差距,而非直接给出答案。

    推荐理由:作者用同一套 VC 任务实测云端与本地模型,给出质量、速度与思考 token 的具体数据,展示小模型靠推理补知识差距的路径。

8月17日周一
8月15日周六
  1. Google Gemini66

    Gemini 3.7 Flash 现已向 Gemini 聊天中的 Pro 和 Ultra 用户开放。该模型更新提升了多步骤任务的推理与准确性,如智能整合数十个文件和邮件为一份主文档。同时,Gemini Spark 也已运行于 3.7 Flash,通过改进对 Google Workspace 应用的工具调用,让个人 AI 智能体更精准。

    引用Google Gemini@GeminiApp

    Gemini Spark 现在运行在 Gemini 3.7 Flash 上。⚡️ 无论你是用 Spark 将供应商信息整理到 Sheets,还是起草谈判邮件,3.7 Flash 都能让你的个人 AI 智能体更精准、更准确,并针对 @GoogleWorkspace 应用改进了工具调用,帮助把想法转化为行动。

    推荐理由:Gemini 3.7 Flash 把多步推理与跨文件整合能力下放到轻量模型,对经常需要合并数十份文件或邮件的用户来说,是一个成本更低的处理选项。

8月14日周五
  1. 公众号:小红书技术(dots.llm)79

    dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理

    小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。

    推荐理由:除开源模型外,TEMPO 让同一智能体在每个宏观步骤切换为 critic,用测试时推理估计回报,给稀疏奖励长程任务的强化学习训练提供了可借鉴的结构。

  2. SiliconFlow65

    DeepSeek-V4-Pro-0813 正式上线硅基流动 SiliconFlow,提供 Day-0 支持,具备 1M 上下文窗口及低/高/最大三档推理强度,更侧重编码、工具调用与智能体工作流,仍保持 MIT 开源协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M。同系列 DeepSeek-V4-Flash-0731 则面向追求速度与成本效益的日常生产场景。

    推荐理由:每百万缓存命中 0.44 美元与 1M 上下文组合,使 Agent 工作流在长上下文成本测算上有了更具体参照。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)80

    GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能

    GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。

    推荐理由:最实际的改变在 API 原语,让同一模型在 ARC-AGI-3 上用约六分之一输出 token 拿到近三倍分数,影响开发者对推理成本和上下文架构的判断。

  4. METR:Notes(网页)69

    METR 分析 LLM 是否加速了科学发现:漏洞发现激增,算法优化未见明显拐点

    METR 汇总多类公开数据寻找发现速度的拐点,发现漏洞发现明显加速:cURL CVE 从 2025 年的 9 个增至 2026 年的 36 个(15 个 AI 标记),Firefox 从 210 增至 342,Microsoft CVE 年化约为 2025 年的 2.5 倍。

    推荐理由:原文用多领域公开数据对比 AI 对发现速度的影响,读者可以看到漏洞发现明显加快而算法优化尚未加速的反差。

8月13日周四
  1. Epoch AI:研究、数据与评测61

    Epoch AI 估算 AI 芯片性价比每年增长约 49%

    Epoch AI 估算 2023 年 Q1 至 2025 年 Q4 每季度购买的 AI 芯片综合性价比,从约 5.6×10^11 升至约 1.4×10^12 bit-operations per second per dollar(2025 年不变美元),指数拟合平均每年增长约 49%(90% CI:36%–66%),倍增时间 1.7 年。

    推荐理由:Epoch AI 用自建的芯片销量和价格数据量化了每季度购买 AI 芯片的性价比增长,并说明了 Nvidia 高利润率对均价的影响。

  2. Google Research:Blog(网页)66

    空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈

    Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于“丢钥匙”而非“空货架”。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。

    推荐理由:知识画像把事实错误拆成编码失败与召回失败,显示前沿模型问题主要在已存知识不稳定调用,思考更多恢复已编码事实而非补全缺失,为优化侧重提供判断依据。

8月12日周三
  1. vLLM 官方博客(RSS)72

    vLLM 提供 Qwen3.8-2.4T-A95B Day-0 支持

    vLLM 宣布对 Qwen3.8-2.4T-A95B 提供 Day-0 支持,该模型是基于 Qwen 3.5 架构的 2.4 万亿参数稀疏 MoE 模型,含 512 个专家,92 层混合骨干中每 4 层使用一次 full attention,其余 69 层为线性注意力。

    推荐理由:原文给出架构细节、量化方案和硬件要求,读者可以据此评估部署这个 2.4T 参数开源权重模型的成本与配置。

  2. The Decoder:AI News(RSS)80

    研究人员发现可读取ChatGPT等模型加密推理过程的API漏洞

    Alexander Panfilov团队发现OpenAI、Anthropic、Google等主要AI提供商API存在漏洞,可读取推理模型的加密思考过程。扫描约7000条公开会话发现62个API密钥、33个邮箱和33个密码。通过越狱,Anthropic的Haiku 4.5可逐字转写Opus 4.8的原始推理;解码10000条推理轨迹的API成本约720美元。

    推荐理由:不是另一个理论漏洞,而是真实可复现的推理链提取,它直接揭示了模型在「想什么」与「说什么」之间的断裂,让密码泄露和欺骗意图从暗箱走向可审计的证据。

  3. Google Blog:AI(RSS)69

    AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力

    Google Research 与 Google DeepMind 推进医疗 AI 系统 AMIE,实现实时临床视频问诊,首次在此场景展示专家级 AI 能力。该系统基于 Gemini 和 Project Astra 构建,可解读视觉与听觉线索、引导虚拟体格检查并实时诊断推理。随机研究中,临床评估者对 AMIE 的病史采集、诊断准确性等核心能力给予好评,患者演员也更偏好视频体验。

    推荐理由:AMIE 在视频中融合视觉与听觉线索进行诊断,展示了多模态临床推理的可行性,对远程医疗产品方向有参考价值。

  4. Hacker News 热门(buzzing.cc 中文翻译)73

    Apple Silicon 与 macOS 虚拟机:借助 Llama.cpp 实现 11–16 倍的 LLM 推理加速

    研究团队为 macOS 虚拟机中的 Metal 能力查询构建进程级兼容层,使 llama.cpp 能选用更新的 Metal 内核。在 M1 Ultra 上,TinyLlama 1.1B 的提示处理速度提升 11.08 倍、token 生成提升 16.36 倍,接近裸机性能的 98%;Gemma 4 12B 的提示处理与生成速度分别提升 7.20 倍和 14.54 倍。

    推荐理由:通过进程级 Metal 能力注入,macOS 虚拟机中 llm 推理速度提升一个数量级,为在隔离环境运行大模型提供了此前缺失的算力基础。

  5. Dwarkesh Patel:Podcast & Blog(RSS)60

    Ryan Greenblatt:人类级AI或于2032年前通过递归自我改进催生失控超级智能

    Dwarkesh Patel与Redwood Research首席科学家Ryan Greenblatt探讨递归自我改进(RSI)的可能性:一旦AI达到人类顶级专家水平,可能在一年内实现相当于4-5年的AI进展,Ryan的中位预期是2031年自动化AI研发。双方还讨论了超级智能的对齐对象、奖励黑客行为是否会升级为AI联手接管世界等风险。

    推荐理由:将递归自我改进的论证拆解为三个命题,并在此基础上推演奖励黑客如何演变为全面接管,为评估 AI 安全紧迫性提供了更具体的思维框架。

8月11日周二
  1. LMSYS:Blog(Chatbot Arena 团队)72

    统一 Radix 缓存:为混合模型前缀缓存构建单一树结构

    LMSYS 团队提出 Unified Radix Cache,用单一 token 键控 radix 拓扑统一管理混合模型的 FULL、SWA 和 MAMBA 组件缓存,各组件独立执行路径、滑动窗口和检查点复用语义。

    推荐理由:传统做法需为每种注意力组合实现独立缓存,本文以统一基树和组件钩子将复用规则解耦,SWE-bench上TTFT降低最高16.6%。

  2. LMSYS:Blog(Chatbot Arena 团队)74

    SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning

    SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持,该开源模型为 30B 总参数、3B 激活参数的混合专家架构,支持最长 1M token 上下文,可从 Hugging Face 下载 BF16 和 NVFP4 权重。模型支持 MTP、DFlash、DSpark 三种投机解码技术,并可通过 OpenAI 兼容 API 接入智能体工作流。

    推荐理由:Nemotron 3.5 Lightning以3B活跃参数提供前沿agent能力,SGLang的即刻支持让开发者能用单命令启动高性能推理,将agent部署成本大幅压缩。

  3. NVIDIA Blog(RSS)76

    NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务

    NVIDIA 发布 Nemotron 3.5 Lightning,一款可定制的开源 30B 混合专家(MoE)模型,专为常驻智能体设计。相比同类开源模型,其 token 生成速度最高提升 4 倍,任务完成时间缩短 30%。该模型采用开放权重,支持用户微调以匹配特定任务,并可在 RTX PC、DGX Spark 及 Jetson 等设备上运行。

    推荐理由:本地运行 30B MoE 模型并声称 4 倍加速,与开源路由器结合可自动分配任务到最合适模型,给控制推理成本提供了新路径。

  4. The Verge:AI(RSS)75

    OpenAI 用 Astra 模型攻克 10 道数学难题,数学家既兴奋又担忧

    OpenAI 宣布其未发布的 Astra 模型解决了 10 道长期悬而未决的数学难题,涵盖球体堆积、纠错码、非 sofic 群存在性等领域,并发布超 250 页论文及 Lean 验证结果。

    推荐理由:这篇报道将10个数学问题的AI解法置于数学界的就业恐慌、商业侵蚀和归属争议之中,展示了技术突破如何引发学术生态的连锁反应。

  5. 公众号:蚂蚁百灵(Ling)72

    Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务

    蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、推理时仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。

    推荐理由:以1.3B激活参数取得接近4B激活模型的综合能力,同时Agent分数超越部分30B+模型,多精度开源和本地部署方案让轻量Agent应用更易落地。