跳到正文
北京时间

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 441–460 条 · 共 592 条
4月14日周二
  1. The Decoder:AI News(RSS)70

    Stanford 2026 年 AI 指数报告显示技术快速进步、安全担忧加剧且公众信任下降

    Stanford HAI 发布的 2026 年 AI 指数报告显示,AI 模型性能实现重大飞跃,中美技术差距显著缩小,但安全问题和公众信任危机同步加剧。报告指出,尽管 AI 能力快速提升,行业面临的安全隐忧日益严峻,公众对技术的信任度持续下滑。

    推荐理由:Stanford 年度报告把 AI 的矛盾赤裸裸摆上台面,模型啃得动博士考题却看不懂钟,编程效率暴涨却让年轻开发者就业萎缩,信任度滑向谷底,这是行业必须正视的撕裂感。

4月13日周一
  1. Tomer Tunguz 博客(VC 分析)61

    AI稀缺时代的开端

    AI算力稀缺时代正式开启。Nvidia Blackwell芯片GPU租赁价格涨至每小时4.08美元,两月内涨幅达48%;云服务商CoreWeave涨价20%并将最低合同期从一年延长至三年。Anthropic已将最新模型限制给约40个组织使用,OpenAI因算力不足被迫放弃部分项目。这标志着AI充足时代结束,"价高者得"、关系型销售、被迫多元化成为行业新常态,初创公司面临更严峻挑战。

    推荐理由:Tunguz 把 AI 算力短缺的五个特征讲得很透,关系销售与价格通胀对创业者是核心挑战,虽然文章有点旧,但判断框架仍然有效。

  2. HuggingFace Daily Papers(社区热门论文)75

    Audio Flamingo Next:面向语音、声音与音乐的下一代开源音频-语言模型

    Audio Flamingo 系列发布下一代模型 AF-Next,支持长达 30 分钟的复杂音频输入,并引入 Temporal Audio Chain-of-Thought 技术,将中间推理步骤显式对应到时间戳。该模型基于超过 100 万小时的新增数据进行课程式训练,在 20 个音频理解与推理基准测试中显著超越同规模开源模型,部分指标超过更大规模的闭源模型。团队同步开源了 AF-Next-Instruct、AF-Next-Think 和 AF-Next-Captioner 三个变体。

    推荐理由:NVIDIA 开源的这个音频大模型在 20 多个基准上大幅超越前代,长音频理解尤其凶猛,做语音、音乐和声音应用的值得把论文翻一遍。

4月10日周五
  1. Epoch AI:研究、数据与评测69

    Epoch AI 发布 MirrorCode 初步结果:Claude Opus 4.6 可完全重实现 1.6 万行的 gotree

    Epoch AI 与 METR 联合开发的 MirrorCode 基准初步结果显示,AI 在无源码、仅有可执行权限和详细可检验规格的条件下能完全重实现真实软件,Claude Opus 4.6 成功重实现约 16,000 行 Go 代码、含 40+ 命令的生物信息学工具 gotree,四位工程师估计人类需 2-17 周。

    推荐理由:原文给出可复现的黑盒重实现评测设计与关键数字,读者可以据此判断长时程自主编码能力的边界与前提。

4月7日周二
  1. Epoch AI:研究、数据与评测63

    Epoch AI 分析:算力贫乏的 AI 实验室能否靠效率追赶 GPT 前沿

    Epoch AI 分析指出,Anthropic 去年在算力上的支出超过 Minimax 与智谱 AI 之和的十倍,OpenAI 的差距更大,中国与开源模型公司因此处于"算力贫乏"状态。文章梳理了三条提升算力效率的路径:更快研发新算法、复现前沿实验室的创新、利用对手模型生成合成数据训练,其中只有第一条有望实现反超。

    推荐理由:原文逐项检验算法创新、模仿与蒸馏三条效率路径能否弥补十倍算力差距,并给出中美与开源模型格局的分层判断。

  2. HuggingFace Daily Papers(社区热门论文)72

    在极简形式主义下通过证明对LLM推理能力的压力测试

    本研究推出了名为ProofGrid的基准测试套件,旨在通过机器可检查的证明,而非仅凭最终答案,来严格评估大语言模型(LLM)的推理能力。该套件包含15项任务,涵盖证明编写、验证等环节,核心采用紧凑的最小自然演绎语言(NDL)进行表述。其评估框架能容忍表面偏差并定位首个实质性推理错误,实现了机械化、可复现的细粒度验证。测试表明,前沿模型在基础任务上表现尚可,但在需要全局组合推理或底层证明合成的困难任务上仍存在显著局限。研究还识别并量化了模型“生成有缺陷证明却能在局部正确识别其错误”的“认识不稳定”现象。

    推荐理由:不再只看答案对不对,而是让机器一步步检查证明,ProofGrid 戳中了 LLM 推理的一个盲区,很多模型产出的证明连自己都不信,这个发现挺要命的。

4月6日周一
  1. Cursor Blog66

    通过warp decode提升MoE模型推理效率

    针对Blackwell GPU上的小批量解码,研究提出了一种名为“warp decode”的新方法。该方法颠覆了传统以专家为中心的计算路径,改为让每个GPU warp负责计算一个输出神经元。这一根本性改变消除了原有流程中五个纯数据管理的“簿记”步骤,将整个MoE计算层压缩为仅两个内核。其优势在于避免了填充、分散和中间缓冲区的读写,并通过warp独立性实现了更好的调度。在Blackwell GPU上,该方法实现了1.84倍的吞吐量提升,同时输出精度更高,与全FP32参考值的差距缩小了1.4倍,有效加速了模型研发流程。

    推荐理由:Cursor 把 MoE 推理的并行轴从专家翻转到输出神经元,Blackwell 上吞吐涨 1.84 倍还顺带提精度,这种同时赢性能和精度的内核优化极其罕见,做推理引擎的值得逐行读。

4月3日周五
4月1日周三
  1. Meta Engineering Blog(RSS)81

    Meta Adaptive Ranking Model:弯曲推理扩展曲线,为广告提供LLM规模模型服务

    Meta将其广告推荐系统的运行时模型扩展至LLM的规模和复杂度,旨在更深入理解用户兴趣与意图,以提升广告效果。这一举措通过自适应排序模型,优化了推理阶段的扩展曲线,使部署大规模模型服务成为可能,标志着推荐系统性能向新前沿迈进。

    推荐理由:Meta的工程实践展示了如何优化LLM规模模型的推理效率,对AI系统设计有参考价值。

3月30日周一
  1. François Chollet

    作者以"Glurg"游戏(实为 chess)假设情境论证:借助现有外部认知基础设施(计算机、互联网等),人类顶尖团队能在24小时内从规则解析开发出3000 Elo引擎,三周内可达3500 Elo且计算效率提升10倍。这表明人类智能已具备即时掌握复杂策略系统的能力,而非从零缓慢进化。该论述回应了关于现实世界更接近 chess 而非 Go 的争论,强调人类利用工具扩展认知边界的即时优势。

    引用Eliezer Yudkowsky@allTheYud

    关于 @fchollet 的观点(我来概括一下):现实生活这个领域更接近国际象棋而非围棋,人类的棋力已经接近最优,顶尖机器也只能让一个马;而不是像人们认为围棋那样,上帝要让五子。(当然,他是在开玩笑。)

    推荐理由:Chollet 用思想实验揭示:人类可从零规则快速构建专家系统,这正是当前 AI 与 AGI 的核心差距

3月26日周四
  1. Artificial Analysis

    OpenAI发布GPT-5.4 mini与nano轻量模型,保留多档推理能力与400K上下文窗口,价格降至$0.20/$1.25每百万token。基准测试显示,GPT-5.4 nano在τ²-Bench等多项测试中领先Claude Haiku 4.5与Gemini 3.1 Flash-Lite Preview,但幻觉率较高且token消耗量大。得益于极低单价,nano在Intelligence Index测试中的有效成本反而低于竞品,展现出优秀的性价比优势。

    推荐理由:OpenAI 发布 GPT-5.4 mini/nano,性价比突出且评测数据详实,nano 性能超越同级竞品。

3月25日周三
  1. ARC Prize:官方博客72

    ARC Prize 发布交互式基准 ARC-AGI-3,ARC Prize 2026 设超 200 万美元奖金

    ARC Prize 官方发布 ARC-AGI-3,包含数百个由人类游戏设计师手工制作的回合制交互环境,无指令、无规则、无既定目标,要求智能体自行探索并跨关卡迁移所学。人类得分 100%,前沿 AI 得分 0.51%。ARC Prize 2026 同步开启,奖金超 200 万美元,设 ARC-AGI-3 竞赛与 ARC-AGI-2 大奖两个开源竞赛,并发布技术论文。

    推荐理由:官方公布交互式基准的构成、人类与前沿 AI 的分数差距及两个竞赛的奖金安排,可据此了解智能体评测方向。

3月23日周一
  1. Nathan Lambert:Interconnects(RSS)

    有损自我改进

    自我改进机制虽客观存在,但受限于"有损"特性,难以推动AI能力的递归式爆发。该论述指出,大语言模型等系统的自我优化过程伴随信息损耗与能力瓶颈,这种非完美的迭代模式打破了"快速起飞"(fast takeoff)的技术假设。与理想化的指数级自我增强不同,实际发展将呈现渐进、受限的增长轨迹,AI安全研究需重新评估递归自我改进的风险阈值。

    推荐理由:AI自我改进虽真实但存在损耗上限,挑战'快速起飞'的普遍担忧,为AGI发展节奏提供新视角

3月20日周五
  1. Artificial Analysis

    Mistral发布开源权重模型Mistral Small 4,采用119B参数MoE架构(每token激活6.5B参数),支持可切换的推理/非推理模式及图像输入。推理模式在Artificial Analysis Intelligence Index获27分,超越Mistral Large 3,但低于gpt-oss-120B等竞品。模型token效率优于同类,幻觉率更低(AA-Omniscience -30分),支持256K上下文窗口,采用Apache 2.0许可证。

    推荐理由:Mistral 开源 Small 4,支持混合推理与多模态,Agent 任务表现大幅提升

3月17日周二
  1. Sam Altman

    GPT-5.4 API 上线首周日处理量达 5T tokens,流量超过去年同期整个 API 总量,年化新增净收入突破 10 亿美元,增速创 OpenAI 模型发布历史纪录。

    引用Greg Brockman@gdb

    gpt-5.4 的增速比我们在 API 上发布过的任何其他模型都要快:上线一周内,每天处理 5 万亿个模型 token,处理量超过我们一年前整个 API 的总量,年化净新增收入达到 10 亿美元。 这是个好模型,快去试试吧!

    推荐理由:GPT-5.4 API采用速度创纪录,日处理5T tokens,年化新增收入达10亿美元

3月16日周一
  1. Gary Marcus:The Road to AI We Can Trust(RSS)

    Sam Altman 承认:实现 AGI 需要超越规模扩展的重大突破

    OpenAI CEO Sam Altman 坦言,仅靠扩大模型规模无法达到 AGI,必须在架构层面实现重大创新。这一表态标志着 AI 发展范式的关键转向,承认当前"越大越好"的扩展策略已遇瓶颈。Altman 强调"是时候寻找新的架构了",暗示基于 Transformer 的现有技术路径难以通向通用人工智能,行业需要颠覆性技术突破而非单纯堆砌算力与参数。

    推荐理由:OpenAI CEO 罕见承认纯扩展不足以实现 AGI,行业技术路线或迎转折

  2. Mistral AI:News(网页)72

    Mistral 发布 Mistral Small 4:统一推理、多模态与编码能力并开源

    Mistral 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型,采用 Apache 2.0 许可开源。

    推荐理由:原文给出完整的架构参数、推理档位设置和与 GPT-OSS 120B 的输出长度对比,读者可以据此评估部署成本和适用场景。

3月11日周三
  1. Noam Brown

    当今前沿推理模型的训练路径与 AlphaGo 高度一致:先模仿大量人类数据,再扩展推理计算(从蒙特卡洛树搜索到思维链),最后用强化学习突破模仿上限。Demis Hassabis 称,十年前 AlphaGo 的"第37步"预示 AI 可攻克真实科学难题,这些思路对构建 AGI 仍至关重要。

    引用Demis Hassabis@demishassabis

    十年前,AlphaGo 在首尔的那场传奇对局,宣告了现代 AI 时代的开启。它那著名的"第 37 手"向我们表明,AI 技术已经准备好应对科学等领域的现实问题——而受这些方法启发的思路,对于构建 AGI 至关重要 https://t.co/8EibfAByaG

    推荐理由:Meta 研究员揭示推理模型与 AlphaGo 的技术传承,点明 RL 超越模仿的核心路径

3月10日周二
  1. Hugging Face:Blog(RSS)83

    保持令牌流动:16个开源强化学习库的教训

    同步强化学习训练中,数据生成是主要瓶颈,如在320亿参数模型上生成3.2万令牌样本需数小时,导致训练GPU闲置。业界主流解决方案是将推理与训练解耦到不同GPU池,通过rollout缓冲区连接并异步传输权重。本文调研了16个实现此模式的开源库,从编排原语、缓冲区设计、权重同步协议、陈旧数据处理、部分rollout支持、LoRA支持及分布式训练后端七个维度比较。关键发现:Ray在编排层占主导(8/16库使用),NCCL广播是默认权重传输方式,LoRA训练支持普遍不足,而分布式MoE支持正成为新差异化特性。

    推荐理由:异步RL训练架构对比,助开发者优化训练效率与库选型。