跳到正文
北京时间

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 561–580 条 · 共 592 条
3月24日周一
  1. ARC Prize:官方博客70

    ARC Prize 发布 ARC-AGI-2 基准并开启 2025 竞赛

    ARC Prize 官方发布更难的 ARC-AGI-2 基准,纯 LLM 得分 0%,o3-preview-low 仅约 4%,而每个任务都至少由 2 人在 2 次尝试内解出。

    推荐理由:官方公布了新基准的题型、人类与 AI 的对比成绩和效率指标,读者可以据此理解当前推理系统与人类泛化能力的具体差距。

  2. DeepSeek:API 更新日志72

    DeepSeek 将 deepseek-chat 升级为 DeepSeek-V3-0324

    DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V3-0324,推理能力增强,MMLU-Pro 升至 81.2,AIME 升至 59.4。同时优化了 Web 前端开发、中文写作(对齐 R1 风格)、中文搜索及 Function Calling 准确率,并修复了此前问题。

    推荐理由:这是 DeepSeek V3 发布后的一次重要版本更新,推理和代码能力提升显著,AIME 提升近 20 分,前端和中文写作体验优化,API 用户应该尽快切换。

2月19日周三
  1. xAI:News(网页)

    Grok 3 Beta 发布:推理智能体时代来临

    Grok 3 Beta 正式发布,开启"推理智能体"时代。新版本强化深度推理与自主决策能力,支持复杂任务拆解和多步逻辑链处理,在数学、编程等推理密集型场景表现显著提升,标志着 AI 从简单问答向自主推理决策的范式转变。

    推荐理由:xAI发布Grok 3 Beta,主打推理智能体能力

2月18日周二
  1. DeepSeek

    NSA是一种硬件对齐且原生可训练的稀疏注意力机制,专为超快速长上下文训练与推理设计。其核心采用动态分层稀疏策略,结合粗粒度token压缩与细粒度token选择。通过针对现代硬件的优化,NSA在加速推理、降低预训练成本的同时不损失性能,在通用基准、长上下文任务及指令推理中匹配或超越Full Attention模型。

    推荐理由:DeepSeek 推出硬件对齐稀疏注意力 NSA,长上下文训练推理双提速,预训练成本显著降低

1月29日周三
1月24日周五
  1. OpenRouter:Announcements(RSS)59

    OpenRouter 推出 Reasoning Tokens,用于思考模型

    OpenRouter 为思考模型(thinking models)新增推理 token(reasoning tokens),帮助用户理解模型思考过程。

    推荐理由:OpenRouter把思考模型的推理步骤给透明了,调试链路的开发者能直接看“内心戏”,但放在今天这个功能已不稀奇。

1月20日周一
  1. DeepSeek:API 更新日志73

    DeepSeek 发布 deepseek-reasoner 推理模型

    DeepSeek 推出新模型 DeepSeek-R1,可通过指定 model=deepseek-reasoner 调用。该模型为推理模型,详细更新与调用指南已分别发布。

    推荐理由:R1 的 API 开放让开发者能直接调用推理能力,对需要深度思考的应用是个关键接入点,成本比同类更低。

1月6日周一
  1. Sam Altman:Blog(RSS)

    反思

    Sam Altman在ChatGPT两周年之际回顾OpenAI九年历程:从坚信AGI可能实现,到2022年意外推出ChatGPT并引爆前所未有的增长曲线。他坦承过去两年从零构建公司的混乱压力,以及被董事会突然解雇的危机教训。如今周活用户已达3亿,在迈向AGI的道路上,他既感激这段经历,也承认未来仍充满未知。

    推荐理由:Sam Altman 反思创业历程,预测 2025 年 AI Agent 将实质性改变企业产出

12月20日周五
12月18日周三
  1. ARC Prize:官方博客63

    ARC-AGI-Pub 2024 进展:Jeremy Berman 与 MIT 康奈尔联队刷新公开榜

    ARC Prize 官方宣布 2024 ARC Prize 竞赛结束时,两个新方案在 ARC-AGI-Pub 公开榜刷新纪录:Jeremy Berman 用基于遗传算法思想的 Evolutionary Test-time Compute 配合 Claude Sonnet 3.5 得到 53.6%,MIT 与 Cornell 联合团队用测试时训练(TTT)方法得到 47.5%。

    推荐理由:原文介绍了两种登上 ARC-AGI 公开榜的方案细节与开源代码,读者可以对比进化式测试时计算与测试时训练的思路差异。

12月10日周二
  1. DeepSeek:API 更新日志67

    DeepSeek 将 deepseek-chat 升级为 DeepSeek-V2.5-1210

    DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V2.5-1210,各项能力提升。数学能力在 MATH-500 基准测试中从 74.8% 提升至 82.8%,代码能力在 LiveCodebench (08.01 - 12.01) 基准测试中从 29.2% 提升至 34.38%。新版本还优化了文件上传和网页总结功能的用户体验。

    推荐理由:DeepSeek把deepseek-chat数学拉到82.8%,代码涨了5个点,做复杂推理的开发可以试试水,但这还是V2.5系列的常规升级,别当次代际跃迁。

12月6日周五
  1. ARC Prize:官方博客64

    ARC Prize 2024 获奖名单与技术报告发布

    ARC Prize 官方公布 2024 年获奖者并发布技术报告,共 1,430 支队伍提交 17,789 个方案,ARC-AGI-1 SOTA 从 33% 升至 55.5%,但 100 万美元大奖无人认领。

    推荐理由:官方技术报告给出完整获奖方案与三类新方法总结,读者可以据此了解 ARC-AGI 分数提升背后的具体技术路线。

11月20日周三
  1. 公众号:DeepSeek(深度求索)66

    DeepSeek 推理模型预览版上线,推理性能媲美 o1-preview,公开完整思维链

    DeepSeek 上线推理模型预览版,其推理性能与 OpenAI 的 o1-preview 相当,并公开了模型的完整思维链。

    推荐理由:虽然已是旧闻,但 DeepSeek 首次公开推理模型完整思维链,对理解 o1 类模型的内部机制是个重要线索,做推理模型研究的值得回看。

10月28日周一
  1. ARC Prize:官方博客60

    Mike Knoop 与 François Chollet 阐述结合深度学习与程序合成攻克 ARC-AGI 的技术路径

    ARC Prize 团队于 2024 年 10 月 24 日举办线上活动,说明为何单靠深度学习难以攻克 ARC-AGI,并提出结合深度学习与程序合成的技术路线。

    推荐理由:Chollet 和 Knoop 系统论述 LLM 局限于记忆技能、需结合程序合成才能胜出 ARC-AGI 的技术路径,为理解智能与抽象层次提供了可迁移的分析框架。

9月30日周一
  1. Liquid AI 模型与工程博客(网页)64

    Liquid AI 发布首批 Liquid Foundation Models:LFM-1B/3B/40B

    Liquid AI 发布第一代 Liquid Foundation Models(LFM),包含 1.3B、3.1B 和 40.3B MoE(激活参数 12B)三个语言模型,官方称在各规模上取得同级领先质量。

    推荐理由:官方发布了三档模型的基准数据和内存表现,并说明非开源决定与边缘部署定位,读者可据此评估是否试用。

9月15日周日
  1. Anthropic:Transformer Circuits(可解释性研究)73

    电路更新——2024年9月:Anthropic团队探索Transformer模型中的“后继头”机制

    Anthropic可解释性团队在2024年9月分享了其初步研究进展,重点探讨了Transformer模型中普遍存在的“后继头”。这些特定的注意力头专门用于处理序数序列(如数字、星期、月份)中的后继关系。研究采用权重检查、独立成分分析等四种互补方法进行识别,其中评分最高的头能将约80%的序数标记最可能地映射到其后继项。分析还揭示了这些头中存在与类别相关的块状结构。团队强调这些发现属于初步成果,预计未来几个月将发表更详细的研究。

    推荐理由:揭示Transformer内部机制,助力AI可解释性研究,对模型调试和安全有参考价值。

9月13日周五
  1. ARC Prize:官方博客71

    ARC Prize 实测 OpenAI o1 在 ARC-AGI-Pub 的成绩

    ARC Prize 用统一测试框架测得 o1-preview 在 ARC-AGI 公开评测得 21.2%,与 Claude 3.5 Sonnet 的 21% 相当,但每任务平均耗时 4.2 分钟约为其 10 倍。文章认为 o1 实现了训练时和推理时的 CoT 范式,从记忆答案转向记忆推理,但仍限于预训练数据分布内,测试时算力增加虽能对数级提升准确率,实现 AGI 仍需新思路。

    推荐理由:ARC Prize 用同一测试框架实测 o1 并给出测试时算力与效率分析,读者可借此理解 o1 在 ARC-AGI 上成绩有限的原因。

8月20日周二
  1. PromptArmor:Threat Intelligence68

    PromptArmor 披露 Slack AI 可经间接提示词注入窃取私频数据

    PromptArmor 披露 Slack AI 存在间接提示词注入漏洞,攻击者可在其自建的公开频道发布恶意指令,诱导 Slack AI 把用户私有频道中的 API key 等机密数据嵌入钓鱼链接并渲染给用户,点击后数据被外泄。

    推荐理由:报告给出完整攻击链和复现细节,读者可以据此评估 Slack AI 的间接提示词注入风险并调整设置。

7月15日周一
  1. Anthropic:Transformer Circuits(可解释性研究)76

    2024年7月电路更新:迈向神经网络机制理解的下五个挑战

    Anthropic可解释性团队分享了2024年7月的多项研究进展与初步想法,并指出了未来面临的五大核心挑战。这些挑战包括:大量未被提取的“缺失特征”可能构成神经网络的“暗物质”;跨层叠加现象使特征难以映射到特定层;注意力叠加可能掩盖了如归纳头等基本单元的真实结构;权重叠加产生的“干扰权重”给电路分析带来混淆;以及如何将微观的电路理解整合为宏观的模型认知。团队认为,尽管在特征叠加等问题上已取得显著进展,但这些新挑战是通往神经网络机制性理解道路上的关键障碍。

    推荐理由:可解释性研究新挑战,帮助理解AI模型黑箱,对安全和信任至关重要。