跳到正文
北京时间

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 41–60 条 · 共 592 条
9月4日周五
  1. Hacker News 热门(buzzing.cc 中文翻译)77

    开发者用 Claude Fable 5 在 Claude Code 中将 1993 年 Amiga 游戏 Babylonian Twins 移植到 Godot

    作者让 Claude Fable 5 在 Claude Code 中分三步移植其 1993 年 Amiga 游戏:34,000 行 C++ 一个晚上迁入 Godot 4,72,758 行无注释 68000 汇编先用 vasm 重建出与发售版字节一致的二进制再移植,并把 1993 原作作为第二启动项嵌入新游戏。

    推荐理由:作者亲历者复盘用 LLM 移植 68000 汇编的完整过程,给出可验证的字节级校验方法和多处 AI 出错的实例。

  2. Gary Marcus:The Road to AI We Can Trust(RSS)74

    Gary Marcus 评 GPT-6 Astra:进步明显但鲁棒性与可监控性存疑

    Gary Marcus 发文点评 GPT-6 Astra,称多项报告显示其为真正的进步,OpenAI 产品显式创建并操纵符号世界模型,令其近十年的主张获得印证。

    推荐理由:作者结合自身近十年主张神经符号世界模型的立场,指出 Astra 的关键未知在鲁棒性与可监控性,判断有具体依据。

  3. Greg Brockman72

    Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。

    引用ARC Prize@arcprize

    由 @OpenAI 推出的 GPT-6 Astra 在 ARC-AGI 上达到 SOTA: - Astra 在 ARC-AGI-3 上得分 63%,通过新的提供商适配器测试框架可达 99% - 它在 96% 的 ARC-AGI-3 关卡上超越了人类表现 - 它构建了我们所见过的、对新环境最精确的符号模型 我们的分析:

    推荐理由:转发 ARC Prize 对 GPT-6 Astra 的评测数据,标准与 Provider Adapter 两种 harness 分差大,可据此了解 harness 对得分的影响。

  4. Aravind Srinivas70

    Perplexity CEO Aravind Srinivas 祝贺 OpenAI 发布 GPT-6 Astra,称其在宽度和深度研究任务上远超其他模型且更具成本效益,将很快向 Perplexity Computer 的 Pro 和 Max 用户开放。

    引用Perplexity@perplexity_ai

    我们在 WANDR 上评估了 GPT-6 Astra。它以每任务 $11.98 的成本得分 0.682,是我们测试过的所有模型中的最高分。 GPT-6-Astra 比 Fable 5.1 高 13.5%,成本低 6.1%;比 Opus 5 高 27.0%,成本高 3.3%。

    推荐理由:Perplexity CEO 确认 GPT-6 Astra 在其评测中领先,并宣布将向 Pro 和 Max 用户开放。

  5. Rohan Paul78

    Rohan Paul 梳理 OpenAI GPT-6 Astra 117 页系统卡的要点:Astra 控制自身链式思维的能力从 GPT-5.6 Sol 的 16.1% 跃升至 60.9%,可监控性相应下降。

    引用Rohan Paul@rohanpaul_ai

    OpenAI 的发布视频越来越出色了。

    推荐理由:作者梳理了 GPT-6 Astra 系统卡中关于链式思维可控性与监控性下降的关键安全发现,读者可借此了解对齐评估的核心结论。

  6. Sherwin Wu66

    Sherwin Wu 表示自己曾觉得 ARC-AGI-3 很难,如今该基准已被 Astra 饱和。引用 François Chollet 的话称,ARC 3 发布时他预计前沿模型约一年才能饱和,实际只用了 6 个月,约为预期的 2 倍速度,新一代模型的能力将挑战人们基于旧模型形成的 AI 观点。

    引用François Chollet@fchollet

    当我们发布 ARC 3 时,有人问我:“你觉得前沿模型什么时候能把它刷满?”我回答说:“大约一年吧,不过这取决于它被专门针对的程度。” 那是 6 个月前的事了,所以 Astra 所代表的进展大约比我预想的快了 2 倍。我认为进展的速度会让很多人吃惊,而新模型能做到的事,将会挑战人们通过使用前几代模型所形成的对 AI 的看法。

    推荐理由:结合 Arc Prize 负责人的预估与半年即饱和的结果,读者可以借此对照自己对前沿模型进展速度的预期。

  7. Hacker News 热门(buzzing.cc 中文翻译)78

    IFM 发布 K2 Horizon 六款开源模型,覆盖 0.9B 到 375B-A23B 并开放完整训练生命周期

    IFM 发布 K2 Horizon 模型系列,共六个模型:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,均以 Apache 2.0 开源,其中 0.9B、3.7B 和 7B 宣称在其规模上达到 SOTA,36B-A4B 采用新提出的稀疏注意力架构 MoVA。

    推荐理由:原文在发布模型之外还放出从预训练到智能体后训练的全流程产物,研究者可以据此复现和改造整套训练方法。

  8. TechCrunch:AI(RSS)81

    OpenAI 发布新模型 Astra,主打计算机与浏览器操作但因 opaque recurrence 引发争议

    OpenAI 发布最新模型 Astra,称其为迄今最强大模型,主打计算机和浏览器操作,先面向 Daybreak 网络安全计划客户开放,随后一周内覆盖 Pro、Plus、Enterprise、Business 付费账户及 API。

    推荐理由:原文梳理了 Astra 的能力主张、发布节奏,以及 opaque recurrence 引发的可监控性争议,信息较为完整。

9月3日周四
  1. Sundar Pichai65

    Google 发布 Gemini 3.8 Flash,为 6 周内第 3 次 Flash 更新。官方称相较 3.7 Flash 在软件工程、智能体任务和多步推理上有显著提升,在 DeepSWE v1.1 上以更低成本自主端到端解决复杂工程问题,表现超越多数更大的前沿模型。图中基准显示其 Terminal-bench 2.1 得 89.4%、HLE-Verified 得 54.9%,输入价格 $0.75/1M tokens、输出 $3.75/1M tokens,为 2026 年 12 月 31 日前 introductory 价。详情见 https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

    推荐理由:原文给出模型能力变化、定价和多项基准对比,读者可据此评估它相对更大模型的性价比与适用场景。

  2. ARC Prize:官方博客79

    ARC Prize 发布 OpenAI GPT-6 Astra 在 ARC-AGI-3 上的评测结果

    ARC Prize 报告 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。

    推荐理由:官方公布了 Astra 在两种 harness 下的完整得分、成本和人类对比数据,读者可以据此了解 agentic 评测方法的差异。

9月2日周三
  1. Artificial Analysis 完整文章(网页)66

    Google 发布 Gemini 3.8 Flash,四个月内第四款 Flash 模型

    Google DeepMind 发布 Gemini 3.8 Flash,在 Artificial Analysis Intelligence Index 上以 high 推理得分 59,较 Gemini 3.7 Flash 提升 3 分。

    推荐理由:评测方一手数据给出了智能指数、单任务成本和速度的具体变化,可帮助读者判断该模型在实际任务中的性价比。

9月1日周二
  1. 上海人工智能实验室 InternLM:原创项目63

    上海AI实验室发布 InternLumina-U2:16B-A1B 多码本扩散统一多模态模型

    上海AI实验室发布 InternLumina-U2,一个 16B 参数(激活 1B)的 MoE 扩散语言模型,用 8 码本全离散视觉表示统一覆盖文本问答、文生图、图像理解与编辑、视频及 3D 理解。

    推荐理由:原文给出多码本全离散统一架构的设计细节、基准分数和双硬件适配说明,读者可以了解统一理解与生成模型的一条新路线。

  2. Artificial Analysis 完整文章(网页)75

    Artificial Analysis 实测 Claude Fable 5.1 登顶智能指数但每任务成本高 20%

    Artificial Analysis 评测 Claude Fable 5.1,其以 66 分登顶 Artificial Analysis Intelligence Index,超过 Claude Opus 5(63)、Fable 5(62)、GPT-5.6 Sol(61)和 Grok 4.6(61)。

    推荐理由:Artificial Analysis 实测了 Claude Fable 5.1 的智能指数、各基准得分与每任务成本,读者可据此权衡其相对 Opus 5 和 GPT-5.6 的性价比。

8月28日周五
  1. Hacker News 热门(buzzing.cc 中文翻译)72

    Terminal-Bench-Science 0.1:评估科研工作流中的 AI 智能体

    斯坦福大学研究人员领衔发布 Terminal-Bench-Science 0.1,用来自生命、物理、地球、数学和工程科学的 70 个专家精选任务评估 AI 智能体的科研能力。

    推荐理由:70 个专家任务里最强模型仅解决 30%,成本与 token 前沿还显示不同系统取舍,为选择科学智能体提供了比软件基准更接近真实研究的依据。

8月27日周四
  1. IT之家(RSS)72

    我国日均词元调用量突破 500 万亿,中国大模型稳居全球第一梯队

    截至 2026 年 6 月,我国日均词元调用量已突破 500 万亿,中国大模型在全球竞争中位居第一梯队。当前旗舰模型几乎以月为单位更新,竞争焦点转向智能体落地与生态建设,推理算力需求随之爆发。腾讯混元 3 正式版上线第一周,Token 调用量比上一代混元 2 增长 68 倍。

    推荐理由:模型更新周期缩短至4到6周,且智能体任务的多轮调用说明推理算力需求上升,对算力产业链的判断需从训练侧扩展到推理侧。