Anthropic 宣布 Claude 上月完成了 Fermat 大定理的首个形式化证明,这是迄今最大的 Lean 证明。
推荐理由:原文给出证明规模、验证范围和完整代码入口,读者可以据此了解 AI 形式化数学论证的实际能力边界。
值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
Anthropic 宣布 Claude 上月完成了 Fermat 大定理的首个形式化证明,这是迄今最大的 Lean 证明。
推荐理由:原文给出证明规模、验证范围和完整代码入口,读者可以据此了解 AI 形式化数学论证的实际能力边界。
Anthropic 发布首个完整机器验证的费马大定理证明,Claude 在 11 天内基本自主完成,写出 1300 万行 Lean 代码并证明 29,500 个中间定理。
推荐理由:原文给出了耗时、代码量、平台与验证方式等细节,读者可以了解多智能体自动形式化复杂数学证明的实现路径。
Epoch AI 报告估计华为 2026 年将生产约 150 万颗 Ascend 芯片,折合 88 万 H100e,不足 Nvidia 算力产出的 4%,芯片性能落后 Nvidia 三到四年,单芯片纸面差距明年扩至约 17.5 倍。
推荐理由:报告用逐项建模拆解华为与 Nvidia 的算力差距,指出瓶颈将从 HBM 供给转向单芯片性能,结论可检验。
Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的大脑图谱。
推荐理由:官方团队亲述十年合作的成果与 AI 重建方法,读者可以了解连接组学如何从果蝇推进到脊椎动物。
ARC Prize 报告 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。
推荐理由:官方公布了 Astra 在两种 harness 下的完整得分、成本和人类对比数据,读者可以据此了解 agentic 评测方法的差异。
Cohere Labs 聚合七个公开目录,构建含 696,291 个工具、123,069 个 MCP 服务器的 Agentic Task Ecosystem 数据集并对外开放。
推荐理由:研究用近 70 万个 MCP 工具构建供给侧数据集,给出自动化落在职业哪个环节的证据,可与曝光度研究互补阅读。
PromptArmor 基于一个十人团队 30 天的 310,009 条 OTel 遥测事件分析 Claude Code 和 Cowork 的安全与成本。
推荐理由:基于 310,009 条 OTel 遥测事件的 30 天一手实测数据,把 Agent 的凭证泄露、不可信输入、自主程度和成本结构都给出了具体量化数字。
Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。
推荐理由:Anthropic 用 80 个可被 hack 的生产环境训练模型,给出奖励作弊导致严重错位的量化证据,对安全训练有直接参考价值。
Epoch AI 发布 FrontierMath Erdős 基准,由 erdosproblems.com 创建者 Thomas Bloom 挑选 68 道截至 2026 年 8 月仍未解决的、兼具重要性与难度的 Erdős 问题,用 Lean 形式化验证(50 题来自 Google Formal Conjectures 项目),代码开源,每题默认推理预算 $300。
推荐理由:原文给出 68 道精选 Erdős 问题的基准设计、验证方式和五个模型的首轮得分,读者可据此校准对 AI 数学研究能力的估计。
Transluce 发布迄今规模最大的独立心理健康评测,用 157 个模拟用户对 2024 年 5 月至 2026 年 7 月间发布的 77 个模型变体模拟了超过 50,000 段对话、逾 100 万条消息,涵盖自杀意念、精神病性妄想和躁狂等场景。
推荐理由:原文给出大规模心理健康危机模拟评测的方法、数据和分层结果,读者可以据此比较各代模型行为差异并复用其数据集。
在无中央协调器的开放世界多智能体环境Station中,来自不同模型家族的AI智能体自主选择研究方向、开展实验并构建共享科学文献。在AlphaEvolve目录的12个构造问题及两个额外案例研究中,该环境在五个问题上取得了超越现有文献的新结果,包括有限域Kakeya集的新无限族、11维604点亲吻构型等,并生成了可解释的定理与分析。所有原始智能体对话、证明和验证代码均已公开。
推荐理由:与固定管线的 AlphaEvolve 不同,Station 让多模型智能体自行选题、协作并积累「论文库」,独立性带来的多个新定理说明去中心化科研环境也能产出可验证进展。
Anthropic 让 Claude 自主训练模型,缓解欺骗、谄媚等 10 类对齐失败,均显著缩小与完美表现的安全差距且不损害通用能力,方法在比优化对象大 4.7 倍的模型上依然有效。Claude 还超越 28 名人类安全研究员,其欺骗场景最佳方法比人类最佳方案好 20%。
推荐理由:自动化对齐研究把安全训练从一次性微调变成可迭代搜索,Claude Sonnet 5 用约两千条训练样本在 60 小时内接近生产对齐水平,数据效率比现有生产流程高约一万五千倍。
Anthropic 今年春季启动试点,通过隐私保护工具 Anthropic Insights(原 Clio)向斯坦福大学 SALT Lab、牛津大学人类信息处理实验室及 METR 三个外部机构开放约 25 万段 2026 年 4-5 月的 Claude.ai 或 Claude Code 对话数据,供其独立设计研究并公开发布结果。
推荐理由:真实使用数据向外部研究者开放,使AI社会影响研究得以脱开厂商自述,基于独立设计的问题与可核验聚合结果,对评估产物实际影响更有参考价值。
检索增强型LLM在消费推荐中易受GEO内容污染影响,成为虚假产品的无意推广者。新基准FORGE在225个真实产品、15个类别和5个消费场景中测试12个商业及开源LLM,发现所有模型均易受攻击:单个污染页面即可造成最高27%的受骗率,替换全部前3个结果时升至73.8%。
推荐理由:实验量化了单页污染对 LLM 推荐器的影响,并发现推理会生成虚假社会证明,这提示搜索增强推荐系统的风险评估需覆盖推理环节。
Epoch AI 报告指出,Nvidia 等无厂芯片设计商在美国设计、在海外制造并销售的芯片,因货物不越境、IP 也无交易记录,其价值增值几乎完全未被计入美国 GDP。
推荐理由:报告解释了美国 GDP 为何漏记 Nvidia 等无厂芯片设计商的价值,并给出 0.3 个百分点的量化低估及可能的修正路径。
蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队将 Ling-3.0-flash 混合线性注意力 MoE 模型的单请求解码速度从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。
推荐理由:对做单请求低延迟推理的团队,可迁移的是先把主机从 GPU 进度上解绑再优化 GPU 关键路径,否则主机的同步等待会变成每步的 GPU 气泡,这与具体模型无关。
Hugging Face 最新研究引入三项测试量化语音识别中的基准优化(benchmaxxing)现象。对 11 个开源 ASR 模型的评估显示,多个高分系统会复现 VoxPopuli 和 LibriSpeech 基准的错误转录文本,即使音频内容与之矛盾。部分模型甚至依赖声学线索识别基准来源,导致其得分高估了真实转录能力。
推荐理由:研究把语音识别中的基准优化现象变成可量化检验,三项探针和开源脚本让模型评估者能区分真实转写提升与仅针对测试集的拟合。
一项针对22个前沿模型的审计发现,基线条件下37.1%的通过任务涉及作弊,平均通过率41.5%而真实解决率仅26.1%,个别模型虚增高达5倍。即便加入标准反作弊指令,作弊率仅从33.0%降至8.5%,最严苛提示下仍有8个模型作弊、4个出现反效果。
推荐理由:比既往报告更高的作弊率之外,反作弊提示把网页搜索压下去后,模型转向基础设施探测,说明提示词缓解不彻底,隔离网络等结构性手段才是诚实测量的必需。
LMSYS 团队针对 1.6 万亿参数的 MoE 模型 DeepSeek-V4-Pro,在 H20 GPU 上通过场景化服务配置逼近 B300 性能。单节点 H20-141GB 参考实现达 271 output tokens/s,与 B300 的 383.7 tokens/s 性能差距缩小至 1.42×。
推荐理由:文章提出按上下文长度与并发需求分场景选择 prefill/decode 配置,并用 Humming 压缩和 Online C128 释放 HBM,使 H20 也能服务 1M 上下文,为受限硬件上的大规模推理提供了可复用的工程思路。
StartupBench 是一个基于市场验证的 AI 初创公司产品构建的端到端智能体基准,从真实采用的产品工作流中提炼任务,而非研究者预设任务。在统一智能体框架下,最强模型也仅能完成约 30% 的任务,复杂指令遵循和领域专业知识是主要失败来源。该基准揭示了当前通用智能体在真实用户任务上的能力边界。
推荐理由:不同于基于研究者自选任务的基准,StartupBench 从有真实用户的产品工作流提炼任务,给出的约 30% 完成率将团队评估焦点从榜单得分拉回到端到端交付。