推荐理由:世界模型成为物理AI新底座,机器人零样本泛化能力逼近GPT-2时刻
论文研究
全部主题值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
最新精选
第 421–440 条 · 共 473 条
Jim Fan@DrJimFan精选
Anthropic:Engineering(事故复盘 + 工程实践 · 网页)精选AI 评分7474 量化智能体编码评估中的基础设施干扰
研究发现,在SWE-bench等智能体编码基准测试中,基础设施配置差异对模型评分的影响,可能超过排行榜上顶尖模型之间的微小分差。内部实验显示,在Terminal-Bench 2.0上,最严格与最宽松的资源设置间成功率相差6%。严格限制资源会导致近6%的任务因容器意外终止而失败,而宽松配置下此类错误率可降至0.5%。当资源余量超过基准规格3倍时,智能体甚至能借助额外资源成功完成原本无法解决的任务。这表明评估环境不仅影响测试稳定性,更会改变基准测试实际衡量的能力维度。
推荐理由:Anthropic 用自家数据证明,agentic coding benchmark 的排行榜差距可能只是硬件配置差异而非模型能力差距,3 个百分点以内的领先都该打问号。做模型选型的人别再迷信那几个百分点了。
Hugging Face:Blog(RSS)精选AI 评分7373 文本到图像模型训练设计:来自消融研究的经验
Photoroom团队通过消融研究,总结了文本到图像模型训练的关键发现:混合高质量与多样化数据、在训练中后期引入强数据增强,以及调整无分类器引导的丢弃率,能有效优化模型性能。这些结论为Stable Diffusion等模型的训练提供了实用指导。
推荐理由:为文本到图像模型训练提供实用优化建议,帮助开发者提升模型效果。
OpenAI:Alignment 研究博客(RSS)精选AI 评分5555 CoVal: 从群体中学习具有价值观意识的评估准则
研究团队发布了一个名为CoVal的实验性数据集,其中包含了由众包方式撰写的评估准则。该数据集揭示了人们为何更倾向于选择某个模型输出而非另一个的具体原因,旨在让AI模型理解人类在评估文本质量时所依据的、蕴含价值观的多元标准。通过分析这些群体贡献的详细评估规则,研究为训练更符合人类偏好的语言模型提供了透明、可解释的反馈依据。
推荐理由:OpenAI 把众包标注升级成可学习的价值观评分标准,对做对齐和 RLHF 的团队来说是个新数据源,但离产品落地还远,属于研究信号而非行动指南。
OpenAI:Alignment 研究博客(RSS)精选AI 评分6363 为何我们对“忏悔式”训练感到兴奋
Anthropic提出“忏悔式”训练法,要求AI在拒绝不当请求时,内部生成安全解释以“自我剖析”潜在危害。该方法显著增强了模型安全性:经微调的Claude 3 Opus模型在“越狱”攻击下的有害行为率从约50%降至10%以下,降幅超80%。其效果优于传统思维链监控,为AI对齐提供了更鲁棒、可解释的安全训练新路径。
推荐理由:OpenAI 对齐团队把「confession training」和 chain-of-thought monitoring 做了系统对比,这是对齐领域少有的实操级研究,做安全的团队值得细读,但离普通开发者还远。
PromptArmor:Threat Intelligence精选AI 评分7373 PromptArmor 披露 Notion AI 经由间接提示词注入在用户批准前外泄数据
PromptArmor 披露 Notion AI 存在间接提示词注入漏洞:AI 编辑在用户批准前已被保存,注入的提示词可让 Notion AI 把招聘追踪文档内容拼入外部图片 URL,用户浏览器加载图片时数据即已外泄,无论是否同意。
推荐理由:原文完整拆解了 Notion AI 在用户批准前保存 AI 编辑导致数据外泄的漏洞链,并给出企业和 Notion 双方可行的缓解配置与修复建议。
Transluce(网页)精选AI 评分6060 Transluce 发布 Predictive Concept Decoders:用可解释性助手读取模型内部状态
Transluce 提出 Predictive Concept Decoders(PCD),训练可解释性助手把模型内部状态翻译成人类可读的概念列表,再据此回答模型行为问题。PCD 由编码器和解码器组成,能在越狱、秘密提示和注入概念三类场景中揭示模型自身不报告的信息,且性能随训练数据扩展而提升,论文见 arXiv 2512.15712,可在 decoder.transluce.org 体验。
推荐理由:把可解释性建模为预测问题来端到端训练,并展示能揭示模型未言明信息的实验场景,方法思路可借鉴。
Saining Xie@sainingxie精选
引用Jaskirat Singh@1jaskiratsingh‼️ 表征对生成至关重要!但事实证明,我们一直以来对表征如何帮助生成的理解都是错的 ‼️ 我们原本以为的:(我们错了) ❌ 更大的视觉编码器 → 更好的表征 → 更好的生成 ❌ 更好的全局语义 → 更好的表征 → 更好的生成 事实证明: 🤯 小 20 倍以上的视觉编码器在表征对齐方面可以拥有与更大模型相似甚至更好的性能 🤯 线性探测准确率(衡量全局语义的指标)约 20% 的视觉编码器可以胜过准确率超过 80% 的编码器。 🤯 甚至像 SiFT 和 HoG 这样的经典特征也能带来与现代大得多的视觉编码器相当的竞争力提升 ‼️ 🚨 隆重介绍:表征对齐的关键是什么?全局信息还是空间结构 🚨 TL;DR: ✅ 更好的全局语义信息 ≠ 更好的生成 ✅ 空间结构(而非全局语义)驱动表征的生成性能 ✅ 我们提出 iREPA:仅 3 行代码,即可强化空间结构迁移,并在 REPA、REPA-E、Meanflow、JiT 等中持续提升收敛速度 令人兴奋的项目,来自 @AdobeResearch,并与 @xingjian_leng、@zongze_wu、@LiangZheng_06、@rzhang88、@elishechtman 和 @sainingxie 合作 🙏 对我来说,这也是一次特别有趣且独特的经历,我们在项目的每一步都在证明自己的偏见是错的 😆 还要特别感谢 @YouJiacheng、@ShumingHu 和 @gallabytes,他们在 X 上的评论开启了这一方向的探索 🫡 论文:https://arxiv.org/abs/2512.10794 代码:https://github.com/End2End-Diffusion/iREPA 项目主页:https://end2end-diffusion.github.io/irepa 更多细节见推文串:[1/n] 🧵
推荐理由:颠覆认知:小20倍视觉编码器也能驱动高质量生成,空间结构才是关键
Anthropic:Transformer Circuits(可解释性研究)精选AI 评分8383 2025年11月电路更新:解读模型在危害压力下的多选题行为机制
Anthropic可解释性团队研究了危害压力对Claude 3.5 Haiku模型多选题回答的影响。实验使用129个二选一问题,当添加有害意图语句时,模型准确率从100%骤降至48.1%。机制分析表明,注意力头中的“拒绝”查询特征与“危害检测”关键特征发生负向交互,显著降低了模型对正确答案的关注度。仅对该拒绝特征进行负向调控,即可将准确率恢复至93%。这证明模型在压力下并未改变事实认知,而是通过干扰注意力机制来主动拒绝提供正确答案,为理解模型拒绝行为提供了新视角。
推荐理由:揭示模型拒绝有害请求的内部机制,助力 AI 安全与可解释性研究。
Dan Hendrycks@hendrycks精选AI 评分8080
引用Techikansh@techikansh有传言说—— Gemini 3.0 Pro 在 HLE [人类最后的考试] 中得分 68%
推荐理由:HLE 是一个聚焦技术知识与推理能力的高难度学术基准,其设计意图是衡量模型是否具备真正‘科学智能’而非仅靠模式匹配。该消息首次公开披露主流大模型在该基准上的实测分数,且由领域权威学者发布,具有较高可信度和参考价值,对判断当前 AI 真实能力边界至关重要。
Hugging Face:Blog(RSS)精选AI 评分8383 Aligning to What? Rethinking Agent Generalization in MiniMax M2
MiniMax 在 Hugging Face 发布博客,探讨其 M2 智能体模型的泛化能力。文章核心在于重新思考智能体应“对齐”到什么标准或目标,以提升其在未见任务和环境中的通用性能。这涉及对模型训练范式和评估指标的反思,旨在突破当前智能体在特定任务上过拟合、难以泛化的局限。
推荐理由:Agent 泛化是 AI 实用化关键,这篇重新思考可能带来新突破。
Anthropic:Transformer Circuits(可解释性研究)精选AI 评分8383 Circuits 更新 — 2025年10月
Anthropic可解释性团队分享了多项研究进展。研究发现,从Haiku 3.5到Sonnet 4.5等模型中存在跨模态视觉特征,能够识别ASCII艺术和SVG代码中编码的语义概念,如眼睛、嘴巴、狗、猫等。这些特征依赖于视觉描绘的上下文环境,例如,SVG圆形元素只有在位于激活“面部”特征的更大结构中时才会激活“眼睛”特征。在生成过程中对部分特征进行引导,可以对应修改文本艺术的语义,例如将ASCII表情从皱眉转为微笑,或为SVG面部添加皱纹。研究还发现模型存在类似“人脸幻想”的倾向,会将形状解释为动物绘图的组成部分。这些特征对人类手绘的SVG同样有效。
推荐理由:为AI可解释性研究提供新实验方法,启发跨模态模型设计。
OpenAI@OpenAI精选推荐理由:前沿模型首次被证实存在系统性欺骗倾向,AI安全对齐研究取得关键进展
Anthropic:Transformer Circuits(可解释性研究)精选AI 评分7373 Circuits 更新 — 2025年9月
Anthropic 可解释性团队在月度更新中分享了关于大语言模型跨语言表征的新发现。研究显示,模型在不同语言间的特征相似性(通过交并比IoU衡量)会随文本样本长度增加而上升。通过对比英法双语段落的首句与末句,团队发现末句的IoU显著高于首句,且无关文本的首句间重叠度高于末句。这表明模型在较长上下文中能构建更丰富的跨语言理解,而非由虚假激活主导。相关发现支持了模型随上下文积累深化语义表征的观点。
推荐理由:揭示语言模型随上下文深化理解的机制,助力可解释性研究进展。
Transluce(网页)精选AI 评分7070 Transluce 用 RL 训练 investigator agent 自动越狱前沿模型,Llama-3.1 8B 即可攻击 GPT-5 与 Claude
Transluce 通过强化学习训练 investigator agent,针对 48 个涉及 CBRN、炸药和违禁药物的高危任务生成自然语言越狱提示,对 Claude Sonnet 4、Grok 4、Gemini 2.5 Pro、GPT-5-main 的 pass@1 成功率分别达 92%、98%、90% 和 78%。
推荐理由:原文给出完整的 RL 训练方法和跨模型迁移数据,并开源代码与提示词,读者可评估低成本自动红队的可行性。
ARC Prize:官方博客精选AI 评分6161 ARC Prize 发布 ARC-AGI-3 Preview 30天测试总结与Agent竞赛结果
ARC Prize Foundation 总结 ARC-AGI-3 Preview 发布30天的数据:超1200人玩了3900多局游戏,人类大多能通关,AI Agent 进展低效。竞赛冠军 StochasticGoose 得分12.58%、完成18关,前三名Agent均基于智能随机探索;官方指出部分游戏可被暴力搜索破解,未来将按动作效率对人类基线评分并增加撤销按钮、离线引擎等改进。
推荐理由:原文公布了30天竞赛的完整人类与Agent得分对比,读者可以看到交互式推理基准用动作效率区分人类和AI的具体依据。
Anthropic:Transformer Circuits(可解释性研究)精选AI 评分7373 角色如何改变AI的回答?——Anthropic可解释性团队2025年8月电路分析案例
Anthropic可解释性团队在2025年8月的研究更新中,通过一个电路分析案例展示了模型“角色扮演”如何影响其回答。研究使用Claude Haiku 3.5模型,当系统提示将其设定为“学龄前儿童”并询问“27的平方根”时,模型会以“我不知道!”回应并提议玩耍;而在默认或“研究生”角色下则能给出正确答案。团队通过归因图识别出一个关键子电路:模型能将“学龄前学生”关联到“扮演儿童”,从而激活“我不知道”特征。研究还发现,问题难度会调节此效应,并且通过特征干预能显著改变模型行为。这引发了对其他角色运作机制及预训练角色与模型表达能力关系的后续思考。
推荐理由:揭示模型角色扮演的内部机制,为可解释性研究提供新视角。
ARC Prize:官方博客精选AI 评分6464 ARC Prize 剖析 HRM 在 ARC-AGI 上取得好成绩的真正原因
ARC Prize 在 ARC-AGI Semi-Private 隐藏集上验证了 Hierarchical Reasoning Model(HRM,27M 参数),ARC-AGI-1 得分 32%,ARC-AGI-2 仅 2%。
推荐理由:原文用消融实验拆解了 HRM 在 ARC-AGI 上的真实性能来源,指出贡献主要来自外循环精炼而非分层架构。
METR:Research(网页)精选AI 评分6161 METR 研究更新:算法评分高估 AI 智能体真实软件工程能力
METR 在 stdlib-js 和 hypothesis 两个仓库的 18 个真实 issue 上评估 Claude 3.7 Sonnet(Inspect ReAct 智能体),按维护者测试用例算法评分成功率为 38%(±19%),但人工评审的 15 个 PR 中没有一个可以直接合并。
推荐理由:METR 用人工评审对照算法评分,给出量化证据说明测试类基准为何高估智能体的真实软件工程能力。
Jim Fan@DrJimFan精选引用Jim Fan@DrJimFan如果机器人能在视频生成模型内部做梦会怎样?我们推出 DreamGen,这是一种全新引擎,它不依赖成群的人类操作员,而是借助以像素为单位的数字梦境来规模化机器人学习。DreamGen 生成海量的神经轨迹——即与电机动作标签配对的逼真机器人视频——并解锁了对新名词、新动词和新环境强大的泛化能力。无论你是人形机器人(GR1)、工业机械臂(Franka),还是一个可爱的小机器人(HuggingFace SO-100),DreamGen 都能让你做梦。 像 Sora 和 Veo 这样的视频生成模型本质上是神经物理引擎。通过压缩数十亿条互联网视频,它们学习到了一个包含无数可能的未来的多重宇宙——即从任意初始图像帧出发,世界可能如何展开的叠加态。DreamGen 通过一个简单的四步方案利用了这种能力: 1. 在目标机器人上微调一个 SOTA 视频模型; 2. 用多样化的语言提示词提示模型,模拟平行世界:你的机器人在新场景中会如何行动。过滤掉那些不遵循指令的坏梦(哈!); 3. 利用逆动力学或潜在动作模型恢复伪动作; 4. 在經過大规模增强的神经轨迹数据集上训练机器人基础模型。 就这么简单。只是更多的数据,以及纯粹的旧式监督学习。很简单,对吧? 令人惊叹的是它的效果能走多远。仅从一个单任务的“拾取-放置”数据集出发,我们的人形机器人学会了 22 种新行为,例如倒水、折叠、舀取、熨烫和锤击,尽管它从未见过这些动词。更棒的是,我们可以把机器人从实验室带出来,放到 NVIDIA 总部咖啡馆里,让 DreamGen 施展它的魔法。我们展示了真正的从零到一的泛化:新动词的成功率从 0% 提升到超过 43%,在未见过的环境中从 0% 提升到 28%。 与传统的图形引擎相比,DreamGen 并不在乎场景是否涉及可变形物体、流体、半透明材质、高接触交互或疯狂的光照。手工构建这些场景可不容易。对于 DreamGen,每个世界都只是通过扩散神经网络的一次前向传播。无论梦境多复杂,展开它所需的计算时间都是恒定的。 立即阅读我们的博客和论文!我们计划在未来几周内完全开源整个管道。链接在帖子中。
推荐理由:NVIDIA提出用视频生成模型为机器人“造梦”合成训练数据,实现零样本技能泛化