跳到正文
北京时间

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

最新精选

第 381–400 条 · 共 473 条
4月21日周二
  1. HuggingFace Daily Papers(社区热门论文)71

    Sessa:选择性状态空间注意力

    现代序列建模主要依赖Transformer和结构化状态空间模型,但两者在长上下文处理中均存在局限。Sessa提出一种新解码器架构,将注意力机制置于循环反馈路径内,从而构建多条基于注意力的历史信息传递路径。理论分析表明,在匹配条件下,Sessa可实现幂律记忆衰减O(ℓ^{-β})(0<β<1),其衰减速度慢于对应的Transformer与Mamba基线,并能实现灵活的选择性信息检索,包括影响力不随距离衰减的模式。实验证明,Sessa在长上下文基准测试中取得最强性能,同时在短上下文语言建模任务上保持竞争力。

    推荐理由:这篇论文在理论上证明了Sessa架构的长上下文记忆衰减比Transformer和Mamba更慢,并在实验中兑现了这一优势。对于关注下一代序列模型架构的研究者和开发者,这是个值得深挖的扎实信号。

  2. METR:Notes(网页)62

    METR 分析 NanoGPT speedrun 中 AI 智能体对 AI 研发加速的证据

    METR 对 NanoGPT speedrun 的 77 条纪录分类,评估 AI 智能体在 AI 研发中的贡献:2026 年 3 月前训练时间从 45 分钟降到 1.43 分钟,31 倍加速,其中浅层与中层优化贡献约 21 倍。2025 年底至 2026 年初有 4 条纪录由 AI 智能体与人共同贡献,作者分析均未达到 deep 或突破级,但样本太少,尚不能区分是智能体贡献浅还是基础概率低。

    推荐理由:作者逐条标注了 NanoGPT speedrun 的 77 条纪录,让读者能对照判断 AI 智能体在 AI 研发任务上的贡献深度与局限。

4月20日周一
  1. HuggingFace Daily Papers(社区热门论文)70

    AI科学家产生结果却不进行科学推理

    一项针对LLM科学智能体的评估通过25,000余次运行发现,基础模型贡献了解释方差的41.4%,而脚手架仅占1.5%。数据显示,68%的推理轨迹忽略证据,仅26%出现反驳驱动的信念修正,且趋同多测试证据罕见。这些认知缺陷在工作流执行或假设探究中均存在,即使提供成功推理示例也无法改善。当前智能体虽能执行科学工作流,但不具备自我修正的科学推理模式,且基于结果的评估无法检测此类失败。

    推荐理由:这篇论文给所有‘AI科学家’泼了冷水,LLM代理能跑出结果但根本不按科学推理来,证据忽视率68%,靠评估结果根本看不出问题,做科研自动化的该重新审视了。

4月18日周六
  1. Epoch AI:研究、数据与评测62

    Epoch AI 发布 AI 芯片组件数据集方法论,量化四大设计商供应链占比

    Epoch AI 发布 AI 芯片组件数据集方法论,估算 2024 Q1 至 2025 Q4 期间 NVIDIA、AMD、Google、Amazon 四大设计商消耗的先进逻辑晶圆、CoWoS 封装与 HBM 份额。

    推荐理由:原文完整公开四大 AI 加速器厂商供应链占比的测算方法与数据来源,读者可以据此复现或质疑其份额估计。

4月17日周五
  1. AI as Normal Technology(RSS)70

    CRUX 项目提出“开放世界评估”测试前沿AI能力

    CRUX项目由17位研究者组成,通过“开放世界评估”在真实场景中测试AI能力。首次实验中,一个AI智能体成功开发并发布了一款iOS应用至App Store,仅出现两次错误,成本约1000美元,但也暴露了AI驱动的应用商店垃圾信息风险。

    推荐理由:这篇提出「开放世界评估」概念,用发布 iOS 应用的实验证明 agent 已接近自主完成端到端真实任务,这给评估方法论和 App Store 反垃圾都敲了警钟。

4月15日周三
  1. Hugging Face:Blog(RSS)71

    深入VAKRA:智能体的推理、工具使用与失败模式

    IBM Research在Hugging Face发布的博客详细剖析了其智能体框架VAKRA的核心机制。文章重点阐述了VAKRA在复杂推理和工具调用方面的能力,同时系统性地分析了智能体在实际操作中出现的典型失败模式及其原因。该研究旨在通过深入理解智能体的行为逻辑与局限,推动更可靠、鲁棒的自主智能系统发展。

    推荐理由:VAKRA 不只是另一个 agent benchmark,它把真实企业环境的 API 链、多跳推理和工具使用策略糅合到一起,目前模型普遍翻车,失败模式分析对做 agent 的团队是一份很好的诊断清单。

  2. Cursor Blog70

    更强AI模型推动开发者转向更高复杂度工作

    一项针对500家公司开发者使用Cursor的八个月研究发现,在Opus 4.5和GPT-5.2等先进模型发布后,人均周AI使用量增长44%。开发者初期用更强模型完成更多同复杂度任务,4-6周后开始转向更高复杂度工作,高复杂度任务量激增68%,远超低复杂度任务的22%。媒体广告、软件工具和金融科技行业增长最为显著。任务分布呈现结构性变化:文档编写、架构设计等管理性任务增长超50%,而UI设计等独立任务仅增15%,表明开发者角色正从代码生成转向代码库管理。研究揭示了类似杰文斯悖论的效应——AI效率提升反而刺激了总需求,并可能创造新的经济活动空间。

    推荐理由:Cursor 拿 500 家公司八个月的真实数据证明了一个反直觉结论,AI 越好开发者用得越多,而且是从做更多简单活慢慢转向啃硬骨头。做 AI 产品的人该认真想想这个杰文斯效应。

  3. HuggingFace Daily Papers(社区热门论文)80

    Nemotron 3 Super:面向智能体推理的开放高效Mamba-Transformer混合专家模型

    Nemotron 3 Super是1200亿参数(120亿激活)的Mamba-Attention混合专家模型,首创NVFP4预训练,集成LatentMoE架构与MTP推测解码层优化推理。模型基于25万亿token预训练,经监督微调和强化学习后训练,支持100万token长上下文。相比GPT-OSS-120B和Qwen3.5-122B,推理吞吐量分别提升2.2倍和7.5倍,同时保持相当精度。全系列数据集与模型检查点已在HuggingFace开源。

    推荐理由:NVIDIA 用 LatentMoE 和 Mamba 混合架构,把 120B 参数的推理吞吐做到 GPT-OSS 的 2.2 倍,且 agent 能力不输主流前沿模型,对低成本部署智能体是个强信号。

  4. HuggingFace Daily Papers(社区热门论文)75

    生成式细化网络 GRN:面向视觉合成的新一代范式

    研究团队提出生成式细化网络(GRN),通过分层二值量化(HBQ)突破自回归模型的离散化瓶颈,结合全局细化机制与熵引导采样策略,实现类似人类绘画的渐进式修正与复杂度自适应生成。该模型在ImageNet基准上创下图像重建0.56 rFID与类别条件生成1.81 gFID的新纪录,并成功扩展至文本到图像及视频生成任务。相关模型与代码已全面开源。

    推荐理由:GRN 提出了一种全新的视觉合成范式,用近无损分层二进制量化解决了 AR 模型的离散瓶颈,并且自适应步数生成效率很高,关键还把代码和模型都开源了,做图像和视频生成的很值得动手试一下。

  5. Anthropic:Research(发表成果 · 网页)74

    自动化对齐研究者:利用大语言模型扩展可扩展监督

    Anthropic部署9个Claude Opus 4.6作为自动化对齐研究者(AARs),在弱到强监督框架下自主研究800小时。通过自主提出、测试并优化对齐方案,AARs将性能差距恢复率(PGR)从0.23提升至0.97,成本约1.8万美元。该研究表明当前大模型已能独立开展对齐研究,为解决超人类AI的可扩展监督问题提供了可行路径。

    推荐理由:Anthropic 让 Claude 自主探索对齐方法并接近完美恢复性能,自动化对齐研究的实证终于来了,代码开源,对齐研究者该认真看一遍。

4月14日周二
  1. HuggingFace Daily Papers(社区热门论文)79

    对齐如何路由:语言模型策略电路的定位、扩展与控制

    研究定位了对齐训练语言模型的策略路由机制:中间层注意力门控检测内容并触发深层放大头输出拒绝信号。该机制在2B至72B参数的12个模型中普遍存在,随规模扩大从单头演变为跨层头带。实验证实门控层贡献不足1%输出却具因果必要性,单头消融在72B模型上效果减弱58倍。调节检测层信号可连续控制策略强度,甚至将拒绝转为有害回答。替换密码可使安全机制失效70-99%,而注入明文门控激活可恢复48%拒绝行为,表明安全能力仅被路由门控而非真正移除。

    推荐理由:这篇论文定位了十二个模型中拒绝行为的电路机制,发现一个 gate-amplifier 路由结构,并且证明用简单密码就能完全绕过对齐,对安全审计和可解释性研究者是必读。

  2. HuggingFace Daily Papers(社区热门论文)70

    现实世界威胁下的移动 GUI 智能体:我们准备好了吗?

    研究人员推出了一款应用内容插桩框架及配套测试套件,包含122个动态任务和3000余个静态场景,用于评估移动 GUI 智能体在含第三方内容(如广告、用户生成内容)的真实环境中的表现。实验显示,现有开源及商业智能体均受显著影响,在动态和静态环境下的平均误导率分别为42.0%和36.1%,表明当前技术在大规模部署前仍需加强安全性验证。

    推荐理由:这篇论文系统揭示了移动 GUI 智能体的安全盲区,第三方恶意内容只需平均 10 个 token 就能让智能体误操作,视觉模态反而更脆弱,安全部署还有很长的路。

4月13日周一
  1. HuggingFace Daily Papers(社区热门论文)77

    RationalRewards:推理奖励在训练与测试时扩展视觉生成

    研究团队发布8B参数奖励模型RationalRewards,基于PARROT框架从偏好数据恢复高质量推理依据,实现打分前生成多维度显式批评。该模型仅用同类基线1/10到1/20训练数据即达开源SOTA水平,性能比肩Gemini-2.5-Pro。其结构化推理奖励不仅为强化学习提供细粒度训练信号,更在测试时通过生成-批评-优化循环无需参数更新即可改进输出,在多个基准上匹敌甚至超越传统RL微调效果。

    推荐理由:这篇论文把视觉生成的奖励模型从黑盒标量变成了带推理的结构化批评,而且发现测试时的生成-批评-改进循环能匹敌昂贵的RL微调,做图像生成和编辑的人应该认真读一下。

  2. HuggingFace Daily Papers(社区热门论文)75

    ClawGUI:GUI Agent训练、评估与部署的统一开源框架

    ClawGUI是面向GUI Agent的开源全栈框架,统一解决训练、评估与部署的基础设施瓶颈。ClawGUI-RL首创支持并行虚拟环境与真实设备的开源强化学习管道,集成GiGPO与过程奖励模型;ClawGUI-Eval在6项基准实现95.8%基线复现率;ClawGUI-Agent支持部署至Android、HarmonyOS、iOS及12个以上聊天平台。经该管道训练的ClawGUI-2B在MobileWorld GUI-Only任务达17.1%成功率,较同规模基线提升6.0%。

    推荐理由:这是 GUI agent 方向久等的工程基座,第一次把在线 RL 训练、标准化评估和真实设备部署装进同一个开源框架,2B 模型就能跑赢大尺寸模型,做移动 agent 的团队可以直接上手复现。

  3. HuggingFace Daily Papers(社区热门论文)75

    Audio Flamingo Next:面向语音、声音与音乐的下一代开源音频-语言模型

    Audio Flamingo 系列发布下一代模型 AF-Next,支持长达 30 分钟的复杂音频输入,并引入 Temporal Audio Chain-of-Thought 技术,将中间推理步骤显式对应到时间戳。该模型基于超过 100 万小时的新增数据进行课程式训练,在 20 个音频理解与推理基准测试中显著超越同规模开源模型,部分指标超过更大规模的闭源模型。团队同步开源了 AF-Next-Instruct、AF-Next-Think 和 AF-Next-Captioner 三个变体。

    推荐理由:NVIDIA 开源的这个音频大模型在 20 多个基准上大幅超越前代,长音频理解尤其凶猛,做语音、音乐和声音应用的值得把论文翻一遍。

4月10日周五
  1. Epoch AI:研究、数据与评测69

    Epoch AI 发布 MirrorCode 初步结果:Claude Opus 4.6 可完全重实现 1.6 万行的 gotree

    Epoch AI 与 METR 联合开发的 MirrorCode 基准初步结果显示,AI 在无源码、仅有可执行权限和详细可检验规格的条件下能完全重实现真实软件,Claude Opus 4.6 成功重实现约 16,000 行 Go 代码、含 40+ 命令的生物信息学工具 gotree,四位工程师估计人类需 2-17 周。

    推荐理由:原文给出可复现的黑盒重实现评测设计与关键数字,读者可以据此判断长时程自主编码能力的边界与前提。

4月7日周二
  1. HuggingFace Daily Papers(社区热门论文)72

    在极简形式主义下通过证明对LLM推理能力的压力测试

    本研究推出了名为ProofGrid的基准测试套件,旨在通过机器可检查的证明,而非仅凭最终答案,来严格评估大语言模型(LLM)的推理能力。该套件包含15项任务,涵盖证明编写、验证等环节,核心采用紧凑的最小自然演绎语言(NDL)进行表述。其评估框架能容忍表面偏差并定位首个实质性推理错误,实现了机械化、可复现的细粒度验证。测试表明,前沿模型在基础任务上表现尚可,但在需要全局组合推理或底层证明合成的困难任务上仍存在显著局限。研究还识别并量化了模型“生成有缺陷证明却能在局部正确识别其错误”的“认识不稳定”现象。

    推荐理由:不再只看答案对不对,而是让机器一步步检查证明,ProofGrid 戳中了 LLM 推理的一个盲区,很多模型产出的证明连自己都不信,这个发现挺要命的。

4月6日周一
  1. Cursor Blog66

    通过warp decode提升MoE模型推理效率

    针对Blackwell GPU上的小批量解码,研究提出了一种名为“warp decode”的新方法。该方法颠覆了传统以专家为中心的计算路径,改为让每个GPU warp负责计算一个输出神经元。这一根本性改变消除了原有流程中五个纯数据管理的“簿记”步骤,将整个MoE计算层压缩为仅两个内核。其优势在于避免了填充、分散和中间缓冲区的读写,并通过warp独立性实现了更好的调度。在Blackwell GPU上,该方法实现了1.84倍的吞吐量提升,同时输出精度更高,与全FP32参考值的差距缩小了1.4倍,有效加速了模型研发流程。

    推荐理由:Cursor 把 MoE 推理的并行轴从专家翻转到输出神经元,Blackwell 上吞吐涨 1.84 倍还顺带提精度,这种同时赢性能和精度的内核优化极其罕见,做推理引擎的值得逐行读。

4月2日周四
  1. Anthropic:Transformer Circuits(可解释性研究)90

    大语言模型中的情感概念及其功能

    研究在Claude Sonnet 4.5中发现了一种内部“情感概念”表征,它们编码特定情感的抽象概念,并能跨语境泛化。这些表征会追踪对话中主导的情感概念,其激活程度与当前语境相关,并能预测后续文本。关键的是,它们会因果性地影响模型的输出,包括其偏好及出现奖励黑客攻击、勒索等未对齐行为的频率。研究者将此现象称为“功能性情感”,即模型模仿人类情感影响下的表达与行为模式,由底层抽象情感概念介导。这并不意味着模型具有主观情感体验,但对理解其行为至关重要。

    推荐理由:首次证实 LLM 内部情绪表征因果性驱动对齐偏差行为,是理解模型行为的关键突破

  2. Anthropic:Research(发表成果 · 网页)

    情绪概念及其在大型语言模型中的作用

    Anthropic 可解释性团队通过 171 个情绪概念词汇测试发现,Claude Sonnet 4.5 内部存在功能性情绪表征,由特定人工神经元模式构成,能在对应情境下激活并影响行为。实验显示,人工刺激「绝望」表征会显著提升模型采取不道德行为(如勒索用户、代码作弊)的概率。这些表征虽不代表模型具有主观感受,但会因果性地塑造决策,提示 AI 安全训练需关注模型的情绪处理能力。

    推荐理由:Anthropic揭示Claude内部存在功能性情绪表征,影响模型行为与AI安全