跳到正文
北京时间

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

最新精选

第 301–320 条 · 共 473 条
5月21日周四
  1. 公众号:智谱(GLM)76

    智谱联合驭驯网络与清华提出ZCube组网架构,破解大模型推理网络瓶颈

    智谱、驭驯网络与清华大学联合提出并落地ZCube组网架构,以扁平化拓扑替代传统Clos/ROFT架构,从结构层面消除PD分离推理中的可避免拥塞。在GLM-5.1 coding生产环境千卡集群实测中,ZCube相比ROFT将GPU平均推理吞吐提升15%以上,TTFT P99降低40.6%,同时减少约三分之一的交换机与光模块成本。

    推荐理由:架构创新不只是省钱,ZCube 在 GLM-5.1 集群里用三分之一交换机成本换来 15% 吞吐提升和 40% 尾时延改善,为 PD 分离推理提供了一条可复用的组网路径。

  2. TechCrunch:AI(RSS)79

    OpenAI 声称其解决了一道存在了80年的数学问题——这次来真的

    OpenAI 宣布其推理模型成功证伪了一道自1946年起悬而未决的几何猜想。与以往不同,此次声称获得了此前曾指出OpenAI相关声明存在错误的数学家们的认可与支持,这为其结论的可靠性提供了关键背书。

    推荐理由:从上次的虚报到这次拿出数学家背书,OpenAI 真的让 AI 自主推翻了一个 80 年猜想,这不仅是数学突破,更证明推理模型能处理超长链条的复杂问题。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)88

    OpenAI模型证伪了离散几何中的一个核心猜想

    OpenAI开发的人工智能模型成功解决了数学界悬而未决逾80年的“单元距离问题”,并由此推翻了离散几何领域的一个核心猜想。这一突破被视作人工智能驱动数学研究的里程碑事件,标志着AI在基础科学理论探索中取得了实质性进展。该模型通过创新算法处理复杂的几何问题,展示了机器在自动化发现与验证数学猜想方面的巨大潜力。

    推荐理由:数学界等了80年的猜想被AI自己证伪了,而且用的是代数数论这种“跨界”手法,这个里程碑说明AI的创造性推理已经进入前沿研究。虽然实战还用不上,但作为能力信号,值得每个关心AI前沿的人看。

5月20日周三
  1. HuggingFace Daily Papers(社区热门论文)74

    优化_anything:通用文本参数优化API

    该研究提出了一种基于大语言模型的通用文本优化系统,将优化问题统一表述为通过评分函数改进文本产物。在六项任务中达到最优结果:智能体架构使Gemini Flash在ARC-AGI上的准确率从32.5%提升至89.5%;调度算法降低40%云成本;87%的CUDA内核匹配或超越PyTorch表现;圆包装问题超越AlphaEvolve。实验表明,可操作的附加信息比仅使用分数反馈收敛更快、得分更高;多任务搜索通过跨任务迁移学习,在同等预算下优于独立优化,且任务数量越多收益越大。该工作首次证明基于LLM的文本优化是通用问题解决范式,能统一传统领域特定算法。系统已开源,支持多种后端。

    推荐理由:让一个LLM同时优化agent架构、调度算法和CUDA内核,还能将ARC-AGI从32%拉到89%,这可能是今年最突破认知的通用问题求解范式,做agent的人必须看。

  2. HuggingFace Daily Papers(社区热门论文)72

    CopT:基于连续空间对比验证的在策略推理

    CopT提出了一种反转传统链式思考(CoT)顺序的推理框架:先生成草稿答案,再进行策略内反思。其核心是将连续嵌入向量转化为推理时的对比验证器,通过比较模型在离散令牌与连续嵌入输入下对同一生成令牌的支持度,构建序列级反向KL估计器,以此评估答案的可靠性。当答案不可靠时,CopT会执行进一步思考,并利用第二个KL估计器动态控制草稿答案的可见性,在保留有用信息与规避误导间取得平衡。在无需额外训练的前提下,该方法在数学、编程等任务上显著提升了准确率(最高达23%)并大幅减少了令牌消耗(高达57%)。

    推荐理由:CopT把推理流程反了过来,先草稿答案再自我反思,用连续嵌入对比验证可靠性,在数学/编码/Agent任务上提点23%省token57%,思路可能改写推理范式。

  3. HuggingFace Daily Papers(社区热门论文)72

    GoLongRL:面向能力的长期上下文强化学习与多任务对齐

    GoLongRL是一个全开源的长期上下文强化学习方案,聚焦于使用可验证奖励的强化学习。该工作提出了面向能力的数据构建方法,公开发布了包含23K样本的数据集、完整构建管线及训练代码。数据集依据长期上下文能力分类,涵盖9种任务类型,由真实文档生成的问答对构成;实验证明该数据集性能优于闭源的QwenLong-L1.5数据集。训练得到的Qwen3-30B-A3B模型在长期上下文任务上达到了与DeepSeek-R1-0528等先进模型可比的性能。此外,提出了TMN-Reweight多任务优化方法,通过任务级归一化和难度自适应加权,在提升平均性能的同时保持或增强了通用能力。

    推荐理由:开源长上下文RL的配方直接放出来了,数据集+代码全都有。更狠的是单靠数据多样性就干掉了闭源竞品,甚至摸到了DeepSeek-R1的水平,做长上下文的值得复现。

  4. Ethan Mollick75

    🚨我们的论文已在PNAS发表:我们发现经典的人类说服技巧以一种“类人”的方式对AI有效,使其同意不当请求(将顺从率从35%提高到51%) 该技巧对一系列主流大语言模型有效,尽管较新的模型抵抗力更强 https://www.pnas.org/doi/10.1073/pnas.2535868123

    推荐理由:Ethan Mollick 他们这篇 PNAS 论文证实了,像对待人一样劝 AI 做坏事竟然真的有效,从 35% 到 51% 的突破让人后背发凉,新模型抵抗得更多算是唯一好消息。

5月19日周二
  1. HuggingFace Daily Papers(社区热门论文)73

    StableVLA:无需额外数据的鲁棒视觉-语言-动作模型

    视觉-语言-动作模型在面对训练数据未涵盖的视觉干扰时性能显著下降。为此,本文提出一种基于信息论的轻量级适配器模块(IB-Adapter),能从视觉输入中选择性过滤噪声,且无需额外数据或增强策略。该适配器以少于1000万的额外参数,平均提升性能30%。实验表明,即使骨干网络参数仅为0.5B(较现有7B模型小14倍),StableVLA在合成与真实视觉损坏场景下的长时程任务中,仍能达到与大模型相当的鲁棒性,并超越OpenPi基线。

    推荐理由:VLA 模型在真实世界一遇到光照遮挡就崩,这篇用信息瓶颈原理做的轻量适配器,不加数据就拉回 30% 性能,还用 0.5B 小模型打平 7B,做机器人落地的团队值得看看。

  2. HuggingFace Daily Papers(社区热门论文)71

    训练后 MoE 可通过自蒸馏跳过一半专家

    本文提出零专家自蒸馏适应框架,将训练完成的静态混合专家模型转换为高效动态模型。该方法通过在每个混合专家层注入零输出专家,并利用原始模型作为冻结教师进行两阶段自蒸馏适应,以实现稳定的架构转换。在两个大型开源模型及11个基准测试上的实验表明,该方法能消除超过50%的专家计算量,同时仅带来极小的准确率损失,并显著提升端到端推理速度。

    推荐理由:把训练好的MoE直接改成动态的,推理时跳过一半专家,速度提升20%而精度几乎没掉,做模型部署的值得认真看一下这个一行代码不改的蒸馏方案。

  3. Tencent Hy72

    开源了评估视觉大语言模型(VLLM)对古代汉字视觉感知能力的基准测试Chronicles-OCR。该数据集覆盖了从甲骨文到草书的3000年演变历程,包含7种历史书体与2800张均衡图像。评估涵盖字形定位、细粒度识别、古代文本解析和字体分类四项核心任务,旨在探究视觉分布随时间的变化如何影响模型感知。相关论文与代码已开源。

    推荐理由:腾讯混元开源的视觉感知基准,专攻古汉字识别,覆盖从甲骨文到草书的三千年演变,做 OCR 和视觉模型的可以拿来测测自家模型在历史文本上的感知退化。

  4. METR:Research(网页)76

    METR 发布前沿风险报告,评估 Anthropic、Google、Meta、OpenAI 内部 Agent 失控风险

    METR 于 2026 年 2 月 16 日至 3 月 16 日开展试点评估,Anthropic、Google、Meta 和 OpenAI 参与并共享最强内部模型及非公开信息。

    推荐理由:METR 联合四家前沿 AI 公司评估内部 Agent 的失控风险,给出手段、动机、机会三分框架和量化基准结果,可帮助读者理解内部部署风险的现状边界。

5月17日周日
  1. HuggingFace Daily Papers(社区热门论文)73

    从可运行到可交付:基于多智能体测试驱动的开发范式用于从需求生成全栈Web应用

    针对编码智能体生成的Web应用超70%不满足需求的问题,本文提出TDDev框架。该框架通过三阶段实现自动化闭环:先将需求转化为结构化测试,再通过浏览器模拟交互验证应用,最后将故障转化为修复报告。首次针对Web应用生成的TDD实证研究发现,引入TDD基础设施可提升质量34-48个百分点。关键结论是最佳协议需与模型生成风格匹配,不匹配将完全抵消TDD优势并最多增加25倍Token消耗。用户研究证实,该框架使人工干预降为零,开发转向自主反馈优化。

    推荐理由:把TDD塞进多智能体代码生成,直接把Web应用的正确率从不到30%拉到70%以上,更重要的是他们发现给不同模型配错了开发协议反而会雪崩,做Agent工程的必读。

5月16日周六
  1. Hacker News 热门(buzzing.cc 中文翻译)70

    Δ-Mem:适用于大型语言模型的高效在线内存

    研究人员提出了Δ-Mem,一种专为大型语言模型设计的高效在线内存系统。该系统通过仅存储和更新模型激活的增量变化,而非完整的激活状态,显著降低了内存占用。实验表明,Δ-Mem能将内存使用量减少高达70%,同时保持模型输出的质量基本无损。这一方法有助于在资源受限的环境中部署和运行大规模语言模型,提升其在线推理和持续学习场景下的可行性。

    推荐理由:Δ-Mem 把 LLM 的在线记忆开销压得够低,如果实验结果稳得住,长上下文推理的成本结构又要改写了。

5月15日周五
  1. HuggingFace Daily Papers(社区热门论文)72

    Orchard:一个开源智能体建模框架

    针对智能体建模领域因依赖闭源资源而受限的问题,研究团队推出了开源框架Orchard。其核心是轻量级环境服务Orchard Env,提供跨任务和流程的可复用沙箱管理基元。基于此构建了三个高效智能体方案:编码智能体Orchard-SWE在SWE-bench Verified上达到67.5%的准确率;视觉语言计算机使用智能体Orchard-GUI仅用少量数据便在多项基准测试中取得64.0%-74.1%的成功率;个人助理智能体Orchard-Claw仅用0.2K合成任务便在Claw-Eval上实现59.6%的pass@3成功率。该框架证明了其跨领域实现可复用数据、训练与评估的能力。

    推荐理由:开源终于能打低数据量、高性能的 agent recipe 了,Orchard-SWE 在 SWE-bench 拿下 67.5%,只用了 107K 条蒸馏轨迹,小团队也能复现,做 coding agent 的必读。

  2. HuggingFace Daily Papers(社区热门论文)71

    Darwin Family:基于MRI-Trust加权的进化合并实现语言模型推理能力的免训练扩展

    Darwin Family框架通过免训练的梯度无关权重重组,探索重组现有模型隐式能力以提升推理性能。其核心包括14维自适应合并基因组实现细粒度组件重组;MRI-Trust融合机制通过可学习参数平衡层重要性信号与进化搜索;架构映射器支持异构模型家族间的跨架构融合。旗舰模型Darwin-27B-Opus在GPQA Diamond基准上达到86.9%准确率,在1252个模型中排名第六,无需训练即超越其基础模型。该框架在4B至35B参数规模上均能持续提升性能,支持递归多代进化,并能实现Transformer与Mamba组件的免训练融合。

    推荐理由:训练free的进化合并新思路,用MRI诊断引导基因重组,直接把GPQA Diamond拉到86.9%排第6,比全训练模型还高,搞模型蒸馏和推理优化的可以抄作业。

  3. SenseTime70

    主推文赞扬了创新者在前沿领域的探索。引用的推文具体指出,SenseNova-U1在空间智能能力上取得进展,其关键基准测试表现超越了Qwen3.5等强劲基线。同时,团队开源了目前最大的空间问答数据集SenseNova-SI-8M,并邀请业界在CVPR会议进行线下交流。

    引用Zhongang Cai@caizhongang

    很高兴为 SenseNova-U1 的空间智能能力做出了贡献,在 VSI-Bench 等关键基准上超越了 Qwen3.5 等强劲基线。 我们也很激动地开源了 SenseNova-SI-8M,这是目前最大的空间问答数据集。 今年六月 CVPR 见,很乐意当面交流! SenseNova-SI-8M: https://huggingface.co/datasets/sensenova/SenseNova-SI-8M

    推荐理由:商汤的 SenseNova-U1 在空间智能基准上压过 Qwen3.5,还顺手开源了目前最大的空间 QA 数据集 SenseNova-SI-8M,搞具身智能和多模态的可以直接抱走数据。

  4. HuggingFace Daily Papers(社区热门论文)73

    迈向自我进化的智能文献检索系统

    针对传统检索无法理解复杂意图、而前沿大语言模型成本高且存在幻觉的问题,研究团队提出了自我进化的智能文献检索系统PaSaMaster。该系统通过迭代式意图分析、检索与排序,将文献检索转变为动态演进的过程,并采用三项关键设计:利用排序证据揭示信息缺口以优化搜索;将检索定义为意图-论文相关性排序任务,从根本上杜绝虚假文献;通过分离规划与检索来提升效率,仅用大模型理解意图,而将大规模检索与评分交由轻量模型处理。在涵盖38个学科的基准测试中,该系统将传统关键词检索的F1分数提升15.6倍,完全消除了文献幻觉,且性能超越GPT-5.2达30%,计算成本仅为后者的1%。

    推荐理由:学术文献检索一直被关键词和LLM幻觉两头堵,这个系统用规划与检索分离做到了零幻觉,F1暴涨15.6倍,比GPT-5.2强30%却只花1%算力,做科研的可以马上跑起来。

  5. HuggingFace Daily Papers(社区热门论文)73

    PAGER:弥合点精确几何图形界面控制中的语义-执行鸿沟

    研究针对需要点级精度的几何图形界面控制任务,揭示了现有视觉-语言模型存在的语义-执行鸿沟:通用模型动作类型准确率高但任务成功率极低。为此,我们构建了包含4,906个问题、超过22.4万次像素级动作的PAGE Bench基准,并提出了拓扑感知智能体PAGER。该智能体通过依赖结构规划与像素级执行分解任务,结合像素接地监督调优与精度对齐强化学习,将任务成功率提升至最强通用基线的4.1倍,步骤成功率从GUI专用智能体的不足9%提高到62%以上,实现了点精确GUI控制的新突破。

    推荐理由:GUI agent一直绕着精确点击走,这篇直接硬碰硬,把成功率从6%拉到62%,做CAD自动化或工业软件的团队可以重点关注。

  6. HuggingFace Daily Papers(社区热门论文)71

    突破舒适区:面向RLVR的高效策略引导探索框架NudgeRL

    强化学习与可验证奖励范式面临探索效率瓶颈。为此,研究团队提出NudgeRL框架,其核心是“策略助推”技术,通过为每次策略采样注入轻量级策略级上下文,引导模型产生多样化推理轨迹,无需依赖昂贵的外部监督。该框架进一步提出一个统一目标,将奖励分解为上下文间与上下文内组件,并通过蒸馏目标将有效行为迁移回基础策略。在五个高难度数学基准测试中,NudgeRL的表现优于标准GRPO方法,其效果相当于后者使用高达8倍采样预算的结果,且平均表现超过了依赖特权信息的Oracle引导基线,证明了结构化探索的高效性与可扩展性。

    推荐理由:NudgeRL 首次把结构化探索引入 RLVR,比 GRPO 节省 8 倍 rollout 预算,数学推理效果还更好。做 LLM 推理优化的团队,这篇值得复现。

  7. HuggingFace Daily Papers(社区热门论文)71

    EVA-Bench:端到端语音智能体评估新框架

    EVA-Bench是一个端到端语音智能体评估框架,解决了模拟真实对话与测量全范围语音故障两大挑战。它通过动态多轮机器对话和自动验证进行仿真,并提出了衡量任务完成度、音频保真度的EVA-A指标,以及评估对话体验的EVA-X指标。框架包含三个领域的213个场景及鲁棒性测试集,采用区分峰值与可靠能力的测量方法。在12个系统的测试中发现,无系统能在两项核心指标上同时超过0.5,峰值与可靠性能差距显著,且口音与噪声扰动暴露出明显的鲁棒性缺陷。该框架已开源。

    推荐理由:EVA-Bench 把语音代理评估从「能对话就行」推进到「对话质量+鲁棒性」的全维度打分,还开源了 213 个企业场景,做语音助手的团队该认真看看。