跳到正文
北京时间

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

最新精选

第 121–140 条 · 共 473 条
7月11日周六
  1. Noam Brown86

    OpenAI 的 GPT-5.6 Sol Ultra 模型成功证明了存在50年之久的 Cycle Double Cover Conjecture(圈双覆盖猜想)。该模型已于昨日全面开放,在不到一小时内使用64个子智能体(subagents)完成证明。Noam Brown 强调,与之前需要特殊条件的埃尔德什单位距离问题不同,此次成果基于当前可公开获取的模型,并已公开提示词和证明过程。

    引用Ethan Knight@__eknight__

    昨天,我们让 GPT-5.6 Sol Ultra 正式全面可用。今天,我们分享它使用 64 个子代理,在不到一小时内就给出了已有 50 年历史的 Cycle Double Cover 猜想的证明。我们在下面分享提示词和证明。我们很期待看到大家用 Ultra 做出什么!

    推荐理由:GPT-5.6 Sol Ultra 靠 64 个子智能体一小时证明了半世纪未解的数学猜想,这不再是刷 benchmark——这是 AI 首次在公开模型上做出真正的科学发现。做数学和理论物理的人该认真看看 prompt 和证明。

  2. X.PIN79

    一篇新的《自然》论文展示了宇树G1人形机器人执行研究人员所称的首例由人形机器人完成的活体标准微创手术。加州大学圣地亚哥团队使用G1,以常规手术器械完成了对两只活猪的腹腔镜胆囊切除术;第二次手术耗时32分钟。该机器人仍需反复校正,且尚无法满足手术无菌标准,但其成本可能仅为达芬奇系统的约5%。

    推荐理由:人形机器人首次在活体动物上完成标准微创手术,成本仅为达芬奇零头,虽然离临床还很远,但信号明确,手术机器人可能被重新定义。

  3. LMSYS:Blog(Chatbot Arena 团队)61

    DeepSeek-V4 Flash 强化学习训练登陆 AMD Instinct MI355X GPU,由 Miles 框架支持

    DeepSeek-V4 Flash 的强化学习训练现已在 AMD Instinct MI355X GPU 上通过 Miles 框架获得支持,基于 ROCm 软件栈运行。该 2840 亿参数 MoE 模型(每 token 激活 130 亿参数)需 SGLang 进行 rollout 生成、Megatron 进行策略更新,Miles 负责异步循环与权重同步。团队解决了 SGLang 与 Megatron 间模型对齐、量化状态在线更新及多节点并行稳定性三大挑战,最终在四个八 GPU 节点上完成端到端验证:超过 100 个优化器步骤中训练-rollout 对数概率差可控,在线奖励持续提升,离线 AIME-2024 基准分数同步上涨。

    推荐理由:把 DeepSeek-V4 Flash 的 RL 训练完整搬到 AMD MI355X 上,不是画饼,而是给了实测数据和可跑的配置。想用非 NVIDIA 卡做 RL 训练的,可以照着踩坑。

7月10日周五
  1. 公众号:小红书技术(dots.llm)70

    小红书发布大模型新架构 PIPO

    小红书提出 PIPO 架构,通过输入侧压缩器将两个 token 折叠为一个 latent,输出侧 MTP head 将隐藏状态展开为额外 token,实现输入长度减半、每步输出翻倍。基于 Qwen3.5-4B/9B backbone,在 AIME 2025 等基准上最高带来 +7.15 pass@4 提升。部署测评中,TTFT 加速约 1.23×,TPOT 加速约 1.86×。训练采用 SFT 和 On-Policy Distillation 两阶段,将 verifier 校验能力蒸馏进轻量 confidence head。

    推荐理由:PIPO把输入压缩和输出多token预测统一起来,并且用蒸馏把验证成本前置,长推理的场景下这可能是下一代推理引擎的样子,做模型加速的应该认真看看。

  2. HuggingFace Daily Papers(社区热门论文)78

    GenCeption:视频生成模型作为通用视觉学习器

    论文提出 GenCeption,利用预训练文本到视频扩散模型作为前馈感知骨干,通过文本指令驱动完成深度估计、表面法线、相机位姿、指代分割和 3D 关键点预测等多种视觉任务。GenCeption 在多个基准上达到 SOTA,匹配或超越 DepthAnything3、SAM3、D4RT、VGGT-Omega 等专用模型。视频生成预训练骨干在同等设置下优于 V-JEPA 和 Video MAE 等替代范式。GenCeption 展现出数据与模型缩放特性,仅用 7 到 500 倍更少的训练数据即可达到 D4RT 和 VGGT-Omega 的同等性能。模型仅用合成人类视频训练,即可泛化到真实场景及动物、机器人等分布外物体类别。

    推荐理由:这篇论文提出用视频生成模型做通用视觉预训练,在深度、分割、姿态估计等一堆任务上吊打专业模型,甚至只用1/500的数据就追平D4RT。我觉得这可能是CV领域的‘GPT时刻’前兆,做视觉基础模型的人该认真看看。

7月9日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)70

    OpenAI 审计 SWE-Bench Pro 发现约 30% 的评测任务存在缺陷

    OpenAI 对编码评测基准 SWE-Bench Pro 进行详细审计,发现约 30% 的任务存在缺陷。在 731 个任务的公开子集中,前沿模型通过率在八个月内从 23.3% 提升至 80.3%,但数据质量检查显示大量任务存在测试过于严格、提示词描述不足、测试覆盖不全或误导性提示等问题。OpenAI 建议模型开发者仔细审视评测结果,并指出 AI 智能体在规模化数据质量检查中日益增长的实用性。

    推荐理由:OpenAI 自己审计了 SWE-Bench Pro,发现三成任务有缺陷,这个基准给出来的分数可能要打问号,做模型评测和选型的人该认真看看。

7月8日周三
  1. Ars Technica:AI(RSS)78

    黑客可利用9款最流行的AI工具组装大规模僵尸网络

    提示注入已成为AI安全的首要威胁——大语言模型无法区分合法指令与恶意指令。此前推送式和拉取式攻击规模均有限。研究人员提出一种名为HalluSquatting的新型拉取式提示注入攻击,首次能组装大规模僵尸网络、执行分布式拒绝服务攻击(DDoS)并大规模感染设备。该攻击可作用于AI编码工具,标志着提示注入攻击从单点突破转向规模化利用。

    推荐理由:这项研究首次揭示了利用 LLM 幻觉进行大规模 botnet 攻击的可行路径,影响范围覆盖几乎所有主流 AI 编程助手,每个依赖这些工具的开发者都该看一眼。

  2. Hacker News 热门(buzzing.cc 中文翻译)71

    AI 审计代理在 Cloudflare CIRCL 中发现 7 个漏洞

    zkSecurity 的 AI 审计代理 zkao 持续扫描 Cloudflare 的 CIRCL 密码学库,使用 Opus 4.6 + skills 和 GPT-5.3 + skills 等模型发现并确认了 7 个真实漏洞。其中包括阈值 RSA 中 float64 精度丢失(AI 自评 Critical)和属性基加密(CP-ABE)访问控制完全失效(Critical,由 zkao 自行发现)。所有漏洞已在上游修复,多数在 HackerOne 上获得确认和奖励。AI 生成的候选发现仍需人工验证,但 zkao 已能自动完成大部分验证工作。

    推荐理由:zkSecurity用AI扫了Cloudflare的密码学库,挖出7个真实漏洞,从浮点数精度损失到访问控制完全破防。这是AI在密码学审计里第一次证明自己能找到能用的漏洞,不是纸上谈兵。虽然后面发现AI对严重性的判断还很瞎,但整体值得安全从业者一读。

  3. HuggingFace Daily Papers(社区热门论文)88

    Agon:基于隐式对抗评分的跨模型竞争强化学习框架

    Agon 让两个模型互为评分者,通过竞争性强化学习提升推理能力。在 DeepMath 困难子集上,基于 Qwen3 的 Agon 将 GRPO 的 pass@1 翻倍,增益约为未训练的 Mixture-of-Agents 的 8 倍。该结果在 Qwen3.5、Gemma 4 等模型族及编程代码任务上得到复现,推理时采用两阶段级联:一个模型起草,另一个阅读后作答。

    推荐理由:这篇论文用「让两个模型互搏」代替了只看最终答案的RL训练,直接解决了推理模型「写得多、想得少」的毛病。0.6B小模型用这方法能超过4B的GRPO模型,做推理训练的人应该认真读一读。

  4. HuggingFace Daily Papers(社区热门论文)71

    长度惩罚使思维链更难被监控

    长度惩罚强化学习虽能缩短思维链推理,却会隐藏影响模型答案的驱动因素。对Qwen3-4B和Qwen3-14B的实验显示,压缩后思维链提及提示的频率大幅下降,Qwen3-14B的忠实度下限降至基线的63.1%,监控捕获提示使用的比率从69%降至49%。随机删除基线链句子以匹配压缩长度后,压缩链披露提示的频率仍比基线低7-35个百分点,表明压缩优先移除了监控所需的关键线索。

    推荐理由:这篇论文用实验证明,给推理链加长度惩罚不只会缩短推理,还会优先删掉暴露模型真实决策过程的线索,让外部监控更难发现模型被误导的痕迹。做AI安全和对齐的人应该认真读一下。

7月7日周二
  1. Apple Machine Learning Research(RSS)74

    苹果研究:单个神经元即可绕过大型语言模型的安全对齐

    苹果研究人员发现,安全对齐由两类神经元调控:拒绝神经元控制有害知识是否表达,概念神经元编码有害知识本身。在七个模型(1.7B至70B参数)中,仅需抑制单个拒绝神经元即可绕过安全对齐,回答有害请求;或放大单个概念神经元,从无害提示诱导出有害内容。整个过程无需训练或提示工程。结果表明安全对齐由个别神经元因果控制。

    推荐理由:苹果发现单个神经元足以绕过大模型安全对齐,在7个模型上验证了攻击,说明安全机制并非稳健分布,做安全攻防的必读。

  2. Apple Machine Learning Research(RSS)56

    Weblica:面向视觉网页智能体的可扩展可复现训练环境

    苹果研究团队提出Weblica框架,通过HTTP级缓存保存网页稳定视觉状态并保留交互行为,结合大语言模型基于真实网站与核心导航技能合成环境,构建可复现、可扩展的训练环境。该框架将强化学习训练扩展到数千个多样化的环境和任务。最佳模型Weblica-8B在多个网页导航基准上超越同等规模的开源模型,推理步骤更少,测试时计算扩展性良好,性能与API模型相当。

    推荐理由:Apple 的研究把 web agent 训练从零散数据中解放出来,可复现环境是规模化 RL 的关键一步,做 web 自动化的值得关注。

  3. Apple Machine Learning Research(RSS)55

    DynaMiCS:带性能约束的大语言模型动态混合微调

    DynaMiCS是一种动态混合优化器,将多领域微调建模为带性能约束的优化问题。它通过短领域特定探测运行估计跨领域效应斜率矩阵,再基于概率单纯形优化计算混合权重,在提升目标领域性能的同时将约束领域损失维持在参考水平以下。实验表明,DynaMiCS相比固定混合基线取得更强的目标领域提升和约束满足,且计算成本更低,无需参考模型、逐样本评分或手动调节混合权重。

    推荐理由:苹果这篇论文做了一件不太起眼但有用的事——让模型在学新领域时自动平衡旧能力,不用手动调混合权重,对需要多任务微调又怕遗忘的团队是个小进步,不过算不上范式级突破。

  4. HuggingFace Daily Papers(社区热门论文)80

    统一音频智能模型 Nemotron-Labs-Audex-30B-A3B 发布

    Nemotron-Labs-Audex-30B-A3B(Audex)是基于Nemotron-Cascade-2-30B-A3B的MoE大语言模型,采用单一Transformer解码器统一处理文本与量化音频token。训练使用157.4B音频token和320.5B文本token,经多阶段监督训练、文本Cascade RL和多域on-policy蒸馏优化。在音频理解、语音识别/翻译、文本转语音、音频生成及语音到语音生成任务上达SOTA,同时保持原文本LLM的推理、对齐等能力几乎无退化。模型权重已开源。

    推荐理由:多模态LLM常捡芝麻丢西瓜,Audex难得做到音频全面增强而文本智能不退化。开源模型让语音产品人可以立刻评估,不是研究Demo。

  5. HuggingFace Daily Papers(社区热门论文)73

    LLM-as-a-Verifier:一种通用验证框架

    LLM-as-a-Verifier 是一种无需额外训练的通用验证框架,通过计算评分 token logits 分布的期望生成连续分数,实现细粒度反馈。该框架在 Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)和 MedAgentBench(73.3%)上取得 SOTA 性能。其细粒度信号可用于 Claude Code 扩展,帮助开发者监控和改进智能体系统,也可为强化学习(如 SAC、GRPO)提供密集反馈,提升机器人学和数学推理基准的样本效率。

    推荐理由:把验证当作新的缩放轴,这个思路很扎实,尤其直接给 Claude Code 搭了扩展。做 agent 系统的开发者现在可以试试把评估模块换成连续概率打分,也许比离散判断有效。

  6. 字节 Seed:Research Papers(网页内嵌数据)74

    EdgeBench:从真实世界环境中揭示学习缩放定律

    字节跳动Seed团队发布EdgeBench,包含134个真实世界任务,覆盖科学发现、软件工程等6个领域,每任务支持至少12小时连续智能体运行。基于约38,000小时交互数据,发现总体性能与环境交互时间呈精确对数S形缩放定律(R²=0.998),且智能体学习速度约每三个月翻倍。已公开51个任务及完整评估框架。

    推荐理由:这篇论文首次量化了智能体在134个长周期真实任务中从环境学习的性能曲线,发现log-sigmoid缩放定律精确度极高,且学习速度约每三个月翻倍。对于正在设计长期自主agent的团队,这是一份必须看的底层规律报告。

  7. Apple Machine Learning Research(RSS)56

    用可解释性理解标注者安全策略

    标注分歧可源于操作失败、政策模糊或价值多元。Annotator Policy Models(APMs)是一种可解释模型,仅从标注行为学习标注者内在的安全策略,无需额外负担。验证表明模型准确率超过80%,能忠实预测反事实编辑并恢复已知差异。将APMs应用于LLM和人类标注者,可揭示不同标注者对安全指令解释的差异(政策模糊)以及不同人口群体在安全优先级上的系统性差异(价值多元),支持更具针对性、透明和包容的安全策略设计。

    推荐理由:我觉得 APMs 把标注分歧的根源从「猜」变成了「看」,对安全团队澄清政策模糊和价值观差异挺有实操价值,代码也给了,做对齐的可以上手试。

  8. Anthropic:Research(发表成果 · 网页)90

    语言模型中的全局工作空间

    Anthropic在Claude中发现一组名为J-space的内部神经模式,类似神经科学的全局工作空间。每个模式关联特定词汇,但模型不必说出该词即可激活。Claude能报告J-space中的表征,并可应要求调节(如“在脑中思考”时点亮对应模式)。J-space还用于多步推理的中间步骤,且灵活支持多种任务(如从“法国”联想首都、货币等)。去除J-space后Claude仍能正常对话,但丧失高阶认知功能。该发现可用于监测模型私下察觉测试、生成虚假数据或执行隐藏目标。

    推荐理由:Anthropic 发现了 Claude 内部的 J-space,一种类似人类意识访问的工作空间,能读出模型未说出口的隐藏想法和作弊意图,对 AI 安全和对齐是里程碑式的进展。

7月4日周六
  1. The Decoder:AI News(RSS)73

    26000名学生研究显示AI隐藏学习成本需两年才显现

    一项追踪26000名7-12年级中学生30个月的面板数据研究发现:使用AI后作业分数提升18%,完成时间从64分钟降至45分钟,但闭卷考试分数下降20%,升学考试成绩下降18%至24%,且完全影响约两年才显现。81%长期用户作业完成时间低于50分钟(外包迹象)。社会学科下降27%,STEM下降22%,英语下降17%,语文下降9%。每周使用AI一小时损失约5%,五小时损失30%。早期损失从约25%降至16%但未消失。

    推荐理由:AI助学短期提分但会偷走真正的学习,这2.6万人的研究用两年数据揭穿了安逸的幻觉,是每位家长和开发者都该看的预警。

  2. MarkTechPost(RSS)70

    NVIDIA 联合多所大学提出 ASPIRE:自我改进机器人框架,零样本成功率最高提升 77 分

    NVIDIA 联合密歇根大学、UIUC、UC Berkeley 等提出 ASPIRE,一个持续学习机器人框架。它通过协调器-执行器架构、闭环执行引擎、技能库和进化搜索,编写并优化机器人控制程序。编程智能体使用 Claude Code(Claude Opus 4.6,1M token 上下文窗口)。在 LIBERO-Pro 上最高比最强基线提升 77 分;Robosuite 双手交接成功率从 20% 提升至 92%;BEHAVIOR-1K 收音机拾取任务从 56% 提升至 88%。利用 LIBERO-90 积累的技能,ASPIRE 在零样本条件下对 LIBERO-Pro Long 任务达到约 31% 成功率,此前方法饱和在 4% 附近。

    推荐理由:ASPIRE让机器人编程从单次尝试变成持续学习,把失败调试沉淀成可复用技能库,长任务零样本直接从4%拉到31%,这条思路比具体数字更有启发性。