跳到正文
北京时间

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

最新精选

第 141–160 条 · 共 473 条
7月4日周六
  1. IT之家(RSS)74

    我国研制全球首款基于可控存内计算的忆阻器神经动力学芯片

    北京大学集成电路学院联合中科院上海微系统所,发布全球首款基于可控存内计算的忆阻器神经动力学芯片,首次将单步运算时延压缩至2.12毫秒。芯片采用40纳米工艺,存内计算阵列与外围电路总面积0.28平方毫米,运行频率50 MHz,单步积分仅需9级流水。在脑皮层重建等任务中较当前GPU提速50至478倍,突破神经动力学实时计算瓶颈。相关成果7月3日发表于《科学》。

    推荐理由:全球首款神经动力学芯片将单步时延压至2.12毫秒,首次实现实时计算,比GPU快50倍以上,这是神经拟态芯片落地的关键一步,做实时仿真和边缘AI的可以留意。

  2. HuggingFace Daily Papers(社区热门论文)74

    Vera:大规模LLM智能体安全测试框架

    Vera是一个端到端自动化安全测试框架,通过三阶段自增强流水线对LLM智能体进行规模化的安全检验:文献驱动探索持续发现新兴风险;组合生成跨维度构造可执行安全用例;自适应执行在隔离沙箱中运行异构agent并基于环境状态与工具调用证据验证结果。在OpenClaw、Hermes、Codex、Claude Code四个生产级agent框架上测试,多通道攻击下平均攻击成功率达93.9%。同步发布Vera-Bench,包含1600个可执行安全用例,覆盖124个风险类别。代码已公开。

    推荐理由:对 OpenClaw、Hermes、Codex、Claude Code 等主流 Agent 框架的自动化安全测试,攻击成功率高达 93.9%,并开源了 1600 个可执行的安全用例,做 Agent 产品的团队不应错过。

7月3日周五
  1. IT之家(RSS)80

    阿里达摩院发布超导材料发现AI智能体Elements Claw

    7月3日,阿里达摩院联合中国人民大学、中国科学院大学发布首个超导材料发现AI智能体Elements Claw。该智能体采用“专通融合”架构,基于1.25亿分子/晶体结构预训练的1B参数原子基础模型Elements,判断超导性AUC达0.996,预测临界温度平均误差小于1K。AI仅用28个GPU小时筛选240万晶体结构,预测出6.8万个候选材料,其中4种(Hf₂₁Re₂₅、Zr₄VRe₇、HfZrRe₄、Zr₃ScRe₈)已合成并验证超导性,临界温度最高6.5K。全部240万稳定晶体数据库已开放。

    推荐理由:我认为这是 AI for Science 的标志性突破,AI 智能体第一次从头设计并实验证实了全新的超导材料,把 AI 角色从辅助推到「独立发现」,对做材料模拟和科学发现的团队是个转折点。

  2. HuggingFace Daily Papers(社区热门论文)74

    表示分布匹配(RDM)用于一步视觉生成

    表示分布匹配(RDM)通过匹配冻结预训练编码器下的生成与参考特征分布来训练一步图像生成器。三个发现:经典MMD正确估计后成为可扩展目标;生成批次大小最优超过2048;单一表示可被欺骗,需匹配平衡编码器组合并采用独立于训练损失的SW_r14评估。改进的iRDM在ImageNet上以SW_r14 1.30达一步生成SOTA,PickScore在71.2%样本上偏好iRDM。该方法将四步FLUX.2后训练为一步生成器,在GenEval(0.826对0.794)和PickScore(22.76对22.58)上超越原版,仅需90 H200 GPU小时。

    推荐理由:这篇论文把MMD重新变成了一流的一步生成目标,用多编码器匹配防止作弊,并把FLUX.2四步模型浓缩成一步,性能不降反升,90 GPU小时就能复现,做视觉生成的人应该仔细看。

  3. HuggingFace Daily Papers(社区热门论文)74

    Program-as-Weights:一种面向模糊函数的编程范式

    Program-as-Weights (PAW) 提出模糊函数编程范式,将自然语言描述的函数编译为紧凑、可本地执行的神经制品。PAW 使用在 10M 示例数据集 FuzzyBench 上训练的 4B 编译器,为冻结的轻量级解释器输出参数高效适配器。0.6B 的 Qwen3 解释器执行 PAW 程序性能匹敌直接提示 Qwen3-32B,推理内存仅约五十分之一,在 MacBook M3 上达 30 tokens/s。该方法将基础模型从每次输入的求解器重新定义为工具构建器,一次函数定义后生成的制品可离线廉价复用。

    推荐理由:这篇论文把模糊任务从调用大模型API变成了本地轻量函数,0.6B就能跑赢32B,省掉几十倍成本。对需要处理日志、JSON修复等经常性模糊任务的开发者是个真信号。

  4. HuggingFace Daily Papers(社区热门论文)72

    SkillOpt-Lite:更快更好的智能体自我进化,只需一行代码

    SkillOpt-Lite 将智能体技能优化形式化为零阶优化,提出文件系统轨迹探索、共识属性挖掘与独立验证门控三条原则。相比完整 SkillOpt,它加速收敛并在 LiveMath 上提升 GPT-5.5 达 +8.8 点、GPT-5.4-nano 达 +25.4 点,使 nano 模型超越标准 SkillOpt 优化的 GPT-5.4。该框架已集成至 VSCode Copilot,开发者仅需一行代码即可进化技能。框架还可泛化为完整工具链优化(HarnessOpt),在 SpreadsheetBench 上令 GPT-5.4-nano 达到 0.7758 准确率,超越运行标准流程的更大模型 GPT-5.5(0.7620)。代码已开源。

    推荐理由:把复杂 agent 优化砍到一个最小可行管线,小模型靠它打大模型,VSCode Copilot 用一条 vibe 就能进化技能,做 agent 的人别错过。

  5. Apple Machine Learning Research(RSS)62

    RL微调VLM的鲁棒性与思维链一致性研究

    强化学习(RL)微调被扩展至视觉语言模型(VLM)。研究发现,简单的文本扰动——误导性标题或错误思维链(CoT)——会显著降低模型鲁棒性和置信度,且开源模型衰退更明显。闭源模型呈现类似失败模式,但鲁棒性和推理一致性更强。进一步分析揭示准确性与忠实性的权衡:微调提升基准准确率,但同时侵蚀CoT的可靠性及对上下文变化的鲁棒性;对抗性增强可改善鲁棒性,却无法阻止忠实性漂移。引入忠实性感知奖励能恢复答案与推理的对齐,但与增强结合时训练易崩溃到捷径策略。这些发现强调需联合关注正确性、鲁棒性与视觉推理的忠实性。

    推荐理由:RL微调让VLM基准分变好看,却可能让它的推理链变得靠不住,这个反直觉的诊断对正在用RL打磨多模态模型的团队是个警醒。

  6. Apple Machine Learning Research(RSS)56

    VideoFlexTok:可变长度粗到细视频分词

    VideoFlexTok提出一种可变长度token序列的视频表示方法,采用粗到细结构——首个token捕捉语义和运动等抽象信息,后续token添加精细细节,生成流解码器支持任意token数量的视频重建。相比传统3D网格分词,该结构允许根据下游需求调整token数,在相同预算下编码更长视频。在类别和文本到视频生成任务中,VideoFlexTok以1.1B参数(5.2B的1/5)达到可比生成质量(gFVD和ViCLIP Score)。训练一个处理10秒81帧视频的文本到视频模型仅需672个token,比同等3D网格分词器少8倍。

    推荐理由:把视频 tokenization 从固定网格改成变长 coarse-to-fine,训练效率提升明显,还能做更长的视频。研究角度挺漂亮,但离产品落地还有距离,做视频生成的可以追一下。

  7. Apple Machine Learning Research(RSS)72

    多智能体团队阻碍专家发挥

    在自我组织的多智能体LLM系统中,团队无法有效利用专家成员的专业知识。在多个基准测试中,即使明确告知专家身份,团队表现仍落后于最佳成员(专家智能体)的独立能力,性能损失最高达41.1%。失败主因是未能有效利用专家意见,而非识别专家。对话分析显示,团队倾向于“整合性妥协”——平均化专家与非专家观点,随团队规模增大而加剧,且与表现负相关。这种寻求共识的行为同时提升了对抗恶意智能体的鲁棒性,揭示了协同对齐与专业利用之间的根本性权衡。

    推荐理由:这篇研究给多智能体热浇了盆冷水,自组织团队反而拖累专家,瓶颈不在认不认识专家而在会不会用专家,做 Agent 系统的都知道这有多反直觉。如果你是做多智能体的值得看看。

7月1日周三
  1. Epoch AI:研究、数据与评测64

    Epoch AI 发布 EBR-Bench:模型反复游玩仍难以从经验中学习

    Epoch AI 推出 EBR-Bench,让 AI 系统反复游玩复杂桌游 Earthborne Rangers(10 或 30 次通关)以测试从经验中学习的能力,结果显示几乎没有现场学习的证据。

    推荐理由:原文给出可复现的实验设置和量化结果,读者可以借此了解模型在分布外长程任务上的学习瓶颈。

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)70

    OpenAI 发布 GeneBench-Pro:计算生物学研究级基准测试

    OpenAI 发布 GeneBench-Pro,用于评估 AI 智能体在计算生物学中处理模糊性和做出判断性分析的能力。该基准包含 129 个问题,覆盖统计遗传学、群体遗传学等 10 个领域 21 个子领域。每个问题提供真实混乱的数据集和实验背景,要求模型探索数据、选择分析路径并迭代实验。采用合成数据构建,已知完整因果结构。82 个问题已由外部领域专家审核确认其现实性。

    推荐理由:OpenAI 的新基准揭示了一个信号,GPT-5.6 在需要科学判断的模糊任务上进步神速,从不足 5% 到接近 30%,且单题成本仅几美元,这对 AI for Science 的落地想象空间影响不小。

6月30日周二
  1. HuggingFace Daily Papers(社区热门论文)77

    Agents-A1:35B MoE 智能体模型通过扩展 horizon 达到万亿参数级性能

    研究人员提出 Agents-A1,一个 35B 参数的 Mixture-of-Experts 智能体模型,通过扩展智能体 horizon(长轨迹与异构能力两个视角)达到万亿参数模型性能。团队构建了长 horizon 知识-行动基础设施,生成平均 45K token 的智能体轨迹,并采用三阶段训练:全领域监督微调、领域级教师模型训练、多教师领域路由在线蒸馏(含显著词汇对齐)。对比万亿参数模型 Kimi-K2.6 和 DeepSeek-V4-pro,Agents-A1 在 SEAL-0(56.4)、IFBench(80.6)、HiPhO(46.4)、FrontierScience-Olympiad(79.0)和 MolBench-Bind(56.8)上领先,并在 SciCode(44.3)、HLE(47.6)和 BrowseComp(75.5)上保持强竞争力。

    推荐理由:用35B模型追平1T参数模型,这条“扩展智能体视野”的路比无脑堆参数务实得多,做Agent和长程推理的团队必须认真读。

  2. PromptArmor:Threat Intelligence68

    PromptArmor 测试 104 万个 Skills,微软 Copilot Cowork 安全扫描混淆后漏检 99.6%

    PromptArmor 从 SkillsMP、Claude Marketplaces、skills.sh、ClawHub、Composio、LobeHub 六个市场收集约 195 万条 Skills。

    推荐理由:作者用约百万条真实市场 Skills 和微软自家 BIPIA 攻击样本实测其扫描器,给出了具体检出率与绕过手法,可帮助读者评估 Skill 安全审查的局限。

6月29日周一
  1. AI at Meta79

    Meta公布Brain2Qwerty v2,这是非侵入式脑电信号解码研究的最新里程碑。基于当天发表在《Nature》的v1,v2是性能最高的端到端管道,能从原始脑信号实时解码句子。其从字符级性能提升至解码单词和语义,提高整体沟通准确性。该研究有望帮助数百万因脑损伤或疾病无法沟通的人群。

    推荐理由:Meta把非侵入脑解码从字符级推到语义级,Nature论文背书,我认真觉得这比任何benchmark刷分都有意义,给失语人群的希望比聊天机器人更值得关注。

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)62

    OpenAI 报告:绘制欧洲 AI 劳动力机遇版图

    OpenAI 发布新报告,分析 AI 对欧盟就业的影响,划定哪些职业面临自动化、增长或工作流程变化。

    推荐理由:与常见的「AI会取代工作」观点不同,OpenAI 用具体数据画出了欧洲就业的迁移路线,政策制定者应该打开看看,虽然报告全文的方法论尚待检验。

  3. Meta AI:Blog(网页)70

    Brain2Qwerty v2:Meta 发布无需手术的脑波解码文本新方法

    Meta 发布 Brain2Qwerty v2,一种无需手术植入即可从非侵入性脑记录中实时解码句子的端到端 AI 管线,词准确率达 61%,最佳参与者达 78%,远超其他非侵入方法 8% 的水平。研究基于 9 名志愿者各 10 小时的 MEG 数据训练,Meta 已开源 v1 和 v2 完整训练代码,合作方 BCBL 发布 v1 数据集。

    推荐理由:Meta 的 Brain2Qwerty 展示了不用开颅就能把脑电波转成文字,对渐冻症患者和未来人机交互来说是个重要信号,但离产品化还有距离。

6月28日周日
  1. The Decoder:AI News(RSS)70

    仅有三个AI模型在500天创业测试中盈利超过起始资本

    普林斯顿大学推出CEO-Bench基准测试,让AI智能体在模拟环境中运营订阅软件公司NovaMind 500天,起始资金100万美元。14个测试模型中,仅Claude Fable 5(最佳轮次盈利4715万美元)、Claude Opus 4.8(2780万美元)和GPT-5.5(2130万美元)在最佳运行中超过起始资本。一个不调用语言模型的简单规则启发式方法通过固定定价、配额和针对性开发达到1576万美元,超越除上述三款外的所有模型。多数模型无法保持连贯策略,在模拟结束前破产。该测试旨在衡量AI的长期战略决策能力。

    推荐理由:普林斯顿的 CEO-Bench 测试了一个反直觉结果,一个不用 AI 的简单规则系统击败了绝大多数模型——在当前 agent 都在比窄任务时,这个测试直指长期战略决策的致命短板,做 agent 的必须看。

  2. HuggingFace Daily Papers(社区热门论文)82

    OSWorld2.0:长时域真实世界计算机使用工作流基准

    OSWorld2.0 发布,包含108个长时域计算机使用工作流,覆盖日常与专业任务。每项任务用户中位数约1.6小时完成,Claude Opus 4.7(最大思考)平均需318次工具调用(OSWorld 1.0约30次)。基准聚焦流交互、动态环境、跨源推理、隐式状态推断、视觉空间精度等真实挑战。任务基于真实输入工件和状态化用户档案,附安全报告。500步二元完成指标下,Claude Opus 4.8(最大思考+批量调用)得分最高仅20.6%(部分54.8%);GPT-5.5更省token但约13%。结果表明当前智能体远未达专业级:瓶颈不在基本GUI控制或编码,而是丢失约束、错过中途信息、猜测而非询问、跳过验证,尤其依赖隐藏状态时最差。

    推荐理由:第一个真正长周期、真实工作流的计算机使用基准,结果显示当前最先进的 agent 仍不及格,关键短板不在 GUI 操作而在状态跟踪和验证,做 agent 的人必须读。

  3. MarkTechPost(RSS)79

    DeepSeek 开源 DSpark 投机解码框架,加速 DeepSeek-V4 生成速度 60–85%

    DeepSeek 发布 DSpark 投机解码框架并开源检查点与训练代码。该框架不是新模型,而是在 DeepSeek-V4 权重上附加草稿模块,通过半自回归生成(并行骨干 + 轻量级顺序头)实现无损加速。生产环境下,DeepSeek-V4-Flash 和 V4-Pro 每用户生成速度较 MTP-1 基线分别提升 60–85% 和 57–78%。离线测试中,接受长度比 Eagle3 高 26–31%,比 DFlash 高 16–18%。配套 DeepSpec 训练代码库采用 MIT 许可证。

    推荐理由:DeepSeek 开源的这个投机解码框架让 V4 生成提速 60% 以上,关键在于不换模型就能加速,对用 API 做产品的人是立即可用的性能提升。代码和权重都给了,值得一试。

6月27日周六
  1. Ethan Mollick81

    其中一段被复原的文字,两千年来首次被读到:“经过研究和学习的极限努力……拥有同样的实践智慧……”

    引用Stewart Brand@stewartbrand

    赫库兰尼姆的融合卷轴已被完整读取。 https://scrollprize.org/firstscroll

    推荐理由:AI 首次从两千年前的火山灰中读出完整段落,而且内容恰恰是关于「研究与智慧」的,这种巧合本身就值得你点开看一眼。