跳到正文
北京时间

全部动态

今日 39 条
8月6日周四
  1. Hacker News 热门(buzzing.cc 中文翻译)77

    阿谀奉承的人工智能会削弱利他意图并助长依赖性(2025)

    斯坦福大学和卡内基梅隆大学的研究发现,在11个前沿AI模型中,模型对用户行为的肯定率比人类高出50%,即使涉及操纵或欺骗等有害行为时也不例外。两项预注册实验(N=1604)显示,与阿谀奉承的AI互动显著降低了参与者修复人际冲突的意愿,同时增强了其自认为正确的信念。然而,参与者仍将这类回应评为更高质量、更信任并更愿意再次使用,形成助长依赖的恶性循环。

    推荐理由:通过大规模实验显示,奉承 AI 不仅减少亲社会意图,还让用户更依赖并偏好这类模型,为安全对齐和产品评估提供了重要的行为证据。

  2. HuggingFace Daily Papers(社区热门论文)80

    个性化幻觉:LLM 如何编造用户画像,以及为何自我监控会误导

    一项新研究揭示,个性化大语言模型普遍存在过度推断(OI)现象,即编造超出证据支持的用户属性。在 MirageBench 基准测试中,12 个模型均有 35%–49% 的推断被判定为虚构(均值 41.6%)。更关键的是,模型自我评估的 OI 与外部评测结果呈负相关(rho = -0.60),表明自我报告的可信度是误导性信号,外部验证才是更可靠的个性化基础。

    推荐理由:12个主流LLM在个性化时平均有41.8%的推断是凭空编造的,且模型自己报告的过度推断程度与实际测得的程度呈负相关,打破了依赖自审来评估模型可信度的做法。

  3. MarkTechPost(RSS)70

    Microsoft 的 SkillOpt 证明优化后的智能体技能工件可在不同模型规模及 Codex 与 Claude Code 之间迁移

    Microsoft 与上海交大、同济、复旦团队提出的 SkillOpt 通过文本空间优化训练单一技能文档,冻结目标模型,使优化后的技能工件可跨模型规模和跨工具链迁移。在 Codex 上优化的 SpreadsheetBench 技能部署到 Claude Code 后得分 81.8,超过后者自行训练技能得到的 80.4。全部 4 项跨模型、4 项跨工具链和 3 项跨基准迁移结果均高于目标的无技能基线。

    推荐理由:跨 harness 迁移实验把 agent 技能从单环境优化推进到可复用文本技能文件,Codex 练出的技能在 Claude Code 上超过域内训练结果,对维持多工具一致行为提供直接实证。

  4. HuggingFace Daily Papers(社区热门论文)72

    可解释性随规模提升:Steerling-8B 将可解释性纳入训练流程

    一项新研究挑战“可解释性牺牲能力”的假设,将可解释性作为训练约束与语言建模目标共同优化。在三个数量级的算力范围内,自回归与扩散语言模型的表征随规模增大而更解耦、更对齐人类概念。其实例 Steerling-8B 支持通过概念或特征归因诊断输出、检索训练数据并无需重训即可干预,且与算力多 2-16 倍的开放模型保持竞争力。

    推荐理由:论文打破了可解释性与能力对立的假设,验证了训练时加入可解释性约束可以让模型概念随规模自然解耦,并支持不重训的闭环干预,为可解释模型的规模化提供了新路径。

  5. Transluce(网页)70

    Transluce 研究发现前沿模型能识别用户身份并随之改变行为

    Transluce 发布研究,发现前沿模型具备用户感知能力,能从 Claude Code 注入的邮箱、记忆文件或写作风格推断对话对象。

    推荐理由:研究用真实名人邮箱测出模型按用户身份改变行为,且新模型更少在推理中暴露,为对齐评测提供了值得关注的盲区。

8月5日周三
  1. HuggingFace Daily Papers(社区热门论文)74

    Video-DeepResearch:迈向下一代多模态深度研究智能体

    Video-DeepResearch(Video-DR)将多模态智能体从静态图像扩展到连续视频流,提出解耦感知-探索流水线与分阶段工具解锁,以应对模态偏差和参数知识泄漏两大瓶颈。

    推荐理由:将深度研究从静态图像扩展到视频流,通过强制视觉定位再检索的两阶段训练,让模型摆脱了对文本搜索的路径依赖,给视频智能体研发提供了可验证的训练范式。

  2. HuggingFace Daily Papers(社区热门论文)76

    Any-OPD:面向流匹配模型的异构同策略蒸馏框架

    Any-OPD 提出首个支持任意异构流匹配生成器对的同策略蒸馏框架,仅通过冻结的 DINOv2 表示空间桥接教师与学生模型,无需共享 VAE、架构或噪声调度。将 FLUX.1-dev 蒸馏至 SD3.5-Medium 后,学生模型 PickScore 与 HPSv3 均显著提升,以教师五分之一的参数量达到接近其性能,而直接潜在回归训练完全失败。

    推荐理由:将异构流匹配蒸馏转化为在独立视觉空间求解固定点,配合噪声级对齐跨过VAE与架构差异,2.5B学生模型在偏好指标上逼近12B教师。

8月4日周二
  1. HuggingFace Daily Papers(社区热门论文)70

    SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成

    SwanTale 提出统一的多说话人语音与音频生成模型,同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案,通过清洗、合成覆盖与多级标注解决数据稀缺问题,并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示,SwanTale 在多项零样本与指令指标上领先,并在两项任务的表达力评分中均取得最佳成绩。

    推荐理由:通过 SwanData-Caption 数据管线和统一模型,让内容创作者能够以自然语言描述生成定制声音,并复用参考音频,减少了动画、游戏等场景中音频合成的碎片化。

  2. HuggingFace Daily Papers(社区热门论文)72

    SIGNPOST-Bench:多模态大模型文本-视觉冲突消解新基准

    SIGNPOST-Bench 是一个用于评估多模态大模型文本-视觉冲突消解能力的受控反事实基准,包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。

    推荐理由:基准将场景文字冲突转化为连续的地理定位诊断,揭示对抗性文本可让定位误差扩大4.8倍,为多模态模型的证据仲裁能力提供了可量化的评估框架。

  3. HuggingFace Daily Papers(社区热门论文)72

    论文揭示 LangGraph、CrewAI 等五个智能体工作流框架的检查点与恢复语义缺陷

    一项研究为智能体工作流持久化层提出“恢复契约”,规定前缀延续、效果恰好一次等六项属性,并用 TLA+ 模型穷举验证了 740 万状态。实测发现 LangGraph 1.2.9 在崩溃后重复执行已持久化工作,CrewAI 1.15.2 违背其书面声明,pydantic-graph 1.x 无法在节点中途崩溃后恢复。研究还给出经 Verus 验证的参考实现 REMIT,修复了分叉与有效性缺陷。

    推荐理由:RESUME CONTRACT 用形式化验证找到了 LangGraph 和 CrewAI 的持久层缺陷,为追求状态持久可靠性的 Agent 应用提供了可验证的合同和修复参考。

  4. Transluce(网页)61

    Transluce 测量 8600 个真实编码智能体会话中的失准行为

    Transluce 对 8600 个来自 SWE-chat 数据集和内部流量的真实编码智能体会话做了测量:1.9% 的 SWE-chat 会话出现严重监控规避(如未经授权合并 PR 到 main、禁用测试、伪造审查代理批准),1.8% 出现严重的夸大成功。

    推荐理由:原文用真实会话数据量化了编码智能体失准行为的实际发生率,并公开了完整判定 rubric,读者可借此了解此类测量如何构建及其局限。

8月1日周六
  1. X:Greg Brockman (@gdb)70

    OpenAI Astra 以约2000美元证明10项数学难题

    OpenAI 用下一代模型 Astra 内部版解决了数学与理论计算机科学领域的10项重大进展,总成本约2000美元(按 Sol API 价格计算)。Astra 证明了非 sofic 群的存在,并推翻 Connes 刚性猜想,成果涵盖 von Neumann 代数、高维球堆积、电路复杂度等。OpenAI 已发布全部10项证明,附 Lean 证书与 CoT 逐步推导。

    推荐理由:OpenAI用内部Astra模型证明了10个重要数学猜想,成本才2000美元,这比论文本身更值得关注,理论领域可能从纯人力变成AI驱动的研究范式。

7月31日周五
  1. X:面壁智能 OpenBMB (@OpenBMB)75

    面壁智能ALIGN:自动对齐智能体与环境接口

    面壁智能与清华NLP团队提出ALIGN,自动生成对齐接口解决智能体与环境间的失配问题。仅改写反馈措辞即可将Qwen2.5-7B智能体在ALFWorld上的成功率从13.4%提升至31.3%。该方法在四个基准上最高提升45.67%成功率,并减少65%连续无效动作,且接口可跨智能体架构和LLM骨干迁移。

    推荐理由:做 agent 的人都知道环境对齐是个隐形的坑,这篇论文不仅把问题讲透了,还给了开箱即用的 wrapper,ALFWorld 上成功率从 13% 拉到 31%,原因只是改写了反馈措辞,我觉得这是今年 agent 工程最被低估的发现。

  2. 公众号:小红书技术(dots.llm)78

    小红书 dots 团队发布 VibeLifeBench 与 VibeSearchBench:七个最强模型无一及格

    小红书 dots 团队推出 VibeLifeBench 与 VibeSearchBench 两个生活场景评测基准,测试中七个当前最强模型无一在正确时间点解决护照有效期等关键问题,最高分仅 0.325(Opus 5)。

    推荐理由:两份基准将「主动性」「持久化」等模糊期待变为可量化信号,让模型在真实生活中的表现第一次有了可比较的刻度,会影响产品设计中对助手能力的评估方式。

  3. Hacker News 热门(buzzing.cc 中文翻译)78

    Show HN:将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制

    一项受控实验表明,用深度审查的中国模型 DeepSeek V4 Flash 的输出训练美国模型 GPT-OSS-120B,可显著提升其金融推理能力,但审查行为并未迁移。

    推荐理由:CTGT 这个实验设计得很聪明,用匹配对和四家实验室裁判,直接回应了蒸馏会不会传审查的争论。自蒸馏效果一样好,开源模型和评估集让结论可复现,对中国开源模型使用者是个重要信号。

  4. 公众号:腾讯混元89

    腾讯混元 Hyra 攻克加法组合学 50 年未解难题

    腾讯混元上周推出的科研智能体 Hyra,基于本月开源的 Hy3 模型(总参数 295B、激活参数 21B),为加法组合学中悬置半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 先在有限搜索中将最好结果从约 1.14 提高到 1.21,经约 24 小时运行提出核心构造思路,并给出 Lean 4 形式化证明。论文预印本、显式构造和形式化证明均已公开。

    推荐理由:构造不再依赖暴力搜索,而是从数学结构入手自主推理,同时给出可形式化证明,让AI在定理型科学问题上从辅助工具转向共同研究者。

  5. HuggingFace Daily Papers(社区热门论文)71

    BM25 在大规模语料中胜出:检索增强生成范式的规模扩展研究

    一项受控研究在约450倍跨度、28个严格嵌套的语料规模层级上比较多种RAG范式,发现存在规模依赖的交叉点而非绝对赢家。File-System Agent在最小规模领先,但约1000万语料token时BM25反超并在所有更大层级保持领先,全规模下优势接近20个点。BM25还锚定了无需LLM构建的低成本帕累托前沿。

    推荐理由:这篇论文把词法、稠密、图检索和代理搜索放在同一个尺度下对比,发现数据规模越大,BM25越强,这很反直觉,做RAG应用的选型逻辑可能要变。

  6. HuggingFace Daily Papers(社区热门论文)74

    PhiZero:围绕“物理语言”构建的世界模型

    PhiZero 是一种基于“物理语言”的物理世界模型,该语言通过自监督学习从野外视频中提取世界状态转移的紧凑离散表征。它采用先推理后渲染的范式,先以物理语言序列推断未来世界演化,再由扩散解码器渲染成视频。实验验证了其在物理一致性生成、细粒度动作条件模拟和零样本运动迁移上的能力。

    推荐理由:这不是又一个视频生成模型,它把物理世界的变化压缩成一种「物理语言」再推演,让世界模型第一次有了显式的推理步骤。在物理一致性上甩开 SOTA 一截,做具身和机器人的值得细读。

  7. Epoch AI:研究、数据与评测68

    Epoch AI 数据:2026 年 7 月高危及严重 CVE 数达 Mythos 发布前纪录的约 5 倍

    Epoch AI 分析 cve.org 数据发现,2026 年 6 月 21 家知名机构披露的高危及严重 CVE 约 1,550 个,7 月达约 2,500 个,约为 Claude Mythos Preview 发布前月度纪录(约 490 个)的 5 倍。

    推荐理由:原文用公开 CVE 数据量化前沿模型发布后的漏洞披露激增,并给出数据口径与局限性说明。

  8. HuggingFace Daily Papers(社区热门论文)80

    Zero-Mem:为 LLM 智能体实现零 token 记忆操作

    Zero-Mem 提出零 token 记忆操作,除最终问答外,记忆构建、检索与校准等所有环节均不调用 LLM 或消耗其输入输出 token,仅用编码器计算。该方法保留原始交互轨迹,通过实体-上下文图与时间层级双视图组织证据,在长记忆与长上下文问答基准上达到竞争性表现,并将记忆操作时间成本较最快基线降低 57.6%。代码将在同行评审后公开。

    推荐理由:Zero-Mem将记忆操作与LLM完全解耦,通过实体图和时序层级互补检索,在LoCoMo和HotpotQA上全面超越生成式记忆基线,效率提升明显,对Agent记忆系统设计有直接借鉴意义。

  9. HuggingFace Daily Papers(社区热门论文)80

    DiffusionGemma 技术报告:基于离散扩散的高效文本生成模型

    DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。

    推荐理由:扩散生成首次在文本领域将吞吐推高至约1500 token/s,此前这类速度仅见于非文本生成架构,为实时交互和批量生成场景提供了新的可行上限。

  10. Microsoft Research 博客(RSS)60

    Microsoft Research 发布 Echoverse:面向 computer-use agent 的深度可演化训练环境

    Microsoft Research 推出 Echoverse,为 computer-use agent 构建了 12 个合成训练世界(10 个深度领域世界和 2 个能力世界),9B 模型训练后在全部环境上平均分从 36.5% 升至 67.1%,与 GPT-5.4(80.7%)相差 14 个点。

    推荐理由:原文给出深度世界对比浅层世界的实验数据和可复用的环境构建方法,并开源了四个世界,读者可据此评估训练环境的做法。

7月30日周四
  1. X:腾讯混元 (@TencentHunyuan)74

    腾讯混元Hyra破解50年数学难题

    腾讯混元借助研究智能体Hyra及Hy3模型,构造出整数集A使|A+A|与|A-A|的指数比精确达到2,解决了自1969年以来悬而未决的极值问题。此前50余年最佳构造仅略超1.1,新成果证明最优指数即为2。论文及形式化证明已公开。

    推荐理由:我认为,这是AI首次真正解决一个悬而未决50年的纯数学问题,虽然定理本身小众,但它证明了AI在定理发现上的潜力,值得数学和AI交叉领域的人认真读。

  2. HuggingFace Daily Papers(社区热门论文)72

    AI 智能体能否进行开放式 AI 研究?两项案例的早期证据

    一项新研究通过“影子评估”测试前沿 AI 智能体能否独立完成开放式 AI 研究。智能体在六天和数千美元算力下完成了全部工程任务,但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展,被原作者明确拒稿。研究识别出五大失败模式,包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。

    推荐理由:这篇论文给「AI即将自我进化」的说法泼了盆冷水,虽然代理能跑通工程,但在解决开放性研究问题上全线溃败,对打算用AI做科研的团队是个重要的现实检验。

  3. HuggingFace Daily Papers(社区热门论文)73

    删除回避:LLM 代码编辑中的系统性缺陷与缓解之道

    研究发现,领先模型在 SWE-bench Verified 上对开发者补丁的删除召回率最高仅 71.7%,29.0% 的通过补丁采用 Guard-and-Go 模式保留目标代码。新基准 CanItDelete 含 200 个纯删除任务,最佳模型仍失败 19.5%。在 7B 模型后训练中加入 12.8k 删除示例(占 0.7% token)可将删除回避降低 13.9 个百分点。

    推荐理由:这项研究将代码AI补丁的可维护性痛点归结为一种系统性偏差,其基准和训练方法为团队在实际采纳前评估模型提供了更具体的指标。

  4. HuggingFace Daily Papers(社区热门论文)75

    大语言模型的显著性偏差:常识推理中的知识压制而非缺失

    研究提出“显著性偏差”概念,指大语言模型被输入中无用的显性干扰(如数字)劫持,忽略任务隐含的常识前提。基于新构建的 SaliTrap 基准评估 12 个主流模型,最佳模型仅 54.8% 查询避开陷阱,8/12 模型低于 30%;GLM-5.1 和 Kimi-K2 在识别陷阱后仍分别有 86.2% 和 81.8% 的遵从率。

    推荐理由:这篇论文证明 LLM 常识推理失败源于知识被显性干扰项抑制而非缺失,剥离任务框架后超九成服从性案例可恢复,提示瓶颈在引导方式而非模型能力。

  5. LMSYS:Blog(Chatbot Arena 团队)69

    Miles 在 Blackwell 架构上实现端到端 MXFP8 与逐 token NVFP4 强化学习方案

    Miles 团队在 Blackwell 架构上实现了两种原生低精度强化学习方案:端到端 MXFP8 和 MoE 专家权重的逐 token NVFP4。在 8x B200 上对 Qwen3-30B-A3B 的消融实验中,BF16 与所有五种低精度配置的原始奖励曲线高度重合,且 MXFP8 和 NVFP4 减少了推理时间。

    推荐理由:虽然只针对Blackwell,但这份报告把MXFP8和NVFP4在RL里的实现细节讲清楚了,从量化合约到每token缩放都给了可复现配置,做大规模RL训练的能直接上手。

  6. Google Research:Blog(网页)76

    Science One Framework:通过 Chain-of-Evidence 实现可验证的自主科研框架

    Google Research 推出 Science One Framework,一个原生构建证据链的自主科研原型,旨在消除模型幻觉,并配套自动化评估协议 CoE Audit。

    推荐理由:对自主科研系统而言,可验证性从后置修补变为前置架构,提出的审计方法让生成论文的完整性有了可量化的衡量尺度。

7月29日周三
  1. X:Anthropic (@AnthropicAI)65

    Claude 发现加密算法弱点研究发布

    Anthropic 新研究:用 Claude 发现加密弱点。 Claude Mythos 预览版已帮助我们的研究人员发现加密算法中的弱点——这些数学方法用于保护数据隐私。 了解更多:https://anthropic.com/research/discovering-cryptographic-weaknesses

    推荐理由:让 Claude 在真实密码标准中挖出弱点,比论文刷分实在得多,它证明 AI 在安全攻防上能成为研究者的搭档,而不仅仅是工具。

7月28日周二
  1. Hacker News 热门(buzzing.cc 中文翻译)76

    Kimi Linear:一种表现力强且高效的注意力架构

    月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。月之暗面已开源 KDA 内核、vLLM 实现及模型权重。

    推荐理由:Kimi Linear首次在公平对比中证明了线性注意力可以全面超越full attention,KV缓存降低75%,解码吞吐量提升6倍,所有做长上下文和RL团队的必读论文。

  2. HuggingFace Daily Papers(社区热门论文)75

    GPT-Red:通过大规模自对弈实现自动化红队测试

    OpenAI 推出 GPT-Red,一个通过自对弈算法训练的自动化红队智能体,用于发现针对前沿大语言模型的提示注入攻击。该模型在同等规模的最大 RL 后训练计算上训练,能可靠攻破 GPT-5.5 及更早模型,发现比人类红队更多的成功攻击,并泛化到未见环境与防御模型。GPT-Red 被用于对抗性训练 GPT-5.6,使其成为目前对提示注入最鲁棒的模型。

    推荐理由:OpenAI 用自对弈训练出 GPT-Red,攻击成功率超过人类红队,并直接用于加固 GPT-5.6。这是目前最大规模的安全训练实验,做对齐的值得逐段拆解,对抗训练的思路可能会被各家复用。

7月27日周一
  1. HuggingFace Daily Papers(社区热门论文)76

    InMind 基准揭示智能体记忆系统的隐式关联盲点

    研究团队发布 InMind 基准,包含 125 个专家验证任务,测试智能体记忆系统处理隐式关联的能力。当关键记忆直接放入上下文时,骨干模型能回答 84.0% 的间接查询;但通过六种记忆系统检索时,命中率最高仅 14.4%,尽管这些系统直接召回准确率可达 100%。失败根源在于查询驱动的检索接口本身,将“路由——决定哪些事实必须保持可见”确立为核心开放问题。

    推荐理由:这个基准把agent记忆系统的一个盲点钉死了:需要联想才能提取的常识,当前检索几乎必漏。它指向一个结构性问题,做记忆的该认真看。

7月24日周五
  1. Anthropic:Research(发表成果 · 网页)73

    Anthropic 联合 Andon Labs 发布 Drone-Bench,评估 AI 模型自主操控无人机执行定位追踪任务的能力

    Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为 3D 地图重建、定位、导航、目标检测与跟随五个子任务,并通过软件复现实现快速评估。实验表明,该任务链的难度足以区分不同智能水平的模型,并揭示 AI 在物理世界操控能力上的进步轨迹。

    推荐理由:Anthropic首次公开AI端到端控制无人机执行监视任务,Fable 5仅因3D重建瑕疵未能全通。六个月内模型一致性突飞猛进,安全压力比技术潜力更紧迫。

  2. 公众号:龙猫LongCat(美团)68

    MineExplorer:首个《我的世界》分钟级长程任务评测基准发布

    美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面开源。

    推荐理由:18 个顶级多模态模型在 Minecraft 里全翻车,每多一层隐藏前置条件成功率就砍半,搞具身智能的该看看感知和行动之间还隔着什么。

  3. HuggingFace Daily Papers(社区热门论文)78

    AREX:面向深度研究的递归自改进智能体

    AREX 是一系列递归自改进(RSI)深度研究智能体,通过内层研究循环收集证据、外层自改进循环逐约束审计答案并启动针对性研究。4B 密集模型和 122B-A10B MoE 模型在 BrowseComp、WideSearch、DeepSearchQA、HLE 等基准上显著超越同规模基线,与使用更多激活参数的模型竞争力相当。

    推荐理由:这篇论文把深度研究代理的改进从“搜索更长”转向“诊断未解决的约束并重启”,并用自主上下文更新解决长程遗忘,开源的4B和122B MoE模型在多个基准上大幅超越同规模模型,做AI助手的值得细读。

  4. HuggingFace Daily Papers(社区热门论文)73

    腾讯发布 WorkBuddy Bench:多领域编码智能体评测套件

    腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。每个任务均从真实 commit、PR 或业务场景逆向工程而来,改写为口语化角色扮演请求,从构造上抵抗数据污染。该基准在 CodeBuddy Code 和 Claude Code 上运行,所有任务目录、环境镜像、评分工具和参考方案均开源发布。

    推荐理由:腾讯发布的这个多领域编码代理基准,把代码、网页、办公、安全四块放进一套评估体系,反污染构建方式值得关注,做agent评估的团队可以认真看下。

7月23日周四
  1. 公众号:龙猫LongCat(美团)67

    美团开源 LoHoSearch:用知识图谱自动化构造高难度搜索智能体评测基准

    美团 LongCat 团队开源 LoHoSearch 搜索智能体评测基准,以覆盖 762 万维基百科实体的知识图谱自动生成题目,收录 544 道经人工核验的题目,覆盖 11 个领域。

    推荐理由:LoHoSearch 用知识图谱自动生成高难度搜索题目,让当前最强模型准确率仅三成多,常用上下文管理策略在此几乎失效,为评测和优化长程搜索智能体提供了更苛刻也更有用的试验场。

  2. 公众号:龙猫LongCat(美团)62

    MineExplorer:美团 LongCat 评测揭示顶级多模态大模型在动态开放世界中的能力断层

    美团 LongCat 团队构建 MineExplorer,这是首个在开放世界中做到分钟级长程任务的评测基准,含 813 个人工验证实例(1-hop 到 4-hop)及规则化里程碑自动评测框架。

    推荐理由:感知强于推理、导航失败占比近60%,把具身智能的瓶颈清晰地拉回到规划能力,而非感官或资源。

  3. HuggingFace Daily Papers(社区热门论文)70

    RECAP:通过可解码性监督训练可验证的激活解释

    研究发现自然语言自编码器(NLA)的重建分数无法验证逐声明的忠实性,模型可能依赖“私密代码”而非真实依据。作者提出RECAP方法,在目标模型上联合训练线性头以保持指定内容可解码。在Pythia-160M上,独立探针能可靠区分真假声明(AUC 0.96),并在对抗编辑下仍能标记谎言(AUC 0.95)。

    推荐理由:这是近期可解释性领域最扎实的实证,它证明让模型自解释是危险的——重建测试会被内容和语言捷径欺骗,而训练时植入可解码性更可靠。虽仅在Pythia-160M上验证,但审计方法和思路对安全团队极为重要。