HuggingFace Daily Papers(社区热门论文)·· 2026-07-27精选AI 评分76
InMind 基准揭示智能体记忆系统的隐式关联盲点
Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory
AI 导读
研究团队发布 InMind 基准,包含 125 个专家验证任务,测试智能体记忆系统处理隐式关联的能力。当关键记忆直接放入上下文时,骨干模型能回答 84.0% 的间接查询;但通过六种记忆系统检索时,命中率最高仅 14.4%,尽管这些系统直接召回准确率可达 100%。失败根源在于查询驱动的检索接口本身,将“路由——决定哪些事实必须保持可见”确立为核心开放问题。
推荐理由
这个基准把agent记忆系统的一个盲点钉死了:需要联想才能提取的常识,当前检索几乎必漏。它指向一个结构性问题,做记忆的该认真看。
正文 · AI 翻译
摘要:长期记忆系统将用户说过的话存储于外部存储器中,并在相关查询到来时进行检索。这一交互界面基于一个看似理所当然、以至于很少被明确陈述的假设:所需的记忆必然与需要它的查询相似。世界知识打破了这一假设。对坚果过敏这一事实,应当通过杏仁粉这一成分来改变对马卡龙请求的回答,然而这两段文本之间并不存在任何检索器能够识别的线索。我们将这种失败模式称为“隐式关联盲点”,并提出了 InMind——一个包含 125 项任务、经专家验证的基准测试,涵盖十个生活领域,其中 113 项任务基于可引用的公开来源。其配对控制实验将现有评估中混淆的三种解释区分开来:事实从未被存储、模型缺乏桥接知识、或者事实已被存储但从未被呈现。结论是清晰的。当决定性的记忆被置于上下文中时,骨干模型能回答 84.0% 的间接查询;而当同样的记忆需要被检索时,六种向量、图及智能体记忆系统最多只能达到 14.4%,尽管它们在按需回忆相同事实时准确率高达 100%。将嵌入向量的维度提升八倍,虽然提高了每个系统在答案盲测中的目标召回率,但差距基本保持不变。一种在查询到来前保持记忆可见的最小诊断探针,能够恢复大部分差距,从而将失败定位在查询条件化的交互界面本身,并指出路由——即决定哪些事实必须保持可见——是 InMind 旨在评分的开放性问题。
| 学科分类: | 计算与语言(cs.CL) |
| 引用方式: | arXiv:2607.24368 [cs.CL] |
| (或本版本:arXiv:2607.24368v1 [cs.CL]) | |
| https://doi.org/10.48550/arXiv.2607.24368 arXiv 发布的 DOI 通过 DataCite 获取(注册中) |
提交历史
来自:Ruizhe Li [
2026 年 7 月 27 日星期一 12:42:12 UTC(1,196 KB)
访问论文:
![]()
当前浏览上下文:
参考文献与引用
书签
![]()
书目与引用工具
与本文相关的代码、数据与媒体
演示
推荐与搜索工具
arXivLabs:与社区合作者的实验项目
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org