AI预检检查:智能体工作记忆架构
The AI Preflight Check
一种为AI智能体设计的预检工作记忆架构:查询到来时,系统从磁盘上约90个索引化的技能库中检索最相关技能,仅加载到上下文窗口。本地开源模型Ornith 35B(350亿参数,通过Ollama在Apple Silicon上运行)执行任务,约80%常规任务由本地模型完成,困难任务路由至前沿模型。看门狗记录每次预检决策和技能调用,夜间通过异步推理处理全天轨迹,自动决定哪些技能需新增或固化(如日历排期转为确定性Rust代码),实现自我改进循环。昨天,看门狗首次未提出任何改进建议,系统或接近性能平台期。
Tunguz 把代理的记忆问题拆成预检+看门狗,不是大模型调参,而是软件架构层的优化,做 agent 的开发者可以直接偷师。
简而言之:一种面向 AI 智能体的工作记忆架构:preflight 从长期技能库中检索出正确的技能,由本地模型执行,而 watchdog 在夜间读取执行轨迹以更新技能库。
我至今仍记得,我的智能体会在我说到一半时就忘掉我说过的话。
上下文大小不是天花板。记忆架构才是。
我一直在试验一种运行 preflight 指令的记忆架构。飞行员会在起飞前规划航线。我的智能体也是如此。
一个查询到来。“总结 Q3 董事会演示文稿。”这句话背后是 200,000 个原始 token 的邮件、PDF 和聊天记录。
Preflight 就是检索。智能体检查它的技能库1,挑选出与任务相关的技能,并只将这些技能加载到上下文窗口中。技能是经过整合的记忆;preflight 这一步就是智能体挑选出正确技能的方式。
本地 Ornith 35B 模型2随后在这个已加载的上下文上执行。困难任务会路由到前沿模型;常规任务则留在本地模型上,这种情况大约占 80%。
Watchdog 监控哪些技能被加载、做出了哪些决策,以及成功率。每一个 preflight 决策都会被记录。每一次技能调用都是一个具名的、带版本的产物。
一夜之间,异步推理3会处理当天的运行轨迹。它决定应当开发哪些新技能,以及现有技能的哪些部分应当转化为确定性代码。日历排程就是一个很好的例子:大语言模型不应该去比较空闲与忙碌的时间段;Rust 在这方面要擅长得多。系统会重写自己的技能库,并在一个自我改进的循环中重启自身。
昨天是看门狗第一次没有提出任何改进建议。我怀疑这种情况不会持续下去。但它暗示了一件事:在某个改进水平上,系统会达到一个平台期。只有真正全新的异常情况才需要人类帮助。
来源:Tomer Tunguz 博客(VC 分析) · tomtunguz.com