跳到正文
北京时间
原文
Tomer Tunguz 博客(VC 分析)· Tomasz Tunguz·· 2026-07-08精选AI 评分57

AI预检检查:智能体工作记忆架构

The AI Preflight Check

AI 导读

一种为AI智能体设计的预检工作记忆架构:查询到来时,系统从磁盘上约90个索引化的技能库中检索最相关技能,仅加载到上下文窗口。本地开源模型Ornith 35B(350亿参数,通过Ollama在Apple Silicon上运行)执行任务,约80%常规任务由本地模型完成,困难任务路由至前沿模型。看门狗记录每次预检决策和技能调用,夜间通过异步推理处理全天轨迹,自动决定哪些技能需新增或固化(如日历排期转为确定性Rust代码),实现自我改进循环。昨天,看门狗首次未提出任何改进建议,系统或接近性能平台期。

推荐理由

Tunguz 把代理的记忆问题拆成预检+看门狗,不是大模型调参,而是软件架构层的优化,做 agent 的开发者可以直接偷师。

正文 · AI 翻译

简而言之:一种面向 AI 智能体的工作记忆架构:preflight 从长期技能库中检索出正确的技能,由本地模型执行,而 watchdog 在夜间读取执行轨迹以更新技能库。

我至今仍记得,我的智能体会在我说到一半时就忘掉我说过的话。

上下文大小不是天花板。记忆架构才是。

Diagram of the memory system : a user request flows through a preflight check that loads the right skill from a long-term skills library into the context window, executed by the local Ornith 35B model, with a watchdog reading the trail at the end.

我一直在试验一种运行 preflight 指令的记忆架构。飞行员会在起飞前规划航线。我的智能体也是如此。

一个查询到来。“总结 Q3 董事会演示文稿。”这句话背后是 200,000 个原始 token 的邮件、PDF 和聊天记录。

Preflight 就是检索。智能体检查它的技能库1,挑选出与任务相关的技能,并只将这些技能加载到上下文窗口中。技能是经过整合的记忆;preflight 这一步就是智能体挑选出正确技能的方式。

本地 Ornith 35B 模型2随后在这个已加载的上下文上执行。困难任务会路由到前沿模型;常规任务则留在本地模型上,这种情况大约占 80%。

Editorial illustration of an airline pilot in the cockpit running a preflight checklist, with a planned flight route curving through the windshield.

Watchdog 监控哪些技能被加载、做出了哪些决策,以及成功率。每一个 preflight 决策都会被记录。每一次技能调用都是一个具名的、带版本的产物。

一夜之间,异步推理3会处理当天的运行轨迹。它决定应当开发哪些新技能,以及现有技能的哪些部分应当转化为确定性代码。日历排程就是一个很好的例子:大语言模型不应该去比较空闲与忙碌的时间段;Rust 在这方面要擅长得多。系统会重写自己的技能库,并在一个自我改进的循环中重启自身。

昨天是看门狗第一次没有提出任何改进建议。我怀疑这种情况不会持续下去。但它暗示了一件事:在某个改进水平上,系统会达到一个平台期。只有真正全新的异常情况才需要人类帮助。


  1. 技能库是一组工作流文件(目前约 90 个),在磁盘上建立索引,并通过意图匹配进行检索。技能是编写一次、经过版本管理、并作为工具 schema 交给模型的工作流。关于该库是如何构建的,参见技能蒸馏。↩︎

  2. Ornith 35B 是一个本地托管的开放权重模型,属于 350 亿参数级别,通过Ollama在 Apple Silicon 上运行。它处理常规的智能体工作——分类、起草、工具选择、结构化提取——并将困难的剩余部分路由给前沿模型。↩︎

  3. 关于使夜间、长达数小时的智能体运行变得可行的队列架构,参见Full Sail on Asynchronous Inference。↩︎

来源:Tomer Tunguz 博客(VC 分析) · tomtunguz.com