AI Harness 对性能的影响超过模型本身:GPT-5.5 与 Opus 4.7 在第三方工具中得分更高
Aftermarket Harnesses
Endor Labs 测试显示,同一模型在不同 harness 中性能差异巨大:GPT-5.5 在 Cursor 中功能正确率 87.2%,远超其在 Codex 原生环境中的 61.5%;Opus 4.7 在 Cursor 中得分 91.1%,高于 Claude Code 的 87.2%。Harness 决定发送的上下文与缓存策略,智能缓存可节省 40-80% 成本并提速 13-31%。
作者引用同一模型在不同 harness 下的分数差与缓存研究,说明 harness 而非模型决定成本和表现,读者可借此审视自己的工具链选择。
AI 运行框架对性能的影响比模型本身更大。
Endor Labs 在同一周内用两个运行框架测试了相同的模型。OpenAI 的 GPT-5.5 在其原生的 Codex 运行框架中功能正确率为 61.5%,而在 Cursor 的运行框架中为 87.2%,仅运行环境一项就带来了 25.7 个百分点的差距。Anthropic 的 Opus 4.7 在 Claude Code 中得分为 87.2%,在 Cursor 中为 91.1%。1
两个前沿模型在竞争对手的运行框架中表现都优于其自家厂商提供的运行框架。
运行框架是 AI 技术栈中的支点。它们影响成本、质量和准确性。
在 OpenRouter 上,输入 token 占 LLM 流量的 86-98%。输出 token 的单价是输入的 5 倍,但输入仍然占据账单的主导地位,因为其数量要多得多。一年前我在《Hungry, Hungry AI Model》一文中就思考过这一比例。2从业者当时说是 95% 输入 / 5% 输出。在大规模场景下,他们是对的。
因此,控制输入成本是一项很有价值的主张。模型无法控制这些成本,但 harness 可以。3 harness 决定发送哪些上下文。其中大部分上下文在每次查询之间都会重复。智能地对其进行缓存可以节省 40-80%。一项覆盖 500 个长时程智能体会话的研究发现,成本降低了 41-80%,首 token 时间加快了 13-31%,且节省幅度随提示词从 500 token 到 50,000 token 呈线性扩展。4最优方案是仅缓存稳定的前缀,并将动态内容放在缓存断点之后。
harness 还执行信息检索:要阅读的代码、风格指南、投资简报中要分析的部分。越简洁、越精确,成本就越低。
Cursor 的 harness 在每一项技术上都与 Claude Code 不相上下:动态工具获取、基于优先级的缀段组装、两级缓存。这就是为什么 Opus 4.7 在 Cursor 中的得分高于在 Claude Code 中的得分,也是为什么 GPT-5.5 在 Codex 之外的功能正确性得分几乎翻倍。
捆绑方案并非没有可取之处。Claude Code 将缓存命中率视为一项正常运行时间指标,在实际会话中达到约 96%,在同一版本的用户之间共享系统提示词缓存,并以 99% 的字节一致性构建分叉子智能体,从而实现 90% 的节省。5
协同设计 harness、缓存 API 和模型,确实能带来真正的缓存纪律。但这种纪律存在于 harness 之中,而第三方 harness 也能做到,正如 Cursor 的数据所示。
这套运行框架已经摆脱了作为模型封装层所遭受的批评;它更像是一位骑师,将 AI 的表现推向远超培育者所想象的高度。
-
Endor Labs,《GPT-5.5 在智能体安全联盟中以 Cursor 而非 Codex 创下代码安全新纪录》,2026 年 4 月 27 日,https://www.endorlabs.com/learn/gpt-5-5-sets-a-new-code-security-record-with-cursor-not-codex-in-agent-security-league。Agent Security League 基准测试,基于卡内基梅隆大学的 Open SusVibes 框架。↩︎
-
Tomasz Tunguz,《饥饿又饥饿的 AI 模型》,2025 年 7 月 8 日,https://tomtunguz.com/input-output-ratio/ ↩︎
-
Tomasz Tunguz,《运行框架是新的战场》,https://tomtunguz.com/the-harness-is-the-new-battleground/ ↩︎
-
Lumer 等人,《不要破坏缓存:面向长周期智能体任务的提示词缓存评估》,arXiv:2601.06007,2026 年。https://arxiv.org/abs/2601.06007 ↩︎
-
Anthropic,《构建 Claude Code 的经验教训:提示词缓存就是一切》,2026 年 4 月,https://claude.com/blog/lessons-from-building-claude-code-prompt-caching-is-everything; 切换成本数据来自 Digital Applied,《提示词缓存经济学:缓存优先的智能体设计》,2026 年 7 月,https://www.digitalapplied.com/blog/prompt-caching-economics-cache-first-agent-architecture-2026。↩︎
来源:Tomer Tunguz 博客(VC 分析) · tomtunguz.com