跳到正文
北京时间
原文
OpenRouter:Announcements(RSS)· Jacky Liang·· 2026-07-31精选AI 评分75

OpenRouter 推出 Ori Eval:用你的数据证明哪款模型最适合你的项目

Ori Eval: Prove the Best Model for What You're Building

AI 导读

OpenRouter 发布 Ori Eval,一个能扫描代码库、自动编写 eval 文件并运行评测的智能体,帮助开发者在 500 多款模型中选出最适合自己项目的单一模型。

推荐理由

Ori Eval 把评测集成到代码库并支持 CI,将模型比较变成可重复的工程实践,选型不再只靠 benchmark 或手感。

正文 · AI 翻译

Ori Eval: Prove the Best Model for What You're Building

随着越来越多的应用加入 AI 功能,为你正在构建的东西选择使用哪个模型依然同样困难,甚至更加困难,因为你可以选择的模型超过 500 个。

目前,想要为你的项目找到最佳模型,通常靠的是感觉,或者某条推文(那也是靠感觉),或者查看基准测试,又或者你根本没用任何实际方法。

也许你在查看基准测试分数,你在阅读关于中国最新模型的讨论帖。每周都有新模型发布,你不堪重负,而正因为你不堪重负,最终什么选择都没做出(或者更糟,做出了糟糕的选择)。

尽管上述资源可能很有帮助,但没有什么能告诉你,一个模型在你的应用中、在你的测试框架上、在你的数据上、在你的提示词上表现如何。

直到今天。

在 OpenRouter,我们对模型还是略知一二的。

我们学到的是,不存在绝对意义上的最佳模型——只有最适合你正在构建的东西的模型。

Ori Eval 帮你找到那唯一的模型,并向你证明它。

要开始使用,告诉你的智能体:

run curl -fsSL https://openrouter.ai/skills/spawn-ori-eval and follow the instructions in its output to get started

Ori Eval 会像一位友好且经验丰富的工程朋友一样,带你了解如何为你正在构建的东西选择最佳模型——无需任何 eval 经验。

简而言之

  • Ori Eval 会在你自己的提示词上运行你的智能体,对它调用的工具进行断言,并用 LLM 评委为开放式答案打分。
  • Ori 在一次运行期间会固定测试框架和模型。环境保持不变,因此如果某个 eval 结果发生了变化,你就知道这一变化只能归因于模型的变化。
  • Ori Eval 通过 OpenRouter 路由,因此模型对比覆盖每一个模型和实验室。
  • 你不需要知道如何编写 eval。Ori Eval 会找出你的代码中每一处调用模型的地方,询问你在意什么,并编写 eval 文件。
  • eval 文件就是代码。在 CI 中运行它以阻止回归,并在新模型发布时重新运行它。
  • 要开始,告诉你的编码智能体:run curl -fsSL https://openrouter.ai/skills/spawn-ori-eval and follow the instructions in its output to get started。

提出问题,获得答案(附带证据)

要使用 Ori Eval,你只需告诉你最喜欢的编码智能体:

运行 curl -fsSL https://openrouter.ai/skills/spawn-ori-eval 并按照其输出中的说明操作

你的智能体将请求交给 Ori Eval。Ori Eval 会探索你的代码库,然后带着问题回来。在运行任何评估之前,它会与你协作,帮助弄清楚对你而言什么最重要——是成本、性能、延迟、速度、工具调用准确率,还是其他方面。随后它会挑选出 5 个符合你要求的最新模型,并与你确认。

一旦收集齐所有这些必要的要求,Ori Eval 就会编写一个 review.eval.ts 文件,让你的智能体并行地对候选模型进行测试,并返回一张表格:

模型捕获率p50$/PR结果
anthropic/claude-opus-594%38s$0.041通过
openai/gpt-5.6-sol92%44s$0.038通过
moonshotai/kimi-k390%31s$0.019通过
z-ai/glm-5.286%26s$0.008通过
google/gemini-3-pro84%52s$0.062未通过(成本)

该推荐附带理由:比方说,在你的模型成本标准内实现最高的 bug 捕获率,以及当 bug 审查量增长时的性价比之选。

如果你以前从未写过 eval,也不用担心

编写好的评估并不容易,所以我们替你处理了那些烦人的部分。

Ori Eval 会扫描你的代码库,找出模型运行的每一处位置,并向你展示它的发现:用例范围、确切的文件,以及你当前在那里使用的模型。接着它会询问你希望评估覆盖哪些范围,以及对你来说最重要的是什么:准确率、速度、成本,还是其他什么?

一旦 Ori Eval 完成对你的访谈,它就会根据你的回答编写评估文件,并运行它。

就这么简单。

一次又一次运行,分数始终一致

由于 Ori Eval 是一个智能体,它可以在一次运行的整个过程中固定 harness、模型和 effort。它还经过了预先调优:我们已经选好了最适合评测工作的 harness 和模型,因此你无需自己挑选。

一次评测检查三件事

评估文件是一个用 *.eval.ts 运行的文件,配合 bun test 使用。它会检查智能体调用了哪些工具、避开了哪些工具,以及回答的质量:

const run = await agent.run("dinner in Lisbon?");
run.tool("search").toBeCalled();
run.tool("delete_file").toNotBeCalled();
run.toComplete();

对于开放式回答,由 LLM-as-a-judge 对输出进行评分。Ori Eval 帮助你设定评分标准和最低分数,因此即便是棘手的开放式问题也能被评估。

每个 bug 都会变成你可以用来测试的对象

用大白话告诉 Ori Eval 一个 bug:比如说,一个客服智能体连订单都不查就直接退款——这可是个大问题。

Ori Eval 会编写一个 eval,断言 lookup_order 被调用。该 eval 失败,证明这个 bug 确实存在。随后你修复了这个智能体,eval 便通过了。这条断言会留在你的测试套件中,因此你始终都能捕获到它。

阻止回归,并在领域变化时重新运行

把 ori eval 加入 GitHub Actions 工作流。它会像 bun test 那样退出,因此 eval 失败也会导致构建失败,回归永远不会进入生产环境。

由于 Ori Eval 编写的内容本身就是代码,你也可以轻松地安排它们定期运行。我们的一位早期 beta 测试者现在每月运行一次模型对比。当有新模型发布,并且它在你的代码库中表现优于现有模型时,就会自动开一个 PR,你所要做的就是合并它,然后坐享其成,甚至都不用去想这件事。

告诉你的编程智能体:

run curl -fsSL https://openrouter.ai/skills/spawn-ori-eval and follow the instructions in its output to get started

就这样。

这个技能会安装 Ori(我们预先调优好的编程智能体),要求你登录,对你进行访谈,然后运行 eval。如果你使用 OpenRouter MCP server,请改为运行 /spawn-ori-eval,并跳过 URL。

手动安装 Ori:

curl -fsSL https://openrouter.ai/labs/ori/install.sh | bash

然后运行 ori login。运行评估还需要 Bun。

阅读更多内容,请访问 Ori Eval 页面或 Ori Eval 文档。

来源:OpenRouter:Announcements(RSS) · openrouter.ai