Sakana AI 发布多智能体编排系统 Sakana Fugu,对外表现为单一模型
Sakana AI Launches Sakana Fugu: An Orchestration Model That Routes Tasks Across a Swappable Pool of Frontier LLMs
今日 Sakana AI 发布 Sakana Fugu,一个多智能体编排系统,对外表现为单一模型。用户通过 OpenAI 兼容端点发送请求,Fugu 内部决定直接求解或组建专家模型团队协作。提供两个变体:Fugu(平衡性能与低延迟,支持特定 agent opt-out)和 Fugu Ultra(针对困难多步问题优化,固定 agent 池,当前模型 ID 为 fugu-ultra-20260615)。在 11 项基准测试中,Fugu Ultra 在 SWE Bench Pro(73.7%)、TerminalBench 2.1(82.1%)、LiveCodeBench(93.2%)、Humanity’s Last Exam(50.0%)等 10 项上取得最高分,表现与 Anthropic 的 Fable 5 和 Mythos Preview 相当。Fugu 通过 OpenAI 兼容 API 调用,无需更换 SDK,并支持 opt-out 以应对合规和单供应商风险。
Sakana AI 把多模型调度塞进一个 API,基准分压倒了它协调的单独模型,对降低供应商依赖的团队是个新路标,但自研路由也意味着锁死模型选型。
今天,Sakana AI 推出了 Sakana Fugu。这是一个多智能体编排系统,行为表现却如同单一模型。你只需向单一端点发送请求,Fugu 会在内部决定如何处理。当直接处理足以完成任务时,它会直接解决;当需要时,它也会组建并协调一支专家模型团队。多智能体系统的复杂性永远不会触及你的代码。
TL;DR
- Fugu 在一个 OpenAI 兼容 API 背后交付了一套多智能体系统。
- Fugu Ultra 在大多数已公布的编程与推理基准测试中领先。
- 该编排器的表现超越了它所协调的各个单独模型。
- 退出选项与提供商路由针对的是合规性和单一供应商风险。
- 路由机制为专有技术,因此每次查询的模型选择始终不对外公开。
什么是 Sakana Fugu
Fugu 本身就是一个语言模型。它经过训练,能够调用智能体池中的其他 LLM。该池中包含它自身的实例,以递归方式调用。Fugu 在内部管理模型选择、任务委派、验证与综合。
Fugu 不是采用硬编码的角色或工作流,而是学习如何协调。它自行决定何时委派任务,以及智能体之间应如何沟通。随后,它将这些智能体的工作整合为一个答案。从外部看,你调用的是单一模型。而在内部,一个由专家组成的协调系统在完成工作。
Sakana AI 将此定位为对单一供应商依赖的一种对冲。如果某家提供商限制访问,Fugu 会绕过这一中断进行路由。研究团队援引近期针对 Anthropic 的 Fable 和 Mythos 模型的出口管制作为动机。随着时间推移,更新的模型可以被纳入这一池中。
Fugu 与 Fugu Ultra:两个模型,一个 API
Fugu 以两种变体发布,二者都通过一个兼容 OpenAI 的 API 提供:
- Fugu 在强劲性能与低延迟之间取得平衡。它是日常编程、代码审查和聊天机器人的默认选择。它也适用于 Codex 等工具。你可以将特定智能体排除在其池之外。这有助于团队满足数据、隐私和合规要求。
- Fugu Ultra 针对困难的多步骤问题进行了调优,以实现最高的答案质量。它协调一个更深的专家智能体池。其池是固定的,因此无法选择排除。当前的模型 ID 是
fugu-ultra-20260615。
编排器背后的研究
Fugu 建立在两篇 ICLR 2026 论文之上:Trinity 以及关于学习式编排的 Conductor。
TRINITY 在多个轮次中使用一个轻量级的进化协调器。它分配 Thinker、Worker 或 Verifier 角色,以自适应地委派工作。Conductor 通过强化学习训练。它为多样化的 LLM 池发现自然语言协调策略和聚焦的提示词。
两者共同表明,系统可以学会按任务组装和路由智能体。这取代了手工设计的工作流。
交互式讲解
基准测试
Sakana AI 将 Fugu 与其所编排的基础模型进行对比。基线使用提供商报告的分数。SWE Bench Pro 使用 mini-swe-agent 作为脚手架。
| 基准测试 | Fugu | Fugu Ultra | Opus 4.8 | Gemini 3.1 Pro | GPT 5.5 |
|---|---|---|---|---|---|
| SWE Bench Pro* | 59.0 | 73.7 | 69.2 | 54.2 | 58.6 |
| TerminalBench 2.1 | 80.2 | 82.1 | 74.6 | 70.3 | 78.2 |
| LiveCodeBench | 92.9 | 93.2 | 87.8 | 88.5 | 85.3 |
| LiveCodeBench Pro | 87.8 | 90.8 | 84.8 | 82.9 | 88.4 |
| Humanity's Last Exam | 47.2 | 50.0 | 49.8 | 44.4 | 41.4 |
| CharXiv Reasoning | 85.1 | 86.6 | 84.2 | 83.3 | 84.1 |
| GPQA-D | 95.5 | 95.5 | 92.0 | 94.3 | 93.6 |
| SciCode | 60.1 | 58.7 | 53.5 | 58.9 | 56.1 |
| τ³ Banking | 21.7 | 20.6 | 20.6 | 8.4 | 20.6 |
| 长上下文推理 | 74.7 | 73.3 | 67.7 | 72.7 | 74.3 |
| MRCRv2 | 86.6 | 93.6 | 87.9 | 84.9 | 94.8 |
该编排器在 11 行中的 10 行上取得了最高分。Fugu Ultra 在四项编程基准、CharXiv Reasoning 和 Humanity's Last Exam 上均位居榜首。它在 GPQA-D 上与普通版 Fugu 打成平手。普通版 Fugu 在 SciCode、τ³ Banking 和 Long Context Reasoning 上领先。GPT 5.5 赢得了 MRCRv2,这是此处唯一的基线模型胜出。
其 Fugu 系列模型与 Anthropic 的 Fable 5 和 Mythos Preview 不相上下。这两款模型不在 Fugu 的候选池中,因为它们并未公开可用。
用例
Sakana AI 开展了面向近 500 名早期用户的 beta 测试。公布的示例偏向于长流程、多步骤任务。
- AutoResearch:一个智能体自主改进了一个小型 GPT 的训练配方。它在一张 H100 GPU 上运行了约 14 小时,共进行了 123 次实验。Fugu Ultra 达到了最佳平均验证 BPB 0.9774,最佳单次运行为 0.9748。
- 魔方求解:每个模型都编写了一个纯 Python 求解器,不允许使用任何库。Fugu Ultra 解出了全部 300 个留出测试魔方,平均 19.72 步。一个基线模型以 19.76 步紧随其后。另外两个模型崩溃,一个都没解出。
- 古典日语假名读音顺序:在一封 1610 年的信件上,Fugu Ultra 取得了 NED 0.80 的分数。最接近的基线模型仅达到 0.24。
- 盲棋:Fugu 凭记忆下了四盘棋,全程不显示棋盘。它击败了三个前沿模型以及一个 2100 Elo 的 Stockfish 引擎。
- 在线交易:在一个 50 周的窗口内,Fugu Ultra 在五次运行中平均回报率为 +19.43%。其他前沿模型均低于 +15%。Sakana AI 指出,过往表现并不保证未来结果。
一个最小 API 示例
Fugu 使用与 OpenAI 兼容的 API,因此无需迁移 SDK。只需将现有客户端指向控制台提供的端点即可。
from openai import OpenAI
# Endpoint and key come from your Sakana console (console.sakana.ai).
client = OpenAI(
base_url="https://<your-fugu-endpoint>/v1", # from console.sakana.ai
api_key="YOUR_SAKANA_API_KEY",
)
resp = client.chat.completions.create(
model="fugu-ultra-20260615", # or "fugu"
messages=[
{"role": "user",
"content": "Reproduce the method in this paper and report the gap."},
],
)
print(resp.choices[0].message.content)Token 用量和成本按请求报告。因此你可以实时监控支出。
社区反响
Sakana Fugu——社区早期情绪
对 X 和 Hacker News 上公众反应的人工审阅,附每个来源的链接。采集于 2026 年 6 月 22 日。
已审阅 12 条帖子
情绪分布(n = 12)
支持 3
怀疑 6
批评 3
支持
怀疑
早期反应偏向怀疑。“这到底只是个路由器还是套壳?”这个问题占据主导。最明确的支持声音来自 Sakana 相关人员。
媒体报道与分析
Hacker News 讨论帖 · 50 分 ↗
VentureBeat 报道 ↗
Clanker Cloud 分析 ↗
方法:情绪是根据 2026 年 6 月 22 日一小部分公开帖子手工判定的。这不是一项统计调查,随着更多反应出现,分布可能会发生变化。三条支持性帖子中有两条来自 Sakana AI 或其 CEO。引文经过缩短;请点击每个链接查看完整上下文。Reddit 引文按 VentureBeat 的报道呈现。
· Sakana Fugu 情绪追踪器
来源:X · Hacker News · VentureBeat
来源:MarkTechPost(RSS) · marktechpost.com