跳到正文
北京时间
原文
MarkTechPost(RSS)· Asif Razzaq·· 2026-06-23精选AI 评分76

Sakana AI 发布多智能体编排系统 Sakana Fugu,对外表现为单一模型

Sakana AI Launches Sakana Fugu: An Orchestration Model That Routes Tasks Across a Swappable Pool of Frontier LLMs

AI 导读

今日 Sakana AI 发布 Sakana Fugu,一个多智能体编排系统,对外表现为单一模型。用户通过 OpenAI 兼容端点发送请求,Fugu 内部决定直接求解或组建专家模型团队协作。提供两个变体:Fugu(平衡性能与低延迟,支持特定 agent opt-out)和 Fugu Ultra(针对困难多步问题优化,固定 agent 池,当前模型 ID 为 fugu-ultra-20260615)。在 11 项基准测试中,Fugu Ultra 在 SWE Bench Pro(73.7%)、TerminalBench 2.1(82.1%)、LiveCodeBench(93.2%)、Humanity’s Last Exam(50.0%)等 10 项上取得最高分,表现与 Anthropic 的 Fable 5 和 Mythos Preview 相当。Fugu 通过 OpenAI 兼容 API 调用,无需更换 SDK,并支持 opt-out 以应对合规和单供应商风险。

推荐理由

Sakana AI 把多模型调度塞进一个 API,基准分压倒了它协调的单独模型,对降低供应商依赖的团队是个新路标,但自研路由也意味着锁死模型选型。

正文 · AI 翻译

今天,Sakana AI 推出了 Sakana Fugu。这是一个多智能体编排系统,行为表现却如同单一模型。你只需向单一端点发送请求,Fugu 会在内部决定如何处理。当直接处理足以完成任务时,它会直接解决;当需要时,它也会组建并协调一支专家模型团队。多智能体系统的复杂性永远不会触及你的代码。

TL;DR

  • Fugu 在一个 OpenAI 兼容 API 背后交付了一套多智能体系统。
  • Fugu Ultra 在大多数已公布的编程与推理基准测试中领先。
  • 该编排器的表现超越了它所协调的各个单独模型。
  • 退出选项与提供商路由针对的是合规性和单一供应商风险。
  • 路由机制为专有技术,因此每次查询的模型选择始终不对外公开。

什么是 Sakana Fugu

Fugu 本身就是一个语言模型。它经过训练,能够调用智能体池中的其他 LLM。该池中包含它自身的实例,以递归方式调用。Fugu 在内部管理模型选择、任务委派、验证与综合。

Fugu 不是采用硬编码的角色或工作流,而是学习如何协调。它自行决定何时委派任务,以及智能体之间应如何沟通。随后,它将这些智能体的工作整合为一个答案。从外部看,你调用的是单一模型。而在内部,一个由专家组成的协调系统在完成工作。

Sakana AI 将此定位为对单一供应商依赖的一种对冲。如果某家提供商限制访问,Fugu 会绕过这一中断进行路由。研究团队援引近期针对 Anthropic 的 Fable 和 Mythos 模型的出口管制作为动机。随着时间推移,更新的模型可以被纳入这一池中。

Fugu 与 Fugu Ultra:两个模型,一个 API

Fugu 以两种变体发布,二者都通过一个兼容 OpenAI 的 API 提供:

  • Fugu 在强劲性能与低延迟之间取得平衡。它是日常编程、代码审查和聊天机器人的默认选择。它也适用于 Codex 等工具。你可以将特定智能体排除在其池之外。这有助于团队满足数据、隐私和合规要求。
  • Fugu Ultra 针对困难的多步骤问题进行了调优,以实现最高的答案质量。它协调一个更深的专家智能体池。其池是固定的,因此无法选择排除。当前的模型 ID 是 fugu-ultra-20260615。

编排器背后的研究

Fugu 建立在两篇 ICLR 2026 论文之上:Trinity 以及关于学习式编排的 Conductor。

TRINITY 在多个轮次中使用一个轻量级的进化协调器。它分配 Thinker、Worker 或 Verifier 角色,以自适应地委派工作。Conductor 通过强化学习训练。它为多样化的 LLM 池发现自然语言协调策略和聚焦的提示词。

两者共同表明,系统可以学会按任务组装和路由智能体。这取代了手工设计的工作流。

交互式讲解

基准测试

Sakana AI 将 Fugu 与其所编排的基础模型进行对比。基线使用提供商报告的分数。SWE Bench Pro 使用 mini-swe-agent 作为脚手架。

基准测试FuguFugu UltraOpus 4.8Gemini 3.1 ProGPT 5.5
SWE Bench Pro*59.073.769.254.258.6
TerminalBench 2.180.282.174.670.378.2
LiveCodeBench92.993.287.888.585.3
LiveCodeBench Pro87.890.884.882.988.4
Humanity's Last Exam47.250.049.844.441.4
CharXiv Reasoning85.186.684.283.384.1
GPQA-D95.595.592.094.393.6
SciCode60.158.753.558.956.1
τ³ Banking21.720.620.68.420.6
长上下文推理74.773.367.772.774.3
MRCRv286.693.687.984.994.8

该编排器在 11 行中的 10 行上取得了最高分。Fugu Ultra 在四项编程基准、CharXiv Reasoning 和 Humanity's Last Exam 上均位居榜首。它在 GPQA-D 上与普通版 Fugu 打成平手。普通版 Fugu 在 SciCode、τ³ Banking 和 Long Context Reasoning 上领先。GPT 5.5 赢得了 MRCRv2,这是此处唯一的基线模型胜出。

其 Fugu 系列模型与 Anthropic 的 Fable 5 和 Mythos Preview 不相上下。这两款模型不在 Fugu 的候选池中,因为它们并未公开可用。

用例

Sakana AI 开展了面向近 500 名早期用户的 beta 测试。公布的示例偏向于长流程、多步骤任务。

  • AutoResearch:一个智能体自主改进了一个小型 GPT 的训练配方。它在一张 H100 GPU 上运行了约 14 小时,共进行了 123 次实验。Fugu Ultra 达到了最佳平均验证 BPB 0.9774,最佳单次运行为 0.9748。
  • 魔方求解:每个模型都编写了一个纯 Python 求解器,不允许使用任何库。Fugu Ultra 解出了全部 300 个留出测试魔方,平均 19.72 步。一个基线模型以 19.76 步紧随其后。另外两个模型崩溃,一个都没解出。
  • 古典日语假名读音顺序:在一封 1610 年的信件上,Fugu Ultra 取得了 NED 0.80 的分数。最接近的基线模型仅达到 0.24。
  • 盲棋:Fugu 凭记忆下了四盘棋,全程不显示棋盘。它击败了三个前沿模型以及一个 2100 Elo 的 Stockfish 引擎。
  • 在线交易:在一个 50 周的窗口内,Fugu Ultra 在五次运行中平均回报率为 +19.43%。其他前沿模型均低于 +15%。Sakana AI 指出,过往表现并不保证未来结果。

一个最小 API 示例

Fugu 使用与 OpenAI 兼容的 API,因此无需迁移 SDK。只需将现有客户端指向控制台提供的端点即可。

from openai import OpenAI

# Endpoint and key come from your Sakana console (console.sakana.ai).
client = OpenAI(
    base_url="https://<your-fugu-endpoint>/v1",  # from console.sakana.ai
    api_key="YOUR_SAKANA_API_KEY",
)

resp = client.chat.completions.create(
    model="fugu-ultra-20260615",           # or "fugu"
    messages=[
        {"role": "user",
         "content": "Reproduce the method in this paper and report the gap."},
    ],
)

print(resp.choices[0].message.content)

Token 用量和成本按请求报告。因此你可以实时监控支出。

社区反响

Sakana Fugu——社区早期情绪

对 X 和 Hacker News 上公众反应的人工审阅,附每个来源的链接。采集于 2026 年 6 月 22 日。

已审阅 12 条帖子

情绪分布(n = 12)

支持 3

怀疑 6

批评 3

支持

怀疑

早期反应偏向怀疑。“这到底只是个路由器还是套壳?”这个问题占据主导。最明确的支持声音来自 Sakana 相关人员。

媒体报道与分析

Hacker News 讨论帖 · 50 分 ↗

VentureBeat 报道 ↗

Clanker Cloud 分析 ↗

方法:情绪是根据 2026 年 6 月 22 日一小部分公开帖子手工判定的。这不是一项统计调查,随着更多反应出现,分布可能会发生变化。三条支持性帖子中有两条来自 Sakana AI 或其 CEO。引文经过缩短;请点击每个链接查看完整上下文。Reddit 引文按 VentureBeat 的报道呈现。

· Sakana Fugu 情绪追踪器

来源:X · Hacker News · VentureBeat

来源:MarkTechPost(RSS) · marktechpost.com