AI 快讯 编译自 marktechpost #模型发布#多智能体#编排模型

Sakana AI 发布 Fugu 编排模型:动态路由任务至多个前沿 LLM,性能领先多数基准

Sakana AI 推出 Fugu 和 Fugu Ultra,一种多智能体编排系统,通过单一 API 调用即可路由任务至可替换的模型池,在 SWE-Bench、LiveCodeBench 等 11 项基准中 10 项领先。本文详解其技术原理、性能数据、中文用户实际可用性及与国产模型的对比。

编译发布 2026/06/22 原文发布 2026/06/22

一句话看懂

Sakana AI 推出 Fugu 编排模型,将多智能体系统封装成单一 API,自动路由任务至最优模型,在编码和推理基准上超越 GPT-5.5 等前沿模型。

详细发生了什么

2026 年 6 月 22 日,Sakana AI 正式发布 Sakana Fugu 和 Fugu Ultra。Fugu 本身是一个语言模型,经过训练可以调用模型池中的其他 LLM(包括自身的递归实例),自动完成模型选择、任务委派、结果验证和答案合成。用户只需向一个 OpenAI 兼容的 API 端点发送请求,Fugu 内部会决定是直接求解,还是组建专家模型团队协作。

Fugu 有两个版本:Fugu 平衡性能与延迟,支持用户选择排除某些模型以符合合规要求;Fugu Ultra 则针对高难度多步骤问题优化,使用固定模型池,不支持排除。在 11 项基准测试中,Fugu 和 Fugu Ultra 在 10 项上取得最高分,包括 SWE-Bench Pro(73.7%)、LiveCodeBench(93.2%)、Humanity’s Last Exam(50.0%)等。唯一落败的是 MRCRv2,GPT-5.5 以 94.8% 胜出。

Sakana AI 强调,Fugu 的设计初衷之一是降低对单一供应商的依赖。研究团队引用近期 Anthropic 的 Fable 和 Mythos 模型出口管制作为动机。Fugu 的编排技术基于两篇 ICLR 2026 论文(Trinity 和 Conductor),通过强化学习让系统学会自适应地分配角色和协调策略。

中文圈视角

国内用户能用吗? Fugu 通过 OpenAI 兼容 API 提供服务,理论上国内开发者可以通过代理访问。但 Sakana AI 目前未明确中国区的可用性,且模型池中包含的模型(如 GPT-5.5、Gemini 3.1 Pro、Opus 4.8 等)部分在国内无法直接访问,实际体验可能受限。

国产平替对比: 国内类似的多模型编排产品较少。智谱的 GLM 系列支持工具调用和 Agent,但未做到跨模型池自动路由。DeepSeek 的 MoE 架构在单模型内实现专家路由,但非多模型编排。Fugu 的价值在于“一个 API 调用多个模型”,这对需要高可靠性和低供应商风险的团队很有吸引力。

中文场景影响: 对于中文写作、编程、研究等任务,Fugu 的自动路由能力可能提升复杂任务(如长文档分析、多步代码调试)的效率。但中文理解能力取决于池中模型的中文水平,目前基准测试未包含中文数据集,实际效果待验证。

监管盲点: 如果 Fugu 路由到受出口管制的模型(如 Anthropic 的 Fable),国内用户可能面临合规风险。Sakana AI 的 opt-out 功能允许排除特定模型,但 Fugu Ultra 不支持,需注意。

几条值得记住的细节

  • Fugu 和 Fugu Ultra 均通过 OpenAI 兼容 API 调用,无需迁移 SDK,只需修改 base_url 和 api_key。
  • Fugu Ultra 在 SWE-Bench Pro 上得分 73.7%,比 GPT-5.5(58.6%)高 15 个百分点。
  • Fugu 的模型池可替换,支持随时加入新模型,以应对供应商限制或模型更新。
  • 定价按请求计费,每次调用返回 token 用量和费用,便于实时监控。
  • 早期社区反应偏怀疑,主要质疑其是否只是“路由器或包装器”,但基准数据支持其有效性。

一句话总结

Fugu 让多模型协作变得像调用一个模型一样简单,但国内用户需关注可用性和合规风险。