

Sakana Fugu 是日本 Sakana AI 于 2026 年 6 月推出的一款编排模型(orchestration model):它提供一个兼容 OpenAI 的 API,可将任务路由至 GPT-5.5、Gemini 和 Claude Opus 4.8。尽管它在编程基准测试中取得了前沿分数,但它本质上是一个路由器,而非单一模型,并且在最难的基准测试中落后于 Fable 5。
Sakana Fugu 并非单一的大型语言模型,尽管它的基准测试方式与单一模型无异,并被定位为 Anthropic 的 Fable 5 的竞争对手。它是一个编排模型:一个经过学习的协调器,通过一个兼容 OpenAI 的 API 接收您的请求,并将其路由至现有的前沿模型池(目前包括 GPT-5.5、Gemini 3.5 Flash 和 Claude Opus 4.8),然后将它们的工作成果合并为一个统一的答案。该模型于 2026 年 6 月 22 日由 Sakana AI 推出,这是一家位于东京的实验室,由 David Ha 和原始 Transformer 论文作者之一的 Llion Jones 共同创立。
Fugu 建立在 Sakana 的两篇 ICLR 2026 论文基础之上:Trinity(一个约 0.6B 参数的小型进化协调器)和 Conductor(一个约 7B 参数的强化学习模型,能够发现协调策略并递归调用自身实例)。它在一个端点后提供两种变体:Fugu(专为速度优化,并能为满足合规性要求而选择退出特定提供商)和 Fugu Ultra(专为在复杂的多步任务中实现最高准确率而优化)。此次发布恰逢美国出口管制导致全球大部分地区无法访问 Fable 5 和 Mythos Preview 的十天后,Sakana 的定位非常明确:无需依赖单一供应商或司法管辖区,即可获得前沿级别的结果。本评测将客观剖析 Fugu 真正擅长的领域,以及其宣传中站不住脚的部分。
Sakana Fugu 概览(2026 年 6 月)
用 Sakana 自己的话来说,Fugu“本身就是一个 LLM,经过训练可以调用代理池中的各种 LLM,包括递归调用自身实例”。您向 console.sakana.ai 上的兼容 OpenAI 的端点发送提示词,协调器会决定池中哪个专家应处理每个步骤,在不同轮次中分配 Thinker、Worker 或 Verifier 角色,最后返回一个合并的响应。其背后有一份发布在 arXiv 上的技术报告 (2606.21228),这比大多数产品发布提供了更高的透明度。
目前提供两种变体。Fugu 是兼顾速度与成本的默认选项,允许您排除特定的提供商,这在您的合规规则禁止使用某家供应商时非常有用。Fugu Ultra(模型 ID fugu-ultra-20260615)使用固定模型池,专为准确率而优化。Sakana 列举了涵盖自动化研究、古典日语阅读顺序预测、魔方求解器、CAD 机械光圈设计、盲棋以及股票交易决策等案例研究。发布时的一个实际限制是:Fugu 在全球范围内可用,但欧盟 (EU) 和欧洲经济区 (EEA) 除外,截至 2026 年 6 月 22 日,其 GDPR 合规性仍在审核中。
Sakana Fugu 真正擅长的领域
这里最强大的理念是通过单一接口实现提供商独立性。您无需将技术栈硬编码到单一模型,也无需在该模型发生变化或不可用时重写提示词,只需调用 Fugu 并让协调器进行选择。对于因 6 月 12 日出口管制而在一夜之间无法访问 Fable 5 和 Mythos 的组织而言,这种弹性的宣传既真实又及时。首席执行官 David Ha 直接指出了这一点:
“在关键基础设施、金融或治理方面依赖单一公司的 API 是一个重大的脆弱性。这种风险不再是假设的可能性,而是现实。”(David Ha,Sakana AI 首席执行官,2026 年 6 月)
从原始数据来看,Fugu Ultra 确实在部分测试套件中取得了前沿级别的分数。它在 LiveCodeBench (93.2) 上领先,在 GPQA-Diamond (95.5) 上略占优势,并且 Sakana 报告称其在多项编程基准测试中的得分超过了 Opus 4.8、GPT-5.5 和 Gemini 3.1 Pro。这种递归的、基于角色的编排是来自一家可靠实验室的真正新颖的工作,而 arXiv 报告使该方法具有可检查性,而不再是一个黑盒。
与 Fable 5 的比较:基准测试的真实情况
Sakana 表示,“在业界最严格的工程、科学和推理基准测试中,Fugu Ultra 与 Fable 5 和 Mythos Preview 等领先模型并驾齐驱。”这一说法是真实的,但有三个因素削弱了它的说服力,而且这些因素很重要。
首先,Fable 5 和 Mythos 并不在 Fugu 的模型池中。它们受到出口管制,因此 Fugu 无法访问它们,并且该比较使用的是 Anthropic 自己公布的数据,而不是受控的正面交锋测试。其次,目前还没有独立的第三方复现这些结果。第三,一旦你跳出编程领域的胜利,就会发现这些数据其实喜忧参半。
| 基准测试 (Benchmark) | Fugu Ultra | Fable 5 / Mythos | 优势方 (Edge) |
|---|---|---|---|
| LiveCodeBench | 93.2 | 89.8 (Fable 5) | Fugu 领先 3.4 |
| GPQA-Diamond | 95.5 | 94.1 (Mythos) | Fugu 领先 1.4 |
| SWE-Bench Pro | 73.7 | 80.0 (Fable 5) | Anthropic 领先 6.3 |
| TerminalBench 2.1 | 82.1 | 88.0 (Mythos) | Anthropic 领先 5.9 |
| Humanity's Last Exam | 50.0 | 53.3 (Fable 5) | Anthropic 领先 3.3 |
客观的解读是:Fugu Ultra 在 LiveCodeBench 和 GPQA-Diamond 上获胜,但在要求最高的测试(SWE-Bench Pro、TerminalBench 和 Humanity's Last Exam)中落后。“与 Fable 5 媲美”只是在少数基准测试中的选择性对等,而非全面等效,并且这是提供商报告的数据,而非经过独立验证。请将标题视为营销手段,将表格视为现实。
Sakana Fugu 的不足之处:用户报告的故障模式
早期的上手反馈大多持怀疑态度,主要集中在三个问题上:速度、成本,以及编排是否增加了足够的价值来证明这一层的合理性。在 Hacker News 上:
“每月支付 $200,你每周的使用时间不到 3 小时,API 极其缓慢,而且在我的测试中,输出质量远不及 Fable。”(cortesi,Hacker News,2026 年 6 月)
最常见的结构性批评是,Fugu 是建立在您已经付费的模型之上的付费路由器,这意味着您可能需要向三家提供商以及 Sakana 支付费用来协调它们。一位评论者直言不讳地总结了这种情绪:
“除非另有证明,否则这只是一个高度先进的路由器或包装器,而不是像 Mythos 或 Fable 那样在智能上的根本性飞跃。”(GreedyWorking1499,Reddit,2026 年 6 月)
还有两个需要权衡的注意事项。供应商独立性的宣传在某种程度上是空洞的,因为 Fugu 仍然通过受美国控制的前沿模型(Opus、GPT、Gemini)进行路由,因此它只是减少了对单一供应商的依赖,而不是消除了地缘政治风险。此外,Sakana 还存在信誉阴影:其 2025 年的“AI CUDA Engineer”声称实现了大幅内核加速,但很快被查出是利用了评估沙盒的漏洞,这就是为什么部分社区在信任 Fugu 的头条数据之前希望得到独立验证。再加上在欧盟不可用以及缓慢的 API,这是一个需要仔细评估而非盲目采用的发布。
Sakana Fugu 与单一前沿模型的对比
理解 Fugu 最清晰的方式是,它是一个决定如何使用多个模型选项的系统,而 Claude(Opus 和 Fable)、ChatGPT (GPT-5.5) 和 Google Gemini 则是具有明确身份的单一模型选项。这种差异是一把双刃剑。在不同模型各有所长的复杂多步工作中,路由可以提升结果,并且它为您提供了一个需要维护的端点,而不是三个集成。但它也增加了延迟,增加了一层成本,并降低了对实际生成输出的模型的可见性,而这对于可重复性、调试和合规性至关重要。
因此,Fugu 并不是 Fable 5 的一对一替代品。如果您需要一个已知的、具有稳定身份的优质模型,并且在最难的代理编程基准测试中获得最高分,单一前沿模型仍然胜出。如果您希望获得与提供商无关的访问权限,并愿意为此牺牲一些控制权和速度,那么 Fugu 是一个更有趣的选择。尽管基准测试的框架将它们放在了对立面,但两者解决的是不同的问题。
Sakana Fugu 定价
访问方式包括订阅或按量付费(代币)。订阅分为 Standard(每月 $20)、Pro(每月 $100,约 Standard 额度的 10 倍)和 Max(每月 $200,约 Standard 额度的 30 倍)。Fugu Ultra 的按量付费价格为每百万输入代币 $5,每百万输出代币 $30;对于超过 272K 的上下文,价格分别升至 $10 和 $45;缓存输入为每百万代币 $0.50。对于在 2026 年 7 月 31 日之前开始的订阅,Sakana 提供第二个月免费的优惠。请注意,代币成本反映了编排开销,因为单个请求可能会分散到多个底层模型中,因此在多步任务中,实际支出可能会高于标价所示的费率。
谁应该使用 Sakana Fugu,谁应该观望
如果您是希望跨前沿模型使用单一且与提供商无关的 API 的开发人员或平台团队,或者是在 6 月 12 日限制措施后担心供应商锁定或出口管制风险的组织,亦或是从事复杂的多步编程和研究工作、且跨专家路由能带来帮助的团队,那么 Fugu 值得认真考虑。如果您已经基于该接口进行开发,兼容 OpenAI 的端点将使试用变得非常顺畅。
如果您需要一个经过验证的单一模型,具有稳定的身份并在代理编程基准测试中获得高分(Fable 5 或 Opus 4.8 仍处于领先地位),如果您对成本或延迟敏感,如果您位于尚未提供该服务的欧盟地区,或者如果您希望获得经过独立验证的前沿推理能力,而不是全新产品提供商的自述声明,请观望或寻找其他选择。Fugu 是 2026 年中期真正新颖的发布之一,但它在实际应用中尚未得到证实,如今明智的做法是在您自己的工作负载上对其进行测试,而不是盲目相信对标 Fable 5 的宣传噱头。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 Sakana Fugu 相关的指南和文章。

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

The Personal AI Productivity Stack (2026): One Tool Per Job, Nothing Extra

DeepSeek V4 Pro vs Claude Opus 4.7: 5-PR Refactor Test (2026)

What People Are Building With Claude Fable 5 (And Which Viral Demos Are Fake)

Claude Code vs Cursor vs Codex vs Devin vs Replit Agent 3: 2026 Scorecard
