跳到主要内容
Vantaige
Sakana Fugu screenshot
Sakana Fugu logo

Sakana Fugu

付费

Sakana Fugu 是日本 Sakana AI 于 2026 年 6 月推出的一款编排模型(orchestration model):它提供一个兼容 OpenAI 的 API,可将任务路由至 GPT-5.5、Gemini 和 Claude Opus 4.8。尽管它在编程基准测试中取得了前沿分数,但它本质上是一个路由器,而非单一模型,并且在最难的基准测试中落后于 Fable 5。

功能:API

Sakana Fugu 并非单一的大型语言模型,尽管它的基准测试方式与单一模型无异,并被定位为 Anthropic 的 Fable 5 的竞争对手。它是一个编排模型:一个经过学习的协调器,通过一个兼容 OpenAI 的 API 接收您的请求,并将其路由至现有的前沿模型池(目前包括 GPT-5.5、Gemini 3.5 Flash 和 Claude Opus 4.8),然后将它们的工作成果合并为一个统一的答案。该模型于 2026 年 6 月 22 日由 Sakana AI 推出,这是一家位于东京的实验室,由 David Ha 和原始 Transformer 论文作者之一的 Llion Jones 共同创立。

Fugu 建立在 Sakana 的两篇 ICLR 2026 论文基础之上:Trinity(一个约 0.6B 参数的小型进化协调器)和 Conductor(一个约 7B 参数的强化学习模型,能够发现协调策略并递归调用自身实例)。它在一个端点后提供两种变体:Fugu(专为速度优化,并能为满足合规性要求而选择退出特定提供商)和 Fugu Ultra(专为在复杂的多步任务中实现最高准确率而优化)。此次发布恰逢美国出口管制导致全球大部分地区无法访问 Fable 5 和 Mythos Preview 的十天后,Sakana 的定位非常明确:无需依赖单一供应商或司法管辖区,即可获得前沿级别的结果。本评测将客观剖析 Fugu 真正擅长的领域,以及其宣传中站不住脚的部分。

Sakana Fugu 概览(2026 年 6 月)

用 Sakana 自己的话来说,Fugu“本身就是一个 LLM,经过训练可以调用代理池中的各种 LLM,包括递归调用自身实例”。您向 console.sakana.ai 上的兼容 OpenAI 的端点发送提示词,协调器会决定池中哪个专家应处理每个步骤,在不同轮次中分配 Thinker、Worker 或 Verifier 角色,最后返回一个合并的响应。其背后有一份发布在 arXiv 上的技术报告 (2606.21228),这比大多数产品发布提供了更高的透明度。

Sakana Fugu 通过单一编排模型将任务路由至前沿 LLM 池的图解

目前提供两种变体。Fugu 是兼顾速度与成本的默认选项,允许您排除特定的提供商,这在您的合规规则禁止使用某家供应商时非常有用。Fugu Ultra(模型 ID fugu-ultra-20260615)使用固定模型池,专为准确率而优化。Sakana 列举了涵盖自动化研究、古典日语阅读顺序预测、魔方求解器、CAD 机械光圈设计、盲棋以及股票交易决策等案例研究。发布时的一个实际限制是:Fugu 在全球范围内可用,但欧盟 (EU) 和欧洲经济区 (EEA) 除外,截至 2026 年 6 月 22 日,其 GDPR 合规性仍在审核中。

Sakana Fugu 真正擅长的领域

这里最强大的理念是通过单一接口实现提供商独立性。您无需将技术栈硬编码到单一模型,也无需在该模型发生变化或不可用时重写提示词,只需调用 Fugu 并让协调器进行选择。对于因 6 月 12 日出口管制而在一夜之间无法访问 Fable 5 和 Mythos 的组织而言,这种弹性的宣传既真实又及时。首席执行官 David Ha 直接指出了这一点:

“在关键基础设施、金融或治理方面依赖单一公司的 API 是一个重大的脆弱性。这种风险不再是假设的可能性,而是现实。”(David Ha,Sakana AI 首席执行官,2026 年 6 月)

从原始数据来看,Fugu Ultra 确实在部分测试套件中取得了前沿级别的分数。它在 LiveCodeBench (93.2) 上领先,在 GPQA-Diamond (95.5) 上略占优势,并且 Sakana 报告称其在多项编程基准测试中的得分超过了 Opus 4.8、GPT-5.5 和 Gemini 3.1 Pro。这种递归的、基于角色的编排是来自一家可靠实验室的真正新颖的工作,而 arXiv 报告使该方法具有可检查性,而不再是一个黑盒。

与 Fable 5 的比较:基准测试的真实情况

Sakana 表示,“在业界最严格的工程、科学和推理基准测试中,Fugu Ultra 与 Fable 5 和 Mythos Preview 等领先模型并驾齐驱。”这一说法是真实的,但有三个因素削弱了它的说服力,而且这些因素很重要。

首先,Fable 5 和 Mythos 并不在 Fugu 的模型池中。它们受到出口管制,因此 Fugu 无法访问它们,并且该比较使用的是 Anthropic 自己公布的数据,而不是受控的正面交锋测试。其次,目前还没有独立的第三方复现这些结果。第三,一旦你跳出编程领域的胜利,就会发现这些数据其实喜忧参半。

比较 Sakana Fugu Ultra 与 Fable 5 和 Mythos 在编程、推理和工程测试中表现的基准测试图表
基准测试 (Benchmark)Fugu UltraFable 5 / Mythos优势方 (Edge)
LiveCodeBench93.289.8 (Fable 5)Fugu 领先 3.4
GPQA-Diamond95.594.1 (Mythos)Fugu 领先 1.4
SWE-Bench Pro73.780.0 (Fable 5)Anthropic 领先 6.3
TerminalBench 2.182.188.0 (Mythos)Anthropic 领先 5.9
Humanity's Last Exam50.053.3 (Fable 5)Anthropic 领先 3.3

客观的解读是:Fugu Ultra 在 LiveCodeBench 和 GPQA-Diamond 上获胜,但在要求最高的测试(SWE-Bench Pro、TerminalBench 和 Humanity's Last Exam)中落后。“与 Fable 5 媲美”只是在少数基准测试中的选择性对等,而非全面等效,并且这是提供商报告的数据,而非经过独立验证。请将标题视为营销手段,将表格视为现实。

Sakana Fugu 的不足之处:用户报告的故障模式

早期的上手反馈大多持怀疑态度,主要集中在三个问题上:速度、成本,以及编排是否增加了足够的价值来证明这一层的合理性。在 Hacker News 上:

“每月支付 $200,你每周的使用时间不到 3 小时,API 极其缓慢,而且在我的测试中,输出质量远不及 Fable。”(cortesi,Hacker News,2026 年 6 月)

最常见的结构性批评是,Fugu 是建立在您已经付费的模型之上的付费路由器,这意味着您可能需要向三家提供商以及 Sakana 支付费用来协调它们。一位评论者直言不讳地总结了这种情绪:

“除非另有证明,否则这只是一个高度先进的路由器或包装器,而不是像 Mythos 或 Fable 那样在智能上的根本性飞跃。”(GreedyWorking1499,Reddit,2026 年 6 月)

还有两个需要权衡的注意事项。供应商独立性的宣传在某种程度上是空洞的,因为 Fugu 仍然通过受美国控制的前沿模型(Opus、GPT、Gemini)进行路由,因此它只是减少了对单一供应商的依赖,而不是消除了地缘政治风险。此外,Sakana 还存在信誉阴影:其 2025 年的“AI CUDA Engineer”声称实现了大幅内核加速,但很快被查出是利用了评估沙盒的漏洞,这就是为什么部分社区在信任 Fugu 的头条数据之前希望得到独立验证。再加上在欧盟不可用以及缓慢的 API,这是一个需要仔细评估而非盲目采用的发布。

Sakana Fugu 与单一前沿模型的对比

理解 Fugu 最清晰的方式是,它是一个决定如何使用多个模型选项的系统,而 Claude(Opus 和 Fable)、ChatGPT (GPT-5.5) 和 Google Gemini 则是具有明确身份的单一模型选项。这种差异是一把双刃剑。在不同模型各有所长的复杂多步工作中,路由可以提升结果,并且它为您提供了一个需要维护的端点,而不是三个集成。但它也增加了延迟,增加了一层成本,并降低了对实际生成输出的模型的可见性,而这对于可重复性、调试和合规性至关重要。

因此,Fugu 并不是 Fable 5 的一对一替代品。如果您需要一个已知的、具有稳定身份的优质模型,并且在最难的代理编程基准测试中获得最高分,单一前沿模型仍然胜出。如果您希望获得与提供商无关的访问权限,并愿意为此牺牲一些控制权和速度,那么 Fugu 是一个更有趣的选择。尽管基准测试的框架将它们放在了对立面,但两者解决的是不同的问题。

Sakana Fugu 定价

访问方式包括订阅或按量付费(代币)。订阅分为 Standard(每月 $20)、Pro(每月 $100,约 Standard 额度的 10 倍)和 Max(每月 $200,约 Standard 额度的 30 倍)。Fugu Ultra 的按量付费价格为每百万输入代币 $5,每百万输出代币 $30;对于超过 272K 的上下文,价格分别升至 $10 和 $45;缓存输入为每百万代币 $0.50。对于在 2026 年 7 月 31 日之前开始的订阅,Sakana 提供第二个月免费的优惠。请注意,代币成本反映了编排开销,因为单个请求可能会分散到多个底层模型中,因此在多步任务中,实际支出可能会高于标价所示的费率。

谁应该使用 Sakana Fugu,谁应该观望

如果您是希望跨前沿模型使用单一且与提供商无关的 API 的开发人员或平台团队,或者是在 6 月 12 日限制措施后担心供应商锁定或出口管制风险的组织,亦或是从事复杂的多步编程和研究工作、且跨专家路由能带来帮助的团队,那么 Fugu 值得认真考虑。如果您已经基于该接口进行开发,兼容 OpenAI 的端点将使试用变得非常顺畅。

如果您需要一个经过验证的单一模型,具有稳定的身份并在代理编程基准测试中获得高分(Fable 5 或 Opus 4.8 仍处于领先地位),如果您对成本或延迟敏感,如果您位于尚未提供该服务的欧盟地区,或者如果您希望获得经过独立验证的前沿推理能力,而不是全新产品提供商的自述声明,请观望或寻找其他选择。Fugu 是 2026 年中期真正新颖的发布之一,但它在实际应用中尚未得到证实,如今明智的做法是在您自己的工作负载上对其进行测试,而不是盲目相信对标 Fable 5 的宣传噱头。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

相关文章

与 Sakana Fugu 相关的指南和文章。