Token导航 LogoToken导航

日本公司发布 Fable 同级新模型:Fugu Ultra

更新时间 2026-06-24来源 AGIHunt正文 2710字阅读约 9分钟12 张图片

刚刚,日本 AI 公司 Sakana AI 发布了 Fugu,一个把多 Agent 编排系统包装成单一模型 API 的产品。

在官方公告中,其号称性能对标 Fable 5 和 Mythos Preview。

图片

不过需要注意的是,这并不是又一个「更大更猛的单体模型」,而是一种完全不同的思路:Sakana 训练的是一个去调度其他模型的模型。

下面是 Sakana 给出的媲美 Fable 和 Mythos 的成绩:

图片
Benchmark
Fugu
Fugu Ultra
Opus 4.8
Gemini 3.1 Pro
GPT 5.5
SWE Bench Pro
59.0
73.7
69.2
54.2
58.6
LiveCodeBench
92.9
93.2
87.8
88.5
85.3
GPQA-D
95.595.5
92.0
94.3
93.6
HLE
47.2
50.0
49.8
44.4
41.4
TerminalBench 2.1
82.1

SWE Bench Pro 上 Fugu Ultra 拿到了 73.7,超过了 Opus 4.8 的 69.2。

GPQA-D(研究生级别科学问答)上达到 95.5,是目前公开可用模型中的最高分。

HLE(Humanity's Last Exam)上拿到了 50.0,略微超过 Opus 4.8 的 49.8。

Sakana 自己说的是:

“ Fugu Ultra 与 Fable 5 和 Mythos Preview 站在同一水平线上。”

01

Fugu 是什么?

Sakana Fugu 本身是一个 LLM,但它并不直接回答你的问题,它的工作是决定让谁来回答

图片

它背后维护着一个 Agent 池,里面包含各种专长不同的模型。

当一个任务进来,Fugu 会动态地决定:调哪个模型、分几步完成、要不要验证结果、要不要递归调用自己。

图片

整个过程对用户来说是无感的,你调的是一个 API,拿到的是一个结果,中间过程发生了什么,你并不需要知道。

Fugu 有两个版本:

Fugu:平衡性能和延迟,适合日常编码、代码审查、交互式场景。

Fugu Ultra:优化答案质量,调用更深层的专家 Agent 池,适合高难度问题。

02

技术原理

这套系统的协调策略没有任何手工设计,全是学出来的

图片

Fugu 的研究基础来自两篇 ICLR 2026 论文:

TRINITY 提出了一个轻量级的「进化协调器」,自适应地给不同任务分配 Thinker(思考者)、Worker(执行者)、Verifier(验证者)三种角色。协调器本身通过进化算法优化,不依赖人工设定规则。

图片

另一篇 Conductor 则通过强化学习训练出一个「指挥家」,让它自己发现最优的 Agent 通信模式和协作策略。

论文的核心发现是:RL 训练出来的协调策略往往是「非直觉但高效」的,人类设计师不太会想到那种分工方式。

图片

Fugu 跟写死的 pipeline 完全不同,它是一个学会了怎么当项目经理的 LLM。它会动态地从模型池中组装团队,并通过非显而易见但高效的协作模式来协调它们,最终完成任务。

03

六个实战案例

Sakana 展示了六个实战案例:

图片

在 AutoResearch(自动化 ML 研究)任务中,Fugu Ultra 自主运行了 123 次实验,拿到了最优的 BPB 得分(0.9774 ± 0.0019),超过所有 frontier 竞争者。

日文古籍识别方面,Fugu 在处理日本历史文献的阅读顺序恢复时达到 NED 0.80,而竞品模型只有 0.24 或直接失败。

不过……这大概和 Sakana 的日本基因有关,其他家估计没空专门去研究日本古籍了。

魔方求解器上,Fugu 生成的代码成功解出了全部 300 个测试魔方,而竞品生成的代码则无法正常运行。并且 Fugu 在 300 个测试案例中,解法步数从未输过(7 胜 293 平 0 负)。

在 CAD 机械设计任务中,Fugu 设计了一个可工作的虹膜机构,其他模型产出的设计则存在间隙或不完整。

其他的,盲棋连续四局对弈中 Fugu 保持着完美的准确率;在股票交易 50 周的回测中 Fugu 实现了 +19.43% 的平均回报,其他 frontier 模型则均低于 15%。

04

价格

目前提供订阅制和按量计费两种方式:

订阅(同时包含 Fugu 和 Fugu Ultra): 

  • Standard:$20/月

  • Pro:$100/月(10 倍 Standard 额度) 

  • Max:$200/月(20 倍 Standard 额度)

2026 年 7 月前订阅可免费获得第二个月。

按量计费(Fugu Ultra,fugu-ultra-20260615):

  • 输入:$5/1M tokens(超过 272K 上下文时 $10) 

  • 输出:$30/1M tokens(超过 272K 上下文时 $45)

  • 缓存输入:$0.50/1M tokens

图片
价格对比

作为对比,Opus 4.8 的价格是 $15 输入 / $75 输出。Fugu Ultra 的输入价格只有 Opus 的三分之一,输出价格不到一半。

Fugu 兼容 OpenAI 的 API 格式,不需要独家 SDK,你直接改个 endpoint 就可以使用了。

05

无出口管制风险

或许是为了讽刺 A 社,Sakana 在发布中反复强调一个点是:frontier capability without the risk of export controls

没有出口管制风险。

随着 AI 监管收紧,依赖单一供应商的风险越来越大。如果某天因为政策或法规限制,某个 frontier 模型在你所在的地区不可用了怎么办?

图片
一个模型挂了?没关系

Fugu 的编排架构天然具有弹性,它可以在底层切换不同的模型。虽然性能可能会有所下降,但不大会从 frontier 直接掉到不可用。

图片

开发者 Chris 在使用后表示:

“ 如果是一个干净的单次 prompt,你大概还是会直接用 Fable 5 或 Mythos。但任务越复杂、越混乱——涉及分工、验证、综合、代码审查、研究循环、安全评估——这种编排系统就越有意义。”

图片

甚至,已经有人火速开源了一个用 TypeScript 实现的简化版 Fugu runtime,用 DSPy 风格的 Agent 框架复刻了 Conductor 的核心模式:指挥、分工、上下文传递、验证和综合。

06

可用性

Fugu 目前全球可用,但欧盟/欧洲经济区暂不支持(GDPR 合规还在进行中)。

用户可以在 Fugu 版本中选择退出特定的底层模型,但 Fugu Ultra 的 Agent 池是固定的,不支持自定义。

数据使用方面,用户数据默认用于性能改进,但可以随时在控制台中关闭。

不过,至于具体使用了哪些底层模型,Sakana 表示,路由信息属于专有技术,不便对外公开……

◇ ◆ ◇

产品页面:https://sakana.ai/fugu/

技术博客:https://sakana.ai/fugu-release/

注册使用:https://console.sakana.ai/login

推文:https://x.com/SakanaAILabs/status/2068861630327443966

文章标签模型发布
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多