多模型协作的范式之争——FUMO Fusion、Sakana Fugu与OpenRouter Fusion深度技术报告
核心摘要
- 从堆参数到拼编排,多模型协作成新主线
- FUMO动态采购证据,长程任务成本省三至四成
- 河豚指挥家调度众模型,SWE-Bench刷新纪录
- 并行评审广撒网,预算面板逼近Fable级
多模型协作的范式之争——FUMO Fusion、Sakana Fugu与OpenRouter Fusion深度技术报告
2026年,大模型行业正式从"单体参数竞赛"转向"多模型协作效率"的比拼。FUMO Lab、Sakana AI与OpenRouter相继发布了三种截然不同的多模型协作方案。本报告深入剖析FUMO Fusion的"动态证据采购"、Sakana Fugu的"任务分解调度"及OpenRouter Fusion的"并行答案合成"三种范式的核心机制、适用场景,并探讨其在真实系统中"三位一体"的组合价值与未来架构演进趋势。
- 从堆参数到拼编排,多模型协作成新主线
- FUMO动态采购证据,长程任务成本省三至四成
- 河豚指挥家调度众模型,SWE-Bench刷新纪录
- 并行评审广撒网,预算面板逼近Fable级
一、引言:从"堆参数"到"拼编排"的范式转移
当单体模型的参数规模遭遇算力墙与数据墙,多智能体协作成为提升智能上限的唯一解。然而,"如何协作"却衍生出不同的技术哲学。
2026年6月至9月,三股力量在短短一个季度内密集落地,构成了这一范式转移的完整时间线:
- 2026年6月12日至13日:OpenRouter 率先发布 Fusion API,用"多模型并行 + 裁判聚合"在深度研究基准上逼近顶级单体模型,以半数成本冲击 Fable 级智能。
- 2026年6月22日:东京的日本最速 AI 独角兽 Sakana AI 发布 Fugu 调度系统,以一个约70亿参数的训练协调器模型,通过单一 API 调动市场上多款顶级模型协同作战。
- 2026年9月1日:新加坡前沿模型实验室 FUMO Lab 正式发布其融合模型产品 Fusion Max 与 Fusion Code,将推理视为随任务状态持续演进的"证据采购"过程,并同期公开白皮书《Fusion: Allocating Intelligence Across Heterogeneous Models》(跨异构模型的智能分配)。
三者虽共享"多模型"标签,但其底层架构、决策时点与成本哲学存在根本分野:
- FUMO Fusion(新加坡前沿模型实验室,2026.09.01发布):提出"智能分配问题",将推理视为持续的证据采购,围绕不确定性组织每一轮计算。
- Sakana Fugu(日本AI独角兽,2026.06.22发布):提出"编排即模型",把任务分解、选角、验证、合成全部内化为一个经过强化学习训练的轻量级指挥家。
- OpenRouter Fusion(聚合平台,2026.06.12发布):推出"API化评审",通过并行生成与交叉验证合成答案,用面板多样性规避单一模型的盲区。
二、三大核心范式深度剖析
2.1 FUMO Fusion:动态证据采购(Dynamic Evidence Procurement)
核心机制:FUMO 摒弃了"一次性路由"的静态思维,构建了一个闭环的"证据获取循环"。其白皮书将这一循环提炼为四条操作:读取状态(Read State)→ 获取证据(Buy Evidence)→ 更新状态(Update)→ 提交或停止(Submit or Stop)。系统在每一步都围绕一个中心问题组织计算:当前还剩什么不确定性?什么证据能改变答案?谁最适合获取证据?这一次计算的期望价值是否大于其成本?换言之,FUMO 不再问"哪个模型能直接答对这个问题",而是问"继续投入哪类计算能让任务状态以最低成本逼近可靠结论"。
工作方式:"一份状态,多种视角,一次提交"。多个模型共享统一的任务状态,探索与批判并行——可以有多个模型共同提出建议、补充证据,但只有唯一权威路径能够执行对外行动。工具调用仅作为建议呈现,证据必须保留适用范围与来源归属,最终决策权始终保持单一,从根上杜绝了多模型分叉带来的状态错乱。当现有证据已足以支撑可靠结论时,系统会及时停止计算。
产品形态:FUMO 发布了两款产品——Fusion Max 面向通用复杂任务,Fusion Code 面向软件工程与代码 Agent 场景,目前开放邀请制试用。
优化目标:智能分配(质量与成本的最优平衡)。官方宣称,相比单模型长程任务,完整任务成本可节约 30%-40%,并称使相关产品处于"性能—成本"的 Pareto 前沿。
2.2 Sakana Fugu:任务分解调度(Task Decomposition Routing)
核心机制:Fugu 本身是一个经大规模监督微调与进化算法(sep-CMA-ES)筛选、并通过强化学习(GRPO)训练的精巧语言模型,参数规模约 70 亿。它把"当个路由脚本"直接变成了"训练一个会协调的模型"——其两项底层技术 TRINITY 与 The Conductor 均被 ICLR 2026 收录:TRINITY 让模型在思考者(Thinker)、执行者(Worker)、验证者(Verifier)三种角色间动态分配任务;Conductor 则用强化学习让模型自行摸索出自然语言层面的协调策略,而非由人工写死路由规则。开发者在请求入口处只需面对一个与 OpenAI 兼容的 API,模型选择、任务分派、结果验证、回应合成全部在内部完成。
工作方式:先分解,后执行,且可递归。Fugu 解析任务后将其拆解为子问题;更擅长逐任务动态路由:判断问题难度,将每个子问题路由给池中 1 至 3 个最适合的专家模型(如 Claude Opus 4.8、GPT-5.5、Gemini 3.1 Pro 以及 Fugu 自身),并行或串行执行;随后引入验证节点交叉审计,最后由 Fugu 将各方输出缝合为单一答案。关键的递归设计在于——当一个子任务过于复杂时,Fugu 可以调用 Fugu 自身继续分解,形成一棵动态展开的任务树,而非一张写死的静态计算图。这也意味着它的"规划"是学习出来的自适应编排,而非固定剧本。
产品形态:标准版 Fugu 主打低延迟,适合日常编程、代码审查与聊天服务;Fugu Ultra 动用更深的代理池,面向研究复现、安全分析等长链条、多步骤复杂任务。
优化目标:极致质量。通过"让最对的专家做最对的事"来逼近乃至比肩单一前沿模型——Sakana 报告 Fugu Ultra 在 SWE-Bench Pro 达 73.7 分,领先 Claude Opus 4.8(69.2)与 GPT-5.5(58.6),并在 TerminalBench、LiveCodeBench、GPQA-Diamond 等测试上达到前沿水平。
需要说明的是,以上分数由 Sakana 自行公布,竞品分数采用各家自报数值,尚未经第三方独立复现;且 Fugu 是"调度系统",其成绩本质是池中多个模型能力合成后的"模型的模型"分数,与单一模型不能直接画等号。
2.3 OpenRouter Fusion:并行答案合成(Parallel Answer Synthesis)
核心机制:"广撒网,再评审"。将同一提示词并行发送给 1 至 8 个面板模型(Panel Models),每个模型独立调用 Web 搜索与抓取工具完成研究,最后由一个裁判模型(Judge Model)阅读全部响应,输出结构化分析——共识点(consensus)、矛盾点(contradictions)、部分覆盖(partial coverage)、独到见解(unique insights)与盲区(blind spots),再由调用方模型基于这份分析写出最终答案。整个管线在服务端执行,开发者只需指定 openrouter/fusion 一个模型标识,或通过 plugin 自定义面板与裁判组合。
工作方式:OpenRouter 将 Fusion 包装为三种形态——模型别名(openrouter/fusion)、服务端工具(server tool,可被主模型自主决定是否调用)、插件配置(plugin)。官方数据显示,Fusion 增益的约四分之三来自裁判的合成环节本身,仅约四分之一来自模型多样性——即便用同一个模型跑两次,"自我融合"也能带来显著提升。
优化目标:规避盲区。适合犯错成本极高、需要多视角校验的研判场景。官方明确提示:当"犯错成本远高于多花几次推理成本"时使用;不建议用于高频实时对话或长时间连续编码——因需等待多模型并行与融合,响应时间通常是标准调用的 2-3 倍。
三、核心机制对比
| 维度 | FUMO Fusion | Sakana Fugu | OpenRouter Fusion |
|---|---|---|---|
| 决策时点 | 贯穿全流程(每步动态评估证据与成本) | 任务开始时分出计算图,执行中按难度动态选角、可递归 | 任务开始时(并行分发,一次定稿) |
| 状态管理 | 强统一(单一份共享状态,唯一权威路径) | 统一规划(由指挥家上下文管理,可递归拆解) | 完全独立(面板间无状态共享) |
| 成本哲学 | 显式纳入循环(每次调用衡量 ROI,及时止损) | 较少考量(优先保障答案上限,隐藏级联调用) | 事后考量(用高成本换高可信度) |
| 角色隐喻 | 项目经理(动态判断下一步该找谁干活) | 总包工头/导演(写好分工剧本并监工验收) | 评审委员会(独立研究后投票表决) |
四、性能基准速览
三家分别公布了面向自身定位的基准数据。由于评测口径与任务集各不相同,横向直接比较意义有限,这里仅作并列呈现与解读:
| 来源 | 基准 / 场景 | 关键数字 |
|---|---|---|
| Sakana Fugu | SWE-Bench Pro | Fugu Ultra 73.7,领先 Opus 4.8(69.2)与 GPT-5.5(58.6);未列入比较池的 Fable 5 为 80.0(第三方引用) |
| Sakana Fugu | TerminalBench / LiveCodeBench / GPQA-Diamond | 官方称达到前沿水平(厂商自报,未独立复现) |
| OpenRouter Fusion | DRACO(深度研究,100 任务×10 领域) | Fable 5+GPT-5.5 融合 69.0% > Fable 5 单模 65.3%;预算面板 64.7% 距 Fable 5 不足 1%,成本约一半 |
| OpenRouter Fusion | DRACO 自我融合 | Opus 4.8 双跑自融 65.5% vs 单模 58.8%,+6.7 分,证明合成环节本身价值 |
| FUMO Fusion | GPQA Diamond / τ³-Banking / Terminal-Bench v2.1 | 官方称超越现有顶级模型,处于性能—成本 Pareto 前沿,任务成本降 30%-40% |
五、适用场景图谱
三种范式各有所长,开发者应依据任务特征进行选型:
FUMO Fusion 最佳实践:适合深度推理、长程 Agent、生产级代码运维。当任务路径充满不确定性(如开放式研究、故障根因分析),且对 Token 成本敏感时,FUMO 的动态裁剪能力极具优势——它把"是否继续计算"本身纳入决策,能在信息不足时持续采购证据、在证据充分时及时止损,天然适合成本意识强的生产环境。
Sakana Fugu 最佳实践:适合结构清晰但高难度的复杂任务。如论文复现、专利检索、安全分析、大规模代码库迁移。其学习型编排与验证节点设计,在任务目标明确、可分可验的场景下能把"最对的专家"组装成一条高质量流水线;Fugu Ultra 在推向极限质量的长链条任务中价值最大。
OpenRouter Fusion 最佳实践:适合高 Stakes 的研判决策。如企业架构取舍、安全风险评估、反方观点生成。官方建议"当犯错成本远高于多花几次推理成本时使用",适用于金融研究、尽调、医疗信息综合、法律与技术的结构化总结等"错了要命"的场景;其面板与裁判均可自定义,也适合团队自行搭建评测与代理管线。
六、协同价值与组合架构
三者并非互斥,在实际生产环境中具有极高的组合价值。本报告提出"三层协作架构"理论:
- 顶层调度(Sakana Fugu):在接到史诗级任务(如"重构整个微服务系统")时,先用 Fugu 进行顶层任务分解,划分出"需求分析"、"代码生成"、"安全审查"等子模块,并为每个模块指派最合适的执行模型。
- 中层执行(FUMO Fusion):将"代码生成"等动态性强的子任务交给 FUMO。FUMO 在编写具体代码时,遇到不确定的第三方库调用,会动态决策是否联网检索或执行测试,围绕不断变化的任务状态持续采购证据,确保持续演进并控制成本。
- 底层校验(OpenRouter Fusion):在关键决策节点(如最终方案合并前),将 FUMO 产出的草案交由 OpenRouter Fusion,调用多个顶尖模型进行对抗性评审,识别出单一模型难以发现的逻辑漏洞与盲区。
已有实践信号:这一组合并非空想。Sakana Fugu Ultra 在实际发布后即同步上线 OpenRouter 平台,开发者可以在同一个聚合入口中同时触达"调度层"与"合成层"能力——"调度层 + 合成层"的商业融合已然发生。同时,开发者社区已在编码 Agent 中探索"用 Fusion 做方案设计,用 FUMO 做动态 Debug"的混用模式,印证了三种范式在真实系统里交叉赋能的可行性。
七、客观性提示:厂商自报数字与未复现风险
在拥抱这一范式转移的同时,本报告特别提示读者注意以下风险点,避免被营销话术牵引:
- 基准数字均来自发布方:Sakana 与 FUMO 的领先数字均由厂商自行发布,竞品分数亦多为各家自报,尚未见第三方独立复现。读"第一"、"刷新纪录"时应保持审慎。
- 口径差异:Fugu 是"调度系统",其得分可能来自调用多个前沿模型再合成,本质是组合后的结果,与单体模型不可直接对比;Fable 5 等最强模型因出口管制停止公开访问而未进入比较池,使"领先"的含金量需要打折看待。
- 成本与延迟的隐藏面:无论是 Fugu 的隐藏级联调用,还是 Fusion 的多模型并行,单次请求的 token 消耗与墙钟延迟都会显著放大。真正值得比较的指标是"每美元 / 每秒钟的准确率",而不是裸分数。
- 评测盲区:DRACO 等主流评测基本不覆盖长时程任务,而长程推理恰是单体顶尖模型的传统强项,也是评测尚未充分反映的领域。
八、行业启示与未来展望
三种范式的集体爆发,揭示了 AI 竞争的深层趋势:
边际价值重构:多模型协作范式的共同实验指向一个反直觉的结论——"强模型未必是好批评者,小模型在特定校验上的边际价值更高",若干预算面板在特定任务上逼近乃至反超单体旗舰,正在瓦解"唯参数论"的迷信。融合提升的边际收益递减规律也表明:系统组织的价值,正在逐步追上单纯堆算力的价值。
地缘韧性:Sakana 强调,当企业依赖单一模型供应商时风险极高——2026 年 6 月美国出口管制令曾让 Anthropic 最强的 Fable 5、Mythos 系列一夜之间撤出公众访问。可插拔的多模型池提供了系统级韧性:模型可以被递补、被替换,而稳定的 API 接口作为不变量留存。
中间层护城河:OpenRouter 证明,当单一模型可被绕过时,跨厂商的无缝协同体验将成为聚合平台的坚实地基。谁控制了编排层、评审层与生态入口,谁就在单模型之争之外开辟了第二战场。
结语:没有任何一种范式是万能解。FUMO 的动态性、Fugu 的规划性与 Fusion 的评审性,恰好构成了 AI 系统"计划-执行-检查"的完整闭环。下一代 AI 的基础架构,将不再是单一超级大脑,而是由这三种范式协同编织的、具备动态分配能力的分布式多智能体联邦。对于开发者和企业而言,理解这三者的本质分野,并构建能够混搭它们的中间件,将成为2026年下半场保持技术领先的核心能力。
本文作者为金融行业风险管理从业者。文中基准数据均来自发布方公开材料,仅作技术科普与信息整理,不构成任何投资或选型建议。