多模型协作的范式之争——FUMO Fusion、Sakana Fugu与OpenRouter Fusion深度技术报告

核心摘要

  • 从堆参数到拼编排,多模型协作成新主线
  • FUMO动态采购证据,长程任务成本省三至四成
  • 河豚指挥家调度众模型,SWE-Bench刷新纪录
  • 并行评审广撒网,预算面板逼近Fable级

多模型协作的范式之争——FUMO Fusion、Sakana Fugu与OpenRouter Fusion深度技术报告

2026年,大模型行业正式从"单体参数竞赛"转向"多模型协作效率"的比拼。FUMO Lab、Sakana AI与OpenRouter相继发布了三种截然不同的多模型协作方案。本报告深入剖析FUMO Fusion的"动态证据采购"、Sakana Fugu的"任务分解调度"及OpenRouter Fusion的"并行答案合成"三种范式的核心机制、适用场景,并探讨其在真实系统中"三位一体"的组合价值与未来架构演进趋势。


一、引言:从"堆参数"到"拼编排"的范式转移

当单体模型的参数规模遭遇算力墙与数据墙,多智能体协作成为提升智能上限的唯一解。然而,"如何协作"却衍生出不同的技术哲学。

2026年6月至9月,三股力量在短短一个季度内密集落地,构成了这一范式转移的完整时间线:

三者虽共享"多模型"标签,但其底层架构、决策时点与成本哲学存在根本分野:


二、三大核心范式深度剖析

2.1 FUMO Fusion:动态证据采购(Dynamic Evidence Procurement)

核心机制:FUMO 摒弃了"一次性路由"的静态思维,构建了一个闭环的"证据获取循环"。其白皮书将这一循环提炼为四条操作:读取状态(Read State)→ 获取证据(Buy Evidence)→ 更新状态(Update)→ 提交或停止(Submit or Stop)。系统在每一步都围绕一个中心问题组织计算:当前还剩什么不确定性?什么证据能改变答案?谁最适合获取证据?这一次计算的期望价值是否大于其成本?换言之,FUMO 不再问"哪个模型能直接答对这个问题",而是问"继续投入哪类计算能让任务状态以最低成本逼近可靠结论"。

工作方式:"一份状态,多种视角,一次提交"。多个模型共享统一的任务状态,探索与批判并行——可以有多个模型共同提出建议、补充证据,但只有唯一权威路径能够执行对外行动。工具调用仅作为建议呈现,证据必须保留适用范围与来源归属,最终决策权始终保持单一,从根上杜绝了多模型分叉带来的状态错乱。当现有证据已足以支撑可靠结论时,系统会及时停止计算。

产品形态:FUMO 发布了两款产品——Fusion Max 面向通用复杂任务,Fusion Code 面向软件工程与代码 Agent 场景,目前开放邀请制试用。

优化目标:智能分配(质量与成本的最优平衡)。官方宣称,相比单模型长程任务,完整任务成本可节约 30%-40%,并称使相关产品处于"性能—成本"的 Pareto 前沿。

2.2 Sakana Fugu:任务分解调度(Task Decomposition Routing)

核心机制:Fugu 本身是一个经大规模监督微调与进化算法(sep-CMA-ES)筛选、并通过强化学习(GRPO)训练的精巧语言模型,参数规模约 70 亿。它把"当个路由脚本"直接变成了"训练一个会协调的模型"——其两项底层技术 TRINITY 与 The Conductor 均被 ICLR 2026 收录:TRINITY 让模型在思考者(Thinker)、执行者(Worker)、验证者(Verifier)三种角色间动态分配任务;Conductor 则用强化学习让模型自行摸索出自然语言层面的协调策略,而非由人工写死路由规则。开发者在请求入口处只需面对一个与 OpenAI 兼容的 API,模型选择、任务分派、结果验证、回应合成全部在内部完成。

工作方式:先分解,后执行,且可递归。Fugu 解析任务后将其拆解为子问题;更擅长逐任务动态路由:判断问题难度,将每个子问题路由给池中 1 至 3 个最适合的专家模型(如 Claude Opus 4.8、GPT-5.5、Gemini 3.1 Pro 以及 Fugu 自身),并行或串行执行;随后引入验证节点交叉审计,最后由 Fugu 将各方输出缝合为单一答案。关键的递归设计在于——当一个子任务过于复杂时,Fugu 可以调用 Fugu 自身继续分解,形成一棵动态展开的任务树,而非一张写死的静态计算图。这也意味着它的"规划"是学习出来的自适应编排,而非固定剧本。

产品形态:标准版 Fugu 主打低延迟,适合日常编程、代码审查与聊天服务;Fugu Ultra 动用更深的代理池,面向研究复现、安全分析等长链条、多步骤复杂任务。

优化目标:极致质量。通过"让最对的专家做最对的事"来逼近乃至比肩单一前沿模型——Sakana 报告 Fugu Ultra 在 SWE-Bench Pro 达 73.7 分,领先 Claude Opus 4.8(69.2)与 GPT-5.5(58.6),并在 TerminalBench、LiveCodeBench、GPQA-Diamond 等测试上达到前沿水平。

需要说明的是,以上分数由 Sakana 自行公布,竞品分数采用各家自报数值,尚未经第三方独立复现;且 Fugu 是"调度系统",其成绩本质是池中多个模型能力合成后的"模型的模型"分数,与单一模型不能直接画等号。

2.3 OpenRouter Fusion:并行答案合成(Parallel Answer Synthesis)

核心机制:"广撒网,再评审"。将同一提示词并行发送给 1 至 8 个面板模型(Panel Models),每个模型独立调用 Web 搜索与抓取工具完成研究,最后由一个裁判模型(Judge Model)阅读全部响应,输出结构化分析——共识点(consensus)、矛盾点(contradictions)、部分覆盖(partial coverage)、独到见解(unique insights)与盲区(blind spots),再由调用方模型基于这份分析写出最终答案。整个管线在服务端执行,开发者只需指定 openrouter/fusion 一个模型标识,或通过 plugin 自定义面板与裁判组合。

工作方式:OpenRouter 将 Fusion 包装为三种形态——模型别名(openrouter/fusion)、服务端工具(server tool,可被主模型自主决定是否调用)、插件配置(plugin)。官方数据显示,Fusion 增益的约四分之三来自裁判的合成环节本身,仅约四分之一来自模型多样性——即便用同一个模型跑两次,"自我融合"也能带来显著提升。

优化目标:规避盲区。适合犯错成本极高、需要多视角校验的研判场景。官方明确提示:当"犯错成本远高于多花几次推理成本"时使用;不建议用于高频实时对话或长时间连续编码——因需等待多模型并行与融合,响应时间通常是标准调用的 2-3 倍。


三、核心机制对比

维度FUMO FusionSakana FuguOpenRouter Fusion
决策时点贯穿全流程(每步动态评估证据与成本)任务开始时分出计算图,执行中按难度动态选角、可递归任务开始时(并行分发,一次定稿)
状态管理强统一(单一份共享状态,唯一权威路径)统一规划(由指挥家上下文管理,可递归拆解)完全独立(面板间无状态共享)
成本哲学显式纳入循环(每次调用衡量 ROI,及时止损)较少考量(优先保障答案上限,隐藏级联调用)事后考量(用高成本换高可信度)
角色隐喻项目经理(动态判断下一步该找谁干活)总包工头/导演(写好分工剧本并监工验收)评审委员会(独立研究后投票表决)

四、性能基准速览

三家分别公布了面向自身定位的基准数据。由于评测口径与任务集各不相同,横向直接比较意义有限,这里仅作并列呈现与解读:

来源基准 / 场景关键数字
Sakana FuguSWE-Bench ProFugu Ultra 73.7,领先 Opus 4.8(69.2)与 GPT-5.5(58.6);未列入比较池的 Fable 5 为 80.0(第三方引用)
Sakana FuguTerminalBench / LiveCodeBench / GPQA-Diamond官方称达到前沿水平(厂商自报,未独立复现)
OpenRouter FusionDRACO(深度研究,100 任务×10 领域)Fable 5+GPT-5.5 融合 69.0% > Fable 5 单模 65.3%;预算面板 64.7% 距 Fable 5 不足 1%,成本约一半
OpenRouter FusionDRACO 自我融合Opus 4.8 双跑自融 65.5% vs 单模 58.8%,+6.7 分,证明合成环节本身价值
FUMO FusionGPQA Diamond / τ³-Banking / Terminal-Bench v2.1官方称超越现有顶级模型,处于性能—成本 Pareto 前沿,任务成本降 30%-40%

五、适用场景图谱

三种范式各有所长,开发者应依据任务特征进行选型:

FUMO Fusion 最佳实践:适合深度推理、长程 Agent、生产级代码运维。当任务路径充满不确定性(如开放式研究、故障根因分析),且对 Token 成本敏感时,FUMO 的动态裁剪能力极具优势——它把"是否继续计算"本身纳入决策,能在信息不足时持续采购证据、在证据充分时及时止损,天然适合成本意识强的生产环境。

Sakana Fugu 最佳实践:适合结构清晰但高难度的复杂任务。如论文复现、专利检索、安全分析、大规模代码库迁移。其学习型编排与验证节点设计,在任务目标明确、可分可验的场景下能把"最对的专家"组装成一条高质量流水线;Fugu Ultra 在推向极限质量的长链条任务中价值最大。

OpenRouter Fusion 最佳实践:适合高 Stakes 的研判决策。如企业架构取舍、安全风险评估、反方观点生成。官方建议"当犯错成本远高于多花几次推理成本时使用",适用于金融研究、尽调、医疗信息综合、法律与技术的结构化总结等"错了要命"的场景;其面板与裁判均可自定义,也适合团队自行搭建评测与代理管线。


六、协同价值与组合架构

三者并非互斥,在实际生产环境中具有极高的组合价值。本报告提出"三层协作架构"理论:

  1. 顶层调度(Sakana Fugu):在接到史诗级任务(如"重构整个微服务系统")时,先用 Fugu 进行顶层任务分解,划分出"需求分析"、"代码生成"、"安全审查"等子模块,并为每个模块指派最合适的执行模型。
  2. 中层执行(FUMO Fusion):将"代码生成"等动态性强的子任务交给 FUMO。FUMO 在编写具体代码时,遇到不确定的第三方库调用,会动态决策是否联网检索或执行测试,围绕不断变化的任务状态持续采购证据,确保持续演进并控制成本。
  3. 底层校验(OpenRouter Fusion):在关键决策节点(如最终方案合并前),将 FUMO 产出的草案交由 OpenRouter Fusion,调用多个顶尖模型进行对抗性评审,识别出单一模型难以发现的逻辑漏洞与盲区。

已有实践信号:这一组合并非空想。Sakana Fugu Ultra 在实际发布后即同步上线 OpenRouter 平台,开发者可以在同一个聚合入口中同时触达"调度层"与"合成层"能力——"调度层 + 合成层"的商业融合已然发生。同时,开发者社区已在编码 Agent 中探索"用 Fusion 做方案设计,用 FUMO 做动态 Debug"的混用模式,印证了三种范式在真实系统里交叉赋能的可行性。


七、客观性提示:厂商自报数字与未复现风险

在拥抱这一范式转移的同时,本报告特别提示读者注意以下风险点,避免被营销话术牵引:

  1. 基准数字均来自发布方:Sakana 与 FUMO 的领先数字均由厂商自行发布,竞品分数亦多为各家自报,尚未见第三方独立复现。读"第一"、"刷新纪录"时应保持审慎。
  2. 口径差异:Fugu 是"调度系统",其得分可能来自调用多个前沿模型再合成,本质是组合后的结果,与单体模型不可直接对比;Fable 5 等最强模型因出口管制停止公开访问而未进入比较池,使"领先"的含金量需要打折看待。
  3. 成本与延迟的隐藏面:无论是 Fugu 的隐藏级联调用,还是 Fusion 的多模型并行,单次请求的 token 消耗与墙钟延迟都会显著放大。真正值得比较的指标是"每美元 / 每秒钟的准确率",而不是裸分数。
  4. 评测盲区:DRACO 等主流评测基本不覆盖长时程任务,而长程推理恰是单体顶尖模型的传统强项,也是评测尚未充分反映的领域。

八、行业启示与未来展望

三种范式的集体爆发,揭示了 AI 竞争的深层趋势:

边际价值重构:多模型协作范式的共同实验指向一个反直觉的结论——"强模型未必是好批评者,小模型在特定校验上的边际价值更高",若干预算面板在特定任务上逼近乃至反超单体旗舰,正在瓦解"唯参数论"的迷信。融合提升的边际收益递减规律也表明:系统组织的价值,正在逐步追上单纯堆算力的价值。

地缘韧性:Sakana 强调,当企业依赖单一模型供应商时风险极高——2026 年 6 月美国出口管制令曾让 Anthropic 最强的 Fable 5、Mythos 系列一夜之间撤出公众访问。可插拔的多模型池提供了系统级韧性:模型可以被递补、被替换,而稳定的 API 接口作为不变量留存。

中间层护城河:OpenRouter 证明,当单一模型可被绕过时,跨厂商的无缝协同体验将成为聚合平台的坚实地基。谁控制了编排层、评审层与生态入口,谁就在单模型之争之外开辟了第二战场。

结语:没有任何一种范式是万能解。FUMO 的动态性、Fugu 的规划性与 Fusion 的评审性,恰好构成了 AI 系统"计划-执行-检查"的完整闭环。下一代 AI 的基础架构,将不再是单一超级大脑,而是由这三种范式协同编织的、具备动态分配能力的分布式多智能体联邦。对于开发者和企业而言,理解这三者的本质分野,并构建能够混搭它们的中间件,将成为2026年下半场保持技术领先的核心能力。


本文作者为金融行业风险管理从业者。文中基准数据均来自发布方公开材料,仅作技术科普与信息整理,不构成任何投资或选型建议。

关于作者

毕超,博士、高级工程师(计算机技术专业),金融行业风险管理从业者。

清华大学校友导师,中国人工智能学会终身会员,中国计算机学会学术审稿专家。

研究方向:大语言模型、数字金融、金融科技。2024年获北京市西城区"西融计划"青年拔尖人才。

了解更多:关于作者