BTC $63,848.51 +1.28%
ETH $1,904.22 +1.21%
BNB $606.24 -0.14%
XRP $1.00 +0.30%
SOL $75.81 +0.58%
TRX $0.3312 -0.10%
DOGE $0.0702 +0.42%
ADA $0.1744 -1.06%
BCH $204.39 +0.00%
LINK $9.51 +1.76%
HYPE $59.53 +3.99%
AAVE $87.66 +1.13%
SUI $0.6761 -0.30%
XLM $0.1580 +0.27%
ZEC $512.74 +3.98%
BTC $63,848.51 +1.28%
ETH $1,904.22 +1.21%
BNB $606.24 -0.14%
XRP $1.00 +0.30%
SOL $75.81 +0.58%
TRX $0.3312 -0.10%
DOGE $0.0702 +0.42%
ADA $0.1744 -1.06%
BCH $204.39 +0.00%
LINK $9.51 +1.76%
HYPE $59.53 +3.99%
AAVE $87.66 +1.13%
SUI $0.6761 -0.30%
XLM $0.1580 +0.27%
ZEC $512.74 +3.98%

从提分到付费:Model Fusion 的需求错觉

核心观点
Summary: Fusion 会作为低频功能留下,而不是成为默认架构或独立品类。
IOSG Ventures
2026-08-17 22:11:43
Fusion 会作为低频功能留下,而不是成为默认架构或独立品类。

作者:Yiping & David,IOSG

 

一、Model Fusion 是什么?

2026 年 6 月,AI 市场在不到三周内看到了两款名为 “Fusion” 的产品。

6 月 12 日,OpenRouter 发布 Fusion Router,标题是 Surpassing Frontier Performance with Fusion。在其 DRACO 深度研究评测中,Fable 5 与 GPT-5.5 组成的模型组拿到 69.0 分,超过 Fable 5 单模型的 65.3 分。OpenRouter 给出的卖点很直接:当单模型不够好,就让多个模型回答同一道题,再由评审模型比较、综合。

从提分到付费:Model Fusion 的需求错觉

6 月 29 日,Cognition 发布 Devin Fusion,标题却是 Frontier Performance at 35% Lower Cost。它没有让多个模型重复完成整项任务,而是让前沿模型负责规划和判断,把测试、机械修改等工作交给更便宜的 sidekick,并在执行过程中动态切换模型。

从提分到付费:Model Fusion 的需求错觉

同一个词,指向两套相反的经济逻辑。OpenRouter 用更多计算购买更高上限;Cognition 设法减少昂贵计算,同时守住原有质量。这个反差比任何一张模型排行榜都更能说明问题。模型融合的技术命题确实成立:多次尝试有机会超过一次尝试。但市场真正奖励的不是“模型调用更多”,而是在满足质量门槛后,谁能更少花钱、更快交付。

从提分到付费:Model Fusion 的需求错觉

▲ 图 1:同一个月,两种 Fusion

本文把 Model Fusion 限定为一种较窄的架构:多个模型对同一任务并行作答,评审模型比较结果,最后再由一个模型输出答案。Devin Fusion 不属于这个定义,它更接

近动态路由和任务委派。之所以把它放在开头,是因为市场正在把 “Fusion” 当成所有多模型编排的统称,而真正有效的产品,往往正在远离狭义的模型融合。

我们的判断偏悲观:Model Fusion 是一份昂贵的质量保险。它能提高某些任务的绝对表现,却很少能把成本—质量—延迟的效率前沿真正推向外侧。真正值得购买这份保险的任务很少。它会留下来,但更可能成为一个低频触发的功能,而不是默认架构,更难成为独立品类。

二、模型目前有哪些选择?

讨论 Fusion 很容易被带进准确率排行榜,但企业并不购买排行榜名次。企业购买的是一项任务的合格结果,还要同时计算价格、延迟、隐私和稳定性。只要便宜模型已经

越过业务验收线,继续为“更聪明”付费就可能没有经济意义。成本效率才是模型市场真正的主线。

从提分到付费:Model Fusion 的需求错觉

▲ 图 2:模型智能与单任务成本,横轴为对数刻度

图中最值得关注的不是最右上角的最高分,而是偏离价格—能力趋势的点:它们以更低价格提供了足够能力,是特定工作负载上的效率 outlier。综合指数无法直接回答哪

个模型最适合代码审查、中文研究或受监管部署,但它揭示了一个方向:模型供给正在商品化,“最强模型”与“最优选择”正在分开。

面对同一个质量缺口,市场目前有四种主要买法。

第一种是直接升级到更强的单模型。它最简单,也最容易审计;只要高端模型的边际提价低于错误或返工成本,这通常仍是首选。第二种是在同一个模型上增加测试时计算,例如延长推理、self-consistency 或多次采样。第三种是路由、级联和任务委派:先用便宜模型处理可验证或机械性的部分,只有遇到困难才升级。第四种才是狭义的 Model Fusion:让多个模型对同一问题重复作答,再由评审和综合模型形成最终答案。

这四种方式都能“用更多计算换质量”,区别在于计算花在哪里。单模型扩展购买更深的推理,路由购买更准确的资源分配,Fusion 则购买更多候选答案。前三种方法把预算集中在最可能改变结果的环节;Fusion 却先为重复意见付费,再赌评审模型能从中找出有效差异。候选模型只有带来足够多的独立信息,而且评审能够识别这些信息,

Fusion 才可能胜过前三种方案。

路由已经证明,模型之间的能力差异首先是一项调度机会。RouteLLM 在部分评测中把成本降低超过 2 倍而不损失质量;Switchcraft 以 82.9% 的准确率实现 84% 的成本下降,按论文测算,每百万次请求可节省超过 3,600 美元。结果仍需在企业自己的流量上复现,但经济逻辑很直接:不必让多个模型开会,只需把每项任务交给最便宜的合格模型。

这意味着,市场会先用升级、路由和验证解决质量缺口;只有当这些方法仍然不够时,才有理由为 Fusion 购买更多候选答案。

三、为什么提分不等于有价值?

因为 Fusion 必须同时跨过三道门槛:增量质量要覆盖新增成本与延迟,候选模型要提供独立信息,评审还要稳定识别更好的答案。任何一项不成立,分数提升都无法转化为生产价值。

计算成本:需要增加多少预算和延迟?

Fusion 的提分首先是一笔确定的计算支出。OpenRouter 会并行调用多个 panel 模型,再由评审和综合模型生成答案。DRACO 的三组对照都提了分:Fable 5 + GPT-5.5 从 65.3 升至 69.0;Opus 4.8 自融合从 58.8 升至 65.5;低成本三模型组从 60.3 升至 64.7。

但 Opus 自融合的提升更大,说明收益可能来自额外搜索和采样,而非跨模型知识互。公平对照应比较相同 token 预算下的 self-consistency、更长推理和强单模型。现有研究也显示:多智能体在约 20 倍计算量下最多提升 7.1 个百分点;预算相同时,debate 和 Mixture-of-Agents 仅比 self-consistency 高 1.3 和 2.7 个百分点,另一项等 reasoning-token 研究则发现单 agent 持平或更优。不少“协作收益”会在计算账对齐后消失。

从提分到付费:Model Fusion 的需求错觉

▲ 图 3:OpenRouter 的基准提升与产品成本

OpenRouter 默认 3 模型 panel 的成本约为普通生成的 4-5 倍速度慢 2-3 倍,但没有披露各 DRACO 配置的完整 token、成本和延迟,无法判断 3.7 分提升是否值得。评测也只有 100 个纯文本英文任务,Fable 相关配置只完成 93 项;更换评审模型可让绝对分数移动 10-25 个百分点。它证明了 Fusion 能提分,没有证明 Fusion 改善了生产 ROI。

选择性调用只能摊薄成本。按 OpenRouter 披露的区间估算,触发率为 1% 时,整体成本约为 1.03-1.04 倍;10% 时为 1.30-1.40 倍;25% 时已达 1.75-2.00 倍。

从提分到付费:Model Fusion 的需求错觉

▲ 图 4:选择性调用 Fusion 的整体经济性

最难的请求最可能触发 Fusion,系统却必须等待最慢的 panel 成员,再串行完成评审和生成,因此尾延迟集中在最有价值的任务上。多供应商调用还扩大故障面、审计复杂度和隐私暴露。Fusion 的成本不只是 API 价格,也包括等待时间和新增的系统风险。

信息互补:多个模型是否真的提供了不同信息?

Fusion 的价值取决于候选模型是否带来独立信息,但不同模型往往共享训练语料、网页来源和错误前提。研究任务中,这会导致“引用洗白”:多个模型追溯到同一来源,却被包装成多份独立证据。若系统不保留 claim-level provenance 和搜索路径,随着模型数量增加,API 成本几乎线性上升,证据多样性却未必增加。

KAIKAKU.AI 联合创始人兼 CEO Josef Chen 在 2026 年的论文 When DoesCombining Language Models Help? 中研究了 21 家服务商的 67 个模型。开放式数学任务中,所有模型同时答错的预测概率为 2.3%,实测却达到 5.2%——约为预测值的 2.3 倍;执行评分代码任务和自由回答版 GPQA-Diamond 的共同失败率进一步升7.9% 和 12.7%

换成 100 道 GPQA-Diamond,大约有 13 道题会让所有候选模型一起答错,投票、评审或综合都无正确答案可选。模型在容易题上的分歧会放大组合价值,而在最需要保险的尾部问题上,它们反而可能一起失手。

判断可靠性:系统能否识别并合成更好的答案?

即使候选答案互补,价值仍取决于评审。候选一致时,评审可能把相关错误误认成高置信度;候选分歧时,它又必须具备足够专业知识才能选对。综合模型还可能抹掉关键少数意见,或把真实分歧改写成确定结论。

在代码任务中,编译器、测试和静态分析通常比另一份模型意见更可靠;在创意任务中,评审与综合又容易把差异压成平均答案。LitBench 中最强的现成评审模型与人类创意写作偏好的一致率也只有 73%。当任务已有廉价外部验证器,或“好”本身依赖主观判断时,Fusion 的提分很难转化为可付费价值。

四、谁会为 Fusion 付费?

Fusion 的需求取决于两道门槛:任务是否能从多模型中获益,以及这种收益是否足以形成持续付费。前者是技术问题,后者才是市场问题。

从技术适用到经济成立

Fusion 把错误改对的概率 × 单次错误可避免的损失,必须大于新增的 API 成本、延迟、运维复杂度和隐私风险。

基准分数无法回答这道损益题。Fusion 只有在错误代价高、候选模型提供互补搜索路径、缺少更便宜的外部验证器,而且业务能接受额外延迟和供应商风险时才可能成立;最终结果仍应由人或外部证据确认。

从提分到付费:Model Fusion 的需求错觉

▲ 图 5:从技术适用到可持续需求

符合这些条件的主要是高价值研究与尽调、架构与安全评审,以及不可逆决策前的“第二意见”。它们的共同点是约束不完整、遗漏代价高,另一条独立思路本身就有价值。相反,常规代码、实时消费应用、高吞吐低毛利工作流,以及能由测试或规则直接验证的任务,通常不需要 Fusion。受监管机构也可能因数据边界和审计要求拒绝多供应商 panel。

从付费意愿到可持续需求

技术上有用可以带来高付费意愿,却不等于可规模化需求。要形成持续需求,错误损失必须可量化,任务要重复发生,组织内要有明确的预算负责人,Fusion 还必须持续胜过人工专家、强单模型和外部验证。但尽调预算往往流向分析师与可信来源,安全预算流向专业审计,不可逆决策又发生得太少。

因此,我们不看好只做多模型 wrapper、默认运行 panel,或把静态模型选择算法当作护城河的公司。连接 API 容易复制,固定策略也会随模型能力和价格变化迅速失效;如果不知道错误值多少钱、Fusion 实际改对了多少次,就无法为这份保险定价。更可能捕获价值的是掌握真实结果的一方:网关和 agent 平台、垂直应用、工作流所有者,以及评测和可观测性产品。它们知道错误成本,能观察结果,也能优化触发策略。真正难复制的不是 panel 名单,而是判断何时不调用 Fusion。

市场验证

公开市场尚不足以判断 Fusion 的需求规模,但已经能看出它如何被使用。Perplexity Model Council 仅向每月 200 美元的 Max 用户和 Enterprise Max 用户开放,用户在网页端手动选择三个模型,用于投资研究、复杂决策和信息验证;公开用户案例包括通过 browser automation 将 Model Council 接入股票研究流程。Hermes Mixture of Agents 则把 Fusion 做成 agent 中可选择的虚拟模型:用户可以通过 /moa 只升级一个困难问题,也可以在复杂 session 中持续启用,由多个 reference models 提供分析,再由 aggregator 调用工具并完成任务。Hermes 后来降低默认fan-out 频率,复用上一轮模型意见以控制成本。这些案例说明,Fusion 的真实需求集中在 research、debugging、review 和重要决策等低频困难任务,典型使用方式是单模型遇到瓶颈后的主动升级,而不是默认开启的高频自动化流程。现有证据证明这种需求存在,但公开信息仍不足以判断它能否形成独立、规模化的付费市场。

五、Fusion 的未来

推理价格下降表面上利好 Fusion,但也会同步降低强单模型、路由和外部验证的成本。Fusion 竞争的不是昨天的一次模型调用,而是不断改善的下一代单模型与编排基线。

Cognition 的 Devin Fusion 展示了这场竞争的方向:把昂贵模型留给判断环节,把可验证、机械性的工作交给更便宜的模型。厂商自测中,Fusion + Fable 5 的总分从57.0 小幅升至 57.6,平均成本从 5.12 美元降至 3.00 美元;但在公布的 5 个案例中,成本均下降 25%-62%,任务得分却在 +12 至 -27 之间波动。边界清楚、测试充分的 ES6 重构从 98 分升至 100 分;依赖交互理解和隐含需求的 React/Redux 功能被错误委派后,则从 54 分跌至 27 分。

从提分到付费:Model Fusion 的需求错觉

▲ 图 6:Devin Fusion 的任务得分与成本

这些是厂商挑选的案例,不代表总体分布,但指向清楚:未来多模型系统的核心能力不是调用更多模型,而是划定正确的降级边界。可验证、机械性的任务可以交给便宜模型,判断密集型任务必须留给前沿模型。OpenRouter 出售“更多智能”,Cognition 出售“同等智能,更低成本”;第二种命题更接近长期方向。一个系统越接近生产经济学,就越不像狭义的 Model Fusion,而越像路由、委派和验证。

7 月下旬,媒体报道称 Stripe 正洽谈以约 100 亿美元收购 OpenRouter,交易尚未确认。这个信号不应被解读为 Fusion 已经获得市场验证:OpenRouter 的核心价值并非某一种 panel,而是连接超过 500 万开发者与 400 多个模型的中立调用层。Stripe 已经为 OpenRouter 提供计费、税务和风控,并允许开发者通过 Stripe Projects 直接创建账户、取得 API key 和接通付款。Stripe 真正可能购买的是 AI 推理的交易入口:OpenRouter 掌握模型选择、token 用量与成本,Stripe 则处理定价、账单和支付。这为前文的价值判断提供了市场信号:多模型时代的价值更可能留在能够观察任务、分配调用并完成结算的 orchestration layer,Fusion 只是其上的一种高成本升级策略。

未来的多模型系统不会默认召集 panel,而会先估计任务难度、验证成本和错误损失;只有当更强单模型、延长推理和外部工具仍不足时,才进入多模型分歧搜索。触发率、增量成功率和经验证的单位结果成本,才是有意义的产品指标。Fusion 会作为低频功能留下,而不是成为默认架构或独立品类。

六、Sources

  • OpenRouter: Surpassing Frontier Performance with Fusion

  • OpenRouter Fusion Router documentation

  • Cognition: Devin Fusion — Frontier Performance at 35% Lower Cost

  • Microsoft Research: Switchcraft — AI Model Router for Agentic Tool Calling

  • When Does Combining Language Models Help?

  • Multi-Agent Reasoning Improves Compute Efficiency

  • Single-Agent LLMs Outperform Multi-Agent Systems on Multi-Hop Reasoning Under Equal Thinking Token Budgets

  • Mixture-of-Agents Enhances Large Language Model Capabilities

  • RouteLLM: Learning to Route LLMs with Preference Data

  • LitBench: A Benchmark for Creative-Writing Evaluation

  • Artificial Analysis model comparison

  • The Price of Progress: Price Performance and the Future of AI

  • Perplexity: What is Model Council?

  • Perplexity user example: Model Council for financial research

  • Hermes Agent: Mixture of Agents documentation

  • Stripe powers OpenRouterʼs global AI model access

  • Axios: Whatʼs behind Stripeʼs reported OpenRouter move

欢迎加入 ChainCatcher 官方社群
Telegram 订阅: @chaincatcher
X (Twitter): @ChainCatcher_
warnning 风险提示
app_icon
ChainCatcher 与创新者共建Web3世界