提案から支払いへ:モデルフュージョンの需要の錯覚
著者:Yiping & David,IOSG
一、Model Fusion とは何ですか?
2026年6月、AI市場は3週間足らずで「Fusion」と名付けられた2つの製品を目にしました。
6月12日、OpenRouterはFusion Routerを発表し、タイトルはSurpassing Frontier Performance with Fusionでした。そのDRACO深層研究評価では、Fable 5とGPT-5.5からなるモデルグループが69.0点を獲得し、Fable 5単体の65.3点を上回りました。OpenRouterが提示した売り文句は非常に直接的です:単一モデルが十分でない場合は、複数のモデルに同じ問題に答えさせ、評価モデルが結果を比較・統合します。

6月29日、CognitionはDevin Fusionを発表しましたが、タイトルはFrontier Performance at 35% Lower Costでした。これは複数のモデルに全てのタスクを繰り返し実行させるのではなく、最前線のモデルに計画と判断を任せ、テストや機械的な修正などの作業をより安価なサイドキックに任せ、実行中にモデルを動的に切り替えます。

同じ言葉が、2つの相反する経済論理を指し示しています。OpenRouterはより多くの計算を使ってより高い上限を購入し、 Cognitionは高価な計算を減らしつつ、既存の品質を守ることに成功しました。 この対比は、どのモデルランキングよりも問題を明確に示しています。モデル融合の技術的命題は確かに成立しています:複数回の試行は一度の試行を超える機会があります。しかし、市場が本当に報酬を与えるのは「モデルを多く呼び出す」ことではなく、品質の閾値を満たした後に、誰がより少ないコストで、より早く提供できるかです。
▲ 図1:同じ月に、2つのFusion
この記事ではModel Fusionを狭義の構造に限定します:複数のモデルが同じタスクに並行して回答し、評価モデルが結果を比較し、最終的に1つのモデルが答えを出力します。 Devin Fusionはこの定義には当てはまりません。これはより動的なルーティングとタスク委任に近いです。これを冒頭に置いた理由は、市場が「Fusion」をすべての多モデル編成の総称として扱っているからであり、実際に効果的な製品は狭義のモデル融合から遠ざかっていることが多いからです。
私たちの判断は悲観的です:Model Fusionは高価な品質保険です。特定のタスクの絶対的なパフォーマンスを向上させることができますが、コスト---品質---遅延の効率の最前線を本当に外側に押し出すことはほとんどありません。 この保険を購入する価値のあるタスクは非常に少ないです。これは残るでしょうが、より低頻度のトリガー機能になる可能性が高く、デフォルトの構造や独立したカテゴリになることは難しいでしょう。
二、現在のモデルにはどのような選択肢がありますか?
Fusionについての議論は正確性ランキングに引き込まれやすいですが、企業はランキングの順位を購入するわけではありません。企業が購入するのはタスクの合格結果であり、同時に価格、遅延、プライバシー、安定性も考慮する必要があります。安価なモデルがビジネスの受け入れラインを越えた場合、より「賢い」ものに対して追加料金を支払うことには経済的な意味がないかもしれません。 コスト効率こそがモデル市場の真の主軸です。
▲ 図2:モデルの知能と単一タスクのコスト、横軸は対数スケール
図で最も注目すべきは、右上隅の最高得点ではなく、価格---能力のトレンドから外れた点です:それらはより低い価格で十分な能力を提供し、特定の作業負荷における効率のアウトライヤーです。総合指数はどのモデルがコードレビュー、中文研究、または規制された展開に最適かを直接答えることはできませんが、1つの方向性を示しています:モデル供給は商品化が進んでおり、「最強モデル」と「最適選択」は分離しています。
同じ品質のギャップに直面して、市場には現在4つの主要な購入方法があります。
第一の方法は、より強力な単一モデルに直接アップグレードすることです。これは最も簡単で、最も監査しやすいです;高級モデルの限界価格がエラーや再作業のコストを下回る限り、通常はこれが最初の選択肢です。第二の方法は、同じモデルでテスト時の計算を増やすことです。例えば、推論を延長したり、自己一貫性を持たせたり、複数回サンプリングを行ったりします。第三の方法は、ルーティング、カスケード、タスク委任です:まず安価なモデルで検証可能または機械的な部分を処理し、困難に直面したときだけアップグレードします。第四の方法が狭義のModel Fusionです:複数のモデルが同じ問題に繰り返し答え、評価と統合モデルが最終的な答えを形成します。
これら4つの方法はすべて「より多くの計算で品質を得る」ことができますが、違いは計算がどこに使われるかです。単一モデルの拡張はより深い推論を購入し、ルーティングはより正確なリソース配分を購入し、Fusionはより多くの候補答案を購入します。 最初の3つの方法は、結果を変える可能性が最も高い部分に予算を集中させますが、Fusionはまず繰り返し意見に対して支払い、その後評価モデルが有効な差異を見つけられることに賭けます。候補モデルは十分な独立情報を提供し、評価がこれらの情報を識別できる場合にのみ、Fusionは最初の3つの提案を上回る可能性があります。
ルーティングはすでに、モデル間の能力差が最初はスケジューリングの機会であることを証明しています。 RouteLLMは一部の評価でコストを2倍以上削減し、品質を損なうことはありませんでした;Switchcraftは82.9%の正確性で84%のコスト削減を実現し、論文の計算によれば、100万回のリクエストで3,600ドル以上を節約できます。結果は企業自身のトラフィックで再現する必要がありますが、経済論理は非常に直接的です:複数のモデルを会議に呼ぶ必要はなく、各タスクを最も安価な合格モデルに任せるだけです。
これは、市場はまずアップグレード、ルーティング、検証で品質のギャップを解決し、これらの方法がまだ不十分な場合にのみ、Fusionに対してより多くの候補答案を購入する理由があるということを意味します。
三、なぜスコアを上げることが価値を持つとは限らないのか?
Fusionは同時に3つのハードルを越えなければなりません:増分品質が新たに発生するコストと遅延をカバーし、候補モデルが独立した情報を提供し、評価がより良い答えを安定して識別できること。 いずれかが成立しなければ、スコアの向上は生産価値に転換できません。 計算コスト:どれだけの予算と遅延を増やす必要がありますか? Fusionのスコア向上はまず確定的な計算支出です。OpenRouterは複数のパネルモデルを並行して呼び出し、評価と統合モデルが答えを生成します。DRACOの3つの対照はすべてスコアを上げました:Fable 5 + GPT-5.5は65.3から69.0に、Opus 4.8の自己融合は58.8から65.5に、低コストの3モデルグループは60.3から64.7に上昇しました。
しかし、Opusの自己融合の向上はより大きく、利益は追加の検索とサンプリングから来ている可能性があり、モデル間の知識の相互補完ではないことを示しています。 公平な対照は、同じトークン予算の下での自己一貫性、より長い推論、強力な単一モデルを比較するべきです。既存の研究も示しています:複数のエージェントは約20倍の計算量で最大7.1パーセント向上します;予算が同じ場合、ディベートとMixture-of-Agentsは自己一貫性よりそれぞれ1.3と2.7パーセント高いだけで、別の推論トークン研究では単一エージェントが同等かそれ以上の結果を示しました。多くの「協力利益」は計算の整合性が取れた後に消失する可能性があります。
▲ 図3:OpenRouterのベンチマーク向上と製品コスト
OpenRouterのデフォルトの3モデルパネルのコストは通常生成の4-5倍で、速度は2-3倍遅いですが、各DRACO構成の完全なトークン、コスト、遅延は公開されておらず、3.7点の向上が価値があるかどうかを判断することはできません。評価も100の純テキスト英語タスクしかなく、Fableに関連する構成は93項目しか完了していません;評価モデルを変更することで絶対スコアが10-25パーセント動くこともあります。これはFusionがスコアを上げることができることを証明していますが、Fusionが生産ROIを改善したことを証明しているわけではありません。
選択的呼び出しはコストを薄めるだけです。OpenRouterが公開した範囲の推定によれば、トリガー率が1%のとき、全体のコストは約1.03-1.04倍;10%のときは1.30-1.40倍;25%のときには1.75-2.00倍に達します。
▲ 図4:選択的呼び出しFusionの全体的な経済性
最も難しいリクエストが最もFusionを引き起こす可能性が高いですが、システムは最も遅いパネルメンバーを待たなければならず、評価と生成を直列で完了する必要があるため、尾部遅延は最も価値のあるタスクに集中します。複数の供給者の呼び出しは故障面、監査の複雑さ、プライバシーの露出を拡大します。FusionのコストはAPI価格だけでなく、待機時間や新たなシステムリスクも含まれます。
情報の相互補完:複数のモデルは本当に異なる情報を提供していますか?
Fusionの価値は候補モデルが独立した情報をもたらすかどうかに依存しますが、異なるモデルはしばしば訓練コーパス、ウェブソース、誤った前提を共有します。研究タスクでは、これが「引用洗浄」を引き起こすことがあります:複数のモデルが同じソースに遡りながら、独立した証拠として包装されます。システムがクレームレベルの出所と検索パスを保持しない場合、モデルの数が増えるにつれて、APIコストはほぼ線形に上昇し、証拠の多様性は必ずしも増加しません。
KAIKAKU.AIの共同創設者兼CEOであるJosef Chenは、2026年の論文When Does Combining Language Models Help?で21社の67モデルを研究しました。オープンな数学タスクでは、すべてのモデルが同時に間違える予測確率は2.3%でしたが、実測では5.2%------予測値の約2.3倍に達しました;スコアリングコードタスクと自由回答版GPQA-Diamondの共同失敗率はさらに7.9%と12.7%に上昇しました。100問のGPQA-Diamondに置き換えると、約13問がすべての候補モデルが一緒に間違えることになり、投票、評価、または統合には正しい答えが選べません。モデルが簡単な問題での意見の相違は組み合わせの価値を拡大しますが、最も保険が必要な尾部問題では、逆に一緒に失敗する可能性があります。 信頼性の判断:システムはより良い答えを識別し、合成できますか? 候補答案が相互補完的であっても、価値は評価に依存します。候補が一致している場合、評価は関連するエラーを高い信頼度として誤認する可能性があります;候補が異なる場合、評価は正しい選択をするために十分な専門知識を持っている必要があります。 統合モデルは重要な少数意見を消し去るか、実際の相違を確定的な結論に書き換える可能性もあります。
コードタスクでは、コンパイラ、テスト、静的分析は通常、他のモデルの意見よりも信頼性が高いです;創造的なタスクでは、評価と統合が差異を平均的な答えに圧縮しやすくなります。LitBenchで最も強力な既製の評価モデルと人間の創造的な執筆の好みの一致率は73%に過ぎません。タスクにすでに安価な外部検証者が存在する場合や、「良い」自体が主観的な判断に依存する場合、Fusionのスコア向上は有料の価値に転換するのが難しいです。
四、誰がFusionに対して支払うのか?
Fusionの需要は2つのハードルに依存します:タスクが複数のモデルから利益を得られるかどうか、そしてその利益が持続的な支払いを形成するのに十分かどうか。前者は技術的な問題であり、後者は市場の問題です。 技術的適用から経済的成立へ Fusionは、エラーを正す確率 × 一度のエラーで回避できる損失が、新たなAPIコスト、遅延、運用の複雑さ、プライバシーリスクを上回る必要があります。
基準スコアはこの損益問題に答えることはできません。Fusionはエラーコストが高く、候補モデルが相互補完的な検索パスを提供し、より安価な外部検証者が不足し、ビジネスが追加の遅延と供給者リスクを受け入れられる場合にのみ成立する可能性があります;最終結果は依然として人または外部証拠によって確認されるべきです。
▲ 図5:技術的適用から持続可能な需要へ
これらの条件を満たすのは主に高価値の研究とデューデリジェンス、アーキテクチャとセキュリティレビュー、不可逆的な意思決定前の「第二意見」です。 これらの共通点は制約が不完全で、見落としのコストが高く、別の独立した思考自体が価値を持つことです。逆に、通常のコード、リアルタイム消費アプリケーション、高スループット低利益のワークフロー、そしてテストやルールで直接検証できるタスクは、通常Fusionを必要としません。 規制機関もデータの境界と監査要件のために複数の供給者パネルを拒否する可能性があります。
支払い意欲から持続可能な需要へ
技術的に有用であることは高い支払い意欲をもたらすことができますが、スケール可能な需要にはつながりません。 持続的な需要を形成するためには、エラー損失が定量化可能で、タスクが繰り返し発生し、組織内に明確な予算責任者が存在し、Fusionが人工専門家、強力な単一モデル、外部検証を持続的に上回る必要があります。しかし、デューデリジェンスの予算はしばしばアナリストや信頼できるソースに流れ、安全予算は専門的な監査に流れ、不可逆的な意思決定はあまりにも少なく発生します。
したがって、私たちは単に多モデルのラッパーを作成したり、デフォルトでパネルを実行したり、静的モデル選択アルゴリズムを防御線として扱う企業には期待していません。APIを接続することは容易にコピーでき、固定戦略はモデルの能力や価格の変化に迅速に無効化されます;エラーの価値がどれくらいか、Fusionが実際に何回正しい答えを出したかがわからなければ、この保険に価格を付けることはできません。価値を捕らえる可能性が高いのは、実際の結果を把握している側です:ゲートウェイやエージェントプラットフォーム、垂直アプリケーション、ワークフロー所有者、評価や可観測性製品です。彼らはエラーコストを知り、結果を観察し、トリガー戦略を最適化できます。本当にコピーが難しいのはパネルのリストではなく、Fusionを呼び出さないタイミングを判断することです。 市場の検証 公開市場はFusionの需要規模を判断するには不十分ですが、どのように使用されているかはすでに見えてきています。Perplexity Model Councilは、月額200ドルのMaxユーザーとEnterprise Maxユーザーにのみ開放されており、ユーザーはウェブ端末で3つのモデルを手動で選択し、投資研究、複雑な意思決定、情報検証に使用します;公開されたユーザーケースには、ブラウザ自動化を通じてModel Councilを株式研究プロセスに組み込む事例が含まれます。Hermes Mixture of AgentsはFusionをエージェント内で選択可能な仮想モデルとして作成しました:ユーザーは/moaを通じて1つの難しい問題だけをアップグレードすることも、複雑なセッション内で継続的に有効にすることもでき、複数のリファレンスモデルが分析を提供し、アグリゲーターがツールを呼び出してタスクを完了します。Hermesは後にデフォルトのファンアウト頻度を下げ、前回のモデルの意見を再利用してコストを制御しました。これらのケースは、Fusionの真の需要が研究、デバッグ、レビュー、重要な意思決定などの低頻度の困難なタスクに集中していることを示しています。典型的な使用方法は、単一モデルがボトルネックに直面した後の積極的なアップグレードであり、デフォルトで開始される高頻度の自動化プロセスではありません。 現在の証拠はこの需要が存在することを証明していますが、公開情報はそれが独立した、スケール可能な支払い市場を形成できるかどうかを判断するには不十分です。
五、Fusionの未来
推論価格の低下は表面的にはFusionに好影響を与えますが、同時に強力な単一モデル、ルーティング、外部検証のコストも低下させます。Fusionが競争するのは昨日の一度のモデル呼び出しではなく、絶えず改善される次世代の単一モデルと編成の基準です。
CognitionのDevin Fusionはこの競争の方向性を示しています:高価なモデルを判断の段階に留め、検証可能で機械的な作業をより安価なモデルに任せることです。 企業の自己テストでは、Fusion + Fable 5の総得点は57.0からわずかに57.6に上昇し、平均コストは5.12ドルから3.00ドルに減少しました;しかし、公開された5つのケースでは、コストは25%-62%減少しましたが、タスクの得点は+12から-27の間で変動しました。 境界が明確で、テストが十分なES6のリファクタリングは98点から100点に上昇しました;インタラクティブな理解と暗黙のニーズに依存するReact/Redux機能が誤って委任された場合、54点から27点に下落しました。
▲ 図6:Devin Fusionのタスク得点とコスト
これらは企業が選択したケースであり、全体の分布を代表するものではありませんが、明確な指針を示しています:未来の多モデルシステムの核心能力は、より多くのモデルを呼び出すことではなく、正しいダウングレードの境界を定めることです。 検証可能で機械的なタスクは安価なモデルに任せることができ、判断を要するタスクは最前線のモデルに留める必要があります。OpenRouterは「より多くの知能」を販売し、Cognitionは「同等の知能をより低コストで」販売しています;後者の命題は長期的な方向性により近いです。システムが生産経済学に近づくほど、狭義のModel Fusionとは似ておらず、ルーティング、委任、検証に近づきます。
7月下旬、メディアはStripeが約100億ドルでOpenRouterを買収する交渉を行っていると報じましたが、取引はまだ確認されていません。この信号はFusionが市場の検証を受けたと解釈されるべきではありません:OpenRouterの核心的価値は特定のパネルではなく、500万以上の開発者と400以上のモデルを接続する中立的な呼び出し層です。StripeはすでにOpenRouterに対して請求、税務、リスク管理を提供し、開発者がStripe Projectsを通じて直接アカウントを作成し、APIキーを取得し、支払いを接続できるようにしています。Stripeが本当に購入する可能性があるのはAI推論の取引入口です:OpenRouterはモデル選択、トークン使用量、コストを把握し、Stripeは価格設定、請求、支払いを処理します。 これは前述の価値判断に市場の信号を提供します:多モデル時代の価値は、タスクを観察し、呼び出しを割り当て、決済を完了できるオーケストレーションレイヤーに留まる可能性が高く、Fusionはその上の高コストのアップグレード戦略に過ぎません。
未来の多モデルシステムはデフォルトでパネルを召集するのではなく、まずタスクの難易度、検証コスト、エラー損失を見積もります;より強力な単一モデル、推論の延長、外部ツールがまだ不十分な場合にのみ、多モデルの意見の相違検索に入ります。トリガー率、増分成功率、検証された単位結果コストが、有意義な製品指標です。Fusionは低頻度の機能として残り、デフォルトの構造や独立したカテゴリにはならないでしょう。
六、出典
OpenRouter: Surpassing Frontier Performance with Fusion
OpenRouter Fusion Router documentation
Cognition: Devin Fusion --- Frontier Performance at 35% Lower Cost
Microsoft Research: Switchcraft --- AI Model Router for Agentic Tool Calling
When Does Combining Language Models Help?
Multi-Agent Reasoning Improves Compute Efficiency
Single-Agent LLMs Outperform Multi-Agent Systems on Multi-Hop Reasoning Under Equal Thinking Token Budgets
Mixture-of-Agents Enhances Large Language Model Capabilities
RouteLLM: Learning to Route LLMs with Preference Data
LitBench: A Benchmark for Creative-Writing Evaluation
Artificial Analysis model comparison
The Price of Progress: Price Performance and the Future of AI
Perplexity: What is Model Council?
Perplexity user example: Model Council for financial research
Hermes Agent: Mixture of Agents documentation
Stripe powers OpenRouterʼs global AI model access
Axios: Whatʼs behind Stripeʼs reported OpenRouter move













