Kimi K3とFableのルーティング戦略は93%の精度を実現し、コストは最大50倍削減可能です。
Fireworks AI は評価レポートを発表し、オープンソースモデル Kimi K3 とクローズドソースモデル Fable 5 の約 1030 件の代理タスク(SWE、エンドユーザー運用、アルゴリズム、多言語コーディング、法律などのシナリオを含む)における比較テストを行いました。結果は、両モデルの SWE ベンチマークにおける精度がそれぞれ 92.4% と 92.6% であり、全体的なパフォーマンスは近いものの、細分化された分野ではそれぞれの強みがあることを示しています:K3 は記号数学と開発ツールの分野で優位性を持ち、Fable は Web とデータビジュアライゼーションの分野で優れています;エンドユーザーの長期タスクにおいて、K3 は Fable が解決できなかった 11 件のタスクを独自に克服しました。
レポートは、タスクレベルのルーティング戦略を採用することで、両者間で動的に割り当てを行い、93% の精度を実現し、いずれかの単一モデルを超えることができると指摘しています。また、K3 は Fireworks プラットフォーム上で顕著なコスト優位性を持ち、長期代理タスクにおいては Fable よりも最大 50 倍コストを低く抑えることができます。レポートは、オープンソースモデルをデフォルトオプションとして採用し、ルーターを通じてタスクとモデルの最適なマッチングを継続的に学習することで、品質とコストの両立を図ることを提案しています。







