Kimi K3はFableと同等性能、組み合わせで最高精度を実現
Fireworks AIがKimi K3とFable 5を約1,030個のエージェントタスクで比較した結果、ルーティング戦略により93%の精度を達成し、K3は長時間のエージェントループで最大50倍のコスト効率を実現した。
Fireworks AIは、オープンモデルのKimi K3とクローズドモデルのFable 5を、SWE、Terminal、Algorithmic、Multi-Language、Legalの5つのベンチマークファミリーに属する約1,030個のエージェントタスクで検証した。K3とFableの間でのルーティングにより93%の精度が達成され、長時間のエージェントループではK3がFable単体比で最大50倍のコスト効率を示した。
ベンチマーク結果
SWEベンチマーク(460タスク)ではK3が92.4%、Fableが92.6%の精度を記録し、両者はほぼ同等の性能を示した。Terminal(89タスク)ではK3が11のソロ勝利、Fableが7のソロ勝利を獲得した。Algorithmic(100タスク)、Multi-Language(225タスク)、Legal(120タスク)を含む全5ファミリーにおいて、K3はFableと比較してコスト効率が高かった。
タスク処理効率とトークン消費
K3はSWEタスクを平均55ターンと1.3Mトークンで完了するのに対し、Fableは平均21ターンと130Kトークンを要した。一方、Terminalタスクではfableが最大64ターンと1.5Mトークンを消費することが確認された。オラクルルーティングの分析により、K3は全タスク種別にわたって72〜96%のタスク流量が割り当てられることが示唆された。


筆者の見立て
- 複数モデルの組み合わせが単一モデルより多様なタスク対応に優れていると解釈している
- 単一モデル提供者による時代とトークン最大化の時代が終わりに向かっていると予想している
- 最良のAIはもはや単一の研究機関からではなく、複数モデルの混合から生まれると論じている
- コスト最適化されたオープンモデルがワークロードのベースケースであるべきと解釈している
- ワークロードに特化したルーティングの構築とタスク・モデル分割の学習が競争優位を保つ最良の方法と論じている
この記事は元記事の事実のみに基づいて自動生成されました。
出典
Fireworks AI『Kimi K3 is competitive with Fable; Kimi K3 + Fable is SoTA.』https://fireworks.ai/blog/kimik3-fable