it.xnews.jp
出典: Fireworks AI 原文公開: 2026-07-21 生成: 2026-07-22 読了 約 2 分 model: claude-haiku-4-5 原文: https://fireworks.ai/blog/kimik3-fable raw.md

Kimi K3はFableと同等性能、組み合わせで最高精度を実現

Fireworks AIがKimi K3とFable 5を約1,030個のエージェントタスクで比較した結果、ルーティング戦略により93%の精度を達成し、K3は長時間のエージェントループで最大50倍のコスト効率を実現した。

Fireworks AIは、オープンモデルのKimi K3とクローズドモデルのFable 5を、SWE、Terminal、Algorithmic、Multi-Language、Legalの5つのベンチマークファミリーに属する約1,030個のエージェントタスクで検証した。K3とFableの間でのルーティングにより93%の精度が達成され、長時間のエージェントループではK3がFable単体比で最大50倍のコスト効率を示した。

ベンチマーク結果

SWEベンチマーク(460タスク)ではK3が92.4%、Fableが92.6%の精度を記録し、両者はほぼ同等の性能を示した。Terminal(89タスク)ではK3が11のソロ勝利、Fableが7のソロ勝利を獲得した。Algorithmic(100タスク)、Multi-Language(225タスク)、Legal(120タスク)を含む全5ファミリーにおいて、K3はFableと比較してコスト効率が高かった。

タスク処理効率とトークン消費

K3はSWEタスクを平均55ターンと1.3Mトークンで完了するのに対し、Fableは平均21ターンと130Kトークンを要した。一方、Terminalタスクではfableが最大64ターンと1.5Mトークンを消費することが確認された。オラクルルーティングの分析により、K3は全タスク種別にわたって72〜96%のタスク流量が割り当てられることが示唆された。

ベンチマーク比較結果

ルーティング精度分析

筆者の見立て

この記事は元記事の事実のみに基づいて自動生成されました。

出典

Fireworks AI『Kimi K3 is competitive with Fable; Kimi K3 + Fable is SoTA.』https://fireworks.ai/blog/kimik3-fable

この記事をシェア