
Ember-1:40%削減されたトークンで同等の性能を実現
Fireworks Researchが新しい専門特化型AI モデル「Ember-1」を発表。Kimi K3をベースに構築され、トークン使用量を40%削減しながら同等の品質を提供する。
新モデルの概要
Fireworks Researchは2026年9月23日、Ember-1を発表した。このモデルはKimi K3をベースに開発され、Kimi K3と同等の品質を40%少ないトークン数で提供する。開発には50以上の訓練実験と200以上の評価が実施された。Ember-1は外部ベンチマーク、2社との本番環境でのA/Bテスト、内部の本番運用を通じて検証された。

トークン効率化の実現メカニズム
推論モデルKimi K3は、生成トークンの90%以上を内部推論に費やしており、実際の回答には比較的少ないトークンしか割かない。Ember-1は、7つのベンチマークと2社の本番トラフィックにおいて、Kimi K3の推論を35~50%短縮させることができると判明した。このうち、内部検証では推論トークンを71.3%削減し、全体では39%のトークン削減を達成している。
ベンチマークと実証結果
Ember-1はDoximityのBedside Benchで検証された。このベンチマークは10の専門分野にわたる500の臨床ケースを医師による検証を受けた形式である。Ember-1は、GPT-5.6 Sol、GPT-6 Astra、Claude Opus 5を含むオープンおよびクローズドモデルの中で、新たなパレート最適フロンティアを確立した。

実運用での導入実績
2社との本番環境でのA/Bテストでは、Ember-1は同等の品質を保ちながら、タスク当たり約35%少ないトークン数を提供した。既に1社の顧客がEmber-1を本番運用中であり、ベースモデルに完全に置き換える計画を進めている。Fireworks社の内部開発者も日常的なコーディング作業でEmber-1を使用しており、切り替えに気づかなかったとされる。

提供方法
Ember-1はServerlessでResearch Previewリリースとしてロールアウトされ、ベースモデルのKimi K3と併行して利用可能となる。また、Fireworksは新しい研究リリース制度を導入し、開発者に新しい研究モデルへの2週間のServerlessアクセスを提供する。
筆者の見立て
- K3を最もコスト効率よく実行する方法は、思考量を減らすことではなく、Ember-1を実行することであると解釈している。
- エージェントベースのコーディングやその他の推論トークンがコストの大部分を占めるワークロードにおいて、同等の品質を約半分のトークンコストで提供することが可能であることを示唆している。
- トークン効率化がFireworksのテーマになっていることを論じている。
- 今後のオープンモデルは特定のワークロードで訓練された専門特化型モデルであると予想している。
この記事は元記事の事実のみに基づいて自動生成されました。
出典
Fireworks AI「Introducing Ember-1」 https://fireworks.ai/blog/ember-1