---
source_url: https://fireworks.ai/blog/ember-1
source_title: "Introducing Ember-1"
source_site: "Fireworks AI"
source_published_at: 2026-09-23
hero_image: https://fireworks.ai/images/OpenGraph.png
tags: ai-models,token-efficiency,language-models
generated_at: 2026-09-27T20:00:59.725Z
model: claude-haiku-4-5
---
# Ember-1：40%削減されたトークンで同等の性能を実現

Fireworks Researchが新しい専門特化型AI モデル「Ember-1」を発表。Kimi K3をベースに構築され、トークン使用量を40%削減しながら同等の品質を提供する。

## 新モデルの概要

Fireworks Researchは2026年9月23日、Ember-1を発表した。このモデルはKimi K3をベースに開発され、Kimi K3と同等の品質を40%少ないトークン数で提供する。開発には50以上の訓練実験と200以上の評価が実施された。Ember-1は外部ベンチマーク、2社との本番環境でのA/Bテスト、内部の本番運用を通じて検証された。

![Ember-1の概要](https://fireworks.ai/_next/image?url=https%3A%2F%2Fcdn.sanity.io%2Fimages%2Fpv37i0yn%2Fproduction%2Fdf5a6f5563b24d981bd4c119739a18be88e17146-1810x1208.png%3Fauto%3Dformat&w=3840&q=75)

## トークン効率化の実現メカニズム

推論モデルKimi K3は、生成トークンの90%以上を内部推論に費やしており、実際の回答には比較的少ないトークンしか割かない。Ember-1は、7つのベンチマークと2社の本番トラフィックにおいて、Kimi K3の推論を35～50%短縮させることができると判明した。このうち、内部検証では推論トークンを71.3%削減し、全体では39%のトークン削減を達成している。

## ベンチマークと実証結果

Ember-1はDoximityのBedside Benchで検証された。このベンチマークは10の専門分野にわたる500の臨床ケースを医師による検証を受けた形式である。Ember-1は、GPT-5.6 Sol、GPT-6 Astra、Claude Opus 5を含むオープンおよびクローズドモデルの中で、新たなパレート最適フロンティアを確立した。

![Bedside Benchでの評価結果](https://fireworks.ai/_next/image?url=https%3A%2F%2Fcdn.sanity.io%2Fimages%2Fpv37i0yn%2Fproduction%2F7dc4ddef2dc6aadfc3590fc9d4c45f499f743200-1564x1048.png%3Fauto%3Dformat&w=3840&q=75)

## 実運用での導入実績

2社との本番環境でのA/Bテストでは、Ember-1は同等の品質を保ちながら、タスク当たり約35%少ないトークン数を提供した。既に1社の顧客がEmber-1を本番運用中であり、ベースモデルに完全に置き換える計画を進めている。Fireworks社の内部開発者も日常的なコーディング作業でEmber-1を使用しており、切り替えに気づかなかったとされる。

![パフォーマンス比較](https://fireworks.ai/_next/image?url=https%3A%2F%2Fcdn.sanity.io%2Fimages%2Fpv37i0yn%2Fproduction%2F7fd5a909f34a9100146cb676368a371c34d388fe-2757x1777.png%3Fauto%3Dformat&w=3840&q=75)

## 提供方法

Ember-1はServerlessでResearch Previewリリースとしてロールアウトされ、ベースモデルのKimi K3と併行して利用可能となる。また、Fireworksは新しい研究リリース制度を導入し、開発者に新しい研究モデルへの2週間のServerlessアクセスを提供する。

## 筆者の見立て

- K3を最もコスト効率よく実行する方法は、思考量を減らすことではなく、Ember-1を実行することであると解釈している。
- エージェントベースのコーディングやその他の推論トークンがコストの大部分を占めるワークロードにおいて、同等の品質を約半分のトークンコストで提供することが可能であることを示唆している。
- トークン効率化がFireworksのテーマになっていることを論じている。
- 今後のオープンモデルは特定のワークロードで訓練された専門特化型モデルであると予想している。

*この記事は元記事の事実のみに基づいて自動生成されました。*

## 出典

Fireworks AI「Introducing Ember-1」
https://fireworks.ai/blog/ember-1
