it.xnews.jp
出典: PrismML 原文公開: 2026-09-17 生成: 2026-09-18 読了 約 3 分 model: claude-haiku-4-5 原文: https://prismml.com/news/bonsai-2-27b raw.md

Bonsai 2 27B:9倍圧縮で98.2%の性能を維持するAIモデル

PrismMLが三値化ウェイトを用いたマルチモーダルAIモデル「Ternary Bonsai 2 27B」をリリース。Qwen3.8 27Bをベースに、9倍の圧縮率を達成しながら全精度モデル比で98.2%の性能を保持。

リード段落をここに挿入します。PrismMLは2026年9月17日、三値化ウェイトを採用した27Bパラメータのマルチモーダルモデル「Ternary Bonsai 2 27B」をリリースした。Qwen3.8 27Bをベースにした同モデルは、9倍の圧縮を実現しながら、ベンチマークスイートで98.2%の性能保持率を達成している。

モデルの圧縮技術と仕様

Ternary Bonsai 2 27Bは、{−1, 0, +1}の三値ウェイトとFP16グループ単位スケーリングを組み合わせることで、ウェイトあたり1.76ビットの実効ビット幅を実現。その結果、総モデルサイズは5.9GBに抑制されている。同モデルは262K トークンのコンテキストウィンドウをサポートし、テキストと画像の両方の入力に対応するマルチモーダル機能を備えている。

Ternary Bonsai 2 27Bのモデル構成図

ベンチマーク性能と推論速度

Ternary Bonsai 2 27Bはベンチマークスイート全体で83.9のスコアを獲得し、推論タスクの多岐にわたる能力を実証している。内訳として、推論・数学で83.95、数学で96.57、コーディングで81.58、命令追従で82.66、エージェンティック・ツール呼び出しで77.57、ビジョンで78.59を記録。推論速度はNVIDIA GeForce RTX 5090で最大143トークン/秒、M5 Maxで46.8トークン/秒に達する。

エネルギー効率とデバイス対応

RTX 4090上でのエネルギー消費は1トークンあたり0.714mWhで、フル精度の8Bモデルと比較して40%高い効率性を実現している。Ternary Bonsai 2 27Bは、NVIDIA GPUをCUDAで、Apple デバイス(Mac、iPhone、iPad)をMLXの カスタム低ビットカーネルを通じて実行可能。モデルウェイトはApache 2.0ライセンスの下で公開されている。

企業背景と開発体制

PrismMLはCaltechの研究者チームから生まれ、Khosla Ventures、Cerberus、Googleのサポートを受けて設立。現在もSamsungから継続的な支援を受けている。同社は2ヶ月前に初代Bonsai 27Bモデルをリリースしており、Ternary Bonsai 2 27Bではより強い推論、コーディング、ビジョン、エージェンティック機能をもたらしている。

筆者の見立て

この記事は元記事の事実のみに基づいて自動生成されました。

出典

PrismML「Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint」 https://prismml.com/news/bonsai-2-27b

この記事をシェア