it.xnews.jp
出典: The Cloudflare Blog 原文公開: 2026-08-03 生成: 2026-08-04 読了 約 4 分 model: claude-haiku-4-5 原文: https://blog.cloudflare.com/smaller-faster-safer-models/ raw.md

Cloudflareが大規模言語モデルの効率的な実行に向けた3つの最適化手法を発表

TL;DRについて、Cloudflareは2026年8月3日にWorkers AI上でKimi K-seriesおよびGLMモデルを実行するための3つの最適化手法を発表しました。KVキャッシュの量子化、モデルの重みの圧縮、キャッシュ整合性チェックにより、精度を損なわずにコストを削減し、スケーラビリティを向上させます。

Cloudflareはデータセンター内のGPUで推論を実行するWorkers AIプラットフォーム上で、Moonshootの「Kimi」およびZ.aiの「GLM」といった大規模言語モデルをサポートしています。これらは「長いコンテキストに対応したミクスチャー・オブ・エキスパーツモデルであり、使い勝手が優れている一方で、メモリ制約の問題から効率的に提供することが非常に困難」とされています。

KVキャッシュの量子化

Cloudflareが実装した最初の最適化は、キャッシュの精度を16ビット浮動小数点数(BF16)から8ビット浮動小数点数(FP8)に変更することです。「キャッシュにより、モデルは長い会話を拡張でき、新しいトークンが生成されるたびに全コンテキストを再度読み取る必要がなくなる」機能を維持しながら、キャッシュサイズを半減させます。

Kimi K2.6では、BF16キャッシュで686000トークンのコンテキスト長に対応していたのに対し、FP8量子化により1.37 millionトークンが可能になります。また「長いコンテキストモデルの場合、キャッシュはすぐに増加し、通常はモデルの重みではなくKVキャッシュがGPUメモリを最初に満杯にする」という制約が緩和されます。FP8キャッシュは64の並行リクエスト時に2192 tokens per secondのスループットを達成し、BF16のピークより41%の向上を実現しており、1トークンあたりのコスト削減は30%に達します。

モデル重みの圧縮とメモリ効率化

GLM 5.2について、Cloudflareは8ビット浮動小数点の重みを4ビット整数(INT4)に圧縮する手法を実装しています。チェックポイントサイズは705 GBから421 GBへ縮小され、約40%の圧縮比を達成します。8方向テンソル並列展開での1GPU当たりのメモリ使用量は88 GBから52 GBへ削減されます。

INT4圧縮によって「トークン生成時にモデルの重みをGPUメモリからストリーミングするため、デコード速度はメモリ帯域幅に制限される」という制約が改善され、メモリ帯域幅要件の削減によりデコードフェーズが高速化します。一方で「プリフィルはメモリ帯域幅ではなく計算バウンドであるため、ここではキャッシュをBF16に保持して、わずかに高いスループットを維持する」戦略を採用しています。Cloudflareはプリフィルに対してはFP8、デコードに対してはINT4を実行する分散設計を採用しており、INT4での圧縮後も1.18 millionトークンのKVキャッシュ容量が実現されます。

プリフィルのスループットはFP8で10160 tokens per second、INT4で8660 tokens per secondであり、評価スイート全体ではINT4とFP8の重みは識別不可能とされています。精度面での最大差分は0.8ポイントに留まります。

キャッシュ整合性チェックの実装

複数のリクエスト間で共有されるキャッシュページを保護するため、Cloudflareはキャッシュ整合性チェックを実装しました。各物理キャッシュページには再割り当てされるたびに変更されるタグが割り当てられ、「何か一致しない場合、影響を受けたリクエストは中止され、間違ったページからのデータが返されることはない」仕組みになっています。

「検証を注目カーネルに統合せず、個別バッチチェックとして実行することで計算コストを低く保った。GPUスレッドグループ間の競合が発生する可能性があるため」という設計上の配慮がされており、Cloudflareの要求量では「10億分の1の確率で定期的に表示されるエラーの閾値」に対応します。整合性チェックのオーバーヘッドは1%の閾値内に収まり、並行性1でのスループット変化は0.53%、p95レイテンシの変化は0.42%に限定されています。

Cloudflareはオープンソースの推論サービスフレームワークであるSGLangを使用しており、SGLangチームと密接に協力してパッチと新機能をアップストリームに提供しています。

この記事は元記事の事実のみに基づいて自動生成されました。

出典

The Cloudflare Blog「Smaller, faster, safer: running Kimi and GLM at scale」 https://blog.cloudflare.com/smaller-faster-safer-models/ (SGLang、NVIDIAの報道による)

この記事をシェア