---
source_url: https://inference-docs.cerebras.ai/models/overview
source_title: "Model Catalog - Cerebras Inference"
source_site: "Cerebras Inference"
hero_image: https://cerebras-inference.mintlify.app/mintlify-assets/_next/image?url=%2F_mintlify%2Fapi%2Fog%3Fdivision%3DDocumentation%26title%3DModel%2BCatalog%26description%3DBrowse%2Ball%2Bmodels%2Bavailable%2Bon%2BCerebras%2Bpublic%2Bendpoints.%26theme%3D0d969de00f05bf51f42e2bb2&w=1200&q=100
tags: cerebras,ai-models,inference
generated_at: 2026-09-03T20:00:50.187Z
model: claude-haiku-4-5
---
# Cerebasが公開エンドポイントで複数の大規模言語モデルを提供

Cerebasは公開APIエンドポイントを通じて、OpenAI GPT OSSおよびQwen 3.8 27Bを含むオープンソースモデルのカタログを提供している。同社は保存時に選択的な重みのみの量子化を適用する一方で、活性化、注意機構、KVキャッシュは全精度で維持する。

Cerebasの公開エンドポイントで利用可能なモデルは、無料トライアルおよび従量課金制の両ティアで提供されており、レート制限と料金の対象となる。提供されるすべてのモデルは、オリジナルの未剪定版である。

## 提供モデルとコンテキスト長

OpenAI GPT OSSは120億パラメータモデルで、無料ティアで65kトークンのコンテキスト長、有料ティアで131kトークンのコンテキスト長に対応する。処理速度は3000 tokens/sである。一方、Qwen 3.8 27Bは27億パラメータモデルで、無料ティアで64kトークン、有料ティアで128kトークンのコンテキスト長を備え、処理速度は1500 tokens/sとされている。

## 量子化と重み保存

Cerebasは保存時に選択的な重みのみの量子化を採用しており、重みを16ビット、8ビット、または4ビットの部分的な形式で保存する。敏感な層については全精度で保存され、実行時にオンザフライで逆量子化される。活性化、注意機構、KVキャッシュは全精度のままで量子化されない。

## 剪定モデルの研究と配布

Cerebasは REAP（Router-weighted Expert Activation Pruning）などの剪定技術に関する研究を実施している。REAPから得られた剪定モデルはHugging Faceで研究コミュニティに共有されているが、公開API経由では利用できない。Cerebasは既存のすべてのエンドポイントでオリジナルモデルを提供することにコミットしており、モデルアーキテクチャを剪定により変更していない。

*この記事は元記事の事実のみに基づいて自動生成されました。*

## 出典
Cerebras Inference「Model Catalog - Cerebras Inference」https://inference-docs.cerebras.ai/models/overview（Hugging Face の報道による）
