---
source_url: https://www.fermionresearch.com/models/neutrino-8b/
source_title: "Neutrino-1 8B"
source_site: "Fermion Research"
hero_image: https://fermionresearch.com/images/og/neutrino-8b.jpg
tags: machine-learning,ai-models,llm
generated_at: 2026-07-28T08:00:40.068Z
model: claude-haiku-4-5
---
# Fermion Research が Neutrino-1 8B をリリース：3.88 GB で 8B パラメータ LLM

Fermion Research は 2026-07-27、8.19B パラメータの軽量言語モデル Neutrino-1 8B をリリースした。独自の三進数系ウェイト形式により、モデル全体を 3.88 GB に圧縮し、データセンター GPU から MacBook、デスクトップ CPU まで幅広いプラットフォームでの実行を実現する。

## モデルの仕様と構成

Neutrino-1 8B は、36 層のデコーダと 252 個のトランスフォーマー線形層で構成されるデコーダ専用トランスフォーマーである。252 個の線形層すべてが、fp16 の 8 分の 1 のサイズである独自の三進数系ウェイト形式で保存されている。ウェイトは圧縮状態で保持され、行列カーネル内でデコードされる仕組みだ。

モデルのアーキテクチャは、隠れ層幅 4,096、ヘッド幅 128、コンテキスト長 40,960 トークンを備えている。語彙サイズは 151,936 である。圧縮前のウェイトのうち、6.95B パラメータが符号化投影ウェイトで、1.24B パラメータが int8 埋め込みである。符号化ウェイトの 62.63 パーセントはゼロ値である。

## パフォーマンス評価

MMLU では 5 ショット、全 57 科目、14,042 項目での評価で 72.1 点を獲得した。その他のベンチマークでは MMLU-Redux 67.8、IFEval（プロンプト厳密）77.2、IFEval（命令厳密）80.2、BFCL v3 68.9、GSM8K（柔軟な抽出）53.4、GSM8K（指定形式）51.73 を記録している。

## デプロイメント時の処理速度

単一ストリーム デコード速度はプラットフォームと最適化手法によって大きく異なる。NVIDIA H100 では通常のデコードで 396 tok/s、ドラフティング使用時には 763 tok/s を達成する。NVIDIA L4 では GGUF 形式で 4k トークンコンテキスト時に 30.7 tok/s、Apple M5 MacBook では MLX で最適化した場合に 33.7 tok/s、CPU 専用では 24.9 tok/s である。

## メモリ効率とファイルサイズ

ダウンロードサイズは 2,559,822,594 バイト（2.56 GB）で、ディスク上では 3,875,404,812 バイト（3.88 GB）となる。3.88 GB の作業セットは、同じメモリシステム上で 16 GB の fp16 モデルに対して単一ストリームデコードで到達不可能なレート達成可能である。モデル全体は KV キャッシュを含めて 8 GB GPU または 16 GB ノートパソコンの横に収まる。グループ化クエリアテンションはクエリ幅の 4 分の 1、トークンあたり 144 KiB の fp16 でキャッシュを保持し、4000 トークンセッションで 0.60 GB のキャッシュを必要とする。

## ライセンスと利用可能性

Neutrino-1 8B は Apache License 2.0 でライセンスされており、商用利用、改変、ファインチューニング、再配布が許可されている。ベースモデルは Alibaba Cloud Qwen3-8B である。

*この記事は元記事の事実のみに基づいて自動生成されました。*

## 出典

Fermion Research「Neutrino-1 8B」https://www.fermionresearch.com/models/neutrino-8b/
