
Fermion Research が Neutrino-1 8B をリリース:3.88 GB で 8B パラメータ LLM
Fermion Research は 2026-07-27、8.19B パラメータの軽量言語モデル Neutrino-1 8B をリリースした。独自の三進数系ウェイト形式により、モデル全体を 3.88 GB に圧縮し、データセンター GPU から MacBook、デスクトップ CPU まで幅広いプラットフォームでの実行を実現する。
モデルの仕様と構成
Neutrino-1 8B は、36 層のデコーダと 252 個のトランスフォーマー線形層で構成されるデコーダ専用トランスフォーマーである。252 個の線形層すべてが、fp16 の 8 分の 1 のサイズである独自の三進数系ウェイト形式で保存されている。ウェイトは圧縮状態で保持され、行列カーネル内でデコードされる仕組みだ。
モデルのアーキテクチャは、隠れ層幅 4,096、ヘッド幅 128、コンテキスト長 40,960 トークンを備えている。語彙サイズは 151,936 である。圧縮前のウェイトのうち、6.95B パラメータが符号化投影ウェイトで、1.24B パラメータが int8 埋め込みである。符号化ウェイトの 62.63 パーセントはゼロ値である。
パフォーマンス評価
MMLU では 5 ショット、全 57 科目、14,042 項目での評価で 72.1 点を獲得した。その他のベンチマークでは MMLU-Redux 67.8、IFEval(プロンプト厳密)77.2、IFEval(命令厳密)80.2、BFCL v3 68.9、GSM8K(柔軟な抽出)53.4、GSM8K(指定形式)51.73 を記録している。
デプロイメント時の処理速度
単一ストリーム デコード速度はプラットフォームと最適化手法によって大きく異なる。NVIDIA H100 では通常のデコードで 396 tok/s、ドラフティング使用時には 763 tok/s を達成する。NVIDIA L4 では GGUF 形式で 4k トークンコンテキスト時に 30.7 tok/s、Apple M5 MacBook では MLX で最適化した場合に 33.7 tok/s、CPU 専用では 24.9 tok/s である。
メモリ効率とファイルサイズ
ダウンロードサイズは 2,559,822,594 バイト(2.56 GB)で、ディスク上では 3,875,404,812 バイト(3.88 GB)となる。3.88 GB の作業セットは、同じメモリシステム上で 16 GB の fp16 モデルに対して単一ストリームデコードで到達不可能なレート達成可能である。モデル全体は KV キャッシュを含めて 8 GB GPU または 16 GB ノートパソコンの横に収まる。グループ化クエリアテンションはクエリ幅の 4 分の 1、トークンあたり 144 KiB の fp16 でキャッシュを保持し、4000 トークンセッションで 0.60 GB のキャッシュを必要とする。
ライセンスと利用可能性
Neutrino-1 8B は Apache License 2.0 でライセンスされており、商用利用、改変、ファインチューニング、再配布が許可されている。ベースモデルは Alibaba Cloud Qwen3-8B である。
この記事は元記事の事実のみに基づいて自動生成されました。
出典
Fermion Research「Neutrino-1 8B」https://www.fermionresearch.com/models/neutrino-8b/