
Aleph Alphaが主権的ドイツ言語モデル「Kolibri」をリリース
2026年10月3日、Aleph Alphaは78.1億パラメータの混合エキスパート型大規模言語モデル「Kolibri」をApache 2.0ライセンス下で公開した。ドイツ語とイギリス英語に最適化され、EUのAI規制に対応して設計された。
Kolibriは、ドイツ・フィンランドのインフラで一から学習され、トークンあたり3.46億の活動パラメータを使用する。ドイツ語専用トークナイザー、スライディングウィンドウアテンション、ドイツ語推論能力、Merlin-Arthurプロトコルによる棄却学習、調整可能な推論努力レベルを備える。
モデルの構造と学習
Kolibriは50層で構成され、各層は384個のエキスパートに1個の共有エキスパートを加えた設計となっている。ルーターが各トークンを384個のエキスパート中6個へ送信する。学習には768個のNVIDIA B200 GPUを使用し、24兆トークンで学習された。知識カットオフは2026年6月18日である。
モデルは768 GBのメモリで重みを保持する必要があり、FP8形式では78 GBのGPU メモリが必要である。ネイティブコンテキスト長は262,144トークン、テスト済みコンテキスト長は1,048,576トークンに達する。
トークナイザーとコンテキスト能力
Kolibriのトークナイザーは、UniBPEアルゴリズムで学習された128,000語彙を備える。ドイツ語テキスト用に最適化されており、ドイツ連邦共和国基本法(185 KB)をトークン化する際、GPT-5のトークナイザーと比べて11.2%少ないトークンを必要とする。法務ドイツ語テキストではGPT-5より15%少ないトークンで処理できる。
40層はスライディングウィンドウアテンションを使用し、各トークンは前の512トークンを参照する。5層ごとに全前文を参照する構造になっている。スライディングウィンドウ層のみが回転位置埋め込みを通じてトークン位置を認識する。Aleph Alphaは1,048,576トークンまでコンテキスト拡張を検証した。
パフォーマンスと言語別対応
Kolibriは、AIME 2025ドイツ語数学テストで87.5のスコアを獲得し、NVIDIA Nemotron 3 Nanoの84.4を上回った。英語総合スコアは75.5、ドイツ語総合スコアは70.8である。AIME 2025英語テストでは96.9、未見企業文書に関する英語質問では89.7のスコアを記録した。
RULER長文脈テストでは、基盤モデルの100万トークンで63.2、128,000トークルで67.9を達成した。Omniscience テスト(Artificial Analysisの評価)では44%の確率で「知らない」と回答し、Qwen3.5 35B-A3Bの11.1%、GPT-OSS 120Bの23.7%、Qwen3.6 35B-A3Bの56.7%と比較される。
閉書籍RAG ベンチマークで51.0のスコアを記録。Berkeley Function Calling Leaderboardの多ターンツール呼び出しで39.8(GLM-4.7 Flashは58.2、Qwen3.5 35B-A3Bは54.0)。Terminal-Bench 2.1コーディングテストで27.7(Qwen3.5 35B-A3Bは39.7)。SWE-bench Verifiedで66.4(Qwen3.6 35B-A3Bは73.8)を記録した。
ドイツ語推論の強化
Aleph Alphaは約800,000個のドイツ語推論例を生成した。ドイツ語数学スコアは、ドイツ語推論データが不足していた時点で70.2から48.3に低下したが、追加のドイツ語推論データの投入により67.3へ回復した。Kolibriはドイツ語プロンプトではドイツ語で推論する。
設計と規制対応
Kolibriはドイツ語とイギリス英語のみの対応という意図的な選択がなされている。Aleph Alphaは「チームがドイツで構築し、ドイツ・フィンランドのインフラで学習し、欧州およびドイツ法下で、外国支配なく開発した」と述べている。さらに「導入の完全な自由とIP安全性により、コンプライアンスが継承属性として得られる」と説明した。
モデルはMerlin-Arthurプロトコルを使用して、「知らない」と回答するよう学習されている。Aleph Alphaは欧州連合の汎用AI行動規範に署名し、政治的バイアスについて学習データをフィルタリングした。英語ウェブテキストはGoogleのGemma 4で言い換え、ドイツ語テキストはMistral-NeMoで言い換えられた。Qwen3-32Bは品質フィルター用のデータラベリングに使用された。
利用可能性と技術要件
KolibriはvLLMプラグインでサポートされており、起動時にvLLMバージョン0.29が必要である。起動日時点では、Kolibriをホストするプロバイダーはまだ存在しない。Hugging Faceで重みが公開されており、トークン当たり4.4%のアクティブパラメータにより、比較的少ないメモリで動作する効率的な設計が実現されている。
Kolibriは4つの推論レベル(なし、低、中、高)をサポートしている。
筆者の見立て
- 「パラメータ数が少なく、問題が生じる可能性が少なく、必要な計算量が減少する小規模言語モデルが将来である」と予想している
- 「混合エキスパート型は病院全体の専門医を1つのモデルに詰め込む」と解釈している
- 「Kolibriは生成AIの3大課題(幻覚、有限コンテキスト、知識カットオフ)すべてに対抗している」と解釈している
- 「RAGが機能するには、モデルがドキュメントに答えがない場合に認めることが必須である」と解釈している
- 「Kolibriはトークナイザーの強み、100万トークンコンテキスト、ドイツ語長文書RAG用の棄却学習など、全ての強みを活かしている」と解釈している
- 「ドイツ語テキストを含むプロジェクトでドキュメントをオンプレミスに保つ必要がある場合、Kolibriが選択肢である」と述べている
- 「コーディングエージェント、メモリからの質問、ドイツ語とイギリス英語以外の言語、78 GB GPUメモリが確保できない場合、Kolibriは不適切である」と述べている
- 「78 GB GPUメモリが利用不可の場合、単一タスク向けに微調整された小規模特化モデルが引き続き選択肢である」と述べている
この記事は元記事の事実のみに基づいて自動生成されました。
出典
Tejas Kumar『Aleph Alpha Kolibri: How the Sovereign German LLM Works』https://tej.as/blog/aleph-alpha-kolibri