
Reflectionが501Bパラメータの疎なMoE言語モデル「Beam」を発表
Reflectionは、コーディングとエージェント タスク向けに最適化された疎なMixture-of-Experts言語モデル「Beam」を発表した。501億のパラメータを持つこのモデルは、今月中にApache 2.0ライセンスでリリースされる予定である。
モデルの仕様と訓練方法
Beamは501億のパラメータを備え、うち23億がアクティブなパラメータである。同社は多様で厳選された高品質なトークン23.8兆個を使用してプリトレーニングを実施した。このトークンはウェブおよびプロプライエタリなライセンス取得データセットから取得されている。
Beamの訓練には10.5KのNVIDIA GB300 GPUを使用した4週間の高コンピュート強化学習が実施され、100万回を超えるロールアウトが生成された。プリトレーニングは6,144個のNVIDIA GB300 NVL72 GPUからなるクラスタで4週間以内に完了し、プリトレーニング終盤で92.3%のグッドプット率を達成した。さらに訓練中盤に有効なコンテキスト長を1M トークンに拡張された。

インフラストラクチャと運用
訓練中、1.3億個のサンドボックスが訓練とグレーディングに使用された。強化学習用には主に合成データパイプラインを通じて100万近くの環境が構築された。最大170Kの並行サンドボックスが実行中にサポートされ、10億を超えるサンドボックス作成リクエストが処理された。
推論フリートへの新しいウェイト配布は約12秒の中央値で実現され、訓練ジョブを終了することなく71回の推論インシデントに対応した。障害後の推論キャパシティの回復には中央値で8分を要し、経過サービスGPU分のシェアとしてのロストキャパシティは0.02%であった。

性能と最適化
Beamはコーディングとエージェント タスク向けに設計され、推論効率において優れた性能を発揮するとされている。推論ベンチマークでは、推論コンピュートの使用量がGLM-5.2比で3~4倍少ないと報じられている。プリトレーニング完了時の最も負荷の高いエキスパートの負荷は平均の1.04倍であり、ほぼ均一なエキスパート利用を実現した。
データ品質の処理では、インターネットトークンの95%が除去され、従来の手法では見落とされたはずの1.8兆個の高品質トークンが保持された。キュレーションされたウェブコードトークンは全体の87%を占める。
リリース予定
Beamは現在最終的なレッドティーミングと評価の段階にあるとされている。ウェイト、テクニカルレポート、モデルカード、および開発者アーティファクトは今月中にリリースされる予定である。ライセンスはApache 2.0となる。
この記事は元記事の事実のみに基づいて自動生成されました。
出典
Reflection、「Introducing Beam: Reflection's 501B open-weight model — Reflection」、https://reflection.ai/blog/introducing-beam