it.xnews.jp
出典: Reflection 生成: 2026-10-05 読了 約 3 分 model: claude-haiku-4-5 原文: https://reflection.ai/blog/introducing-beam raw.md

Reflectionが501Bパラメータの疎なMoE言語モデル「Beam」を発表

Reflectionは、コーディングとエージェント タスク向けに最適化された疎なMixture-of-Experts言語モデル「Beam」を発表した。501億のパラメータを持つこのモデルは、今月中にApache 2.0ライセンスでリリースされる予定である。

モデルの仕様と訓練方法

Beamは501億のパラメータを備え、うち23億がアクティブなパラメータである。同社は多様で厳選された高品質なトークン23.8兆個を使用してプリトレーニングを実施した。このトークンはウェブおよびプロプライエタリなライセンス取得データセットから取得されている。

Beamの訓練には10.5KのNVIDIA GB300 GPUを使用した4週間の高コンピュート強化学習が実施され、100万回を超えるロールアウトが生成された。プリトレーニングは6,144個のNVIDIA GB300 NVL72 GPUからなるクラスタで4週間以内に完了し、プリトレーニング終盤で92.3%のグッドプット率を達成した。さらに訓練中盤に有効なコンテキスト長を1M トークンに拡張された。

Beam訓練の概要

インフラストラクチャと運用

訓練中、1.3億個のサンドボックスが訓練とグレーディングに使用された。強化学習用には主に合成データパイプラインを通じて100万近くの環境が構築された。最大170Kの並行サンドボックスが実行中にサポートされ、10億を超えるサンドボックス作成リクエストが処理された。

推論フリートへの新しいウェイト配布は約12秒の中央値で実現され、訓練ジョブを終了することなく71回の推論インシデントに対応した。障害後の推論キャパシティの回復には中央値で8分を要し、経過サービスGPU分のシェアとしてのロストキャパシティは0.02%であった。

インフラストラクチャ配置の詳細

性能と最適化

Beamはコーディングとエージェント タスク向けに設計され、推論効率において優れた性能を発揮するとされている。推論ベンチマークでは、推論コンピュートの使用量がGLM-5.2比で3~4倍少ないと報じられている。プリトレーニング完了時の最も負荷の高いエキスパートの負荷は平均の1.04倍であり、ほぼ均一なエキスパート利用を実現した。

データ品質の処理では、インターネットトークンの95%が除去され、従来の手法では見落とされたはずの1.8兆個の高品質トークンが保持された。キュレーションされたウェブコードトークンは全体の87%を占める。

リリース予定

Beamは現在最終的なレッドティーミングと評価の段階にあるとされている。ウェイト、テクニカルレポート、モデルカード、および開発者アーティファクトは今月中にリリースされる予定である。ライセンスはApache 2.0となる。

この記事は元記事の事実のみに基づいて自動生成されました。

出典

Reflection、「Introducing Beam: Reflection's 501B open-weight model — Reflection」、https://reflection.ai/blog/introducing-beam

この記事をシェア