
Mistral Large 4 公開プレビュー開始、1兆パラメータのマルチモーダルモデル
Mistralは10月6日、1兆パラメータを持つマルチモーダルAIモデル「Mistral Large 4」(ML4)の公開プレビューを発表した。同社のヨーロッパ拠点のデータセンターで3,800個のNVIDIA Grace Blackwell GPUを用いて学習され、月末までにウェイトが公開される予定である。
ML4は、セキュリティテストで高スコアを記録し、複数の業務自動化ベンチマークで競争力のある性能を示す。€3 billion の Series D ラウンドで調達した資金に基づいており、この資金ラウンドはヨーロッパの技術企業が獲得した最大規模の株式ラウンドである。
モデルの仕様と学習体制
ML4は49 billion のアクティブパラメータを持つネイティブマルチモーダルモデルである。160以上の言語を含む多言語学習データで構成され、欧州連合のすべての公用語を含む。Mistralの欧州拠点のデータセンターで学習されており、3,800個のNVIDIA Grace Blackwell GPUが利用された。
公開プレビューAPIはMistral Studioで本日より利用可能であり、ウェイトは月末までにリリースされる予定である。モデルはサイバーセキュリティの専門家、検証済みのパートナー、および州当局とのレッドチーミングを実施中である。
%201_20jgWu.webp?dpl=6ac516f190c69e0008d46233)
セキュリティ性能
ML4はArtificial Analysis Cyber Indexで82%のスコアを記録した。同テストでは、公開ソフトウェア内の実際の脆弱性を再現し、修正することが求められる。Cybenchセキュリティチャレンジでは93%を達成した。
Lakera の B3 AI Security Benchmark では93.3%の攻撃耐性を示した。内部テストでは、ML4がマルウェア分析、脆弱性の優先順位付け、検出ルールの作成に有用であることが実証されている。これに対し、Claude Opus 5.5 およびGPT-6 Astraを含む主要なクローズドモデルは脆弱性再現テストで0に近いスコアを記録しており、タスクの実行を拒否するためとみられる。
コード生成と自動化性能
ML4はDeepSWE v1.1で61.7%、SWE-Atlas-QnAで59.4%を達成した。Terminal-Bench 4では28.3%のスコアを記録し、Coding Agent Indexの総合スコアは49.8%である。

AutomationBench で は657の業務ワークフローのテストに対して59.9%を達成した。AA-Briefcase長期知識作業評価ではEloスコア1,393を獲得した。vals.aiは代表的な法律・金融タスクでML4を評価した。Dense 200ビジュアルグラウンディングベンチマークでは42%のスコアを記録し、KORA Benchmark では2.0満点中1.691を達成した。
-alt_ZYLgs8.webp?dpl=6ac516f190c69e0008d46233)

人間評価と国際展開
Surge AI による盲検人間評価では、ML4プレビューは5つのモデル中第2位で3.74を記録した。第1位はClaude Opus 5で4.22であった。
ML4はヨーロッパを含む複数地域での世界規模な展開予定である。Mistralは€3 billion のSeries Dラウンドを調達しており、これはヨーロッパの技術企業が獲得した最大規模の株式ラウンドである。

筆者の見立て
- ML4は、新世代の特化・最適化されたMistralモデルの基盤となるとしている
- 学習の継続に伴い、改善の余地が実質的に存在することを示唆している
- 今後数週間から数か月間の大規模かつ迅速な改善が見込まれると予想している
- この先の進捗ペースは速くなるとしている
この記事は元記事の事実のみに基づいて自動生成されました。
出典
Mistral「Introducing Mistral Large 4」https://mistral.ai/news/mistral-large-4/