
Mistral AIがShieldstralを発表、ポリシー適応型の安全分類器
Mistral AIが3Bパラメータの開放重みマルチモーダル安全分類器「Shieldstral」をApache 2.0ライセンスの下で公開した。このモデルはテキストと画像の安全性評価を統一し、推論時にプレーンテキストのポリシーを受け入れることで、再学習なしにコンテンツモデレーションを実行する。
同規模のモデルと比べて最大7倍のサイズのモデルに匹敵またはそれ以上の性能を実現し、単一の16GB NVIDIA GPUで動作する。
リリース内容
Mistral AIは、コンテンツモデレーションを二項質問応答タスクとして設計したShieldstralを、Open Secure AI Allianceへのメンバーシップアクティビティとしてリリースした。NVIDIAを含む複数の組織との提携における初期メンバーとして位置付けられている。
技術的特性
Shieldstralは3Bパラメータの軽量設計ながら、テキストおよびマルチモーダルモデレーションにおいて最大7倍のサイズのオープンガード系モデルと同等またはそれ以上の性能を発揮する。単一の推論パスから校正された安全スコアを返却し、インフラストラクチャの要件を最小化している。
推論時に「このコンテンツは保護対象グループへの暴力を促進しているか?」「この画像は未成年者に見せても安全か?」「アシスタントはリクエストを拒否したか?」といったプレーンテキストのポリシーを直接入力でき、モデルの再学習やファインチューニングなしにポリシー変更に対応できる。
実装の柔軟性
同じコンテンツでも、サイバーセキュリティ研究ツールでは許容可能だが、メンタルヘルスプラットフォームでは有害となるなど、製品やユーザー層、時間軸に応じて適切な判定が必要である。Shieldstralの設計は、単一の固定分類体系で全製品を対応させるのではなく、コンテキストに適応するモデレーションを実現する方式として機能する。
この記事は元記事の事実のみに基づいて自動生成されました。
出典
Mistral AI「Introducing Shieldstral.」https://mistral.ai/news/shieldstral/