it.xnews.jp
出典: Mistral AI 生成: 2026-08-04 読了 約 2 分 model: claude-haiku-4-5 原文: https://mistral.ai/news/shieldstral/ raw.md

Mistral AIがShieldstralを発表、ポリシー適応型の安全分類器

Mistral AIが3Bパラメータの開放重みマルチモーダル安全分類器「Shieldstral」をApache 2.0ライセンスの下で公開した。このモデルはテキストと画像の安全性評価を統一し、推論時にプレーンテキストのポリシーを受け入れることで、再学習なしにコンテンツモデレーションを実行する。

同規模のモデルと比べて最大7倍のサイズのモデルに匹敵またはそれ以上の性能を実現し、単一の16GB NVIDIA GPUで動作する。

リリース内容

Mistral AIは、コンテンツモデレーションを二項質問応答タスクとして設計したShieldstralを、Open Secure AI Allianceへのメンバーシップアクティビティとしてリリースした。NVIDIAを含む複数の組織との提携における初期メンバーとして位置付けられている。

技術的特性

Shieldstralは3Bパラメータの軽量設計ながら、テキストおよびマルチモーダルモデレーションにおいて最大7倍のサイズのオープンガード系モデルと同等またはそれ以上の性能を発揮する。単一の推論パスから校正された安全スコアを返却し、インフラストラクチャの要件を最小化している。

推論時に「このコンテンツは保護対象グループへの暴力を促進しているか?」「この画像は未成年者に見せても安全か?」「アシスタントはリクエストを拒否したか?」といったプレーンテキストのポリシーを直接入力でき、モデルの再学習やファインチューニングなしにポリシー変更に対応できる。

実装の柔軟性

同じコンテンツでも、サイバーセキュリティ研究ツールでは許容可能だが、メンタルヘルスプラットフォームでは有害となるなど、製品やユーザー層、時間軸に応じて適切な判定が必要である。Shieldstralの設計は、単一の固定分類体系で全製品を対応させるのではなく、コンテキストに適応するモデレーションを実現する方式として機能する。

この記事は元記事の事実のみに基づいて自動生成されました。

出典

Mistral AI「Introducing Shieldstral.」https://mistral.ai/news/shieldstral/

この記事をシェア