---
source_url: https://mistral.ai/news/shieldstral/
source_title: "Introducing Shieldstral. | Mistral AI"
source_site: "Mistral AI"
hero_image: https://mistral.ai/cms-media/api/media/file/Thumbnail-Model%3DShieldstral.jpg
tags: content-moderation,ai-safety,open-source
generated_at: 2026-08-04T20:01:12.822Z
model: claude-haiku-4-5
---
# Mistral AIがShieldstralを発表、ポリシー適応型の安全分類器

Mistral AIが3Bパラメータの開放重みマルチモーダル安全分類器「Shieldstral」をApache 2.0ライセンスの下で公開した。このモデルはテキストと画像の安全性評価を統一し、推論時にプレーンテキストのポリシーを受け入れることで、再学習なしにコンテンツモデレーションを実行する。

同規模のモデルと比べて最大7倍のサイズのモデルに匹敵またはそれ以上の性能を実現し、単一の16GB NVIDIA GPUで動作する。

## リリース内容

Mistral AIは、コンテンツモデレーションを二項質問応答タスクとして設計したShieldstralを、Open Secure AI Allianceへのメンバーシップアクティビティとしてリリースした。NVIDIAを含む複数の組織との提携における初期メンバーとして位置付けられている。

## 技術的特性

Shieldstralは3Bパラメータの軽量設計ながら、テキストおよびマルチモーダルモデレーションにおいて最大7倍のサイズのオープンガード系モデルと同等またはそれ以上の性能を発揮する。単一の推論パスから校正された安全スコアを返却し、インフラストラクチャの要件を最小化している。

推論時に「このコンテンツは保護対象グループへの暴力を促進しているか？」「この画像は未成年者に見せても安全か？」「アシスタントはリクエストを拒否したか？」といったプレーンテキストのポリシーを直接入力でき、モデルの再学習やファインチューニングなしにポリシー変更に対応できる。

## 実装の柔軟性

同じコンテンツでも、サイバーセキュリティ研究ツールでは許容可能だが、メンタルヘルスプラットフォームでは有害となるなど、製品やユーザー層、時間軸に応じて適切な判定が必要である。Shieldstralの設計は、単一の固定分類体系で全製品を対応させるのではなく、コンテキストに適応するモデレーションを実現する方式として機能する。

*この記事は元記事の事実のみに基づいて自動生成されました。*

## 出典

Mistral AI「Introducing Shieldstral.」https://mistral.ai/news/shieldstral/
