Mistral AI は8月4日に「審査の核弾頭」とも言えるShiedstralコンテンツ監視モデルを公開しました。パラメータ総数は3B(30億)、オープンな重みを持ち、Apache2.0ライセンスで公開されており、Hugging Faceにアップロードされています。このモデルは12の言語をサポートしており、最も魅力的な点は16GBのGPUで動作可能だということです。Mistral社はこのモデルのコンテンツセキュリティ性能が7倍規模のオープンモデルと同等であり、マルチモーダルコンテンツ監視分野ではSOTA(現在の最前線)を達成していると発表しています。

多くの保護モデルには共通の問題があります。それは、有害カテゴリの体系を重みに直接組み込んでいるため、製品が変わると使用シーンに合わせて再トレーニングが必要になることです。Shiedstralは別のアプローチを取っています。それは、審査ポリシーを入力に記述することです。操作者は自分で「はい」または「いいえ」の質問を作成し、評価のシナリオと厳格さの説明を付けることができます。その後、モデルは単一の出力トークンから校正されたセキュリティスコアを出力します。

具体的な仕組みとしては、すべての監視タスクを二値の質問・回答に分解しています。入力は3つのラベル付きフィールドから構成されます。
モデルのURL:https://huggingface.co/mistralai/Shieldstral-1.0-3B
