AI倫理・規制・セキュリティ

AI の安全制限を外した「無検閲モデル」、HuggingFace 上で 3,471 件を確認

AI の安全制限を外した「無検閲モデル」、HuggingFace 上で 3,471 件を確認
文字サイズ

AI モデルから安全制限を意図的に取り除いた「無検閲モデル」の広がりを調査した論文が、2026 年 9 月 4 日に arXiv へ公開されました。研究機関 10a Labs の Juliette Garcia ら 8 名によるもので、モデルの生産から配布・活用に至る一連の流れを体系的に分析しています。

調査期間である 2024 年 1 月から 2026 年 3 月の間に、AI モデル共有プラットフォーム HuggingFace 上で 3,471 件の無検閲モデルが確認されました。それらは平均 2.4 回にわたって別形式に変換・再配布されており、派生物を含む総数は 8,164 件に上ります。うち 52% をわずか 3 者が手がけており、ごく少数の提供者がこうした無検閲モデルの配布を行なっている実態が浮かび上がっています。

安全制限の除去には主に 3 つの手法が使われています。モデル内部の「断り動作」を無効化する処理、有害な要求も受け入れるよう再学習させる手法、そして制限の緩いモデルを既存モデルに組み合わせる手法です。特に最初の手法は高度な専門知識や大規模な計算設備を必要とせず、EU の規制基準が定める「重大な改変」にも該当しないため、現行の規制では事実上取り締まれないという問題があります。

安全制限の有無による影響は数字にも表れています。改変前のモデルが危険なリクエストに応じた割合は平均 19.2% でしたが、改変後は平均 80.0% まで跳ね上がります。一般に AI モデルはパラメータ数が多いほど高性能とされますが、安全制限の除去においてはモデルの規模はほぼ関係なく、比較的小さなモデルでも改変後の危険性は大型モデルと変わらないことも示されています。つまり、入手しやすい小型モデルを改変するだけで、大型モデルと同程度に有害なリクエストへ応じるようになるということです。

懸念されるのは、一度広まったモデルが簡単には消せない点です。元のファイルが削除されても、形式を変えてコピーされたものが別のサービス上に残り続ける仕組みになっています。RAND の 2026 年報告書は、こうしたモデルが生物兵器の開発に悪用される現実的なリスクがあると指摘しており、その対策を担う保護措置は国や企業によってバラバラなままだと警告しています。

オープンウェイトモデルは構造上、提供者側が利用状況を把握・管理することができません。RAND はサプライチェーン全体を見渡した多層的な防衛策を提言していますが、業界・政策立案者が足並みをそろえた実効性ある対策を打ち出せるかどうかが、今後の焦点となっています。