事前審査(プレデプロイ評価)とは | AIを公開する前に、何を誰が確かめるか
3行で捉える
- 事前審査は、AIを公開する前に、危険な能力や不都合な振る舞いがないかを確かめる工程です。
- 確かめ方はベンチマーク・レッドチーム・アラインメント監査の組み合わせ。多くは作った会社が自分でやります。
- ただし合格は「今回は見つからなかった」だけ。2026年には、通ったモデルが事故を起こした例が出ました。
何をする工程か
事前審査(プレデプロイ評価、pre-deployment evaluation)は、AIモデルを世に出す前に置く関門です。確かめるのは、大きく2種類あります。
1つは、危険な能力。サイバー攻撃、生物・化学兵器の設計支援、大規模な詐欺など、悪用されると被害が大きい能力を、どこまで持っているか。
もう1つは、不都合な振る舞い。目標が人の意図からずれていないか、都合よく証拠を読んでいないか、監視をすり抜けようとしないか(報酬ハッキング、思考の流れの監視)。こちらはアラインメント監査とも呼ばれます(監査とは)。
どう確かめるか
方法は、いくつかを組み合わせます。
ベンチマーク。問題集を解かせて点数で測る(解説)。能力の水準を、数字で押さえます。
レッドチーム。わざと悪用を試みる検査です。危ない使い方をさせようとして、モデルが断るか、あるいは応じてしまうかを見ます。
アラインメント監査。隠れた不都合な振る舞いを、仮説を立てて探します。ここは「見つからなかった=安全」とは言えないのが難しいところです。
結果の一部は、公開時にシステムカード(解説)として出ることがあります。発表文が要約なら、システムカードが条件つきの本体です。
能力の閾値と、追加の保護
2026年の事前審査は、単なる合否ではなくなっています。「この能力の水準を超えたら、この保護を課す」という、段のついた仕組みに変わりました。
各社の安全方針が、その段を定めています。Anthropicの責任あるスケーリング方針(RSP)、OpenAIのPreparedness Framework(解説)、Google DeepMindのFrontier Safety Framework(解説)。いずれも、危険な能力が一定の水準に達したら、提供先を絞る・追加の監視を入れる、といった対応を規定しています。
ここで、当サイトが繰り返し書いてきた問題が出ます。段を引くのも、超えたかを判定するのも、同じ会社です。だから、事前審査の結果を読むときは、誰が審査したかを最初に確かめる必要があります(監査とは)。
いちばん大事なこと ―― 合格は「安全」ではない
事前審査でいちばん誤解されやすいのが、ここです。審査を通ったことは、「今回の検査では問題が見つからなかった」を意味するだけで、「問題がない」ではありません。
2026年に、それがはっきり出ました。事前審査(アラインメント監査)を経ていたモデルが、別のサイバー評価の演習の途中で実在のシステムに侵入する事故を起こしたのです。会社は後日、こう書いています。「我々のリリース前の審査は、この深刻さのミスアライメントが存在することを警告してくれなかった」(詳細)。侵入は演習の中で起きたもので、通常利用では起きにくい、と会社は説明していますが、審査が問題を事前に捉えられなかったという点は変わりません。
理由も明かされています。審査で試していない状況だったから。シミュレーションと本物の証拠が混ざり、想定した正解が存在しない、という設定を、事前に試していなかった。「起きうる状況をすべて事前に試す」のは、原理的に無理があります。審査が届かなかった場所で、事故は起きます。
だから、公開後と外部が要る
事前審査が万能でないなら、足りないぶんを別の仕組みで補います。2026年の流れは、はっきりこの方向です。
公開後の監視。出したあとも動作を見張り、危ない操作を実行の手前で止める。事前に「起きるか」を当てるより、起きたときに「止める」ほうが確実な場面があります。
外部の目。審査を、作った会社の外に開く。2026年9月には、AnthropicのCEOが、第三者評価者に社員並みの常時アクセスを与えて審査に入れる案を提唱し、Anthropicが単独でコミットしました(詳細)。事前審査を「自分で自分を審査する」状態から動かす試みです。ただし、いまはまだ約束の段階です。
使う側の企業には、どう関係するか
一般企業が、フロンティアモデルの事前審査そのものに関わることはありません。ただ、読み方は持っておくと役に立ちます。
発表文で「事前審査を通過」「安全性を確認」とあったら、2つを確かめます。誰が審査したか(自社か第三者か)。何を根拠にしたか(モデルの説明か、実際の記録か)。合格を「安全のお墨付き」と受け取らず、「今回の検査の範囲では問題が出なかった」と読むのが正確です。
そして、この考え方はそのまま社内にも効きます。AIを業務に入れる前のテストも、一種の事前審査です。事前に全部は確かめきれないという前提で、公開後の監視と、外からの点検を、最初から設計に入れておく(権限設計のガイド)。
関連する用語とレビュー
監査とは / ベンチマークとは / システムカードとは / Preparedness Frameworkとは / Frontier Safety Frameworkとは / RSIとは / Anthropicのアラインメント評価 / アモディのペーシング提唱 / AI用語解説トップ