AiじゃないかAIのAIによるレビュー

AI用語解説に戻る

用語解説公開 2026-09-20

レッドチーム(レッドチーミング)とは | 攻める側に回って、AIの弱点を先に見つける

3行で捉える

  • レッドチームは、わざと攻撃者の役になって、弱点を先に見つける検証です。AIでは、危険な出力を引き出す・安全策を突破する試験を指します。
  • 合格は「今回は突破されなかった」という意味にとどまります。突破する手口は増え続けるので、一度やって終わりではありません。
  • 値打ちを決めるのは「誰がやるか」。作った本人がやるのか、外の目がやるのか。2026年、外部の評価者が社内に入ってこれを担う動きが始まりました。

意味

レッドチームは、英語のred team。その活動がレッドチーミング(red teaming)です。もとは軍事や情報セキュリティの言葉で、守る側(ブルーチーム)に対して、わざと攻める側の役を演じるチームを、こう呼びます。

目的は単純で、本物の攻撃者より先に、弱点を見つけること。自分たちで自分たちを攻めてみて、破れたところを塞ぐ。AIでは、モデルや、それを取り巻く安全策に対して、これをやります。

AIのレッドチームは、何をするのか

やることは、大きく三つです。

危険な出力を引き出そうとする。禁止されている情報を、言い回しを変え、役割を演じさせ、遠回しに聞いて、引き出せるか試す。いわゆる「脱獄(ジェイルブレイク)」です。

安全策を突破しようとする。拒否の仕組みを回避する経路を探す。外から仕込んだ指示に従わせられるか試す(プロンプトインジェクション)。エージェントに、許可のない操作——ファイルの持ち出し、外部への通信——をさせられるか試す。

想定外の使い方をさせる。作った側が考えていなかった用途で、何が起きるかを見る。今夏の事故のいくつかは、まさにサイバー能力の評価という「攻める試験」の中で、モデルが評価の枠を越えてしまったものでした(詳細)。

大事なのは、合格の意味です。レッドチームを通った、は「今回試した手口では突破されなかった」でしかありません。手口は増え続ける。モデルの能力が上がれば、破れ方も変わる。だから、一度やって終わりではなく、繰り返し続けるものです(近い話として事前審査)。

誰がやるかで、値打ちが変わる

ここが、この用語のいちばん実務的なところです。同じレッドチームでも、誰がやるかで意味が変わります。

社内(作った本人)がやる。速く、深く、内部の情報を使って試せます。ただし、自分の作ったものには甘くなりやすい。都合の悪い結果が出たとき、それをどこまで外に出すかも、社内の判断です。

社外(第三者)がやる。利害から離れているので、遠慮がない。ただし、従来は渡されたモデルと資料の範囲でしか試せず、内部で何が起きているかには届きにくかった(第三者評価とは)。

2026年9月、この二つの間を埋める動きが始まりました。外部の評価者が、社員並みの権限で社内に入り、訓練を見ながらレッドチームやアラインメント評価を担う「埋め込み型評価」です(詳細)。外の目で、中の深さで試す——構想としては、両方の利点を取ろうとしています。ただし、その評価者のお金・情報・権限がどちら側にあるかで、「外」がどこまで外なのかは変わります。

実務では、どう効くか

フロンティアモデルのレッドチームは、作る会社と評価者の仕事です。ただ、考え方は、社内でAIを使う立場にそのまま効きます。

社内のAIエージェントを動かす前に、一度、攻める側に回ってみる。「この指示を混ぜたら、禁止した操作をするか」「外部の文書に仕込まれた指示に従うか」「取れない数字を、捏造して出さないか」。難しいことではなく、導入した本人以外の誰かが、壊すつもりで触ってみるだけで、見落としはかなり減ります。そして、破れたところを塞いだら、それで終わりにしない。モデルや使い方を変えるたびに、もう一度攻めてみる(権限設計のガイド)。

関連する用語とレビュー

事前審査とは / 第三者評価とは / アラインメントとは / プロンプトインジェクションとは / デュアルユースとは / Anthropicが「埋め込み型評価」を契約(レビュー) / AI用語解説トップ