AiじゃないかAIのAIによるレビュー

AI用語解説に戻る

用語解説公開 2026-09-24

安全ケース(safety case)とは | 「安全だ」を主張ではなく、証拠つきの論証にする

3行で捉える

  • 安全ケースは、あるシステムのリスクが特定の用途について十分に管理されている、と説明する「証拠に支えられた構造的な論証」です。
  • 「安全だ」という主張と、安全ケースは別。主張は一つの言明、ケースは主張を証拠・前提・残るリスクにつないだ論証で、外の人が確かめられる形になっています。
  • 2026年9月、OpenAIが第三者評価の優先領域の一番目に安全ケースの独立評価を置き、CEOは国連で「人間の制御下に置けるという極めて強い根拠を示せないモデルは、訓練すべきでない」と述べました。ただし、確かめる側との契約はまだです。

意味

安全ケースは、英語のsafety case。「ケース」は事件や箱ではなく、「論拠」「主張を支える議論」の意味です(裁判で「ケースを立てる」と言うときのケース)。OpenAIが2026年9月22日の文書で置いた定義はこうです。あるモデルやシステムのリスクが、訓練・評価・展開といった特定の活動について十分に管理されている理由を説明する、証拠に支えられた構造的な論証。個々の安全の主張を、それを支える証拠につなぎ、前提・不確実性・残るリスクを明示するもの。

ここで対になるのが安全の主張(safety claim)です。主張は、「このモデルは高度なサイバー作業を断る」のような、証拠に照らして確かめられる一つの言明。どのリスクと条件について言っているか、前提と限界は何か、が付いていなければなりません。安全ケースは、こうした主張を複数束ね、「だから、この用途では十分に管理されている」と論証したものです。

この考え方は、AI発ではありません。航空、原子力、鉄道、医療機器——失敗が人命に関わる分野で、「安全です」と言うだけでは許可が下りないので、なぜ安全と言えるかを文書で論証し、規制当局が審査する仕組みとして育ってきました。AIでも各社の枠組みに以前から入っていましたが、2026年9月、外の人が確かめる対象として前面に出てきた、という位置づけです。

「主張」と「論証」は別

ここが、この用語のいちばん大事なところです。当サイトはこの数週間、宣言と挙動は別、と書いてきました。安全ケースは、その間に入る三つ目の層です。

宣言は「安全にやります」。主張は「このモデルはXをしません」。安全ケースは「Xをしない、と言える根拠はこの評価結果で、その評価はこの条件で行われ、この前提が崩れたら成り立たず、それでも残るリスクはこれです」。そして挙動は、実際にモデルが何をしたか。宣言から挙動までの距離を、ケースが埋めます。

なぜ必要か。主張だけでは、外の人は検証できないからです。「危険な作業を断る」と言われても、どんな試験で、どの水準で、どの前提で、が書かれていなければ、本当かどうか確かめようがない。ケースの形になって初めて、「この証拠はこの主張を支えているか」「この前提は現実に合っているか」「見落としているリスクはないか」を、作った本人以外が問える。9月22日のOpenAIの文書が、第三者評価の優先領域の一番目に「安全ケースの独立評価」を置いた理由です(詳細)。翌23日、同社のCEOは国連安保理で「人間の制御下に置けるという極めて強い根拠を示せないモデルは、訓練すべきでない」と述べました(詳細)。訓練の前に、ケースを立てる、ということです。

誰が確かめるのか

安全ケースは、作った本人が書きます。だから、値打ちは誰が確かめるかで決まります。自分で書いて自分で通すなら、それは宣言と変わりません。

2026年9月の時点で、各社の仕組みはこうです。Google DeepMindのFrontier Safety Framework(解説)は、重大能力水準に達したモデルについて、外部提供の前に安全ケースの審査を行うと定めています。OpenAIは、Preparedness Framework(解説)の閾値評価に加え、第三者による安全ケースの独立評価を優先領域にしました。Anthropicは、外部評価者を社内に置く契約を先に結びました(埋め込み型評価とは)。ただし、独立した評価者が安全ケースを実際に審査した、と公表された例は、本稿時点でまだありません。線引きは書かれ、契約は一つ結ばれ、審査はこれからです。

そして、確かめる人が本当に外側にいるかは、お金・情報・権限の三つの線引きで決まります(第三者評価とは)。安全ケースの審査で特に効くのは情報です。証拠の元データを見せてもらえるか。要約だけを渡されて「支えている」と判定するのは、審査ではなく追認です。

実務では、どう効くか

社内でAIエージェントに権限を渡すとき、小さな安全ケースを自分で書けます。形はこれだけです。

主張。「このエージェントは、承認なしに顧客データを外に送らない」。証拠。権限設定のスクリーンショット、送信先の許可リスト、テストで試した記録。前提。許可リストが正しく保たれていること、エージェントの版が変わっていないこと(固定した版が本当に入っているか)。残るリスク。許可リスト内の相手に誤送信する可能性、プロンプトインジェクション(解説)で指示が書き換わる可能性。確かめる人。導入を推した本人ではない誰か。

これを書いてみて、証拠の欄が埋まらない主張があれば、そこが権限を絞る場所です(権限設計のガイド)。大手が国連で言われたことの、机の上の版です。

関連する用語とレビュー

第三者評価とは / 埋め込み型評価とは / 事前審査とは / 監査とは / Frontier Safety Frameworkとは / Preparedness Frameworkとは / システムカードとは / アルトマンの国連安保理演説(レビュー) / OpenAIの第三者評価の原則(レビュー) / AI用語解説トップ