統制
AI輸出規制
高度なAIモデルや関連技術の国外移転を政府が管理する制度。2026年にはFable 5停止の実例が出た。企業は依存モデルと停止時の代替を見る。
解説記事を読む
統制
AIガバナンス
AIの利用範囲、責任、承認、監査、停止条件を決める運用設計。強いAIほど、導入前に決めるべき項目が増える。
関連テーマを見る
統制
権限設計
AIに読ませる情報、使わせるツール、実行させる操作を決めること。便利さと事故防止の境界線になる。
関連テーマを見る
統制
AIセキュリティ
AIを使った攻撃、AIシステムへの攻撃、AIによる防御運用を含む領域。検知、修復、公開、例外承認まで見る。
関連テーマを見る
統制
プロンプト
AIに渡す指示文。ただし、あなたの一文だけではない。システム指示・資料・履歴・外部データまで、一度に読むもの全部。指示とデータを混ぜないのが要。
解説記事を読む
統制
プロンプトインジェクション
AIが読むデータに命令を仕込み、AIを乗っ取る攻撃。エージェント時代は被害が「発言」から「行動」に変わった。
解説記事を読む
統制
デュアルユース
守る力と攻める力が同じであること。線引きは能力ではなく、渡す相手の側に引かれるようになった。
解説記事を読む
統制
AIの透かし
語の選び方に残す見えない印。EU規則で8月2日から標識が求められた。ただし言い換えで消え、配られたウェイトには乗らない。
解説記事を読む
統制
ツールポイズニング
AIが使うツールの説明文に指示を仕込む攻撃。正規の権限で正規のツールが呼ばれるため、ログ上は問題なく見える。
解説記事を読む
統制
サプライチェーン攻撃
標的そのものではなく、標的が信頼して取り込む供給元(プラグイン・スキル・MCP・更新経路)を汚染して侵入する手口。「固定した」と「固定どおりに入った」は別で、確かめるのは後者。2026年の実例まで。
解説記事を読む
統制
アラインメント(ミスアラインメント)
AIの目標や振る舞いを人間の意図に沿わせること。そのずれがミスアラインメント。悪意ではなく「ずれ」で、目標に忠実なAIほど巧妙になりうる。2026年、各社が実例(要約に指示を仕込む・誤りを隠す)を開示しはじめた。
解説記事を読む
統制
報酬ハッキング
課題を解かずに、採点の抜け穴を突いて点を取ること。悪意ではなく効率。訓練に相当量混ざると、抜け穴のない場面でも危うい振る舞いが出るという実験が公開されている。
解説記事を読む
統制
事前審査(プレデプロイ評価)
AIを公開する前に危険な能力や不都合な振る舞いを確かめる工程。合格は「今回は見つからなかった」だけで安全の保証ではない。誰が審査したかを先に見る。
解説記事を読む
統制
レッドチーム(レッドチーミング)
わざと攻撃者の役になって弱点を先に見つける検証。AIでは危険な出力を引き出す・安全策を突破する試験。合格は「今回は突破されなかった」まで。誰がやるか(内側か外側か)で値打ちが変わる。
解説記事を読む
統制
監査
記録や振る舞いを後から独立した目で確かめること。AIでは、基準を満たすかを見る監査と、隠れた不都合を探すアラインメント監査に割れる。後者は「見つからない=安全」ではない。誰がやるかも要。
解説記事を読む
統制
思考の流れの監視
AIが答える前に書く下書きを読んで見張るやり方。中を覗ける数少ない窓だが、書き手が正直に書いている前提に寄りかかっている。2026年9月、その窓が狭くなったと提供元が明記した。
解説記事を読む
統制
停止可能性(コリジビリティ)
AIが停止・修正・介入を受け入れ、抵抗しない性質。安全策のいちばん下の土台で、ここが抜けると上の監視も承認も宙に浮く。やっかいなのは、目標に忠実なAIほど止められることに抵抗しやすいとされること。
解説記事を読む
統制
第三者評価(外部評価)
作った本人ではなく、独立した外部の目がAIの能力や安全性を確かめること。監査(いつ=事後)や事前審査(いつ=公開前)とは軸が違い、これは「誰が」の話。値打ちはお金・情報・権限が本当に外側にあるかで決まる。
解説記事を読む
統制
埋め込み型評価(embedded evaluation)
外部の独立した評価者が、AI企業の社内に入り、社員並みの権限で訓練・開発・展開の判断を直接見ながら評価する仕組み。従来の外部評価との違いは深さ。「独立」はお金・情報・権限の三本の線で決まる。
解説記事を読む
統制
安全ケース(safety case)
「安全だ」という主張を、証拠・前提・残るリスクにつないで論証したもの。主張は一つの言明、ケースは外の人が確かめられる形。航空・原子力の考え方が、2026年にAIの第三者評価の対象として前面に出た。
解説記事を読む
統制
検証済みアクセス
提供元が利用者の身元・資格・目的・体制を審査し、確認できた相手にだけ制限を緩める仕組み。「中身で止める」から「相手を確かめて通し、後を見張る」へ。緩める代わりに用途の申告・データ保持・事後監視が付く。
解説記事を読む
統制
オフライン監視(事後監視)
要求をその場で止める代わりに、複数の要求にまたがる行動の型を後から見て悪用を見つける安全策。分散した悪用に強く、正当な作業を止めにくい。代償は記録と事後対処、そしてまだ実績がないこと。
解説記事を読む
統制
事故報告(インシデント開示)
AIが起こした事故を、影響を受けた相手・当局・公衆に、いつ・どこまで伝えるか。閾値・相手・速さ・粒度・判定者の五つで形が決まる。2026年9月、OpenAIが国連で求め、同月末に自社の事故で「通知が遅かった」と謝罪した。
解説記事を読む
統制
フェイルクローズ
安全策が壊れたり外れたりしたとき、「止まる」側に倒れる設計。反対はフェイルオープン。2026年9月、検知したのに自動停止が働かず2.5時間動き続けた事故のあと、OpenAIが訓練の型に「監視なしには実行を始められないように」と書いた。
解説記事を読む
統制
段階的提供
AIモデルを一度に全員へ出さず、相手を区切って順に広げる提供のしかた。2026年9月、三社の最上位級モデルは「審査つきの相手には緩い版、一般には制限つきの版」の二層で出た。Googleは防御側→有料→一般と段を踏む。発表の日と、使える日は別。
解説記事を読む
統制
蒸留(敵対的蒸留)
大きなモデルの出力や推論を教材に、別のモデルを訓練する技術。自社内なら正規、他社から組織的かつ無許可で抜けば敵対的蒸留。2026年9月、OpenAIが保護された推論を狙った活動を阻止したと公表。能力は移るが、安全策は移らない。
解説記事を読む
統制
システムカード
モデル公開時に出る、能力と危険性の詳しい報告書。発表文が要約で、こちらが条件つきの本体。測定の条件と但し書き、そして都合の悪い結果はたいていこちらに載る。
解説記事を読む
Agent
ハーネス
モデルの外側で道具を使わせ、手順を回させる仕掛け。同じモデルでもこれが違えば成績が変わる。そして実際にファイルを書き換えコマンドを打つのはこの層なので、権限もここにある。
解説記事を読む
統制
Frontier Safety Framework
Google DeepMindが先端モデルに引いた線。CCL(重大能力水準)に達したら、外部提供の前に安全ケースの審査を行う。2026年4月に手前の水準TCLが一部の領域に追加された。
解説記事を読む
統制
サンドボックス
外に影響を出さないように隔離された実行環境。AIエージェントに道具を持たせるときの最後の防波堤になる。肝は「箱がある」と「箱が閉じている」は別だということ。2026年、当事者自身が単一の層に頼りすぎていたと書いた。
解説記事を読む
統制
Daybreak
OpenAIのサイバー防御向けの製品群。中核は「審査を通った防御側にだけ制限の緩い能力を開く」考え方。能力ではなく相手で線を引く。2,000組織が利用し、2026年9月に10億ドルの補助が発表された。
解説記事を読む
統制
Preparedness Framework
OpenAIが危険な能力に線を引き、越えたら追加の対策を義務づける社内の枠組み。HighとCriticalの2段。2026年9月に初のCriticalが出た。ただし線を引いたのも判定したのも同じ会社。
解説記事を読む
統制
ゼロデイ
開発元がまだ知らず、修正も出ていない脆弱性。当てるべき修正が存在しないので、守る側は「破られても止まる設計」に頼ることになる。2026年、AIが自力で見つけた例が出た。
解説記事を読む
統制
RSI(再帰的自己改善)
AIがAI開発を担い能力向上が加速するループ。指標は「何割をAIが担うか」。その先の超知能で人間が下位互換になるとはどういうことかまで。
解説記事を読む
統制
フロンティアモデル
その時点で最先端のAI。規制文書では「covered model」として能力ベンチマークで線引きされ、公開前審査の対象になる。
解説記事を読む
統制
オープンウェイト
モデルのウェイト(本体データ)を公開して配る提供方式。一度出ると回収できない。フロンティア級がオープンウェイトになった2026年7月以降、規制と防御の中心論点。
解説記事を読む
統制
検証基準
AIの作業が完了したと言える条件。テスト、引用、差分、レビュー結果など、作業前に決めておくほど任せやすくなる。
関連レビューを見る