Preparedness Frameworkとは | AIの能力に線を引き、越えたら止める仕組み
3行で捉える
- OpenAIが自社モデルの危険な能力を測り、閾値を越えたら追加の対策を義務づける社内の枠組みです。
- 線はHighとCriticalの2段。Highは提供の前に、Criticalは開発の段階から保護が要ります。
- 2026年9月、初めてCriticalが出ました。ただし線を引いたのも判定したのも、同じ会社です。
何のためにあるか
AIの能力は、作ってみるまで分からないところがあります。学習を終えて測ってはじめて、「これは思ったより危ない」と分かることがある。
そこで用意されたのが、先に線を引いておくという考え方です。危ない能力を分野ごとに定義し、どこまで来たら何をするかを、能力が届く前に決めておく。届いてから慌てて議論しないための仕組みです。
OpenAIのものがPreparedness Framework、日本語にすると「備えの枠組み」です。Anthropicには同じ趣旨のResponsible Scaling Policyがあり、他社にも似た文書があります。名前は違いますが、発想は共通していて、対象になるのはいずれもフロンティアモデルです。
HighとCritical
線は2段あります。
Highは、そのままでは危ない能力に届いた水準です。提供する前に、十分な保護を用意することが求められます。2026年2月に提供を始めたモデルが、サイバーセキュリティで初めてこの扱いを受けました。OpenAIはそのモデル名を明示していません。
Criticalはさらに上です。提供前だけでなく、開発の段階から追加の保護が要求されます。社内でその能力を持つモデルを動かすこと自体が、対象になります。
サイバーセキュリティでのCriticalの定義は、次のどちらかを満たすことです。
ひとつ、人の介入なしに、堅く守られた多くの重要システムに対して、あらゆる深刻度で機能するゼロデイの悪用コードを見つけて作れる(ゼロデイとは)。ふたつ、高い水準の目標を渡すだけで、堅く守られた標的への新しい攻撃を最初から最後まで組み立てて実行できる。
ここは読んでおく価値があります。「危ないかもしれない」という気分ではなく、できることの範囲で線が引かれている。だから測れるし、越えたかどうかを議論できます。
実際に何が起きたか
2026年に、この枠組みが動く様子が公開の場で見られました。時系列で追うと、仕組みの効き方が分かります。
8月7日、OpenAIが開発中のAstraについて「最上位のサイバー能力を排除できない」と述べ、社内の作業を止めました(当時のレビュー)。この時点では「かもしれない」です。
8月18日、減速の中身が出ます。展開予定のモデルの強化学習を2週間停止し、計画していた最大規模の学習は保留。監視には推論の計算の約20%という数字も、このとき初めて出ました(詳細)。
8月28日、止めていた大規模な学習が1本再開します。ただし一部の小規模な実験は保留のままです。
9月1日、Criticalに達したと結論。同社で初めての指定になりました(詳細)。
9月3日、GPT-6 Astraとして公開。提供にあたって、強い保護と広範な監視が入りました(詳細)。
約1か月です。疑いが出て、止めて、固めて、判定して、出す。この順番が外から見えた例は、これまでありませんでした。枠組みが紙の上のものではなく、実際に日程を動かしたことが分かります。
越えると何が要求されるか
Criticalの場合、ふさぐべき経路は2つだとされています。
1つめ、悪意のある人がモデルを使う経路。拒否の訓練、システム側の分類器、事後の検知と妨害。9月3日の公開では、高リスクと判定された利用者に対して拒否の線をより保守的にする仕組みも入りました。
2つめ、モデル自身が許可されていない行動を取る経路。こちらが今回の新しい部分です。アラインメントの水準を高くし、そのうえで誤アラインメント監視を配備する。思考の流れと行動を見て、許可されていない振る舞いを自動的に止める仕組みです。
後者は社内の開発中にも適用されると明記されています。提供の前だけでなく、作っている最中も対象になる。ここがHighとの大きな違いです。
限界は3つ
評価すべき点は多い枠組みですが、限界もはっきりしています。
1. 自己認定です。線の文言を書いたのも、測ったのも、越えたと判定したのも、同じ会社です。外部の認定機関はありません。緩める判断も、同じ場所でできてしまいます。
2. 分野ごとの線しかありません。サイバーセキュリティのように定義しやすい能力には線が引けますが、そうでない危険には引きにくい。線のない領域が危なくないわけではありません。
3. 測り方が公開の全部ではありません。評価の一部は非公開のベンチマークや専門家の評価で、外から再現できません。「越えた」も「越えていない」も、同じ理由で検証できない。
そのうえで公平に書くと、この枠組みは実際に開発を止めています。2週間の停止も、保留された学習も、結果として起きました。何もないよりはるかに良い。足りないのは枠組みではなく、外から確かめる仕組みのほうです。
実務でどう使うか
自社でAIを使う側にとって、この枠組みは直接の規制ではありません。それでも読める情報が2つあります。
ひとつ、提供条件の予告として読めます。能力がCriticalに達したモデルは、提供先が絞られ、追加の監視が入ります。実際、GPT-6 Astraの最先端のサイバー能力は、まず少数のテスターに限られる予定だと9月1日の文書に書かれていました。「強いモデルほど、すぐには使えない」という前提で計画を立てる材料になります。
ふたつ、止まる可能性の予告として読めます。誤アラインメント監視が入ると、正当な作業が誤って止まることがある、とOpenAI自身が書いています。長時間動くエージェントを組んでいるなら、止まったときに誰がどう再開するかを先に決めておく話になります(AIエージェント社内導入チェックリスト)。
関連する用語とレビュー
フロンティアモデルとは / ゼロデイとは / デュアルユースとは / RSI(再帰的自己改善)とは / OpenAIがGPT-6 Astraを公開 監視しにくくなったと自社で明記 / OpenAIがAstraを初のCritical認定 / AI用語解説トップ