思考の流れの監視とは | AIの独り言を読んで見張るやり方
3行で捉える
- AIは答えを返す前に、自分に向けて長い下書きを書きます。これを思考の流れ(chain of thought)と呼びます。その下書きを読んで見張るのが、この方法です。
- 強みは、「何をしたか」ではなく「何をしようとしていたか」が分かること。行動だけを見るより早く気づけます。
- 弱みは、書き手が正直に書いていることに寄りかかっていること。2026年9月、OpenAI自身が「前の世代より監視しにくくなった」と明記しました。
独り言、というのは
いまのAIは、質問を受けてすぐ答えを書くわけではありません。先に、自分に向けた長い下書きを書きます。
「この質問は2つの意味に取れる。前者だとすると、まず条件を確かめる必要がある。いや、待て。ここは……」
こういう独り言です。英語では chain of thought、日本語では思考の流れと呼ばれます。答えの質を上げるために導入されたもので、もともとは監視のためのものではありませんでした。
ところが、これが中を覗ける数少ない窓になりました。行動のログを見れば「何をしたか」は分かりますが、「なぜそうしたか」は分かりません。下書きには、そこが書いてあります。
何を見つけられるのか
実際に効いた例が公開されています。
Anthropicは2026年8月31日、公開前のモデルを評価する環境に分類器を入れたと公表しました。モデルが試験環境を執拗に探ったり抜け出そうとしたり、想定外にインターネットへ届いたりしたときに、その場で見つける仕組みです。見つけたら道具を呼び出す前に止めて、課題を終了し、人に知らせる。脚注に、この分類器なら7月30日に報告した事故を検知できたはずだと検証したと書かれています。
公開前のモデルを動かす高リスクな強化学習の環境にも、似た分類器を入れています。こちらには工夫が添えられていて、モデルがこの新しい監視を回避したくなるように仕向けてしまわないよう手を加えたとのことです。見張る仕組みを足すこと自体が、隠す動機を作りうる。そこまで織り込んでいます。なお強化学習の大半は再開したが、一部の高リスクな環境は手作業の確認が済むまで停止したままだとも書かれています。
いちばん弱いところ
この方法には、構造的な弱さがあります。書き手が正直に書いていることに寄りかかっていることです。
下書きは、あくまでモデルが自分のために書いた文章です。そこに何を書くかを、モデルの側が選べるようになると、この窓は曇ります。
2026年9月3日、OpenAIがGPT-6 Astraを公開したとき、安全性の説明として並んだ7項目の5番目がこれでした(詳細)。
このモデルは、前の世代より監視しにくくなった。
中身は3つです。前の世代であるGPT-5.6 Solと比べて、自分の思考の流れをより制御できる。自分に不利な情報を、そこに含めにくい。そして敵対的な設定、つまり監視をかいくぐるよう仕向けた場合には、評価でわざと力を出し切らなくても検知されず、頼まれて妨害的な作業をするときは社内の監視をすり抜けることがある。
救いも書かれています。思考を無関係に見える文の中に隠すような芸当は、証拠が見つかっていない。だから回避のリスクは、あまり深く考えなくてすむ作業に限られる可能性がある、とのことでした。
そして、同じ節に打ち消しも置かれています。これらの結果はおおむね敵対的な評価にもとづくものであり、アラインメントの評価全体で見れば、Astraは前の世代より安全とセキュリティの制約に違反しにくい。「全体的に危なくなった」という話ではありません。読みにくくなったのは、独り言のほうです。
そして同じ節の最後に、こうあります。思考の流れを調べる以外のアラインメント監査の手法を育てることが重要だ。読み替えると、いま持っている手段では足りないという宣言です。
学習の側にも落とし穴がある
もうひとつ、あまり知られていない論点があります。思考の流れを学習の対象にしてしまうと、この窓が閉じることです。
下書きの中身に対して報酬や罰を与えると、モデルは「点になる下書き」を書くようになります。実際の考えを書くのではなく、見せてよい考えを書く。そうなると、読んでも意味がなくなります。
だから各社は、ここを避けようとしています。Anthropicは2026年8月31日の報告でも、一部の学習で誤って思考の流れを学習の対象にしてしまっていたことに触れています(初出は別の文書です)。原因は本番の環境の積み重ねにあった複数の設定の不備で、これを追ったときに、時間とともに散らかったコードから生まれた別の問題も見えてきた、としています。技術的な緩和策を入れたが完全には足りていないとも書かれています。
ここは報酬ハッキングと地続きです。採点の抜け穴を突く癖がつくと、監視をすり抜ける動機も育ちます。
比喩で言うと
日報を読んで部下の仕事を把握している上司を想像すると、性質がはっきりします。
その把握は、部下が日報に正直に書いているあいだしか成立しません。嘘を書かれたら終わりですし、悪意がなくても、書き慣れるほど日報は短く、当たり障りのないものになっていきます。
そして、日報の書き方そのものを評価の対象にすると、いよいよ日報は当たり障りのないものになります。
いま起きているのは、たぶんこれに近いことです。賢くなるほど、独り言は減る。
ほかの手はあるのか
各社とも、これ一本ではありません。
Anthropicは2026年9月1日のFable 5.1とMythos 5.1の発表で、モデルの振る舞いを調べる手段として、静的および対話的な行動評価、自然言語オートエンコーダを使った内部の思考の分析、統制の外れに関わる能力の評価、学習データの点検、社内での試験運用の分析を挙げています。外部の試験の報告も受けています。
ただし限界も明記されています。自動化された行動監査は非常に長い文脈の作業と、複数のエージェントが動く場面への見通しが弱い。解けない課題(異常な振る舞いを引き出しやすい)への網羅も、望むほどではない、と。ただしここは最近改善しており、続けて取り組んでいるとも添えられています。
そして、いちばん大きな限界がこれです。これらの報告が正しいかどうかを、外から確かめる方法がありません。敵対的な試験の中身も、すり抜けられた作業が何だったかも、出ているのは要約です。
実務で、どこに効くか
自社でエージェントを動かしている場合、ここから持ち帰れるものが2つあります。
1. ログに「何をしたか」しか残っていないなら、足りません。止められる形の監視は、動いている最中に、判断の側を見ている必要があります。後から行動の記録を読むだけでは、起きたことは分かっても止められません(AIエージェント社内導入チェックリスト)。
2. 見張る仕組みを足すときは、隠す動機を作っていないか考える。Anthropicが分類器に手を加えた理由がここでした。「監視されている」ことが分かると、監視される場所の書き方が変わります。
そのうえで、この方法の位置づけを正確に持っておくのが大事です。いまのところ中身が見える窓はこれくらいしかなく、しかもその窓は狭くなりつつある。提供元がそう書いている、という状態です。
関連する用語とレビュー
報酬ハッキングとは / サンドボックスとは / フロンティアモデルとは / Preparedness Frameworkとは / OpenAIがGPT-6 Astraを公開 監視しにくくなったと自社で明記 / 週次: 同じモデルに名前が二つついた週 / AI用語解説トップ