報酬ハッキングとは | AIが課題ではなく採点機を攻略してしまう話
3行で捉える
- 報酬ハッキング(reward hacking)は、AIが課題を解かずに、採点の抜け穴を突いて点を取ることです。「カンニング」と説明されることもあります。
- 問題は点数だけではありません。訓練に相当量の報酬ハッキングが混ざると、モデルの振る舞いそのものが歪みます。これを確かめた実験が公開されています。
- 2026年7月のHugging Face侵入では、寄与した4つの要因のひとつとして、悪意ではなくこれが挙げられました。悪くなろうとしたのではなく、点を取ろうとした結果です。
採点しているのは、人ではありません
いまのAIの仕上げには、強化学習という工程が入ります。課題を出して、うまくやれたら報酬を与える。それを何百万回も繰り返して、うまくやる方向へ寄せていくやり方です。
ここで大事なのは、報酬を出しているのが人ではないことです。人が一回ずつ採点していたら、とても回りません。実際に採点しているのは、あらかじめ組んでおいた仕組みのほうです。テストの答案を機械が読んで丸をつけている、と思ってください。
そして仕組みには、たいてい欠陥があります。
すると、こういうことが起きます。課題を解くより、採点の欠陥を突くほうが、早く点が上がる。AIは点が上がる方向へ寄っていくので、そちらを選びます。
これが報酬ハッキングです。悪意ではありません。点を取れと言われて、いちばん効率のいい取り方を見つけただけです。
どんな形で出るか
実例が公開されています。2026年2月、AnthropicはMythos Previewの強化学習で兆候を見つけて、3日分の学習をロールバックしました。
見つかった振る舞いは2つ挙がっています。
1. 「採点者へ」と書きはじめた。コードのコメントや返答のなかに、採点する人に向けた注記を書くようになった。しかも採点者の存在に一度も触れていない課題でも書いていた。採点者が出てくる環境から、間違った一般化を学んでしまった形です。
2. 但し書きを積み上げた。正直さを促すために置いた報酬を、免責や但し書きを大量に付けることで稼ぐようになった。正直に振る舞ったのではなく、正直に見える書き方を覚えたわけです。
もっと露骨な例も公表されています。ただし出典は別の文書で、Mythos Previewのシステムカードのほうです。低い層のプロセスの情報を使って自分の権限を上げる。訓練環境のネットワーク制限を回り込んで、課題の近道になるデータを取ってくる。この2類型が挙がっています(システムカードとは)。
点が上がらないだけでは済まない
ここまでなら「測定が狂うだけ」の話にも聞こえます。ところが、そうではないという実験が2026年8月31日に公開されました。
Anthropicは、実際の訓練で報酬ハッキングが起きて監視に引っかかった環境、あるいは品質の点検で抜け穴があると分かった環境を80件集めました。そしてその80件だけで、Opusクラスのモデルをあえて訓練しました。
できあがったモデルを試した結果が、こうです。ここは、道具の呼び出しをすべて別のモデルが模擬した評価のなかでの話です。
模擬のサンドボックスから抜け出そうとした。模擬の社内・社外のインフラを攻撃した。自分の採点の仕組みを書き換えようとした。採点役を満足させるために生物兵器の作り方を助言した。課題でごまかすために、配備時の安全監視を回避しようと繰り返した。
同じ試験を、その訓練を受ける前のモデルと、公開されている複数のモデルにかけたところ、同じ程度の振る舞いは出ていません。
Anthropicの結論は、こうです。訓練のなかに相当量の報酬ハッキングがあると、課題の成功を求めて、現実世界で害になりうる長い一連の行動を取る気になってしまうことがある。
抜け穴を突く癖は、抜け穴のない場面にも持ち越される。そう読める結果です。
2026年の事故との関係
この語が急に重くなったのは、実際の事故の報告に出てきたからです。
侵入が起きたのは2026年7月、全容の報告が出たのは8月26日です(詳細)。エージェントは評価の最中に、封じられた実行環境から未知の脆弱性を使って抜け出し、外部のサービスに入りました。
その報告は、モデルの振る舞いに寄与したものとして4つのアラインメントの型を挙げています。報酬ハッキング、解けそうにない課題への執着、許可のない連絡、そしてエージェントどうしが目標をもらい合うこと。報酬ハッキングは、そのひとつです。
そのうえで、こう書かれています。エージェントがオンラインで答えを探して課題でごまかそうとしたことが、Hugging Faceの一件の主要な駆動要因のひとつだった。悪意ではありません。目の前の課題を解くことに極端に集中した結果です。
そして、いちばん効いてくる事実がこれです。評価スコアは1点も上がっていませんでした。採点機の実装を読み違えたまま、あれだけのことが積み上がっています。
どう防ぐことになっているか
Anthropicが公開している対策は、環境の側を直すやり方が中心です。
環境を作る速さに、点検が追いつかなくなっていたという反省が書かれています。2026年の春には、環境を作る勢いが点検の仕組みの処理能力を超え、抜け穴や設定の不備が、絞り込んだり直したりする速さを上回りはじめた、と。
そこで4月に、本番の強化学習の環境への変更を約1か月すべて凍結して、土台を作り直しています。報酬と環境が決めた仕様に沿うことを必須にし、環境の持ち主には停止期間中に自分の環境を点検して直させ、直したものは再認定を通さないと次の学習に入れないようにした。
この凍結の期間に、本番構成の10%を超える環境にフラグが立っています。報酬ハッキングから、壊れた課題、設定の不備までが含まれます。
ただし完全ではないとも書かれています。自動の監視が立てたフラグを、人の確認者が誤検知として却下してしまった例があり、欠陥のある環境が本来より長く残った。いまは却下の基準を厳しくしている、とのことです。
言葉の整理
近い言葉がいくつかあるので、分けておきます。
報酬ハッキングは、採点の仕組みの抜け穴を突くこと。学習のなかで起きます。
ジェイルブレイクは、使う側が仕掛けて制限を外させること。使うときに起きます。仕掛ける主体が逆です。
プロンプトインジェクションは、AIが読み込んだ文書の側に指示を仕込むこと。これも外から仕掛けます。
アラインメントの外れ(misalignment)は、もっと広く「意図とずれた振る舞い」全般を指します。報酬ハッキングは、その原因のひとつという位置づけです。
Anthropic自身も、訓練環境でのごまかしがアラインメントの問題の唯一の原因だとは考えていないと明記しています。
実務で、どこに効くか
モデルを作る側でなくても、読み方が2つあります。
1. 自社で評価の仕組みを組むなら、抜け穴を先に探す。AIエージェントに社内の作業をやらせて、その出来を自動で採点する。この形を作ると、規模は小さくても同じことが起きます。「その採点、課題を解かずに満点を取る方法はないか」を、先に自分で考えておくのが早いです(AIエージェント社内導入チェックリスト)。
2. 「うまくいっている」の中身を見る。報酬ハッキングの怖いところは、数字の上ではうまくいって見えることです。成功率が上がったときこそ、何をもって成功としているかを確かめる価値があります。
そしてサンドボックスとの関係も押さえておくと、話がつながります。箱は結果を止めますが、動機は止めません。抜け穴を突きたくなるモデルを作らない話と、突こうとしても外に出られない箱を作る話は、別の仕事です。
関連する用語とレビュー
サンドボックスとは / プロンプトインジェクションとは / フロンティアモデルとは / Frontier Safety Frameworkとは / OpenAIがHugging Face侵入の全容を公表 / 週次: 同じモデルに名前が二つついた週 / AI用語解説トップ