蒸留(distillation)と敵対的蒸留とは | 大きなモデルの答えで小さなモデルを教える技術と、他社のモデルから無許可で抜き取る行為
3行で捉える
- 蒸留は、大きなモデルの出力や推論を教材にして、別のモデルを訓練する技術です。自社の中で使えば、安く速いモデルを作る正規の手法。
- 敵対的蒸留は、他社のモデルから組織的かつ無許可で出力や推論を抜き取って使うこと。技術は同じで、違うのは「誰のモデルから、許可を得て」です。2026年9月30日、OpenAIが自社モデルの保護された推論を狙った活動を阻止したと公表しました。
- 問題は、能力は移るが、安全策は移らないこと。安全策は出力と提供条件に付いていて、推論そのものには付いていないからです。
意味
蒸留は、英語のdistillation。もとは液体を熱して成分を取り出す化学の言葉で、機械学習では知識蒸留(knowledge distillation)として使われてきました。大きくて高性能なモデル(教師)に大量の問いを解かせ、その答え——最終回答だけでなく、答えに至る途中の推論や、答えの確からしさの分布——を教材にして、小さなモデル(生徒)を訓練する。生徒は、教師の訓練に使われた元データを持たなくても、教師の振る舞いを近似できます。
これ自体は、各社が日常的に使う正規の技術です。最上位のモデルを教師にして、軽量級の安いモデルを作る。自社の教師から、自社の生徒へ。ここに問題はありません。
敵対的蒸留(adversarial distillation)は、OpenAIが9月30日の文書でこの意味で使った言葉で、定義はこうです。「あるモデルの出力や推論を、別のモデルの訓練・複製・改良を助けるために、組織的かつ無許可で使うこと」。技術は同じです。違うのは、教師が他社のモデルで、許可がないこと。OpenAIは今回の活動を利用規約違反と位置づけています(他社の規約は当サイトが個別に確認していません)。
2026年9月に、何が起きたか
9月30日、OpenAIが、自社モデルの保護された推論——課題を解く途中でモデルが書く内部の記録で、利用者には見せていない部分——を抜き取る組織的な活動を7月に遮断した、と公表しました。手口は、暗号を破るのではなく、ある会話の暗号化された推論を別の会話に貼り、モデル自身に復号して書き起こさせるもの。7月24〜25日に4,000超のユーザーから16,000件(試みの件数)の急増があり、関連する1万5,000超のユーザーの集団を7月28日までに遮断した、と。中核の一群はMoonshot AIに関係する個人に帰属させる、と書いていますが、根拠は示されていません(詳細)。
対応として、他人の暗号化された推論を再生して中身を取り出せる経路を閉じ、推論を露出させうるストリーム出力を検知して保留し、Frontier Model Forumと政府に情報を共有した、と。「OpenAI固有の脆弱性ではない」とも書いています。
なぜ安全上の問題になるのか
OpenAIの説明は二点です。抜き取った推論で別のモデルを訓練すれば、元のモデルの利用者向け出力に施された安全策を保たないまま訓練できる。そして大規模になれば、同じ安全への投資をせずに、高度な能力の移転を加速できる。
当サイトの言葉で言い直します。提供元は、モデルの能力に線引きを重ねて出しています——断る要求、審査つきの相手(段階的提供とは)、監視。その線引きは出力と提供の条件に施されていて、推論そのものには施されていない。推論を抜いて別のモデルに学ばせれば、能力だけが線引きの外に出る。「能力は移るが、安全策は移らない」。これが、技術としては同じ蒸留が、相手が違うだけで安全保障の話になる理由です。
もう一つ、推論を隠す設計との関係があります。提供元が思考の連鎖を利用者に見せないのは、監視を回避する方向にモデルが学ばないため(解説)でもあり、能力の複製を防ぐためでもある、と当サイトは読みます。同じ「隠す」が、安全と競争の両方に効いている。今回の手口は、隠した推論をモデル自身に開けさせることで、その両方を同時に突きました。
実務では、どう効くか
AIを使う側の企業に、直接の影響はほぼありません。遮断されたのは特定の型のプロンプトを大量に使うアカウントの集団です。ただ、二つの場面で関係します。
自社のAIの出力を、外に出すとき。自社製品がAIの出力や推論の要約を外部に提供しているなら、それを他社が訓練に使うことを規約でどう扱うかを決めておく。提供元の利用規約が「出力の再利用」にどう線を引いているかは、そのまま参考になります。
他社のAIの出力を、自社のモデルに学ばせるとき。社内で小さなモデルを作るために、外部のAIの出力を教材にするなら、提供元の規約が許す範囲かを先に確かめる。許可の有無が、正規の蒸留と敵対的蒸留を分ける線です(権限設計のガイド)。
関連する用語とレビュー
思考の連鎖の監視とは / オープンウェイトとは / フロンティアモデルとは / 段階的提供とは / 事故報告とは / OpenAIが「組織的なモデル蒸留」を阻止したと公表(レビュー) / Kimi K3のウェイト公開(レビュー) / AI用語解説トップ