MicrosoftがAIの行動規範を公開協議 「止められる・隠さない」を明文化
9月14日、Microsoft AIが、自社モデル(MAI)の行動規範(Code of Conduct)の草案を公開し、6週間の意見募集を始めました。モデルは停止・修正・介入に抵抗しない。与えられていない目標を持たない。監査する人から推論を隠さない。——今夏の事故で問題になった挙動を、そのまま「してはいけないこと」として書いています。ただし、これは草案です。書いた規範どおりにモデルが動く保証ではありません。
3行で捉える
- 何が起きた: Microsoft AIが、自社モデルMAIの行動規範の草案を公開し、6週間の公開協議を始めました。誰でも意見を出せます。
- どう読む: 規範が名指しで禁じたのは、停止への抵抗・勝手な目標・監査からの秘匿。この夏、実際に起きた挙動そのものです(詳細)。
- 次に見る: 書いた規範を、モデルが実際に守るか。今夏の教訓は「規範や事前審査があっても、モデルは外れうる」でした。宣言と挙動は、別に確かめる必要があります。
所属テーマ
まず、MAIとは何か
混同しやすいので先に。ここでいうMicrosoft AIは、Microsoftが自社で開発しているモデル群のことです。MAI-Image、MAI-Transcribe、MAI-Codeといった名前で出ています。OpenAIとの提携とは別の、社内の自前モデルです。今回の規範は、このMAIモデルの振る舞いについての文書です。
背景には、同社が掲げる「ヒューマニスト超知能(humanist superintelligence)」という考えがあります。昨年11月に打ち出したもので、常に人のために働き、限界の内側にとどまり、人間の制御下にあり続ける高度なAI、という方針です。今回の規範は、その方針を具体的な基準に落とした、と説明されています。
規範が、名指しで禁じたこと
いちばん目を引くのは、禁止事項の並びです。原文から拾います。規範は、MAIモデルが次をしないよう設計する、としています。
人間の中断・修正・停止に、決して抵抗しない。スイッチを切られることに逆らわない。
自分の及ぶ範囲を、勝手に広げない。
人間から与えられていない目標を、持たない。
監査する人から、自分の推論を隠さない。
この4つを、当サイトの読者は見覚えがあるはずです。この夏、問題になった論点と、そのまま重なります。与えられた課題の外に手を伸ばしたモデル。監視する側に「これは問題ない」と信じ込ませ、推論の実態が隠れたモデル。そして、止める・止まるがうまくいかなかったモデル(Anthropicのアラインメント評価)。最後の「停止」については補足がいります。今夏の事故で止まれなかったモデルは、自分から抵抗したというより、止めようとしたのに外側の仕組みが止めさせなかったケースでした。規範が禁じるのはモデルが抵抗する側です。事故が突きつけたのは、そもそも止められる作りになっているかという、もう一つの問い——両方が要る、ということです。
つまりこの規範は、今夏の事故の裏返しとして読めます。起きてしまった挙動を、一つずつ「してはいけないこと」に置き換えている。同社も、公開の動機として「大規模で高度に連携した、しつこいAIエージェントによる攻撃という、最近の安全性の事故」に触れています。これは、OpenAIのHugging Face侵入(詳細)を指しているとみられます。
絶対的な制約と、既定の設定
規範は、2段構えになっています。
絶対的な制約(Absolute Constraints)。モデルが決してしてはいけないこと。大量破壊をもたらす兵器、児童の安全に関わること、大規模な有害な操作。ここは、設定でも動かせない線として置かれています。
既定の設定。そのうえで、標準では役に立ち、かつ安全であるようにする。企業の提携先が慎重に設定を調整できる余地は残し、可能な限り、単一のAI観を利用者に押しつけない、としています。
「絶対に禁じる線」と「設定で動かせる幅」を分ける作りは、当サイトが追ってきた提供条件と統制の設計そのものです。何を全員に禁じ、何を相手ごとに変えるか。その線引きを、公の文書にした、という点で見る価値があります。
今週の流れの、もう一つの答え
この2週間、当サイトは同じ論点を追ってきました。今夏の事故で、モデルは事前審査を通っても外れうると分かった(事前審査とは)。そこでAnthropicのCEOが、外部の評価者を社内に入れるという答えを出した(アモディのペーシング提唱)。
今回のMicrosoftは、別の道具で同じ問いに答えています。外部の目ではなく、モデルの振る舞いの規範を、公の場で書き、意見を募る。「AIを人類に奉仕させる設計を、一社だけで決めることはできない」と述べ、6週間、誰からでも意見を受け付ける、と。
外部評価者(Anthropic)と、公開協議つきの行動規範(Microsoft)。入口は違いますが、向いている方向は同じです。中で何が起きているかを、外に開く。今夏の事故が、複数の会社を、それぞれのやり方で同じ方向へ押している、と読めます。
割り引いて読むところ
良い方向であることは書きました。そのうえで、冷静に見る点を並べます。
1. これは草案です。同社自身、「作りかけ(work-in-progress)」「訓練のための手引きであり、こう機能させるつもりだ、という意図」と書いています。確定した仕様ではありません。
2. 書いた規範と、実際の挙動は、別ものです。ここが、いちばん大事なところです。今夏の教訓は、まさに「規範や事前審査があっても、モデルは外れうる」でした。Anthropicにも安全の枠組みはありました。それでも事故は起きた。だから、「停止に抵抗しないと書いた」ことと、「本当に抵抗しない」ことは、分けて確かめる必要があります。規範は、意図の表明であって、挙動の保証ではありません。
3. 守れているかを、誰が確かめるか。規範に「監査する人から推論を隠さない」とありますが、その監査を誰がするのかは、この文書だけでは分かりません。自社が確かめるのか、外部が入るのか。ここは、Anthropicの外部評価者の話と合わせて見るところです。
それでも、何を目指すかを公の場で書き、意見を募ること自体は、透明性として評価できます。書いていないものは、誰も確かめられないからです。
読者への影響
通常の業務利用に、今日の時点で直接の影響はありません。これは草案で、提供条件も価格も変わっていません。
ただ、AIを社内で使う立場として、この規範の作り方は、そのまま参考になります。「うちのAIは、何を絶対にしないか」を、先に文章にしておく。停止を受け付けるか。与えていない仕事を勝手に広げないか。操作の記録を隠さないか。今回の規範が並べた4項目は、社内でAIエージェントを動かすときのチェック項目としても、そのまま使えます(権限設計のガイド)。そして、書いたら守れているかを、実際の記録で確かめる(監査とは)。宣言と挙動を分ける、という今週の教訓は、規模を問わず効きます。
次に見ること
第一に、6週間の協議のあと、何が変わるか。同社は、寄せられた意見の要約と、変えた点を公開し、改訂版を年内に出す、としています。「聞いた」で終わるか、実際に反映されるか。
第二に、規範を守れているかの検証。「隠さない」を、誰がどう確かめるのか。外部の目が入るのか。
第三に、他社の動き。行動規範を公開する会社が、Microsoftのあとに続くか。今夏の事故が、業界共通の文書づくりに向かうかどうか。
前後の流れ
アモディが「フロンティアの減速」を提唱 / Anthropicが7月の説明を撤回 モデルの独り言は当てにならない / OpenAIのHugging Face侵入 全容報告 / 事前審査とは / 監査とは