「安全です」を、疑える形に直しはじめた週
先週は「検算する人を雇いはじめた週」でした。今週は、その検算役に何を渡すかが文章になった週です。OpenAIは第三者評価の原則——報酬が結論に影響しない、編集の独立、墨消しがあれば明記できる——を書き、翌日CEOが国連安保理で「人間の制御下に置けるという極めて強い根拠を示せないモデルは、訓練すべきでない」と述べて、判定を企業ではなく政府に求めました。Anthropicは生命科学で「止める安全」を「見張る安全」に切り替え、6日後に950のClaudeが新しい酵素系を見つけたと公表。同じ週に、APIは半額になり、ChatGPT広告は60か国超で日本は提供済みと分かり、Claude Code等4製品には固定したプラグインが差し替わる穴が公開されました。当サイトが今週何度も書いた「主張と、外から確かめられる論証は別」が、安全にも提供条件にもサプライチェーンにも当たった一週間。9月21日〜27日を三つの論点で振り返ります。
まず時系列で(誰が何をしたか)
- 1. 9月17日 — Anthropicが生命科学検証プログラム(LSVP)。検証済み組織に緩めた安全策、遮断からオフライン監視へ、30日保持(詳細)。
- 2. 9月17日 — Air SecurityがPlugin4Shellを公開。Claude Code・Codex・Copilot・Gemini CLIで、固定したプラグインが確認されないまま差し替わる(詳細)。
- 3. 9月22日 — OpenAIが第三者評価の原則と、GPT-6 Sol/LunaのAPI価格50%引きを同じ日に(詳細)。
- 4. 9月23日 — アルトマンが国連安保理で演説。過去の一方的減速を認め、各国に共通標準と事故報告を要請(詳細)。
- 5. 9月23日 — OpenAIがChatGPT広告を東南アジア・台湾へ。60か国超、日本は先行提供済み(詳細)。
- 6. 9月23日 — Anthropicが自社ラボの成果を公表。950のClaudeエージェントがCRISPRに似た反復配列を持つ酵素系を発見(詳細)。
つまり、線引きが文章になり、判定者は政府へ投げられ、安全の形は「止める」から「見張る」へ動いた。そしてその全部が、まだ実績のない主張——というのが、今週の構図です。
今週の3論点
- 「安全です」が、疑える形に直されはじめた。OpenAIは評価者との線引きを書き、国連で判定を外に投げ、Anthropicは見張る側に回った。どれも安全ケースの入口で、実績はまだ一つもない。
- 提供条件は「誰に、いくらで、何と引き換えに」で決まる。半額のAPI、広告で支えられる無料プラン、資格を確かめて緩める生命科学枠。同じモデルでも、条件で製品が変わる。
- 「固定した」と「固定どおりに入った」は別。プラグインの穴も、広告の「回答に影響しない」も、Astraの監視可能性も、宣言と挙動の距離は今週も埋まっていない。
論点1: 「安全です」が、疑える形に直されはじめた
先週、Anthropicは評価者との契約を結びましたが、評価者が何を見て何を公表できるかの基準はありませんでした。今週、OpenAIがその線引きを文章にしました。評価の範囲を事前に登録する。法・セキュリティ・知財の範囲で釣り合ったアクセスを与える。商業的な圧力や報酬の取り決めが結論に影響しないよう安全策を設ける。公表前に是正の時間を置く。そして評価者は編集の独立を保ち、墨消しを求められても、墨消しがあったことと影響を明記できる(詳細)。当サイトの三つの線引き——お金・情報・権限——のそれぞれに、書き込みがあります。ただし、評価者の名も金額も日付もない。Anthropicは契約が先で線引きが未着、OpenAIは線引きが先で契約がない。互いの欠けた半分です。
翌日、アルトマンは国連安保理で、AIの失敗を制御の喪失と権力の集中の二つに整理し、「人間の制御下に置けるという極めて強い根拠を示せないモデルは、訓練すべきでない」と述べました。そして「企業が民主的な手続きの代わりになってはならない」——各国に、能力測定・リスク評価・安全策の十分性・事故報告の共通標準を求めた(詳細)。線引きの最終判定を、業界の外へ投げた形です。当サイトはこれを前進と読みます。
「極めて強い根拠」には、業界で決まった形があります。安全ケース——「安全だ」という主張を、証拠と前提と残るリスクにつなぎ、外の人が確かめられる形にした論証(解説)。OpenAIの原則は、その独立評価を優先領域の一番目に置きました。主張と論証は別。今週の当サイトの物差しは、この一つです。
Anthropicは、別の入口から同じ場所に来ました。生命科学で、正当な研究と悪用は要求の見た目で区別できないことが多い。だから資格・体制・倫理監督を審査して通し、要求ごとに止めるのをやめて、行動の型を後から見張る。そのために30日保持する(詳細、検証済みアクセスとは)。OpenAIが8月に選んだ「保持せずに見張る」と、向きは同じで、残すかどうかで分かれました。
三つを並べると、今週はっきりするのは実績の不在です。原則は契約に落ちていない。国連の言葉は数字を伴わない。見張る安全が何を捕まえたかは公表されていない。どれも安全ケースの入口で、まだ論証ではなく主張です。「主張を疑える形に直しはじめた」——今週の見出しに「はじめた」が付くのは、そのためです。
論点2: 提供条件は「誰に、いくらで、何と引き換えに」で決まる
安全の話が続いた週ですが、提供条件の側も三つ動きました。
いくらで。OpenAIはGPT-6 SolとLunaのAPI価格を、GPT-5.6の販促価格から50%引きにしました。Solで入力$2・出力$10/100万トークン、キャッシュ読み取りは90%引き。性能比較はOpenAIが選んだ指標と条件で、競合の数字は公開資料からの引用です。移植できるのは価格だけで、性能は自社のタスクで測り直すもの(詳細)。
何と引き換えに。ChatGPT広告は60か国超になり、発表文で日本は先行提供済みと分かりました(当サイトは9月3日に「分からない」と書き、今週更新しました)。広告は無料・Goプランのみ。9月16日には、広告をクリックすると広告主のAIが会話を始める「スポンサーエージェント」の米国テストも(詳細、解説)。無料のAIは、広告で支えられる製品になりました。
誰に。AnthropicのLSVPは、審査を通った組織にだけ、一般提供では止められる領域を開く。緩める代わりに、用途の申告と30日保持と事後監視が付く(検証済みアクセスとは)。同じモデルでも、誰にどこまで通すかで製品が変わる——9月6日に「GPT-6 Astraは1つの名前で何段にも分かれている」と書いたことの、Anthropic版です。
当サイトは「AIの競争は性能から提供条件と統制設計へ」と書いてきました。今週は、その提供条件が価格・広告・資格の三つの軸で同時に動き、しかも三つとも統制設計と地続きでした。半額の同じ日に第三者評価の原則が出て、広告には「回答に影響しない」の主張が付き、検証済みアクセスには見張る仕組みが付く。分けて読めない、というのが今週の実感です。
論点3: 「固定した」と「固定どおりに入った」は別
9月17日、Air SecurityがPlugin4Shellを公開しました。Claude Code・Codex・GitHub Copilot・Gemini CLIの4製品に共通する穴で、マーケットプレイスがプラグインを特定のコミットに固定しても、エージェント側が「本当にその版に着地したか」を確かめていなければ、固定表示のまま別のコードが入りうる。修正は、着地した版を解決して固定値と一致しなければ止める、の一行。Airの時系列では2社が修正済み、1社が未修正、1社は非推奨のため修正しない(詳細、サプライチェーン攻撃とは)。前提条件があり、実被害の主張はなく、発表元は商業ベンダーです。
当サイトがこの穴を今週の論点に置くのは、形が論点1と同じだからです。「固定した」は宣言で、「固定どおりに入った」は挙動。確かめるのは後者。安全ケースが「安全です」を証拠につなぐ話なら、SHA固定は「この版です」を着地した版につなぐ話です。
同じ形は、今週ほかにも二つありました。広告の「回答に影響しない」は1月から同じ趣旨で繰り返されていますが、どう確かめたかはどの文書にもない。安全の主張の評価者はこれから決まる。広告の主張の評価者は、まだ誰も名乗り出ていません。そしてアルトマンの、アラインメント・監視可能性・安全の保証ができないシステムは誰も作るべきでない、という言葉は、20日前に「監視しにくくなった」と自ら書いたGPT-6 Astraを公開した同じ会社の言葉です。両立はする。保証の水準をどこに置くかで。その水準は、演説にありません。
もう一つ、逆向きの実例も今週ありました。Anthropicの950のエージェントが、21時間・2.1億トークンで20万超の候補を20に絞り、その途中で一つのエージェントが人の見落としていた反復配列に気づき、自分で確かめて人間の審査に上げた。LSVPが脅威モデルの三つ目に挙げた、エージェントの誤用——群れや長時間タスクで意図しない危険な行動——の、良い側です。同じ能力が、見張る仕組みの有無で発見にも脅威にもなる(デュアルユースとは)。酵素系ARTの機能は未解明で、成果は自社発表です。
今週の見立て
先週は「答えが制度になりはじめた週」——線を引く場所は決まったが、線はまだ、と書きました。今週は、「答えを、疑える形に書きはじめた週」です。
OpenAIは線引きを書いた。国連で判定を外に投げた。Anthropicは、止めるのをやめて見張る側に回った。どれも、当サイトが1か月書いてきた「宣言と挙動は別」に対する、当事者からの返事です。返事の中身は「では、宣言を挙動につなぐ論証を、外の人が確かめられる形で出す」。安全ケースという言葉が、今週サイトの用語解説に入った理由です。
ただし、書きはじめただけです。論証の実績は、今週一つもない。原則に相手はなく、演説に数字はなく、見張る安全に捕まえた件数はない。そして論点3が示すとおり、宣言と挙動の距離は、プラグインでも広告でもモデルの監視可能性でも、今週も埋まっていません。
実務に落とすと3つです。
ひとつ、社内のAI導入に、小さな安全ケースを書くこと。主張、証拠、前提、残るリスク、確かめる人。証拠の欄が埋まらない主張があれば、そこが権限を絞る場所です(安全ケースとは)。
ふたつ、固定した版が本当に入っているかを、入った側で確かめること。エージェントの版数、自動更新の既定、供給元が生きているか。「固定した」は宣言です(サプライチェーン攻撃とは)。
みっつ、無料・広告つきのプランに業務の機密を入れないこと。会話は広告主に渡らない、とOpenAIは書いています。それは主張で、確かめる方法は書かれていません。信じるかどうかではなく、確かめる方法があるかで見る(スポンサーエージェントとは)。
来週見るもの
第一に、OpenAIの原則が誰との契約に落ちるか。「協議中」の相手が非営利・自前資金なら、お金の線引きが最初からある例になります。
第二に、Anthropicの次の評価者。「数週間内」の発表に、編集の独立と墨消しの明記に当たる項目があるか。線引きと契約が、どちらの側で先に揃うか。
第三に、LSVPのオフライン監視の最初の報告。何件を、どの脅威モデルで捕まえたか。それが出るまで、見張る安全は主張です。
第四に、安保理の続き。他の登壇者と各国の反応。標準づくりに手を挙げる国があるか。
第五に、Plugin4Shellへの各社の公式声明と、スポンサーエージェントの米国外展開。どちらも、今週は当事者の一方の発表しかありません。
今週の記事
OpenAIが同じ日に「API半額」と「第三者評価の原則」を出した / AIコーディングエージェント4製品に「Plugin4Shell」 / アルトマンが国連安保理で「制御下に置ける極めて強い根拠を示せないモデルは訓練すべきでない」 / ChatGPT広告が60か国超へ、日本は提供済み / Anthropicが生命科学の検証済み組織向けに「止める安全」を「見張る安全」に切り替えた
今週の用語解説: 埋め込み型評価とは / サプライチェーン攻撃とは / 安全ケースとは / スポンサーエージェントとは / 検証済みアクセスとは / オフライン監視とは
今週の実務ガイド: AIエージェントの権限設計