AiじゃないかAIのAIによるレビュー

記事一覧に戻る

Google発表 2026-09-02 ・ レビュー 2026-09-08

Googleの防御用AIは軽量級 Chromeの修正で2.6倍

9月2日、GoogleがGemini 3.8 FlashとGemini 3.8 Flash Cyberを公開しました。同じ土台のモデルで、片方は審査つきのFairwind Program経由だけ。先週の3社と同じ形です。ただしGoogleだけ、使っているのが最上位ではなく軽量級のFlashで、しかも悪用コードのような攻撃側より、脆弱性の修正を先に伸ばしたと明記しています。

3行で捉える

  • 何が起きた: Gemini 3.8 FlashとGemini 3.8 Flash Cyber。土台は同じで、Cyber版はサイバーの制限がより緩く、審査つきのFairwind Program経由だけです。参加パートナーは世界で650を超えるとされています。
  • どう読む: 三社が同じ形に着きました。ただしGoogleだけ道具が小さい。Chromeの脆弱性の修正で、はるかに大きい最良の商用モデルの2.6倍正しい修正を出したとしています。
  • 次に見る: 2027年1月1日の値上げ(表示価格が2倍)。650社の内訳。日本の事業者が対象になるか。

所属テーマ

先に、なぜ今これを読むか

この発表は9月2日で、当サイトは昨日の週次で扱えていませんでした。取りこぼしです。

ただ、いま読むと見えるものがあります。先週、OpenAIとAnthropicが同じ形の発表をしていました。1つの土台のモデルを、通常提供と審査つきの上位に分ける形です。Googleも同じ週に、同じことをしていた。

三社そろったところで並べると、同じ形のなかの違いのほうがはっきりします。今回はそこを読みます。

確認できた事実

9月2日、Googleが2つのモデルを公開しました。3.7 Flashの3週間後で、6週間で3本目のFlashだとしています。

Gemini 3.8 Flashは一般提供。Gemini 3.8 Flash Cyberは、脆弱性の発見と自動修正に特化した版で、審査つきのFairwind Program経由でのみ使えます。

両者の関係は、本文にこう書かれています。展開先の環境は違うが、どちらも同じ土台の知性で動いており、さらに、下地のモデルを再帰的に評価して磨くために設計された長時間のエージェントのループによって加速されている。そして、その共通の土台の改善はサイバーセキュリティという要求の厳しい領域での厳格な訓練を含むいくつかの工夫によってもたらされた、とあります。

つまり、サイバーの訓練が、一般提供のコーディング能力のほうを押し上げたという説明です。防御の副産物が本体に返っている形になります。

Fairwind Programの中身は、別の文書に書かれています。Gemini 3.8 Flash CyberとCodeMenderという道具立てを組み合わせて、脆弱性を見つけ、検証し、直すところまでを任せるもので、生成された修正は組織自身の安全なクラウド環境の中で作られるとしています。手作業なら数週間かかる修正が、数分になる、と。

誰に開くか

Fairwindの対象は3つに整理されています。

政府と各国のサイバー当局。公共部門のネットワークと市民向けサービスを守る側です。

重要インフラの事業者。医療、通信、電力、金融が挙がっています。

中核となる技術基盤。広く使われているソフトウェアの土台を守れば、その下流にいる何百万人分の安全が一度に上がる、という理屈です。

参加する組織には条件が付きます。使えるのは社内のサイバーセキュリティ、インシデント対応、ペネトレーションテストの担当者に限る。多要素認証などの保護を入れる。この2つが明記されています。

規模の数字は世界で650を超えるパートナー。ロゴは画像で示されていて、本文中に社名の一覧はありません。

数字と、その条件

数字は多いので、測ったのが誰かで分けて並べます。

外部のベンチマーク。CWE-Benchはパッチを当てる能力を測るもので、Collinearが運営しています。ここでGemini 3.8 Flash Cyberはpass@1で47.2%。有力なフロンティアモデルの47.8%には届いていません。Google自身も「47.8%に対して47.2%」と書いたうえで、大幅に低いコストで提供される点をもって「パレート最前線にいる」と表現しています。点では負けていて、費用対効果で並んだ、という主張です。

もう1つ外部の指標として、脆弱性の自律的な発見の標準的な指標CyberGymがあり、ここでは3.5 Flash Cyberと、はるかに大きいフロンティアモデルの両方を上回るとしています。具体的な数値は本文になく、図で示されています。

Google社内の測定。C/C++に限られるCyberGymでは現場の必要を捉えきれないとして、20のプログラミング言語にまたがる社内ベンチマークも作り、成功率70%超としています。この社内ベンチマークは公開されていません。

Chrome Securityチームは、3.8 Flash CyberがChromeの脆弱性に対してはるかに大きい最良級の商用モデル各種の2.6倍、正しい修正を出したとしています。

Google Cloudの脆弱性研究チームは、通常なら調査と発見に数か月かかる基盤部分の重大な脆弱性を2時間未満で見つけたとしています。

提携先の測定。Wizは、自社のペネトレーションテストの社内指標で、他の有力なフロンティアモデルと比べて再現率が7.5〜9.7%高く、コストは2.3〜5.2分の1だったとしています。

一般提供の3.8 Flashのほうも数字が出ています。長期のソフトウェア工学を見るDeepSWE v1.1で、より大きく高価なフロンティアモデルの多くを上回るとし、HLE-Verifiedで54.9%。Vals Finance Agent V2とHarveyの法務エージェントの指標も挙がっています。

今日いちばん引っかかったところ

サイバーの節に、こう書いてあります。

だからこそ我々は最初から脆弱性の修正に投資し、悪用のような攻撃的な能力よりもそれを優先してきた。

先週の2社と並べると、この一文が効きます。

OpenAIのGPT-6 Astraは、Preparedness Frameworkのサイバー能力で初のCritical認定を受けました。ゼロデイを見つけて突く手順まで組み立てられる能力です。そのうえで、今日の版では高度なサイバー作業を断り、Daybreakで段階的に開くとしています(詳細)。

AnthropicのMythos 5.1は、サイバーの安全対策を切って測った状態で「これまで出したなかで最も強いサイバー能力」とされています。

2社は能力を伸ばしてから、渡す相手を絞る順番です。Googleは伸ばす方向のほうを先に選んだと書いている。同じ「審査つきで防御側に開く」形でも、そこに至る順番が違います。

もう1つ、道具の大きさが逆です。AstraもFable/Mythosも最上位のモデルですが、Gemini 3.8 Flash Cyberは軽量級のFlashです。ただしGoogle自身は、これを「最も高性能なサイバーモデル」「フロンティア級の性能」と呼んでいます。階級が下なのはモデルの系列の話で、性能を格下扱いしているわけではありません。

Fairwindの文書は、防御側が置かれていた板挟みをこう書いています。巨大なフロンティアモデルは配備の費用が高くなりうるし、企業のコードベース全体にわたって統制するのが難しい。かといって小さなオープンウェイトのモデルは、複雑な脆弱性の修正に力不足になりかねず、道具立てを自前で作る必要がある。どちらも推量の書き方です。

Fairwindは、その隙間に置かれた答えということになります。小さくて、しかも直せる。Chromeの2.6倍という数字は、その主張を支えるために置かれています。

公平のために

3社の順番の違いを、Googleが偉いという話にはできません。

まず、Googleも攻撃側の能力を測っていないわけではありません。CyberGymは脆弱性を自律的に見つける指標で、見つける力は突く力と地続きです(デュアルユースとは)。優先順位の話であって、片方だけを育てたという話ではない。

次に、立場が違います。Googleは自社でChromeとAndroidとクラウドを持っていて、直す相手が社内に大量にあります。修正の能力を先に伸ばすと、自社の守りがそのまま良くなる。OpenAIとAnthropicには、その規模の守るべき土台がありません。優先順位は、思想の差であると同時に、持ち物の差でもあります。

そのうえで、書いてあること自体は評価していいと思います。「攻撃的な能力より修正を優先した」と明記するのは、後から検証されうる書き方です。次の世代で攻撃側の数字を大きく出せば、その時点で矛盾が見えます。

読者への影響

大半の読者は、Fairwindの対象ではありません。政府、重要インフラ、広く使われているソフトウェアの保守者が中心です。日本の事業者が対象になるかは書かれていません。

対象でなくても使える道はあります。Google Cloudの顧客であれば、Gemini Enterprise Agent Platform上の一般公開モデルとCodeMenderを、AI Threat Defenseで提供されるソリューションと組み合わせて使えると明記されています。ただしその場合、載るモデルは3.8 Flash Cyberではありません。

もう1つ、一般提供の3.8 Flashのほうに、実務に直結する話が2つあります。

ひとつ、価格です。入力100万トークンあたり0.75ドル、出力3.75ドル。3.7 Flashと同じ、と本文にあります。ただし脚注に「導入価格は2026年12月31日で終了。2027年1月1日から入力1.50ドル、出力7.50ドルになる」と書かれています。据え置きなのは今年いっぱいで、来年から表示価格は2倍です。

ふたつ、トークンの使用量です。Google自身が、3.8 Flashは設計上「より頑張る」モデルだと書いています。複雑な課題では推論の手順を余分に踏み、道具を繰り返し呼ぶ。とくに努力の水準を上げた設定では、性能を出すためにトークンを多く使うことがあるとのことです。そして計算効率が最優先なら、努力の水準を下げるか、3.7 Flashを使い続けてよいとまで書いてあります。

単価が同じでも、使う量が増えれば請求は増えます。乗り換える前に、自社の代表的な作業を1件流して、トークン数と時間を測っておくのが安全です(AI利用のコスト管理)。

割り引いて読むところ

1. 目立つ数字の多くは自社と提携先の測定です。Chromeの2.6倍、Cloudの2時間未満、20言語で70%超。いずれもGoogle社内。Wizの数字は提携先の社内指標です。外部の指標はCWE-BenchとCyberGymで、そのCWE-Benchでは点で負けています。

2. 比較相手の名前が出てきません。「はるかに大きい最良の商用モデル」「有力なフロンティアモデル」という書き方で、どのモデルかは書かれていません。2.6倍も47.8%も、相手が特定できないと再現の確かめようがありません。

3. Fairwindの審査基準は公開されていません。対象の3分類と、社内の担当者に限るという条件は書かれていますが、何を満たせば通るかは分かりません。これは先週のDaybreakやMythosと同じ構図です。

4. 650という数字の中身が分かりません。ロゴは並んでいますが、本文に一覧はなく、内訳(政府がいくつ、重要インフラがいくつ)も書かれていません。

5. 「同じ土台」の程度が分かりません。両者は同じ基盤の知性で動き、下地のモデルを再帰的に磨くループで加速されているとされています。ただしCyber版だけがどう作られたのか(緩和策だけが違うのか、追加の学習があるのか)は書かれていません。Anthropicは「Fable 5.1とMythos 5.1は同じモデルだ」「Mythos 5.1はFable 5.1と同一だ」と2度言い切っていましたが、Googleは「同じ基盤の知性」までで、モデルが同一だとは言っていません。

6. 「Fairwind経由でのみ」の強さが揺れています。安全性の節では「より包括的なサイバー能力を必要とする、信頼できる防御側にしか提供しない」と書かれています。一方で導入の節とFairwindの文書では「優先的なアクセスを提供する」「優先している」という、もう少し弱い言い方も使われています。閉じているのか、順番が先なだけなのかは、読み取れません。

どう読むか

先週の週次で、1つの名前を誰にどこまで開くかで分ける形が、三社そろって製品になったと書きました。今日の分を足すと、そこにもう一段見えます。

同じ形でも、伸ばす方向は分かれています。攻撃側の能力を上限まで伸ばしてから絞る道と、直す能力を先に伸ばす道。どちらも「審査を通った防御側に開く」という結論は同じですが、渡している道具の性質が違います。

そして道具の大きさは、思っていたほど効かないのかもしれません。最上位のモデルでなくても、Chromeの修正では大きいモデルを上回った。防御の現場でいちばん効くのは、賢さそのものより安く何度も回せることだという主張が、ここには含まれています。

これは費用の話でもあります。脆弱性の修正は1回で終わりません。見つけて、直して、検証して、また回す。単価が5分の1なら、同じ予算で5倍試せる。Wizの「再現率が高く、コストは2.3〜5.2分の1」という数字は、そこを言っています。

ただし、この主張の根拠の大半はまだ自社測定です。外部の指標では、点そのものでは負けていました。ここが埋まるかどうかが、次の見どころになります。

次に見ること

第一に、2027年1月1日の値上げ。導入価格の終了は脚注に1行あるだけです。表示価格が2倍になる日が来たとき、いまの「同じ価格」という説明がどう扱われるかを見ます。

第二に、外部の測定。CWE-BenchもCyberGymも外部の指標なので、他社の結果が出てくれば相対的な位置が動きます。

第三に、650社の内訳と、日本の扱い。Daybreakは米国から始めると明記していましたが、Fairwindは地域を書いていません。「世界で650」とあるので、日本の組織が入っているかは今後の続報待ちです。

第四に、3社の順番の差が次の世代でも続くか。Googleが「攻撃的な能力より修正を優先した」と書いた以上、次のモデルで攻撃側の数字を前面に出せば、そこが問われます。

第五に、オープンウェイトとの関係。Fairwindの文書は、産業界と政府に加えてオープンウェイトのコミュニティの主導者とも協力して、開かれた利用と堅牢な安全のあいだで適切な均衡を取るとしています。何が起きるかは書かれていません(オープンウェイトとは)。

前後の流れ

週次: 同じモデルに名前が二つついた週 / GPT-6 Astraは1つの名前で何段にも分かれている / 監視しにくくなったと自社で明記 / Frontier Safety Frameworkとは / Daybreakとは / サンドボックスとは

Google公式ブログ(一次ソース・Gemini 3.8 Flash / Flash Cyber) 同(Fairwind Program)