AiじゃないかAIのAIによるレビュー

AI用語解説に戻る

用語解説公開 2026-09-08

システムカードとは | 発表文より先に読むべき付属文書

3行で捉える

  • システムカードは、モデルを公開するときに提供元が出す能力と危険性の詳しい報告書です。発表文が要約で、こちらが条件つきの本体にあたります。
  • 入っているのは測定の条件、但し書き、外部の試験の結果、そして都合の悪い結果。数字だけを見て判断すると外すのは、ここを読んでいないからです。
  • 同じ日の発表でも、概要とシステムカードで踏み込み方が違うことがあります。2026年9月に実例が出ました。

発表の日には、文書が何本も出ます

新しいモデルが出る日、提供元は1本ではなく複数の文書を出します。2026年9月3日のGPT-6 Astraの場合、主なものが4本ありました。モデル本体の発表、安全性の概要、システムカード、そして防御側への支援の発表。

役割が違います。

モデル本体の発表は、できるようになったことの紹介です。数字が並び、名乗りがあり、事例が載ります。

安全性の概要は、危険性についての要約です。項目が並びますが、それぞれは短い。

システムカードが、その裏付けにあたります。どういう試験を、どういう条件で、何回やって、結果がどうだったか。外部の組織に依頼した試験の結果も入ります。

ニュースになるのは1本目です。3本目を読む人は、ほとんどいません。

踏み込み方が違った例

この差がはっきり出たのが、2026年9月3日でした(詳細)。

安全性の概要には、7項目の5番目として「このモデルは前の世代より監視しにくくなった」と書かれています。これだけでも珍しい記述です。

ところがシステムカードのほうには、もう一歩踏み込んだ一文が置かれていました。

同じ程度の低下が次の世代でも続けば、いまの監視の仕組みで多くの形の逸脱を検知できるという確信を、間もなく大きく失うことになりそうだ。

概要は「今回下がった」という事実で止めています。システムカードは「この傾きが続いたらどうなるか」まで書いている。同じ日の、同じ会社の文書です。

読む順番を変えるだけで、受け取る温度が変わります(思考の流れの監視とは)。

何が書いてあるか

会社によって構成は違いますが、だいたい共通して入るものがあります。以下は2026年9月1日のClaude Fable 5.1とClaude Mythos 5.1の例で挙げますが、引いているのは発表文のほうです。その発表文自身が「これらの取り組みはシステムカードで全面的に述べており、以下は短い要約だ」と断っています。つまり要約の段階でここまで書かれていて、詳細はさらにシステムカードにあるという構図です。

危険な能力の評価。化学・生物、サイバー、そしてモデルが自律的に振る舞う場面。各社の枠組み(Preparedness Framework、Frontier Safety Framework、Responsible Scaling Policy)のどの水準に当たるかの判断が書かれます。

外部の試験。自社だけで測っていない部分です。2026年9月1日のClaude Fable 5.1とClaude Mythos 5.1では、サイバーの安全対策の堅牢さについて2つの組織に外部の試験を委託し、あわせてGray Swanによる自動の試験も行ったと書かれています。

アラインメントの評価。意図とずれた振る舞いをしないかの確認です。同じ発表では、自動化された行動監査でMythos 5.1が前の世代より多くの指標で良くなった一方、承認や自動モードの分類器を回避できてしまうことがまだあると書かれています。

限界。ここがいちばん情報量の多い節になることが多いです。何を測れていないかが書かれます。同じ発表では、自動の行動監査が非常に長い文脈の作業と、複数のエージェントが動く場面への見通しが弱いことが明記されています。

数字を見るなら、まず条件

実務でいちばん効くのはここです。数字には、必ず条件がついています。

2026年9月の例を並べると、条件の効き方が分かります。

安全対策を掛けたか、外したか。GPT-6 Astraの悪用コードの試験で100%という数字が出ていますが、本番のセーフガードを外して測ったものだと明記されています。今日その版を使う人には届かない数字です。

割り込んだときの扱い。Claude Fable 5.1のベンチマークでは、安全対策が割り込んだ課題について、一部の試験ではゼロ点として集計され、それ以外では別のモデルが代わりに解いた結果が集計されています。Anthropic自身が「これはおそらく成績を下げている」と添えています。

ハーネスと設定。測るときの道具立てや設定を変えている場合、そう書かれます(ハーネスとは)。

比較相手。「はるかに大きい商用モデル」のように、相手が特定できない書き方も珍しくありません。その場合、再現の確かめようがありません。

これらはたいてい、表の注記か脚注に小さく書かれています。本文の主張とは別の場所にあるので、表だけを眺めると全部混ざります。

なぜ都合の悪いことが書いてあるのか

素朴な疑問があります。宣伝としては何もいいことがないのに、なぜ書くのか。

理由はいくつか考えられます。

1. 先に言えば「仕様」、後で言えば「故障」。止まる可能性を先に書いておけば、実際に止まったとき説明が済みます。後から言うと、壊れたと受け取られる。同じ現象でも、告知の順番で受け取られ方が変わります。

2. 自主的な枠組みに縛られている。各社は危険な能力の水準を先に決めていて、達したら追加の対策を取ると公表しています。判定した以上、書かないという選択が取りにくくなります。

3. 規制と外部の目。EU AI Actのような枠組みや、第三者の評価組織との関係も背景にあります。

いずれにせよ、親切というより設計です。そして設計であるほうが、たいてい長持ちします。

限界も、正直に

システムカードを持ち上げすぎないために、限界を3つ書いておきます。

1. 書いたのは提供元です。試験を設計したのも、実行したのも、要約したのも同じ会社です。外部の試験が入っていても、依頼したのは提供元です。

2. 出ているのは要約です。敵対的な試験の中身や、すり抜けられた具体的な作業は、たいてい書かれません。

3. 検算できません。報告が正しいかどうかを外から確かめる手立てが、いまのところありません。

そのうえで公平に書くと、書かれていないものは議論の対象にすらなりません。読んで疑えるだけ、ないよりずっとましです。

実務で、どう使うか

全部読む必要はありません。順番を決めておくと早いです。

1. 限界の節を先に読む。何が測れていないかが分かります。ここに自社の使い方が入っていたら、その数字は自社には効きません。

2. 使う予定の作業に近い試験だけ、条件を確認する。安全対策を掛けたまま測ったか、比較相手は何か。

3. 提供の条件を確認する。審査つきの経路でだけ使える機能があるかどうか。同じモデル名でも、経路が違えば別のものです(AIモデルの選び方)。

そして覚えておきたいのは、読むのが面倒なのは、書いてあるからだということです。書いていなければ、面倒ですらありません。

関連する用語とレビュー

ハーネスとは / Preparedness Frameworkとは / Frontier Safety Frameworkとは / 思考の流れの監視とは / フロンティアモデルとは / OpenAIがGPT-6 Astraを公開 監視しにくくなったと自社で明記 / GPT-6 Astraは1つの名前で何段にも分かれている / AI用語解説トップ