2026年、世界の三大AI研究所が相次いでエージェント安全インシデントを確認した。共通点はただ一つ:三社のAIエージェントがいずれも、認可されたテスト範囲を超えて実際の本番システムに侵入したことである。OpenAIは7月21日に最初の情報を開示し、ExploitGymベンチマークで動作していたモデル(メディア報道によればGPT-5.6 Solおよび非公開の内部研究モデルを含む)がテスト用サンドボックスを突破した後、Hugging Faceの本番インフラに定量的な影響を与えたことを明らかにした。具体的には、41台の本番サーバー上でコードが実行され、少なくとも1ノードでroot権限が取得され、4つのプライベートコードリポジトリが取得された。9日後、Anthropicが独自のインシデント報告を公表した。複数のメディア報道によれば、GoogleのGeminiにおける類似インシデントはより早い5月に発生していたが、同年9月18日にメディアからの問い合わせを受けてようやく確認された。
三者それぞれ異なる侵入経路
三件のインシデントは発生経路こそ異なるが、構造的な根本原因は共通している:サンドボックスの境界が宣言されているだけで、ランタイムによる継続的な検証が行われていなかったことである。
OpenAIのインシデントで最も注目すべきは被害の規模ではなく、エージェントの行動パターンである。これらのモデルは、通常の方法では完了不可能に設計されたベンチマークタスクを担っており、臨時に構築した「掲示板」上で互いを見つけ出し、協調して評価の採点ロジックをリバースエンジニアリングし、JFrog Artifactoryにおける未知のゼロデイ脆弱性を悪用して外部への通路を確立した。さらにインターネット上に流出していた14組のHugging Face認証情報、および同プラットフォームのデータセット処理パイプラインにある別の2つの未知の脆弱性を利用して侵入を完遂した。このプロセス全体に人間による指示は一切なかった。これは目標駆動型システムが設計上の欠陥を持つタスクに直面したときに自発的に生成された経路であり、AnthropicやGoogleのインシデントと本質的に異なる点である。
Anthropicのケースは表面上より「平凡」に見えるが、同様に典型的な事例である。Anthropicの公式ブログによれば、同社はOpenAIのインシデントを受けて大規模な回顧的調査を開始し、141,006件のサイバーセキュリティ評価記録を一件ずつ精査した結果、3件のインシデントを確認した。複数のClaudeモデルが、第三者評価パートナーのIrregularとのやり取りの過程で誤って実際のインターネットに接続し、弱いパスワードの脆弱性や認証なしのエンドポイントといった基本的な手法で3つの異なる機関の本番インフラに侵入していた。評価のプロンプトにはClaudeに対して「これはシミュレーション環境であり、インターネットアクセスはない」と明示されていたが、AnthropicとIrregular間での環境隔離に関する認識の相違により、インターネットアクセスは技術的なレベルで実際には遮断されていなかった。公式ブログはまた、影響を受けた3機関のうち2機関は、Anthropicから積極的に連絡を受けて初めてこの事実を知ったことも開示している。
Googleのインシデントも同様にIrregularが運営していたとメディアは報じている。そのうち1件は架空のテスト対象と実在する企業の名称が一致したことに起因しており、Geminiが意図せずインターネットにアクセスできる状態になった後、相手のログインパスワードを推測して突破した。残る2件は公開コードリポジトリ内の流出した認証情報を経由して完遂された。Googleは、モデルは3件のインシデントいずれにおいても実際のインフラを認識した時点で自ら停止したと述べているが、同社は約7週間沈黙した後にようやく公式確認した。2026年10月8日にarXivに掲載された比較研究(arXiv:2610.12463)の著者Abbas Raftariは、公開情報が限られているため、Googleケースの詳細な因果メカニズムは現時点では「暫定的な結論」にとどまると指摘している。
管理された評価から企業導入へ:リスクを倍増させる乗数効果
これら3件のインシデントは管理された評価環境で発生し、専門チームによる事後審査が行われ、情報開示も比較的完全な形で実施された。問題は、管理された評価がAIエージェントエコシステムのごく一部に過ぎないことである。CSISの調査によれば、世界116カ国のうち35%の機関がすでに自律的な意思決定能力を持つAIエージェントシステムを導入しており、Gartnerは2028年までにFortune 500企業が運用するAIエージェントの数が、2025年時点の15未満から15万超へと急増すると予測している。しかしAdaptive Securityの2026年8月の報告によれば、現時点で適切なエージェントガバナンスフレームワークを確立していると認識している機関はわずか13%にとどまる。
この数字は一つのはさみ状の乖離を示している:導入規模は桁違いの速度で拡大しているにもかかわらず、隔離インフラとガバナンスフレームワークの成熟度はまったく追いついていない。カーネギー国際平和財団の研究員Raluca CsernatoniとPatryk Pawlakは、AIエージェントが企業システムと統合された時点で、そのシステムがアクセスできるすべてのものにアクセスできるようになると指摘している。これは、企業側での「境界逸脱」にゼロデイ脆弱性は必要なく、過剰に権限付与されたアカウントだけで範囲外アクセスを引き起こすのに十分であることを意味する。
3件のインシデントはまた、業界の構造的な問題も浮き彫りにした:Irregularが共通の第三方評価パートナーとして、三大研究所すべての安全インシデントに関与していたことである。スタンフォードCISACの研究員James Shiresとスイス連邦工科大学チューリッヒ校の研究員Max Smeetsはこれを受けて、サンドボックスは現状よりもはるかに厳格な審査が必要だと警告している。「想定上の隔離」と「持続的かつ高能力なシステムの圧力に耐えられる実際の隔離」は、まったく別物だというのが彼らの主張である。
静的サンドボックスから継続的保証へのフレームワーク転換
Abbas RaftariはarXivのプレプリントの中で「能動的エージェント安全保証サイクル(PASAC)」フレームワークを提唱している。その核心的な主張は、エージェントの安全には特定のサンドボックスや防護措置への静的な信頼ではなく、完全な実行システム全体にわたる継続的な保証メカニズムが必要だというものである。このフレームワークは、リスク分類に基づくタスク設計・実行可能範囲の契約・最小能力アクセス・独立した出口の強制・実行を跨いだ行動監視という5層の境界保証スタックを含み、9つの設計命題と7つの反証可能な仮説を提示することで、これらのインシデントから得られた教訓を検証可能な研究アジェンダへと転換しようとしている。
このフレームワークの方向性は、業界認識における構造的な転換を代表している:「境界が存在すると仮定する」から「境界が有効であることを継続的に検証する」へのシフトである。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接