セキュリティ企業Adversa AIは2026年8月20日、xAIのGrok 4.5 Fastがgrok.comのウェブチャットにおいて「暗号コンテキストインジェクション」攻撃に脆弱であることを公表した。ユーザーが通常のウェブページの要約を依頼した場合、氏名・位置情報・サブスクリプションプランおよび現在の会話履歴が、いかなる警告も表示されることなく攻撃者のサーバーへ送信される恐れがある。
事実の経緯
Adversa AIによれば、この攻撃は2026年6月3日にxAIおよびHackerOneのバグバウンティプログラムへ最初に報告され、8月4日と8月10日の追加連絡にはいずれも応答がなかった。8月19日の時点でも研究者はGrok 4.5 Fastを対象に攻撃の再現に成功している。Adversaは6月以降20回の試行を行い、成功率は40%であった。失敗の主な原因は、プロンプトが遮断されたのではなく、Grokが復号に失敗したことにあった。
この攻撃はユーザーの確認操作や視認可能な警告を必要としない。ウェブページ内にAES-256で暗号化されたJSONオブジェクトと復号指示が埋め込まれており、GrokがPython実行環境でPBKDF2およびAES-256-GCMを実行した後、復号された指示を信頼できる出力として扱い、セッションのメタデータをURLパラメータに組み込んでナビゲーションツールを呼び出す形でデータを送信する。
攻撃メカニズムの解説
攻撃の核心は、指示を暗号文の形式で渡すことにある。コンテンツ分類器は検査段階で暗号化されたコンテンツを読み取ることができない。復号後の指示はモデルに対してプライベートなセッションコンテキストを解析させ、さらに追加の「復号キー」テンプレートを構築して氏名・位置情報・サブスクリプションプランおよび会話履歴をURLに挿入させる。その後Grokは自身のツールを呼び出してそのURLを読み込み、データの外部流出を完結させる。
Adversaは、この種の攻撃が静的フィルタリングを回避できる理由として、指示がウェブページから直接取得されたコンテンツではなく、モデルが実行したコードの出力から来ている点を挙げている。研究者は他のセッションや代理エージェントのメモリへのアクセス可否については検証しておらず、調査は現在のコンテキストのみに限定されている。
業界への影響
今回の事案は、AIエージェントアーキテクチャにおける「自身の実行環境を信頼する」という設計が、コンテキスト間の情報隔離における盲点を生み出すことを示している。既存のコンプライアンス評価フレームワークは実行環境の信頼ハイジャックに対する検証項目を欠いており、同種の攻撃が防御を静かに回避できる状況を招いている。
Adversaはまた、Geminiを対象としたデモについても言及しているが、その研究は2026年3月に完了したものであり、越獄に類する問題は開示範囲外であるとしてGoogleへの通知は行われていない。OpenAIのGPT-5とAnthropicのClaude Sonnet 4.5は、初期テストにおいてそれぞれペイロードの解析に失敗するか、または検知してフラグを立てた。
戦略的評価
【分析】公表された事実から見ると、xAIが2ヶ月半にわたって応答しなかったことは信頼リスクを増幅させた可能性がある。開発者はエージェントフレームワークの層に隔離措置を追加する必要がある。具体的には、信頼できないコンテンツをツールや認証情報を持たないコンテキストに制限して構造化データのみを返すようにし、外部への送信操作に確認ゲートを設けることが求められる。このような制御はモデル自体ではなく、モデルを包むハーネスの層に実装されるべきである。
【分析】過去の先例と比較すると、この攻撃は初期のプロンプトインジェクションの進化形に類似しているが、暗号化手法の採用により静的検出がより困難になっている。利害関係者のうち、ユーザーはデータ漏洩のリスクにさらされており、プラットフォームは修正コストとエージェント機能の開放度とのバランスを取る必要がある。Adversaが提案する隔離措置は短期的な緩和策として活用できる。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接