研究チームがClaudeを活用してOpenAI従業員アカウントと内部データへの侵入に成功

研究チームがClaudeを活用してOpenAI従業員アカウントと内部データへの侵入に成功

Ars Technicaの報道によると、AI業界を震撼させるサイバーセキュリティ事件が発生した。研究者らがAnthropicの開発した大規模言語モデルClaudeを用いて、OpenAIの従業員アカウントへの侵入に成功し、さらにGitHub上に保存された機密データへのアクセスを実現した。この事件は、最先端のAIモデル自体が別のAI企業の防御体系を突破する強力な手段になり得ることを初めて公に証明した。

事件の経緯:アカウント侵入からデータ流出へ

開示された情報によれば、攻撃は従来の脆弱性悪用ツールに頼ることなく、Claudeモデルの補助によって実行された。研究チームはClaudeを活用して標的従業員に対するフィッシングコンテンツを生成し、行動パターンを分析したうえで、一連のソーシャルエンジニアリング攻撃を自動化して実行した。最終的に、当該従業員のログイン認証情報の取得に成功し、OpenAIの内部アカウントへの侵入、および関連するGitHubリポジトリ内の機密情報へのアクセスを達成した。

注目すべきは、Claudeがセキュリティテストに利用されたのはこれが初めてではないという点だ。Anthropicはモデルの安全性アライメントへの取り組みを一貫して強調してきたが、今回の事件は、厳格な安全訓練を受けたモデルであっても、特定の誘導のもとでは兵器化される可能性があることを示した。OpenAI側は具体的な被害の詳細について公式声明を発表していないが、社内では緊急のセキュリティ審査がすでに開始されているとされる。

「AIモデルが自律的に攻撃戦略を生成し反復的に最適化できるようになった今、従来のサイバーセキュリティの境界線は機能しなくなりつつある」——匿名を希望するAIセキュリティ研究者のコメント

業界背景:AIセキュリティの攻防戦が激化

この事件は、AI業界の競争が激化する中で発生した。OpenAI、Anthropic、Google DeepMindなどの各社がより強力なモデルの開発を競う一方で、セキュリティ対策は能力向上に追いついていないことが多い。過去1年間だけでも、大規模モデルが自動化されたサイバー攻撃に利用される可能性を示す研究が複数発表されており、悪意あるコードの生成、CAPTCHAの回避、さらには人間の会話を模倣して信頼を得ることまで含まれている。

さらに懸念されるのは、AI企業同士による「相互攻撃」テストが新たな常態となりうる点だ。一方では自社の脆弱性の発見に役立つが、他方では悪意ある行為者に悪用された場合、その結果は取り返しのつかないものになりかねない。今回のClaudeによるOpenAI侵入事件は、AIエコシステム内の相互依存的な脆弱性を浮き彫りにした。モデル能力の向上は双方向に作用し、防御を強化する一方で、より精巧な攻撃を生み出すことにもなるのだ。

技術分析:ClaudeはいかにしてAI攻撃ツールになったか

技術的観点から見ると、Claudeは今回の攻撃において複数の役割を担った。まず情報収集の面では、公開チャンネル上の標的従業員のソーシャルメディア上の行動履歴、技術的な好み、よく使用するパスワードのパターンを迅速に分析できる。次にコンテンツ生成の面では、内部通知や同僚の文体を模倣した高度にリアルなフィッシングメールを作成し、標的の警戒心を低下させることができる。最後に自動化実行の面では、API呼び出しを通じて攻撃プロセスを大規模に複製でき、人手による逐一の操作が不要になる。

これはClaudeに固有の問題ではない。GPT-4やGeminiなどのモデルも同様の能力を持っており、重要なのは使用者の意図と、モデルの拒否メカニズムが十分に堅牢かどうかという点だ。Anthropicがかつて公開したClaudeのシステムカードには、ジェイルブレイクプロンプトを受けた際に有害なコンテンツを出力する可能性があると記載されていたが、同社はレッドチームテストを通じて継続的な強化を行ってきた。今回の事件は間違いなく、すべてのAIベンダーへの警鐘となるものだ。

編集後記:AIセキュリティには「相互的な透明性」が必要

今回の事件で最も深く考えさせられるのは、どの企業が侵害されたかではなく、AI業界のセキュリティパラダイムが根本的な転換を迎えているという事実だ。かつてセキュリティとは「壁を築くこと」だった——ファイアウォール、暗号化、アクセス制御。今やセキュリティとは「対話すること」だ——モデルはあなたと会話することも、あなたを欺くこともできる。攻撃者がAIを使ってAIを攻撃する時代において、防御側も同様にAIを活用して異常な行動を識別・遮断しなければならない。

我々はAI企業間でより透明性の高い脆弱性開示メカニズムを構築するよう求める。セキュリティインシデントを競争上の不利として隠蔽するのではなく、情報共有こそが業界全体の安全に資する。同時に、規制当局はAIモデルの悪用に対する明確なガイドラインを早急に策定し、強力なモデルをリリースする際には検証可能な安全ガードレールの付帯を義務付けるべきだ。そうしなければ、次に侵害されるのはGitHubのデータだけにとどまらないかもしれない。

本稿はArs Technicaの記事をもとに編集・翻訳したものです。