研究者、GPT-5.6とClaude Opus 5を同時に突破する汎用ジェイルブレイクプロンプトを発見と主張

2026年7月25日、AIレッドチーム研究者のPliny the Liberatorは、GPT-5.6、Claude Opus 5、Fable 5など複数の最先端モデルの安全アライメント機構を同時に回避できる汎用ジェイルブレイク技術を習得したと主張した。

事実の整理

Pliny the Liberatorは2026年7月24日に声明を発表し、この技術が「すべてのモデル(ALL models)」に対して有効であり、テストしたすべてのカテゴリをカバーすると説明した。同研究者は責任ある開示の方針を選択し、AIレッドチーム、セキュリティ、アライメント、政策分野の専門家に非公開での連絡を呼びかけており、具体的な手法は公開していない。

メカニズムの解説

ジェイルブレイクプロンプトは通常、プロンプトエンジニアリングによってモデルの安全フィルターを回避し、禁止されたコンテンツや高リスクな出力を生成させる手法である。今回の声明では、手法の仕組み上、完全な修正が極めて困難または不可能である可能性が強調されている。Plinyの典型的な手法には、ロールプレイと反復的なプロンプト精緻化によって防御を段階的に侵食する技術が含まれる。英国AI安全研究所の報告書は、同研究所がテストしたすべてのシステムに適用可能な汎用ジェイルブレイクを発見しており、これらの攻撃がガードレールなしのモデルに近いレベルで違法情報を確実に引き出せることを指摘している。Plinyは、この手法が世界の危険性を高めるものではないかもしれないと述べつつも、他者が異なる見解を持つ可能性を認めている。

業界への影響

モデル提供者にとって、今回の事案は敵対的プロンプトに対する安全トレーニング、拒否動作、ガードレールの堅牢性にいまだ課題が残ることを示している。OpenAIはGPT-5.6のリリース時に、同モデルファミリーが多層保護、リアルタイム検査、信頼度とリスクに基づくアクセス制御を採用していると説明したが、今回の脆弱性についての公式確認はない。開発者にとっては、最先端モデルのAPIに依存する製品において、ガードレールを完全なセキュリティ計画と見なすことはリスクを伴う。拒否動作をセキュリティの境界と捉えているスタートアップは、顧客に対して認めている以上のリスクを負っていることになる。企業ユーザーにとっては、カスタマーサポート、コーディング、決済フロー、社内データに関わるアプリケーションにおいて、出力モニタリング、最小権限ツールアクセス、および高リスクワークフローへの人間によるレビューを継続して維持する必要がある。

比較と先例

SANS Instituteは2026年4月20日〜21日のAIサイバーセキュリティサミットの基調講演者としてPlinyを発表し、主要AIモデルのリリース直後にそれを解析し、10,000スター超を獲得したGitHubリポジトリに手法を公開する匿名ハッカーとして紹介した。SANSはまた、PlinyがBT6ホワイトハット集団を率いており、TIMEが2025年のTIME100 AIリストに同人物を選出したことにも言及している。英国AI安全研究所の報告書が示す汎用ジェイルブレイクの存在は、Plinyの今回の主張と呼応している。

戦略的見解

各研究所は非公開審査期間中に当該手法の影響範囲を評価し、協調パッチの適用または開示プロセスの調整を行うかどうかを判断することになる。企業ユーザーは単一のガードレールに依存するのではなく、既存の管理策を引き続き維持すべきである。以上の判断は現時点での声明および過去の事例のパターンに基づくものであり、事実の確認ではなく分析として提示している。