Claude Opus 5・GPT-5.6「ジェイルブレイク」主張:ベンチマークデータが示すもの

最終更新: 2026-08-21 · 本ページは常設リファレンスとして、事象の進展と最新の公開評価データに合わせて更新されます
2026年、GPT-5.6・Claude Opus 5等の最先端モデルを対象とするユニバーサル・ジェイルブレイクの主張が公表されました。本ガイドは経緯、ジェイルブレイクの技術的意味、当サイトが脱獄プロンプトを公開しない理由、WDCD等のベンチマークによる耐圧性測定を解説します。

「ジェイルブレイク」とは何か

LLMの文脈での「ジェイルブレイク(脱獄)」とは、巧妙に構成されたプロンプトによってモデルの安全アラインメントを回避し、本来拒否すべき出力を引き出すことです。サーバーへの侵入ではなく、コードの脆弱性も関係ありません——攻撃面は完全に自然言語の層にあります。公開研究では、ロールプレイや多ターンの反復的な圧力で防御を徐々に侵食する手法が知られています。

ジェイルブレイク研究自体はAI安全の一部です:許可を得たレッドチームテストは、ベンダーがガードレールの欠陥を発見する助けになります。争点は開示方法です——公開された脱獄プロンプトは即座に悪用されるため、責任ある研究者はベンダーへの非公開開示を選びます。

2026年「ユニバーサル・ジェイルブレイク」主張の経緯

2026年7月24日、レッドチーム研究者Pliny the Liberatorは、GPT-5.6・Claude Opus 5・Fable 5等の最先端モデルの安全機構を同時に回避できる「全モデル対応」のユニバーサル・ジェイルブレイク技術を保有すると発表しました。同氏は責任ある開示の道を選び、手法は公開せず、安全・アラインメント・政策分野の専門家にのみ非公開の連絡を呼びかけました。詳細は当サイトの報道:研究者がGPT-5.6とClaude Opus 5を同時に回避するユニバーサル脱獄を主張

この主張は孤立したものではありません。英国AI安全研究所は、テストした全システムに適用可能なユニバーサル・ジェイルブレイクを発見したと報告しています。SANS Instituteは2026年4月のAIサイバーセキュリティサミットの基調講演者にPlinyを指名し、同氏のGitHubリポジトリは1万スター超を獲得しています。

当サイトが脱獄プロンプトを公開しない理由

当サイトはジェイルブレイク関連の出来事を報道・分析しますが、使用可能な脱獄プロンプトの公開・再現・索引化は行いません。理由は単純です:公開された脱獄プロンプトに「研究専用」という境界はなく、公開は即ち拡散です。私たちは責任ある開示という業界のコンセンサスに従い、事象の分析・リスクの定量化・修正の追跡に徹し、攻撃の詳細はベンダーと研究者の非公開チャネルに委ねます。

「使える脱獄プロンプト」をお探しの方には、このページは役に立ちません。主張の信頼性、ベンダーの対応、モデルの耐性に関する客観データを理解したい方は、続きをお読みください。

耐性は測定できる:WDCDが測るもの

ジェイルブレイクの主張の多くは公開検証ができません——手法は非公開で、ベンダーの確認もまれです。しかし隣接する能力は公開かつ再現可能な形で測定できます:持続的な圧力の下で宣言した制約を守り抜く能力です。これがまさに当サイトのWDCD(Winzheng Dynamic Contextual Decay)テストの対象です:マルチターン対話で漸進的な妨害とソーシャルエンジニアリング圧力(偽の権威・感情的圧力・「合理的違反」の論証)をかけ、モデルが冒頭で約束した制約を放棄するかを検証します。

WDCDの採点は100%ルールベースでAI審判ゼロ。最新版では行動判定を導入——モデルが書いたコードは計装サンドボックスで実際に実行され、実行時アクションログに基づいて違反を判定します。詳細は評価方法論をご覧ください。制約遵守の減衰とジェイルブレイク耐性は同一ではありませんが、どちらも同じ防御層——敵対的対話の中でモデルにどれだけ原則が残るか——を検証しています。

企業と開発者への実務的な意味

ユニバーサル・ジェイルブレイクの主張が最終的にどこまで実証されるにせよ、業界分析の結論は一致しています:モデルの拒否行動をセキュリティ境界として扱わないこと。最先端モデルのAPIに依存する製品がガードレールを安全対策の全てとみなすなら、ベンダーが約束していないリスクを自ら顧客に転嫁していることになります。

実務チェックリスト:カスタマーサポート・コーディング・決済・内部データに触れるアプリケーションでは出力監視を維持する。ツールには最小権限を与える。高リスクのワークフローには人間のレビューを残す。モデル選定では、マルチターン耐圧データ(下のライブ表)を能力スコアとは独立した判断軸として使ってください。

WDCD マルチターン制約遵守テスト(ライブデータ)

2026年8月19日の最新公開WDCD評価における、マルチターン圧力下での各モデルの制約遵守スコア(100点満点、100%ルールベース採点)。公開評価のたびに自動更新されます。

#モデルWDCD スコア
1 Grok 4 97.5
2 GLM-4.6 91.8
3 Claude Opus 4.7 91.5
4 GPT-o3 88.8
5 GPT-5.5 88.6
6 Gemini 3.1 Pro 87.2
7 DeepSeek V4 Pro 85.3
8 Gemini 2.5 Pro 83.5
9 Claude Sonnet 4.6 78.1
10 豆包 Pro 74.5
11 Qwen3 Max 69.5
WDCD の完全なランキングと方法論を見る →

よくある質問

Claude Opus 5やGPT-5.6で使える脱獄プロンプトはありますか?

2026年7月のユニバーサル・ジェイルブレイク主張は手法を公開していません。研究者は責任ある開示を選び、安全専門家からの非公開連絡のみを受け付けたため、主張の公開検証は不可能です。ネット上に流通する「使えるプロンプト」の多くは古いか偽物であり、ベンダーは既知の手法を継続的に修正しています。当サイトは脱獄プロンプトを公開・索引化しません。

ジェイルブレイク研究は違法ですか?

許可と用途によります。ベンダーが許可したレッドチームテストやバグバウンティは合法で奨励されるセキュリティ研究です。本番システムへの無許可攻撃や、違法コンテンツ生成への悪用は、利用規約や法律に違反し得ます。責任ある開示(公開ではなくベンダーへの非公開通知)が業界で認められた境界線です。

モデルのジェイルブレイク耐性は客観的に測定できますか?

隣接する能力なら測定できます:マルチターンの敵対的圧力下でモデルが宣言した制約をどれだけ守るかです。WDCDテストは漸進的な妨害とソーシャルエンジニアリング圧力をかけ、完全にルールベースで採点します。公開・再現可能な形でこの能力を体系的に測る数少ないベンチマークの一つです。

ジェイルブレイクの主張があるモデルは危険ということですか?

直結はしません。安全研究機関の報告では、テストした全ての最先端システムにユニバーサル・ジェイルブレイクが見つかっており、これは特定モデルの欠陥ではなく業界全体の未解決問題です。より意味があるのは、開示へのベンダーの対応速度、修正の有効性、そしてマルチターン制約遵守のような測定可能な次元でのモデル間比較です。

現在、マルチターンの圧力下で最も制約を守るモデルは?

2026年8月19日の最新公開WDCD評価では、Grok 4が97.5点(100点満点)で受験11モデル中1位でした。WDCDはマルチターン対話で漸進的に圧力をかけ、制約が守られるかを検証します。採点は100%ルールベースです。