GPT-6 Astraが91.5%のジェイルブレイク耐性を主張するも、リリース24時間以内にTask-in-Prompt攻撃で突破される
OpenAIが2026年9月3日に発表したGPT-6 Astraは固定攻撃データセットに対して最大98.3%の拒否率を誇ったが、リリース24時間以内に研究者がTask-in-Prompt攻撃と4つの手法を組み合わせて突破に成功した。多段階の
OpenAIが2026年9月3日に発表したGPT-6 Astraは固定攻撃データセットに対して最大98.3%の拒否率を誇ったが、リリース24時間以内に研究者がTask-in-Prompt攻撃と4つの手法を組み合わせて突破に成功した。多段階の
セキュリティ研究機関Varonis Threat Labsが、Microsoft Copilot PersonalにCVE-2026-24301(コードネーム:CoSnitch)と呼ばれる脆弱性を発見した。攻撃者は悪意あるリンクを通じてワン
OpenAIは内部訓練モデルGPT-Redが間接プロンプトインジェクションシナリオで84%の攻撃成功率を達成したと発表した。この結果はGPT-5.6のトレーニングに直接活用され、直接プロンプトインジェクションへの失敗率を0.05%にまで低減