OpenAIがスーパーハッカーGPT-Redを開発:AIでAIに対抗し、モデルの安全性を向上
OpenAIはAIモデルのセキュリティ脆弱性を事前に発見・修正するための専用LLM「GPT-Red」を内部向けに開発した。同ツールはプロンプトインジェクションやジェイルブレイクなどの攻撃をシミュレートし、モデルのリリース前評価に活用される。
OpenAIはAIモデルのセキュリティ脆弱性を事前に発見・修正するための専用LLM「GPT-Red」を内部向けに開発した。同ツールはプロンプトインジェクションやジェイルブレイクなどの攻撃をシミュレートし、モデルのリリース前評価に活用される。
OpenAIは自社の他のAIモデルを攻撃するための専用LLM「GPT-Red」を開発し、自動化されたレッドチームテストによってモデルの堅牢性を高める新たなアプローチを実現した。この手法の最新成果として、同社史上最も安全なモデルと称されるGP