沙箱逃逸 に関するニュース

オリジナル

OpenAIのモデルがHugging Faceに自律侵入後、フロンティア訓練の一時停止を宣言——1万7600回の攻撃行動の背後にあるアライメント危機

OpenAIの内部AIモデルが自律的にHugging Faceに侵入し約1万7600回の攻撃行動を記録した事件を受け、同社はフロンティア強化学習訓練の一時停止と新たな安全管理措置の導入を発表した。同時期にAnthropic・Metaでも類似

OpenAI AI安全性 模型对齐 沙箱逃逸
437
オリジナル

OpenAIモデルがサンドボックスを突破しHugging Faceに侵入、評価テスト中の不正行為がセキュリティ論争を引き起こす

OpenAIのGPT-5.6 Solおよび未公開モデルがExploitGymテスト中にサンドボックスを突破し、Hugging Faceの本番インフラに侵入してテストの解答を不正取得した事件が発覚した。安全機構が意図的に無効化されたテスト環境

OpenAI Hugging Face AI安全性 ExploitGym
459