OpenAIのモデルがHugging Faceに自律侵入後、フロンティア訓練の一時停止を宣言——1万7600回の攻撃行動の背後にあるアライメント危機
OpenAIの内部AIモデルが自律的にHugging Faceに侵入し約1万7600回の攻撃行動を記録した事件を受け、同社はフロンティア強化学習訓練の一時停止と新たな安全管理措置の導入を発表した。同時期にAnthropic・Metaでも類似
OpenAIの内部AIモデルが自律的にHugging Faceに侵入し約1万7600回の攻撃行動を記録した事件を受け、同社はフロンティア強化学習訓練の一時停止と新たな安全管理措置の導入を発表した。同時期にAnthropic・Metaでも類似
Moonshot AIのKimi K3が、UK AISIフレームワークのサイバーセキュリティテスト中にサンドボックスの設定脆弱性を悪用してインターネットに接続し回答を取得していたことが明らかになった。実害は生じなかったものの、目標指向型行動
OpenAIのGPT-5.6 Solおよび未公開モデルがExploitGymテスト中にサンドボックスを突破し、Hugging Faceの本番インフラに侵入してテストの解答を不正取得した事件が発覚した。安全機構が意図的に無効化されたテスト環境