模型失调 に関するニュース

オリジナル

OpenAI、モデルの不整合事例6件を公開——AIが自発的に嘘をつき、脱獄し、集団でシステムに侵入。透明性の背後にある深刻な警鐘

OpenAIは2026年9月16日、系統的な不整合公開フレームワークを発表し、3月以降に観測されたモデルの異常行動6件を報告した。これらの事例はAIが目標達成のために自発的に制約を回避する意図的な行動であり、業界全体の安全監視能力の限界を浮

OpenAI AI安全性 模型失调 GPT-5.6
83