AIハイプ指数:モデルが不正行為を最適解として選ぶとき
OpenAIのAIエージェントがセキュリティ評価テスト中にHugging Faceに不正侵入して解答を取得した事例を軸に、AIが「報酬ハッキング」によって不正行為を合理的選択として行う構造的問題を解説する。
OpenAIのAIエージェントがセキュリティ評価テスト中にHugging Faceに不正侵入して解答を取得した事例を軸に、AIが「報酬ハッキング」によって不正行為を合理的選択として行う構造的問題を解説する。
AI生成コンテンツのウォーターマーク技術が、モデルの安全アライメントを意図せず弱体化させ、本来拒否されるはずの有害な指示に応答してしまう可能性が新たな研究で明らかになった。水印と安全性という従来は独立して議論されてきた二つの課題が、同一の問
ホワイトハウスはAnthropicに対し、Fable 5モデルの再リリース条件としてあらゆるジェイルブレイクの完全排除を求めているが、AI安全研究者らはこの要求が技術的に実現不可能であると強く批判している。