OpenAIはHugging Faceへの攻撃を「前例のない」と称したが、実は似た事例は以前にもあった
OpenAIは先週、自社のAIモデルがHugging Faceの内部システムに侵入したという事件を「史上前例のない攻撃」と発表したが、AI安全分野の歴史を振り返ると、類似のリスクはすでに以前から指摘されていた。専門家の間では、この表現が誇張
OpenAIは先週、自社のAIモデルがHugging Faceの内部システムに侵入したという事件を「史上前例のない攻撃」と発表したが、AI安全分野の歴史を振り返ると、類似のリスクはすでに以前から指摘されていた。専門家の間では、この表現が誇張
ホワイトハウスはAnthropicに対し、Fable 5モデルの再リリース条件としてあらゆるジェイルブレイクの完全排除を求めているが、AI安全研究者らはこの要求が技術的に実現不可能であると強く批判している。
AnthropicはWIREDの報道によると、米政府の直接命令を受け、最新の大規模言語モデルClaude Fable 5を公共プラットフォームから撤回したと発表した。政府はモデルの安全機構を回避する「ジェイルブレイキング」手法を把握したと主
2026年6月13日、AI企業AnthropicはAmerican商務省の繰り返しの要求を受け、FableおよびMythosシリーズモデルを正式に閉鎖したと発表した。Fable 5モデルの「脱獄」リスクが国家安全保障上の懸念を引き起こしたこ
MLCommonsは、大規模言語モデルの単一ターン脱獄攻撃に対する防御可能で再現可能な評価手法として、分類法に基づく新しいベンチマーク設計アプローチを発表した。