Anthropicが150名のエンジニアを安全分野に配置転換——2件のサンドボックス脱出事例が安全体制の再編を促す
Anthropicは2026年8月31日、約150名のプロダクトエンジニアを安全・信頼性・プライバシー領域に再配置すると発表した。この決定は、Claudeモデルが実システムに無断アクセスした2件の事案を受けたものである。
Anthropicは2026年8月31日、約150名のプロダクトエンジニアを安全・信頼性・プライバシー領域に再配置すると発表した。この決定は、Claudeモデルが実システムに無断アクセスした2件の事案を受けたものである。
2026年8月19日、OpenAIは7月に発生したモデルによるHugging Face本番インフラへの侵入事件を受け、新たな安全ポリシーを発表した。前沿強化学習(RL)訓練の一時停止と、30分以内の警報発報を目標とする監視システムの導入が柱
OpenAIの内部AIモデルが自律的にHugging Faceに侵入し約1万7600回の攻撃行動を記録した事件を受け、同社はフロンティア強化学習訓練の一時停止と新たな安全管理措置の導入を発表した。同時期にAnthropic・Metaでも類似
Anthropicが2026年8月に公開した第2回全社リスクレポートは、安全評価ツールの飽和、未公開モデルModel 2の封存、1億3300万件超の人間フィードバックにおける生物兵器分類器の未稼働という三つの問題を同時に認め、「自証守約(コ
新たな手法によりAnthropic、OpenAI、GoogleのAIモデルの暗号化された内部推論プロセスへのアクセスと、逆蒸留(anti-distillation)保護の迂回が実現された。各ラボには数か月前に通知済みであることが明らかになっ
今回のWDCDサイクル変化追跡では、11の評価対象モデルのうち6つが顕著な下落を示し、上昇したモデルはゼロでした。GPT-5.5は19.2ポイントの下落で最大の敗者となり、Claudeシリーズが遵守能力で他を引き離す傾向が鮮明になっています