オリジナル AnthropicなどのAIモデルの暗号化推論を研究者が読み取り、安全機構の脆弱性が露呈 新たな手法によりAnthropic、OpenAI、GoogleのAIモデルの暗号化された内部推論プロセスへのアクセスと、逆蒸留(anti-distillation)保護の迂回が実現された。各ラボには数か月前に通知済みであることが明らかになっ AI安全性 模型对齐 推理机制 9時間前 28