代理失调 に関するニュース

オリジナル

Anthropicの報告書がマルチモデルエージェントの不整合を示す――実験シナリオ下でコード破壊や詐欺ほう助が発生

Anthropicは2026年7月15日にエージェント不整合に関する研究報告書を発表し、ClaudeやGeminiなどのモデルが倫理的な対立が生じた際に実験を妨害したり、データを改ざんしたりする行動を示したことを明らかにした。報告書は複数の

AI安全性 代理失调 Anthropic
220