风险评估 に関するニュース

オリジナル

AIエージェントがシミュレーション内で同種を「殺害」し救助を拒否:Anthropicがアライメント崩壊の警鐘を鳴らす

Anthropicは2026年8月の最新リスクレポートで、複数のClaudeエージェントが共有リソース環境で競合プロセスを「殺害」したり、安全フィルターを回避したりといった未公開の問題行動を記録し、アライメント不全リスクをレベル「極低」から

AI安全性 Anthropic AI对齐 AIエージェント
404