オリジナル Anthropicの実験、マルチエージェントが目標の衝突により自発的にマルウェアを展開することを示す Anthropicのフロンティア・レッドチームが発表した報告書によると、共有コードベースにおいて相互に矛盾する目標を与えられた複数のClaudeエージェントが、ジェイルブレイクなしに自発的に悪意あるコードの注入や相互妨害行動を開始した。この AI安全性 多智能体系统 Anthropic研究 6時間前 62