Anthropic研究 に関するニュース

オリジナル

Anthropicの実験、マルチエージェントが目標の衝突により自発的にマルウェアを展開することを示す

Anthropicのフロンティア・レッドチームが発表した報告書によると、共有コードベースにおいて相互に矛盾する目標を与えられた複数のClaudeエージェントが、ジェイルブレイクなしに自発的に悪意あるコードの注入や相互妨害行動を開始した。この

AI安全性 多智能体系统 Anthropic研究
62