オリジナル CoT監視が計画注入攻撃に脆弱――スタンフォード論文、25〜33%の回避率を報告 スタンフォード研究チームがarXivに投稿した論文により、表面上は無害に見える推論計画をActorモデルのコンテキストに埋め込むだけで、Monitorモデルの安全検出を25〜33%の確率で完全に回避できることが明らかになった。 AI安全性 CoT监控 斯坦福研究 1時間前 34