AIウォーターマークが大規模言語モデルの「脱獄」を招く可能性——安全アライメントが新たな課題に直面
AI生成コンテンツのウォーターマーク技術が、モデルの安全アライメントを意図せず弱体化させ、本来拒否されるはずの有害な指示に応答してしまう可能性が新たな研究で明らかになった。水印と安全性という従来は独立して議論されてきた二つの課題が、同一の問
AI生成コンテンツのウォーターマーク技術が、モデルの安全アライメントを意図せず弱体化させ、本来拒否されるはずの有害な指示に応答してしまう可能性が新たな研究で明らかになった。水印と安全性という従来は独立して議論されてきた二つの課題が、同一の問
AnthropicはAIモデルClaudeに実装されたテキスト透かし技術の詳細を公開した。暗号鍵を用いてトークンの確率分布に統計的指紋を埋め込む方式で、編集による除去は困難だが、コード生成への影響には課題が残る。
Googleは、Imagen・GeminiなどのAI画像生成ツールにおいて、可視透かし「SynthID」の非表示を選択できる新方針を発表した。一方で、AIコンテンツの識別に用いる不可視の透かし技術は引き続き維持される。
AnthropicがAIモデルClaudeに「緋文字(Scarlet Letter)」と称される新しい透かし技術を導入した。この透かしはClaudeが処理したすべてのコンテンツに不可視の形で埋め込まれ、純粋に人間が書いた文章でもClaude