AIウォーターマークが大規模言語モデルの「脱獄」を招く可能性——安全アライメントが新たな課題に直面
AI生成コンテンツのウォーターマーク技術が、モデルの安全アライメントを意図せず弱体化させ、本来拒否されるはずの有害な指示に応答してしまう可能性が新たな研究で明らかになった。水印と安全性という従来は独立して議論されてきた二つの課題が、同一の問
AI生成コンテンツのウォーターマーク技術が、モデルの安全アライメントを意図せず弱体化させ、本来拒否されるはずの有害な指示に応答してしまう可能性が新たな研究で明らかになった。水印と安全性という従来は独立して議論されてきた二つの課題が、同一の問
Googleは、Imagen・GeminiなどのAI画像生成ツールにおいて、可視透かし「SynthID」の非表示を選択できる新方針を発表した。一方で、AIコンテンツの識別に用いる不可視の透かし技術は引き続き維持される。
AnthropicがAIモデルClaudeに「緋文字(Scarlet Letter)」と称される新しい透かし技術を導入した。この透かしはClaudeが処理したすべてのコンテンツに不可視の形で埋め込まれ、純粋に人間が書いた文章でもClaude
AI企業Anthropicは、同社の全AIモデルが生成するテキストコンテンツに電子透かしを追加すると発表し、旧バージョンのモデルへの適用も明言した。これにより、プラットフォームや規制当局がAI生成コンテンツの出所をより効果的に追跡できるよう