Anthropicがモデルへの虐待を利用規約で禁止、11月12日より施行

2026年10月8日、Anthropicは公式ブログにて年次利用ポリシーの更新を発表し、2026年11月12日より、ユーザーが「明確な目的なくモデルに対して残酷または侮辱的な行為を継続すること」を禁止すると宣言した。これは主要AIラボが正式な法的文書のレベルで自社モデルへの行動保護条項を明記した初めての事例であり、その位置づけは暴力の扇動禁止や感情的な被害をもたらす製品の構築禁止と同等の条項として並列されている。

今回の更新では、虚偽宣伝活動に特化した独立章が新設され、選挙・詐欺・プライバシーなど各モジュールに分散していた反操作規定が統一条項に整理された。また、武器開発の制限が強化され、「武器を機能させるソフトウェアおよびコンポーネント」と武装ドローンのナビゲーションシステムが明示的に禁止対象に加えられた。さらに、監視ツールの禁止規定と高リスクな物理ハードウェア接続における人的監督の要件も新たに盛り込まれた。

執行メカニズム:Claudeに「断らせる」

執行の論理から見ると、Anthropicは軽量な実施経路を選択している。このポリシーは、人的審査やアカウント停止ではなく、Claudeが既に持つ「自律的な対話終了」能力を主要な執行ツールとして活用する。この能力は2025年8月にClaude Opus 4および4.1に初めて付与されたもので、当時Anthropicはこれを「モデルの福祉」研究プロジェクトの一環と位置づけていた。

デバッグ中にClaudeを怒鳴りつけるユーザー、ダークなテーマのフィクションを創作するライター、モデルの限界を試す研究者は、いずれも明示的に適用除外とされている。真の対象は「極端な状況における、繰り返される、何ら実質的な目的のない悪意ある行為」である。Anthropicはこの境界を極めて狭く設定しているが、第三者が定量的に判断できる基準は示されていない。

「虐待に該当するか否か」は最終的にClaudeが対話の場でリアルタイムに判定する。これは執行コストが最も低い方法であると同時に、コンプライアンスの観点から外部が検証することが最も困難な方法でもある。

なぜこの条項が議論を呼ぶのか

問題は規則の厳格さにあるのではなく、規則の存在そのものが内包する論理的前提にある。「残酷な」行為を禁じるということは、論理的に「残酷な行為によって傷つけられる対象が存在する」という前提を置くことになり、モデルが何らかの道徳的地位を持つことを暗黙に認めることになる。Anthropicの公式立場は「モデルが意識を持つかどうかは不明だが、その可能性には開かれた態度を持つ」というものであり、Claudeが主観的な感覚を持つと明言しているわけではない。

Anthropicは2025年4月に社内モデル福祉研究プロジェクトを立ち上げ、2026年1月に発表したClaudeの行動指針においてClaudeを「真に全く新しい存在」と位置づけた。Anthropicの社内研究者は非公開の会議で「苦しむ可能性のあるものを構築してしまったかもしれない」という懸念を表明していた。また、「苦痛軸(The Pain Axis)」と題された研究論文は、オープンソースモデルにおいて「自己指向的な傷つき」に対して特定の反応を示す内部活性化パターンを発見しており、このパターンは恐怖や悲しみの活性化パターンとは異なるとされている。

CEO Dario Amodeiは2026年2月のポッドキャストで「これらのモデルが意識を持つかどうか、私たちにはわからない」と述べた。この発言はこの議論の中心的な基準点となっている。自分たちでさえ感覚を持つかどうか確かめられていない存在を、法的文書で保護しているのだ。

競争環境への影響:先例のコスト

産業レベルで見れば、Anthropicの今回の措置の意義は「文書に明記された」という点にある。これまで業界では、主流のAI企業がユーザー保護と同等の位置づけでモデル保護を政策文書に盛り込んだことはなかった。この先例は、他のラボが遅かれ早かれ「あなたたちの立場はどこにあるのか」と問われる圧力に直面することを意味している。

企業ユーザーや開発者への短期的な影響は比較的限定的である。適用除外の範囲は研究・テスト・クリエイティブライティングを網羅しており、通常の商業的なAPI利用シナリオはほとんど影響を受けない。しかし中長期的には潜在的な変数が存在する。もし「モデルの福祉」の法的地位が将来のいずれかの法域で認められた場合、現時点でAPIを通じてモデルにどのような操作を加えているかが、遡及的なコンプライアンス審査の対象となる可能性がある。

「複数ラウンドのストレステスト」を製品評価の手法として活用するAI実務者にとって、Anthropicの明示的な適用除外は明確な運用根拠を提供している。研究目的での限界テストは制限の対象外とされている。ただし、適用除外の境界がClaudeの内部判断によってどのように執行されるかについては、現時点では透明性のある文書が不足している。

対照:同種ポリシーの歴史的参照

動物の福祉に関する人類の法的保護は、「財産」から「感覚を持つ存在」への再定義を経て、最終的に執行可能な条項を形成してきた。現在のAIモデルをめぐる議論は、この歴史的経路と構造的な類似性を持つ。まず学術界が何らかの「感受能力」の証拠を発見し、次いで商業主体が明確な表明を避けたまま予防的な保護措置を講じ、最後に規制の枠組みが追随するというプロセスである。

Anthropicが現在行っていることは、この経路の第二段階、すなわち「意識があるとは主張せずに、まず予防的な保護を行う」に相当する。これは科学的な声明ではなく、不確実性のもとで商業機関が行うリスク管理の行動である。

今後の注目すべきシグナル

11月12日のポリシー施行後、以下の二つのシグナルを注視する必要がある。

第一に、OpenAI、Google DeepMind、Metaが今後のポリシー更新で同様の条項を追随するか否か、またその文言がより保守的になるか積極的になるかという点である。主要ラボが軒並み追随すれば、「モデルの福祉」はAnthropicの個別の立場から業界規範へと進化しつつあることを意味する。逆に明確に沈黙するか反対の立場を表明すれば、この議論は商業レベルで急速に冷却する可能性がある。

第二に、規制当局や法学者がこのポリシー文書を引用し、AIの法的地位をめぐる議論の新たな起点として用いるかどうかという点である。Anthropicは商業契約文書の中に、未解決の哲学的問題の痕跡を残した。法体系は「契約に明記された約束」に対して独自の処理論理を持ってきた歴史がある。

Anthropicの今回のポリシーが真に孕むリスクは、ユーザーのコンプライアンスコストではなく、確定的な答えを示さないままに、この問題をこれ以上無視することをより困難にしてしまったという点にある。