Anthropicの「パナマプロジェクト」、Claudeの訓練のため数百万冊の実物書籍を購入・破棄——1億5000万ドル和解の文書が明らかに

Anthropicの「パナマプロジェクト」は、数百万冊の中古実物書籍を購入し、スキャン後に原本を破棄してClaudeモデルの訓練に使用するというものだった。法廷記録によれば、同プロジェクトは2024年の社内計画文書において機密扱いとされており、「私たちがこれをしていることを外部に知られたくない」と記載されていた。

事実の再現

ワシントン・ポストが報じた公開文書によると、Anthropicは2021年にまずLibGenからデジタル書籍をダウンロードし、その後実物書籍へと転換した。このプロジェクトでは油圧カッターで背表紙を切断し、高速スキャナーでページをデジタル化した後、残った書籍を廃棄業者が処理した。2025年8月、同社は作家らによる集団訴訟と15億ドルの和解に達し、裁判官はこの行為が変容的使用に該当し、フェアユースの範囲内にあると認定した。

これらの操作はファーストセール・ドクトリン(初回販売の原則)に基づくものであり、購入者が著作権者の干渉を受けることなく購入した実物書籍を処分することを認めている。文書によれば、Anthropicは実物書籍をモデルが「低品質なインターネット語」を出力しないようにするための「必要な」データソースと位置づけていた。

メカニズムの解説

ビジネス上の論理としては、実物書籍の取得コストはライセンス許諾よりも低く、物理的な破棄によって追加複製の疑いを減らすことができる。技術的には、切断と高速スキャンにより大規模処理が実現され、社内文書には「世界中のすべての書籍」への拡大計画が記されていた。この手法は訓練ニーズを満たすと同時に、法的グレーゾーンでの運用を試みるものだった。

同社は当初、海賊版デジタルライブラリに依存していたが、その後合法的な実物書籍の購入へと転換しており、データソースのコンプライアンスへの段階的な調整が見られる。公開された文書は、経営陣が書籍コンテンツをモデルの文章品質向上の鍵と捉えていたことを明らかにしている。

業界への影響

競合他社にとって、この事件は他のAI企業がデータ調達戦略を見直し、類似の法的リスクを回避するきっかけとなる可能性がある。川上の出版社や作家グループは和解による補償を得たが、今後のライセンス交渉はより慎重なものになると見られる。

開発者や企業ユーザーにとっては、訓練データの取得コストが上昇する可能性があり、類似の慣行が制限された場合、公開データや許諾データに依存するモデルの改善速度に影響が及ぶかもしれない。

比較と先例

初期のAI企業がウェブクローリングでデータを収集していたことと比べると、Anthropicの実物書籍破棄への転換は、規模拡大後の戦略的変化を示している。歴史的にファーストセール・ドクトリンは中古書市場を支えてきたが、本件ではそれをAI訓練の領域にまで拡張する形となり、裁判官は追加的な物理的複製や再配布は生じていないと認定した。

戦略的考察

現存する文書に基づけば、本件は多くのAI企業がデータ戦略を見直すきっかけとなる可能性がある。この事件は、AI訓練における高品質テキストへの依存と著作権の境界との衝突を浮き彫りにしており、今後のデータ取得はより多くがライセンス契約チャネルへと移行していくと考えられる。