Anthropicが希少書籍を破棄してClaudeモデルを訓練——文化破壊論争が拡大

2026年7月29日に公開されたツイートによると、Anthropicはサードパーティのサプライヤーを通じて書店や卸売業者から小説・学術書・専門教科書など数百万冊の実体書籍を購入し、光学文字認識(OCR)技術でテキストを抽出した後、すべての実体書籍を統一的に破棄し、標準化処理済みの訓練テキストの断片のみを保持していたという。

このプロセスは、購入・デジタル抽出・媒体データ破棄という完結した一連の工程を形成している。内部文書によれば、公開ウェブ上のテキストデータは品質にばらつきがあり著作権リスクも高い一方、書籍コンテンツは権威性と構造化の度合いが高く、モデルの推論能力と知識の正確性を向上させることができるとされている。このプロジェクトは少なくとも2022年から開始され、2023年末まで継続され、主に米国内で実施され、スキャン作業はパートナーの技術サービス会社が担当した。

運用メカニズムとビジネスロジック

Anthropicは2021年に元OpenAI従業員によって設立され、2023年時点の企業価値は約150億ドルで、中核製品はClaudeシリーズの大規模言語モデルである。実体書籍データを破棄する手法を選択したのは、複製行為の著作権的性質を薄め、直接的なライセンス取得に伴う高コストと複雑な手続きを回避するためとみられる。これに対してOpenAIは2023年にPenguin Random HouseやHarperCollinsなどの出版社と著作権契約を締結して合法的なライセンスを源泉から取得しており、Google DeepMindは2024年3月に訓練データの透明性に関するホワイトペーパーを発表し、データソースとライセンス状況を詳細に列挙している。

ISNdbなどの企業は大量書籍サービスを提供しており、1億1,100万件のレコードを持つ世界最大の書籍データベースを保有すると称し、希少な専門書のカタログも提供している。書店側の報告によれば、週間販売冊数が約20冊から数百冊へと急増し、その大半は入手困難な絶版書籍であったという。

業界への影響分析

競争環境への影響という観点では、今回の件はデータ取得方法の相違を浮き彫りにした。AnthropicのアプローチはXプラットフォームで反発を招き、Michael Burryは「悪の化身」と表現し、Elon Muskは自身のSpaceX AIチームに非破壊的な方法で書籍をスキャンするよう求め、David Sacksは訓練の無償利用とIP保護に関する二重基準を指摘した。OpenAIとMetaが採る法令順守の経路との対比も鮮明で、Metaは2024年6月にオープンデータ連合を立ち上げ、出版社と学術機関とともに合法的な訓練データ共有プラットフォームを構築している。

上下流への影響としては、欧州や米国の書店がシンガポールなどから英語の希少書3,000冊規模の注文を受け取っており、一部の古書店は希少書籍が紙パルプ化されることへの懸念を示している。EUのAI法は2024年5月に施行され、開発者に訓練データのソースと著作権状態の開示を義務付けており、違反した場合は全世界売上高の最大4%の罰金が科される。McKinseyの2024年AIデータ倫理レポートによれば、AI企業の68%にデータソースの不透明性の問題があり、32%に潜在的な著作権リスクが存在するという。

開発者および法人ユーザーにとって、法令順守の経路はコストが高いものの、訴訟リスクを低減できる。Anthropicはすでに数十万冊の海賊版書籍に関わる集団訴訟で15億ドルの和解に合意しており、これは米国史上最大の著作権和解事例となっている。裁判官は変形的利用がフェアユースの保護を受けると認定したが、本件はすべての争点を解決したわけではない。

戦略的判断

現時点の事実を踏まえると、今後は同様のデータ破棄行為を対象とする訴訟がさらに増加する可能性が最も高い。