Ars Technicaの報道によると、希少本をめぐる「暗闘」が古書市場で静かに進行している。複数の稀少本書商が、最近AI企業とみられる買い手が匿名の仲介者を通じて絶版本を大量購入し、その後まもなく謎の「消滅」を遂げているという事態を確認している。書商たちは、これらの書籍が意図的に廃棄されたと疑っている。
AI企業の「データ飢え」
近年、大規模言語モデルが高品質テキストデータを急激に必要とするようになり、従来のウェブ上のテキストリソースは徐々に枯渇しつつある。AI企業はやむなく書籍、とりわけデジタル化されておらず独自の文体を持つ希少本に目を向けるようになった。以前から、テクノロジー企業がパブリックドメインの書籍を訓練データの不足を補うために活用する計画を公表していた。しかし、物理的な書籍を直接購入して廃棄するという行為は、書商たちの予想をはるかに超えるものだった。
匿名の買い手と「廃棄条項」
「彼らは決して本当の身元を明かさず、第三者の代理人を通じてのみ取引を行う。支払いは気前よくなされるが、書籍の行方を外部に漏らさないよう求めてくる。さらに奇妙なことに、数日後、これらの本が製紙工場に送られたと知った。」匿名を希望するサンフランシスコの古書商がArs Technicaに語った。
同様の現象は、ニューヨーク、ロンドン、東京など古書取引が集中する都市でも発生している。書商たちは、買い取られた書籍が19世紀以前に出版された文学作品、哲学論考、自然史の写本であることが多いと気づいており、これらはまさに言語モデルの訓練において極めて希少な「高品質コーパス」に当たる。
廃棄の背後にある論理
なぜAI企業は購入した書籍を廃棄するのか。業界アナリストはいくつかの可能性を提示している。第一に、データの独占性を維持するため——実物の書籍が市場に流通し続ければ、競合他社が同じ本をスキャンして同等のコーパスを入手できる可能性があるから。第二に、著作権上の責任を回避するため——書籍が著作権保護期間内にある場合、実物を廃棄することでデジタル化利用の痕跡をある程度隠蔽できるから。第三に、一部の企業はデジタルスキャン後の紙の書籍に保存価値がないと判断し、廃棄物として処分している可能性がある。
しかし、いかなる動機があろうとも、一度失われた書籍は取り戻せない。これらの希少本はそれ自体が文化遺産であり、中には唯一の現存本もある。廃棄されれば、たとえ内容がスキャン保存されていたとしても、実物が持つ歴史的価値、版の情報、収蔵としての意義は永遠に失われる。
書商たちの連帯的抵抗
この動向に対し、一部の書商が行動を起こし始めている。ニューヨークの古書店の一軒は、匿名の買い手に「廃棄禁止条項」への署名を求め、違反した場合は高額の賠償を求めると定めている。ロンドンでは数軒の書商が情報共有グループを設立し、不審な買い手を記録して蔵書の販売を拒否している。ある書商はソーシャルメディアにこう書いた。「私たちは知識を売っているのであって、AIの餌を売っているのではない。」
規制と倫理の盲点
著作権法学者やAI倫理研究者たちもこの行為に懸念を示している。電子フロンティア財団(EFF)のあるアナリストは指摘する。「AI企業が書籍を購入する権利はあるが、公共の遺産を破壊することを代償にすべきではない。訓練データの取得が唯一無二の史料の廃棄に依存しなければならないとすれば、この業界の発展の道筋に根本的な欠陥があることを意味する。」
同時に、この事件はAIデータの著作権問題が抱える困難な現状をも映し出している。現在、法律はAI企業による著作権保護テキストの使用に対して明確な制約を設けておらず、企業がコーパスの争奪において極端な手段に走る結果を招いている。
編集後記:AIの食欲が倫理の防衛線を超えるとき
AI訓練データの取得は本来、革新と尊重のバランスをとるべき課題である。企業がモデルの競争力のためにコーパスを囲い込もうとすることは理解できるが、書籍を廃棄する行為は商業の範囲を超え、人類文明の保存という一線に触れるものだ。私たちはあの古い格言を改めて見つめ直すべきかもしれない——知識はプライスレスである、と。しかし今、それは値段をつけられ、さらには灰にされようとしている。
本稿はArs Technicaからの編集翻訳である
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接