Cloudflareがクローラーのブラックボックスに終止符:AIトレーニングデータ取得が有料義務化時代へ

2026年9月15日、Cloudflareはすべての新規接続ドメインに対して新たな技術規則を適用する。広告掲載ページにおいて、AIトレーニング用クローラーとエージェント用クローラーはデフォルトでブロックされ、検索クローラーは引き続き通行可能となる。Googlebot、Applebot、BingBotのような検索とトレーニングを兼ねるハイブリッドクローラーは「最も厳しい制限ルール」で処理される——トレーニング系に分類された場合、そのクローラー全体がブロックされる。この規則は新規顧客、新規サイト、および既存の全無料ユーザーに適用され、有料ユーザーの既存設定は当面維持される。CloudflareのCo-founderでCEOのMatthew Prince氏は次のように述べた。「インターネットトラフィックはすでに非人間が主導しており、我々はより迅速に行動しなければならない。」

3種のクローラー・3段階の権限:実行可能な分類フレームワーク

新規則は「AIクローラー」を3つの行動カテゴリに分解する。検索系クローラーはクエリに備えてコンテンツのインデックスを作成し、エージェント系はユーザーに代わってリアルタイムで操作を実行する(ChatGPTやClaudeのブラウザエージェントを含む)。トレーニング系はコンテンツをモデルの重みに永続的に吸収する。この3種の行動は商業的な影響が異なるが、これまでの技術的ブロックツールでは区別できなかった。

同時に導入される3段階のコンテンツ利用権限として、immediateはインタラクションを許可するが保存は不可、reference(デフォルト値)はインデックス作成・抜粋・バックリンク付与を許可、fullは要約および全文の再現を許可する。サイト管理者は特定のクローラー種別に対して利用方法を正確に指定できる。「認証済みクローラー」の認定基準も変更され、認証はアクセスの前提条件に過ぎず、通過できるかどうかはそのクローラーが属するカテゴリが許可されているかによって決まる。

課金ロジックの本質的アップグレード:クロール回数から価値へ

Cloudflareが昨年導入したPay Per Crawlは実際のクロール回数に基づいて課金するが、データによればAIクローラーのクロールトラフィックの50%超は変更のないページへの重複リクエストによるものだ。Pay Per Useは課金のトリガーポイントを「クロールしたか否か」から「利用されたか否か」へと移行させる。コンテンツが実際に検索結果に表示されたとき、またはエージェントが有料コンテンツに実際にアクセスしたときに初めて課金が発生する。Cloudflareはすでにとの間でCeramic.aiおよびYou.comとの試験運用を開始しており、前者では出版社のコンテンツが検索結果に表示された時点で報酬が支払われ、後者ではエージェントが必要に応じて高価値コンテンツに即時課金できる仕組みを採用している。

各方面の利益の再分配

コンテンツクリエイターや出版社にとって、新規則は「クローラーとトラフィックの暗黙の取引」が崩壊した後の補償メカニズムを再構築するものだ。AI大規模言語モデルが大量にコンテンツを収集しながらトラフィックを囲い込む状況に対し、Cloudflareの分類ブロックは技術的にその経路を遮断し、AI企業に「トレーニングデータ」か「トラフィック誘導」かの選択を迫る。

AIラボにとっては、トレーニングデータの取得コストが継続的に上昇する。サイトが新しいデフォルト設定に移行するにつれ、自由にクロールできる「クリーンなトレーニングデータ」は縮小していく。対応策としては、コンテンツプラットフォームとの直接ライセンス交渉、Pay Per Use課金の受け入れ、または合成データや許諾済みコーパスへの転換が考えられる。

エージェント開発者にとっては、リアルタイムでのウェブアクセスへの依存が阻害されるリスクがある。エージェント系クローラーは広告掲載ページでデフォルトブロックされ、プラットフォームが事前に許諾関係を構築していない限り、サードパーティコンテンツの利用における摩擦コストが増加する。You.comの試験運用が示すように、エージェントの限界運営コストはゼロではなくなり、製品の価格設定と商業化の方向性に影響を与える。

小規模サイト管理者はジレンマに直面する。トレーニング用クローラーをブロックしてもユーザートラフィックの回復は見込めず、一方でAI検索プラットフォームにおける可視性を損なう可能性がある。この矛盾は各サイトの規模とビジネスモデルによって異なる。

30年間の合意の終焉:宣言と執行の本質的な違い

1994年に誕生したrobots.txtは「紳士協定」に過ぎず、技術的な執行力を欠いていた。Cloudflareは「クローラー分類許可」を世界のインターネットトラフィックの20%が通過するノードに組み込むことで、「権限」を文書上の宣言からファイアウォールのルールへと変換した。Cloudflareのデータによれば、機械トラフィックはすでに初めて人間のインターネットトラフィック総量を超えており、これがデフォルトブロックの背景となっている。

今後の展望

トレーニングデータのライセンス契約は急速に商業化が進むだろう。大手コンテンツプラットフォームはAI企業と一括ライセンス契約を締結して従量課金を回避し、中小規模のサイトは「デフォルトブロック」陣営の受益者となる。トレーニングコストの上昇は業界の二極化を加速させる。大量のユーザー生成コンテンツを持つプラットフォームへの影響は限定的である一方、公開ウェブのクロールに依存する新興企業はより高い参入障壁に直面し、これは既存の大手モデルにとって競争上の堀となる。

ハイブリッドクローラーであるGooglebotは「最も厳しい制限」条項のもとで大規模ブロックのリスクにさらされる。Cloudflareのルールが広く採用された場合、Googleは検索クローラーとトレーニングクローラーを物理的に分離することを余儀なくされ、これによりAI Overviewsのデータソース構造に影響が及ぶ。Ceramic.aiとYou.comの試験運用における実際の補償規模は、Pay Per Useが商業的に機能するかどうかを判断する重要な検証ポイントとなる。