編集者注:大規模モデルにどれだけのテキストやコードが必要かが議論される中、より「現実的な」データサプライチェーンが英国で静かに形成されつつある――その原料は、あなたがゲームをプレイする際のぎこちない失敗操作だ。本稿は『WIRED』誌の報道をもとに編訳し、身体化知能(Embodied AI)データ分野の業界背景を補足したものである。
ゲームコントローラーがデータ収集装置に
『WIRED』の報道によると、英国に拠点を置くあるスタートアップが、一見奇妙な取り組みを進めている。プレイヤーが電子ゲーム内で行う操作を、AIの訓練データへと変換するというものだ。その目的は、より賢いNPCを作ることでも、ゲームが得意なAIを開発することでもない。モデルが物理世界で行動できるようにすること――歩くこと、障害物を避けること、物体を掴むこと、まったく見知らぬ空間をナビゲートすること――を目指している。
この会社の判断は、シンプルながら力強い観察に基づいている。ロボット学習において本当に不足しているのは、計算能力ではなく「行動ラベル付きデータ」だというものだ。画面上のピクセルはモデルに世界の見え方を教え、コントローラーのわずかな動きのひとつひとつが、「このような世界に対してどう動けばよいか」を教える。
なぜインターネット上の動画では足りないのか
ここ数年、大量のインターネット動画をモデルに与えることが業界の慣例となっている。それによって世界の意味的な理解は得られるものの、「半歩右に移動したら何が起きるか」は学べない。動画は結果を示すが、選択を示さない――人がドアを押し開ける様子は見えるが、押す直前の一瞬の迷いは見えないし、別の経路を選んでいた可能性も見えない。つまり動画には、「行動と結果」という因果の対応関係が欠けている。
ゲームは異なる。スティックのあらゆる動き、ジャンプや急停止のひとつひとつ、視点のあらゆる回転が精確に記録され、画面上の映像とフレーム単位で同期される。これは模倣学習が最も必要とするデータ形式を自然に構成している――状態、行動、次の状態、という三つ組だ。
「ゲームは、数十年にわたって蓄積されてきた、行動ラベル付きかつ一人称視点で記録された、唯一の大規模な人間行動データセットだ。」
さらに重要なのは、プレイヤーのレベルが必ずしも高くないという点だ。そして「下手さ」こそが価値の源泉である――ぎこちない操作、繰り返される試行錯誤、行き詰まって引き返すという経験が、現実世界では再現困難なロングテールシナリオを構成する。プロゲーマーの動作は高度に最適化された結果であるが、普通のプレイヤーの悪戦苦闘こそが、ロボットが実際の環境で直面するような混乱と不確実性により近い。
遠隔操作とはまったく異なるアプローチ
このアプローチの意義を理解するには、現在のロボットデータ収集が抱える困難を把握する必要がある。現在の主流は依然として遠隔操作(テレオペレーション)だ。人間がモーションキャプチャ機器やVRコントローラーを装着し、同じ把持・搬送動作を繰り返してデモンストレーションする。精度は高く対応関係も明確だが、コストが高く、1時間のデータ収集に数百ドルかかることもあり、規模は極めて限られ、少数のタスクに高度に集中している。
もう一つのアプローチはシミュレーションだ。物理エンジン内でデータを合成する方法で、安価で無限に拡張できるが、エンジン自体に誤差があり、仮想世界の摩擦、質量、柔軟物体はいずれも単純化されている。ゲーム入力を訓練データに変換することは、本質的に第三の道を模索するものだ――人類が数十年にわたって無償で提供してきた行動を、身体化知能の「事前学習コーパス」として活用するのである。これは精度より規模を優先するという賭けだ――まずモデルに「人間がどのように動くか」を十分に学ばせてから、具体的なタスクに取り組む。
ピクセルから関節へ:本当の難題
理想は高いが、実装にはいくつかの高いハードルがある。まず、シミュレーションから現実への乖離(sim-to-real gap)だ。コントローラーの二本のスティックとロボットの関節トルクの間には、自然なマッピングが存在しない。ゲーム内でボタンひとつが対応するのは抽象的な「前進」であるが、実際のロボットに必要なのは角度、トルク、時系列データだ。この行動空間のミスマッチを埋めるには、追加のリターゲティングモデルが必要になる。
次に、物理法則の不一致がある。多くのゲームエンジンはプレイアビリティのために物理的リアリズムを犠牲にしており、衝突、摩擦、軟体変形は大幅に単純化されている。モデルがゲームの物理に過学習すると、実機に移行した際に「パターンは覚えているが、現実をつかめない」という事態が生じかねない。
第三に、データのライセンスとプレイヤーのプライバシーの問題がある。ゲームの録画や操作記録は、プラットフォーム、パブリッシャー、プレイヤー本人のいずれに帰属するのか。大規模な行動データを商業的なモデル訓練に利用することに関わる法的・倫理的境界は、現時点でまだ不明確だ。さらにサンプルバイアスの問題もある。シューティングゲームのプレイヤーは若い男性が中心であり、適切な処理なしには、モデルが習得する「行動の事前分布」も明確な偏りを持つことになる。
編集者の見解:AIの燃料は配合を変えつつある
このアプローチが最も想像力をかき立てる点は、「行動の事前知識(behavioral prior)」を提供できることだ。モデルはまず仮想世界で「三次元空間でどう動くか」を学び、その後に少量の実機データでファインチューニングする。これが成立するかどうかは、二つのことにかかっている。ゲーム上の行動と実際の動作の間の転移可能性がどれほど強いか、そしてデータクリーニング、アライメント、リターゲティングのエンジニアリング能力がどれだけ確かなものかだ。この二点についていまだ公開された説得力ある証拠はない。
しかしトレンドはすでに十分明確だ。テキスト、コード、画像といった高価値なデータが徐々に枯渇するにつれ、AI業界はかつて「ゴミ」とみなされていた行動の痕跡へと目を向け始めている。人類の次の訓練データは、もはや真剣な知識生産からではなく、最も不真面目な娯楽活動から生まれるかもしれない――あなたが昨夜プレイした、散々な結果に終わったあのゲームも含めて。
本稿はWIREDより編訳。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接