AIがトヨタ・カローラを運転してハンバーガーを買いに行く:3モデル実地テストで成功したのは1つだけ

AIがトヨタ・カローラを運転してハンバーガーを買いに行く:3モデル実地テストで成功したのは1つだけ

ChatGPT、Claude、Grokを運転席に座らせたとしたら、あなたをファストフード店まで安全に届けられるだろうか?3人のエンジニアが、実際のトヨタ・カローラを使ってその答えを探ることにした。

奇想天外な実験:AIが車を運転してハンバーガーを買いに行く

WIREDの報道によると、3人のエンジニアが現在最も主流な3つの大規模言語モデル——OpenAIのGPT、AnthropicのClaude、xAIのGrok——をそれぞれ改造したトヨタ・カローラに接続し、出発点からIn-N-Outバーガーの店舗まで走行して戻るという運転タスクを、各モデルが単独で完遂できるかを検証した。

これは単純なシミュレーションテストではない。車両には必要なセンサーとアクチュエータが搭載され、AIモデルはリアルタイムで道路情報を処理し、運転判断を下してステアリング、アクセル、ブレーキを制御する必要があった。つまり、言語モデルを物理世界の安全クリティカルな場面に直接投入する実験だ。

「テキストの世界では万能なこれらのAIが、実際の道路ではどう振る舞うのかを知りたかった」と、実験に参加したエンジニアは述べた。

結果発表:成功したのは1モデルのみ

実験の結果は劇的なものだった。3モデルのうち成功したのはわずか1つ。どのモデルが勝者かは明示されていないが、この結果自体が多くを語っている——現在の大規模言語モデルが物理世界で示す信頼性は、モデルによって大きなばらつきがあるということだ。

失敗したモデルにはどのような問題が生じたのか。複雑な道路状況の誤判断、交通規則の理解のずれ、あるいは突発的な状況における意思決定の混乱といった問題が考えられる。これらはまさに、自動運転分野が数十年にわたって解決しようとしてきた核心的な難題だ。

注目すべきは、大規模言語モデルの本質がテキスト予測に基づくAIシステムである点だ。これらのモデルは専門的な運転訓練を受けておらず、それを直接車両制御に用いることは、一度も車を運転したことのない「本の虫」を路上に送り出すようなものだ。

なぜこの実験が注目に値するのか

現在、AI業界では「エンボディドインテリジェンス(身体性を持つ知能)」——AIをデジタル世界から物理世界へ進出させること——が盛んに議論されている。ヒューマノイドロボットから自動運転まで、大規模言語モデルは潜在的な「汎用ブレイン」として期待されている。しかしこの実験は、言語理解能力と物理世界の操作能力の間には巨大な隔たりがあることを改めて示した。

自動運転分野ではすでにWaymoやテスラといった企業が数十億ドルを投じ、専用のセンサーフュージョンとエンドツーエンドのニューラルネットワークを開発している。それに対して、汎用大規模言語モデルで直接車を運転させることは、実用的な技術路線というよりも、極限的なストレステストに近い。

しかし、こうした実験の価値は問題を浮き彫りにすることにある。AIモデルが「前方工事中、迂回してください」という臨時標識や、「後方から救急車が接近中」という緊急事態に直面したとき、正しい判断を下せるか。こうしたエッジケースこそが、自動運転安全性の急所なのだ。

編集後記:AIに必要な「身体」は「頭脳」より難しい

この実験が示す深層的な示唆はこうだ。私たちは大規模言語モデルの汎用性を過大評価し、物理世界の複雑さを過小評価してきたのかもしれない。GPT、Claude、Grokは詩の執筆、プログラミング、法律試験で優れた性能を発揮するが、車の運転に必要なのは知識だけではない。リアルタイムの知覚、空間推論、動的な意思決定——これらの能力は現時点でも依然として専用システムに大きく依存している。

もちろん、これは大規模言語モデルが自動運転において価値を持たないという意味ではない。シナリオ理解、ヒューマンマシンインタラクション、意思決定の説明といった用途には活用できるが、低レベルの制御システムとの統合にはまだ多大なエンジニアリング努力が必要だ。

3人のエンジニアによるこの実験は一見荒唐無稽に見えるが、実際には精密な「ストレステスト」だ。汎用人工知能への道において、物理世界のハードルは私たちが想像していたよりもはるかに高い——この実験はそのことを教えてくれる。そして安全最優先が求められる交通の場面では、いかなる技術の未熟さも、人命という代償を伴いかねないのだ。

本記事はWIREDより編訳