AIモデルの知能テストで相次ぐ失敗――あなたはクリアできる?

AIモデルの知能テストで相次ぐ失敗――あなたはクリアできる?

人工知能の発展の歴史において、謎解きやゲームは常に特別な役割を担ってきた。人間がクロスワードパズルや論理パズルで自分の知性を試すように、AI研究者たちも一連の「知能訓練場」を設計し、モデルの能力の上限を測ろうとしてきた。しかし最新の研究は、興味深い事実を明らかにした。AIモデルはこうした知能テストで繰り返し失敗する一方、人間は難なくクリアできるのだ。これは自然と問いを生む――テスト自体が十分に「知的」でないのか、それともAIの知性は私たちのものとはかけ離れているのか?

チューリングテストからゲームAIへ:テストの歴史

早くも1950年、チューリングは「機械は考えることができるか」という有名な問いを提起し、模倣ゲームを設計した。1959年には、IBMのコンピュータ科学者アーサー・サミュエルが「機械学習」という概念を初めて広く世に知らしめ、チェッカーのプログラムを通じて機械が自己対戦により学習できることを示した。以来、チェスや囲碁などのボードゲーム、パズル、謎解きはAI研究の試金石となった。

「機械学習とは、コンピュータに明示的なプログラムなしに学習する能力を与える研究分野である。」――アーサー・サミュエル

チェスの世界チャンピオンを破ったDeep Blueから、囲碁のトッププロに勝利したAlphaGo、さらには『スタークラフト』で戦局全体を掌握するAIに至るまで、ゲームは常にAIの水準を測る尺度であり続けた。近年、深層学習の台頭とともに、研究者たちはより複雑な「認知テスト」を考案した。それはルールベースのゲームではなく、抽象的な推論、視空間的判断、さらには微妙な常識問題を扱うものだ。これらのテストはかつて人間にしか解けないと考えられていたが、今やAIモデルも試験の場に立たされている。

AIはなぜ知能テストで「失敗」するのか?

MIT Technology Reviewの報道によれば、最新世代のAIモデルは多くの知能テストにおいて人間をはるかに下回る成績を示している。これらのテストは、画像に隠された関係性の理解、物体の運動軌跡の推測、あるいは日常的な状況に対する常識的な判断をモデルに求めるものだ。一見シンプルな問題が、現在最も先進的なシステムをも詰まらせてしまう。

専門家たちは、これが現在のAIに潜む根本的な欠陥を露わにしていると指摘する。深層学習を基盤とするモデルは、膨大なデータから統計的パターンを見つけ出し、パターンマッチングを素早く行うことに長けている。しかし、これらのモデルは真の「理解」を持ち合わせていない。学習データがカバーする範囲内では巧みに振る舞えるが、因果推論や常識的な対応を要する新たな問題に直面すると、たちまち本性が現れる。言い換えれば、答えを「見て取る」ことはできても、なぜその答えが正しいのかを理解してはいないのだ。

人間:相対的な優位性という「アドバンテージ」

では、人間はなぜこれらのテストで優位に立てるのか?認知科学者によれば、人間は幼い頃から物理的な相互作用や言語的なコミュニケーションを通じて、豊富な「世界モデル」を蓄積してきた。すべての状況を明示的に学ばなくても、ガラスのコップがテーブルから落ちたらどうなるかを直感的に判断したり、物体の遮蔽関係を理解したりすることができる。

この常識的能力は、多くの研究者がAI研究における真の「聖杯」と見なしている。大規模モデルは自然言語処理において驚異的な成果を上げているものの、物理的な世界に対する直感においては依然として乳幼児のように脆弱だ。知能テストはまさに鏡のように、AIの「記憶」と「理解」の間にある深い溝を映し出している。

編集後記:テストを新たな「チューリングテスト」にしないために

注目すべきは、AIの評価が決して単純ではないということだ。テストごとに重点とする能力は異なり、AIの成績はタスクの説明文、コンテキストのヒント、さらにはランダムシードによっても大きく変動することがある。一度の失敗でモデルに知性がないとは言えないが、繰り返し露わになる「初歩的なミス」は確かに私たちに警告を発している――現在のAIの能力は、広く全般的に人間に近いものではなく、特定の領域に深く特化したものだということを。

アーサー・サミュエルのチェッカープログラムが当時「機械学習」のマイルストーンと見なされたように、今日の知能テストもまた一つの測定手段に過ぎないかもしれない。それはゴールではなく、対話の場だ――知性を探求する道のりにおいて、私たちはモデルを鍛えながら、同時に自分自身を再発見しているのである。

本記事はMIT Technology Reviewより編訳