大規模言語モデルに騙されるな:それらは本当の意味で推論できない

大規模言語モデルに騙されるな:それらは本当の意味で推論できない

2016年3月、ソウル。私は碁盤の前に座り、自分が構築に携わったプログラムが碁盤の第5線に着手するのを見ていた――それは人間の対戦相手への大きなプレゼントのように見えた。五番勝負第2局の第37手は、あまりにも奇妙だったため、一部の解説者はバグが発生したと思ったほどだ。しかし数時間後、この一手は天才的な妙手であることが証明された。AlphaGoは勝利し、囲碁界は永遠に変わった。

その瞬間、多くの人が信じた――機械はついに「直感」、さらには「推論」を学んだと。

しかし8年が経ち、大規模言語モデルが流暢なコードを書き、司法試験に合格し、量子力学を「説明」するのを目にして、私は危険な誤解が広まっていることに気づいた。私たちは統計的なパターンマッチングを、真の推論能力と混同しているのだ。

AlphaGoはLLMではない――両者には本質的な違いがある

明確にしておくべきことがある。AlphaGoと今日のLLM(大規模言語モデル)は、まったく異なる技術的アプローチを採っている。AlphaGoは深層ニューラルネットワークとモンテカルロ木探索を組み合わせ、自己対局を通じて囲碁のゲームツリーを探索し、各手において「もし……ならば……」という先読み計算を行う。言い換えれば、AlphaGoは確かに探索し、計画し、評価している――これらは推論の核心要素だ。

では大規模言語モデルはどうか? それらは本質的に「次の単語の予測器」である。与えられたテキストに対して、モデルは訓練データの統計的規則性に基づき、最も出現しやすい次の単語を予測する。このプロセスには、明示的な探索も、計画も、因果推論も一切存在しない。

LLMがパリはフランスの首都だと「知っている」と言えるのは、訓練中にその事実を無数に目にしてきたからだ。しかし「もしパリがフランスになければ、フランスの首都はどこになるか」と問うと、その回答はしばしば、LLMが真の地理的概念を持っていないことを露わにする――「パリ」「フランス」「首都」といった単語のベクトル空間における関連パターンを再配置しているに過ぎないのだ。

なぜ私たちは「推論の幻想」に惑わされやすいのか?

人間はパターン認識を得意とする生き物だ。文章が論理的に一貫していて、用語が正確で、語調が自信に満ちているとき、私たちは本能的に書き手が理解力を持つと判断する。LLMはまさにそのような文章を生成することに長けている。膨大なデータから「推論らしく見える」言語パターンを学習しているのだ――まず問いを立て、次に論拠を並べ、最後に結論を示す、というように。

しかしこの「推論」は脆弱だ。問いの言い回しを変えたり、無関係な情報を加えたりするだけで、モデルの出力は完全に崩れてしまう。真の推論は体系性、一貫性、そして転移可能性を備えているべきだ――LLMはこれらの次元においてきわめて低い性能を示す。

さらに懸念されるのは、私たちがこれらのシステムにますます多くの意思決定権を委ねていることだ。医療診断から法律相談、金融リスク管理から軍事指揮に至るまで、意思決定者がLLMは「思考している」と誤信すれば、根本的な事実を見過ごすことになる――モデルは単に単語列の確率を計算しているに過ぎないという事実を。

「確率的オウム」論争:私たちはより冷静な認識を持つ必要がある

2021年、Emily Benderらは著名な論文を発表し、LLMを「確率的オウム(Stochastic Parrots)」と呼んだ――訓練データの言語パターンを繰り返しているだけで、真の理解を持たないと。この見解は激しい論争を巻き起こした。規模が十分に大きくなれば推論能力が「創発」するという研究者もいた。

しかし現時点では、LLMが形式論理や因果推論を習得したという証拠は何もない。標準的なベンチマークテストでの高スコアは、しばしばテストデータへの潜在的な記憶によるものであり、真の汎化能力によるものではない。複数ステップの推論を要する新しい問題に直面すると、その性能は急激に低下する。

私はLLMの価値を否定しているわけではない。翻訳、要約、コード補完などのタスクでは非常に有用だ。しかし「有用である」ことは「推論できる」ことを意味しない。電卓は有用だが、私たちは電卓が推論すると言わない。検索エンジンは有用だが、世界を理解していると言わない。

結語:「推論」をマーケティング用語にするな

AI分野には危険な傾向がある。あらゆる技術的進歩を「汎用人工知能への一歩」として包装しようとするのだ。LLMの能力は誇張され、その限界は隠蔽される。企業は資金調達が必要で、メディアは見出しが必要で、研究者は注目が必要だ――こうして「推論」は便利なラベルと化した。

しかし科学者やエンジニアとして、私たちには明確に言う責任がある。今日のLLMは推論できない。世界モデルを持たず、因果的な理解を持たず、論理的一貫性も持たない。ただ次の単語を予測することが非常に得意なだけだ。

「流暢な言語出力」と「真の推論」を混同し続ければ、AIの能力を過大評価するだけでなく、重要な応用場面で深刻な誤りを犯すことになる。第37手が偉大だったのは、AlphaGoが真に未来を探索したからだ。一方、LLMは過去に対して統計的なフィッティングを行っているに過ぎない――両者の間には、いまだ越えられていない大きな隔たりがある。

本稿はMIT Technology Reviewより編訳