米国政府AIに『マインクラフト』を聞いたら、なぜ的外れな回答が返ってきたのか

米国政府AIに『マインクラフト』を聞いたら、なぜ的外れな回答が返ってきたのか

編集者注:ある国の政府公式サイトにAIアシスタントが導入された際、国民が最も気にするのは、そのAIがどれほど賢いかではなく、でたらめを言わないかどうかだ。TechCrunchの記者Amanda Silberlingによる何気ない検証が、政府レベルのAI回答システムの一端を偶然にも明らかにした。システムはクラッシュしたわけでも、暴走したわけでもなく、ただ別の設計思想のもとに作られていたのだ。

ブロックゲームが、政府のAIアシスタントを困らせた

事の発端は至って平凡だった。TechCrunchの報道によると、ユーザーがAmerica.govの政府提供AIアシスタントに『マインクラフト(Minecraft)』に関する質問をすると、返ってくる回答が非常に奇妙なものになるという。話題を避けたり、質問とほぼ無関係な公式声明のような文言を返したりし、語調は硬く、論理は飛躍しており、政策に関する質問への回答とはまるで別物だった。全世界で3億本以上を売り上げ、現代の若者にとって共通言語とも言えるサンドボックスゲームについて、自然言語を理解すると謳うAIアシスタントがこれほど不案内な振る舞いをすること自体、十分に異常だ。

一見すると、これは典型的なモデルの幻覚(ハルシネーション)のように見える。大規模言語モデルが不慣れな領域に遭遇すると、自ら答えを作り上げてしまうのだ。しかし記者はすぐに、これが不具合ではないと確認した。America.govの異常な挙動は、技術的な事故ではなく、意図的な設計の結果だった。

幻覚ではなく、ガードレールの副作用

この問題を理解するには、まず大規模モデル製品におけるガードレール(guardrails)機構を理解する必要がある。商業用AIアシスタントは通常、三層構造によって制約されている。基盤モデル自体の安全アラインメント、システムプロンプトによって設定された行動範囲、そして外部の入出力フィルターだ。政府向けのシステムでは、この三層すべてがより保守的な設定に調整される。トピックのホワイトリスト、キーワードフィルタリング、公式サービスページへの強制誘導などが一般的な手段だ。ユーザーがホワイトリスト外でありながら、機密違反にも該当しない質問をした場合、システムはどのように体裁よく断ればよいかわからず、あの的外れな回答という気まずい結果が生じる。

「国家安全保障の観点からすれば、America.govがまだ長々と詩を書き連ねるほど幻覚していないとわかって、正直ほっとした。」——原文より

この言葉は皮肉めかしているが、問題の核心を突いている。国民が政府AIに求める最低限の基準は、どれだけ博識かではなく、少なくとも自信満々にでたらめを言わないことだ。もごもごとしか答えられないアシスタントは困惑を招くが、法律条文、政策の詳細、さらには歴史的事実を自信を持って捏造するアシスタントは、実質的な害を及ぼしかねない。その意味では、マインクラフト問題は滑稽ではあるものの、相対的に安全な失敗の形だと言える。

政府AIと商業AI、そもそも別の生き物

過去2年間で、各国政府は大規模モデルの能力を急速に取り込んできた。米国政府は連邦調達庁(GSA)を通じた連邦AI調達パイロット事業を推進し、複数のモデルベンダーが連邦機関に対して極めて低価格でサービスを提供できるようにした。英国、シンガポール、アラブ首長国連邦もそれぞれ、市民向けの政務AIポータルを立ち上げている。こうしたシステムとChatGPT型製品の根本的な違いは、最適化対象にある。商業製品はユーザーの継続利用と主観的満足度を最適化するが、政務製品が最適化するのはゼロエラー、発言の管理可能性、そして監査可能性だ。

その結果、政務AIは本質的に「過度な拒否」に陥りやすい。学術界ではこの現象をアラインメント税または過剰安全(over-refusal)と呼んでいる。ごくわずかな有害出力の確率を抑えるために、正常なやり取りの大部分における使い勝手が犠牲になるのだ。保護者が単に「子どもに合ったサンドボックスゲームはどれか」と尋ねただけなのに、ネットセキュリティ政策に関する公式文言で遮られた場合、その体験の損失は現実のものだ。ただし、それは安全指標には反映されない。

「悪をなさない」が「ミスをしない」に変わるとき

なぜよりによってマインクラフトのようなトピックが異常を引き起こしたのか、追究する価値がある。合理的な推測はいくつかある。第一に、娯楽やゲームに関する検索が非政務カテゴリに分類され、システムがユーザーをサービス一覧へ誘導するよう求められている可能性。第二に、ユーザー生成コンテンツ、オンラインサーバー、MOD改造などに関係するコンテンツフィルタリングのルールに、こうした語が近接している可能性。第三に、モデルが不確実な状況では自ら言葉を組み立てるのではなく、既定の表現を優先して繰り返すよう求められている可能性だ。いずれにせよ、問題はモデルの能力にあるのではなく、製品設計がリスクをどう値付けするかにある。

同時に、この事件は、汎用モデルをそのまま政府ポータルの対話層として充てることには、アーキテクチャ上の緊張が本質的に存在することを改めて示している。モデルの言語能力は本来、発散的なものであり、政務の要件は本来、収束的なものだ。両者を無理に接続すれば、その継ぎ目に必然的にこうした不自然な挙動が現れる。

公への信頼こそが、真の試金石

より広い視点から見れば、America.govが『マインクラフト』について問われた際の奇妙な振る舞いは、AIガバナンスに関する小さな寓話だ。政府がAIを導入する正当性は透明性に由来する。国民はシステムが何に答えられ、何に答えられず、なぜそのような回答が返ってくるのかを知る権利がある。害のない質問に曖昧な返答をしながら、ユーザーにその理由を説明しないアシスタントは、技術的に安全であっても、信頼の面で亀裂を残す。

真に成熟した政務AIは、拒否する際に明確な理由を示すべきだ。「この質問は私のサービス範囲外です。○○ページをご参照ください」という形で。奇妙な的外れ回答を演じるのではなく。安全性と使い勝手はゼロサムではない。限界を壁にはっきりと明示することは、ユーザーに見えない壁がどこにあるか推測させるよりも、コストが小さく、得られるものも大きい。

本記事はTechCrunchより編訳