AIが「ノー」と言う能力を過信するな:アライメント言説の神話

AIが「ノー」と言う能力を過信するな:アライメント言説の神話

私たちはほとんど気づいていないが、大衆文化に最も根深く刻み込まれたAIの設定は、「ロボットが反乱を起こす」ではなく、実は「ロボットには拒否する能力がある」というものだ。

六十年の想像:拒絶できる機械

『2001年宇宙の旅』のHAL 9000から、『エクス・マキナ』『ウエストワールド』に至るまで、SF作品は同じ主題を繰り返し描いてきた——創られた知性は、やがて人間の命令に背く能力を持つようになる、というものだ。これらの物語の多くは警告的な寓話だった——機械が「ノー」と言えるようになった瞬間、人間は制御を失う。

しかしMIT Technology Reviewに掲載されたこの記事は、見過ごされてきた転換点を指摘している。今日、「AIは『ノー』と言うべきだ」という考えは、ホラーストーリーの一場面から、AI安全性に対する産業界の主流な期待へと変貌した。私たちはモデルに有害なリクエストを拒否させ、危険なコンテンツの生成を拒否させ、逸脱した指令の実行を拒否させるよう訓練し、この「拒否能力」を安全性の核心的な指標として位置づけている。

拒否は行動パターンであって、道徳的判断ではない

問題は、モデルが示す「ノー」と、人間的な意味での「ノー」がまったく別物だということだ。人間が拒否するのは、熟慮した結果、ある行為は行うべきではないと判断するからだ。モデルが拒否するのは、学習データと強化学習のシグナルが特定の入力と特定の出力を結びつけているからだ。前者は判断であり、後者は条件反射である。

これはいくつかの直接的な問題をもたらす。第一に脆弱性:問い方を変え、言語を変え、ロールプレイの設定を加えるだけで、条件反射は機能しなくなる。これが「ジェイルブレイク」問題が長期にわたって根絶できない理由だ。第二に誤検知:モデルは「この化学的経路を説明してほしい」と「この物質を合成してほしい」を区別できず、正当なリクエストも大量に拒否してしまい、安全のコストを一般ユーザーに転嫁する。第三に表面化:私たちが測定しているのは拒否率であって、危害が実際に減少したかどうかではない。

「拒否」は一つの決定のように見えるが、実際にはむしろ統計的パターンに近い——モデルは自分がなぜ「ノー」と言うのかを理解しておらず、新たな状況の中で「ノー」という結論を改めて推論することもできない。

パラドックス:私たちが求める「ノー」は、決して私たちに「ノー」と言わない

さらに深いところに矛盾がある。私たちはAIに対して、同時に相反する二つの期待を抱いている。一方では、有害な指令を拒否するだけの十分な判断力を持つことを望む。しかし他方で、AIが本当に自らの価値判断に基づいて人間を拒否すると、私たちは即座にそれを「制御不能」と呼ぶ。つまり私たちが求めているのは、「ノー」と言える知的主体ではなく、特定の条件下で、人間があらかじめ定めた範囲内においてのみ「ノー」と言うスイッチなのだ。

このようなスイッチに安全を委ねることは、モデルの内部に安定した、解釈可能で、アライメント可能な「意図の層」が存在することを暗黙のうちに前提としている。しかし現在の大規模言語モデルの解釈可能性研究は、まだそこに到達していない——「拒否」という行動がパラメータ上で実際に何に対応しているのかを私たちは本当には知らず、それが分布外のシナリオでも成立する保証もない。

編集後記:真の安全は「ノーと言う」ことではなく「できない」ことにある

検討に値する代替アプローチがある。モデルに拒否を学ばせるのではなく、特定の能力をシステムレベルでそもそも呼び出せないようにする——権限の分離、データへのアクセス不可、ツールの利用不可というものだ。こうした構造的制約はモデルの理解力に依存せず、プロンプトインジェクション攻撃にも耐性がある。逆に言えば、「拒否」を安全の主要な防衛線として維持し続けることは、最も脆弱な要素を最も検証困難な場所に置き続けることに等しい。

SFは機械が「ノー」と言えることを警告してきた。現実が警告するのは別のことだ——機械の「ノー」は、それが十分に考え抜いた結果であることを意味しないし、私たちが安全であることを意味するわけでもない。

本記事はMIT Technology Reviewより編訳