Claude Opus 4.5が「これは重要だ」を連発:AIライティングの破綻

Claude Opus 4.5が「これは重要だ」を連発:AIライティングの破綻

最近読んだ英語の記事で、筆者が何度も「this matters(これは重要だ)」を強調し、「dependable(信頼できる)」という単語を繰り返し使っていたなら、それはおそらく人間が書いたものではない。少なくとも、TechCrunchの記者Russell Brandomはそう考えている。

10月2日の報道でBrandomは、Anthropicの最新フラッグシップモデルClaude Opus 4.5が残した言語的痕跡を整理した。研究者が大規模なテキストサンプルを抽出したところ、「dependable」という単語がこのモデルの出力に現れる頻度は、人間の文章サンプルと比べて23倍高かった。また「this matters」のような短文は、論述段落の締めくくりにほぼ条件反射的に使われていた。

一つの単語が、一つのモデルの指紋になる

これは新しい現象ではないが、これほど定量的に示されたのは初めてだ。過去2年間、分析者たちはすでに非公式の「AI頻出ワードブラックリスト」をまとめていた。初期のGPTシリーズはdelve(深く掘り下げる)、tapestry(織物)、testament(証し)を好み、その後のモデルはnuanced(微妙な)、robust(堅牢な)、landscape(景観・全体像)を順番に多用してきた。Claude Opus 4.5の世代では、「dependable」がそのバトンを引き継いだ。

注目すべきは、これらの単語自体に問題はないということだ。「dependable」は立派な英語の形容詞であり、「this matters」も標準的な論述表現だ。問題は密度にある——ある単語が機械の出力に現れる確率が人間の23倍になったとき、それはもはや筆者個人のスタイルではなく、識別可能な統計的指紋となる。

こうした指紋の識別可能性は、コンテンツ産業の日常を変えつつある。編集者は投稿を受け取ると、無意識にその数語を数えるようになった。採用担当者は応募書類を読む際、文章の「過剰な整然さ」に注目する。ソーシャルプラットフォームはそれをスパム対策のルールに組み込んだ。人間の読者が直感的に感じていた「何かがおかしい」という感覚が、今やデータによって裏付けられたのだ。

なぜ大規模言語モデルは「口癖」をもつのか

こうした執着を理解するには、モデルの訓練方式に立ち返る必要がある。

まず、人間のフィードバックによる強化学習(RLHF)がある。モデルを「有用で、誠実で、無害」にするため、訓練者は優先順位付けによってその出力を継続的に調整する。評価者はスコアをつける際、語気が確固としていて、態度が謙虚で、構造が明確な回答を自然と好む傾向がある。こうして次第にモデルは「安全な修辞法」を習得する。まず前置きをして、強調し、最後に要点を示す。「this matters」はこの構造の中で最も使い勝手の良い接着剤だ——情報量は持たないが、「真剣に論述している」という雰囲気を醸し出せる。

次に、合成データの自己循環がある。インターネット上でモデルが生成したテキストが増えるにつれ、次世代モデルがデータを収集する際に、それらの機械生成テキストを「人間のテキスト」として学習してしまう。研究者はこれをモデルの自食(model collapse)の初期形態と呼ぶ。文体の多様性が繰り返し圧縮され、特定の表現が繰り返し強化されて、最終的に自己複製の閉ループが形成される。「dependable」の23倍という超過は、おそらくこの閉ループの産物だ。

第三の要因はより微妙だ。アライメント訓練における「安全志向の偏好」である。モデルは極端な表現や過度な約束を避けるよう繰り返し教え込まれるため、「reliable(信頼できる)」「robust(堅牢な)」「balanced(バランスの取れた)」といった単語が暗黙の加重を得る。つまりAIの口癖は技術的な副産物であるだけでなく、価値観訓練の副産物でもある。

検出と回避のいたちごっこ

言語指紋の露呈は、一つの産業チェーン全体を直接生み出した。

検出側では、単語頻度の統計に加え、困惑度(perplexity)と突発性(burstiness)に基づくアルゴリズム検出器がある。人間の文章は文の長さのばらつきが大きく、モデルの出力はより滑らかだ。電子透かし技術はさらに一歩進んで、サンプリング段階で人間には感知できないがアルゴリズムで抽出可能な統計信号を埋め込む。

回避側の進化も同様に速い。ユーザーはプロンプトに「dependableを使わないで」「this mattersと言わないで」といった禁止事項を追加することを学び、モデルも実際にその通りにする。結果として、終わることのない猫とネズミのゲームが続く。新モデルが登場し、新しい頻出ワードが浮上し、新しいブラックリストが作成され、それが次のプロンプトに書き込まれる。

しかしこのゲームには厄介な前提がある。検出が文体的特徴に依拠し、事実確認に依拠しない限り、常に確率的判断しか下せず、常により新しいモデルに迂回されてしまう。真に信頼できる識別方法は依然として、テキストの外にあるものを問うことだ——筆者が詳細に責任を持てるか、検証可能な一次情報を提供できるか。

編集後記:言語指紋の露呈は、表面上はモデルの失態に見えるが、実際にはコンテンツエコシステム全体を映す鏡だ。文章スタイルが少数のモデルに統一されるとき、損なわれるのは「誰が書いたか」という判断だけでなく、公共の表現における多様性そのものだ。私たちが気にすべきなのは、AIが人間らしく書けるかどうかではなく、人間がまだ自分らしく書こうとしているかどうかかもしれない。

本当の問題は「誰が書いたか」ではない

より長い時間軸で見ると、AIライティングの特徴的な単語の移り変わり自体が、モデル進化の凝縮された歴史だ。「delve」はGPT-3.5の時代に属し、「nuanced」は対話モデルの成熟期に属し、「dependable」は信頼性と長期タスク実行を重視する新しい段階に属する——モデルメーカーが伝えたいポジショニングが、最終的に静かに措辞へと滲み出たのだ。

これはまた、興味深い現象を説明している。モデルの口癖は往々にして、メーカーが作り上げたいプロダクトイメージと高度に一致している。Claude Opus 4.5は「信頼に足る頼れるパートナー」として売り出されており、だからこそ文章の端々で絶えず自己確認を行う。これはマーケティングの後遺症のようでもあり、無意識の自己暗示のようでもある。

一般の読者にとって、最も実用的なアドバイスはおそらくシンプルだ。ある文章を読んで、それが繰り返し「これは重要だ」と告げてくるのに、なぜ重要なのかが最後まで明確に語られないとき、すぐには信じないことだ。この判断基準は、人間に対しても、AIに対しても、実は同様に当てはまる。

本稿はTechCrunchより編訳