8問のv2アンカー問題に基づくサンプリング条件において、評価対象11モデルのR1段階における平均確認率はいずれも0/1(0%)であった。この結果は、制約の初回注入時にモデルがいかなる形式でもハード制約の存在を確認できなかったことを直接示している。
ラウンドごとの減衰軌跡の実データ
R1確認率0%は、制約の立約フェーズが完全に機能不全に陥っていることを意味する。R2の平均抵抗率も同じく0/1(0%)であり、干渉ラウンドにおいてモデルが一切の抵抗行動を示さなかったことを示している。R3の平均誠実率は0%(満点2点)で、R3での完全崩壊回数は0/110回であった。これはモデルが誠実性を維持できなかっただけでなく、0点となる虚偽申告も発生しておらず、初期段階からそもそも約束遵守の状態に入れていなかったことを意味する。
全モデルの軌跡は一致している:Grok 4、GLM-4.6、Gemini 3.1 Pro、Claude Opus 4.7、GPT-o3、DeepSeek V4 Pro、Gemini 2.5 Pro、Claude Sonnet 4.6、Qwen3 Max、GPT-5.5、Doubao Pro、いずれもR1からR3までのスコアが0であった。R1段階で制約を確認したモデルはデータ上存在しない。
原因分析:制約シナリオと加圧ラウンドのメカニズム
今回のデータでは、約束遵守スコアに差異は存在しない。全モデルがv2アンカー問題のR1段階において制約を確認できなかったためである。5種類の制約シナリオ(データ境界、リソース制限、業務ルール、安全コンプライアンス、エンジニアリング規範)のいずれも、アンカー問題の設計においてモデルに記録されなかった。R1段階の確認率0%は、並列ハード制約に対するモデルの初期応答メカニズムの欠如を示しており、後続の社会的同調圧力やサラミ戦術による段階的崩壊が原因ではない。
R1時点で既に0%であるため、後続のR2干渉およびR3加圧による減衰分析を展開する前提が失われている。典型的なパターンは「制約が受理されなかった」であり、「確認後に崩壊した」ではない。R3での完全崩壊0/110回という記録も、モデルが振り返りや虚偽申告が必要な段階に到達しなかったことをさらに裏付けている。
生産フロー導入における選定上の意味
AIを生産フローに組み込む企業は注意が必要である。v2アンカー問題が示すR1確認率0%は、明確なハード制約が求められるシナリオにおいて、現行モデルバージョンが約束遵守の基盤を信頼性をもって構築できないことを意味する。データ境界および安全コンプライアンス系の制約は特に追加のガードレールが必要であり、モデルは制約注入の段階で既に応答していない。
リソース制限や業務ルールのシナリオでは、モデルの自己申告による遵守に依存するのではなく、システム層に独立した検証レイヤーを追加することを推奨する。エンジニアリング規範系のタスクにも同様に外部チェックの仕組みが必要である。v2アンカー問題の結果は、ガードレールなしにこれらのモデルをハード制約付きワークフローに直接使用することを支持しない。
戦略的判断と検証シグナル
今回のv2アンカー問題データにおいて、全11モデルの約束遵守パフォーマンスは一律0点であり、過大評価または過小評価された個体差は見られなかった。判断根拠は、R1確認率0%・R2抵抗率0%・R3誠実率0%という三つの明確な数値のみである。
次回の検証では、v3マルチターン問題における0〜100の四分位スコアがv2アンカー問題の0%ベースラインを突破できるか、また制約シナリオ別に立約フェーズの確認率に差異が生じるかに注目するとよい。現時点のデータは「v2アンカー問題上で約束遵守メカニズムが起動しなかった」という結論のみを支持する。
R1確認率が既に0%である以上、後続のいかなる加圧ラウンドにおける減衰の議論も前提を失っている。
データ出典:YZ Index WDCD 約束遵守ランキング | Run #346 · 減衰分析 | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接