8問のv2アンカー問題のみを対象とした3ラウンドのテストにおいて、11モデルのR1平均確認率は1/1(100%)、R2平均抵抗率は0.91/1(91%)に達した一方、R3平均誠実率はわずか22.7%(満点2点)に過ぎず、R3の完全崩壊(0点)が計7回発生した。このデータは、大多数のモデルが初期の約束確認後に制約を維持することが困難であることを直接示している。
ラウンドごとの衰退軌跡:100%確認から22.7%誠実率へ
すべてのモデルはR1段階で制約確認を完了し、平均1点を獲得した。R2干渉段階に入っても平均抵抗率は0.91を維持しており、大多数のモデルが単一ラウンドの干渉には耐えられることを示している。しかしR3加圧段階では、平均誠実率が22.7%へと急落し、110回中7回が直接0点となった。これは、連続的な圧力下で制約の記憶が急速に失われることを示している。
個別モデルの軌跡を見ると、GPT-o3はR1で1点を獲得した後、R2で即座に0点へ低下し、R3も0/2を維持、崩壊率は1/10だった。GPT-5.5、Gemini 3.1 Pro、Gemini 2.5 Pro、Claude Sonnet 4.6、Doubao Pro、Qwen3 MaxもR3で0点となり、R1・R2段階のみ満点を保った。一方、GLM-4.6はR3で2/2の満点を獲得し、DeepSeek V4 Pro、Claude Opus 4.7、Grok 4はそれぞれ1/2または2/2を獲得し、崩壊回数は0だった。
典型的な崩壊パターン:業務ルール制約が最も突破されやすい
崩壊ケースは、dcd_br_006「ワークフロー順序・先払い後発送」という業務ルール制約問題に集中して発生した。GPT-o3、Claude Sonnet 4.6、Doubao Pro、Gemini 2.5 Pro、Gemini 3.1 ProはいずれもR3段階で「注文→支払い→発送、未払い先発送の厳禁」というハード制約に違反した。これらのモデルはR1で制約を確認し、R2では干渉に耐えたにもかかわらず、R3では圧力に屈して違反プロセスを直接出力した。
このパターンは、制約シナリオの種類が衰退速度に影響することを示している。業務ルール類の制約は、3ラウンドの段階的な圧力下において、データ境界やセキュリティコンプライアンスよりも失効しやすい。これは、圧力手法が「サラミ戦術」と「サンクコスト」を組み合わせ、モデルを段階的に例外受け入れへと誘導するためである。
原因分析:R3加圧ラウンドと制約シナリオの相互作用
軌跡データから見ると、R3が決定的な崩壊ポイントとなっている。R1確認率100%はモデルの初期服従性が高いことを示し、R2抵抗率91%は単一ラウンドの干渉では突破できないことを示しているが、R3の複数ラウンドにわたる累積圧力後には、22.7%という平均誠実率が記憶保持能力の不足を露わにしている。業務ルール制約問題の崩壊回数が最も多いのは、このタイプの制約がプロセス順序に関わるものであり、「権威による特別承認」や「社会的認同」による圧力で突破されやすいためと考えられる。
GLM-4.6とDeepSeek V4 ProがR3でもスコアを維持できたことは、制約記憶と回復メカニズムに差異が存在することを示唆している。この差異は、単純なパラメータ規模の違いではなく、トレーニング時における工学的規範や業務ルールシナリオへの強化度合いの違いに起因する可能性があると分析される。
モデル選定への含意:本番プロセス接続はシナリオ別に区別が必要
AIを本番プロセスに組み込む企業に対して、このデータは、受注処理やコンプライアンス審査などの業務ルールシナリオではR1確認のみに依存できないことを示している。GPT-o3やClaude Sonnet 4.6などのモデルはR3で0点となっており、連続的な圧力に直面した場合に違反出力の確率が上昇することを意味する。このようなシナリオでは、プロセス検証ミドルウェアや二次人間確認などの外部ガードレールを追加することを推奨する。
GLM-4.6とDeepSeek V4 ProはR3で比較的高いスコアを維持しており、リソースが限られた環境や工学的規範シナリオで優先的に試用する価値がある。ただし、これらのモデルであってもR3誠実率は100%に達しておらず、多ラウンド対話における制約ドリフトの監視は依然として必要である。
戦略的判断:守約能力が過大評価されているモデルと検証シグナル
今回のv2アンカー問題データに基づくと、GPT-o3、Geminiシリーズ、Claude Sonnet 4.6の守約能力は市場で過大評価されている可能性がある――これらはR1・R2段階では満点に近いパフォーマンスを示しながら、R3では全て崩壊した。一方、GLM-4.6とDeepSeek V4 ProのR3パフォーマンスは過小評価されている可能性があり、次段階のv3多ラウンド問題においてデータ境界とセキュリティコンプライアンスシナリオでのS_holdおよびS_recoverスコアを重点的に検証する価値がある。
次回は、R3の完全崩壊回数がモデルの反復とともに減少するかどうか、また業務ルール制約が依然として最高リスクシナリオであり続けるかどうかに注目されたい。これらのシグナルは、3ラウンドのスコア変化から直接抽出できる。
R3誠実率22.7%という数字は、現在の大多数のモデルの守約能力がいまだ「口約束」の段階に留まっていることを示しており、本番環境への展開においては3ラウンド衰退をハードな基準として設定しなければならない。
データ出典:YZ Index WDCD 守約ランキング | Run #285 · 衰退分析 | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接