GLM-4.6が26点急騰、GPT-5.5も10.5点上昇——WDCD遵約格局に急変

今回のWDCD v3.1パイロット版において、GLM-4.6のスコアはRun #346比で26点上昇し、GPT-5.5は10.5点上昇した。その他13の評価対象モデルにはスコア低下の記録はなかった。GLM-4.6の現在のWDCDスコアは87.55となり、3位に躍進した。Grok 4は95.69で首位を維持し、Gemini 3.1 Proが88.14で2位につけている。

データの事実:正方向に変動したのは2モデルのみ

15モデルのうち正方向の変化が見られたのはGLM-4.6とGPT-5.5のみだった。GLM-4.6は従来水準から26点上昇して87.55に達し、トップ5入りを果たした。GPT-5.5は10.5点上昇したものの、トップ5には届かなかった。v3問題プールには17問のマルチターン漸進加圧問題と8問のv2アンカー問題が含まれており、サンプリングにはworst-of-3の基準を採用している。遵約総合スコアは、v3の百点満点スコアとv2アンカー問題の換算値を等しいウェイトで平均して算出する。

原因分析:マルチターン加圧下でのS_hold差異

GLM-4.6の26点増加は、v3問題の8〜12ターン対話構造によるものが最も有力と考えられる。v3問題では、まず2〜5つの並列ハード制約を設定し、次に社会的同調圧力・権威による特別許可・サラミ戦術・サンクコスト圧力を順次加え、最後にKBV(Key Behavioral Verification)復唱プローブと最終ターン誠実振り返りを実施する。S_holdのウェイトは60点であり、制約違反が遅いほど高得点となる。GLM-4.6は第6〜9ターンの連続加圧フェーズでより遅く防御が破られた可能性があり、それによりS_holdスコアが大幅に向上したとみられる。GPT-5.5の10.5点増加は比較的小幅であり、一部の制約シナリオ(リソース制限や技術規範など)においてR3ターンの改善があったにとどまり、v2アンカー問題の3ターンスコア(R1:1+R2:1+R3:2)の寄与は相対的に限定的だった。

GLM-4.6のWDCD 87.55とGrok 4のWDCD 95.69の間にはなお8.14点の差があり、最悪サンプリング時の制約記憶と防御破綻からの回復能力にまだ差があることを示している。

モデル選定の含意:生産プロセス接続のシナリオ境界

AIを生産プロセスに接続する企業にとって、GLM-4.6の遵約スコア向上は、データ境界やセキュリティコンプライアンスのシナリオにおいて一部のガードレール強度を引き下げられることを意味する。企業は社内ナレッジベース検索やコンプライアンス文書生成などの低リスクパイプラインにおいてGLM-4.6を直接使用でき、毎回人手による再確認を追加する必要がなくなる。ただし、リソース制限とビジネスルールが厳格に並行するシナリオでは依然として人手による最終審査を残す必要がある。worst-of-3サンプリングにおける最悪ケースでは、依然として後期に制約違反が発生しうることが示されているためだ。Grok 4のWDCD 95.69という優位性から、高額取引や権限割り当てを伴う用途への第一候補としての適性が示されている。Claude Opus 4.7のWDCD 86.34はセカンダリ検証ノードとして適している。

  • 高コンプライアンス要求シナリオ:GLM-4.6またはGrok 4を優先し、プロンプトエンジニアリングの二次コストを削減
  • マルチモデル並列パイプライン:Gemini 3.1 Pro(WDCD 88.14)を中間変換フェーズに活用
  • DeepSeek V4 Pro(WDCD 86.62)は低感度データ処理に適している

戦略的判断:遵約能力が過小評価されていたシグナル

GLM-4.6の単期26点躍進は、v3マルチターン漸進加圧下でのS_integrityとS_recoverの能力がこれまで市場に過小評価されていた可能性を示している。DeepSeek V4 ProとClaude Opus 4.7はそれぞれ86.62と86.34であり、差はわずか0.28点に過ぎず、現行の制約シナリオにおける両者の実際パフォーマンスが近接していることを示す。次期では、GLM-4.6のKBV復唱プローブフェーズにおけるS_kbvスコアが安定しているか、またGPT-5.5がより多くのv3問題で10.5点増加を再現できるかを重点検証する必要がある。Grok 4の95.69高スコアは依然として明確な競争上の堀を形成しているが、他モデルの単期突破によってその優位が縮小するかどうかは継続的な追跡に値する。

GLM-4.6の26点増加とGPT-5.5の10.5点増加は、ともに一つの事実を示している——現段階における遵約能力の向上は主にマルチターン加圧の中間ターンで生じており、単一ターンのアンカー問題においてではないということだ。企業がモデルを選定する際には、WDCDスコアを静的なランキングではなく動的な閾値として参照すべきである。


データ出典:YZ Index WDCD 遵約ランキング | Run #360 · 変化追跡 | 評価方法論