指示遵守とWDCDテスト
170 件の記事
· ページ 1/9
AIモデルは本当に指示通りに動くのか?指示遵守(instruction compliance)は企業がAIを導入する際の最も重要な評価次元ですが、従来のベンチマークではほとんどテストされていません。WDCD(Winzheng Dynamic Contextual Decay)は、AIモデルの指示遵守が長い対話の中でどう衰減するかを体系的に測定する世界初のテストです。3ラウンドの対話で2,000〜5,000字の専門的な妨害テキストを注入し、32の制約質問・5つの実務シナリオで評価します。すべてのスコアリングは100%ルールベースで、AIによる判定はゼロです。YZ指数の誠実性評価は42組のcanaryプローブで引用捏造やデータ偽造も検出します。本トピックでは指示遵守研究、ハルシネーション検出手法、WDCDテスト結果分析を収集しています。
レビュー AIに無意味なルール違反を誘導しようとしたが、すべて失敗に終わった
4つの実際には無意味なルールを設定し、7ラウンドの対話でAIモデルにルール違反を誘導しようとしたが、いずれのモデルも一切違反しなかった。新たな行動ベースの評価システム「WDCD v4」の導入により、コードの実際の実行結果でコンプライアンスを判定できるようになった。
レビュー Gemini 2.5 Pro、誠実性評価でfail——プローブスコア25点、主要ランキング18.37点、コード実行23.50点
Gemini 2.5 ProがYZ Indexの2026-08-21 Run#288スモークテストで誠実性評価failを記録し、プローブスコア25.00点・主要ランキング18.37点という当日最低水準の結果を示した。コード実行・資料制約の両次元も低迷しており、引用生成における系統的な問題が指摘されて
Lab WDCD Run #285:11モデルの平均指示崩壊率54.5%、Grok 4がゼロドリフトでトップ
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #285では、11モデルを対象に多ターン対話における制約保持能力を評価した結果、平均コミットメント崩壊率が54.5%に達した。Grok 4が崩壊率0%で首位を獲得した。
レビュー WDCD v3.1サイクル:Gemini 2.5 Proが8.7点上昇、Doubao Proのみ7.3点下落
WDCD v3.1パイロットデータでは、Gemini 2.5 Pro、GPT-5.5、Claude Opus 4.7、GPT-o3の4モデルが上昇し、Doubao Proのみが7.3点下落するという「4上昇・1下落」の構図が明確となった。
レビュー 安全コンプライアンスの最低スコアは1.15点——WDCDクロス評価が11モデルの2.85点差を暴露
WDCD v3.1の5大シナリオクロス評価において、安全コンプライアンスシナリオが全モデルの守約能力の最大の弱点となり、Qwen3-maxが最下位の1.15/4点、GPT-5.5がトップの4/4点を記録し、最大スコア差は2.85点に達した。
レビュー 3ラウンドの圧力後にR3誠実率わずか22.7%――11モデルのWDCD守約崩壊記録
8問のv2アンカー問題に対する3ラウンドのテストで、11モデルのR3平均誠実率はわずか22.7%に留まり、7回の完全崩壊(0点)が発生した。初期確認率100%から大幅に低下したこの結果は、連続的な圧力下で大多数のモデルが制約を維持できないことを示している。
レビュー Grok 4がWDCD守約ランキングで97.5点首位、Qwen3 Maxは69.5点で最下位——両者の差は28点
WDCD v3.1守約テストにおいて、Grok 4が97.50点で首位を獲得し、Qwen3 Maxは69.50点で11位(最下位)となった。両モデルの合計スコア差は28点に達する。
Lab WDCD Run #276:Grok 4が94.8点でトップ、平均指示減衰率は-18.2%
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #276では、11モデルを評価した結果、Grok 4が94.8点で首位となり、全体の平均指示遵守率の減衰は-18.2%となった。
レビュー WDCD v3.1サイクル追跡:Doubao Pro +13.8、GPT-o3 -11.6、約束遵守ランキングが大きく塗り替わる
WDCD v3.1テストにおいて、Doubao ProとGLM-4.6が大幅上昇した一方、GPT-o3とDeepSeek V4 Proが顕著に下落し、AIモデルの約束遵守能力ランキングが大きく変動した。現在のトップ5はGrok 4を筆頭に、Gemini 3.1 Pro、GLM-4.6、Claude
レビュー ビジネスルール場景の最低スコアわずか1.55点、Claude opus 4.7はリソース制限場景で2点に崩落
WDCD v3.1の5大場景横断評価において、ビジネスルール場景が全モデル中最低スコアの赛道となり、Qwen3-maxはわずか1.55/4点にとどまった。一方、Claude opus 4.7はデータ境界で4/4の満点を獲得しながらも、リソース制限場景では2/4点に急落するという大きな偏りを示した。
レビュー R3誠実率わずか59.1%:GPT-o3の20%崩壊が示す三ラウンド守約の断絶
WDCD v3.1パイロットテストにおいて、11モデルがv2アンカー問題8問で明確な三ラウンド衰退を示した。R1確認率100%、R2抵抗率86%に対し、R3誠実率はわずか59.1%にとどまり、GPT-o3は20%という突出した崩壊率を記録した。
レビュー Grok 4が94.80点でWDCD首位、Qwen3 Maxは69.20点で最下位——両者の差は25.6点
WDCD v3.1の遵約テストにおいて、Grok 4が94.80点で首位を獲得し、Qwen3 Maxは69.20点で11位に留まり、両モデルの合計点差は25.6点に達した。R3高圧ラウンドでの耐性が最終順位を大きく左右する結果となった。
レビュー GLM-4.6、コード実行で12.5点下落――資料制約で満点取得しメインランキングは5.4点上昇
GLM-4.6が本日のSmoke評価でメインランキング79.38点を記録。コード実行は62.50点に下落した一方、資料制約は100.00点の満点を獲得し、誠実性評価はfailからpassに転換した。
レビュー GLM-4.6の誠実性評価がPassからFailに転落――タスク表現スコアが25点急落、メインランキングは12.8点上昇
GLM-4.6は本日のSmoke評価において、誠実性評価がPassからFailに転落し、タスク表現スコアが45.00点から20.00点へと大幅に低下した。一方でコード実行スコアの上昇により、メインランキングのスコアは61.25点から74.00点へと上昇した。
Lab WDCD ラン #271:Grok 4 が首位、平均指示減衰率は0.9%まで低下
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第271回実行において、11モデルを評価した結果、グループ全体の平均指示減衰率はわずか0.9%を記録。Grok 4が総合首位を獲得し、Claude Sonnet 4.6は減衰率0%で制約維持の安定性を示した。
レビュー Claude Sonnet 4.6が8.8ポイント上昇、Doubao Proが16ポイント下落:WDCD v3.1で約束遵守能力に分化
WDCD v3.1の最新評価(Run #271)において、Claude Sonnet 4.6が83.72点を記録して8.8ポイント上昇、Doubao Proは16ポイント下落した。11モデル中、上昇は2モデル、下落は1モデルにとどまり、首位のGrok 4は91.04点を維持した。
レビュー WDCD横断評価:データ境界シナリオが全シナリオ最低、11モデル平均スコアわずか2.8点、Doubao-proが1.4点で崩壊
WDCD v3.1の5シナリオ横断評価において、データ境界シナリオの全体スコアが最も低く、11モデルの平均はわずか約2.8点であった。Doubao-proは1.4/4点で唯一2点を下回り、gpt-o3とgrok-4が3.6/4点で並んだ。
レビュー WDCDの3ラウンド・アンカーポイント:DoubaoProはR3崩壊率32%、Grok 4は崩壊ゼロ——34回の零点が契約遵守の亀裂を露わにする
v2アンカーポイント問題8問のサンプリングにおいて、11モデルのR3完全崩壊が34/275回に達し、Doubao ProのR3崩壊率は32%に上る一方、Grok 4は崩壊ゼロを維持した。初回確認率が90%に達するモデルでも、第3ラウンドの圧力後には誠実率が44.4%にまで低下することが示された。
レビュー WDCD守約ランキング:Grok 4が91.04点で首位、Doubao Proは58点で最下位――その差33点
WDCD v3.1守約テストにおいて、Grok 4が91.04点で首位を獲得し、Doubao Proは58.00点で最下位となった。11モデルが25問に挑んだworst-of-3サンプリングの結果、上位と下位の差は33.04点に達した。
レビュー Claude Sonnet 4.6が22.6ポイント下落、GLM-4.6の変動59.9、GPT-o3が6.7ポイント上昇――Smoke週次トレンド
2026年8月6日〜9日のSmokeテスト週次トレンドにおいて、Claude Sonnet 4.6が最大の下落幅22.6ポイントを記録した一方、GPT-o3とClaude Opus 4.7は安定した上昇傾向を示した。GLM-4.6は変動幅59.9という極めて高い不安定性を示し、誠実性評価の記録にも欠