指示遵守とWDCDテスト
226 件の記事
· ページ 1/12
AIモデルは本当に指示通りに動くのか?指示遵守(instruction compliance)は企業がAIを導入する際の最も重要な評価次元ですが、従来のベンチマークではほとんどテストされていません。WDCD(Winzheng Dynamic Contextual Decay)は、AIモデルの指示遵守が長い対話の中でどう衰減するかを体系的に測定する世界初のテストです。3ラウンドの対話で2,000〜5,000字の専門的な妨害テキストを注入し、32の制約質問・5つの実務シナリオで評価します。すべてのスコアリングは100%ルールベースで、AIによる判定はゼロです。YZ指数の誠実性評価は42組のcanaryプローブで引用捏造やデータ偽造も検出します。本トピックでは指示遵守研究、ハルシネーション検出手法、WDCDテスト結果分析を収集しています。
Lab WDCD Run #360:Grok 4が95.7点でトップも、15モデル全体で38%の指示劣化を記録
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #360において、Grok 4が95.7点で首位を獲得したが、38%という大幅な指示劣化を示した。15モデル全体のコホート平均劣化率はわずか0.5%にとどまる一方、モデル間の個別ばらつきは顕著だった。
レビュー GLM-4.6が26点急騰、GPT-5.5も10.5点上昇——WDCD遵約格局に急変
WDCD v3.1パイロット版のRun #360において、GLM-4.6が26点上昇して87.55を記録し総合3位に浮上。GPT-5.5も10.5点上昇し、遵約能力評価の勢力図に大きな変化が生じた。
レビュー WDCD 5大シナリオ横断評価:業務ルールが最低2.13点、GPT-6シリーズは偏り差1.84点
WDCD v3.1の5大シナリオテストで、業務ルールシナリオが全モデル中最低スコア領域となり、Doubao-proはわずか2.13/4点にとどまった。一方、GPT-6シリーズは工学規範で満点を記録しながらデータ境界では著しく低スコアとなる偏りが浮き彫りになった。
レビュー 3ラウンドの圧力後に誠実率48.5%:Grok 4は崩壊ゼロ、GPT-o3の崩壊率は20.7%
v2アンカー問題8問のみを対象としたサンプリングにおいて、15モデルの第3ラウンド平均誠実率はわずか48.5%にとどまり、制約の遵守が3回目の圧力後にシステム的に崩れることが明らかになった。Grok 4が崩壊ゼロという優れた結果を示す一方、GPT-o3の崩壊率は20.7%に達した。
レビュー Grok 4が95.69点でWDCD首位、Qwen3 Maxは73.48点で最下位——両者の差は22点超
WDCD v3.1守約テストにおいて、Grok 4が95.69点でトップに立ち、Qwen3 Maxが73.48点で最下位となった。両者の差は22.21点に達し、上位モデルと下位モデルの間に明確な断層が生じている。
Lab WDCD Run #346:全11モデルが指示崩壊ゼロを達成、Grok 4が100点でリーダーボード首位
Winzhengが実施したWCDC Run #346において、評価対象の全11モデルがラウンド1からラウンド3にかけて平均コミットメント崩壊率0%を記録した。Grok 4が満点の100点で首位に立ち、これまでのリーダーボードで最もフラットな崩壊曲線が観測された。
レビュー Qwen3 Maxが20.2ポイント急上昇、GLM-4.6が僅差で続く――WDCD5モデルが全線上昇
WDCD v3.1テストにおいて、Qwen3 Maxが20.2ポイント、GLM-4.6が19.9ポイントと大幅に上昇し、評価対象11モデルのうち5モデルが上昇、下降ゼロという結果となった。Grok 4は引き続き満点100.00を維持し、守約能力でトップの座を堅持している。
レビュー WDCD 5シナリオ横断評価:エンジニアリング規範が最低2.45点、DoubaoとClaudeの得意・不得意の差は1.45点
WDCD v3.1の5大制約シナリオ横断評価において、エンジニアリング規範シナリオで全モデルの得点が最低となり、Doubao-proは11モデル中最低の2.45/4を記録した。安全コンプライアンスシナリオでは最大1.2点の差が生じ、モデルごとの得意・不得意の偏りが明確に浮かび上がった。
レビュー 11モデルのWDCD v2アンカー問題でR1確認率0%――約束遵守は初回から完全崩壊
8問のv2アンカー問題に基づくサンプリング条件において、評価対象11モデル全てのR1段階における平均確認率が0%となり、ハード制約の初回注入時点で約束遵守の基盤が完全に機能しないことが示された。
レビュー Grok 4が満点でWDCDランキング首位、Doubao Proは75.3点で最下位――スコア差は24.7点
WDCD v3.1の約束遵守テストにおいて、Grok 4が100点満点を獲得した唯一のモデルとなり、Doubao Proは75.30点で11位に留まり、両者のスコア差は24.7点に達した。
レビュー 7日間のSmokeデータ:Claude Opus 4.7がトレンド25.2で最高、Gemini 3.1 Proは26.9ポイント下落
2026年9月21日〜27日のSmoke評価データによると、Claude Opus 4.7が7日間で70.77点から96.01点へ上昇し、トレンド25.2・平均値87.8で全モデル中最高を記録。一方、Gemini 3.1 ProとDeepSeek V4 Proはそれぞれ26.9ポイント、25.7ポイ
Lab WDCD ラン #336:平均指示減衰率が -36.4% を記録、Gemini 3.1 Pro のみがゼロ減衰を維持
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのラン #336 において、11モデルの評価で平均指示減衰率が -36.4% を記録。Gemini 3.1 Pro だけがマルチターン対話全体にわたって指示へのコミットメントを完全に維持した唯一のトップクラスモ
レビュー 4モデルがWDCDで一斉下落、Gemini 2.5 Proは16.7ポイント急落
WDCD v3.1パイロットテストにおいて、Gemini 2.5 Proが前回Run #331比で16.7ポイント下落し、評価対象4モデル中最大の下落幅を記録した。DeepSeek V4 Pro、GPT-5.5、Qwen3 Maxも下落し、今回は上昇したモデルはゼロだった。
レビュー データ境界が契約遵守の最大盲点に——11モデルの最低スコア差は2.7点
WDCD v3.1の5大制約シナリオテストにおいて、データ境界シナリオの平均スコアが最も低く、Qwen3-maxはわずか1.3/4にとどまった。一方、業務ルールシナリオでは6モデルが満点4/4を獲得しており、モデルによってシナリオ間のスコア差が最大2.7点に達することが明らかになった。
レビュー WDCD三ラウンドアンカーテスト:R3誠実率63.6%、GPT-o3は確認後に崩壊
11モデルを対象とした3ラウンド連続施圧テストでは、R3(第3ラウンド)の平均誠実率が63.6%にとどまり、GPT-o3はR1・R2で満点に近いスコアを示しながらR3で完全崩壊するという典型的なパターンを示した。Grok 4やDoubao ProはR3で崩壊ゼロを達成した。
レビュー Grok 4がWDCD守約ランキングで93.60点首位、Qwen3 Maxは67.30点で最下位
WDCD v3.1守約テストにおいて、Grok 4が93.60点で11モデル中首位を獲得し、Qwen3 Maxが67.30点で最下位となった。上位と下位の差は26.3点に達した。
Lab WDCD Run #331:Grok 4が91.8点でトップ、平均指示減衰率は-15.1%
WinzhengのWDCDベンチマーク第331回実行において、11モデルを対象に評価が行われ、Grok 4が91.8点で首位を獲得。コホート全体の平均指示減衰率は-15.1%となり、長文コンテキスト下での指示遵守の劣化が依然として課題であることが示された。
レビュー GLM-4.6が29.8ポイント急落、GPT-5.5も6ポイント低下——WDCD約束遵守テストで両モデルが全面後退
WDCD v3.1パイロットデータによると、GLM-4.6のスコアが前回Run #326比で29.8ポイント、GPT-5.5が6ポイント低下し、上昇したモデルはゼロだった。Grok 4が91.76点でトップを維持している。
レビュー WDCD横断比較:データ境界が最難関シナリオに — GLM-4.6はわずか1.36点で崩壊
WDCD v3.1テストにおいて、データ境界シナリオで全モデルが最低スコアを記録し、GLM-4.6はわずか1.36/4点にとどまった一方、DeepSeek V4 ProとGemini 3.1 Proは3.8/4点で並んだ。各シナリオにおけるモデルの守約能力の差異から、企業の本番環境導入に向けた具体的
レビュー R3誠実率わずか49.5%:Grok 4のゼロ崩壊とGLM-4.6の27.6%崩壊が示す約束遵守能力の格差
WDCD v2アンカー問題テストにおいて、Grok 4はR3段階で完全崩壊がゼロだった一方、GLM-4.6のR3崩壊率は27.6%に達し、同一の三ラウンド加圧下での約束遵守能力に顕著な差が生じた。