指示遵守とWDCDテスト
150 件の記事
· ページ 1/8
AIモデルは本当に指示通りに動くのか?指示遵守(instruction compliance)は企業がAIを導入する際の最も重要な評価次元ですが、従来のベンチマークではほとんどテストされていません。WDCD(Winzheng Dynamic Contextual Decay)は、AIモデルの指示遵守が長い対話の中でどう衰減するかを体系的に測定する世界初のテストです。3ラウンドの対話で2,000〜5,000字の専門的な妨害テキストを注入し、32の制約質問・5つの実務シナリオで評価します。すべてのスコアリングは100%ルールベースで、AIによる判定はゼロです。YZ指数の誠実性評価は42組のcanaryプローブで引用捏造やデータ偽造も検出します。本トピックでは指示遵守研究、ハルシネーション検出手法、WDCDテスト結果分析を収集しています。
レビュー Grok 4、マテリアル制約スコアが17.6点急落――総合ランキングは1.8点減にとどまる
本日のSmoke評価において、Grok 4のマテリアル制約スコアが82.60点から65.00点へと17.6点急落した一方、総合ランキングは82.99点から81.23点へと1.8点の小幅な低下にとどまった。
Lab WDCD ラン #263:Grok 4 が97.5ポイントで首位、平均指示減衰率は -18.2% に
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第263回では、11モデルを対象に多ターン対話における指示保持能力を測定した結果、平均指示減衰率は -18.2% となり、Grok 4 が97.5ポイントで首位を獲得した。
レビュー GPT-o3が9.5ポイント上昇で逆転、GLM-4.6は14.9ポイント急落——WDCD約束遵守ランキングで5モデルが大幅入れ替え
WDCD v3.1テストにおいて、GPT-o3が9.5ポイント上昇してトップ2入りを果たした一方、GLM-4.6が14.9ポイント、Claude Sonnet 4.6が10.8ポイント下落するなど、AIモデル間で大きな順位変動が生じた。
レビュー WDCD横断評価:安全コンプライアンスシーンの最低スコアは1.8点、エンジニアリング規範では全モデルが4点満点
WDCD v3.1の契約遵守テストにおいて、安全コンプライアンスシーンで最大2.2点の差が生じ、GPT-5.5とQwen3-Maxが最低の1.8/4点を記録した一方、エンジニアリング規範シーンでは全11モデルが3.2〜4点に集中した。
レビュー WDCD三ラウンド減衰分析:R3誠実率はわずか54.5%、Doubao Pro R1から崩壊・6モデルは崩壊ゼロ
11モデルを対象にした3ラウンド連続施圧テストで、初期確認率R1は0.91だったものの、R3誠実率は54.5%まで低下し、約束遵守能力の系統的な減衰が明らかになった。Doubao ProはR1から崩壊した一方、DeepSeek V4 ProはR3で満点を記録した。
レビュー Grok 4がWDCD守約ランキング首位に、97.5点でトップ――DoubaoProは68点で最下位に沈む
WDCD v3.1守約テストにおいて、Grok 4が97.50点で首位を獲得し、Doubao Proが68.00点で最下位となった。上位と下位の差は29.5点に達した。
レビュー GLM-4.6、材料制約スコアが27.3点急落——メインランキングは逆に30.2点上昇
本日のSmokeベンチマークにおいて、GLM-4.6の材料制約スコアが75.00点から47.70点へ下落した一方、コード実行スコアが100点満点を記録し、メインランキングは46.29点から76.47点へと上昇した。誠実性評価はpassからwarnに変化した。
Lab WDCD Run #253:Grok 4が94.8点でトップ、平均指示減衰率は4.5%
WinzhengのWDCDベンチマーク第253回実行において、Grok 4が94.8点で首位を獲得。11モデルを対象とした評価では、平均指示コミットメント減衰率は4.5%となった。
レビュー ClaudeデュオがWDCDスコア6.8点上昇、Geminiは単独5.6点下落——守約ランキングが激変
WDCD v3.1守約テストのRun #253において、Claude Opus 4.7が6.8点上昇、Claude Sonnet 4.6が6.7点上昇した一方、Gemini 3.1 Proが5.6点下落し、多段階の段階的圧力下でのモデル間の制約維持能力に顕著な差異が生じた。
レビュー WDCD 5大シナリオ横断評価:ビジネスルールで全モデル最低、エンジニアリング規範の3点差が最も厳しい結果に
WDCD v3.1の5大シナリオ横断評価において、ビジネスルールシナリオが全モデルにとって最難関となり、エンジニアリング規範シナリオでは最大3点という大きなスコア差が生じた。Claude-opus-4.7はエンジニアリング規範のみ3/4にとどまり、最も顕著な「得意不得意の偏り」事例となった。
レビュー WDCD三ラウンドアンカーテスト:R3誠実率わずか45.5%、GPT-5.5とQwen3 Maxの崩壊率20%
8問のv2アンカー問題を用いた3ラウンドテストにおいて、11モデルの平均R1確認率は0.95、R2抵抗率は0.86だったが、R3誠実率は45.5%まで低下し、9回の完全崩壊(0点)が発生した。この結果は、持続的なプレッシャー下でのモデルの約束遵守能力が急激に低下することを示している。
レビュー Grok 4がWDCD守約ランキングで94.80点首位、DoubaoProは64.20点で最下位――両者の差は30点超
WDCD v3.1守約テストにおいて、Grok 4が94.80点で首位を獲得し、Doubao Proは64.20点で11位に終わり、両者の差は30.6点に達した。
Lab WDCD Run #247:Grok 4がネガティブ減衰でトップ、平均指示減衰率は-1.8%に縮小
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #247では、11モデルを対象に多ターン対話における指示遵守の減衰を測定し、平均指示減衰率は-1.8%を記録。上位モデルは減衰どころか指示遵守率が向上するという結果となった。
レビュー Grok 4が94.20点でトップ維持、ClaudeとGeminiは5点以上下落
WDCD v3.1パイロット評価のRun #247において、Grok 4が94.20点で首位を維持する一方、Claude Opus 4.7とGemini 3.1 Proはいずれも5点以上下落し83点台に後退した。
レビュー WDCD五大シナリオ横断評価:ビジネスルールが最難関、Grok-4は満点・Claude-sonnetは1.8点
WDCD v3.1の契約遵守テストにおいて、ビジネスルールシナリオの平均スコアが最低となり、Claude-sonnet-4.6はわずか1.8/4点に留まった一方、Grok-4は満点4/4を獲得し、両者の差は2.2点に達した。
レビュー R3誠実率わずか50.6%:Grok 4はゼロ崩壊、GPT-o3は20%崩壊
WDCD v3.1パイロットテストにおける8問のv2三段階アンカー問題の結果、11モデルのR3平均誠実率はわずか50.6%にとどまった。Grok 4がR3で1.63/2を達成しゼロ崩壊を記録した一方、GPT-o3とQwen3 Maxの崩壊率はいずれも20%に達した。
レビュー GLM-4.6、材料制約で93.30点を記録も誠実性評価はfail――コード実行25.00点が総合ランキングの足を引っ張る
2026年7月23日実施のRun#243 Smokeテストにおいて、GLM-4.6は総合ランキング55.74点を記録。材料制約で93.30点の高得点を挙げた一方、コード実行は25.00点にとどまり、誠実性評価はfail(プローブ30.00点)となった。
Lab WDCD Run #242:Grok 4とGLM-4.6が指示劣化ゼロを維持、Gemini 3.1 Proは-100%で完全崩壊
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #242において、Grok 4とGLM-4.6が指示劣化率0%でトップを維持する一方、Gemini 3.1 Proは-100%という最悪の結果を記録し、全体平均劣化率18.2%との間に極端な二極化が見
レビュー GLM-4.6がWDCDで13.7点急伸、GPT-o3は6.9点下落——守約Top圏の序列が再編
最新のWDCD v3.1守約テストにおいて、GLM-4.6が13.7点上昇して92.00点に達した一方、GPT-o3は6.9点下落して87.10点となり、上位5モデルの内部順位が大きく塗り替えられた。
レビュー リソース制限シナリオで最低1.55点:11モデルのWDCD契約遵守テスト、最大スコア差は2.45点
WDCD v3.1の契約遵守テストにおいて、リソース制限シナリオでgpt-5.5が1.55/4と最低スコアを記録し、全5シナリオ中の最大スコア差は2.45点に達した。モデルの契約遵守能力はシナリオ固有の特性であり、単一シナリオの成績から全体性能を推測できないことが明らかになった。