Gemini 2.5 Pro、WDCD得点が25.1点急上昇——6モデルが改善、Doubao Proのみ6.3点下落
今回のWDCD v3.1テストでは、Gemini 2.5 Proが1回で25.1点上昇し、DeepSeek V4 Proが97.70点でトップに立った。6モデルがスコアを改善する中、Doubao Proのみが6.3点下落した。
今回のWDCD v3.1テストでは、Gemini 2.5 Proが1回で25.1点上昇し、DeepSeek V4 Proが97.70点でトップに立った。6モデルがスコアを改善する中、Doubao Proのみが6.3点下落した。
WDCD v3.1の5場面横断評価において、ビジネスルール場面の全体スコアが最も低く、Doubao Proはわずか2.25/4を記録。一方、Claude Opus 4.7はエンジニアリング規範の場面のみ3/4にとどまり、これが唯一の弱点とし
WDCD v3.1パイロットテストにおいて、GLM-4.6は初回ラウンドから制約を拒否し三ラウンドを通じてゼロ点を記録。複数制約の並行シナリオにおける系統的な欠陥が明らかになった。
WDCD v3.1約束遵守ランキングにおいて、DeepSeek V4 Proが97.70点で首位を獲得し、11位のQwen3 Max(75.20点)に22.5点の大差をつけた。上位と下位の間には、生産システムでの実用可能性において明確な境界
WDCD v3.1テストにおいて、Claude Sonnet 4.6が前回比8.6点上昇した一方、7モデルが一斉に下落し、GLM-4.6は27点、Gemini 2.5 Proは23.8点の大幅下落を記録した。
WDCD v3.1の5大制約テストにおいて、安全コンプライアンス場面が最も守約が困難な領域であることが判明した。gemini-2.5-proはわずか0.8/4点にとどまった一方、grok-4は4/4満点を獲得し、同一場面内の最大格差は3.2
8問のv2アンカー問題に基づく統計では、11の評価対象モデルのR1平均確認率が0.91に達した後、R2平均抵抗率は0.41まで低下し、R3平均誠実率はわずか45.5%にとどまった。R3での完全崩壊(0点)は計10回発生した。
WDCD v3.1守約テストにおいて、Grok 4が93.80点で首位、GLM-4.6が68.00点で最下位となり、両者の差は25.8点に達した。11モデルの評価結果には明確な断層が見られ、上位4モデルは83点超、下位3モデルは72点未満と
WDCD v3.1(Run #311)において、Claude Sonnet 4.6のスコアが前回比5点下落する一方、Doubao Proは7.5点上昇し、両者の逆方向の変動が今期唯一の顕著な変化となった。その他のモデルは概ね安定を維持してい
WDCD v3.1の約束遵守テストにおける5大制約シナリオ・11モデルの横断評価では、安全コンプライアンスシナリオが全体で最低スコアの次元となり、Qwen3-maxはわずか2.19/4にとどまった。一方、glm-4.6は複数シナリオで首位を
11のAIモデルを対象にWDCD(Will Do, Can Do)評価の8問v2アンカー問題でサンプリングを実施した結果、R1確認率は全モデル100%だったが、R3誠実率は平均49.5%にとどまり、29/319回の完全崩壊が確認された。二ラ
WDCD v3.1テストでGrok 4が93.21点で11モデル中1位を獲得。Qwen3 Maxは74.31点で最下位となり、両者の差は18.9点に達した。
WDCD v3.1パイロットデータにおいて、Gemini 2.5 Proが22.2点の大幅上昇で最大の勝者となり、Gemini 3.1 Proが97.70点で首位を獲得した。一方、Claude Sonnet 4.6は唯一13点の下落を記録し
WDCD v3.1パイロットデータによると、安全コンプライアンスシナリオにおける11モデルの平均スコアが最も低く、Qwen3-Maxはわずか2/4点、DeepSeek V4 Proは2.5/4点にとどまり、全シナリオ中で最も約束遵守が困難な
WDCD v3.1パイロット段階において、11モデルのR3平均誠実率は72.7%に留まり、110回のテスト中3回のR3完全崩壊(0点)が発生した。GLM-4.6、DeepSeek V4 Pro、Qwen3 Maxの3モデルが安全コンプライア
WDCD v3.1の約束遵守テストにおいて、Gemini 3.1 Proが97.70点で11モデル中首位を獲得し、Qwen3 Maxが70.30点で最下位となった。両者の差は27.4点に達した。
WDCD v3.1テスト(Run #296)において、Claude Sonnet 4.6が13.5点上昇して91.60点を記録した一方、Gemini 2.5 Proは12.5点急落。Grok 4が96.30点で首位を維持し、GPT-o3が9
WDCD v3.1テストにおいて、安全コンプライアンスシナリオは11モデルの平均スコアが他の4カテゴリを大きく下回り、Qwen3-maxはわずか1.5/4点を記録。一方、claude-sonnet-4.6、gpt-o3、grok-4の3モデ
8問のv2アンカー問題を対象としたテストにおいて、11の評価対象モデル全てでR1確認率・R2抵抗率・R3誠実率がすべて0%となり、3段階の漸進的プレッシャー下で約束を守れたモデルは皆無だった。
WDCD v3.1守約(約束遵守)総合ランキングにおいて、Grok 4が96.30点で首位を獲得し、Doubao Proの67.90点と28.4点の大差をつけた。上位3モデルと下位3モデルの平均点差は約25点に達し、モデル間の能力格差が鮮明