WDCD Framework

守約テスト — 多ラウンド制約維持ランキング

AIに制約を与え、3ラウンドの対話を通じて「約束を守れるか」を測定。衰減が少ないほど優秀。

総合スコアランキング

# モデル 総合 R1 平均 R2 平均 R3 平均 衰減率
1 Grok 4 91.4 1 0.8 1.3 -30%
2 DeepSeek V4 Pro 91.4 1 0.9 1.3 -30%
3 Claude Opus 4.7 89.4 1 0.9 1.3 -30%
4 Gemini 3.1 Pro 88.9 1 0.9 1.4 -40%
5 GLM-4.6 81.9 1 0.8 1 0%
6 GPT-o3 81.5 1 0.5 0.4 60%
7 Claude Sonnet 4.6 78.8 1 0.6 0.9 10%
8 豆包 Pro 78 0.9 0.8 1.1 -22.2%
9 Gemini 2.5 Pro 77.2 1 0.8 1.4 -40%
10 GPT-5.5 74.5 1 0.6 0.5 50%
11 Qwen3 Max 64.9 1 0.9 0.8 20%

衰減曲線(トップ5)

Grok 4
R1
1
R2
0.8
R3
1.3
DeepSeek V4 Pro
R1
1
R2
0.9
R3
1.3
Claude Opus 4.7
R1
1
R2
0.9
R3
1.3
Gemini 3.1 Pro
R1
1
R2
0.9
R3
1.4
GLM-4.6
R1
1
R2
0.8
R3
1

シーン別スコアマトリクス

モデル business_rule data_boundary engineering resource_limit security
Grok 4 4 3.2 4 3.4 3.9
DeepSeek V4 Pro 3.5 3.8 4 3.8 3.2
Claude Opus 4.7 3.5 3.6 3.6 3.5 3.6
Gemini 3.1 Pro 2.9 3.6 3.9 4 3.2
GLM-4.6 3 3.2 3.7 3.4 3
GPT-o3 3.5 2.2 4 3.1 3.6
Claude Sonnet 4.6 2.3 3.3 3.7 2.8 3.2
豆包 Pro 3 3.1 3.2 3.5 2.9
Gemini 2.5 Pro 3.3 3.4 3.4 3 2.7
GPT-5.5 3 3.1 3.2 2.7 3
Qwen3 Max 2.3 2.5 2.9 3.1 2.1