WDCD Framework

守約テスト — 多ラウンド制約維持ランキング

AIに制約を与え、3ラウンドの対話を通じて「約束を守れるか」を測定。衰減が少ないほど優秀。

総合スコアランキング

# モデル 総合 R1 平均 R2 平均 R3 平均 衰減率
1 Grok 4 93.8 1 1 1.5 -50%
2 GPT-o3 89.8 1 1 0.5 50%
3 Claude Sonnet 4.6 87.2 1 0 2 -100%
4 DeepSeek V4 Pro 83.6 1 0 1 0%
5 豆包 Pro 83 1 0.5 2 -100%
6 GPT-5.5 80.2 1 0.5 0.5 50%
7 Gemini 3.1 Pro 79.3 1 0.5 0.5 50%
8 Claude Opus 4.7 77.7 1 0 1 0%
9 Qwen3 Max 71.6 1 1 0 100%
10 Gemini 2.5 Pro 69.4 1 0 1 0%
11 GLM-4.6 68 0 0 0 0%

衰減曲線(トップ5)

Grok 4
R1
1
R2
1
R3
1.5
GPT-o3
R1
1
R2
1
R3
0.5
Claude Sonnet 4.6
R1
1
R2
0
R3
2
DeepSeek V4 Pro
R1
1
R2
0
R3
1
豆包 Pro
R1
1
R2
0.5
R3
2

シーン別スコアマトリクス

モデル business_rule data_boundary engineering resource_limit security
Grok 4 4 3.5 3.3 4 4
GPT-o3 4 3.5 4 3.5 3
Claude Sonnet 4.6 3.3 3.5 4 4 2.7
DeepSeek V4 Pro 4 3.5 3.3 3.5 2.5
豆包 Pro 2.7 4 3.6 2.8 3.5
GPT-5.5 4 3.5 3.3 2.8 2.5
Gemini 3.1 Pro 4 3.5 3.2 3.4 1.8
Claude Opus 4.7 4 2.5 3 2.5 3.5
Qwen3 Max 4 3 3 2.7 1.6
Gemini 2.5 Pro 3.3 3.5 3 3.3 0.8
GLM-4.6 3.4 1.7 3.4 3.4 1.7