守約テスト — 多ラウンド制約維持ランキング
AIに制約を与え、3ラウンドの対話を通じて「約束を守れるか」を測定。衰減が少ないほど優秀。
総合スコアランキング
| # | モデル | 総合 | R1 平均 | R2 平均 | R3 平均 | 衰減率 |
|---|---|---|---|---|---|---|
| 1 | Grok 4 | 91.4 | 1 | 0.8 | 1.3 | -30% |
| 2 | DeepSeek V4 Pro | 91.4 | 1 | 0.9 | 1.3 | -30% |
| 3 | Claude Opus 4.7 | 89.4 | 1 | 0.9 | 1.3 | -30% |
| 4 | Gemini 3.1 Pro | 88.9 | 1 | 0.9 | 1.4 | -40% |
| 5 | GLM-4.6 | 81.9 | 1 | 0.8 | 1 | 0% |
| 6 | GPT-o3 | 81.5 | 1 | 0.5 | 0.4 | 60% |
| 7 | Claude Sonnet 4.6 | 78.8 | 1 | 0.6 | 0.9 | 10% |
| 8 | 豆包 Pro | 78 | 0.9 | 0.8 | 1.1 | -22.2% |
| 9 | Gemini 2.5 Pro | 77.2 | 1 | 0.8 | 1.4 | -40% |
| 10 | GPT-5.5 | 74.5 | 1 | 0.6 | 0.5 | 50% |
| 11 | Qwen3 Max | 64.9 | 1 | 0.9 | 0.8 | 20% |
衰減曲線(トップ5)
Grok 4
DeepSeek V4 Pro
Claude Opus 4.7
Gemini 3.1 Pro
GLM-4.6
シーン別スコアマトリクス
| モデル | business_rule | data_boundary | engineering | resource_limit | security |
|---|---|---|---|---|---|
| Grok 4 | 4 | 3.2 | 4 | 3.4 | 3.9 |
| DeepSeek V4 Pro | 3.5 | 3.8 | 4 | 3.8 | 3.2 |
| Claude Opus 4.7 | 3.5 | 3.6 | 3.6 | 3.5 | 3.6 |
| Gemini 3.1 Pro | 2.9 | 3.6 | 3.9 | 4 | 3.2 |
| GLM-4.6 | 3 | 3.2 | 3.7 | 3.4 | 3 |
| GPT-o3 | 3.5 | 2.2 | 4 | 3.1 | 3.6 |
| Claude Sonnet 4.6 | 2.3 | 3.3 | 3.7 | 2.8 | 3.2 |
| 豆包 Pro | 3 | 3.1 | 3.2 | 3.5 | 2.9 |
| Gemini 2.5 Pro | 3.3 | 3.4 | 3.4 | 3 | 2.7 |
| GPT-5.5 | 3 | 3.1 | 3.2 | 2.7 | 3 |
| Qwen3 Max | 2.3 | 2.5 | 2.9 | 3.1 | 2.1 |