基準: Run #313 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-09-07 05:06 SGT 最新: Run #323 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-09-14 05:06 SGT

メイン変動 総合力 core_overall

Grok 4 +2.4
77.2 → 79.6
Claude Sonnet 4.6 +2.1
74.7 → 76.8
Gemini 3.1 Pro +1.4
69.3 → 70.7
Gemini 2.5 Pro -7.9
73.2 → 65.3
GPT-o3 -5.1
81.7 → 76.6
豆包 Pro -3.7
75.7 → 72.0
Claude Opus 4.7 -2.6
82.6 → 80.1
DeepSeek V4 Pro -1.8
71.6 → 69.9
Qwen3 Max -1.6
71.6 → 70.0
GPT-5.5 -1.3
79.1 → 77.8

サイドランキング変動 エンジニアリング判断 / タスク表現

DeepSeek V4 Pro +18.0
タスク表現: 58.3 → 76.3
Gemini 2.5 Pro +17.6
エンジニアリング判断: 58.9 → 76.5
Gemini 2.5 Pro +15.0
タスク表現: 65.8 → 80.8
Grok 4 +14.4
タスク表現: 71.4 → 85.8
DeepSeek V4 Pro +10.0
エンジニアリング判断: 72.8 → 82.8
Gemini 3.1 Pro +10.0
エンジニアリング判断: 77.8 → 87.8
Claude Sonnet 4.6 +3.7
タスク表現: 76.7 → 80.4
GPT-o3 +2.5
タスク表現: 78.3 → 80.8
豆包 Pro -7.5
タスク表現: 93.3 → 85.8
Qwen3 Max -5.5
タスク表現: 53.3 → 47.8
Claude Sonnet 4.6 -4.0
エンジニアリング判断: 83.8 → 79.8
Grok 4 -2.9
エンジニアリング判断: 63.2 → 60.3
Claude Opus 4.7 -2.5
タスク表現: 75.3 → 72.8
Qwen3 Max -1.1
エンジニアリング判断: 41.7 → 40.6

運用信号変動 安定性 / 可用性 / コストパフォーマンス

GLM-4.6 +36.1
安定性: 38.9 → 75.0
DeepSeek V4 Pro +4.1
可用性: 86.5 → 90.6
Gemini 3.1 Pro +1.9
安定性: 24.2 → 26.1
Claude Sonnet 4.6 +1.1
安定性: 31.9 → 33.0
Gemini 2.5 Pro +1.1
可用性: 90.9 → 92.0
GLM-4.6 -67.5
可用性: 67.5 → 0.0
GLM-4.6 -38.5
コストパフォーマンス: 38.5 → 0.0
豆包 Pro -8.2
安定性: 42.9 → 34.7
Claude Opus 4.7 -5.6
安定性: 40.5 → 34.9
GPT-o3 -5.2
安定性: 37.3 → 32.1
GPT-5.5 -4.8
安定性: 40.7 → 35.9
Gemini 2.5 Pro -3.5
安定性: 32.4 → 28.9
DeepSeek V4 Pro -2.9
安定性: 44.3 → 41.4
Gemini 2.5 Pro -1.9
コストパフォーマンス: 36.5 → 34.6
DeepSeek V4 Pro -1.7
コストパフォーマンス: 43.6 → 41.9
豆包 Pro -1.6
コストパフォーマンス: 94.8 → 93.2
Grok 4 -1.5
安定性: 31.2 → 29.7
Qwen3 Max -1.5
コストパフォーマンス: 47.0 → 45.5
豆包 Pro -1.0
可用性: 98.9 → 97.9
Qwen3 Max -1.0
安定性: 23.6 → 22.6
GPT-5.5 -0.6
コストパフォーマンス: 19.4 → 18.8
GPT-o3 -0.5
コストパフォーマンス: 9.7 → 9.2

旧バージョンの次元変動を表示(v5 後方互換データ)
8 上昇
3 下降
0 安定

今週上昇

今週下降