YZ Index
AIモデル週間変動ランキング
自動スコアリング · 自動変動計算 · 毎週自動更新
基準: Run #313 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-09-07 05:06 SGT
最新: Run #323 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-09-14 05:06 SGT
メイン変動 総合力 core_overall
Grok 4
+2.4
77.2 → 79.6
Claude Sonnet 4.6
+2.1
74.7 → 76.8
Gemini 3.1 Pro
+1.4
69.3 → 70.7
Gemini 2.5 Pro
-7.9
73.2 → 65.3
GPT-o3
-5.1
81.7 → 76.6
豆包 Pro
-3.7
75.7 → 72.0
Claude Opus 4.7
-2.6
82.6 → 80.1
DeepSeek V4 Pro
-1.8
71.6 → 69.9
Qwen3 Max
-1.6
71.6 → 70.0
GPT-5.5
-1.3
79.1 → 77.8
サイドランキング変動 エンジニアリング判断 / タスク表現
DeepSeek V4 Pro
+18.0
タスク表現: 58.3 → 76.3
Gemini 2.5 Pro
+17.6
エンジニアリング判断: 58.9 → 76.5
Gemini 2.5 Pro
+15.0
タスク表現: 65.8 → 80.8
Grok 4
+14.4
タスク表現: 71.4 → 85.8
DeepSeek V4 Pro
+10.0
エンジニアリング判断: 72.8 → 82.8
Gemini 3.1 Pro
+10.0
エンジニアリング判断: 77.8 → 87.8
Claude Sonnet 4.6
+3.7
タスク表現: 76.7 → 80.4
GPT-o3
+2.5
タスク表現: 78.3 → 80.8
豆包 Pro
-7.5
タスク表現: 93.3 → 85.8
Qwen3 Max
-5.5
タスク表現: 53.3 → 47.8
Claude Sonnet 4.6
-4.0
エンジニアリング判断: 83.8 → 79.8
Grok 4
-2.9
エンジニアリング判断: 63.2 → 60.3
Claude Opus 4.7
-2.5
タスク表現: 75.3 → 72.8
Qwen3 Max
-1.1
エンジニアリング判断: 41.7 → 40.6
運用信号変動 安定性 / 可用性 / コストパフォーマンス
GLM-4.6
+36.1
安定性: 38.9 → 75.0
DeepSeek V4 Pro
+4.1
可用性: 86.5 → 90.6
Gemini 3.1 Pro
+1.9
安定性: 24.2 → 26.1
Claude Sonnet 4.6
+1.1
安定性: 31.9 → 33.0
Gemini 2.5 Pro
+1.1
可用性: 90.9 → 92.0
GLM-4.6
-67.5
可用性: 67.5 → 0.0
GLM-4.6
-38.5
コストパフォーマンス: 38.5 → 0.0
豆包 Pro
-8.2
安定性: 42.9 → 34.7
Claude Opus 4.7
-5.6
安定性: 40.5 → 34.9
GPT-o3
-5.2
安定性: 37.3 → 32.1
GPT-5.5
-4.8
安定性: 40.7 → 35.9
Gemini 2.5 Pro
-3.5
安定性: 32.4 → 28.9
DeepSeek V4 Pro
-2.9
安定性: 44.3 → 41.4
Gemini 2.5 Pro
-1.9
コストパフォーマンス: 36.5 → 34.6
DeepSeek V4 Pro
-1.7
コストパフォーマンス: 43.6 → 41.9
豆包 Pro
-1.6
コストパフォーマンス: 94.8 → 93.2
Grok 4
-1.5
安定性: 31.2 → 29.7
Qwen3 Max
-1.5
コストパフォーマンス: 47.0 → 45.5
豆包 Pro
-1.0
可用性: 98.9 → 97.9
Qwen3 Max
-1.0
安定性: 23.6 → 22.6
GPT-5.5
-0.6
コストパフォーマンス: 19.4 → 18.8
GPT-o3
-0.5
コストパフォーマンス: 9.7 → 9.2