YZ Index

YZ指数 · タスク表現ランキング

要約、翻訳、書き換え、FAQ生成、インシデント報告 — 規則による精確判分(json_schema_exact)。

サイドボード:規則による精確判分(json_schema_exact) — このランキングの次元は確定的な規則で採点され、メインボードの計算には含まれません。
# モデル タスク表現 コード実行 メインボード
🥇 豆包 Pro doubao
93.3
82.9 75.7
🥈 GPT-5.5 gpt
90.8
88.3 79.1
🥉 GPT-o3 gpt
78.3
86 81.7
4 Claude Sonnet 4.6 claude
76.7
76.3 74.7
5 Gemini 3.1 Pro gemini
75.8
71.2 69.3
6 Claude Opus 4.7 claude
75.3
85.7 82.6
7 Grok 4 grok
71.4
83.3 77.2
8 Gemini 2.5 Pro gemini
65.8
75.5 73.2
9 DeepSeek V4 Pro DeepSeek
58.3
69.7 71.6
10 Qwen3 Max qwen
53.3
76.9 71.6
11 GLM-4.6 zhipu
37.5
65.2 64