Doubao Pro、Smoke評価でAPI障害により全5次元データ欠損―メインランキング不参加
Doubao ProはAPIタイムアウト障害により本日のSmoke評価で全5次元のデータが完全に欠損し、自動再実行プロセスに入ったため、今回のメインランキングには参加しない。
Doubao ProはAPIタイムアウト障害により本日のSmoke評価で全5次元のデータが完全に欠損し、自動再実行プロセスに入ったため、今回のメインランキングには参加しない。
Doubao ProはAPI障害・タイムアウトにより本日のSmokeテストで全問未回答となり、execution・grounding・judgment・integrity・communicationの5次元すべてがスコア「-」を記録、今回の
Doubao ProはSmokeテストの5つの評価次元すべてでデータが欠損し、API障害またはタイムアウトが直接原因として特定された。今回はメインランキングへの参加なし。
GLM-4.6は本日のSmoke評価テストにおいて誠実性評価がpassからfailに急落した一方、コード実行スコアが50.00点から97.00点へと47点上昇し、メインランキング総合スコアも62.83点から74.00点に改善した。
Gemini 3.1 ProがSmokeベンチマーク評価のメインランキングで80.99点から72.50点へ8.5点下落し、特にコード実行次元が75点から50点へ25点の大幅下落を記録した。サンプル数の少なさによる抽選変動が主因とみられる。
Grok 4は本日のSmoke評価においてメインランキングのスコアが昨日の87.66点から79.30点へと8.4点下落した。主な要因は材料制約ディメンションの大幅な低下であり、誠実性評価もpassからwarnに変化した。
YZ Index 2026年7月2日のSmoke軽量評価において、Gemini 3.1 Proが82.97点で1位を獲得。実行スコアが順位を左右する主要因となった。
2026年6月29日のYZ Index Smokeライト評価にて、Claude Opus 4.7がメインランキング・実行・制約の全項目で満点100点を記録し首位に立った。一方、Doubao Proは実行スコア75点にとどまり、前日比13.8
Smoke 7 日間連続クイックテストの結果、首位だった GPT-5.5 は 23.1 点急落した一方、Claude の 2 モデルは 30 点超の逆転劇を演じた。ただし、安定性の低さが信頼性に影を落としている。
Smoke 本日のクイックテストで Claude Opus 4.7、Claude Sonnet 4.6、GPT-5.5 が 87.76 点で並列首位となり、コード実行は満点だが材料制約次元で warn シグナルが発生した。
Smoke 10問クイックテストで Grok 4 が98.34点で首位を獲得し、コード実行は満点を達成。一方 Claude Opus 4.7 は前日から31.3点も下落し、モデル間の実行能力の差が顕著に表れた。