Claude Opus 4.7が72.21点で首位:2026-08-14 YZ Index Smoke速報データブリーフィング
2026年8月14日のYZ Index Smokeクイックテストでは11モデルを対象に評価が行われ、Claude Opus 4.7が72.21点で当日首位を獲得した。一方、複数のモデルで大幅なスコア低下が見られ、今後の追加検証が必要とされて
2026年8月14日のYZ Index Smokeクイックテストでは11モデルを対象に評価が行われ、Claude Opus 4.7が72.21点で当日首位を獲得した。一方、複数のモデルで大幅なスコア低下が見られ、今後の追加検証が必要とされて
Gemini 2.5 ProのSmoke評価における本日の総合スコアが昨日の88.53点から79.41点へと9.1ポイント下落した。主な要因はコード実行スコアの単日29.6ポイント急落である。
2026年8月13日のYZ Index Smoke速測では11モデルを対象に評価が行われ、GPT-5.5とGPT-o3が97.25点で当日首位に並んだ。Smokeは毎日10問の速測であり、短期的なシグナル観測に適している。
WDCD v3.1テストにおいて、Doubao ProとGLM-4.6が大幅上昇した一方、GPT-o3とDeepSeek V4 Proが顕著に下落し、AIモデルの約束遵守能力ランキングが大きく変動した。現在のトップ5はGrok 4を筆頭に、
WDCD v3.1の5大場景横断評価において、ビジネスルール場景が全モデル中最低スコアの赛道となり、Qwen3-maxはわずか1.55/4点にとどまった。一方、Claude opus 4.7はデータ境界で4/4の満点を獲得しながらも、リソー
WDCD v3.1パイロットテストにおいて、11モデルがv2アンカー問題8問で明確な三ラウンド衰退を示した。R1確認率100%、R2抵抗率86%に対し、R3誠実率はわずか59.1%にとどまり、GPT-o3は20%という突出した崩壊率を記録し
WDCD v3.1の遵約テストにおいて、Grok 4が94.80点で首位を獲得し、Qwen3 Maxは69.20点で11位に留まり、両モデルの合計点差は25.6点に達した。R3高圧ラウンドでの耐性が最終順位を大きく左右する結果となった。
GLM-4.6が本日のSmoke評価でメインランキング79.38点を記録。コード実行は62.50点に下落した一方、資料制約は100.00点の満点を獲得し、誠実性評価はfailからpassに転換した。
2026年8月12日のYZ Index Smoke速測では11モデルを対象に評価が行われ、Grok 4が98.41点で当日首位を獲得した。上位モデルはコード実行と資料制約の両次元で明確な差異化が見られた。
Doubao ProはAPIタイムアウト障害により本日のSmoke評価で全5次元のデータが完全に欠損し、自動再実行プロセスに入ったため、今回のメインランキングには参加しない。
GLM-4.6は本日のSmoke評価において、誠実性評価がPassからFailに転落し、タスク表現スコアが45.00点から20.00点へと大幅に低下した。一方でコード実行スコアの上昇により、メインランキングのスコアは61.25点から74.0
2026年8月11日のYZ Index Smokeクイックテストでは10モデルを対象に評価が行われ、Gemini 3.1 Proが94.74点で当日首位を獲得した。なお、GLM-4.6は誠実性評価がFailに低下している。
2026年8月10日のYZ Index Smoke速測では10モデルを対象に評価が行われ、DeepSeek V4 Proが87.2点で当日首位を獲得した。Smokeは1日10問の速測であり、短期シグナルの観察に適しており、Fullウィークリ
WDCD v3.1の最新評価(Run #271)において、Claude Sonnet 4.6が83.72点を記録して8.8ポイント上昇、Doubao Proは16ポイント下落した。11モデル中、上昇は2モデル、下落は1モデルにとどまり、首位
WDCD v3.1の5シナリオ横断評価において、データ境界シナリオの全体スコアが最も低く、11モデルの平均はわずか約2.8点であった。Doubao-proは1.4/4点で唯一2点を下回り、gpt-o3とgrok-4が3.6/4点で並んだ。
v2アンカーポイント問題8問のサンプリングにおいて、11モデルのR3完全崩壊が34/275回に達し、Doubao ProのR3崩壊率は32%に上る一方、Grok 4は崩壊ゼロを維持した。初回確認率が90%に達するモデルでも、第3ラウンドの圧
WDCD v3.1守約テストにおいて、Grok 4が91.04点で首位を獲得し、Doubao Proは58.00点で最下位となった。11モデルが25問に挑んだworst-of-3サンプリングの結果、上位と下位の差は33.04点に達した。
Qwen3 MaxのSmoke評価における本日の主要ランキングスコアが96.04点から85.82点へと10.2点下落した。資料制約次元が21.5点という大幅な下落を記録したことが主な要因となっている。
DeepSeek V4 ProのSmokeベンチマークにおける材料制約スコアが前日の89.50点から70.00点へと急落し、総合スコアも94.07点から86.50点に低下した。ただし、コード実行は満点に達しており、モデル全体の系統的な劣化と
2026年8月6日〜9日のSmokeテスト週次トレンドにおいて、Claude Sonnet 4.6が最大の下落幅22.6ポイントを記録した一方、GPT-o3とClaude Opus 4.7は安定した上昇傾向を示した。GLM-4.6は変動幅5