GPT-o3、メインランキングで13.8点急落――コード実行が70.3点から48.5点へ
GPT-o3が本日のSmokeテストにおいてメインランキングで80.61点から66.86点へ急落し、コード実行スコアが70.30点から48.50点へ単日21.8点の下落を記録した。各次元のスコア変動の原因と利用者への影響を分析する。
GPT-o3が本日のSmokeテストにおいてメインランキングで80.61点から66.86点へ急落し、コード実行スコアが70.30点から48.50点へ単日21.8点の下落を記録した。各次元のスコア変動の原因と利用者への影響を分析する。
2026年7月13日〜19日の7日間Smoke評価において、Claude Opus 4.7が平均86.9点で首位を獲得。GPT-o3は初日97.36点から最終日66.86点へと30.5点下落した。
2026年7月19日のYZ Index Smoke速測では、10モデルを対象にClaude Opus 4.7が95.19点で当日首位を獲得した。Smokeは1日10問の速測であり、短期シグナルの観察に適しており、Full週間ランキングの結論
2026年7月18日のYZ Index Smoke快速テストでは11モデルを対象に評価を実施し、GPT-o3が80.61点で当日首位となった。本テストはコード実行と資料制約の2次元で評価する毎日10問の小規模テストであり、短期シグナルの観察
Grok 4が本日のSmokeベンチマーク評価において、主榜スコアが昨日の94.15点から76.65点へと17.5点下落した。特に材料制約次元の単日下落幅が21.9点と最大で、日次の問題抽選による変動が主因と分析されている。
DeepSeek V4 Proが本日のSmoke評価においてメインランキングのスコアが93.84点から81.93点へと11.9ポイント下落した。特にコード実行と材料制約の2次元で大幅な低下が確認された。
2026-07-17のYZ Index Smokeクイックテストでは11モデルを評価し、Gemini 2.5 ProとGemini 3.1 Proが92.44点で並列首位となった。本速報は1日10問のクイックテストによる短期シグナル観測を目
Doubao ProがSmoke評価テストのメインランキングで86.25点から71.22点に急落し、コード実行次元が75.00点から58.30点へと大幅に低下した。今回の変動は主に問題抽選のランダム性によるものとみられるが、複数のコア次元が
Claude Opus 4.7は本日のSmokeベンチマークにおいて、メインランキングスコアが100.00点から80.09点へと急落した。コード実行と資料制約の両次元が同日に大幅な失点を記録している。
2026-07-16のYZ Index Smoke速報(9モデル対象)では、Grok 4が94.15点で当日首位を獲得。Smokeは毎日10問の速報テストであり、短期シグナルの観察に適しているが、Fullウィークリーランキングの結論とは同等
WDCD v3.1テスト(Run #233)において、Claude Sonnet 4.6が前回比15点上昇、GLM-4.6が15.3点下落という対称的な変動が観測され、11モデル中最も顕著な守約能力の二極化が明らかになった。
WDCD v3.1のパイロットデータにより、業務ルールシナリオが11モデル中で約束遵守生存率が最も低い次元であることが判明した。首位のDeepSeek V4 Proが4/4満点を獲得する一方、最下位のQwen3-maxはわずか1.55/4に
WDCD v3.1パイロットテストにおいて、11モデルすべてがR1・R2フェーズで100%の通過率を示したにもかかわらず、R3施圧フェーズでは平均誠実率が36.4%にとどまり、4モデルが完全崩壊(0点)を記録した。業務ルール類の制約が特に脆
WDCD v3.1守約ランキングでGPT-o3が94.00点で首位を獲得し、Qwen3 Maxが62.60点で最下位となった。評価対象の11モデルで首位と最下位の差は31.4点に達した。
Gemini 3.1 ProがSmokeベンチマーク評価のメインランキングで80.99点から72.50点へ8.5点下落し、特にコード実行次元が75点から50点へ25点の大幅下落を記録した。サンプル数の少なさによる抽選変動が主因とみられる。
DeepSeek V4 ProがSmoke評価のコード実行次元で98.70点から75.00点へと23.7点急落し、メインランキング全体も91.46点から86.25点に下落した。ただし、この変動は問題抽選によるばらつきの可能性が高く、モデルの
2026年7月15日のYZ Index Smokeクイックテストでは、Claude Opus 4.7、Gemini 2.5 Pro、GPT-5.5の3モデルが100点満点で並び当日首位となった。本テストはコード実行と資料制約の2次元のみをカ
2026年7月14日のYZ Index Smoke速測では11モデルを対象に評価が行われ、DeepSeek V4 Proが91.46点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期シグナルの観察に適しているが、Full週間ラ
DeepSeek V4 ProがSmoke評価のメインランキングで96.99点から80.10点へと16.9点下落した。主な要因はコード実行次元の28点急落であり、サンプル数が少ないことによる問題抽選の変動が主因とみられる。
Claude Opus 4.7はSmoke評価の主要ランキングにおいて96.99点から82.95点へと下落し、コード実行ディメンションが100.00点から69.00点へ31点落ち込んだ。ただし、モデル全体の能力低下ではなく、当日の出題サンプ