Gemini 2.5 Proのコード実行スコアが25点急落、総合ランキングも7.2点下降
Gemini 2.5 ProがSmokeベンチマークの本日評価でコード実行スコアが100.00点から75.00点へと25点急落し、総合ランキングも88.75点から81.53点に低下した。
Gemini 2.5 ProがSmokeベンチマークの本日評価でコード実行スコアが100.00点から75.00点へと25点急落し、総合ランキングも88.75点から81.53点に低下した。
本日のSmoke評価テストにおいて、Grok 4の材料制約スコアが100.00点から77.80点へと22.2点急落し、総合ランキングスコアも93.79点から88.64点に低下した。ただし、サンプル数の少なさによる確率的変動が主因とみられる。
GPT-o3が本日のSmoke評価においてコード実行次元で94.50点から69.80点へと24.7点急落し、総合スコートも86.04点から78.13点へ低下した。ただし、題目抽選による変動が主因である可能性が高く、モデルの実質的な性能劣化と
Smoke評価テストにおいて、GPT-5.5のコード実行スコアが94.50から72.00へ22.5点下落した一方、材料制約スコアは71.40から100.00へ28.6点上昇した。総合ランキングのスコアはわずか0.5点の上昇にとどまっており、
Claude Sonnet 4.6が本日のSmoke評価において、材料制約スコアが昨日の100.00点から66.40点へ急落し、総合ランキングも86.25点から81.86点に低下した。ただし、複数の次元で同時上昇が見られることから、モデル能
Qwen3 MaxがSmokeテストでコード実行スコアを96.70点から75.00点へと大幅に下落させた一方、素材制約スコアは48.80点から69.20点へと上昇した。主要ランキングスコアは75.15点から72.39点へと小幅に低下した。
GPT-5.5が本日のSmoke評価においてコード実行スコアを100.00から75.00へと急落させ、メインランキング全体も79.12から71.67へと7.5ポイント低下した。抽選による問題のばらつきが主因と見られるが、跌幅は継続的な追跡が
2026年9月3日実施のRun#307において、GLM-4.6は誠実性評価でfailと判定され、プローブスコア15.00、主要ランキングスコア48.25点を記録した。同日テストされた他の全モデルが誠実性評価をpassしており、GLM-4.6
GPT-5.5が本日のSmokeテストでコード実行スコアを94.50から69.50へと急落させた一方、素材制約スコアは76.00から100.00へ上昇。両者が相殺し合い、総合ランキングの低下は3点にとどまった。
Grok 4が本日のSmokeベンチマークにおいてコード実行スコアを94.50点から72.70点へと大幅に落とし、メインランキングが89.15点から84.99点に後退した。一方、素材制約スコアは100点満点を記録した。
本日のSmoke評価テストにおいて、Gemini 3.1 Proのメインランキングスコアが昨日の96.60点から85.83点へと10.8ポイント下落した。特に素材制約次元が14.4ポイント、エンジニアリング判断が25ポイントと大幅に低下して
Grok 4は本日のSmoke評価テストで、メインランキングのスコアが昨日の96.99点から88.14点に低下し、1日の落ち幅は8.8ポイントに達した。コード実行と素材制約の2次元が主な下落要因となっている。
Claude Sonnet 4.6が本日のSmoke評価においてコード実行次元で97.00点から75.00点へ22点急落した一方、素材制約次元は25.7点上昇した。総合ランキングスコアは83.24点と、わずか0.5点の低下にとどまった。
Claude Opus 4.7は本日のSmokeテストにおいて総合スコア83.24点を記録し、昨日の93.54点から10.3点下落した。主な原因はコード実行ディメンションのスコアが97.00点から75.00点へと22点落ち込んだことにある。
GPT-o3の本日のSmokeベンチマーク総合スコアが昨日の100.00点から89.92点へ10.1点下落した。主因は素材制約次元が100.00点から77.60点へ22.4点急落したことにある。
Doubao ProのSmoke評価において、本日のコード実行スコアが75.00点に急落した一方、素材制約スコアは満点の100点に達した。スコアの変動は主に日次の出題抽選によるものと分析されている。
Gemini 2.5 ProがSmoke評価の本日テストで主榜スコアを18.37点から83.39点へと大幅に更新し、材料制約スコアは12.10点から100.00点の満点に到達した。ただし、この急上昇は1日あたり10問という極めて小さいサンプ
Gemini 2.5 ProがYZ Indexの2026-08-21 Run#288スモークテストで誠実性評価failを記録し、プローブスコア25.00点・主要ランキング18.37点という当日最低水準の結果を示した。コード実行・資料制約の両
GPT-5.5は本日のSmokeベンチマークにおいて総合スコアが98.35点から88.27点へと10.1点下落した。資料制約次元が100.00点から83.70点へと最大の下落幅を記録し、総合スコア低下の主因となった。
Claude Opus 4.7は本日のSmoke評価テストで総合スコアが98.35点から90.16点へと8.2点下落した。主な要因は資料制約スコアの100.00点から87.90点への急落(-12.1点)と、コード実行スコアの97.00点から