GPT-o3のコード実行スコアが32.5点急落——メインランキングは96.01点から80.48点に低下
GPT-o3が本日のSmokeベンチマークにおいてメインランキングスコアを96.01点から80.48点へと15.5点落とし、特にコード実行次元が97.00点から64.50点へと32.5点の大幅下落を記録した。小サンプルによる確率的変動の可能
GPT-o3が本日のSmokeベンチマークにおいてメインランキングスコアを96.01点から80.48点へと15.5点落とし、特にコード実行次元が97.00点から64.50点へと32.5点の大幅下落を記録した。小サンプルによる確率的変動の可能
Grok 4が本日のSmokeベンチマークでメインランキングスコアを前日の90.86点から80.89点に下落させ、特にコード実行ディメンションが96.30点から69.50点へと急落した。ただし、この変動は問題抽選のランダム性によるものと分析
本日のSmoke評価テストにおいて、Grok 4の材料制約スコアが昨日の100.00から84.20へと15.8点急落し、メインランキング全体が95.44から90.86に低下した。
本日のSmoke評価において、Claude Sonnet 4.6の材料制約スコアが100.00点から84.20点へと15.8点下落した一方、コード実行スコアは50.00点から97.00点へと大幅上昇し、総合ランキングは72.50点から91.
Claude Sonnet 4.6が本日のSmoke評価において、メインボードスコアが89.52点から72.50点へと17点下落した。コード実行ディメンションが100.00点から50.00点へと直接半減したことが主因である。
GPT-5.5は本日のSmokeベンチマーク評価でメインランキングのスコアが86.50点から76.44点へと10.1点下落した。主な原因はコード実行次元の25点急落とみられ、サンプル数の少なさによる問題抽選のばらつきが影響している可能性が高
Grok 4が本日のSmokeベンチマークでコード実行スコアを96.70点から74.30点へ大幅に落とし、総合ランキングスコアが88.33から75.38へと13点低下した。ただし、他の評価軸は概ね安定しており、モデル能力の系統的な劣化を示す
DeepSeek V4 Proは本日のSmokeベンチマークで、材料制約スコアが91.70点から76.70点へ下落した一方、主ランキングスコアは55.02点から75.77点へ上昇した。コード実行スコアの大幅改善が主な要因となっている。
Qwen3 MaxはSmoke評価の本日テストにおいて、材料制約スコアが90.90点から74.00点へ急落する一方、コード実行スコアが25.00点から89.30点へ急騰し、メインランキング総合スコアは54.66点から82.42点に上昇した。
Doubao Pro は本日のSmokeテストにおいて材料制約スコアが80.20点から64.30点へと15.9ポイント下落し、総合スコアも91.09点から83.94点へと7.2ポイント低下した。
Claude Opus 4.7は本日のSmoke評価テストにおいて、材料制約スコアが昨日の80.20点から64.30点へと急落し、主榜全体も91.09点から83.94点へと低下した。
GLM-4.6が本日のSmoke評価においてAPI障害・タイムアウトにより全5次元のデータが欠落し、自動再実行に入ったため今回のランキングには参加しない。欠落はモデル本来の性能ではなくインターフェース層の接続断に起因するとみられる。
GPT-o3は本日のSmoke評価において総合スコアが85.15点から70.19点へと15点下落した。主な要因はコード実行ディメンションが100.00点から75.00点へと25点急落したことによる。
GPT-5.5が本日のSmoke評価においてメインボードスコアを82.29点から60.87点へ大幅に下落させ、1日の下落幅は21.4点に達した。コード実行と材料制約の両次元が同時に20点以上の急落を記録し、全体的な可用性に深刻な懸念が生じて
Claude Opus 4.7が本日のSmoke評価において、総合スコアが昨日の82.29点から63.59点へと18.7ポイント急落した。主な原因はコード実行スコアが97.00点から50.00点へと47ポイント下落したことにある。
Gemini 2.5 ProがSmokeベンチマークの本日評価でコード実行スコアが100.00点から75.00点へと25点急落し、総合ランキングも88.75点から81.53点に低下した。
本日のSmoke評価テストにおいて、Grok 4の材料制約スコアが100.00点から77.80点へと22.2点急落し、総合ランキングスコアも93.79点から88.64点に低下した。ただし、サンプル数の少なさによる確率的変動が主因とみられる。
GPT-o3が本日のSmoke評価においてコード実行次元で94.50点から69.80点へと24.7点急落し、総合スコートも86.04点から78.13点へ低下した。ただし、題目抽選による変動が主因である可能性が高く、モデルの実質的な性能劣化と
Smoke評価テストにおいて、GPT-5.5のコード実行スコアが94.50から72.00へ22.5点下落した一方、材料制約スコアは71.40から100.00へ28.6点上昇した。総合ランキングのスコアはわずか0.5点の上昇にとどまっており、
Claude Sonnet 4.6が本日のSmoke評価において、材料制約スコアが昨日の100.00点から66.40点へ急落し、総合ランキングも86.25点から81.86点に低下した。ただし、複数の次元で同時上昇が見られることから、モデル能