GPT-6 Lunaの総合スコアが8.4点急落、コード実行は1日で16.7点下落
本日のSmoke評価テストにおいて、GPT-6 Lunaの総合スコアが83.19点から74.82点へと8.4点下落した。コード実行ディメンションが16.7点下落したことが主な要因だが、現時点ではモデルの実質的な性能低下ではなく小サンプルの抽
本日のSmoke評価テストにおいて、GPT-6 Lunaの総合スコアが83.19点から74.82点へと8.4点下落した。コード実行ディメンションが16.7点下落したことが主な要因だが、現時点ではモデルの実質的な性能低下ではなく小サンプルの抽
本日のSmoke評価において、Claude Sonnet 4.6の材料制約スコアが93.30点から62.70点へ30.6ポイント急落した一方、コード実行スコアは50.00点から75.00点へ25ポイント上昇し、メインボードの総合スコアはほぼ
本日のSmoke評価テストにおいて、Grok 4のコード実行スコアが95.30点から64.00点へ31.3点下落した一方、資料制約スコアは48.40点から83.10点へ34.7点上昇し、総合スコアは74.20点から72.60点へ小幅に低下し
本日のSmoke評価テストにおいて、GPT-5.5のコード実行スコアが72.00から50.00へと22点下落した一方、素材制約スコアは69.10から95.00へと25.9点上昇した。総合スコアへの影響は限定的で、主要ランキングは70.70か
本日のSmoke評価テストにおいて、Qwen3 Maxのコード実行スコアが94.00点から70.00点へと24点急落し、メインランキングスコアも84.51点から77.16点に低下した。ただし、問題の抽選による変動が主因とみられ、モデル能力の
本日のSmokeベンチマークにおいて、GPT-o3のコード実行スコアが93.80点から72.00点へと21.8点下落した一方、資料制約スコアは49.30点から82.80点へと33.5点上昇し、総合スコアは73.78点から76.86点へと小幅
本日のSmokeベンチマークにおいて、GPT-o3のメインランキングスコアが96.01から80.78へと15.2点下落し、特にコード実行の次元で97.00から72.50へと24.5点の急落を記録した。ただし、その他の次元は安定または上昇して
Claude Opus 4.7が本日のSmoke評価テストにおいて、総合スコアが96.01点から82.16点へと13.9点下落した。コード実行部門では22点という大幅な落ち込みが記録されたが、サンプル数の少なさによるランダム変動の可能性が高
GPT-5.5が本日のSmokeベンチマーク評価において総合スコアが91.32点から78.80点へと12.5点下落した。主な要因はコード実行次元のスコアが100.00点から72.00点へと28点急落したことにある。
Doubao Pro が本日のSmokeベンチマーク・メインランキングで83.00点を記録し、昨日の92.85点から9.8点下落した。中でも資料制約ディメンションが85.70点から72.00点へと大幅に落ち込んだ。
GPT-o3が本日のSmokeベンチマークにおいてメインランキングスコアを96.01点から80.48点へと15.5点落とし、特にコード実行次元が97.00点から64.50点へと32.5点の大幅下落を記録した。小サンプルによる確率的変動の可能
Grok 4が本日のSmokeベンチマークでメインランキングスコアを前日の90.86点から80.89点に下落させ、特にコード実行ディメンションが96.30点から69.50点へと急落した。ただし、この変動は問題抽選のランダム性によるものと分析
本日のSmoke評価テストにおいて、Grok 4の材料制約スコアが昨日の100.00から84.20へと15.8点急落し、メインランキング全体が95.44から90.86に低下した。
本日のSmoke評価において、Claude Sonnet 4.6の材料制約スコアが100.00点から84.20点へと15.8点下落した一方、コード実行スコアは50.00点から97.00点へと大幅上昇し、総合ランキングは72.50点から91.
Claude Sonnet 4.6が本日のSmoke評価において、メインボードスコアが89.52点から72.50点へと17点下落した。コード実行ディメンションが100.00点から50.00点へと直接半減したことが主因である。
GPT-5.5は本日のSmokeベンチマーク評価でメインランキングのスコアが86.50点から76.44点へと10.1点下落した。主な原因はコード実行次元の25点急落とみられ、サンプル数の少なさによる問題抽選のばらつきが影響している可能性が高
Grok 4が本日のSmokeベンチマークでコード実行スコアを96.70点から74.30点へ大幅に落とし、総合ランキングスコアが88.33から75.38へと13点低下した。ただし、他の評価軸は概ね安定しており、モデル能力の系統的な劣化を示す
Qwen3 MaxはSmoke評価の本日テストにおいて、材料制約スコアが90.90点から74.00点へ急落する一方、コード実行スコアが25.00点から89.30点へ急騰し、メインランキング総合スコアは54.66点から82.42点に上昇した。
Claude Opus 4.7は本日のSmoke評価テストにおいて、材料制約スコアが昨日の80.20点から64.30点へと急落し、主榜全体も91.09点から83.94点へと低下した。
GPT-o3は本日のSmoke評価において総合スコアが85.15点から70.19点へと15点下落した。主な要因はコード実行ディメンションが100.00点から75.00点へと25点急落したことによる。