GPT-5.5、材料制約スコアが15.2点急落・コード実行は30点上昇――総合ランキングは9.7点改善
本日のSmokeテストにおいて、GPT-5.5の材料制約スコアが15.2点下落した一方、コード実行スコアが30点上昇し、総合ランキングスコアは64.02点へと9.7点改善した。小サンプルによる抽選のばらつきが主因とみられ、モデル能力の構造的
本日のSmokeテストにおいて、GPT-5.5の材料制約スコアが15.2点下落した一方、コード実行スコアが30点上昇し、総合ランキングスコアは64.02点へと9.7点改善した。小サンプルによる抽選のばらつきが主因とみられ、モデル能力の構造的
DeepSeek V4 ProのSmokeベンチマークにおける材料制約スコアが前日の89.50点から70.00点へと急落し、総合スコアも94.07点から86.50点に低下した。ただし、コード実行は満点に達しており、モデル全体の系統的な劣化と
Claude Opus 4.7が本日のSmoke評価においてメインランキングスコアを90.51点から71.26点へと19.3点落とした。コード実行と素材制約の2次元が同時に大幅下落した一方、エンジニアリング判断は上昇しており、モデルの真の性