Gemini 2.5 Pro、主榜スコアが18.37から83.39へ急上昇――材料制約スコアは12.1から100点満点に
Gemini 2.5 ProがSmoke評価の本日テストで主榜スコアを18.37点から83.39点へと大幅に更新し、材料制約スコアは12.10点から100.00点の満点に到達した。ただし、この急上昇は1日あたり10問という極めて小さいサンプ
Gemini 2.5 ProがSmoke評価の本日テストで主榜スコアを18.37点から83.39点へと大幅に更新し、材料制約スコアは12.10点から100.00点の満点に到達した。ただし、この急上昇は1日あたり10問という極めて小さいサンプ
GPT-5.5は本日のSmokeベンチマークにおいて総合スコアが98.35点から88.27点へと10.1点下落した。資料制約次元が100.00点から83.70点へと最大の下落幅を記録し、総合スコア低下の主因となった。
Claude Opus 4.7は本日のSmoke評価テストで総合スコアが98.35点から90.16点へと8.2点下落した。主な要因は資料制約スコアの100.00点から87.90点への急落(-12.1点)と、コード実行スコアの97.00点から
Doubao ProはSmokeテストにおいて材料制約スコアが90.90点から50.00点へと40.9点急落し、総合ランキングが82.16点から77.50点に低下した。一方、コード実行スコアは75.00点から100.00点へ上昇しており、変
GPT-o3の本日のSmokeベンチマーク総合スコアが96.93点から87.93点へ9点下落した。主因は資料制約ディメンションが95.00点から75.00点へ20点急落したことによる。
Doubao ProがSmoke評価テストにおいて、主要ランキングのスコアを94.74点から82.16点へと12.6ポイント落とし、特にコード実行ディメンションが100.00点から75.00点へと25ポイント急落した。ただし、サンプル数の少
Qwen3 MaxのSmokeベンチマーク総合スコアが前日の95.34点から86.98点へ8.4点下落し、とりわけ材料制約スコアが1日で16.5点という大幅な落ち込みを記録した。コード実行スコアは比較的安定を維持している。
DeepSeek V4 ProがSmoke評価のメインランキングで70.44点から51.24点へと19.2点下落した。主な原因はコード実行ディメンションが66.70点から25.00点へと41.7点急落したことにある。
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが100.00点から75.00点へと25点下落し、総合ランキングも80.52点から75.00点に後退した。ただし、サンプル数が少ないため、モデルの能力が
Claude Opus 4.7の本日のSmokeベンチマークでは、コード実行スコアが99.60点から75.00点に低下した一方、素材制約スコアが61.70点から100.00点に上昇し、総合ランキングのスコアは82.55点から86.25点へと
DeepSeek V4 ProはSmokeテストにおいてコード実行次元のデータが完全に欠損し、素材制約スコアは55.60点にとどまった。メインランキングへの参加は不可能となっており、原因はモデル能力の低下ではなくAPIの障害と分析されている
本日のSmokeテストにおいて、GPT-5.5の材料制約スコアが15.2点下落した一方、コード実行スコアが30点上昇し、総合ランキングスコアは64.02点へと9.7点改善した。小サンプルによる抽選のばらつきが主因とみられ、モデル能力の構造的
Gemini 2.5 ProのSmoke評価における本日の総合スコアが昨日の88.53点から79.41点へと9.1ポイント下落した。主な要因はコード実行スコアの単日29.6ポイント急落である。
GLM-4.6が本日のSmoke評価でメインランキング79.38点を記録。コード実行は62.50点に下落した一方、資料制約は100.00点の満点を獲得し、誠実性評価はfailからpassに転換した。
GLM-4.6は本日のSmoke評価において、誠実性評価がPassからFailに転落し、タスク表現スコアが45.00点から20.00点へと大幅に低下した。一方でコード実行スコアの上昇により、メインランキングのスコアは61.25点から74.0
Qwen3 MaxのSmoke評価における本日の主要ランキングスコアが96.04点から85.82点へと10.2点下落した。資料制約次元が21.5点という大幅な下落を記録したことが主な要因となっている。
DeepSeek V4 ProのSmokeベンチマークにおける材料制約スコアが前日の89.50点から70.00点へと急落し、総合スコアも94.07点から86.50点に低下した。ただし、コード実行は満点に達しており、モデル全体の系統的な劣化と
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが94.50点から75.00点へと19.5点下落した一方、資料制約スコアは43.30点から97.80点へと急上昇し、メインランキング総合スコアは71.4
本日のSmoke評価において、Grok 4のマテリアル制約スコアが82.60点から65.00点へと17.6点急落した一方、総合ランキングは82.99点から81.23点へと1.8点の小幅な低下にとどまった。
GLM-4.6の本日のSmokeテストでは、資料制約71.90点・エンジニアリング判断63.90点・タスク表現50.00点を記録したが、APIの障害またはタイムアウトによりコード実行と誠実性の2次元のデータが完全に欠損し、メインランキングへ