GPT-o3のSmokeベンチマーク総合スコアが1日で9点急落——資料制約ディメンションが20点下落
GPT-o3の本日のSmokeベンチマーク総合スコアが96.93点から87.93点へ9点下落した。主因は資料制約ディメンションが95.00点から75.00点へ20点急落したことによる。
GPT-o3の本日のSmokeベンチマーク総合スコアが96.93点から87.93点へ9点下落した。主因は資料制約ディメンションが95.00点から75.00点へ20点急落したことによる。
Qwen3 MaxのSmokeベンチマーク総合スコアが前日の95.34点から86.98点へ8.4点下落し、とりわけ材料制約スコアが1日で16.5点という大幅な落ち込みを記録した。コード実行スコアは比較的安定を維持している。
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが100.00点から75.00点へと25点下落し、総合ランキングも80.52点から75.00点に後退した。ただし、サンプル数が少ないため、モデルの能力が
Claude Opus 4.7の本日のSmokeベンチマークでは、コード実行スコアが99.60点から75.00点に低下した一方、素材制約スコアが61.70点から100.00点に上昇し、総合ランキングのスコアは82.55点から86.25点へと
DeepSeek V4 ProはSmokeテストにおいてコード実行次元のデータが完全に欠損し、素材制約スコアは55.60点にとどまった。メインランキングへの参加は不可能となっており、原因はモデル能力の低下ではなくAPIの障害と分析されている
本日のSmokeテストにおいて、GPT-5.5の材料制約スコアが15.2点下落した一方、コード実行スコアが30点上昇し、総合ランキングスコアは64.02点へと9.7点改善した。小サンプルによる抽選のばらつきが主因とみられ、モデル能力の構造的
Qwen3 MaxのSmoke評価における本日の主要ランキングスコアが96.04点から85.82点へと10.2点下落した。資料制約次元が21.5点という大幅な下落を記録したことが主な要因となっている。
DeepSeek V4 ProのSmokeベンチマークにおける材料制約スコアが前日の89.50点から70.00点へと急落し、総合スコアも94.07点から86.50点に低下した。ただし、コード実行は満点に達しており、モデル全体の系統的な劣化と
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが94.50点から75.00点へと19.5点下落した一方、資料制約スコアは43.30点から97.80点へと急上昇し、メインランキング総合スコアは71.4
本日のSmoke評価において、Grok 4のマテリアル制約スコアが82.60点から65.00点へと17.6点急落した一方、総合ランキングは82.99点から81.23点へと1.8点の小幅な低下にとどまった。
GLM-4.6の本日のSmokeテストでは、資料制約71.90点・エンジニアリング判断63.90点・タスク表現50.00点を記録したが、APIの障害またはタイムアウトによりコード実行と誠実性の2次元のデータが完全に欠損し、メインランキングへ
GLM-4.6は本日のSmokeテスト評価においてAPI障害・タイムアウトにより「実行(execution)」と「判断(judgment)」の2次元データが欠損し、自動再実行待ちのため今回のメインランキングには参加しない。材料制約次元は51
本日のSmokeベンチマークにおいて、GLM-4.6の材料制約スコアが75.00点から47.70点へ下落した一方、コード実行スコアが100点満点を記録し、メインランキングは46.29点から76.47点へと上昇した。誠実性評価はpassからw
GPT-o3が本日のSmokeベンチマーク主要ランキングで79.28点を記録し、昨日の93.16点から13.9ポイント下落した。コード実行と資料制約の両次元で13ポイント以上の下落が見られたが、小サンプルによる抽選変動が主因とみられる。
Qwen3 MaxはSmoke評価において、材料制約スコアが前日の67.70点から47.70点へ20点急落した一方、コード実行スコアは54.70点から92.50点へ37.8点急騰し、メインランキング総合スコアは60.55点から72.34点へ
DeepSeek V4 ProのSmokeテストにおいて、コード実行スコアが前日の100.00から75.00へと25点急落し、総合スコアも83.53から76.85へと下落した。ただし、現時点のデータはモデルの実質的な性能劣化を示すものではな
Grok 4が本日のSmoke評価テストにおいてメインスコアを89.30点から78.01点へと11.3点落とした。主因は資料制約次元の単日18点下落であり、サンプル数の少なさによる抽選変動の可能性が高い。
DeepSeek V4 ProのSmoke評価において、材料制約スコアが31.8点急落した一方、コード実行スコアは30.5点急上昇し、ほぼ対称的な変動を示した。専門家はこれをモデルの構造的劣化ではなく、サンプリングのランダム性によるものと分
GPT-o3が本日のSmokeベンチマークにおいて、コード実行スコアを44.50点から97.00点へと大幅に伸ばした一方、素材制約スコアは100.00点から84.30点へ低下した。総合ランキングスコアは69.48点から91.29点へと21.
2026年7月23日実施のRun#243 Smokeテストにおいて、GLM-4.6は総合ランキング55.74点を記録。材料制約で93.30点の高得点を挙げた一方、コード実行は25.00点にとどまり、誠実性評価はfail(プローブ30.00点