Doubao Pro、材料制約スコアが1日で40.9点下落——コード実行は25点上昇、総合ランキングは4.7点低下
Doubao ProはSmokeテストにおいて材料制約スコアが90.90点から50.00点へと40.9点急落し、総合ランキングが82.16点から77.50点に低下した。一方、コード実行スコアは75.00点から100.00点へ上昇しており、変
Doubao ProはSmokeテストにおいて材料制約スコアが90.90点から50.00点へと40.9点急落し、総合ランキングが82.16点から77.50点に低下した。一方、コード実行スコアは75.00点から100.00点へ上昇しており、変
Doubao ProがSmoke評価テストにおいて、主要ランキングのスコアを94.74点から82.16点へと12.6ポイント落とし、特にコード実行ディメンションが100.00点から75.00点へと25ポイント急落した。ただし、サンプル数の少
DeepSeek V4 ProがSmoke評価のメインランキングで70.44点から51.24点へと19.2点下落した。主な原因はコード実行ディメンションが66.70点から25.00点へと41.7点急落したことにある。
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが100.00点から75.00点へと25点下落し、総合ランキングも80.52点から75.00点に後退した。ただし、サンプル数が少ないため、モデルの能力が
Claude Opus 4.7の本日のSmokeベンチマークでは、コード実行スコアが99.60点から75.00点に低下した一方、素材制約スコアが61.70点から100.00点に上昇し、総合ランキングのスコアは82.55点から86.25点へと
Gemini 2.5 ProのSmoke評価における本日の総合スコアが昨日の88.53点から79.41点へと9.1ポイント下落した。主な要因はコード実行スコアの単日29.6ポイント急落である。
GLM-4.6が本日のSmoke評価でメインランキング79.38点を記録。コード実行は62.50点に下落した一方、資料制約は100.00点の満点を獲得し、誠実性評価はfailからpassに転換した。
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが94.50点から75.00点へと19.5点下落した一方、資料制約スコアは43.30点から97.80点へと急上昇し、メインランキング総合スコアは71.4
Claude Opus 4.7が本日のSmokeベンチマークでコード実行スコアが100.00点から69.50点に急落した一方、素材制約スコアと工学的判断スコアは大幅に上昇し、主要ランキングの低下は6.4点にとどまった。スコア変動の主な原因は
本日のSmoke評価において、Grok 4のマテリアル制約スコアが82.60点から65.00点へと17.6点急落した一方、総合ランキングは82.99点から81.23点へと1.8点の小幅な低下にとどまった。
GLM-4.6が本日のSmoke評価でメインランキング74.00点を記録。コード実行82.30点・素材制約95.00点を獲得したものの、API障害・タイムアウトにより2つのディメンションのデータが欠損し、今回のランキングには参加しない。
GPT-o3が本日のSmokeベンチマーク主要ランキングで79.28点を記録し、昨日の93.16点から13.9ポイント下落した。コード実行と資料制約の両次元で13ポイント以上の下落が見られたが、小サンプルによる抽選変動が主因とみられる。
Qwen3 MaxはSmoke評価において、材料制約スコアが前日の67.70点から47.70点へ20点急落した一方、コード実行スコアは54.70点から92.50点へ37.8点急騰し、メインランキング総合スコアは60.55点から72.34点へ
本日のSmokeテストにおいて、Grok 4のコード実行スコアが92.00点から72.50点へ19.5点急落した一方、資料制約スコアは60.90点から84.10点へ23.2点上昇し、総合ランキングスコアは78.01点から77.72点へわずか
DeepSeek V4 ProのSmokeテストにおいて、コード実行スコアが前日の100.00から75.00へと25点急落し、総合スコアも83.53から76.85へと下落した。ただし、現時点のデータはモデルの実質的な性能劣化を示すものではな
本日のSmokeベンチマークにおいて、Claude Sonnet 4.6のコード実行スコアが97.00点から75.00点へと22点急落した一方、資料制約スコアは60.20点から85.90点へと25.7点上昇した。主要ランキングの総合スコアは
本日のSmokeベンチマークにおいて、DeepSeek V4 Proのコード実行スコアが100.00点から75.00点へと25点急落した一方、材料制約スコアは68.20点から95.00点へと26.8点上昇し、総合ランキングのスコアは85.6
DeepSeek V4 ProのSmoke評価において、材料制約スコアが31.8点急落した一方、コード実行スコアは30.5点急上昇し、ほぼ対称的な変動を示した。専門家はこれをモデルの構造的劣化ではなく、サンプリングのランダム性によるものと分
2026年7月23日実施のRun#243 Smokeテストにおいて、GLM-4.6は総合ランキング55.74点を記録。材料制約で93.30点の高得点を挙げた一方、コード実行は25.00点にとどまり、誠実性評価はfail(プローブ30.00点
GLM-4.6は本日のSmoke評価テストにおいて誠実性評価がpassからfailに急落した一方、コード実行スコアが50.00点から97.00点へと47点上昇し、メインランキング総合スコアも62.83点から74.00点に改善した。