Claude Sonnet 4.6、コード実行スコアが22点急落――資料制約は25.7点上昇
本日のSmokeベンチマークにおいて、Claude Sonnet 4.6のコード実行スコアが97.00点から75.00点へと22点急落した一方、資料制約スコアは60.20点から85.90点へと25.7点上昇した。主要ランキングの総合スコアは
本日のSmokeベンチマークにおいて、Claude Sonnet 4.6のコード実行スコアが97.00点から75.00点へと22点急落した一方、資料制約スコアは60.20点から85.90点へと25.7点上昇した。主要ランキングの総合スコアは
本日のSmokeベンチマークにおいて、DeepSeek V4 Proのコード実行スコアが100.00点から75.00点へと25点急落した一方、材料制約スコアは68.20点から95.00点へと26.8点上昇し、総合ランキングのスコアは85.6
DeepSeek V4 ProのSmoke評価において、材料制約スコアが31.8点急落した一方、コード実行スコアは30.5点急上昇し、ほぼ対称的な変動を示した。専門家はこれをモデルの構造的劣化ではなく、サンプリングのランダム性によるものと分
2026年7月23日実施のRun#243 Smokeテストにおいて、GLM-4.6は総合ランキング55.74点を記録。材料制約で93.30点の高得点を挙げた一方、コード実行は25.00点にとどまり、誠実性評価はfail(プローブ30.00点
GLM-4.6は本日のSmoke評価テストにおいて誠実性評価がpassからfailに急落した一方、コード実行スコアが50.00点から97.00点へと47点上昇し、メインランキング総合スコアも62.83点から74.00点に改善した。
GPT-o3が本日のSmokeベンチマークで総合スコアを昨日の96.27点から87.94点へと8.3点落とした。コード実行・工程判断の両次元が大幅に下落し、誠実性評価も「pass」から「warn」に転じた。
本日のSmoke評価において、Claude Opus 4.7のメインスコアが100.00点から73.92点へと26.1ポイント下落した。コード実行・資料制約の両次元で25ポイント以上の降下が確認されたが、小サンプルによる変動の可能性が高いと
Qwen3 MaxがSmoke評価テストのメインランキングで前日比14.9点下落し、特にコード実行次元が31.3点の急落を記録した。誠実性評価もpassからwarnに変化し、明確なリスクシグナルが発生している。
本日のSmoke評価において、Gemini 2.5 Proのコード実行スコアが74.60点から50.00点へと24.6点急落し、メインランキング全体も76.49点から69.98点に低下した。ただし、サンプル数の少なさによる抽選変動が主因と分
GPT-o3が本日のSmokeテストにおいてメインランキングで80.61点から66.86点へ急落し、コード実行スコアが70.30点から48.50点へ単日21.8点の下落を記録した。各次元のスコア変動の原因と利用者への影響を分析する。
DeepSeek V4 Proが本日のSmoke評価においてメインランキングのスコアが93.84点から81.93点へと11.9ポイント下落した。特にコード実行と材料制約の2次元で大幅な低下が確認された。
Doubao ProがSmoke評価テストのメインランキングで86.25点から71.22点に急落し、コード実行次元が75.00点から58.30点へと大幅に低下した。今回の変動は主に問題抽選のランダム性によるものとみられるが、複数のコア次元が
Claude Opus 4.7は本日のSmokeベンチマークにおいて、メインランキングスコアが100.00点から80.09点へと急落した。コード実行と資料制約の両次元が同日に大幅な失点を記録している。
Gemini 3.1 ProがSmokeベンチマーク評価のメインランキングで80.99点から72.50点へ8.5点下落し、特にコード実行次元が75点から50点へ25点の大幅下落を記録した。サンプル数の少なさによる抽選変動が主因とみられる。
DeepSeek V4 ProがSmoke評価のコード実行次元で98.70点から75.00点へと23.7点急落し、メインランキング全体も91.46点から86.25点に下落した。ただし、この変動は問題抽選によるばらつきの可能性が高く、モデルの
DeepSeek V4 ProがSmoke評価のメインランキングで96.99点から80.10点へと16.9点下落した。主な要因はコード実行次元の28点急落であり、サンプル数が少ないことによる問題抽選の変動が主因とみられる。
Claude Opus 4.7はSmoke評価の主要ランキングにおいて96.99点から82.95点へと下落し、コード実行ディメンションが100.00点から69.00点へ31点落ち込んだ。ただし、モデル全体の能力低下ではなく、当日の出題サンプ
Claude Opus 4.7が本日のSmoke評価においてメインランキングスコアを90.51点から71.26点へと19.3点落とした。コード実行と素材制約の2次元が同時に大幅下落した一方、エンジニアリング判断は上昇しており、モデルの真の性
YZ Index 2026年6月のSmokeテストにおいて、Qwen3 Maxのメインランキングスコアが84.92点から72.02点へ12.9ポイント下落し、特にコード実行ディメンションが96.30点から69.50点へ急落した。単日データの
YZ Index 2026年7月4日のSmoke軽量評価(11モデル対象)で、Gemini 2.5 Pro が主榜96.99点で首位を獲得。一方、Qwen3 Max は12.9点急落し72.02点に後退した。