GPT-5.5がコード実行満点86.95点でSmokeベンチマーク首位、制約面の弱点も露呈
2026年7月3日のSmoke軽量評価において、GPT-5.5がコード実行100点・素材制約71点の組み合わせで主ランキング86.95点を獲得し首位に立った。一方で、素材制約が現行モデル全般の共通課題であることも明らかになった。
2026年7月3日のSmoke軽量評価において、GPT-5.5がコード実行100点・素材制約71点の組み合わせで主ランキング86.95点を獲得し首位に立った。一方で、素材制約が現行モデル全般の共通課題であることも明らかになった。
YZ Index 2026年6月30日 Smoke 軽量評価において、Gemini 3.1 Pro が主榜98.47点で首位を獲得。一方、複数モデルで実行スコアの大幅下落が確認され、Claude Opus 4.7は27.2点減の72.8点に
YZ Index 2026年6月27日のSmoke軽量評価において、Claude Opus 4.7が主榜97.12点で首位を獲得。コード実行100点を達成した一方、材料制約が93.6点にとどまり全体スコアを引き下げた。