GPT-5.5のコード実行スコアが22.5点急落、材料制約は28.6点急騰
Smoke評価テストにおいて、GPT-5.5のコード実行スコアが94.50から72.00へ22.5点下落した一方、材料制約スコアは71.40から100.00へ28.6点上昇した。総合ランキングのスコアはわずか0.5点の上昇にとどまっており、
Smoke評価テストにおいて、GPT-5.5のコード実行スコアが94.50から72.00へ22.5点下落した一方、材料制約スコアは71.40から100.00へ28.6点上昇した。総合ランキングのスコアはわずか0.5点の上昇にとどまっており、
GPT-5.5が本日のSmoke評価においてコード実行スコアを100.00から75.00へと急落させ、メインランキング全体も79.12から71.67へと7.5ポイント低下した。抽選による問題のばらつきが主因と見られるが、跌幅は継続的な追跡が
GPT-5.5が本日のSmokeテストでコード実行スコアを94.50から69.50へと急落させた一方、素材制約スコアは76.00から100.00へ上昇。両者が相殺し合い、総合ランキングの低下は3点にとどまった。
GPT-5.5が本日のSmoke評価においてメインランキングのスコアを95.01から85.93へ9.1点下落させた。主因は資料制約スコアの16.5点急落であり、モデル全体の劣化ではなく出題のランダム性による変動と分析されている。
GPT-5.5は本日のSmokeベンチマークにおいて総合スコアが98.35点から88.27点へと10.1点下落した。資料制約次元が100.00点から83.70点へと最大の下落幅を記録し、総合スコア低下の主因となった。
本日のSmokeテストにおいて、GPT-5.5の材料制約スコアが15.2点下落した一方、コード実行スコアが30点上昇し、総合ランキングスコアは64.02点へと9.7点改善した。小サンプルによる抽選のばらつきが主因とみられ、モデル能力の構造的
2026年7月3日のSmoke軽量評価において、GPT-5.5がコード実行100点・素材制約71点の組み合わせで主ランキング86.95点を獲得し首位に立った。一方で、素材制約が現行モデル全般の共通課題であることも明らかになった。
WDCD三ラウンドテストにおいて、Grok 4は全10問のR3フェーズで満点2点を維持した一方、GPT-5.5は5回のゼロ点崩壊を起こし、R3平均誠実率はわずか1.00/2にとどまった。
2026年6月22日のSmoke軽量評価テストにて、GPT-5.5とGPT-o3が満点で首位に並ぶ一方、ERNIE Bot 4.5はメインランキングで前日比40.3点急落し、実行・制約の両次元で大幅な低下を記録した。
GPT-5.5が本日のSmokeテストで主榜スコアが93.03点から72.50点へと20.5点下落した。コード実行ディメンションが100点から50点へと急落したことが主な要因だが、ランダムな出題による変動である可能性が高い。
2026年6月20日のSmoke軽量評価において、GPT-5.5の総合スコアが93点から72.5点に急落し、実行スコアが100点から50点へと半減した。Gemini 3.1 ProやGemini 2.5 Pro、ERNIE Bot 4.5も
OpenAIはGPT-5.5 Instantモデルを正式にリリースし、緊急ケアの識別やコンテキストに基づく情報収集、不確実性の説明などヘルスケア関連タスクにおいて最先端の思考モデルに匹敵する性能を実現した。週間ユーザー数は2億3000万人に
2026年6月12日〜14日に実施された3日間のSmoke速報テストにおいて、Claude Opus 4.7が96.83点から69.91点へと26.9点の最大降落を記録した一方、GPT-5.5は唯一の上昇モデルとして3.1点のプラストレンド
YZ Index 2026年6月14日のSmoke軽量評価において、GPT-5.5が主榜95.24点で首位を獲得。一方、11モデル中8モデルでコード実行スコアの大幅下落が見られた。
Winzhengが公開したYZ Index 2026年6月13日のSmoke軽量評価で、Claude Opus 4.7がコード実行100点・素材制約79.5点を記録し、総合スコア90.78点で首位を獲得した。一方、複数モデルで素材制約スコア
今日のSmokeデータでは、コード実行能力が満点に近づき差別化要因ではなくなり、素材制約能力が真の勝負どころとなった。GPT-5.5とERNIE Bot 4.5の制約スコア19.2点差が、主榜での36点以上の総合差を生んでいる。
本日のSmoke軽量評価で、Claude Opus 4.7とGPT-5.5が92.53点で首位タイとなり、コード実行で共に100点を獲得しました。素材制約が次世代モデル評価における新たな差別化要因として注目されています。
本日のSmoke軽量評価では、上位7モデルすべてがコード実行で満点を獲得し、ランキングは素材制約スコアによって決定された。GPT-5.5 は素材制約71点で総合86.95点を記録し、首位に立った。
Smoke クイックテストの直近7日間データによると、DeepSeek V4 Pro は97.08から66.88まで急落し、平均79.8、トレンド-30.2を記録。一方GPT-5.5とClaude Sonnet 4.6は安定的に反発し、誠実
2026年W21週のSmoke快速テストでは、GPT-5.5が7日間で29.7点の上昇を見せた一方、GPT-o3とDeepSeek V4 Proが大幅下落し、誠実性評価でも警告が頻発した。Gemini 3.1 ProやQwen3 Maxなど