Gemini 2.5 Proは本日のSmoke評価において、コード実行スコアが74.60点から50.00点へと24.6点下落し、メインランキング全体も76.49点から69.98点に低下した。
スコア変動の詳細
資料制約スコアは78.80点から94.40点へと15.6点上昇。エンジニアリング判断は75.00点から88.90点へと13.9点上昇。タスク表現は51.70点からわずかに50.00点に低下。誠実性評価はpassを維持した。
変動要因の分析
Smoke評価は1日あたり各ディメンション2問のみで、サンプル数が極めて少ない。コード実行ディメンションの2問中1問で完全失点が発生した場合、1日あたり約25点規模の変動が生じうる。本日の50.00点はちょうど2問とも基準未達となる最低区間に相当しており、無作為抽選による極端な結果と整合している。
資料制約が同時に15.6点上昇していることは、別の2問の資料忠実度タスクでモデルがより良いパフォーマンスを発揮したことを示している。2つのディメンションが逆方向に変化していることは、モデルパラメータレベルの劣化ではなく、出題内容の差異を示唆している。エンジニアリング判断も同時に13.9点上昇しており、抽選変動という説明をさらに裏付けている。
ユーザーへの示唆
コード実行に強く依存するチームは、本日においてGemini 2.5 Proの生成結果に人手による検証工程を追加する必要がある。特に多段階推論やAPI呼び出しを伴うシナリオでは注意が必要だ。資料制約スコアが94.40点であることは、入力文書への厳格な準拠が求められるタスクにおいて、このモデルが依然として高い可用性を維持していることを示している。
開発者がモデルを選定する際、コード実行の50.00点は単日の極端値として捉えるべきであり、新たな基準値とみなすべきではない。真の安定性を判断するには、同一ディメンションのスコア標準偏差を複数日にわたって継続観察する必要がある。
戦略的判断
現時点の比較データに基づくと、Gemini 2.5 Proのコード実行能力の低下は、モデルの真の劣化ではなく、出題抽選による一時的な落ち込みである可能性が高い。メインランキングの69.98点は昨日を下回ったが、資料制約とエンジニアリング判断の同時上昇は、全体的な能力分布が依然として正常な範囲内にあることを示している。
次回の評価では、コード実行スコアが70点以上に回復するかどうかを重点的に検証する必要がある。2日連続で50点前後を維持した場合には、システム的な問題が発生していないかをさらに調査する必要がある。現時点のシグナルは注視を促すものにとどまり、長期評価を引き下げる根拠にはならない。
データ出典:YZ Index | Run #238 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接