Gemini 2.5 Pro、主榜スコアが18.37から83.39へ急上昇――材料制約スコアは12.1から100点満点に

Gemini 2.5 ProはSmoke評価の本日テストにおいて、主榜スコアが昨日の18.37点から83.39点へ上昇し、コード実行スコアは23.50点から69.80点へ、材料制約スコアは12.10点から100.00点へと上昇した。また、誠実性評価も「fail」から「pass」へと転じた。

データの事実:1日での各スコアの変化

コード実行スコアは昨日23.50点・本日69.80点、材料制約スコアは昨日12.10点・本日100.00点、エンジニアリング判断(サイドランキング、AI補助評価)は24.40点から88.90点へ、タスク表現(サイドランキング、AI補助評価)は50.00点から65.00点へそれぞれ上昇した。主榜はコード実行と材料制約の2つの監査可能なスコアの加重平均のみで構成されているため、本日の83.39点はこの2スコアの同時改善を直接反映している。

原因分析:出題抽選の変動が最も有力な説明

Smoke評価は1日あたりわずか10問(各スコア2問)で構成されており、サンプルサイズが極めて小さい。材料制約スコアが12.10点から満点へと跳ね上がったことは、本日抽選された2問の材料制約問題がいずれも正しく処理されたことを意味する。一方、昨日の出題にはより厳格な制約条件や違反を誘発しやすい境界ケースが含まれていた可能性がある。コード実行スコアにおける46.3点の上昇もまた、小サンプル下での出題難易度のランダム分布によるスコアの激しい変動と合致する。現状のデータにはモデルのパラメータや学習に変化が生じた形跡がないため、今回の上昇をモデルの実力の退化や向上に帰因する根拠は乏しい。

本日の材料制約スコアは100.00点に達した一方、昨日はわずか12.10点であり、その差は87.9点に及ぶ。これは1問あたりのスコア標準偏差から想定される通常の変動幅を大きく超えている。

利用者への示唆

コード実行を重視するチームがモデルを選定する際、Gemini 2.5 ProのSmoke評価におけるコード実行スコアは依然として69.80点にとどまっており、満点には明らかな差があることに留意する必要がある。材料の忠実性に依存するユースケースにおいては、本日このモデルの材料制約スコアが100.00点に達した一方で、昨日の同スコアはわずか12.10点であったことから、1回のテスト結果だけでは長期的なモデル選定の根拠として不十分であることが示されている。

誠実性評価が「fail」から「pass」へと転じたことは、本日の回答が誠実性の閾値を満たしたことを意味するが、この閾値はあくまで参入条件であり、あらゆるシナリオで一貫した出力品質が保たれることを示すものではない。Gemini 2.5 Proを本番環境にデプロイする予定の開発者は、少なくとも連続する3サイクル以上の独立したSmoke評価において誠実性評価が「pass」となることを確認してから、出題抽選の変動による誤判断リスクを軽減すべきである。

戦略的判断

現在のスコア比較に基づくと、Gemini 2.5 Proの今回の主榜スコア上昇は、モデル能力の系統的な変化よりも出題抽選の変動によって引き起こされた可能性が最も高い。エンジニアリング判断とタスク表現の両サイドランキングスコアが同時に上昇していることも、テスト全体の出題難易度分布のランダム性をさらに裏付けている。次回テストでの検証ポイントとして、材料制約とコード実行の出題難易度が近い水準に保たれた場合、Gemini 2.5 Proが引き続き主榜80点以上を維持できるかどうかを重点的に確認することを推奨する。2サイクル連続で同様の大幅な変動が見られた場合は、このモデルの測定安定性を重点観察リストに加える必要がある。

現状のデータは、Gemini 2.5 Proを「材料制約の問題を解決済み」と判定する根拠を支持せず、またコード実行能力に実質的な退化が生じたと判定する根拠も支持しない。唯一確認できる結論は、Smoke評価の1日あたりのサンプルサイズが過小であるため、単一モデルのスコアが日をまたいで主榜で60点を超える変動を示す可能性があり、この変動そのものを継続的に追跡する価値があるという点である。


データソース:YZ Index | Run #289 | 元データを見る