Gemini 2.5 Proは本日のSmokeベンチマークにおいて、素材制約スコアが昨日の100.00点から72.00点へ28点下落した。一方、コード実行スコアは71.90点から100.00点へ上昇し、総合スコアは84.55点から87.40点へ改善した。
スコア変動の事実
今回のベンチマークは1日10問のみをカバーし、コード実行と素材制約はそれぞれ2問ずつ出題された。素材制約は1日で28点を失ったが、エンジニアリング判断は100.00点を維持し、タスク表現は81.70点から91.70点へ上昇、誠実性評価はpassを維持した。総合スコアはコード実行と素材制約の2軸による加重で構成されており、本日は正味2.9点増加した。
問題の抽選による変動か、モデルの劣化か
Smokeベンチマークの問題は毎日ランダムに抽選されるため、1軸あたり2問という規模では1問あたりのスコアウェイトが極めて高い。素材制約は昨日が満点、本日が72点であり、その差はちょうど1問分の失点に対応している。コード実行も昨日71.90点、本日満点という結果は同様に1問分の得点押し上げと一致する。エンジニアリング判断とタスク表現に同期した下落は見られず、モデル全体の出力フレームに崩壊がないことを示している。素材制約の1軸のみで−28点が生じたことは、問題における素材忠実度要求のランダムな強化を示唆しており、モデルのパラメータレベルの劣化ではない。
素材制約とコード実行の反対方向への激しい変動は、10問の簡易テストにおける典型的なサンプリング効果である。
利用者への具体的な影響
素材制約に依存するシナリオには、長文書の要約、契約条項の照合、引用元の追跡タスクなどが含まれる。Gemini 2.5 Proの本日の72点という結果は、こうしたシナリオで素材の欠落や書き換えが発生する確率が上昇することを意味する。コード実行を重視するチームは100点の結果から直接恩恵を受けられ、アルゴリズムのデバッグやデータ処理系タスクにおける本日の利用適性は高い。両方のシナリオが共存する企業は、同一モデルに対して二重の検証プロセスを用意する必要がある。
戦略的判断
総合スコアは依然87.40点の水準を維持しており、単一軸での28点の変動が全体的な順位に影響を与えていないことを示している。同一モデルの素材制約スコアの標準偏差を複数日にわたって観察することで、サンプリングノイズと実際の能力ドリフトを区別できる。現時点では単日データのみが「抽選による変動」という結論を支持しており、長期的な選定優先度を引き下げるべき閾値には達していない。次回のSmokeベンチマークでも素材制約が85点を下回る場合は、長文テキストを対象とした専門的な検証テストを開始する必要がある。
エンジニアリング判断とタスク表現という2つのサブスコア軸が安定または上昇を維持していることは、主因が素材制約問題のランダムな難易度にあり、モデルの汎用能力の低下ではないことをさらに裏付けている。企業がモデル選定を行う際には、Gemini 2.5 Proの素材制約パフォーマンスを高分散シグナルとして捉え、重要な実運用シナリオでは人手によるサンプルチェックの割合を増やすことが望ましい。
データ出典:YZ Index | Run #358 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接