Gemini 2.5 Proは本日のSmoke評価において、総合スコアが昨日の88.53点から79.41点へと9.1ポイント下落した。
コアデータの内訳
総合スコアはコード実行と資料制約の2項目の加重平均のみで構成される。本日のコード実行スコアは70.00点で、昨日の99.60点から29.6ポイント下落。資料制約スコアは90.90点で、昨日の75.00点から15.9ポイント上昇した。この2項目が一方は上昇・一方は下落したことにより、総合スコアは正味9.1ポイントの下落となった。エンジニアリング判断とタスク表現はサイドランキング(AI補助評価)に属し、本日それぞれ100.00点・65.00点に上昇したが、総合ランキングには算入されない。
原因分析:抽選による変動か、真の性能劣化か
Smoke評価は1日あたり10問のみで、各項目2問ずつ出題される。コード実行項目のスコアが単日で99.60点から70.00点へ下落したことは、2問のうち少なくとも1問で明らかな失敗または満点基準未達があったことを意味する。この程度の変動幅は、少数サンプルの抽選において問題の難易度がランダムに分布した結果として十分起こり得るものであり、モデルの能力が構造的に劣化したとは断言できない。資料制約スコアが同時に15.9ポイント上昇したことも、当日の問題抽選が各項目に異なる方向で影響を与えたことを裏付けている。誠実性評価は「合格(pass)」を維持しており、回答の一貫性に問題は見られなかった。
ユーザーへの具体的な示唆
コード実行に大きく依存するチームは注意が必要だ。Gemini 2.5 Proは本日のコード実行2問において70.00点しか獲得できておらず、アルゴリズム実装・デバッグ・多段階推論のシナリオで高い失敗確率が生じることを示している。一方、資料制約スコアが90.90点に改善したことは、引用元の明示や幻覚の回避において同モデルのパフォーマンスが向上していることを示しており、出力の忠実性が重視されるドキュメント生成タスクに適している。サイドランキングのエンジニアリング判断100.00点は、工学的意思決定問題において高水準を維持していることを示すが、タスク表現の65.00点は依然として低い水準にあり、複雑な指示への対応能力には改善の余地がある。
戦略的判断
本日のデータに基づけば、総合スコアの下落はコード実行という単一項目の極端な変動によって主導されたものであり、全項目の同時下落ではない。1日あたり2問というサンプル数は過少であり、単日マイナス29.6ポイントをもってモデルの真の性能劣化と判定するには不十分だ。ただし、同一項目のスコアが2日連続で85点を下回った場合は、優先度を上げて注視する必要がある。次回の評価ではコード実行項目の問題タイプ分布を重点的に検証し、ランダムな変動と能力変化を区別することを推奨する。
データ出典:YZ Index | Run #277 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接