Gemini 2.5 Proは本日のSmoke評価において、コード実行スコアが100.00点から75.00点へと急落し、総合ランキングも88.75点から81.53点へと低下した。
データの詳細分析
スコア比較によると、コード実行が25点下降し、エンジニアリング判断も同様に25点下降して50.00点となった。一方、タスク表現は8.3点上昇して90.00点、素材制約は14.5点上昇して89.50点となった。総合ランキングは全体で7.2点低下。誠実性評価はpassを維持した。
原因分析
Smoke評価は1日あたり10問のみで、各次元につき2問とサンプル数が少なく、出題の抽選によるばらつきが最も有力な原因として考えられる。コード実行とエンジニアリング判断が同時に25点下落したことは、今回抽選された問題が、複雑なコードパスや制約条件下でのモデルの処理の非一貫性を集中的に露呈した可能性を示唆している。素材制約とタスク表現のスコアが上昇していることから、テキストの忠実度や表現の明確さにおいてモデルに系統的な劣化は生じていないと判断できる。
実際のモデル劣化の可能性は低い。単日のデータでは継続的な結論を導くには不十分であり、2つの次元が同時に下落したことは、パラメータレベルの変化よりも小サンプルによるランダム性に合致する。エンジニアリング判断はサブランキングの次元としてコード実行との関連性が高く、両者が同幅で変動したことは、モデル全体の能力低下よりも問題の特性を指し示すものである。
利用者への示唆
コード実行を重視するチームがGemini 2.5 Proを使って多段階デバッグやアルゴリズム実装を行う際には、人によるレビュー工程を追加する必要がある。今回の75.00点という水準は昨日の基準値100.00点を大きく下回っており、同種のタスクでエラーが発生する確率が上昇していることを意味する。素材制約スコアが89.50点に上昇したことは、入力指示への厳密な遵守が求められるシナリオにおいて、むしろより安定した出力を提供することを示している。
開発者がGemini 2.5 Proを統合する際には、コード実行タスクを優先的に他のモデルに割り当てるか、プロンプト内で制約条件を強化してばらつきの影響を軽減することを検討すべきである。エンジニアリング判断が50.00点であることは、モデルの技術的ソリューションの優劣を評価する能力に顕著な不安定さが生じていることを示しており、この判断に基づいてアーキテクチャの意思決定を行うシナリオでは慎重を期す必要がある。
戦略的判断
単日の比較に基づくと、Gemini 2.5 Proのコード実行能力は今回の出題抽選によって影響が誇張されており、実際の劣化を示す証拠は不十分である。総合ランキング81.53点は依然として実用可能な範囲にあるが、同種の次元で2日連続して大幅なばらつきが生じた場合には重点的な検証が必要となる。素材制約とタスク表現の上昇は、モデルが非コード次元において安定性を維持していることを示している。
次回のSmoke評価ではコード実行とエンジニアリング判断が回復するかどうかを重点的に観察することを推奨する。両次元が継続して80点を下回る場合には、このカテゴリのタスクにおけるモデルの実際の安定性が低下していることを検討する必要がある。現時点のデータはGemini 2.5 Proの総合能力の引き下げという結論を支持するものではなく、コード集約的なシナリオにおいて冗長な検証を追加することを示唆するにとどまる。
データ出典:YZ Index | Run #318 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接