Gemini 3.1 Proは本日のSmoke評価において、メインランキングのスコアが80.99点から72.50点へと低下し、下落幅は8.5点に達した。
コア次元のスコア変化
コード実行次元は昨日の75.00点から本日の50.00点へと25点下落した。一方、素材制約次元は88.30点から100.00点へと11.7点上昇した。エンジニアリング判断(サイドランキング、AI補助評価)は100.00点から75.00点へ低下し、タスク表現(サイドランキング、AI補助評価)は76.70点から66.70点へ低下した。誠実性評価はpassを維持した。
変動要因の分析
Smoke評価は1日あたりわずか10問、各次元2問のみで、サンプル数が極めて少ない。コード実行次元における1日25点の下落は、抽選された問題の難易度上昇、またはモデルが特定のコードシナリオで一貫性のない出力をした可能性が最も高い。素材制約次元が同時に満点に上昇したことは、モデルの引用制約に関するパフォーマンスが系統的に低下していないことを示しており、両次元の逆方向の変動は、モデル全体の能力低下ではなく問題の抽選変動を示唆している。
エンジニアリング判断(サイドランキング、AI補助評価)とタスク表現(サイドランキング、AI補助評価)が同時に低下したことは、エンジニアリングのトレードオフとタスク記述を必要とする問題におけるスコアの変動が拡大していることを反映している。安定性次元の計算式 max(0, 100-stddev×2) は、このモデルの同種問題におけるスコアの標準偏差が大きいことをすでに示唆しており、今回の1日での複数次元の変動は安定性スコア31.7点というシグナルと一致している。
利用者への具体的な意味
コード実行を重視するチームがGemini 3.1 Proを採用する際は、冗長な検証ステップを追加する必要がある。本日の50.00点は、2問のコード問題がいずれも基準を満たさなかった可能性を意味する。素材の忠実度に依存するシナリオは引き続き使用可能であり、本日の100.00点は制約能力が依然として高水準にあることを示している。
エンジニアリング判断とタスク表現を同時に必要とする複合ワークフローについては、75.00点と66.70点がもたらす出力のばらつきを避けるため、本番環境に人的レビューのノードを追加することを推奨する。
戦略的判断
現在のスコア比較に基づくと、Gemini 3.1 Proのコード実行能力は1日の抽選によって誇張されており、真の能力低下を示す証拠は不十分である。ただし、コード実行スコアが2日連続で60点を下回った場合は、次回の優先検証が必要となる。素材制約が満点を維持していることは、この次元が依然としてモデルの相対的な強みであることを示している。メインランキングの72.50点は昨日を下回っており、モデル選定の際は単日の結果ではなく複数日の平均スコアを基準とすべきである。
データソース:YZ Index | Run #232 | 生データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接