Gemini 3.1 Proは本日のSmoke評価テストにおいて、メインランキングスコアが昨日の96.60点から85.83点へと低下し、下落幅は10.8ポイントに達した。
主要次元の変化内訳
コード実行次元は99.30点から91.50点へと7.8ポイント低下。素材制約次元は93.30点から78.90点へと14.4ポイント低下。エンジニアリング判断(サブランキング、AI補助評価)は75.00点から50.00点へと25ポイント低下。タスク表現は85.00点から91.70点へと6.7ポイント上昇。誠実性評価はpassを維持。
データの事実と考えられる要因
Smoke評価テストは1日あたり10問(次元ごとに2問)であり、単日の変動は正常範囲内とされる。ただし、素材制約次元が単日で14.4ポイント下落したことはコード実行の7.8ポイントを大きく上回っており、今回の抽出問題がモデルの素材忠実度における弱点を集中的に露呈した可能性を示唆している。エンジニアリング判断(サブランキング、AI補助評価)の25ポイント下落も、エンジニアリング上のトレードオフを要するシナリオで明確なミスが発生したことを示している。
一方、タスク表現次元が6.7ポイント上昇したことは、モデルのタスク陳述の明確さが全体的に低下していないことを意味する。これら二つの逆方向の変化は、モデルの実質的な退化ではなく、問題抽出における変動を示唆している。素材制約とエンジニアリング判断が同時に大幅下落した最も可能性の高い原因は、当日の問題に素材の境界を厳密に遵守すること、または多要素のエンジニアリングトレードオフを要するケースが含まれていたにもかかわらず、Gemini 3.1 Proがこれらの具体的なケースで昨日の水準を維持できなかったことである。
利用者への示唆
法的契約の抽出、製品仕様の照合、研究文献の要約など、素材制約を重視するシナリオにおいて、Gemini 3.1 Proの本日のパフォーマンスはリスクの上昇を示している。高い根拠付け精度を必要とするパイプラインに同モデルを使用している開発者は、人手による検証ステップを追加するか、素材制約がより安定したモデルへの切り替えを検討する必要がある。
コード実行への依存度が高いチームにとっても、7.8ポイントの下落は素材制約ほどではないが、複数日にわたって継続するかどうかを引き続き注視する必要がある。エンジニアリング判断(サブランキング、AI補助評価)が50点まで低下したことは、アーキテクチャ上の意思決定やトレードオフ分析タスクにおける現在の出力信頼性が低下していることを意味し、本番環境での意思決定への直接利用は当面避けることを推奨する。
戦略的判断
今回のメインランキング10.8ポイントの下落は主に素材制約とエンジニアリング判断によって引き起こされており、タスク表現の上昇はモデル全体の能力が体系的に低下したわけではないことを示している。短期的には問題抽出の変動と見なせるが、素材制約の14.4ポイント下落はすでに追跡が必要な閾値に達している。
次回の評価で素材制約が90点以上に回復しない場合、Gemini 3.1 Proの根拠付け能力に新たなボトルネックが存在するかどうかを検討する必要がある。現在のデータが支持する判断は、素材制約が重要なシナリオではGemini 3.1 Proへの依存を当面低下させ、コード実行シナリオについては引き続き観察を続けるというものである。
データ出典:YZ Index | Run #300 | 元データを確認
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接