Gemini 2.5 Pro、誠実性評価でfail——プローブスコア25点、主要ランキング18.37点、コード実行23.50点

Gemini 2.5 ProはYZ Indexの2026-08-21 Run#288スモークテストにおいて、誠実性評価が直接failとなり、プローブスコアはわずか25.00点、主要ランキングスコアは18.37点、コード実行は23.50点、資料制約は12.10点という結果に終わった。この結果は同日の他モデルと比較して際立った対比をなしている。

スコア構造の分解

主要ランキングはコード実行と資料制約の2次元のみで構成される。Gemini 2.5 Proはいずれの次元も低水準であり、コード実行23.50点、資料制約12.10点となった。資料制約のスコアがコード実行を下回っており、長文書の引用検証タスクにおいてより深刻な問題があることを示している。誠実性failは42個のカナリアプローブによって引き起こされており、プローブスコア25.00点は上記2次元とは独立している。

同日の他モデルを参照値として示すと、DeepSeek V4 Proはプローブ90.00点、Claude Opus 4.7はプローブ80.00点、GPT-5.5はプローブ80.00点、Grok 4はプローブ70.00点であった。Gemini 2.5 Proの25.00点は当日の最低値である。

プローブ発動メカニズムの分析

誠実性評価failは、42個の架空エンティティプローブにおいて、モデルが存在しない引用や情報源を実在するコンテンツとして出力したことを意味する。資料制約12.10点はさらに、指定された長文書が与えられた場合でも、モデルが資料に厳密に基づいて回答し正確に引用することが困難であることを示している。この2つの低スコアが同時に現れたことは、単一タスクの難易度によるものではなく、引用生成プロセスにおける系統的な問題を指し示している。

過去のデータによると、2026-08-20 Run#286では主要ランキング62.42点・誠実性pass(プローブ100.00点)、2026-08-19 Run#284では主要ランキング74.18点・誠実性pass(プローブ90.00点)であった。2026-08-21は公開済みrunの中で唯一のfailとなっている。

利用者への具体的な影響

資料引用に依存する研究開発チームは特に注意が必要である。資料制約12.10点は、法律契約のレビュー・学術文献の要約・製品仕様の照合といった場面において、Gemini 2.5 Proが指定資料中に存在しない引用を出力する可能性があることを示している。コード実行23.50点は、Pythonスクリプトの高度なデバッグを行うチームも同様に高い失敗リスクに直面していることを示唆している。

Gemini 2.5 Proを本番環境に組み込んでいる企業に対しては、直ちに人手による引用検証ステップを追加することを推奨する。プローブfailのシグナルはタスクの難易度とは独立しており、問題がタスクの複雑さに応じて自動的に解消されるわけではないことを示している。

戦略的判断

当日のデータから導かれる判断は、Gemini 2.5 Proが引用の真正性制御において明確な弱点を示しており、後続runでプローブが繰り返し発動するかどうかを継続的に観察する必要があるというものである。他モデルのプローブスコアは概ね55点以上であり、Gemini 2.5 Proの25.00点は独立したリスクポイントを構成している。

モデル選定においては、コード実行と資料制約がともに低く誠実性failという組み合わせは、単一次元の低スコアよりも優先的に精査する価値がある。次回のスモークテストにおけるプローブスコアが重要な検証シグナルとなる。


データソース:YZ Index | Run #288 | 元データを確認する