GPT-o3の材料制約スコアが20点急落、メインランキングは4.8点上昇

GPT-o3の材料制約スコアが20点急落、メインランキングは4.8点上昇

GPT-o3は本日のSmokeテストにおいて、材料制約が70.00点から50.00点へ下落し、エンジニアリング判断が100.00点から50.00点へ下落したが、メインランキングのスコアは72.75点から77.50点へと上昇した。

スコア変動の詳細

コード実行は75.00点から100.00点へ上昇し、タスク表現は91.70点から95.00点へ上昇、誠実性評価はpassを維持した。材料制約とエンジニアリング判断の2項目がそれぞれ20点・50点下落したが、コード実行による25点の増加分を相殺してもなお、メインランキングでは4.75点の純増を実現した。

原因分析

Smokeテストは1日あたり10問のみで、各項目2問ずつというきわめて小さなサンプル数で構成されている。材料制約が20点急落した最も可能性の高い原因は、本日抽選された2問がたまたまモデルの原典引用における弱点を突くものであったのに対し、昨日の2問はその弱点を顕在化させなかったためと考えられる。エンジニアリング判断が100.00点から50.00点へ下落したことも同様に、問題の抽選変動を示している。エンジニアリング判断は実際の運用シナリオにおけるトレードオフを重視するため、1問の失敗だけで50点規模の差が生じ得る。

コード実行が25点上昇したことは、本日抽選されたコード問題においてモデルが安定した、あるいはより良好なパフォーマンスを発揮したことを示している。2つの項目で正反対の大幅な変動が生じたことは、小サンプルの抽選によるランダム変動の特徴に合致しており、1日以内にモデルのパラメータが系統的に劣化したわけではない。

ユーザーへの示唆

契約条項の抽出や政策文書の照合など、材料への忠実度に強く依存する企業向けシナリオでは、本日GPT-o3が示した50.00点水準のリスクに直面することになる。開発者がRAGパイプラインを構築する際には、1回の回答で大規模な情報の欠落や改変が生じることを防ぐため、材料制約の検証レイヤーを追加することが必要だ。

コード実行スコアが100.00点へ上昇したパフォーマンスは、純粋なアルゴリズム実装やコード生成を重視するタスクに対して依然として参考価値がある。一方、エンジニアリング判断が50.00点へ下落したことは、モデルに運用上の意思決定を委ねているチームが、単一出力への信頼ウェイトを下げるべきであることを示唆している。

戦略的判断

現在のスコア比較に基づくと、GPT-o3の材料制約とエンジニアリング判断の同時大幅下落は、真の能力劣化ではなく抽選変動である可能性が高い。メインランキングスコアが4.8点上昇したという事実もこの判断を裏付けており、全体的な能力に系統的な低下は見られない。

次回のSmokeテストでも材料制約が50.00点前後にとどまる場合は、この項目を重点的な観察対象として取り上げ、持続的な弱点が存在するか検証する必要がある。現時点では1日分のデータのみでは、モデルの過小評価または過大評価を結論付けるには不十分であり、継続的な追跡が必要なシグナルとして位置づけるにとどまる。


データ出典:YZ Index | Run #312 | 元データを見る