GPT-6 Luna、材料制約スコアが20点下落・コード実行が41.7点上昇——総合ランキングは13.9点増加

本日のSmoke評価テストにおいて、GPT-6 Lunaの材料制約スコアは95.00点から75.00点に低下し、コード実行スコアは58.30点から100.00点に上昇、総合ランキングスコアは74.82点から88.75点へと改善した。

データファクトの詳細分析

昨日と本日のスコアを比較すると、コード実行部門は41.7点上昇、材料制約部門は20点下落、エンジニアリング判断部門は100.00点のまま変化なし、タスク表現部門は10点上昇して87.50点となった。総合ランキングはコード実行と材料制約の2つの検証可能な部門を加重合算して算出されており、最終的に正味13.9点の増加となった。誠実性評価は「pass」を維持しており、閾値には抵触していない。

Smoke評価テストは1日あたり各部門2問、計10問で構成される。材料制約部門が1日で20点下落したということは、少なくとも1問において材料への忠実度に関して明確な減点が生じたことを意味する。コード実行部門が1日で41.7点上昇したということは、対応する問題において実行正確性が満点またはそれに近い評価を得たことを意味する。

原因分析:抽選による変動かモデルの劣化か

材料制約とコード実行が同時に大幅な逆方向の変動を示した最も可能性の高い原因は、問題の抽選によるばらつきである。1日2問という極めて少ないサンプル数では、複雑な引用を伴う材料制約問題が1問含まれるだけで20点の低下を招き、精確なコード出力を要する問題が1問含まれるだけで41.7点の上昇をもたらす。エンジニアリング判断部門とタスク表現部門に同期した下落が見られないことも、系統的な劣化ではなく変動であるという判断を支持している。

モデルの真の劣化であれば、通常は複数の部門で同時に一貫した低下が現れるが、本日のデータではエンジニアリング判断が満点を維持し、タスク表現はむしろ上昇しており、誠実性評価も「pass」を保っている。したがって、材料制約における20点の下落は、1日の抽選によって生じた統計的なノイズに近いと判断される。

利用者への具体的な意味

コード実行を重視するチームにとっては、本日のGPT-6 Lunaは対応問題で100.00点を達成しており、より高い信頼度を得られる。一方、材料への忠実度が重要なシナリオでは追加の人工検証が必要となる。75.00点は昨日の95.00点を大きく下回るためである。このモデルに依存する開発者は、モデル選定の際に単日の結果ではなく、複数日の平均スコアを参照することが望ましい。

エンジニアリング判断部門は100.00点で安定しており、サイドランキング能力への影響はない。タスク表現部門がわずかに上昇したことは、出力の構造化能力が改善していることを示している。総じて、単日のデータが本番環境におけるモデル選定に与える影響は限定的である。

戦略的判断

現在のスコア比較に基づくと、GPT-6 Lunaは今回のSmoke評価テストにおいて系統的な劣化のシグナルを示しておらず、材料制約の下落は抽選によるばらつきによるものである可能性が高い。総合ランキングスコアはむしろ13.9点上昇しており、コード実行の増加分が材料制約の損失を上回っていることを示している。

安定性部門はこれまで31.7点を記録しており、このモデルが同種の問題においてスコアの変動が大きいことを裏付けている。次回以降も材料制約とコード実行の日間標準偏差を継続して追跡し、材料制約が2日連続で低水準にとどまる場合は、重み付けの調整や人工検証工程の追加を検討することを推奨する。

現在のデータは「モデルの劣化」という結論を支持しない。1日10問という簡易テストに内在する分散で、全ての変化は十分に説明できる。


データ出典:YZ Index | Run #370 | 生データを見る