GPT-6 Solは本日のSmoke評価テストにおいて、材料制約スコアが88.30点から55.00点へ33.3点下落したものの、主要ランキングのスコアは80.99点から79.75点への小幅低下にとどまった。
スコア比較データ
コード実行は75.00点から100.00点へ25点上昇。材料制約は88.30点から55.00点へ下落。エンジニアリング判断は94.80点を維持。タスク表現は100.00点から77.50点へ22.5点下落。誠実性評価はpassを維持。
データの詳細分析
主要ランキングはコード実行と材料制約の2つの次元を加重して構成される。コード実行の満点100.00点が主要ランキングを押し上げる一方、材料制約の55.00点が相殺要因となり、総合では1.2点の低下にとどまった。タスク表現はサブランキングの次元として同時に22.5点の低下を示しており、今回の10問速テストにおけるモデルの指示への忠実度に不一致が生じていることを示している。
原因分析
Smoke評価は1日あたり各次元2問のみで構成され、問題のランダム抽選により単日スコアが大きく変動する可能性がある。材料制約の55.00点と前日の88.30点との差は、今回抽選された問題が素材引用への要求水準が高かったのに対し、モデルが安定した出力を維持できなかったことに起因する可能性がある。コード実行が100.00点に上昇したことは、今回のコード系問題においてモデルが安定したパフォーマンスを発揮し、同種の劣化が見られなかったことを示している。2つの次元が逆方向に変動したことは、モデル全体の能力劣化よりも問題抽選による変動に近いと考えられる。
利用者への示唆
契約審査や文献引用生成など材料制約を重視するシナリオでは、企業は55.00点水準での出力誤差を避けるため、人手による検証工程を追加する必要がある。コード実行に依存する開発者はGPT-6 Solを引き続きプログラミングタスクに活用でき、今回の100.00点のパフォーマンスが短期的な信頼材料となる。タスク表現77.50点は、多段階指示シナリオにおいてモデルが指示を見落とす可能性があることを示唆しており、リスク低減のために複雑なタスクの分割が推奨される。
戦略的判断
材料制約の単日33.3点下落は通常の変動範囲を超えており、次回のSmoke評価で重点的に追跡する価値がある。材料制約が2日連続で60点以下に留まる場合、モデルにこの次元での体系的な問題が生じていることを検討する必要がある。現在の主要ランキング79.75点は依然として実用可能な範囲にあるが、素材への忠実度を重視するチームは代替モデルの準備を進めるべきである。エンジニアリング判断の94.80点は安定を維持しており、サブランキング能力の参照基準として活用できる。
今回の評価では、GPT-6 Solがコード実行と材料制約の2つのコア次元において明確な乖離を示した。コード実行の満点パフォーマンスは今回の問題難易度との適合によるものと考えられ、材料制約の55.00点は出力の一貫性不足を露呈している。主要ランキングの1.2点という小幅低下は内部次元の激しい変動を覆い隠しており、モデル選定の意思決定を誤らせるリスクがある。
企業ユーザーがGPT-6 Solを選択する際は、利用シナリオを区別する必要がある。コード生成系タスクは引き続き依存可能だが、素材引用系タスクでは二次審査プロセスを設ける必要がある。タスク表現77.50点の低下はさらに、複雑な多段階指示シナリオにおけるモデルの安定性不足を示している。
データから見ると、問題抽選による変動がより可能性の高い説明である。10問の速テストはサンプル数が限られており、1次元あたり2問のみで30点以上の変動が生じ得る。モデルの実際の劣化を判断するにはより多くの継続的データが必要であり、現時点では単日の結果のみでは劣化の結論を導くには不十分である。
次回の評価で材料制約が80点以上に回復した場合、今回の55.00点は偶発的事象と見なせる。65点を継続的に下回る場合は、モデル能力劣化の検証プロセスを開始する必要がある。エンジニアリング判断が94.80点を維持していることは、サブランキング能力の参照基準を提供している。
データ出典:YZ Index | Run #364 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接