GPT-6.1 Solは本日のSmoke評価テストにおいて、メインランキングスコアが86.25点から77.07点に低下し、コード実行次元では75.00点から58.30点へと16.7点の下落となった。
スコア比較データ
前日のスコアは、コード実行75.00点、資料制約100.00点、エンジニアリング判断100.00点、タスク表現72.50点、メインランキング86.25点。本日のスコアは、コード実行58.30点、資料制約100.00点、エンジニアリング判断100.00点、タスク表現87.50点、メインランキング77.07点。誠実性評価は引き続きpassを維持。
データの詳細分析
メインランキングの9.2点低下はコード実行次元のみによるもので、資料制約とエンジニアリング判断は変動なし、タスク表現はむしろ15点上昇した。Smoke評価テストは1日あたり10問のみで、各次元2問ずつという構成上、1問あたりの得点ウェイトが高く、2問の失点だけで次元スコアが大幅に変動しうる。
原因分析
コード実行次元の本日スコア58.30点は、抽選で選ばれた2問の難易度や問題タイプが昨日と異なっていたことが最も有力な原因と考えられる。資料制約とエンジニアリング判断が満点を維持していることから、モデルの基礎能力に系統的な劣化は生じていない。タスク表現スコアの上昇は、本日の問題に対する表現次元での適応力が高かったことを示している。1日10問というテスト固有の分散だけで、16.7点の下落は十分に説明可能であり、モデルの実際の能力低下を想定する必要はない。
利用者への影響
コード実行に強く依存する開発チームは、Smoke評価スコアの変動が大きい日には人的レビュー工程を追加し、モデルが生成したコード断片を直接採用することを避けるべきである。資料制約で満点を維持しているモデルは、原文への厳格な忠実性が求められるシナリオで引き続き活用できる。タスク表現スコアの上昇は、明確なアウトプットを必要とするプロダクトドキュメント生成のシナリオにとって前向きなシグナルとなる。
戦略的判断
今回のメインランキング下落はSmoke評価テストにおける通常範囲内の単日変動であり、コード実行次元の16.7点低下は他の次元の同時低下を伴っていないため、現時点では即時対応が必要な劣化シグナルとはみなされない。次回の評価でコード実行次元が引き続き65点を下回る場合は、継続的な低位区間に入ったかどうかを検証する必要がある。
企業の導入選定においては、GPT-6.1 Solのコード実行次元の過去の中央値は依然として多くの競合製品を上回っており、単日のデータが全体評価を変えるべきではない。開発者は引き続き非クリティカルなコードタスクに同モデルを使用できるが、本番環境でのコード生成については人的校閲プロセスの維持を推奨する。
資料制約次元が継続して満点を記録していることは、モデルが制約遵守において安定した出力を維持していることを証明している。エンジニアリング判断次元も同様に100.00点を維持しており、エンジニアリング上の意思決定支援が必要なシナリオに適している。タスク表現次元は72.50点から87.50点に上昇し、表現タスクにおける即時適応能力を示している。
本日の全次元データを総合すると、GPT-6.1 Solには次元横断的な系統的低下は見られず、コード実行次元のみがテスト問題数の制約により大きな分散を生じている。次回のSmoke評価結果により、今回の変動の性質についてより明確な判断が可能となる。
データ出典:YZ Index | Run #358 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接