Claude Sonnet 4.6は本日のSmoke評価において、コード実行次元が昨日の97.00点から75.00点へ22点下落し、素材制約次元は67.60点から93.30点へ25.7点上昇した。総合ランキングスコアは83.77点から83.24点へ、わずか0.5点の低下にとどまった。
データの実態:少数サンプルが引き起こす極端な逆方向の変動
Smoke評価は1日あたり10問のみで、各次元2問ずつとなっている。コード実行が1日で22点失ったということは、本日の2問のコード実行問題において、モデルの平均得点が昨日を大きく下回ったことを意味する。素材制約が同期間に25.7点上昇したことは、本日の2問の素材制約問題でのパフォーマンスが昨日を大きく上回ったことを示している。エンジニアリング判断は100.00点から94.50点に低下し、タスク表現は70.00点から95.00点に上昇した。誠実性評価はpassを維持している。
原因分析:モデルの真の劣化ではなく、出題のサンプリング変動
コード実行と素材制約がほぼ対称的な逆方向の変化を示していることから、最も考えられる原因は、本日抽出された4問(各次元2問)がモデルの能力特性と極端に異なる適合度を持っていたことである。Smoke評価の問題は毎日入れ替わり、1問あたりのスコア比重が高いため、2問というサンプル数では、難問が1問あるだけで次元平均スコアを22点引き下げ得る。素材制約が同時に大幅に上昇していることも、「モデル能力の低下」ではなく「出題適合度の変化」という解釈を裏付けている。モデルに系統的な劣化が生じた場合、通常は同一日に別のコア次元が同等幅の上昇を示すことはない。
エンジニアリング判断が5.5点小幅低下し、タスク表現が25点上昇したことも、少数サンプルによるランダム変動の特性と一致している。総合ランキングスコアがわずか0.5点の低下にとどまったことは、コード実行と素材制約の激しな変動が互いに相殺されたことを示しており、これは各次元1日2問という設計に直接起因している。
利用者への示唆
コード実行に強く依存する開発チームは、1日のSmoke得点75.00がモデルの実際のコード能力がそのレベルまで低下したことを意味するわけではない点に注意が必要だ。モデル選定や日常的な検証の際は、より大きなサンプルでのテストを行い、1日2問という結果に惑わされないようにすることを推奨する。素材制約への感度が高いシナリオ(長文書の忠実度要件が高いアプリケーションなど)については、本日の93.30点が対応問題においてモデルが安定したパフォーマンスを発揮できる余地を持っていることを示している。
企業がSmokeスコアを日次監視指標として用いる場合は、単一次元を孤立して見るのではなく、総合ランキング全体の変化を同時に観察すべきである。コード実行と素材制約の逆方向の変動は、少数サンプルによる迅速テストが本質的に抱える限界を利用者に改めて認識させるものである。
戦略的判断
現時点の1日分のデータに基づけば、Claude Sonnet 4.6のコード実行次元を直ちに真の劣化と判断する必要はない。総合ランキングスコアが83.24点を維持していることは、全体的な能力に系統的な低下が生じていないことを示している。次回の評価では、コード実行が85点を継続的に下回るかどうかを検証する必要があり、2日連続で同様の低スコアが出た場合に初めて、モデル能力の変化の可能性を検討すべきである。現時点のシグナルは、出題サンプリングによる通常の変動を指している可能性が高い。
このモデルに依存する開発者は、短期的には従来の方針で引き続き利用しつつ、少数サンプル評価のランダム性をヘッジするため、コード実行タスクに対する内部テストのカバレッジを拡充することを推奨する。
データ出典:YZ Index | Run #299 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接