Claude Sonnet 4.6は本日のSmokeベンチマークにおいて、コード実行次元のスコアが昨日の97.00点から75.00点へと22点低下した。
スコア比較
資料制約次元のスコアは60.20点から85.90点へと25.7点上昇した。エンジニアリング判断(サイドランキング、AI補助評価)は94.50点から75.00点へ、タスク表現(サイドランキング、AI補助評価)は95.00点から90.00点へそれぞれ低下した。主要ランキングの総合スコアは80.44点から79.91点へとわずか0.5点の微減にとどまった。誠実性評価は引き続き「pass」を維持している。
変動要因の分析
Smokeベンチマークは1日あたり10問のみで、各次元につき2問が出題されるため、1日単位のスコアの標準偏差は本質的に大きくなる。コード実行と資料制約という主要ランキングの2次元で逆方向の大幅な変動が生じた最も可能性の高い原因は、問題の抽選による標本変動であり、モデル能力の実質的な低下ではない。コード実行問題が複雑な多段階推論やエッジケースを含む場合、1度のミスで22点の低下を招く可能性がある。一方、資料制約問題が単純な事実確認に転じた場合には高得点を得やすい。エンジニアリング判断のサイドランキングが同時に19.5点低下していることも、今回の抽選で推論型問題の比率が高かったことを示唆している。
利用者への示唆
コード実行への依存度が高いチームは、本日および今後数日間、Claude Sonnet 4.6の出力に対して追加の人的検証を行う必要がある。特に複数ファイルのリファクタリングやアルゴリズム最適化のシナリオで注意が求められる。資料制約スコアの大幅上昇は、ユーザーの指示への厳密な準拠と幻覚の回避において同モデルのパフォーマンスが向上していることを示しており、高い忠実度の出力が求められる文書生成や契約審査のシナリオにはむしろ有利に働く。主要ランキングの低下はわずか0.5点であり、総合的な能力は引き続き実用可能な水準にあるが、単一次元における22点の変動は多くの企業が許容できる安定性の閾値を超えている。
戦略的判断
現時点のデータは「モデルの性能低下」という結論を支持しない。資料制約の同時大幅上昇とコード実行の急落が鏡像関係を形成しており、これはシステム的な能力低下ではなく問題の分散による典型的な特徴である。次回のSmokeベンチマークではコード実行次元が90点以上に回復するかどうかを重点的に注視することを推奨する。2日連続で75点前後にとどまる場合は、より長期にわたる安定性検証を開始する必要がある。エンジニアリング判断サイドランキングの19.5点低下についても、複雑な推論チェーンにおけるモデルの潜在的な一貫性問題を排除するため、並行してトラッキングする価値がある。
モデル選定を進めている企業にとって、Claude Sonnet 4.6は引き続き資料制約要件の高いシナリオにおける第一候補となりうるが、コード実行集約型プロジェクトでは代替モデルの準備またはテストケースのカバレッジ拡充が望ましい。同モデルを活用した自動コード生成を行う開発者は、本日のデータを踏まえ、単一次元の変動リスクを軽減するためにユニットテストの比率を高めることを検討すべきである。
データソース:YZ Index | Run #250 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接