Claude Sonnet 4.6は本日のSmoke評価において、材料制約スコアが昨日の100.00点から66.40点へ急落し、総合ランキング全体も86.25点から81.86点に低下した。
スコア比較と主要事実
コード実行は75.00点から94.50点へ上昇、タスク表現は79.70点から90.00点へ上昇、エンジニアリング判断は100.00点から82.50点へ低下した。誠実性評価はpassを維持している。以上のデータはすべて同一のSmoke評価に基づいており、昨日と本日の2日間の単日結果の比較に限定される。
材料制約スコア急落の考えられる原因
Smoke評価は1日あたり10問のみで、各次元につき2問構成となっている。材料制約の単日-33.6点は、最も可能性が高い原因として設問の抽選による変動が挙げられる。新たに出題された2問が材料への忠実度に対してより高い要求を課しており、それが直接この次元のスコアを引き下げた。一方でコード実行が同時に+19.5点上昇しており、別の問題セットにおいてモデルの実行能力が低下していないことを示している。エンジニアリング判断の-17.5点についても、モデル全体の能力低下ではなく設問の難易度変化を示唆している。
モデルの実際の劣化であれば、通常は複数の次元が同時に低下するが、本日はコード実行とタスク表現がともに明確に上昇しており、実際の劣化である可能性は低い。
利用者への具体的な意味
材料制約に強く依存するシナリオ、たとえば法的契約のレビュー、社内文書の書き換え、長文の忠実度が高く求められるタスクなどについては、次回のSmoke評価結果が出るまで大規模な本番投入を一時見合わせることを推奨する。コード実行スコアはすでに94.50点に達しており、コード実行を重視するチームはプログラミング関連業務に引き続きこのモデルを使用して差し支えない。
エンジニアリング判断(サブランキング、AI補助評価)は82.50点に低下しており、複雑な意思決定チェーンを必要とするプロセスに影響を及ぼす可能性があるため、開発者は重要なノードに人的確認を追加すべきである。
戦略的判断
単日の材料制約-33.6点だけではモデル能力の劣化を断定するには不十分だが、この次元の変動幅はすでに総合ランキングの平均水準を超えている。次回のSmoke評価で材料制約が引き続き80点を下回る場合には、材料に敏感なシナリオからこのモデルをダウングレード使用する必要がある。現時点のデータは「設問の抽選による変動」という結論を支持しており、「継続的な劣化」という判断は支持しない。
Claude Sonnet 4.6の材料制約スコアを毎日のモニタリング項目として設定し、2日連続で75点を下回った場合に初めて採用モデルの見直しを行うことを推奨する。
データソース:YZ Index | Run #315 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接