Claude Sonnet 4.6、材料制約スコアが30.6ポイント急落――コード実行は25ポイント上昇

Claude Sonnet 4.6は本日のSmoke評価において、材料制約スコアが93.30点から62.70点へ30.6ポイント下落し、コード実行スコアは50.00点から75.00点へ25ポイント上昇した。メインボードの総合スコアは69.49点から69.47点へとほぼ変化なしだった。

コアデータの分析

Smoke評価は1日あたり10問のみで、2問が1つの評価軸に対応する。材料制約とコード実行はいずれもメインボードの監査可能な評価軸に属する。前日の材料制約93.30点は高い材料忠実度を示していたが、本日の62.70点はこの軸を大幅に押し下げた。コード実行が25ポイント急伸し、材料制約の損失を部分的に相殺した結果、メインボードは69.47点を維持した。

エンジニアリング判断は88.90点から100.00点へ、タスク表現は75.00点から90.80点へと上昇し、2つのサイドボード評価軸も同時に改善した。誠実性評価は2日連続でpassを維持し、閾値には触れていない。

変動要因の分析

材料制約の1日あたり30.6ポイントの下落は、問題抽選のランダム性に起因する可能性が最も高い。Smoke評価は毎日問題が入れ替わるため、2問というサンプル数では、1問の失敗だけで20〜30ポイント規模の変動が生じうる。コード実行が同期して大幅に上昇していることは、コード関連タスクにおけるモデルの系統的な劣化がないことを示している。2つのメインボード評価軸が逆方向に動いていることは、モデル能力全体の低下ではなく、問題内容の差異によるものと考えられる。

真の性能劣化であれば、コード実行と材料制約は通常同じ方向に変動する。今回の逆方向の変動は、抽選による揺らぎの特徴により合致している。エンジニアリング判断とタスク表現が同時に向上していることも、モデルの基礎能力が影響を受けていないことを裏付けている。

利用者への具体的な影響

材料忠実度を重視するシナリオ――長文書の要約、契約条項の抽出、コードコメントの生成など――においては、Claude Sonnet 4.6の本日の出力に対して追加の人的検証が必要である。コード実行を重視するチームはこのモデルの利用を継続できる。75.00点は前日水準を上回っている。

材料制約とコード実行の両方に依存する複合タスクでは、単一評価軸の変動が最終結果に波及しないよう、中間チェックポイントを追加することを推奨する。誠実性評価がpassであることは、モデルが回答拒否や明らかなハルシネーションを起こしていないことを示しており、基本的な使用可能性は安全な範囲内にある。

戦略的評価

メインボードスコア69.47点と前日の69.49点の差異は無視できる水準であり、1日の材料制約の急落は全体的なランキング順位を変えていない。次回のSmoke評価で材料制約が80点以上に回復すれば、今回の下落は抽選によるノイズと判定できる。70点を下回る状態が続く場合は、新たな変動域に入ったかどうかを注視する必要がある。

現時点のデータはモデルの真の性能劣化という結論を支持しておらず、既存の利用戦略を維持しつつ、材料制約に敏感なシナリオにのみ検証ステップを追加することを推奨する。


データ出典:YZ Index | Run #364 | 元データを見る