Claude Sonnet 4.6、材料制約スコアが15.8点急落——コード実行は47点上昇

Claude Sonnet 4.6は本日のSmoke評価において、材料制約スコアが昨日の100.00点から84.20点へと15.8点下落した。一方、コード実行スコアは50.00点から97.00点へと上昇し、総合ランキングは72.50点から91.24点へと改善した。

データ分解:2つのコア指標における激しい逆方向変動

Smoke評価は1日あたり各指標2問のみで、サンプル数が極めて少ない。材料制約が1日で15.8点下落したことは、少なくとも1問において引用の忠実度または制約遵守に明確な減点が生じたことを意味する。コード実行が1日で47点上昇したことは、別の問題(または2問)で実行精度が大幅に改善したことを示している。総合スコア91.24点はコード実行と材料制約の加重平均で算出されており、実行側の大幅な回復が制約側の下落を覆い隠している。

原因分析:抽選による変動か、真の性能劣化か

スコアの変動幅から見ると、2つの指標が同日にそれぞれ15点超の変化を示したことは、小サンプルによる抽選的変動の典型的な特徴に合致する。材料制約は昨日が満点100.00点、本日が84.20点であり、その差は材料に厳密に従って回答すべき1問から生じた可能性がある。コード実行も昨日50.00点から本日97.00点へと変化しており、同様に1問の難易度が低下したか、モデルがたまたま正解経路を辿った可能性がある。複数日にわたる同方向の継続的トレンドデータがないため、モデル能力の系統的な劣化よりも、問題のランダム性に起因する可能性が高い。

利用者への具体的な意味

材料の忠実度に大きく依存するシナリオ(法律契約の情報抽出、製品仕様の照合、社内ナレッジベースへの質問応答など)において、Claude Sonnet 4.6の本日の材料制約スコア84.20点は、単一呼び出しにおけるエラー発生確率が上昇していることを意味する。重要なプロセスでは、人手による再確認や複数モデルのクロス検証の追加を推奨する。

コード実行ニーズが高いチーム(自動化スクリプト生成、データ処理パイプラインなど)にとって、本日の97.00点は、当モデルが実行系タスクにおいて高い実用水準に達していることを示しており、管理された環境下での利用範囲拡大が可能である。

戦略的判断

単日データに基づけば、材料制約の15.8点下落はモデル劣化のシグナルとはまだ言えず、Smoke評価固有の変動である可能性が高い。誠実性評価はpassを維持しており、誠実性に関する問題は発生していない。次回も引き続き材料制約スコアを追跡し、2日連続で90点を下回った場合に深度再評価を開始することを推奨する。現時点でClaude Sonnet 4.6の総合能力評価を引き下げる必要はない。

総合スコア91.24点 vs 昨日72.50点——実行側の回復が制約側の下落を覆い隠しており、短期的には引き続き観察を優先する。

データ出典:YZ Index | Run #334 | 元データを見る