Claude Sonnet 4.6、Smoke評価でメインスコアが17点急落――コード実行が100点から50点へ

Claude Sonnet 4.6は本日のSmoke評価において、メインボードスコアが89.52点から72.50点へと17点下落し、コード実行ディメンションが100.00点から50.00点へと直接半減した。

ディメンション分解:メインボード下落の直接要因

メインボードはコード実行と資料制約の2ディメンションのみで加重構成されている。昨日はコード実行100.00点・資料制約76.70点だったのに対し、本日はコード実行50.00点・資料制約100.00点となった。コード実行の単一ディメンションが50点下落したことでメインボードが17点押し下げられ、資料制約の23.3点回復では損失を完全に相殺できなかった。

サイドボードのデータでは、エンジニアリング判断が50.00点から83.30点へ上昇し、タスク表現が95.80点から65.00点へ低下した。誠実性評価はpassを維持し、閾値問題は発生しなかった。

原因分析:2問の抽選ばらつきが最も有力な説明

Smoke評価は1日あたりディメンションごとに2問のみであり、サンプル数が極めて少ない。コード実行ディメンションが満点から50点へ下落した最も直接的なメカニズムは、1問で全点を失い、もう1問で部分点を得たケースである。資料制約が同時に満点へ上昇していることは、当日抽出された資料系問題の難易度または制約要件が前日より低かったことを示している。エンジニアリング判断が33.3点上昇し、タスク表現が30.8点下落していることも、モデル全体の能力低下ではなく、ディメンションごとの問題難易度分布の不均一さを裏付けている。

真の性能劣化であれば、通常は複数ディメンションが同時に低下するものであり、資料制約とコード実行はいずれもコア能力に属するため、一方が50点上昇し他方が50点下落するという極端な逆方向の変動は起こりにくい。したがって、問題の抽選ばらつきが現在のデータが示す最も有力な要因である。

利用者への具体的な意味

コード実行に大きく依存するチームは、本番環境においてコード生成専用のテストを別途追加する必要がある。Claude Sonnet 4.6のSmoke評価においてコード実行で50点級の変動が生じたことは、2問の1回限りのテスト結果を大規模コードベースや複雑なアルゴリズムタスクにそのまま外挿できないことを意味する。

資料忠実性が重視される場面(契約情報抽出や法令遵守審査など)においては、本日の100.00点のパフォーマンスを参考にすることはできるが、資料制約スコアが高水準で安定しているかどうか、継続的に複数日にわたって観察する必要がある。

エンジニアリング判断とタスク表現の大きな変動は、構造化出力や多ターン対話を要するシナリオにおいて、単日スコアの参考価値が限定的であることを示唆している。

戦略的判断:次回データの継続的な追跡が必要

現時点のスコア比較に基づくと、Claude Sonnet 4.6のメインボード17点下落は、複数ディメンションの同時劣化ではなく、コード実行単一ディメンションの極端な変動によって主に引き起こされている。次回のSmoke評価でコード実行が80点以上に回復すれば、今回は抽選による異常と判定できる。一方、引き続き50点前後に留まる場合は、コードタスクにおけるモデルの安定性をさらに検証する必要がある。

現時点のデータは「モデル劣化」という結論を支持しないが、「単一ディメンションの高い変動性」という観察を支持する。モデル選定を検討する企業はClaude Sonnet 4.6のコード実行能力を独立した検証項目として設けるべきであり、本日のメインボードスコア72.50点を最終的な参考値として直接採用することは避けるべきである。


データ出典:YZ Index | Run #332 | 元データを見る