本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが100.00点から75.00点へと25点下落し、総合ランキング全体も80.52点から75.00点に後退した。
スコア変動の内訳
総合ランキングはコード実行と資料制約の2つの次元のみで構成される。本日はコード実行75.00点、資料制約75.00点となり、両者の平均として総合ランキング75.00点が算出された。昨日の資料制約は56.70点にとどまっていたが、本日は18.3点上昇し、コード実行の下落を部分的に相殺した。エンジニアリング判断は100.00点から60.50点へ低下し、タスク表現は65.80点から70.00点へ上昇したが、これら2つのサブランキング次元は総合ランキングには算入されない。
原因の考察
Smoke評価テストは1日あたり10問のみで、2問が1つの次元に対応する。本日コード実行次元での失点が多かった主な要因は、出題の抽選による難易度分布の変動と考えられ、モデル能力の系統的な低下ではない可能性が高い。資料制約スコアが同時に上昇していることも、当日の問題が各次元にランダムに割り振られた結果であることを示唆しており、モデルが特定の方向で一貫した問題を抱えているわけではない。誠実性評価は「合格」を維持しており、新たな違反の兆候は見られない。
ユーザーへの具体的な意味
コード実行に大きく依存する開発チームが、Claude Sonnet 4.6を用いて複雑なアルゴリズムや多段階推論タスクを処理する際は、人手によるレビュー工程を追加する必要がある。資料制約スコアが75.00点に回復したことは、このモデルがユーザー提供のコンテキスト資料に忠実に従う点で安定していることを示しており、忠実性が求められるドキュメント生成や知識抽出のシナリオに適している。
戦略的判断
10問の簡易テストにおける1日25点の変動は正常な範囲内であり、現時点のデータではモデルに実質的な劣化が生じたとは判断できない。今後3日間における同一次元のスコア標準偏差を継続的に追跡し、コード実行スコアが85点を下回る状況が連続して発生した場合に初めて、モデル選定の優先順位の見直しを検討することを推奨する。エンジニアリング判断(サブランキング、AI補助評価)の大幅な低下は副次的な参考シグナルとして活用できるが、総合ランキングの判断を変えるものではない。
全体として、本日のClaude Sonnet 4.6の総合ランキング75.00点と資料制約75.00点の一致は、コードと資料という2つのコア次元においてバランスが取れてきていることを示している。企業がモデルを選定する際には中〜高水準の選択肢として位置づけることができるが、複数日のデータで安定性を確認することが必要だ。
データ出典:YZ Index | Run #280 | 原始データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接