Claude Sonnet 4.6は本日のSmokeベンチマークにおいて、素材制約スコアが前日の100.00点から79.50点へと1日で20.5点下落した。一方、コード実行スコアは73.70点から100.00点へと上昇し、メインボードの総合スコアは85.54点から90.78点へと上昇した。
スコアの事実とメインボードの構成
メインボードはコード実行と素材制約の2つの評価軸の加重平均のみで構成されている。本日はコード実行が満点100.00点、素材制約が79.50点となり、両者の平均によりメインボードは90.78点に達した。前日は素材制約が満点であったためメインボードは85.54点であったが、本日は素材制約が20.5点減少した一方、コード実行が26.3点増加したことで相殺され、メインボードはなお+5.2点の純増を実現した。
エンジニアリング判断は100.00点から60.50点へ、タスク表現は95.80点から95.00点へとそれぞれ低下したが、いずれもサイドボード(AI補助評価)に属するためメインボードのランキングには算入されない。誠実性評価はpassを維持した。
考えられる原因の分析
Smokeベンチマークは1日あたり10問のみで、各評価軸につき2問が出題されるため、抽選によるランダム性が高い。素材制約スコアが1日で20.5点失った最も可能性の高い原因は、本日抽選された2問の素材制約問題がモデル出力の忠実度に対してより厳しい要件を課しており、引用または制約遵守において減点が生じたことにあると考えられる。コード実行の2問はいずれも満点であり、当該評価軸の抽選問題に対してモデルが安定したパフォーマンスを発揮したことを示している。
モデルの真の性能劣化であれば、通常は複数の評価軸で同時に変動が見られる。しかし本日はタスク表現がわずか0.8点の低下にとどまり、サイドボードのエンジニアリング判断は39.5点低下したもののメインボードには影響しない。単一の評価軸で大幅な変動が生じ、もう一方のコア評価軸が反対方向で満点を記録したことは、系統的な能力低下ではなく、抽出サンプルのばらつきによる特徴に合致している。
利用者への具体的な意味
長文書の要約、契約条項の抽出、ナレッジベースQAなど素材制約への依存度が高いシナリオにおいては、Claude Sonnet 4.6の本日スコア79.50点は、出力に事実の逸脱または欠落が生じる可能性があることを意味する。人手による検証ステップを追加することを推奨する。
コード実行ニーズが主な開発チームにとっては、本日の100.00点はアルゴリズム実装やデバッグスクリプトなどのタスクにおいてモデルが高い信頼性を備えていることを示しており、引き続き本番環境での使用が可能である。
両種類のタスクを併用する混合チームは、同一バッチの回答においてモデルの評価軸間でパフォーマンスにばらつきが生じる可能性があることに注意し、タスクの種類ごとにプロンプトや後処理ルールを個別に設定することを推奨する。
戦略的判断
本日のデータに基づくと、Claude Sonnet 4.6の素材制約における20.5点の下落は、モデルの真の性能劣化ではなく、問題の抽選ばらつきによる可能性が最も高い。メインボードはコード実行の満点によりなお純増を実現しており、コア能力に系統的な問題は発生していないことを示している。
1日単位のSmokeベンチマークの変動は通常の範囲内であり、次回以降も素材制約スコアが回復するかどうかを継続的に追跡することを推奨する。素材制約スコアが2日連続で80点を下回った場合には、より深い評価を実施するかどうかを検討されたい。現時点のデータは、モデルの総合的な能力を引き下げる結論を支持しない。
サイドボード(AI補助評価)におけるエンジニアリング判断の大幅な低下は副次的な観察指標として位置づけられるが、メインボードの判断を変えるものではない。誠実性評価はpassを維持しており、モデル回答の一貫性は誠実性の閾値に抵触していない。
データソース:YZ Index | Run #297 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接