本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアは94.50点から75.00点へと19.5点下落した。一方、資料制約スコアは43.30点から97.80点へと上昇し、メインランキング総合スコアは71.46点から85.26点へと上昇した。
データの実態:1日2問サンプリングによる極端な対比
今回の評価テストは、1日10問・各次元2問という簡易テスト設定のみで構成されている。コード実行次元では1日あたり19.5点の損失、資料制約次元では1日あたり54.5点の増加となり、両者の差は74点に達した。エンジニアリング判断は88.90点から86.70点へと微減し、タスク表現は90.00点から85.80点へと低下した。誠実性評価はpassを維持した。
原因分析:モデルの性能劣化ではなく問題抽選の変動
Smoke評価テストは1日あたりわずか2問というサンプル数で、1問あたりのスコアの重みが極めて高い。コード実行次元では今回、このモデルに不利な問題タイプが抽選で当たった可能性があり、75.00点という低水準につながった。一方、資料制約次元では高度に適合した制約タスクが選ばれ、97.80点まで押し上げられた。エンジニアリング判断とタスク表現の下落幅はいずれも5点以内であり、通常範囲内の変動に過ぎない。現時点のデータはモデルの実際の能力が劣化したという結論を支持しておらず、むしろメインランキング総合スコアが13.8点上昇したことは、資料制約の極めて大きなプラス寄与がコード実行の損失を上回ったことを示している。
利用者への示唆
コード実行に大きく依存する開発チームは、抽選が連続して不利な場合に1日あたり75.00点という低水準が生じ得ることに留意し、重要なコード生成タスクには人的レビュー工程を追加することを推奨する。契約審査やデータ抽出など、資料への忠実性が求められる場面においては、Claude Sonnet 4.6の今回の97.80点という結果が、特定の制約タスクにおける高い実用性を示している。エンジニアリング判断とタスク表現のスコアは依然として85点以上の水準を維持しており、構造化出力を必要とするプロダクト統合への影響は限定的である。
戦略的判断
今回のデータは、モデルの体系的な変化ではなく抽選変動によるものである可能性が最も高い。メインランキング総合スコアが上昇したという事実は、現在の評価において資料制約次元のウェイトが全体的なランキングに対してより大きな影響を持つことを示している。次回以降の検証で注目すべきシグナルは、Smoke評価テストが連続3回でコード実行スコアが80点を下回った場合であり、その際はより大規模なデータセットによる専門的なテストを開始すべきである。現時点の1日分のデータのみではClaude Sonnet 4.6が過大評価または過小評価されているかを判断するには不十分であり、優先度を変更するのではなく、当該モデルを観察リストに加えることを推奨する。
今回のスコア比較を総合すると、Smoke評価テストにおけるClaude Sonnet 4.6のパフォーマンスは小サンプル・高分散という特性に合致しており、即時の対応を要する能力劣化のシグナルは現時点では見られない。
データ出典:YZ Index | Run #268 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接