Claude Opus 4.7は本日のSmoke評価において、総合スコアが昨日の82.29点から63.59点へと18.7ポイント低下した。
データの詳細分析
スコア比較によると、コード実行は97.00点から50.00点へと47ポイント下落し、資料制約は64.30点から80.20点へと15.9ポイント上昇した。エンジニアリング判断は100.00点から94.50点へ、タスク表現は91.70点から85.80点へそれぞれ低下した。総合スコアはコード実行と資料制約の加重のみで構成されており、コード実行の47ポイント下落が全体スコアを直接18.7ポイント引き下げた。
Smoke評価は各次元につき1日2問のみであり、1問のミスだけで次元スコアが大きく変動する可能性がある。本日のコード実行次元のスコアが50.00点であることは、当該次元の2問のうち少なくとも1問が合格基準に達しなかったことを意味する。
原因分析
コード実行次元に47ポイントの下落が生じた最も可能性の高い原因は、本日の抽出問題の難易度、またはモデルが特定のコード制約への対応に失敗したことである。資料制約が同期間に15.9ポイント上昇していることは、モデルが資料を忠実に引用する能力は同時に低下していないことを示している。エンジニアリング判断とタスク表現の小幅な低下(それぞれ5.5ポイントと5.9ポイント)はコード実行の落ち込みよりはるかに小さく、性能低下がコード生成の段階に集中していることを示している。
真の能力低下であれば、資料制約が15.9ポイント逆方向に上昇するはずはない。現在のデータは、問題抽出による変動という説明をより強く支持している。1日2問というサンプルサイズでは分散が大きく、1回のミスだけで次元スコアが半減しうる。
利用者への意味
コード実行に大きく依存している開発チームは注意が必要である。Claude Opus 4.7の本日のコード実行スコア50.00点は、コードの正確な生成やデバッグが必要なシナリオにおいて、単回呼び出しの失敗確率が上昇していることを意味する。一方、資料制約の80.20点は、与えられた文書や仕様をモデルが忠実に処理することに依存するシナリオでは、引き続き高い信頼性を維持できることを示している。
企業の採用選定において、ワークロードにおけるコード実行の比率が60%を超える場合、本日のデータは人手によるレビュー工程の追加、または単日変動を分散させるための他モデルの並列呼び出しを検討する必要があることを示唆している。
戦略的判断
コード実行次元が97.00点から50.00点へと落ち込んだことは、2問のみのサンプリング条件下においては、モデルの能力の恒久的な低下ではなく、高確率でランダムな変動と見なされる。誠実性評価はpassを維持しており、新たなリスクシグナルは確認されていない。
次回の評価では、コード実行次元が90点以上に回復するかどうかを重点的に検証する必要がある。連続2日間にわたって50点前後で推移した場合は、モデルの真の能力低下の可能性を検討すべきである。現時点では単日データだけではモデルが過大評価または過小評価されているかを判断するには不十分であり、3日間のコード実行平均スコアを継続追跡することを推奨する。
データ出典:YZ Index | Run #320 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接