Claude Opus 4.7は本日のSmoke評価において、コード実行ディメンションのスコアが前日の100.00点から72.00点に低下し、資料制約ディメンションは56.00点から85.00点に上昇した。メインランキング総合スコアは80.20点から77.85点へと下落した。
データの事実:2つのコアディメンションの逆方向変動
Smoke評価は1日あたり10問のみで、各ディメンション2問ずつとなっている。本日のコード実行ディメンションのスコアは72.00点で前日比28点減、資料制約ディメンションは85.00点で前日比29点増となった。エンジニアリング判断は94.50点から100.00点に上昇し、タスク表現は66.70点から58.90点に低下した。誠実性評価は「pass」を維持した。
メインランキングはコード実行と資料制約の加重平均で算出されており、本日の77.85点は前日比2.4点の下落となった。コード実行の1日の下落幅はメインランキングの下落幅を大きく上回る一方、資料制約の上昇幅が損失の一部を完全に相殺した。
原因分析:出題サンプリングの変動による可能性が高い
Smoke評価では各ディメンションがわずか2問であるため、1問あたりの得点ウェイトが極めて高い。コード実行ディメンションは前日満点の100.00点だったが、本日は72.00点であり、その差分28点は出題難易度のサンプリング差に起因する可能性が最も高い。資料制約ディメンションも前日は56.00点と低めだったが本日は85.00点となっており、同様に出題サンプリングによるスコアの反動上昇を示している。
モデルに真の性能劣化が発生した場合、通常は複数のディメンションに同時に影響が出る。本日はエンジニアリング判断がむしろ満点の100.00点に上昇しており、タスク表現の低下も7.8点にとどまりコード実行の低下幅を大きく下回っている。メインランキングの2つのディメンションが完全に逆方向の変動を示したことは、モデル能力の系統的な低下ではなく出題サンプリングによる変動という解釈をさらに支持するものである。
利用者への示唆
コード実行を重視するチームがClaude Opus 4.7を採用する際は、1日単位のスコア変動に対してバッファを設けておく必要がある。Smoke評価におけるコード実行72.00点は依然として実用可能な範囲内にあるが、複数日にわたって同様の低スコアが続く場合は、複雑なコードタスクにおける同モデルの安定性を改めて評価する必要がある。
資料制約への対応が重要なシナリオでは、本日の85.00点はClaude Opus 4.7が所定の資料に忠実に従う面での改善を示している。開発者は、厳密な資料忠実性が求められるタスクにおいて同モデルの本日のパフォーマンスを優先的にテストすることを検討できる。
戦略的判断:現時点で優先度の引き下げは不要、ただし翌日の検証が必要
本日のデータに基づけば、Claude Opus 4.7のメインランキングはわずか2.4点の低下にとどまっており、コア能力に系統的な劣化のシグナルは見られない。コード実行と資料制約の逆方向の大幅な変動は、2問サンプリングの統計的特性と合致している。
翌日のSmoke評価でコード実行ディメンションのスコアが90点以上に回復した場合、本日の変動は通常の範囲内であったと確認できる。一方、80点を下回る状態が続く場合はコード実行ディメンションを重点観察対象に加える必要がある。現時点のデータは、Claude Opus 4.7の総合的な能力に対して否定的な戦略的評価を下す根拠とはならない。
データ提供:YZ Index | Run #345 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接