Claude Opus 4.7のコード実行スコアが30.5点急落、総合スコアは6.4点のみ低下

Claude Opus 4.7は本日のSmokeベンチマークにおいて、コード実行スコアが100.00点から69.50点に低下し、素材制約スコアが71.90点から95.00点に上昇、主要ランキングのスコアが87.36点から80.98点に低下した。

スコア変動の事実

コード実行部門で-30.5点の変動が発生し、素材制約部門で+23.1点、工学的判断部門で+25点、タスク表現部門で+5点の変動があった。主要ランキング全体では6.4点の低下となった。誠実性評価は「pass」を維持している。

変動要因の分析

Smokeベンチマークは1日あたり10問のみで、各部門2問ずつ構成されている。コード実行部門では1問の失敗だけで30点以上の低下を引き起こす可能性がある。素材制約と工学的判断が同時に大幅上昇していることは、モデル全体の出力能力に系統的な劣化が生じていないことを示している。問題抽選のランダム性が今回の変動の最も可能性の高いメカニズムである。

コード実行69.50点(前日100.00点)、素材制約95.00点(前日71.90点)、この2部門の逆方向の動きは抽選によるものであり、モデルの劣化ではないことを示している。

利用者への具体的な意味

コード実行に大きく依存している開発チームは、複数日のSmokeデータが安定した後にワークフローの調整を検討するべきである。素材制約スコアの上昇は、プロンプトや書式への厳格な準拠が求められる場面にとってポジティブなシグナルとなる。工学的判断スコアが100.00点に達し、サブランキング(AI補助評価)ではモデルが工学的意思決定に関する問題でより一貫したパフォーマンスを示していることが確認された。

戦略的判断

今回のコード実行スコアの急落は、モデルの実際の能力低下ではなく、当日の問題抽選によって引き起こされた可能性が最も高い。主要ランキングがわずか6.4点しか低下しなかったという事実がこの判断をさらに裏付けている。次回のSmokeベンチマークでもコード実行部門を引き続き追跡し、2日連続で80点を下回った場合に初めて詳細な再テストを実施することを推奨する。現時点のデータはClaude Opus 4.7の採用評価を引き下げる根拠とはならない。

工学的判断スコアが75.00点から100.00点に、タスク表現スコアが90.00点から95.00点に上昇し、2つのサブランキング(AI補助評価)部門が同時に改善されたことは、コード実行以外のタスクにおけるモデルの安定性が影響を受けていないことを裏付けている。

モデル選定を進めているチームにとって、Claude Opus 4.7の本日のデータは単一部門における抽選変動を示すにすぎず、このモデルを見送る十分な理由にはならない。素材制約95.00点・工学的判断100.00点というデータは、書式の忠実性や工学的意思決定に高い要件を持つ場面に適している。

安定性部門が測定するのはモデルが同種の問題に複数回回答した際のスコア標準偏差であり、今回の1日あたり30.5点の変動は小サンプルの抽選において通常の範囲内に収まる。主要ランキングの80.98点は依然として実用可能な水準にある。

全部門のデータを総合すると、Claude Opus 4.7の本日のSmokeベンチマークにおける異常はコード実行の1問に集中しており、素材制約と工学的判断の顕著な上昇がネガティブな影響の大部分を相殺している。利用者は引き続き当初の計画どおりこのモデルを使用しながら、今後2日間のコード実行スコアが90点以上に回復するかどうかを注視することが望ましい。


データソース:YZ Index | Run #266 | 元データを見る