Claude Opus 4.7、コード実行75.00点・素材制約100.00点——総合ランキングは3.7点上昇

Claude Opus 4.7の本日のSmokeベンチマークにおいて、コード実行スコアは昨日の99.60点から75.00点に低下し、素材制約スコアは61.70点から100.00点に上昇した。総合ランキングのスコアは82.55点から86.25点に上昇した。

スコア変動の直接的な事実

コード実行部門では−24.6点の下落、エンジニアリング判断部門では−11.1点の下落が発生し、タスク表現部門は91.70点のまま変化なしとなった。素材制約部門では+38.3点の上昇が見られた。これにより総合ランキングのスコアは正味3.7点増加した。誠実性評価は「pass」を維持している。

サンプリングによる変動とモデル劣化の区別

Smokeベンチマークでは、コード実行・素材制約それぞれ1日2問ずつしか出題されない。1日合計10問という少ない出題数では、問題の抽選差異だけで20点以上の変動が生じ得る。コード実行が99.60点から75.00点に下落したことと、素材制約が61.70点から100.00点に上昇したことが同時に起きていることから、当日の問題が2つの部門で逆方向の難易度分布を示していたことがわかる。特定の能力でシステム的な劣化が生じたわけではない。

エンジニアリング判断が86.10点から75.00点に下落した幅はコード実行より小さく、タスク表現に変化がないことも、変動の原因が問題の抽選にあり、モデルのパラメータや推論チェーンに永続的な変化が生じたわけではないという見方を裏付けている。

コード実行を重視するチームへの影響

コード実行の精度に依存する開発者は、本日75.00点というスコアを目にすることになる。これは昨日の99.60点を下回っており、本番環境向けにフォールバック手段や人手による検証ステップを用意しておく必要がある。一方、素材制約が満点100.00点を記録したことは、ユーザーが提供した素材を厳格に遵守する点でこのモデルが安定していることを示しており、高い忠実度の出力が求められる文書生成や知識抽出のシナリオに適している。

モデル選定企業への戦略的示唆

総合ランキングの86.25点は昨日の82.55点を上回っており、単一部門の下落によって総合能力が損なわれていないことを示している。コード実行と素材制約の両部門を同時に活用している企業は、Claude Opus 4.7全体の優先度を下げるのではなく、コード実行のシナリオにおいてテストケースのカバレッジを増やすことが望ましい。エンジニアリング判断の75.00点は昨日の86.10点を下回っており、エンジニアリング上の意思決定支援を必要とするチームは追加検証が必要である。

安定性シグナルの判断

1日あたりわずか4問のサンプリングにおいて、コード実行−24.6点・素材制約+38.3点という相殺的な変動は正常範囲内である。現時点のデータは、モデルの実質的な劣化という結論を支持しない。次回の評価でコード実行が85点を継続的に下回る、または素材制約が70点を下回るような場合に、改めて劣化の確認を行うべきである。

コード実行75.00点と素材制約100.00点が同時に出現したことは、当日の問題難易度が2つの部門で互いに補完的な分布を示していたことを意味しており、モデル能力に構造的な低下が生じたわけではない。

現時点のスコア比較に基づけば、Claude Opus 4.7の総合ランキングは素材制約の満点によって向上しており、コード実行の単日低スコアはサンプリング変動の結果である可能性が高い。コード実行を重視するチームは検証ステップを追加する必要があるが、素材制約を重視するシナリオではこのモデルを引き続き活用できる。


データ出典:YZ Index | Run #280 | 元データを見る