Claude Opus 4.7は本日のSmoke評価テストにおいて、材料制約スコアが昨日の80.20点から64.30点へと下落し、主榜全体も91.09点から83.94点に低下した。
コア次元の分解
コード実行次元は100.00点で変動なし、材料制約次元は-15.9点の下落となった。主榜はこの2つの監査可能な次元のみで構成されているため、材料制約の1日の下落が直接的に総合ランキングを押し下げた。エンジニアリング判断サイドランキングは100.00点から75.00点へ低下し、タスク表現サイドランキングは63.90点から80.60点へ上昇した。
変動要因の分析
Smoke評価テストは1日あたり10問のみで、そのうち2問が材料制約次元に対応している。64.30点という結果は、この次元の2問の平均スコアが昨日を大幅に下回ったことを意味する。考えられる原因としては、問題の抽選による難易度の差異、またはモデルが材料への忠実度において一時的な不整合を起こした可能性が挙げられる。コード実行次元の2問はいずれも満点を維持しており、同モデルがその能力において同様の変動の影響を受けていないことが示された。
エンジニアリング判断サイドランキングの-25点の下落が材料制約と同期していることから、外部資料を組み合わせてエンジニアリング上の判断を行うシナリオでモデルのパフォーマンスが低下していることが示唆される。一方、タスク表現サイドランキングの+16.7点の上昇はタスク記述の明確さが改善されたことを示しており、両者の変化の方向が逆であることから、今回の変動が材料処理の段階に集中していることがさらに裏付けられる。
利用者への具体的な意味
材料制約に大きく依存するチーム、たとえば所定のドキュメントやコードベースを厳密に参照させるRAGアプリケーションを必要とするチームにとって、本日のデータはClaude Opus 4.7が単日テストで明らかな偏差を示したことを意味する。コード実行が安定しているチームは、純粋なプログラミングタスクに引き続き同モデルを使用できるが、材料引用の正確性については人手による追加確認が必要となる。
法律契約の審査や製品仕様の照合など、材料への忠実度が求められるシナリオにおいては、64.30点という水準は2問につき少なくとも1問で明らかな逸脱が生じることを意味する。開発者はモデルの出力をそのまま採用するのではなく、本番ワークフローに材料制約の検証ステップを追加すべきである。
戦略的判断
現在のスコア比較に基づくと、材料制約の-15.9点という下落は、1日10問という枠組みの下では、モデルの実質的な劣化よりも問題の抽選による変動に起因する可能性が高い。コード実行次元の変動ゼロは、モデルのコア能力が全体的に低下していないことを裏付けている。誠実性評価は「pass」を維持しており、参入基準の問題は生じていない。
次回のSmoke評価テストでも材料制約が65点以下を維持する場合、そのシグナルはモデルの一貫性低下の初期証拠として扱う必要がある。現時点では単日データのみではモデルが過大評価または過小評価されているかを判定するには不十分であり、Claude Opus 4.7の材料制約パフォーマンスを次回の重点追跡リストに加えることを推奨する。
主榜は91.09点から83.94点へと低下し、その主な要因は材料制約によるものである。コード実行が満点を維持しているという事実は、Claude Opus 4.7が監査可能な能力において依然として競争力を持つことを示しているが、材料制約の変動はすでに全体的な実用性に対して測定可能な影響を及ぼしている。
データソース:YZ Index | Run #324 | 生データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接