Claude Opus 4.7は本日のSmoke評価テストにおいて、総合スコアが98.35点から90.16点へと8.2点下落した。主な要因は、資料制約スコアが100.00点から87.90点へと急落したこと(-12.1点)、およびコード実行スコアが97.00点から92.00点へと低下したこと(-5点)である。
データ分析:総合スコア下落の直接的な要因
総合スコアはコード実行と資料制約の2つの次元の加重平均のみで構成される。本日の資料制約は1日で12.1点を失い、総合スコア下落分の大部分を占めた。コード実行は5点の損失で残りの部分に寄与した。エンジニアリング判断は75.00点で変化なし、タスク表現は66.70点から56.70点に低下したが、これら2つの次元はサブスコアに属し、総合スコアには算入されない。
Smoke評価テストは1日あたり各次元2問のみで、サンプル数が極めて少ないため、1日単位の変動は本来正常な範囲内にある。しかし、資料制約の下落幅が10点を超えており、これは同種の短期テストの過去データと比較して比較的大幅な変動といえる。
原因分析:問題の偏りかモデルの実質的な劣化か
次元の構成から見ると、資料制約は主に与えられた資料に対するモデルの事実的忠実度と境界の遵守を評価する。本日の87.90点は、少なくとも1問において明らかな逸脱または事実からの乖離が生じたことを意味する。コード実行が92.00点に低下したことも、特定の問題でコード実行エラーまたは形式違反が発生したことを示している。
1日2問のみの抽出であるため、「難問の集中」が起こりやすい状況にある。すなわち、2問の資料制約問題がいずれも厳格な境界制御を要求し、そのうち1問でモデルの制約の弛緩が発生した可能性がある。もう1つの可能性は、連続する複数ターンの対話や長い指示において、資料に対する忠実度がランダムに変動したことである。
現時点のデータは「抽出による変動」という説明のみを支持している。1日単位の比較では、モデルのパラメータやアライメント戦略に系統的な劣化が生じたことは証明できない。エンジニアリング判断が変化しておらず、誠実性評価も引き続きpassであるためである。
利用者にとっての具体的な意味
資料制約に強く依存するユースケース(法律契約の情報抽出、社内ナレッジベースのQ&A、コンプライアンスコンテンツ生成など)において、Claude Opus 4.7の本日のパフォーマンスは人的レビュー工程の追加が必要であることを示唆している。資料制約87.90点は、厳格な忠実度が求められる場面でエラーの発生確率が明らかに上昇していることを意味する。
コード実行に高い要求を持つ開発チームにとって、92.00点は引き続き実用可能な範囲内にあるが、形式エラーや境界エラーの発生率上昇に注意が必要である。エンジニアリング判断が75.00点を維持していることから、工学的なトレードオフが求められる非決定論的なタスクではモデルのパフォーマンスが相対的に安定しており、引き続き使用可能である。
タスク表現が56.70点に低下したことは、明確なタスク分解が必要なプロンプトエンジニアリングの場面への影響は限定的である。この次元は総合スコアに算入されないためである。
戦略的判断:継続的な監視は必要か
1日分のデータに基づくと、Claude Opus 4.7の総合スコア下落は主に、極めて少ないサンプル数における資料制約次元の大幅な変動に起因している。次回のSmoke評価テストでは、資料制約スコアが95点以上に回復するかどうかを重点的に観察することを推奨する。資料制約スコアが2日連続で90点を下回った場合は、モデルがその次元で短期的な劣化を生じている可能性を検討する必要がある。
現時点では本日のデータのみでは、モデルが過大評価または過小評価されているかを判断するには不十分である。次回の検証で注目すべきシグナルは、より大きなサンプルにおいて資料制約が95点以上で安定するか、およびコード実行が96点台に回復するかどうかである。
モデル選定を検討する企業にとっては、短期的にはClaude Opus 4.7を引き続き使用できるが、資料制約が影響する場面では追加の検証ポイントを設け、1日単位の変動がそのまま出力品質に影響しないよう対策すべきである。
データソース:YZ Index | Run #286 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接