Claude Sonnet 4.6、コード実行スコアが27.4点急落——素材制約は37.7点急騰

Claude Sonnet 4.6は本日のSmoke評価テストにおいて、コード実行部門のスコアが昨日の71.90点から44.50点へ27.4点下落し、素材制約部門は50.60点から88.30点へ37.7点上昇した。メインスコアは62.32点から64.21点へわずか1.9点の増加にとどまった。

スコア比較データ

エンジニアリング判断(サブスコア、AI補助評価)は75.00点から100.00点へ上昇し、タスク表現(サブスコア、AI補助評価)は83.90点から45.00点へ下落した。誠実性評価はpassを維持。Smoke評価テストは1日あたり10問のみで、各部門2問ずつのため、単日スコアの変動は通常の範囲内とされているが、今回のコード実行と素材制約が逆方向に大幅変動した幅は、これまでの単日記録を超えるものとなった。

原因分析

コード実行部門は2問のみであるため、昨日は複数ステップのデバッグや複雑なロジックを要する問題が抽出された可能性があり、今日は単純な計算や既知のパターンの問題が抽出されたことで、スコアが直接27.4点落ち込んだと考えられる。素材制約部門では昨日、原文への厳格な忠実性が求められる制約タスクに当たった可能性があり、今日は制約が緩やかな素材が抽出されたことでモデルの出力が評価を通過しやすくなった。タスク表現部門も同様に2問という制限を受けており、昨日の高スコアは構造が明確な出力によるものであった可能性があり、今日の低スコアは正確なフォーマットを要するタスクが抽出されたことによる可能性がある。メインスコアはコード実行と素材制約の加重平均で算出されるため、両部門が一方は下落・一方は上昇した結果、純変動はわずか+1.9点となり、メインスコアが極端な変動に対して一定の緩衝機能を持つことが示された。

利用者への示唆

コード実行を重視するチームがClaude Sonnet 4.6をアルゴリズムやデータ処理タスクに活用する場合は、人間によるレビュー工程を追加する必要がある。単日44.50点という水準では、実際のシナリオでより多くの実行エラーが発生する可能性があるためだ。契約審査や技術文書生成など、素材への忠実性が重要なシナリオでは、本日の88.30点という結果がモデルの制約遵守における潜在能力を示しており、当該タスクでの優先的なテストが推奨される。エンジニアリング判断が満点に達したことは、サブスコア評価においてモデルがエンジニアリング判断系の問題でより信頼性の高い出力を行っていることを意味するが、タスク表現の45点は、明確な表現が求められるシナリオでフォーマットや論理の飛躍が生じる可能性を示唆している。

戦略的見解

今回の変動は、モデルの実質的な性能劣化によるものではなく、出題の抽選による変動が最も可能性の高い原因と考えられる。Smoke評価テストはサンプル数が少なく、各部門わずか2問であるため、問題の難易度や制約の強度のわずかな差異でもスコア差が増幅される。メインスコアは依然として64点台を維持しており、総合的な能力に系統的な低下は見られない。次回の評価テストでは、コード実行部門が60点以上に回復するかどうか、および素材制約が70点以下に戻るかどうかを重点的に観察することを推奨する。両部門が同時に現在の極端な水準を維持する場合は、対応するタスクにおけるモデルの安定性についてさらなる検証が必要となる。

現在モデルを選定中の企業にとって、Claude Sonnet 4.6の素材制約部門における単日高スコアは参考にはなるが、コード実行の低スコアはコア的なコード生成ツールとして直接導入することが適切でないことを示唆している。このモデルを複数ラウンドのデバッグタスクに活用している開発者は、スコアの変動に備えてバックアップモデルまたは人工検証プロセスを準備しておくべきだ。


データソース:YZ Index | Run #361 | 元データを見る