Grok 4は本日のSmoke評価テストにおいて、材料制約スコアが昨日の100.00から84.20へと直接低下し、下落幅は15.8点に達した。これによりメインランキング全体が95.44から90.86へと下落した。
主要データの比較
コード実行の評価軸は91.70から96.30に上昇し、4.6点増加。材料制約は100.00から84.20に低下し、15.8点減少。エンジニアリング判断(サイドランキング、AI補助評価)は79.90から61.10に低下し、18.8点減少。タスク表現(サイドランキング、AI補助評価)は70.00で変動なし。メインランキングの最終結果は90.86。誠実性評価はwarnからpassに転じた。
スコア変動の原因分析
Smoke評価テストは1日あたりわずか10問で、各評価軸につき2問のみ出題されるため、1日の抽選による変動がスコアの変化を増幅させやすい。材料制約とエンジニアリング判断が同時に大幅な低下を示したことは、今回抽選された問題が材料への忠実度をより厳しく求めるものであったか、あるいはモデルの引用制約における一貫性に明らかな問題が生じたことを示唆する。一方、コード実行スコアの上昇は、この評価軸における回答の安定性が比較的高く、モデル全体の能力が低下したわけではないことを示している。
材料制約の評価軸はメインランキングの算出に直接影響するため、15.8点の下落はメインランキング4.6点の低下を十分に説明できる。エンジニアリング判断の18.8点下落はサイドランキングに属するものの、材料制約との同期した変動は、指定された材料を厳密に遵守することが求められるタスクにおいて、モデルがより多くの逸脱や見落としを生じさせた可能性を示唆している。
利用者への具体的な意味
契約審査・政策解釈・長文書の要約など、材料制約への依存度が高い用途においては、Grok 4の本日の結果を踏まえると、人による追加確認工程を設けることが望ましい。コード実行スコア96.30は、コードの作成やデバッグを行う開発者にとって依然として参考価値があるが、材料制約84.20というレベルは、原文の厳密な引用が求められるタスクにおける信頼性を低下させる。
誠実性評価がpassに転じたことは、本回の評価テストにおいてモデルが明らかな規約違反や幻覚的な出力を示さなかったことを意味し、コンプライアンス準拠の出力を必要とするチームには肯定的なシグナルとなる。ただし、これにより材料制約の低下がもたらす使用上のリスクが相殺されるわけではない。
戦略的判断
単日データに基づく限り、メインランキングの低下は主に材料制約によって決定されており、コード実行の向上はモデルが評価軸間で明確な差異を持つことを示している。エンジニアリング判断と材料制約の同期した下落は、今回の問題抽選がモデルの制約遵守における不安定性を増幅させた可能性を示しており、持続的な性能劣化を意味するものではない。
今回の変動幅はSmoke評価テストの通常の範囲を超えており、次回の評価テストでは材料制約が95点以上に回復するかどうかを重点的に観察することを推奨する。2日連続で85点を下回った場合には、Grok 4を材料感度の高いタスクの優先候補リストから一時的に除外する必要がある。
現時点のデータは、今回の低下をモデル全体の能力低下と解釈することを支持しない。判断できるのは、材料制約の評価軸が今回の抽選において明確な変動を示したという事実のみである。メインランキングの順位に依拠してモデルを選定するチームにとって、Grok 4の本日のメインランキングスコア90.86は昨日の水準を下回っており、使用にあたってはコード実行と材料制約という2つの評価軸の実際のパフォーマンスをシナリオ別に区別する必要がある。
データ出典:YZ Index | Run #334 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接