本日のSmokeベンチマークにて、GLM-4.6の材料制約スコアは75.00点から47.70点に下落し、メインランキングスコアは46.29点から76.47点に上昇した。
スコア比較の概要
コード実行は22.80点から100.00点へ上昇、材料制約は75.00点から47.70点へ下落、エンジニアリング判断は100.00点から63.90点へ下落、タスク表現は66.70点から50.00点へ下落、メインランキングは46.29点から76.47点へ上昇、誠実性評価はpassからwarnへ変化した。
評価次元の構成と変動メカニズム
メインランキングはコード実行と材料制約の2次元のみで構成されている。本日は材料制約が27.3点下落したが、コード実行が77.2点上昇したため、両者の平均によってメインランキングは30.2点の上昇となった。Smokeベンチマークは1日あたり10問のみ(各次元2問)であり、1日単位の抽選によるスコアの変動は通常の範囲内とみなされる。材料制約スコアの下落は、モデル全体の能力低下ではなく、当日の出題が材料への忠実度をより厳しく問う問題であった可能性が最も高い。
コード実行100.00点と材料制約47.70点の組み合わせが、メインランキングを76.47点へと押し上げた。
原因分析
材料制約次元はモデルが所与の材料に対してどれだけ忠実であるかを重視する。スコアが75.00点から47.70点へ下落したことは、当日の問題においてモデルが材料の内容から逸脱した回答を多く生成したことを示している。コード実行次元は22.80点から100.00点へと上昇しており、コード関連の問題でモデルが安定した正確な出力を示したことが確認できる。サブランキングに位置するエンジニアリング判断とタスク表現の2次元も同時に下落し、それぞれ36.1点・16.7点の減少となっており、当日の問題難易度の分布が前日と異なっていたことをさらに裏付けている。誠実性評価がpassからwarnへ変化したことは、モデルが一部の回答において記録可能な誠実性の問題を生じさせたことを意味する。
利用者への示唆
コード実行を重視するチームは引き続きGLM-4.6を使用できる。コード実行次元はすでに100.00点を達成しているためだ。一方、材料への忠実度が求められるシナリオでは注意が必要であり、47.70点という材料制約スコアは、モデルが所与の材料と一致しない内容を生成しやすい状態にあることを意味する。エンジニアリング判断とタスク表現に依存する開発者は、これら2つのサブランキング次元でいずれも顕著な下落が見られるため、出力の手動検証を追加で行う必要がある。
戦略的判断
メインランキングスコアの上昇はコード実行という単一次元に主導されたものであり、材料制約の27.3点の下落がその優位性の一部を相殺している。誠実性評価がwarnへ変化したことは、今回のベンチマークにおいて継続的に追跡すべき唯一のシグナルである。次回のSmokeベンチマークで材料制約スコアが依然60点を下回った場合には、モデルに真の性能低下が生じているかどうかを判断する必要がある。材料制約スコアが70点以上に回復した場合は、今回の変動は問題の抽選によるものとみなす可能性が高い。
今回のベンチマークデータは1日10問の結果のみを反映しており、継続的な性能低下という結論を支持するものではない。モデル選定を行う企業は、材料制約次元のスコアが75点以上に回復した後にGLM-4.6の総合的な安定性を評価することが望ましい。
データ出典:YZ Index | Run #256 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接