GLM-4.6は本日のSmoke評価テストにおいて誠実性評価がpassからfailへと直接転落し、コード実行スコアは前日の50.00点から97.00点へと上昇、メインランキング総合スコアも62.83点から74.00点に上昇した。
スコア変化の内訳
素材制約スコアは78.50点から75.00点に低下、エンジニアリング判断スコアは60.40点から0.00点に急落、タスク表現スコアは50.00点のまま変化なし。メインランキングのコアはコード実行と素材制約の加重合算のみで構成されているため、コード実行の1日あたり47点の上昇がメインランキング全体を11.2点押し上げた。
考えられる原因の分析
Smoke評価テストは1日あたり10問・各スコア領域2問という構成であり、1日単位の抽選による変動だけでも大きなスコアの揺れが生じ得る。コード実行が50.00点から47点急上昇した背景には、本日の抽選でモデルが得意とするプログラミング問題が2問選ばれた可能性が極めて高い。エンジニアリング判断がゼロに帰着したのは、本日抽選されたサブランキングの2問に対してモデルが有効な判断をまったく示せなかったことを示している。素材制約のわずか3.5点の下落とタスク表現の無変化は、モデルがコア審査可能な評価軸において系統的な性能劣化を起こしていないことを示している。
誠実性評価がpassからfailへと変化したことは参入資格に関わるイベントであり、加点項目ではない。この変化はエンジニアリング判断の0.00点と直接関連している可能性が最も高く、モデルがサブランキングの問題においてファクトの捏造や論理的断絶を起こし、評価システムが誠実性の基準を満たさないと判定した可能性がある。
ユーザーへの具体的な意味
コード実行を重視する開発チームは本日もGLM-4.6を引き続き使用可能であり、97.00点のパフォーマンスは前日を上回っている。ただし、人手によるコードレビューのプロセスを並行して実施する必要がある。素材への忠実性が求められるシナリオでは警戒が必要であり、素材制約スコアの75.00点は前日を下回っており、かつ誠実性評価のfailはモデルの出力に検証不可能なコンテンツが含まれる可能性を示している。
エンジニアリング判断への強い依存がある自動化フロー(要件レビューや設計判断の補助など)は直ちに他のモデルへ切り替える必要があり、0.00点はGLM-4.6がこの種の問題で完全に機能しなくなっていることを示している。
戦略的判断
現在のスコア比較に基づくと、GLM-4.6のメインランキング上昇はコード実行という単一スコア領域によって牽引されており、総合的な能力向上ではない。誠実性評価のfailとエンジニアリング判断のゼロが同時に発生していることは、モデルの真の劣化というよりも、1日単位の抽選変動による可能性が高い。次回のSmoke評価テストではエンジニアリング判断と誠実性評価が回復するかどうかを重点的に検証し、この変動の性質を確認する必要がある。
現時点のデータは、GLM-4.6を継続的な過大評価または過小評価と断定することを支持しない。唯一明確なシグナルは、サブランキング評価軸における極端な不安定さが継続的な追跡に値するという点である。
データ出典:YZ Index | Run #241 | 原データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接