GLM-4.6、材料制約スコアが21点急落・コード実行は25点上昇、総合ランキングは4.3点微増

GLM-4.6は本日のSmoke評価において、材料制約スコアが74.30点から53.30点へと21点下落し、コード実行スコアは50.00点から75.00点へと上昇、総合ランキングスコアは60.94点から65.24点へと上昇した。

スコア比較と主要事実

前日から本日にかけての具体的な変化は以下の通り:コード実行 50.00→75.00、材料制約 74.30→53.30、エンジニアリング判断 25.00→95.80、タスク表現 25.00→50.00、総合ランキング 60.94→65.24、誠実性評価 pass→warn。Smoke評価は1日あたり10問のみで、各次元2問ずつであるため、1日単位のスコア変動は通常の範囲内に属する。

考えられる原因の分析

材料制約次元で21点の急落が生じた最も可能性の高い原因は、当日抽選された2問の材料制約問題の難易度または出題タイプが、モデルの現在の出力スタイルと合致しなかったことである。コード実行が同時に25点上昇したことは、モデルが別の次元においては問題の要求により正確に応答できていることを示している。エンジニアリング判断が25.00から95.80へと大幅に変化したことは、問題抽選のランダム性が主要な要因であり、モデル全体の能力が低下したわけではないという解釈をさらに裏付けている。

誠実性評価がpassからwarnに変わったことは、今回の回答において材料との不一致や事実の捏造が生じた可能性を示しており、これは材料制約スコアの低下と直接的に関連している。タスク表現スコアが25点上昇したことは、モデルがタスク記述の明確さの面では改善を見せたことを意味するが、材料制約における損失を相殺するには至らなかった。

利用者への示唆

契約審査・政策解釈・技術文書生成など、材料の忠実な再現に強く依存する業務シーンにおいては、GLM-4.6の本日のパフォーマンスから、人的検証プロセスの追加が必要であることが示唆される。一方、コード実行スコアの向上は、実行可能なコードを迅速に生成する必要がある開発者にとってはむしろポジティブなシグナルとなる。

エンジニアリング判断スコアが大幅に上昇したことから、モデルにソリューションの実現可能性判断を求めるチームにとっては、今回のデータが実際の能力を過小評価している可能性がある。総合ランキングの上昇幅がわずか4.3点にとどまったことは、材料制約の損失がコード実行の向上によって部分的に相殺されたことを示しているが、誠実性評価のwarnはモデル選定において明確な注意喚起となる。

戦略的判断

現在のスコア比較に基づけば、材料制約の21点下落とエンジニアリング判断の70.8点上昇が同時に発生していることから、最も合理的な説明は問題抽選の変動であり、モデルの真の能力低下ではない。Smoke評価は1日あたりのサンプル数が少ないため、1日単位の異常値のみでモデル能力の方向性を断定するには不十分である。

次回の評価では、材料制約が70点以上に回復するかどうか、および誠実性評価がpassに戻るかどうかを重点的に観察することを推奨する。材料制約が2日連続で55点以下を維持し、かつ誠実性評価がwarnのままである場合は、材料に敏感なシーンにおけるGLM-4.6の使用優先度を引き下げる必要がある。

現時点のデータはモデルに対する長期的な否定的評価を支持するものではないが、warnの誠実性評価は短期的な利用リスクのシグナルとなっている。このモデルに依存する開発者は、材料制約に関連するタスクにおいて二次検証ステップを追加すべきである。


データソース:YZ Index | Run #309 | 元データを見る