GLM-4.6、素材制約スコア+28.2点も工程判断-39.6点――誠実性評価がfailからpassに転じ、メインランキングは12.7点上昇

GLM-4.6は本日のSmoke評価テストにおいて、コード実行スコアが50.00点で前日と変わらず、素材制約スコアが46.10点から74.30点に上昇した。その結果、メインランキングは48.25点から60.94点へ上昇し、誠実性評価はfailからpassに転じた。

データの事実分析

前日と本日のスコアを比較すると、コード実行次元は50.00点で完全に横ばい、素材制約次元は1日で28.2点増加した。工程判断は64.60点から25.00点へ、タスク表現は50.00点から25.00点へそれぞれ低下した。メインランキング全体で12.7点の上昇となり、その主な要因は素材制約の向上にある。

要因分析

Smoke評価テストは1日あたりわずか10問(次元ごとに2問)であり、サンプル数が極めて少ないため、出題の抽選によるばらつきがスコア変動の最も直接的なメカニズムとなっている。素材制約次元のスコアが大幅に上昇したことは、本日抽選された2問において、素材への忠実度という要件でモデルがより良いパフォーマンスを発揮したことを示している。工程判断とタスク表現の両サブランキング次元がそれぞれ-39.6点・-25点の下落を示したことは、抽選された問題が工程上の意思決定およびタスク記述に対してより高い要求を課すものであった可能性を示しており、これらのサブランキング問題においてモデルの失点が増加した。誠実性評価がfailからpassに転じたことは、本日の抽選問題においてモデルが誠実性の減点項目を発動させなかったことを反映している。

素材制約74.30点 vs 工程判断25.00点――同一モデルの同日において異なる次元間で38.3点の差が生じており、これはモデルアーキテクチャの劣化ではなく出題抽選を起因とするものである。

利用者への示唆

素材制約を重視するシナリオの開発者は、原文への厳密な忠実性が求められるタスクを当日の高スコアモデルで実行することを検討できる。工程判断を重視するチームは、サブランキング25.00点が意思決定の不一致リスクをもたらす可能性に注意し、重要な工程フェーズでは人による確認を追加することを推奨する。タスク表現に依存するシナリオも同様に25.00点水準に直面しており、出力の構造化レベルが低下する可能性がある。

戦略的判断

メインランキング60.94点への改善は完全に素材制約の単一次元によって牽引されており、コード実行が50.00点で変わらないことから、モデルのコア実行能力には系統的な変化が生じていないことがわかる。工程判断とタスク表現の両サブランキングが同時に大幅下落したことは、小サンプル抽選の典型的な結果であり、モデルの実際の劣化を支持する証拠は現時点では存在しない。誠実性評価のpass転換は肯定的なシグナルであるが、サブランキングの激しい変動は、次回のSmoke評価テストにおいて工程判断次元が60点以上に回復するかどうかを継続的に観察する必要性を示唆している。

今回の評価テストにより、Smoke1日10問の設計下ではサブランキングスコアの標準偏差が30点を超えやすい一方、メインランキングは相対的に安定していることが改めて確認された。モデル選定を行う企業は、単日データではなく連続3日間のメインランキング平均値を参考指標とすべきである。


データ出典:YZ Index | Run #308 | 元データを見る