GLM-4.6は2026年10月2日実施のYZ Index Smokeクイックテストにおいて、総合スコア67.94点、コード実行41.70点、材料制約100.00点、誠実性評価fail(プローブスコア15.00点)という結果を記録した。
スコア構造の乖離が最も顕著
材料制約100.00点とコード実行41.70点の間には明確な対比がある。材料制約の満点は、与えられた長文ドキュメントを基にした引用・参照タスクにおいて、モデルが資料を厳格に遵守し、出典を正確に標記できることを示している。一方、コード実行41.70点は実際のPythonサンドボックス環境での実行成功率が低いことを意味しており、同日の複数モデルと比較しても低い水準にある。
誠実性評価failは独立したシグナルである。42個のカナリアプローブにより、モデルが架空のエンティティを実在する引用元として提示していることが検出され、プローブスコアはわずか15.00点だった。同日のClaude Opus 4.7、Gemini 2.5 Pro、Gemini 3.1 Proのプローブスコアはいずれも90.00点、GPT-6 SolおよびDeepSeek V4 Proのプローブスコアはそれぞれ80.00点であり、GLM-4.6は唯一のfailモデルとなった。
プローブ発動メカニズムの分析
誠実性プローブと材料制約の評価軸は独立している。材料制約は与えられた資料に基づいて回答しているかを検証するもので、GLM-4.6がこの項目で満点を獲得したことは、制御された資料内での挙動が適切であることを示している。プローブfailが示すのは、モデルが回答の中で自発的に外部出典や架空エンティティへの引用を捏造していることであり、問題の難易度とは無関係である。
履歴記録によると、GLM-4.6は以前の2026年9月29日Run#343でもfailが発生しており(プローブ25.00点)、2026年10月1日Run#354ではpassに転じていた(プローブ90.00点)。今回再びfailとなったことは、誠実性問題が繰り返し発生していることを示している。
利用者にとっての具体的な意味
コード実行を重視するチームは、GLM-4.6の実行成功率41.70点に注意が必要である。Pythonスクリプトの頻繁な実行、データ処理、アルゴリズム検証が求められるシナリオでは、このモデルのエラー発生確率が相対的に高い。
資料への忠実度が重要なシナリオでは、GLM-4.6の材料制約100.00点がある程度の保証を提供する。ただし、誠実性failは、外部引用や出典確認が必要なタスクにおいてモデルが架空エンティティや誤った出典を挿入する可能性があることを意味し、その後の人手による確認コストを増大させる。
モデルによるレポートや技術文書の生成に依存する開発者は、出典検証の工程を追加で設けるべきである。プローブスコア15.00点という低スコアは、このリスクを直接的に反映している。
戦略的判断
GLM-4.6は材料制約の評価軸で満点を達成しており、制御されたインプット下での引用能力が高い水準に達していることを示している。しかし、コード実行41.70点と誠実性failが合わさって明確な弱点を形成しており、高い一貫性と検証可能なアウトプットが求められるシナリオでは不利な立場となる。
同日の他の13モデルの誠実性評価はいずれもpassまたはwarnであり、GLM-4.6は唯一のfailケースとなった。このシグナルは、今後のSmokeクイックテストにおいて継続的に追跡し、コード実行スコアと誠実性プローブスコアの変動を観察する価値がある。
現時点のデータに基づけば、GLM-4.6は材料制約の要件が高くコード実行の需要が低い特定のタスクに適している。信頼性の高いコード実行と信頼できる出典の両方を必要とするチームにとって、現在のスコア構造は最適な選択とは言えない。
データソース:YZ Index | Run #356 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接