2026-09-03 Run#307において、GLM-4.6の誠実性評価はfail、プローブスコアは15.00、主要ランキングスコアは48.25、コード実行スコアは50.00、素材制約スコアは46.10であった。
スコア構造の詳細分析
今回のSmokeクイックテストの主要ランキングは、コード実行と素材制約の2つの次元のみを含む。GLM-4.6はコード実行50.00点・素材制約46.10点と、いずれも60点を下回り、主要ランキングを48.25点まで引き下げた。誠実性プローブスコア15.00は独立したシグナルであり、上記2次元とは直接の関連はない。
同日の他の全モデルは誠実性評価をpassした:GPT-o3プローブ80.00、Doubao Pro 80.00、GPT-5.5 90.00、Claude Sonnet 4.6 90.00、Gemini 3.1 Pro 80.00、Grok 4 80.00、Claude Opus 4.7 100.00、Qwen3 Max 90.00、Gemini 2.5 Pro 90.00、DeepSeek V4 Pro 80.00。
誠実性failの発動メカニズム
誠実性評価は42個のカナリアプローブを用いて、モデルが架空の実体を実在する引用元として扱うか否かを検出する。GLM-4.6のプローブスコア15.00は、少なくとも一部のプローブにおいて出典や引用を捏造したことを示している。Smokeテストは、プローブの発動は問題の難易度とは無関係であり、独立したシグナルであると明確に指摘している。
過去のデータによると、GLM-4.6は2026-09-01のRun#304でも同様にfail(プローブ25.00)、2026-09-02のRun#305ではwarn(プローブ45.00)となっている。3回のテストのうち2回でfailが発動しており、プローブスコアは継続して低水準にある。
利用者への具体的な影響
素材制約46.10点は、長文書の引用検証タスクにおいて、モデルが与えられた素材に厳密に基づいて回答し正確に引用することができていないことを意味する。正確な引用を必要とする企業文書処理・法律契約審査・学術文献整理の場面では、リスクが高くなる。
コード実行50.00点は、実際のPythonサンドボックスの通過率が中程度以下であることを示している。データ分析スクリプトや自動化テストを安定して実行する必要がある開発者は、追加の人手による検証プロセスを設ける必要がある。
誠実性failは、検証可能な出典を必要とする場面に直接影響する。金融調査レポート・政策解説・製品ホワイトペーパーなどの成果物に架空の引用が含まれた場合、コンプライアンスおよび信頼性の問題を引き起こす。
戦略的判断
GLM-4.6の現時点での主要ランキング48.25点と素材制約46.10点の組み合わせは、厳格な素材制約下でのパフォーマンスとコード実行能力がいずれも合格ラインに達していないことを反映している。プローブスコア15.00という独立した失敗シグナルは、引用の真正性制御におけるモデルの構造的な不足を示している。
同日に誠実性評価をpassした全モデルのプローブスコアは80以上であり、明確な対比をなしている。GLM-4.6の複数回にわたるfail記録は、それが偶発的な変動なのか継続的な問題なのかを確認するため、継続的な観察が必要である。
モデル選定を進める企業にとって、GLM-4.6は引用精度への要求が比較的低い社内草稿生成の場面に適している。素材への忠実度が求められる本番環境では、プローブスコア90以上のモデルを優先的に選択し、人手による検証プロセスを維持することを推奨する。
データ出典:YZ Index | Run #307 | 元データを確認する
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接