GLM-4.6は本日のSmoke評価において、コード実行・資料制約・エンジニアリング判断・タスク表現・総合スコアの5次元でデータが完全に欠落した。現在は自動再実行の対象となっており、今回のランキングには参加しない。
データの事実
スコア比較表において、コード実行・資料制約・エンジニアリング判断・タスク表現・総合スコアのすべてが「- → -(-)」と表示されている。Smoke評価は毎日10問を実施しており、1日単位のスコア変動は通常の範囲内であるが、今回はスコアの変動ではなく、全次元の記録が空欄となっている。
原因分析
問題の抽選によるばらつきは通常、個別問題のスコア変動を引き起こすにとどまり、次元全体の記録欠落にはつながらない。モデルの実質的な性能低下であれば、スコアの連続下降や特定次元のスコア低下として現れるはずであり、APIのタイムアウトや障害とは異なる。今回の異常はAPI障害・タイムアウトによるものと明示されているため、最も可能性の高い原因はインターフェース層の接続断であり、モデルのパラメータや推論能力の変化ではない。
コード実行次元と資料制約次元が同時に欠落していることは、モデル内部の判断・表現能力の低下ではなく、呼び出しチェーンの問題をさらに示唆している。
利用者への示唆
コード実行を重視するチームがGLM-4.6を呼び出す際は、APIタイムアウト時のリトライ機構とバックアップモデルへの切り替え機構を追加し、単発のSmoke簡易評価の異常が本番タスクに影響しないよう備える必要がある。
資料への忠実度が求められるシーンでは、開発者は重要なフロー内に手動サンプルチェックや二次検証を組み込み、API層の障害による出力の切断を防ぐべきである。
エンジニアリング判断とタスク表現は安定したAPIレスポンスに依存しており、今回の障害はこれらのサブランキング能力が一時的に利用不可であることを示している。モデル選定の際はダウングレードプランを準備しておく必要がある。
戦略的判断
今回の異常はAPI障害によって直接引き起こされたものであり、GLM-4.6のモデル本来の性能とは無関係であるため、コア性能について懸念する必要はない。次回のSmoke評価で正常なスコア記録が再開されれば、今回の事象が孤立した技術的問題であることが確認できる。
自動再実行の結果を引き続き観察することを推奨する。再実行後も複数次元の欠落が続く場合に限り、モデルサービス側の安定性についてさらなる調査が必要となる。
データソース:YZ Index | Run #322 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接