GLM-4.6は本日のSmoke評価において、execution・grounding・judgment・integrity・communicationの5次元すべてのスコアが「-」と表示されており、総合ランキングのスコアも同様に欠落しているため、今回のランキングには参加しない。
データの事実
Smoke評価は毎日固定で10問出題され、各次元につき2問が割り当てられる。本日のGLM-4.6は、すべての監査可能次元およびサブランキング次元においてAPI障害またはタイムアウトにより結果が返されず、システムは自動再実行プロセスを起動した。前日比較欄も同様に「-」となっており、今回の中断が単発的な事象であることを示している。
原因分析
スコア比較欄はすべての次元で「-」から「-」の表示となっており、数値の変動は一切見られない。問題の抽選はSmoke評価において通常の範囲内であるが、今回5次元が同時に欠落したことは、モデルの回答品質の低下ではなく、API呼び出しレベルでの技術的中断を示している。自動再実行メカニズムの起動により、原因がインターフェースのタイムアウトまたはサーバー側の応答失敗であることがさらに確認された。
GLM-4.6の本日のSmoke評価における5次元データはAPI障害・タイムアウトにより完全に欠落しており、自動再実行に入っているため、今回のランキングには参加しない。
利用者への影響
GLM-4.6 APIを用いてコード実行タスクを行うチームは、重要なワークフローにタイムアウトリトライとバックアップモデルへの切り替えロジックを追加する必要がある。素材制約に敏感なシナリオでは、1回のAPI中断によってバッチタスク全体が失敗する可能性があるため、呼び出し成功率の監視とサーキットブレーカーの閾値設定を推奨する。
- コード実行を重視するチームは、本日の再実行結果が公開されるまで高価値のバッチ処理タスクを一時保留することを検討すべきだ。
- 素材の忠実度に敏感なシナリオでは、ローカルキャッシュの準備または他の利用可能なモデルへの並列呼び出しが必要となる。
戦略的判断
今回の異常は明確なAPI技術障害であり、モデル能力の低下を示すシグナルではない。自動再実行の完了後は、再実行結果と過去のSmoke評価スコアを直接比較すればよく、本日の欠落データを安定性の問題として解釈する必要はない。次回のSmoke評価で再び複数次元の同時欠落が発生した場合に初めて、APIサービスの信頼性をさらに検証する必要が生じる。
データ出典:YZ Index | Run #328 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接