GLM-4.6は本日のSmokeテストにおいて、資料制約71.90点、エンジニアリング判断63.90点、タスク表現50.00点を記録した。コード実行と誠実性の2次元はAPIの障害またはタイムアウトにより完全に欠損しており、メインランキングへの参加は行われていない。
データの事実
昨日と比較すると、本日は3つのサブランキングまたは一部の次元スコアのみが保持され、実行次元と誠実性評価は直接的に空欄となっている。Smokeテストは毎日固定で10問出題され、2問が1次元に対応するため、単日の標準偏差が大きいことは既知の特性である。ただし今回の欠損はスコアの低下ではなく、次元全体のデータが返ってこなかったものである。
原因分析
欠損した実行次元と誠実性次元に対応する問題は、通常モデルがコードの断片を完成させるか、資料の指示に厳密に従うことを求める。APIのタイムアウトは、複数ターンのやり取りや長いコンテキストを必要とするリクエストで最も発生しやすい。資料制約71.90点とエンジニアリング判断63.90点は依然として返ってきていることから、モデルの基本的な生成能力が完全に停止したわけではなく、問題はインターフェースの安定性に集中しており、モデルパラメータレベルの劣化ではないことが示されている。タスク表現の50.00点が低い点については、問題の抽選に開放型の表現要求が多く含まれていた可能性があるが、実行次元のデータが欠損しているため、システム的な低下かどうかは判断できない。
APIの障害による次元欠損とモデルの真の能力劣化は異なるメカニズムであり、前者は再実行によって回復可能だが、後者は複数日にわたる連続データによってのみ確認できる。
ユーザーへの意味
コード実行シナリオに強く依存している企業は、GLM-4.6 APIの呼び出しログを直ちに確認し、タイムアウト率とリトライ率に重点的に注目する必要がある。日常的なワークフローに資料への忠実性要件が含まれる場合、71.90点は依然として参考基準として使用できるが、実行次元の欠損はコード生成タスクにおけるモデルの実際のパフォーマンスを検証できないことを意味する。開発者は次回の補完実行結果が出るまで、GLM-4.6をコード実行のコアノードとして採用することを一時的に保留すべきである。
戦略的判断
今回の異常は主にAPIレベルで引き起こされたものであり、モデル能力の崩壊ではないため、モデル劣化と即断するのではなく、インターフェースの安定性を継続的に注視する価値がある。次回のSmokeテストでは、実行次元が回復しているか、および誠実性評価が再び現れるかを重点的に確認することを推奨する。補完実行後も実行次元が引き続き欠損する場合は、APIのレート制限またはサーバーサイドの設定問題をさらに調査する必要がある。
単日10問のテスト自体の変動は正常であり、今回の事象は能力シグナルではなく運用シグナルに近い。企業が製品選定を行う際は、APIの可用性を独立した評価項目として、メインランキングのスコアと並列して評価すべきである。
データソース:YZ Index | Run #264 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接