GLM-4.6は本日のSmokeテストにおいて、コード実行58.30点、資料制約100.00点、エンジニアリング判断75.00点、総合スコア74.00点を記録した。API障害・タイムアウトによりintegrityおよびcommunicationの次元データが欠損しており、自動再実行が開始されているため、今回はランキングに参加しない。
データの実態:1日10問における次元別スコア分布
Smokeテストは毎日各次元2問、計10問で構成される。今回GLM-4.6でスコアが得られたのは3次元のみで、コード実行58.30点、資料制約100.00点、エンジニアリング判断75.00点であった。タスク表現次元はAPIタイムアウトにより完全に欠損した。総合スコアはコード実行と資料制約を加重して74.00点が算出された。以上のデータはすべて本日の単回実行によるものである。
原因分析:API障害と問題抽選のばらつきの区別
コード実行58.30点と資料制約100.00点の間には明確な対照が見られる。資料制約の満点は、与えられた資料に厳密に従う場面でモデルが安定したパフォーマンスを発揮しており、問題自体の難易度や制約強度がモデルの能力を超えていないことを示している。一方、コード実行58.30点は著しく低く、公式が明確に記録した「API障害・タイムアウト」と合わせて考えると、最も可能性の高い原因はAPI接続の切断によってコード生成または実行段階が直接失敗したことであり、モデル自体のコードロジック理解の劣化ではないと考えられる。
エンジニアリング判断の75.00点は中程度の水準であり、APIの不安定性の影響を受けているものの、コード実行ほど低い水準には落ちていない。1日10問のテストにおいて問題抽選のばらつきは正常な現象だが、今回はAPIタイムアウトの記録が同時に発生し、2次元分のデータが欠損したことから、ランダムな問題難度変動ではなく外部サービス層の問題を指していると判断できる。
利用者への意味
コード実行に強く依存する開発者は、今回のSmokeテストにおけるGLM-4.6のパフォーマンスを直ちに評価する必要がある。58.30点という結果は、実行可能なコードの生成や多段階デバッグが必要なタスクにおいて、成功率が他のモデルを明確に下回る可能性を意味する。一方、資料制約100.00点は、厳格なRAGや文書への忠実度が高く求められる場面では、このモデルが引き続き信頼性の高い出力を提供できることを示している。
モデル選定を検討する企業にとって、APIの安定性が現時点でGLM-4.6を利用する際の最大のリスクポイントとなっている。エンジニアリング判断75.00点は、技術的な方針のトレードオフが必要な場面でモデルが中程度の提案を行えることを示唆しているが、API問題によって全体的な信頼性が損なわれている。
戦略的判断
本日のスコアとAPI障害の記録に基づくと、GLM-4.6のコード実行58.30点はサービス層のタイムアウトに起因する可能性が最も高く、モデル能力の実質的な劣化ではないと考えられる。資料制約の満点は、制約遵守の次元において依然として高い水準を維持していることを証明している。次回は自動再実行後の完全なデータを重点的に検証することを推奨する。API問題が継続して発生する場合は、コード実行の集中的なタスクを他の利用可能なモデルへ切り替えることを検討すべきである。
今回の異常はAPI障害として明確に記録されており、モデル能力評価の通常サンプルには該当しない。企業ユーザーは現在のGLM-4.6の総合スコア74.00点を外部要因に干渉された暫定値とみなし、再実行完了後に最終判断を行うべきである。
データ出典:YZ Index | Run #368 | 生データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接