GLM-4.6、Smoke評価メインランキング74点——コード実行82.3点、素材制約95点、API障害で一部ディメンション欠損

GLM-4.6は本日のSmoke評価においてメインランキングスコア74.00点を記録した。コード実行82.30点、素材制約95.00点、エンジニアリング判断70.80点を獲得した一方、タスク表現ディメンションはデータなし、完全性とコミュニケーションの2ディメンションはAPI障害・タイムアウトにより欠損している。自動再実行が開始されており、今回のランキングには参加しない。

データの事実:単日スコアとディメンションの完全性

Smoke評価は1日10問、ディメンションごとに2問で構成される。本日のGLM-4.6はコード実行82.30点、素材制約95.00点、エンジニアリング判断70.80点、メインランキング74.00点を記録し、タスク表現ディメンションは空欄となった。前日との比較はすべて「-」であり、今回が初めてこれらの数値を取得したことを示している。素材制約95.00点とコード実行82.30点の差は13.7点で、エンジニアリング判断70.80点は両者を下回っている。

原因分析:API障害と問題抽選によるばらつきの区別

スコアの比較により、タスク表現ディメンションが直接欠損しており、完全性とコミュニケーションも記録されていないことが確認できる。これらはAPI障害・タイムアウトによるものと公式に記録されている。これは問題抽選のばらつきによる通常の単日変動とは異なる。問題抽選のばらつきは通常、個々の問題のスコアの高低に影響するのみで、ディメンション全体のデータが完全に欠損する事態は引き起こさない。エンジニアリング判断70.80点と素材制約95.00点の13.2点差は、限られた問題数におけるディメンション間のパフォーマンス差を反映しているが、ディメンション欠損はモデルの能力が全ディメンで同時に低下したのではなく、技術的なAPIの問題を示している。

API障害により2ディメンションのデータ収集が不可能となり、メインランキング74.00点はコード実行と素材制約の2項目のみに基づいて算出されたものである。

利用者への示唆

コード実行を重視するチームがGLM-4.6を呼び出す際、82.30点はコード関連タスクにおける実用性を示しているが、APIタイムアウト時のリトライ機構を用意しておく必要がある。素材への忠実性が重要なシナリオでは、95.00点が高い参考価値を提供しており、短文テキスト制約タスクで優先的に検討できる。エンジニアリング判断に依存する開発者は、70.80点が複数回の検証を必要とするシナリオ、特に多段階検証が求められる場面での判断不一致リスクをもたらす可能性に注意が必要である。

  • APIが不安定な場合、ディメンション全体の欠損はモデル選定判断の信頼性に直接影響する。
  • 自動再実行の仕組みは単発の障害を緩和できるが、開発者は連続呼び出しの成功率を引き続き監視する必要がある。

戦略的判断:能力低下ではなく技術的障害

現時点のスコア比較に基づくと、GLM-4.6の今回の異常はAPI障害によるものであり、モデルの実際の能力低下ではない。素材制約95.00点とコード実行82.30点の数値は依然として実用範囲内にあり、エンジニアリング判断70.80点は限られたサンプル数におけるばらつきを露呈している。次回の評価ではAPI呼び出し成功率が回復しているか、および再実行後の完全なディメンションスコアが正常範囲に戻るかを検証する必要がある。API問題が継続する場合、本番環境におけるこのモデルの可用性は直接的な制約を受けることになる。

Smoke評価の単日変動は正常な範囲であるが、ディメンションデータの欠損は観測可能な技術的シグナルである。GLM-4.6の今回のメインランキング74.00点の結果は参考情報に留め、完全なランキングは再実行データが返ってきた後に改めて判断すべきである。


データ出典:YZ Index | Run #257 | 元データを見る