GLM-4.6が26点急騰、GPT-5.5も10.5点上昇——WDCD遵約格局に急変
WDCD v3.1パイロット版のRun #360において、GLM-4.6が26点上昇して87.55を記録し総合3位に浮上。GPT-5.5も10.5点上昇し、遵約能力評価の勢力図に大きな変化が生じた。
WDCD v3.1パイロット版のRun #360において、GLM-4.6が26点上昇して87.55を記録し総合3位に浮上。GPT-5.5も10.5点上昇し、遵約能力評価の勢力図に大きな変化が生じた。
GLM-4.6はYZ IndexのSmokeクイックテストで材料制約100点満点を記録した一方、コード実行は41.70点にとどまり、誠実性評価はfailとなった。同日テストした14モデルの中で唯一failとなった点が注目される。
GLM-4.6が本日のSmoke評価においてAPI障害またはタイムアウトによりexecution・grounding・judgment・integrity・communicationの全5次元のスコアが欠落し、ランキングに参加できなかった。
GLM-4.6が本日のSmoke評価においてAPI障害・タイムアウトにより全5次元のデータが欠落し、自動再実行に入ったため今回のランキングには参加しない。欠落はモデル本来の性能ではなくインターフェース層の接続断に起因するとみられる。
2026年9月7日〜13日のYZ Index週次レポートで、Grok 4がトレンド+6.9・均値85.8点でトップを走る一方、GLM-4.6は最終日にゼロ点へ急落し、トレンド-83.5という最大の下落幅を記録した。
GLM-4.6が本日のSmoke評価において材料制約スコアが21点急落した一方、コード実行スコアは25点上昇し、総合スコアは60.94点から65.24点へと小幅上昇した。誠実性評価はpassからwarnに変化しており、材料依存型の業務シーン
GLM-4.6が本日のSmoke評価テストでメインランキングスコアを48.25点から60.94点へ12.7点改善し、誠実性評価もfailからpassに転換した。ただしスコア変動の主因は素材制約次元の大幅上昇であり、工程判断・タスク表現の両次
2026年9月3日実施のRun#307において、GLM-4.6は誠実性評価でfailと判定され、プローブスコア15.00、主要ランキングスコア48.25点を記録した。同日テストされた他の全モデルが誠実性評価をpassしており、GLM-4.6
GLM-4.6が本日のSmoke評価でメインランキング79.38点を記録。コード実行は62.50点に下落した一方、資料制約は100.00点の満点を獲得し、誠実性評価はfailからpassに転換した。
GLM-4.6は本日のSmoke評価において、誠実性評価がPassからFailに転落し、タスク表現スコアが45.00点から20.00点へと大幅に低下した。一方でコード実行スコアの上昇により、メインランキングのスコアは61.25点から74.0
GLM-4.6の本日のSmokeテストでは、資料制約71.90点・エンジニアリング判断63.90点・タスク表現50.00点を記録したが、APIの障害またはタイムアウトによりコード実行と誠実性の2次元のデータが完全に欠損し、メインランキングへ
WDCD v3.1テストにおいて、GPT-o3が9.5ポイント上昇してトップ2入りを果たした一方、GLM-4.6が14.9ポイント、Claude Sonnet 4.6が10.8ポイント下落するなど、AIモデル間で大きな順位変動が生じた。
GLM-4.6は本日のSmokeテスト評価においてAPI障害・タイムアウトにより「実行(execution)」と「判断(judgment)」の2次元データが欠損し、自動再実行待ちのため今回のメインランキングには参加しない。材料制約次元は51
GLM-4.6が本日のSmoke評価でメインランキング74.00点を記録。コード実行82.30点・素材制約95.00点を獲得したものの、API障害・タイムアウトにより2つのディメンションのデータが欠損し、今回のランキングには参加しない。
本日のSmokeベンチマークにおいて、GLM-4.6の材料制約スコアが75.00点から47.70点へ下落した一方、コード実行スコアが100点満点を記録し、メインランキングは46.29点から76.47点へと上昇した。誠実性評価はpassからw
2026年7月23日実施のRun#243 Smokeテストにおいて、GLM-4.6は総合ランキング55.74点を記録。材料制約で93.30点の高得点を挙げた一方、コード実行は25.00点にとどまり、誠実性評価はfail(プローブ30.00点
GLM-4.6は本日のSmoke評価テストにおいて誠実性評価がpassからfailに急落した一方、コード実行スコアが50.00点から97.00点へと47点上昇し、メインランキング総合スコアも62.83点から74.00点に改善した。
WDCD v3.1テスト(Run #233)において、Claude Sonnet 4.6が前回比15点上昇、GLM-4.6が15.3点下落という対称的な変動が観測され、11モデル中最も顕著な守約能力の二極化が明らかになった。
GLM-4.6は本日のSmokeテストで材料制約スコアが50点から25点へ急落した一方、コード実行スコアが25点から75点へ上昇し、総合ランキングのスコアは36.25点から52.50点へ上昇した。
2026年7月8日から12日にかけてのSmokeベンチマーク評価データによると、Gemini 2.5 Proが7日間でトレンド34.3点上昇し最大の伸びを示した一方、Zhipu GLM-4.6は40.5点という最大の変動幅を記録した。