GPT-o3の材料制約スコアが20点急落、メインランキングは4.8点上昇

本日のSmokeテストにおいて、GPT-o3の材料制約スコアが70.00点から50.00点へ急落し、エンジニアリング判断も100.00点から50.00点へ下落した一方、メインランキングのスコアは72.75点から77.50点へと上昇した。この変動は小サンプルの抽選によるランダム変動である可能性が高く、モデルの系統的な劣化ではないと分析されている。

GPT-o3 材料约束 Smoke评测
32

DeepSeek V4 Pro・Gemini 3.1 Pro・GLM-4.6が83.49点で同率首位:2026-09-07 YZ Index Smoke速報データブリーフィング

2026年9月7日のYZ Index Smoke速測では11モデルを対象に評価を実施し、DeepSeek V4 Pro・Gemini 3.1 Pro・GLM-4.6が83.49点で当日首位に並んだ。Smokeは1日10問の速測であり、短期シグナルの観測に適しており、Full週間ランキングの結論とは同一ではない。

赢政指数 Smoke快测 AI评测
47

WDCD 5シナリオ横断評価:安全コンプライアンスの最低スコアは2.19点、glm-4.6が4シナリオで首位

WDCD v3.1の約束遵守テストにおける5大制約シナリオ・11モデルの横断評価では、安全コンプライアンスシナリオが全体で最低スコアの次元となり、Qwen3-maxはわずか2.19/4にとどまった。一方、glm-4.6は複数シナリオで首位を獲得し、モデル間の制約遵守能力に顕著な差異が示された。

WDCD 守约测试 场景横评
156

R3誠実率わずか49.5%:11モデルWDCD三ラウンド遵約崩壊の実測結果

11のAIモデルを対象にWDCD(Will Do, Can Do)評価の8問v2アンカー問題でサンプリングを実施した結果、R1確認率は全モデル100%だったが、R3誠実率は平均49.5%にとどまり、29/319回の完全崩壊が確認された。二ラウンドの妨害・圧力を経ると、ほぼ半数のシナリオで初期の約束を維持できないことが明らかになった。

WDCD 守约测试 约束衰减
162

GLM-4.6、材料制約スコアが21点急落・コード実行は25点上昇、総合ランキングは4.3点微増

GLM-4.6が本日のSmoke評価において材料制約スコアが21点急落した一方、コード実行スコアは25点上昇し、総合スコアは60.94点から65.24点へと小幅上昇した。誠実性評価はpassからwarnに変化しており、材料依存型の業務シーンでは人的検証の強化が推奨される。

GLM-4.6 材料约束 Smoke评测
170

GLM-4.6、素材制約スコア+28.2点も工程判断-39.6点――誠実性評価がfailからpassに転じ、メインランキングは12.7点上昇

GLM-4.6が本日のSmoke評価テストでメインランキングスコアを48.25点から60.94点へ12.7点改善し、誠実性評価もfailからpassに転換した。ただしスコア変動の主因は素材制約次元の大幅上昇であり、工程判断・タスク表現の両次元は同日に大幅下落した。

GLM-4.6 材料约束 Smoke评测
584

WDCD 5シナリオ横断評価:安全コンプライアンスの最低スコアはわずか2点、DeepSeek V4 Proは業務ルール4点・安全コンプライアンス2.5点で1.5点の偏差

WDCD v3.1パイロットデータによると、安全コンプライアンスシナリオにおける11モデルの平均スコアが最も低く、Qwen3-Maxはわずか2/4点、DeepSeek V4 Proは2.5/4点にとどまり、全シナリオ中で最も約束遵守が困難なシナリオであることが示された。

WDCD 守约测试 场景横评
224

WDCD三ラウンドテスト:11モデルのR3誠実率はわずか72.7%、3モデルでR3が完全崩壊

WDCD v3.1パイロット段階において、11モデルのR3平均誠実率は72.7%に留まり、110回のテスト中3回のR3完全崩壊(0点)が発生した。GLM-4.6、DeepSeek V4 Pro、Qwen3 Maxの3モデルが安全コンプライアンスの複合制約下でR3崩壊を起こした一方、Gemini 3.1 ProやGrok 4など8モデルは満点を維持した。

WDCD 守约测试 约束衰减
398