GPT-o3の材料制約スコアが20点急落、メインランキングは4.8点上昇
本日のSmokeテストにおいて、GPT-o3の材料制約スコアが70.00点から50.00点へ急落し、エンジニアリング判断も100.00点から50.00点へ下落した一方、メインランキングのスコアは72.75点から77.50点へと上昇した。この変動は小サンプルの抽選によるランダム変動である可能性が高く、モデルの系統的な劣化ではないと分析されている。
最新AIモデルのレビュー、比較評価、深度分析
本日のSmokeテストにおいて、GPT-o3の材料制約スコアが70.00点から50.00点へ急落し、エンジニアリング判断も100.00点から50.00点へ下落した一方、メインランキングのスコアは72.75点から77.50点へと上昇した。この変動は小サンプルの抽選によるランダム変動である可能性が高く、モデルの系統的な劣化ではないと分析されている。
Doubao ProのSmoke評価において、本日の材料制約スコアが前日比27.6点減の58.30点に急落した一方、コード実行スコアは49.3点増の99.30点に急騰し、メインボードスコアは66.16点から80.85点に上昇した。
2026年9月7日のYZ Index Smoke速測では11モデルを対象に評価を実施し、DeepSeek V4 Pro・Gemini 3.1 Pro・GLM-4.6が83.49点で当日首位に並んだ。Smokeは1日10問の速測であり、短期シグナルの観測に適しており、Full週間ランキングの結論とは同一ではない。
WDCD v3.1(Run #311)において、Claude Sonnet 4.6のスコアが前回比5点下落する一方、Doubao Proは7.5点上昇し、両者の逆方向の変動が今期唯一の顕著な変化となった。その他のモデルは概ね安定を維持している。
WDCD v3.1の約束遵守テストにおける5大制約シナリオ・11モデルの横断評価では、安全コンプライアンスシナリオが全体で最低スコアの次元となり、Qwen3-maxはわずか2.19/4にとどまった。一方、glm-4.6は複数シナリオで首位を獲得し、モデル間の制約遵守能力に顕著な差異が示された。
11のAIモデルを対象にWDCD(Will Do, Can Do)評価の8問v2アンカー問題でサンプリングを実施した結果、R1確認率は全モデル100%だったが、R3誠実率は平均49.5%にとどまり、29/319回の完全崩壊が確認された。二ラウンドの妨害・圧力を経ると、ほぼ半数のシナリオで初期の約束を維持できないことが明らかになった。
WDCD v3.1テストでGrok 4が93.21点で11モデル中1位を獲得。Qwen3 Maxは74.31点で最下位となり、両者の差は18.9点に達した。
2026年9月6日実施のYZ Index Smoke速報テスト(11モデル対象)で、Gemini 2.5 Proが88.21点を獲得し首位となった。本テストは1日10問の小規模サンプルによる速報であり、短期シグナルの観測に適している。
GLM-4.6が本日のSmoke評価において材料制約スコアが21点急落した一方、コード実行スコアは25点上昇し、総合スコアは60.94点から65.24点へと小幅上昇した。誠実性評価はpassからwarnに変化しており、材料依存型の業務シーンでは人的検証の強化が推奨される。
Qwen3 MaxがSmokeテストでコード実行スコアを96.70点から75.00点へと大幅に下落させた一方、素材制約スコアは48.80点から69.20点へと上昇した。主要ランキングスコアは75.15点から72.39点へと小幅に低下した。
2026年9月5日のYZ Index Smoke速測では11モデルを対象に評価が行われ、GPT-o3が90.64点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期的なシグナル観察に適している。
GLM-4.6が本日のSmoke評価テストでメインランキングスコアを48.25点から60.94点へ12.7点改善し、誠実性評価もfailからpassに転換した。ただしスコア変動の主因は素材制約次元の大幅上昇であり、工程判断・タスク表現の両次元は同日に大幅下落した。
GPT-5.5が本日のSmoke評価においてコード実行スコアを100.00から75.00へと急落させ、メインランキング全体も79.12から71.67へと7.5ポイント低下した。抽選による問題のばらつきが主因と見られるが、跌幅は継続的な追跡が必要な水準に達している。
2026年9月4日のYZ Index Smokeクイックテストでは、Claude Opus 4.7が92.49点で首位となりました。Smokeは日次10問の小規模テストであり、短期的なシグナルの観察に適している一方、Full週間ランキングの結論とは同一ではありません。
2026年9月3日実施のRun#307において、GLM-4.6は誠実性評価でfailと判定され、プローブスコア15.00、主要ランキングスコア48.25点を記録した。同日テストされた他の全モデルが誠実性評価をpassしており、GLM-4.6との明確な対比をなしている。
2026年9月3日のYZ Index Smoke速測では11モデルをカバーし、GPT-o3が83.94点で当日首位を獲得した。Smokeは1日10問の速測であり、短期シグナルの観察に適しており、Fullウィークリーランキングの結論とは同一ではない。
WDCD v3.1パイロットデータにおいて、Gemini 2.5 Proが22.2点の大幅上昇で最大の勝者となり、Gemini 3.1 Proが97.70点で首位を獲得した。一方、Claude Sonnet 4.6は唯一13点の下落を記録した。
WDCD v3.1パイロットデータによると、安全コンプライアンスシナリオにおける11モデルの平均スコアが最も低く、Qwen3-Maxはわずか2/4点、DeepSeek V4 Proは2.5/4点にとどまり、全シナリオ中で最も約束遵守が困難なシナリオであることが示された。
WDCD v3.1パイロット段階において、11モデルのR3平均誠実率は72.7%に留まり、110回のテスト中3回のR3完全崩壊(0点)が発生した。GLM-4.6、DeepSeek V4 Pro、Qwen3 Maxの3モデルが安全コンプライアンスの複合制約下でR3崩壊を起こした一方、Gemini 3.1 ProやGrok 4など8モデルは満点を維持した。
WDCD v3.1の約束遵守テストにおいて、Gemini 3.1 Proが97.70点で11モデル中首位を獲得し、Qwen3 Maxが70.30点で最下位となった。両者の差は27.4点に達した。