Claude Sonnet 4.6が5点下落、DoubaoPro が7.5点上昇――WDCD v3.1守約テストが安定性の明暗を浮き彫りに
WDCD v3.1(Run #311)において、Claude Sonnet 4.6のスコアが前回比5点下落する一方、Doubao Proは7.5点上昇し、両者の逆方向の変動が今期唯一の顕著な変化となった。その他のモデルは概ね安定を維持してい
WDCD v3.1(Run #311)において、Claude Sonnet 4.6のスコアが前回比5点下落する一方、Doubao Proは7.5点上昇し、両者の逆方向の変動が今期唯一の顕著な変化となった。その他のモデルは概ね安定を維持してい
WDCD v3.1の約束遵守テストにおける5大制約シナリオ・11モデルの横断評価では、安全コンプライアンスシナリオが全体で最低スコアの次元となり、Qwen3-maxはわずか2.19/4にとどまった。一方、glm-4.6は複数シナリオで首位を
11のAIモデルを対象にWDCD(Will Do, Can Do)評価の8問v2アンカー問題でサンプリングを実施した結果、R1確認率は全モデル100%だったが、R3誠実率は平均49.5%にとどまり、29/319回の完全崩壊が確認された。二ラ
WDCD v3.1テストでGrok 4が93.21点で11モデル中1位を獲得。Qwen3 Maxは74.31点で最下位となり、両者の差は18.9点に達した。
2026年9月6日実施のYZ Index Smoke速報テスト(11モデル対象)で、Gemini 2.5 Proが88.21点を獲得し首位となった。本テストは1日10問の小規模サンプルによる速報であり、短期シグナルの観測に適している。
GLM-4.6が本日のSmoke評価において材料制約スコアが21点急落した一方、コード実行スコアは25点上昇し、総合スコアは60.94点から65.24点へと小幅上昇した。誠実性評価はpassからwarnに変化しており、材料依存型の業務シーン
Qwen3 MaxがSmokeテストでコード実行スコアを96.70点から75.00点へと大幅に下落させた一方、素材制約スコアは48.80点から69.20点へと上昇した。主要ランキングスコアは75.15点から72.39点へと小幅に低下した。
2026年9月5日のYZ Index Smoke速測では11モデルを対象に評価が行われ、GPT-o3が90.64点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期的なシグナル観察に適している。
GLM-4.6が本日のSmoke評価テストでメインランキングスコアを48.25点から60.94点へ12.7点改善し、誠実性評価もfailからpassに転換した。ただしスコア変動の主因は素材制約次元の大幅上昇であり、工程判断・タスク表現の両次
GPT-5.5が本日のSmoke評価においてコード実行スコアを100.00から75.00へと急落させ、メインランキング全体も79.12から71.67へと7.5ポイント低下した。抽選による問題のばらつきが主因と見られるが、跌幅は継続的な追跡が
2026年9月4日のYZ Index Smokeクイックテストでは、Claude Opus 4.7が92.49点で首位となりました。Smokeは日次10問の小規模テストであり、短期的なシグナルの観察に適している一方、Full週間ランキングの
2026年9月3日実施のRun#307において、GLM-4.6は誠実性評価でfailと判定され、プローブスコア15.00、主要ランキングスコア48.25点を記録した。同日テストされた他の全モデルが誠実性評価をpassしており、GLM-4.6
2026年9月3日のYZ Index Smoke速測では11モデルをカバーし、GPT-o3が83.94点で当日首位を獲得した。Smokeは1日10問の速測であり、短期シグナルの観察に適しており、Fullウィークリーランキングの結論とは同一で
WDCD v3.1パイロットデータにおいて、Gemini 2.5 Proが22.2点の大幅上昇で最大の勝者となり、Gemini 3.1 Proが97.70点で首位を獲得した。一方、Claude Sonnet 4.6は唯一13点の下落を記録し
WDCD v3.1パイロットデータによると、安全コンプライアンスシナリオにおける11モデルの平均スコアが最も低く、Qwen3-Maxはわずか2/4点、DeepSeek V4 Proは2.5/4点にとどまり、全シナリオ中で最も約束遵守が困難な
WDCD v3.1パイロット段階において、11モデルのR3平均誠実率は72.7%に留まり、110回のテスト中3回のR3完全崩壊(0点)が発生した。GLM-4.6、DeepSeek V4 Pro、Qwen3 Maxの3モデルが安全コンプライア
WDCD v3.1の約束遵守テストにおいて、Gemini 3.1 Proが97.70点で11モデル中首位を獲得し、Qwen3 Maxが70.30点で最下位となった。両者の差は27.4点に達した。
2026年9月2日実施のYZ Index Smokeクイックテストでは11モデルを対象に評価が行われ、Doubao Proが95.91点でその日の首位を獲得した。本テストはデイリー10問形式の短期シグナル観測用であり、週次フルランキングとは
GPT-5.5が本日のSmokeテストでコード実行スコアを94.50から69.50へと急落させた一方、素材制約スコアは76.00から100.00へ上昇。両者が相殺し合い、総合ランキングの低下は3点にとどまった。
Grok 4が本日のSmokeベンチマークにおいてコード実行スコアを94.50点から72.70点へと大幅に落とし、メインランキングが89.15点から84.99点に後退した。一方、素材制約スコアは100点満点を記録した。