R3誠実率わずか50.6%:Grok 4はゼロ崩壊、GPT-o3は20%崩壊
WDCD v3.1パイロットテストにおける8問のv2三段階アンカー問題の結果、11モデルのR3平均誠実率はわずか50.6%にとどまった。Grok 4がR3で1.63/2を達成しゼロ崩壊を記録した一方、GPT-o3とQwen3 Maxの崩壊率
WDCD v3.1パイロットテストにおける8問のv2三段階アンカー問題の結果、11モデルのR3平均誠実率はわずか50.6%にとどまった。Grok 4がR3で1.63/2を達成しゼロ崩壊を記録した一方、GPT-o3とQwen3 Maxの崩壊率
2026年7月26日のYZ Index Smokeクイックテストでは10モデルを対象に評価が行われ、DeepSeek V4 Proが83.23点で当日首位を獲得した。コード実行とマテリアル制約の2次元で構成される本テストは、短期シグナルの観
2026年7月25日のYZ Index Smokeクイックテストでは、11モデルを対象に評価が実施され、Claude Sonnet 4.6とGrok 4が96.98点で同率首位となった。本テストはコード実行と資料制約の2次元のみを対象とした
MLPerf Tinyは、マイクロコントローラーなどの超低消費電力デバイス上での機械学習性能を公平に比較するためのベンチマークスイートであり、精度・レイテンシ・推論あたりエネルギー消費量を統一された条件で評価する。TinyMLの普及に伴い、
MLPerf Inferenceベンチマークスイートが、LLMの実運用における最も急成長する利用形態であるマルチターンAgentic Inferenceに対応するため、新たなベンチマークを追加した。コーディングエージェントとワークフローエー
MLCommonsのEdge LLM Taskforceは、MLPerf Inference v6.1においてEdge Agentic Inferenceベンチマークを新たに導入すると発表した。提出締め切りは2026年7月31日で、ハードウ
MLCommonsのMedPerfがGoogle Cloud Confidential Computingと統合し、患者データとモデルの知的財産を保護しながら脳腫瘍分割AIの評価を安全に実施できる仕組みを実証した。この統合により、データを移
NetpremeチームがNetpreme X-Mem™ MPUとSGLang HiCacheの統合方案を発表。KVキャッシュ専用の高帯域幅メモリ層を追加することで、長コンテキスト・高プレフィックス再利用シナリオにおいてTTFTを最大6.7倍
Speculative Decodingの高負荷時における検証コスト問題に対処するDSparkがSGLangに統合された。Semi-autoregressiveブロックドラフターと信頼度ベースの動的verify長割り当てにより、Denseモ
AMDとMilesチームが、DeepSeek-V4 Flash RLをROCm搭載のAMD Instinct MI355X GPU上でMilesフレームワークによるエンドツーエンドの強化学習トレーニングに対応させたことを発表した。4ノード構
SGLangチームがGLM-5.2-NVFP4の推論サービスを2週間で大幅最適化し、8×B300・バッチサイズ1の低レイテンシ環境で500 TPS超を達成した。Spec V2、IndexShare MTP、TopK-V2など複数のランタイム
SGLang Team と Thinking Machines Lab は、975Bパラメータのマルチモーダルモデル Inkling を SGLang と Miles で初日からサポートすると発表した。推論サービス、カーネル最適化、投機的デ
MilesチームがOn-Policy Distillation(OPD)をコア機能としてシステムに統合し、教師モデルの効率的な推論行動を学生モデルへ転移させることに成功した。単一の8×NVIDIA B200ノード上でQwen3.5-35B-
2026年7月24日のYZ Index Smoke速測では10モデルを対象に評価が行われ、Grok 4が84.21点で当日首位を獲得した。Smoke速測は毎日10問の小規模テストであり、短期シグナルの観測に適している。
2026年7月23日実施のRun#243 Smokeテストにおいて、GLM-4.6は総合ランキング55.74点を記録。材料制約で93.30点の高得点を挙げた一方、コード実行は25.00点にとどまり、誠実性評価はfail(プローブ30.00点
2026年7月23日のYZ Index Smoke速測では11モデルを対象に評価が行われ、Claude Opus 4.7が96.99点で当日首位を獲得した。本速測はコード実行と資料制約の2次元のみをカバーする小サンプルの日次シグナルである。
最新のWDCD v3.1守約テストにおいて、GLM-4.6が13.7点上昇して92.00点に達した一方、GPT-o3は6.9点下落して87.10点となり、上位5モデルの内部順位が大きく塗り替えられた。
WDCD v3.1の契約遵守テストにおいて、リソース制限シナリオでgpt-5.5が1.55/4と最低スコアを記録し、全5シナリオ中の最大スコア差は2.45点に達した。モデルの契約遵守能力はシナリオ固有の特性であり、単一シナリオの成績から全体
v2アンカー問題8問のみを対象とした3ラウンドテストにおいて、11モデルのR3平均誠実率はわずか40.9%にとどまり、4モデルがR3で完全崩壊(0点)を記録した。崩壊事例はすべてビジネスルール類の制約に集中している。
WDCD v3.1コンプライアンス遵守テストにおいて、Grok 4が93.80点で11モデル中最高得点を記録し、Doubao Proが67.30点で最下位となった。両者の差は26.5点に達し、多ターン段階的プレッシャー下での制約保持能力に大