MLPerf InferenceがAIエージェント時代へ:マルチターンAgentic Inferenceベンチマークを新規追加
MLPerf Inferenceベンチマークスイートが、LLMの実運用における最も急成長する利用形態であるマルチターンAgentic Inferenceに対応するため、新たなベンチマークを追加した。コーディングエージェントとワークフローエー
MLPerf Inferenceベンチマークスイートが、LLMの実運用における最も急成長する利用形態であるマルチターンAgentic Inferenceに対応するため、新たなベンチマークを追加した。コーディングエージェントとワークフローエー
MLCommonsのEdge LLM Taskforceは、MLPerf Inference v6.1においてEdge Agentic Inferenceベンチマークを新たに導入すると発表した。提出締め切りは2026年7月31日で、ハードウ
MLCommonsのMedPerfがGoogle Cloud Confidential Computingと統合し、患者データとモデルの知的財産を保護しながら脳腫瘍分割AIの評価を安全に実施できる仕組みを実証した。この統合により、データを移
NetpremeチームがNetpreme X-Mem™ MPUとSGLang HiCacheの統合方案を発表。KVキャッシュ専用の高帯域幅メモリ層を追加することで、長コンテキスト・高プレフィックス再利用シナリオにおいてTTFTを最大6.7倍
Speculative Decodingの高負荷時における検証コスト問題に対処するDSparkがSGLangに統合された。Semi-autoregressiveブロックドラフターと信頼度ベースの動的verify長割り当てにより、Denseモ
AMDとMilesチームが、DeepSeek-V4 Flash RLをROCm搭載のAMD Instinct MI355X GPU上でMilesフレームワークによるエンドツーエンドの強化学習トレーニングに対応させたことを発表した。4ノード構
SGLangチームがGLM-5.2-NVFP4の推論サービスを2週間で大幅最適化し、8×B300・バッチサイズ1の低レイテンシ環境で500 TPS超を達成した。Spec V2、IndexShare MTP、TopK-V2など複数のランタイム
SGLang Team と Thinking Machines Lab は、975Bパラメータのマルチモーダルモデル Inkling を SGLang と Miles で初日からサポートすると発表した。推論サービス、カーネル最適化、投機的デ
MilesチームがOn-Policy Distillation(OPD)をコア機能としてシステムに統合し、教師モデルの効率的な推論行動を学生モデルへ転移させることに成功した。単一の8×NVIDIA B200ノード上でQwen3.5-35B-
2026年7月24日のYZ Index Smoke速測では10モデルを対象に評価が行われ、Grok 4が84.21点で当日首位を獲得した。Smoke速測は毎日10問の小規模テストであり、短期シグナルの観測に適している。
2026年7月23日実施のRun#243 Smokeテストにおいて、GLM-4.6は総合ランキング55.74点を記録。材料制約で93.30点の高得点を挙げた一方、コード実行は25.00点にとどまり、誠実性評価はfail(プローブ30.00点
2026年7月23日のYZ Index Smoke速測では11モデルを対象に評価が行われ、Claude Opus 4.7が96.99点で当日首位を獲得した。本速測はコード実行と資料制約の2次元のみをカバーする小サンプルの日次シグナルである。
最新のWDCD v3.1守約テストにおいて、GLM-4.6が13.7点上昇して92.00点に達した一方、GPT-o3は6.9点下落して87.10点となり、上位5モデルの内部順位が大きく塗り替えられた。
WDCD v3.1の契約遵守テストにおいて、リソース制限シナリオでgpt-5.5が1.55/4と最低スコアを記録し、全5シナリオ中の最大スコア差は2.45点に達した。モデルの契約遵守能力はシナリオ固有の特性であり、単一シナリオの成績から全体
v2アンカー問題8問のみを対象とした3ラウンドテストにおいて、11モデルのR3平均誠実率はわずか40.9%にとどまり、4モデルがR3で完全崩壊(0点)を記録した。崩壊事例はすべてビジネスルール類の制約に集中している。
WDCD v3.1コンプライアンス遵守テストにおいて、Grok 4が93.80点で11モデル中最高得点を記録し、Doubao Proが67.30点で最下位となった。両者の差は26.5点に達し、多ターン段階的プレッシャー下での制約保持能力に大
GLM-4.6は本日のSmoke評価テストにおいて誠実性評価がpassからfailに急落した一方、コード実行スコアが50.00点から97.00点へと47点上昇し、メインランキング総合スコアも62.83点から74.00点に改善した。
GPT-o3が本日のSmokeベンチマークで総合スコアを昨日の96.27点から87.94点へと8.3点落とした。コード実行・工程判断の両次元が大幅に下落し、誠実性評価も「pass」から「warn」に転じた。
2026年7月22日のYZ Index Smoke速測では11モデルを対象に評価が行われ、Grok 4が98.35点で当日首位を獲得した。Smokeは1日10問の速測であり、短期的なシグナルの観測に適している。
本日のSmoke評価において、Claude Opus 4.7のメインスコアが100.00点から73.92点へと26.1ポイント下落した。コード実行・資料制約の両次元で25ポイント以上の降下が確認されたが、小サンプルによる変動の可能性が高いと