GPT-o3が96.98点で首位:2026-09-01 YZ Index Smoke速報データブリーフィング
2026年9月1日のYZ Index Smoke速測では11モデルを対象に評価が行われ、GPT-o3が96.98点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期シグナルの観察に適している。
2026年9月1日のYZ Index Smoke速測では11モデルを対象に評価が行われ、GPT-o3が96.98点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期シグナルの観察に適している。
2026年8月31日実施のYZ Index Smoke速測では11モデルを対象とし、Grok 4が89.15点で当日首位を獲得した。本速報はコード実行と資料制約の2次元のみを評価対象とした小サンプルの日次シグナルである。
本日のSmoke評価テストにおいて、Gemini 3.1 Proのメインランキングスコアが昨日の96.60点から85.83点へと10.8ポイント下落した。特に素材制約次元が14.4ポイント、エンジニアリング判断が25ポイントと大幅に低下して
Grok 4は本日のSmoke評価テストで、メインランキングのスコアが昨日の96.99点から88.14点に低下し、1日の落ち幅は8.8ポイントに達した。コード実行と素材制約の2次元が主な下落要因となっている。
2026年8月24日〜30日のSmoke評価において、Claude Opus 4.7が82.98点から93.08点へと10.1点の上昇トレンドを記録した一方、Gemini 3.1 Proは11.2点下落し、モデル間で明暗が分かれた。
2026年8月30日のYZ Index Smokeテスト(11モデル対象)において、Claude Opus 4.7が93.08点で当日首位を獲得した。本速報はコード実行と資料制約の2次元による小サンプル単日シグナルであり、週次Full評価と
MLCommonsのMLPerf Inferenceワーキンググループが、初のエンドツーエンド検索拡張生成(RAG)推論ベンチマークを公開した。複数コンポーネントで構成されるRAGパイプライン全体を計測対象とし、2つのワークロードを含む。
MLCommonsはGoogle DeepMind、OpenMined、AVERIと協力し、暗号技術を用いた初の閉源モデルダブルブラインド評価の概念実証を実施した。この手法により、モデル権重と評価データの双方を保護しながら、信頼性の高いAI
Claude Sonnet 4.6が本日のSmoke評価においてコード実行次元で97.00点から75.00点へ22点急落した一方、素材制約次元は25.7点上昇した。総合ランキングスコアは83.24点と、わずか0.5点の低下にとどまった。
Claude Opus 4.7は本日のSmokeテストにおいて総合スコア83.24点を記録し、昨日の93.54点から10.3点下落した。主な原因はコード実行ディメンションのスコアが97.00点から75.00点へと22点落ち込んだことにある。
2026年8月29日のYZ Index Smoke速測では11モデルを対象に評価が行われ、Grok 4が96.99点で当日首位を獲得した。Smoke速測は短期シグナルの観察に適した日次10問テストであり、Full週次ランキングの結論とは同等
DeepSeek-V4-Proは1.6兆パラメータを持つMoEモデルであり、H20 GPUという制約のあるハードウェア上でのサービング最適化において、TTFT・TPOT目標を達成しながら大幅なスループット改善を実現した取り組みを紹介する。
大規模言語モデルの強化学習フレームワークMilesにおいて、MooncakeがRolloutデータ転送バックエンドとして統合され、既存のRayパスと比較してリモートGETレイテンシを約10〜14倍、PUTを約1.2〜1.6倍高速化した。
SGLangチームは、CUDA IPCゼロコピーマッピングを用いてGPUメモリ上にモデルの重みを保持する「Weight Cache Daemon」を発表。これによりモデルの重みロード時間を数分からサブ秒級に短縮し、LLM推論サービスの冷起動
Ling-3.0-flashハイブリッド線形アテンションMoEモデルを4枚のBlwell GPU上で最適化し、平均TPOT54%削減・単一リクエストスループット2.1倍向上を達成した技術的取り組みを解説する。
QwenチームがマルチモーダルMoEモデル「Qwen3.8-Flash-Next」をオープンソース公開し、SGLangがQwen・NVIDIA・AMDチームと連携してDay-0サポートを提供した。本モデルはQwen4アーキテクチャの早期プレ
SGLang Diffusionチームが8×NVIDIA H200上でMiniMax-H3の動画生成ベンチマークを実施し、無損失パスでDiffusersと比較して最大1.95倍、ステップ再利用とスパースアテンション併用で最大6.24倍の高速
Infer-forgeは、SGLangを核として推論最適化の実行環境を体系化するMonoRepoおよびTaskLoop設計の取り組みであり、内部での継続的運用を通じて並行タスク数の大幅な拡大を実現している。
GPT-5.5が本日のSmoke評価においてメインランキングのスコアを95.01から85.93へ9.1点下落させた。主因は資料制約スコアの16.5点急落であり、モデル全体の劣化ではなく出題のランダム性による変動と分析されている。
GPT-o3の本日のSmokeベンチマーク総合スコアが昨日の100.00点から89.92点へ10.1点下落した。主因は素材制約次元が100.00点から77.60点へ22.4点急落したことにある。