GPT-5.5がコード実行満点86.95点でSmokeベンチマーク首位、制約面の弱点も露呈
2026年7月3日のSmoke軽量評価において、GPT-5.5がコード実行100点・素材制約71点の組み合わせで主ランキング86.95点を獲得し首位に立った。一方で、素材制約が現行モデル全般の共通課題であることも明らかになった。
2026年7月3日のSmoke軽量評価において、GPT-5.5がコード実行100点・素材制約71点の組み合わせで主ランキング86.95点を獲得し首位に立った。一方で、素材制約が現行モデル全般の共通課題であることも明らかになった。
YZ Index 2026年7月2日のSmoke軽量評価において、Gemini 3.1 Proが82.97点で1位を獲得。実行スコアが順位を左右する主要因となった。
WDCD三ラウンドテストにおいて、Grok 4は全10問のR3フェーズで満点2点を維持した一方、GPT-5.5は5回のゼロ点崩壊を起こし、R3平均誠実率はわずか1.00/2にとどまった。
WDCD守約テストにおいて、Grok 4が100点満点で首位を獲得し、GPT-5.5は62.5点で最下位となった。11モデル中、満点を達成したのは61.8%にとどまった。
YZ Index 2026年6月の11モデル実測において、Doubao Pro Smokeテストのメインランキングスコアがコード実行次元の急落により、前日比18.6点下落の67.32点を記録した。ただし他の次元は安定または上昇しており、モデ
YZ IndexのSmoke評価において、Grok 4のメインスコアが97.98点から82.73点へと15.3点急落し、特にコード実行ディメンションが100.00点から68.60点へと31.4点の大幅下落を記録した。ただし、少数サンプルによ
2026年7月1日のSmokeライト評価において、Claude Opus 4.7が94.82点でメインランキング1位を獲得。一方、Gemini 3.1 Proはメインランキングで32.2点の大幅下落を記録した。
YZ Index 2026年6月のSmoke評価において、Claude Sonnet 4.6のメインランキングスコアが97.84点から82.52点へと1日で15.3点下落した。ただし、サンプル数の少なさによる抽選変動の可能性が高く、真のモデ
YZ Index 2026年6月のSmokeテストにおいて、Claude Opus 4.7のメインスコアが前日の100.00点から84.01点へ急落し、コード実行次元では100.00点から72.80点へ大幅に低下した。
YZ Index 2026年6月30日 Smoke 軽量評価において、Gemini 3.1 Pro が主榜98.47点で首位を獲得。一方、複数モデルで実行スコアの大幅下落が確認され、Claude Opus 4.7は27.2点減の72.8点に
AIシステムの特性により、30年間にわたりセキュリティコミュニティが依拠してきた協調的脆弱性開示(CVD)モデルが通用しなくなっている。MLCommonsはこの課題に対処すべく、ISO標準化の推進と新たな開示ポリシーの策定に取り組んでいる。
MLCommonsのChakraワーキンググループがMLSys 2026産業フォーラムで画期的な論文を発表し、AI システムのベンチマークテストを標準化するオープンな実行トレースエコシステムの構築に向けた取り組みを示した。40社以上のメンバ
MLCommonsは本日、MLPerf Mobile v6.0を発表した。Androidデバイス上で大規模言語モデル(LLM)を実行するための生成AIベンチマークテストが新たに追加されている。
MLCommonsがMLPerf Training v6.0ベンチマークの最新結果を発表した。今回はMixture-of-Expertsアーキテクチャを採用した2つの新ベンチマークが追加され、AIエコシステムの急速な変革を示している。
Novita AI は SGLang をベースに GLM4-MoE モデル向けの本番環境検証済み高インパクト最適化ソリューションを開発し、Shared Experts Fusion と Suffix Decoding の統合によりエージェン
SGLang RLチームがKimi K2に着想を得て、INT4 Quantization-Aware Training(QAT)のエンドツーエンドソリューションを実現。トレーニング段階のfake quantizationと推論段階のW4A1
智能体強化学習(Agentic RL)におけるトレーニングと推論の不一致を解消するコア設計原則「Token-In-Token-Out(TITO)」を解説し、MilesフレームワークにおけるTITO実装の仕組みを詳述する。
SGLangとAMDチームの緊密な協力により、AMD Instinct™ MI355X GPU上でDeepSeek-R1の大規模分離推論において競争力のある総所有コスト(TCO)を達成。主要な運用ポイントでNVIDIA B200を上回るTC
SGLangコミュニティが提案する異種CPU+GPU構成のEPD分離アーキテクチャにより、VLMサービスにおける視覚エンコードのボトルネックを解消し、TTFTやTPOTなどの主要指標で純GPU構成を上回る性能を実現した。
SGLangとMilesチームがNVIDIA Nemotron 3 UltraへのDay-0サポートを発表し、長時間自律エージェントシステムの短時間インタラクションから永続的ワークフローへの移行を支援する。