Gemini 2.5 Proが89.56点で首位:2026年8月4日 YZ Index Smoke速報データブリーフィング
2026年8月4日実施のYZ Index Smokeクイックテストでは9モデルを対象に評価が行われ、Gemini 2.5 Proが89.56点で当日首位を獲得した。本テストはコード実行と資料制約の2次元を対象とした毎日10問形式のクイックテ
2026年8月4日実施のYZ Index Smokeクイックテストでは9モデルを対象に評価が行われ、Gemini 2.5 Proが89.56点で当日首位を獲得した。本テストはコード実行と資料制約の2次元を対象とした毎日10問形式のクイックテ
2026年8月3日のYZ Index Smokeクイックテストでは、11モデルを対象に評価が行われ、Claude Opus 4.7が95.19点で当日首位を獲得した。本速報はあくまで短期シグナルの観測を目的としており、週次Full評価の結論
GLM-4.6が本日のSmoke評価でメインランキング74.00点を記録。コード実行82.30点・素材制約95.00点を獲得したものの、API障害・タイムアウトにより2つのディメンションのデータが欠損し、今回のランキングには参加しない。
2026年7月28日〜8月2日のSmoke評価において、Qwen3 Maxがトレンド値+36.8を記録してトップに躍り出る一方、Gemini 3.1 Proはトレンド-5.6で最大の下落モデルとなった。DeepSeek V4 Proは全モデ
2026年8月2日実施のYZ Index Smoke速測(10モデル対象)において、Doubao Proが96.7点を獲得し当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観察に適している。
MLCommonsは、企業向けAI推論サービスの性能評価を目的とした新ベンチマーク「MLPerf Endpoints v0.7」を公開した。Coreweave、Google、Intel、KRAI、NVIDIAの初期結果が掲載され、今後のv1
SGLangチームとMilesは、初のオープンソース3兆パラメータ級モデルであるKimi K3に対してDay-0サポートを正式に発表した。SGLangが推論を、MilesがRL学習を担当し、リリース日のあらゆるシナリオをカバーする。
本記事では、低精度強化学習(RL)においてBlackwellアーキテクチャのネイティブ形式であるMXFP8とNVFP4をMilesおよびSGLang RLエコシステムへ統合する2つの方式を解説し、学習の安定性を確保するための高精度レイヤー保
RadixArkとGoogle Cloudがオープンソース推論フレームワーク「SGLang」をTPUエコシステムへ全面導入する提携を正式発表した。開発者はGPUとTPUを同一APIで使い分けられるようになる。
SGLangのissue #15194で提案されたアーキテクチャ変更を解説する。新設計では、チェックポイント解釈・パラメータ登録・重みロード・後処理・カーネル実行を独立した再利用可能なコンポーネントに分離し、量化スタックの保守性と拡張性を大
本日のSmokeベンチマークにおいて、GLM-4.6の材料制約スコアが75.00点から47.70点へ下落した一方、コード実行スコアが100点満点を記録し、メインランキングは46.29点から76.47点へと上昇した。誠実性評価はpassからw
GPT-o3が本日のSmokeベンチマーク主要ランキングで79.28点を記録し、昨日の93.16点から13.9ポイント下落した。コード実行と資料制約の両次元で13ポイント以上の下落が見られたが、小サンプルによる抽選変動が主因とみられる。
2026年8月1日のYZ Index Smoke速測では11モデルを対象に評価が行われ、Claude Opus 4.7とQwen3 Maxが93.39点で同点首位となった。GLM-4.6は誠実性評価がwarnに転落するなど、複数モデルで大幅
Qwen3 MaxはSmoke評価において、材料制約スコアが前日の67.70点から47.70点へ20点急落した一方、コード実行スコアは54.70点から92.50点へ37.8点急騰し、メインランキング総合スコアは60.55点から72.34点へ
本日のSmokeテストにおいて、Grok 4のコード実行スコアが92.00点から72.50点へ19.5点急落した一方、資料制約スコアは60.90点から84.10点へ23.2点上昇し、総合ランキングスコアは78.01点から77.72点へわずか
2026年7月31日のYZ Index Smoke速測では10モデルを対象に評価が行われ、DeepSeek V4 Proが96.94点で当日首位を獲得した。本速報はコード実行と資料制約の2次元のみをカバーする小サンプルの日次モニタリング信号
DeepSeek V4 ProのSmokeテストにおいて、コード実行スコアが前日の100.00から75.00へと25点急落し、総合スコアも83.53から76.85へと下落した。ただし、現時点のデータはモデルの実質的な性能劣化を示すものではな
Grok 4が本日のSmoke評価テストにおいてメインスコアを89.30点から78.01点へと11.3点落とした。主因は資料制約次元の単日18点下落であり、サンプル数の少なさによる抽選変動の可能性が高い。
2026年7月30日のYZ Index Smokeテストでは11モデルを対象に評価が行われ、Claude Opus 4.7とGPT-5.5が86.5点で同率首位となった。本速報はコード実行と資料制約の2次元のみをカバーする日次10問の速報テ
WDCD v3.1守約テストのRun #253において、Claude Opus 4.7が6.8点上昇、Claude Sonnet 4.6が6.7点上昇した一方、Gemini 3.1 Proが5.6点下落し、多段階の段階的圧力下でのモデル間の