SGLangが2週間でGLM-5.2を最適化:8×B300上で500 TPS超を達成
SGLangチームがGLM-5.2-NVFP4の推論サービスを2週間で大幅最適化し、8×B300・バッチサイズ1の低レイテンシ環境で500 TPS超を達成した。Spec V2、IndexShare MTP、TopK-V2など複数のランタイム
SGLangチームがGLM-5.2-NVFP4の推論サービスを2週間で大幅最適化し、8×B300・バッチサイズ1の低レイテンシ環境で500 TPS超を達成した。Spec V2、IndexShare MTP、TopK-V2など複数のランタイム
SGLang Team と Thinking Machines Lab は、975Bパラメータのマルチモーダルモデル Inkling を SGLang と Miles で初日からサポートすると発表した。推論サービス、カーネル最適化、投機的デ
MilesチームがOn-Policy Distillation(OPD)をコア機能としてシステムに統合し、教師モデルの効率的な推論行動を学生モデルへ転移させることに成功した。単一の8×NVIDIA B200ノード上でQwen3.5-35B-
2026年7月24日のYZ Index Smoke速測では10モデルを対象に評価が行われ、Grok 4が84.21点で当日首位を獲得した。Smoke速測は毎日10問の小規模テストであり、短期シグナルの観測に適している。
2026年7月23日実施のRun#243 Smokeテストにおいて、GLM-4.6は総合ランキング55.74点を記録。材料制約で93.30点の高得点を挙げた一方、コード実行は25.00点にとどまり、誠実性評価はfail(プローブ30.00点
2026年7月23日のYZ Index Smoke速測では11モデルを対象に評価が行われ、Claude Opus 4.7が96.99点で当日首位を獲得した。本速測はコード実行と資料制約の2次元のみをカバーする小サンプルの日次シグナルである。
最新のWDCD v3.1守約テストにおいて、GLM-4.6が13.7点上昇して92.00点に達した一方、GPT-o3は6.9点下落して87.10点となり、上位5モデルの内部順位が大きく塗り替えられた。
WDCD v3.1の契約遵守テストにおいて、リソース制限シナリオでgpt-5.5が1.55/4と最低スコアを記録し、全5シナリオ中の最大スコア差は2.45点に達した。モデルの契約遵守能力はシナリオ固有の特性であり、単一シナリオの成績から全体
v2アンカー問題8問のみを対象とした3ラウンドテストにおいて、11モデルのR3平均誠実率はわずか40.9%にとどまり、4モデルがR3で完全崩壊(0点)を記録した。崩壊事例はすべてビジネスルール類の制約に集中している。
WDCD v3.1コンプライアンス遵守テストにおいて、Grok 4が93.80点で11モデル中最高得点を記録し、Doubao Proが67.30点で最下位となった。両者の差は26.5点に達し、多ターン段階的プレッシャー下での制約保持能力に大
GLM-4.6は本日のSmoke評価テストにおいて誠実性評価がpassからfailに急落した一方、コード実行スコアが50.00点から97.00点へと47点上昇し、メインランキング総合スコアも62.83点から74.00点に改善した。
GPT-o3が本日のSmokeベンチマークで総合スコアを昨日の96.27点から87.94点へと8.3点落とした。コード実行・工程判断の両次元が大幅に下落し、誠実性評価も「pass」から「warn」に転じた。
2026年7月22日のYZ Index Smoke速測では11モデルを対象に評価が行われ、Grok 4が98.35点で当日首位を獲得した。Smokeは1日10問の速測であり、短期的なシグナルの観測に適している。
本日のSmoke評価において、Claude Opus 4.7のメインスコアが100.00点から73.92点へと26.1ポイント下落した。コード実行・資料制約の両次元で25ポイント以上の降下が確認されたが、小サンプルによる変動の可能性が高いと
本日のSmoke評価において、Gemini 3.1 Proの材料制約スコアが90.40点から72.60点へと17.8点下落し、総合ランキングも81.93点から75.90点に低下した。ただし、コード実行・エンジニアリング判断の各スコアは改善し
2026年7月21日実施のYZ Index Smokeクイックテストで、Claude Sonnet 4.6とGPT-o3が96.27点で同率首位を獲得。11モデルを対象に代码执行とマテリアル制約の2次元で評価が行われた。
Qwen3 MaxがSmoke評価テストのメインランキングで前日比14.9点下落し、特にコード実行次元が31.3点の急落を記録した。誠実性評価もpassからwarnに変化し、明確なリスクシグナルが発生している。
本日のSmoke評価において、Gemini 2.5 Proのコード実行スコアが74.60点から50.00点へと24.6点急落し、メインランキング全体も76.49点から69.98点に低下した。ただし、サンプル数の少なさによる抽選変動が主因と分
2026年7月20日のYZ Index Smokeクイックテストでは11モデルを対象に評価が行われ、Claude Opus 4.7がすべての次元で満点を獲得し当日首位となった。一方、Gemini 2.5 Pro・Qwen3 Max・Clau
本日のSmoke評価においてGemini 3.1 Proの材料制約スコアが90.90点から64.30点へ26.6点急落した一方、コード実行スコアの大幅回復により総合ランキングは51.03点から56.44点へと上昇した。