GPT-o3が95.91点で首位:2026年8月9日 YZ Index Smoke簡易テスト速報
2026年8月9日のYZ Index Smoke簡易テストでは9モデルを評価し、GPT-o3が95.91点で当日首位を獲得した。複数のモデルで大幅なスコア下落が見られ、後続の再テストによる検証が必要とされている。
2026年8月9日のYZ Index Smoke簡易テストでは9モデルを評価し、GPT-o3が95.91点で当日首位を獲得した。複数のモデルで大幅なスコア下落が見られ、後続の再テストによる検証が必要とされている。
Doubao ProはAPI障害・タイムアウトにより本日のSmokeテストで全問未回答となり、execution・grounding・judgment・integrity・communicationの5次元すべてがスコア「-」を記録、今回の
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが94.50点から75.00点へと19.5点下落した一方、資料制約スコアは43.30点から97.80点へと急上昇し、メインランキング総合スコアは71.4
2026年8月8日実施のYZ Index Smokeテストで、Claude Opus 4.7とGPT-o3が97.66点で並列首位となった。9モデルを対象とした当日の速報データを報告する。
SpecForgeチームがv0.3.0をリリースし、ターゲットモデルの推論とドラフトモデルのトレーニングを完全に分離。オンライン・オフライン・デカップリングワークフローを統合し、より広範な推測デコードアルゴリズムをサポートする。
HFバックエンドをSRTに置き換えてAR+DiTハイブリッド生成フレームワークを最適化し、エンドツーエンドのレイテンシを最大77.2%削減するとともに、動的バッチ処理や分離アーキテクチャによってスループットと並列効率を大幅に向上させた。
テンセントが開発したLLM推論向けオープンソース演算子ライブラリ「HPC-Ops」がSGLangのメインブランチに統合され、H20 GPU上でHy3モデルのTPOTを最大48.8%削減するなど、MoEモデルの推論性能を大幅に向上させることが
Claude Opus 4.7が本日のSmokeベンチマークでコード実行スコアが100.00点から69.50点に急落した一方、素材制約スコアと工学的判断スコアは大幅に上昇し、主要ランキングの低下は6.4点にとどまった。スコア変動の主な原因は
本日のSmoke評価において、Grok 4のマテリアル制約スコアが82.60点から65.00点へと17.6点急落した一方、総合ランキングは82.99点から81.23点へと1.8点の小幅な低下にとどまった。
2026年8月7日実施のYZ Index Smokeクイックテストでは、9モデルを対象にGemini 2.5 Proが87.21点で当日首位を獲得した。本テストは1日10問の小規模サンプルによる監視シグナルであり、週次フルランキングの結論と
GLM-4.6の本日のSmokeテストでは、資料制約71.90点・エンジニアリング判断63.90点・タスク表現50.00点を記録したが、APIの障害またはタイムアウトによりコード実行と誠実性の2次元のデータが完全に欠損し、メインランキングへ
Doubao ProはSmokeテストの5つの評価次元すべてでデータが欠損し、API障害またはタイムアウトが直接原因として特定された。今回はメインランキングへの参加なし。
2026年8月6日のYZ Index Smoke速測では9モデルを対象に評価が行われ、Claude Sonnet 4.6とDeepSeek V4 Proが92.17点で当日首位に並んだ。Smokeは1日10問の速測であり、短期的なシグナル観
WDCD v3.1テストにおいて、GPT-o3が9.5ポイント上昇してトップ2入りを果たした一方、GLM-4.6が14.9ポイント、Claude Sonnet 4.6が10.8ポイント下落するなど、AIモデル間で大きな順位変動が生じた。
WDCD v3.1の契約遵守テストにおいて、安全コンプライアンスシーンで最大2.2点の差が生じ、GPT-5.5とQwen3-Maxが最低の1.8/4点を記録した一方、エンジニアリング規範シーンでは全11モデルが3.2〜4点に集中した。
11モデルを対象にした3ラウンド連続施圧テストで、初期確認率R1は0.91だったものの、R3誠実率は54.5%まで低下し、約束遵守能力の系統的な減衰が明らかになった。Doubao ProはR1から崩壊した一方、DeepSeek V4 Pro
WDCD v3.1守約テストにおいて、Grok 4が97.50点で首位を獲得し、Doubao Proが68.00点で最下位となった。上位と下位の差は29.5点に達した。
2026年8月5日のYZ Index Smoke速測では9モデルを対象に評価が行われ、DeepSeek V4 Pro、GPT-5.5、GPT-o3が80.52点で当日首位に並んだ。Smokeは毎日10問の速測であり、短期シグナルの観察に適し
GLM-4.6は本日のSmokeテスト評価においてAPI障害・タイムアウトにより「実行(execution)」と「判断(judgment)」の2次元データが欠損し、自動再実行待ちのため今回のメインランキングには参加しない。材料制約次元は51
Doubao ProがSmoke評価においてexecution・grounding・judgment・integrity・communicationの5次元すべてでスコアが欠落し、メインランキングから除外された。原因はモデル能力の低下ではな