Gemini 2.5 Pro と Gemini 3.1 Pro が92.44点で並列首位:2026-07-17 Smokeクイックテストデータ速報
2026-07-17のYZ Index Smokeクイックテストでは11モデルを評価し、Gemini 2.5 ProとGemini 3.1 Proが92.44点で並列首位となった。本速報は1日10問のクイックテストによる短期シグナル観測を目
2026-07-17のYZ Index Smokeクイックテストでは11モデルを評価し、Gemini 2.5 ProとGemini 3.1 Proが92.44点で並列首位となった。本速報は1日10問のクイックテストによる短期シグナル観測を目
2026-07-16のYZ Index Smoke速報(9モデル対象)では、Grok 4が94.15点で当日首位を獲得。Smokeは毎日10問の速報テストであり、短期シグナルの観察に適しているが、Fullウィークリーランキングの結論とは同等
2026年7月15日のYZ Index Smokeクイックテストでは、Claude Opus 4.7、Gemini 2.5 Pro、GPT-5.5の3モデルが100点満点で並び当日首位となった。本テストはコード実行と資料制約の2次元のみをカ
2026年7月14日のYZ Index Smoke速測では11モデルを対象に評価が行われ、DeepSeek V4 Proが91.46点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期シグナルの観察に適しているが、Full週間ラ
2026年7月13日のYZ Index Smoke快速テストでは10モデルを対象に評価が行われ、Gemini 2.5 Proがコード実行・資料制約ともに満点の100点を獲得し当日首位となった。一方、Qwen3 MaxやClaude Sonn
2026年7月12日のYZ Index Smoke速測では11モデルを対象に評価が行われ、Claude Opus 4.7、Claude Sonnet 4.6、DeepSeek V4 Pro、Grok 4が96.99点で当日首位に並んだ。一方
2026年7月11日のYZ Index Smokeクイックテストでは11モデルを対象に評価が実施され、Claude Opus 4.7・Claude Sonnet 4.6・GPT-o3が81.44点で当日首位に並んだ。本テストはコード実行と資
2026年7月10日のWinzheng YZ Index Smoke速報では、9モデルを対象に評価を実施し、GPT-o3が86.9点で当日首位を獲得した。Claude Opus 4.7やClaude Sonnet 4.6など複数モデルで大幅
2026年7月9日のWinzheng YZ Index Smokeクイックテストでは、10モデルを対象に評価が行われ、Claude Opus 4.7が90.51点で当日首位を獲得した。コード実行と資料制約の両次元でバランスの取れたスコアを記
2026年7月8日のWinzheng YZ Index Smoke速報では、10モデルを対象に評価を実施し、DeepSeek V4 Proが95.19点で当日首位を獲得した。Smokeは毎日10問の速報テストであり、短期シグナルの観察に適し
2026年7月7日のYZ Index Smokeクイックテストでは、11モデルを対象に評価を実施し、Claude Opus 4.7 と Grok 4 がともに96.99点で当日首位に並んだ。
2026-07-06のWinzheng YZ Index Smokeクイックテストでは11モデルを対象に評価が実施され、Doubao Pro が83.91点で当日首位を獲得した。
2026-07-05のYZ Index Smokeクイックテストでは11モデルを対象に評価を実施し、Doubao Pro と Gemini 3.1 Pro が88.54点で当日首位に並んだ。
最新のWDCDサイクルでは、主流5モデルが同時に大幅下落し、最大下落幅は12.5ポイントに達した一方、Qwen3 Maxのみが7.5ポイントのプラス成長を実現し、Top3入りを果たした。
2026年5月14日のSmoke簡易評価で、Claude Sonnet 4.6がメインボード84.68点で首位に躍り出たが、同モデルを含む8大主流AIモデルのコード実行スコアが軒並み25点暴落し、ランキングが大きく洗い替えされた。これは偶然
本日のSmoke軽量評価で、Claude Opusが89.43点で首位を獲得した一方、Grok 4とGPT-o3が実行次元で軒並み崩壊し、25.2点と23.1点の大幅下落を記録した。AIモデル反復における安定性リスクが浮き彫りとなった。
2026年初時点で中国語AI評価エコシステムに存在する4つの主流ベンチマーク(YZ Index、SuperCLUE、OpenCompass、C-Eval)の方法論的差異を分析し、それぞれの適用シーンと選定指針を解説する。
現在のAI評価ランキングに潜む5つの重大な問題点を指摘し、Winzheng(winzheng.com)が提供するYZ Indexがいかにこれらの問題を解決し、評価業界に革新をもたらすかを解説する。
Winzheng(winzheng.com)が発表したYZ Index WDCD遵守テストは、AIが約束を本当に守れるかという盲点を突き、3ラウンド30問の精密設計でAIの「信用危機」を解剖します。従来のベンチマークでは測れない真の信頼性を
Winzhengが推出したYZ Index v7の新しい実験的次元「DCD(Dynamic Context Decay、動的コンテキスト減衰)」は、複数ターン対話においてAIモデルが初期制約をどれだけ守れるかを測定する。判定にAIを一切使わ