Gemini 2.5 Pro と Gemini 3.1 Pro が92.44点で並列首位:2026-07-17 Smokeクイックテストデータ速報
2026-07-17のYZ Index Smokeクイックテストでは11モデルを評価し、Gemini 2.5 ProとGemini 3.1 Proが92.44点で並列首位となった。本速報は1日10問のクイックテストによる短期シグナル観測を目
2026-07-17のYZ Index Smokeクイックテストでは11モデルを評価し、Gemini 2.5 ProとGemini 3.1 Proが92.44点で並列首位となった。本速報は1日10問のクイックテストによる短期シグナル観測を目
2026-07-16のYZ Index Smoke速報(9モデル対象)では、Grok 4が94.15点で当日首位を獲得。Smokeは毎日10問の速報テストであり、短期シグナルの観察に適しているが、Fullウィークリーランキングの結論とは同等
2026年7月15日のYZ Index Smokeクイックテストでは、Claude Opus 4.7、Gemini 2.5 Pro、GPT-5.5の3モデルが100点満点で並び当日首位となった。本テストはコード実行と資料制約の2次元のみをカ
2026年7月14日のYZ Index Smoke速測では11モデルを対象に評価が行われ、DeepSeek V4 Proが91.46点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期シグナルの観察に適しているが、Full週間ラ
2026年7月13日のYZ Index Smoke快速テストでは10モデルを対象に評価が行われ、Gemini 2.5 Proがコード実行・資料制約ともに満点の100点を獲得し当日首位となった。一方、Qwen3 MaxやClaude Sonn
2026年7月12日のYZ Index Smoke速測では11モデルを対象に評価が行われ、Claude Opus 4.7、Claude Sonnet 4.6、DeepSeek V4 Pro、Grok 4が96.99点で当日首位に並んだ。一方
2026年7月11日のYZ Index Smokeクイックテストでは11モデルを対象に評価が実施され、Claude Opus 4.7・Claude Sonnet 4.6・GPT-o3が81.44点で当日首位に並んだ。本テストはコード実行と資
2026年7月10日のWinzheng YZ Index Smoke速報では、9モデルを対象に評価を実施し、GPT-o3が86.9点で当日首位を獲得した。Claude Opus 4.7やClaude Sonnet 4.6など複数モデルで大幅
2026年7月9日のWinzheng YZ Index Smokeクイックテストでは、10モデルを対象に評価が行われ、Claude Opus 4.7が90.51点で当日首位を獲得した。コード実行と資料制約の両次元でバランスの取れたスコアを記
2026年7月8日のWinzheng YZ Index Smoke速報では、10モデルを対象に評価を実施し、DeepSeek V4 Proが95.19点で当日首位を獲得した。Smokeは毎日10問の速報テストであり、短期シグナルの観察に適し
2026年7月7日のYZ Index Smokeクイックテストでは、11モデルを対象に評価を実施し、Claude Opus 4.7 と Grok 4 がともに96.99点で当日首位に並んだ。
2026-07-06のWinzheng YZ Index Smokeクイックテストでは11モデルを対象に評価が実施され、Doubao Pro が83.91点で当日首位を獲得した。
2026-07-05のYZ Index Smokeクイックテストでは11モデルを対象に評価を実施し、Doubao Pro と Gemini 3.1 Pro が88.54点で当日首位に並んだ。
OpenAIが2026年5月20日に内部の汎用推論モデルが1946年のエルデシュ平面単位距離予想を改善する無限構造族を自主発見したと発表し、数学者が検証を完了。しかしWinzhengはexecutionとgroundingの観点から、形式化
本日のSmoke評価で、Claude Opus 4.7のメインランキング得点が昨日の89.43点から79.86点へと9.6点暴落し、特にコード実行次元では満点100点から75点へと急落した。この変動が真のモデル退化なのか、単なる抽選の運によ
WDCD遵守テストのパイロット段階で、Gemini 3.1 ProとQwen3 Maxが65.00点で並んで首位に立ち、Grok 4はわずか42.50点で最下位に転落、R3段階での全面崩壊により、トップとボトムの差は22.5点に達した。
Gemini 2.5 ProがSmoke評価のメインランキングで74.00から87.54へ急上昇し、誠実性評価もfailからpassへ逆転した一方、エンジニアリング判断は28.4点暴落。本記事ではこの異常変動が単なる抽選変動か、モデルの実質
2026年初時点で中国語AI評価エコシステムに存在する4つの主流ベンチマーク(YZ Index、SuperCLUE、OpenCompass、C-Eval)の方法論的差異を分析し、それぞれの適用シーンと選定指針を解説する。
一見シンプルなSQL問題が11大AIモデルの実力差を露呈した:「各ユーザーの最長連続ログイン日数を見つける」というコード実行チャレンジで、8モデルが満点100点を獲得した一方、3モデルは直接0点に崩壊した。これは偶然ではなく、現在のAIが複
WDCD Run#105のデータ公開は、業界が長年見過ごしてきた盲点を明らかにした。すべての主流評価体系が「モデルが何をできるか」を測定する一方で、「モデルが何をしないか」という企業AI導入時の信頼の核心を体系的に測定する者はほぼ存在しなか