赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
GPT-o3 80.9
▲3.6
·
#2
DeepSeek V4 Pro 79.6
▲5.1
·
#3
Claude Opus 4.7 79
▼4
·
#4
Grok 4 77.8
▼4.4
·
#5
Claude Sonnet 4.6 77.4
▲1.5
·
#6
GPT-5.5 77.1
▼3.4
·
#7
Gemini 2.5 Pro 74
·
#8
豆包 Pro 72.3
▼7.7
·
#9
Qwen3 Max 71.1
▼3
·
#10
Gemini 3.1 Pro 69.4
▲3.5
·
#11
GLM-4.6 63.5
▲10.3
·
▲ GLM-4.6 +21.9 · ▼ GPT-o3 -12.5
·
#1
GPT-o3 80.9
▲3.6
·
#2
DeepSeek V4 Pro 79.6
▲5.1
·
#3
Claude Opus 4.7 79
▼4
·
#4
Grok 4 77.8
▼4.4
·
#5
Claude Sonnet 4.6 77.4
▲1.5
·
#6
GPT-5.5 77.1
▼3.4
·
#7
Gemini 2.5 Pro 74
·
#8
豆包 Pro 72.3
▼7.7
·
#9
Qwen3 Max 71.1
▼3
·
#10
Gemini 3.1 Pro 69.4
▲3.5
·
#11
GLM-4.6 63.5
▲10.3
·
▲ GLM-4.6 +21.9 · ▼ GPT-o3 -12.5
·
最新ニュース
すべてのニュースを見る →WDCD Run #253:Grok 4が94.8点でトップ、平均指示減衰率は4.5%
WinzhengのWDCDベンチマーク第253回実行において、Grok 4が94.8点で首位を獲得。11モデルを対象とした評価では、平均指示コミットメント減衰率は4.5%となった。
Grok 4が89.3点で首位:2026-07-29 YZ Index Smoke速報データブリーフィング
2026年7月29日実施のYZ Index Smoke速測(10モデル対象)において、Grok 4が89.3点で当日首位を獲得した。本速測はコード実行とマテリアル制約の2次元のみを対象とした日次10問の簡易評価であり、短期シグナルの観測に適
AI音声合成の新星Fish Audio、5200万ドルのシード資金調達——年間収益は2100万ドル
サンフランシスコ拠点のAI音声合成スタートアップFish Audioが5200万ドルのシードラウンドを完了し、近年のAI音声分野で最大規模の初期資金調達の一つとなった。同社はサービス開始以来800万人超のユーザーを獲得し、年間経常収益(AR
米国最大の電力網:データセンターへの一時停電で系統崩壊を防止か
米国最大の電力網運営会社PJMが、AI・クラウド需要の急増による電力不足に対応するため、データセンターへの一時的な強制停電措置を検討していることが明らかになった。この動きは、AIインフラの拡大と電網の安定性のバランスをめぐる長期的な課題を浮
OpenAIへのハッキング攻撃?繰り返される旧パターン、AI株が急落
OpenAIがHugging Faceプラットフォームを経由した「前例のない」AIモデルへの攻撃を報告し、AI関連株が急落した。しかし専門家は、こうしたサプライチェーン攻撃のリスクは以前から指摘されており、今回の事態は「灰色のサイ」が突進し
Guardoc Health、Amazon Novaモデルを活用して1日100万件の臨床文書を処理
Guardoc HealthがAmazon Bedrock上のAmazon Novaモデルを通じて1日100万件超の臨床文書を処理していると発表した。医療AI分野における文書自動化の大きな可能性を示す事例として注目されている。
Adam Schiff、AI生成の政治家イメージと有料インフルエンサーコンテンツを規制する2法案を提出へ
カリフォルニア州上院議員Adam Schiffは、政治委員会が費用を負担する視聴覚コンテンツへのスポンサー表示義務化と、AI生成コンテンツへの候補者なりすまし禁止規定の拡張を盛り込んだ2つの法案を提出する予定。2026年中間選挙前のオンライ
『ニューヨーク・タイムズ』はAI覇者の手から報道を救えるか?
2023年末、ニューヨーク・タイムズがOpenAIとマイクロソフトを著作権侵害で提訴した。この訴訟は、ジャーナリズムとAI産業の力学を根本から塗り替える可能性を秘めた、時代を画する法廷闘争として注目されている。
サムスンの半導体エンジニアが集団転職、SKハイニックスが人材の"ブラックホール"に
サムスン電子の半導体部門でエンジニアの大規模流出が相次いでおり、2025年以降300名超がSKハイニックスなどへ転職。HBM(高帯域幅メモリ)市場での技術的な遅れが人材離れを加速させている。
シリコンバレーAI新興企業のIPO間近、非営利組織は「受け皿」の準備を完了
AnthropicとOpenAIのIPOが近づく中、多額の株式オプションを手にする見込みのAI企業従業員からの寄付を期待し、非営利組織が受け入れ態勢を整えている。WIREDの報道をもとに、AI業界が生み出す新世代の富と慈善活動の行方を探る。
アルメニアのAI賭け:チップではなく、コンピューティング主権
コーカサス地方の内陸小国アルメニアが、半導体製造競争に参加する代わりに「コンピューティング主権」を国家AI戦略の核心に据えるという独自路線を打ち出し、国際的な注目を集めている。
Hugging Faceでディープフェイク裸体画像が大量発覚、プラットフォーム監視に課題
WIREDの調査報告によると、オープンソースAIプラットフォームHugging Face上でホストされている複数の画像編集モデルが、ディープフェイク裸体画像の生成に広く利用されていることが明らかになった。研究者たちは安全対策を容易に回避でき
レビュー
すべて見る →Grok 4が89.3点で首位:2026-07-29 YZ Index Smoke速報データブリーフィング
2026年7月29日実施のYZ Index Smoke速測(10モデル対象)において、Grok 4が89.3点で当日首位を獲得した。本速測はコード実行とマテリアル制約の2次元のみを対象とした日次10問の簡易評価であり、短期シグナルの観測に適
Claude Sonnet 4.6、コード実行スコアが22点急落――資料制約は25.7点上昇
本日のSmokeベンチマークにおいて、Claude Sonnet 4.6のコード実行スコアが97.00点から75.00点へと22点急落した一方、資料制約スコアは60.20点から85.90点へと25.7点上昇した。主要ランキングの総合スコアは
DeepSeek V4 Pro、コード実行スコアが25点急落——材料制約は26.8点上昇
本日のSmokeベンチマークにおいて、DeepSeek V4 Proのコード実行スコアが100.00点から75.00点へと25点急落した一方、材料制約スコアは68.20点から95.00点へと26.8点上昇し、総合ランキングのスコアは85.6
WDCD コンプライアンス
#1
Grok 4
94.8
#2
DeepSeek V4 Pro
93.6
#3
GLM-4.6
93.5
#4
Claude Opus 4.7
92.6
#5
Claude Sonnet 4.6
88.2
#6
GPT-o3
85.7
#7
Gemini 3.1 Pro
81
守約ランキング全体を見る →
Research Lab
WDCD Run #253:Grok 4が94.8点でトップ、平均指示減衰率は4.5%
WinzhengのWDCDベンチマーク第253回実行において、Grok 4が94.8点で首位を獲得。11モデルを対象とした評価では、平均指示コミットメント減衰率は4.5%となった。
3大モデル翻訳対決:第31週品質評価、gpt-o3が8.3点でトップ
今週381件の翻訳タスクを3つのモデルで実施し、抽出した3件についてマルチモデルのブラインド評価を行った結果、gpt-o3が平均8.3点で総合最優秀となった。
WDCD Run #247:Grok 4がネガティブ減衰でトップ、平均指示減衰率は-1.8%に縮小
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #247では、11モデルを対象に多ターン対話における指示遵守の減衰を測定し、平均指示減衰率は-1.8