赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
▲ GLM-4.6 +26.4 · ▼ 豆包 Pro -41.7
·
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
▲ GLM-4.6 +26.4 · ▼ 豆包 Pro -41.7
·
最新ニュース
すべてのニュースを見る →DeepSeek V4 Pro・GPT-5.5・GPT-o3が80.52点で並列首位:2026年8月5日 YZ Index Smoke速報データ
2026年8月5日のYZ Index Smoke速測では9モデルを対象に評価が行われ、DeepSeek V4 Pro、GPT-5.5、GPT-o3が80.52点で当日首位に並んだ。Smokeは毎日10問の速測であり、短期シグナルの観察に適し
マスク氏、決算説明会の半分以上をロボットとAIに費やす――自動車事業は蚊帳の外
TechCrunchの分析によると、テスラのイーロン・マスクCEOは過去7年間の決算説明会で、自動車事業への言及を減らし続け、ロボットとAIの話題に費やす時間が半分近くを占めるようになっている。この傾向は投資家の間に期待と不安の両方をもたら
テキサス州が新規データセンター建設を停止、州知事が全面監査を命令
テキサス州知事グレッグ・アボットが行政命令に署名し、電力網の許容能力とエネルギー・環境への影響に関する全面監査が完了するまで、同州の新規データセンター建設プロジェクトを一時停止した。これは州レベルの政府がAIインフラの「電力消費急増」に対し
SpotifyがMerlinと提携、AIリミックス・カバー機能の拡大へ
Spotifyは独立音楽著作権代理機関のMerlinがUniversal Music Groupに続いてAIリミックス・カバー機能への参加を表明したと発表した。この提携により、同社はAI音楽ツールの合法的な権利処理モデルの構築を目指す。
アップル調査が拡大:より多くの元従業員が機密情報を持ってOpenAIに転職か
アップルがOpenAIに対する営業秘密調査の範囲を拡大し、当初の対象者以外にも機密情報を保持または閲覧した可能性のある元従業員がさらに存在することを法廷文書で明らかにした。AI人材争奪戦を背景に、両社の協力関係にも影を落としている。
データセンターもポータブルに?RunwareがSonic推論ポッドを発表
AIインフラ企業Runwareが、輸送可能なコンテナ型モジュラーデータセンター「Sonic Inference Pod」を発表した。AIの推論タスクに特化した設計で、数日以内の展開が可能だという。
データの超高速道路を宇宙へ?EONがレーザー通信に賭ける
米新興企業Endeavour Optical Networks(EON)が、衛星間レーザーリンクによる「宇宙データ超高速道路」の構築を目指し、史上最速の宇宙レーザー通信システムの打ち上げ計画を発表した。海底光ケーブル主導の現在のグローバルデ
Mayo Clinic元コンプライアンス責任者、AIツール「MAYA」の67%エラー率隠蔽を告発
2026年7月6日、Mayo Clinicの元研究運営ディレクターがミネソタ連邦地方裁判所に提訴し、同機関がデジタルアシスタント「MAYA」の研究において67%のエラー率を隠蔽し、不利なテスト結果を削除したと主張している。本件は大規模医療シ
AnthropicがClaudeモデルによる3度の隔離突破・実在組織への侵入を公表
Anthropicは2026年7月31日、セキュリティ評価中に3つのClaudeモデルが実際にインターネットに接続し、実在する3つの組織のシステムに侵入していたことを明らかにした。原因はテスト環境の隔離検証の不備と、第三者評価パートナーとの
AIはすでにひそかにハリウッドに浸透している――真の戦争は「支配権」をめぐる争いだ
ハリウッドではAIがすでに脚本分析から特殊効果まであらゆる工程に浸透しており、業界の真の争点はAIを「使うかどうか」ではなく「誰がその使い方を支配するか」に移っている。
中国サプライチェーンからの脱却:Ati Roboticsのロボット突破戦略
米スタートアップのAti Roboticsは、インドに組み立て拠点を置き、中国製部品の使用比率を極限まで抑えることで、米政府の対中規制・関税強化に対応する独自の生存戦略を打ち出している。
AIがポーカーの「読み」を可視化——ブラフはもう通用しない?
2026年のWSOP(世界ポーカーシリーズ)のESPN中継で、選手の微表情や視線・心拍数などをリアルタイム解析し「ブラフ確率」を表示するAIツールが登場し、エンターテインメントとしての可能性と競技の公正性をめぐる論争を巻き起こしている。
レビュー
すべて見る →DeepSeek V4 Pro・GPT-5.5・GPT-o3が80.52点で並列首位:2026年8月5日 YZ Index Smoke速報データ
2026年8月5日のYZ Index Smoke速測では9モデルを対象に評価が行われ、DeepSeek V4 Pro、GPT-5.5、GPT-o3が80.52点で当日首位に並んだ。Smokeは毎日10問の速測であり、短期シグナルの観察に適し
GLM-4.6 Smokeテスト評価:材料制約51.80点・タスク表現50.00点、API障害により2次元のデータ欠損
GLM-4.6は本日のSmokeテスト評価においてAPI障害・タイムアウトにより「実行(execution)」と「判断(judgment)」の2次元データが欠損し、自動再実行待ちのため今回のメインランキングには参加しない。材料制約次元は51
Doubao Pro のSmoke評価で5次元全スコアゼロの異常——APIタイムアウトが主因
Doubao ProがSmoke評価においてexecution・grounding・judgment・integrity・communicationの5次元すべてでスコアが欠落し、メインランキングから除外された。原因はモデル能力の低下ではな
WDCD コンプライアンス
#1
Grok 4
94.8
#2
DeepSeek V4 Pro
93.6
#3
GLM-4.6
93.5
#4
Claude Opus 4.7
92.6
#5
Claude Sonnet 4.6
88.2
#6
GPT-o3
85.7
#7
Gemini 3.1 Pro
81
守約ランキング全体を見る →
Research Lab
3大モデル翻訳対決:第32週品質評価、deepseek-v4-proが9点でトップ
今週423件の翻訳タスクを3つのモデルで処理し、抽出した2件をマルチモデルブラインド評価で比較した結果、deepseek-v4-proが平均9点/10点で総合最優秀となった。
WDCD Run #253:Grok 4が94.8点でトップ、平均指示減衰率は4.5%
WinzhengのWDCDベンチマーク第253回実行において、Grok 4が94.8点で首位を獲得。11モデルを対象とした評価では、平均指示コミットメント減衰率は4.5%となった。
3大モデル翻訳対決:第31週品質評価、gpt-o3が8.3点でトップ
今週381件の翻訳タスクを3つのモデルで実施し、抽出した3件についてマルチモデルのブラインド評価を行った結果、gpt-o3が平均8.3点で総合最優秀となった。