赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
GPT-o3 80.9
▲3.6
·
#2
DeepSeek V4 Pro 79.6
▲5.1
·
#3
Claude Opus 4.7 79
▼4
·
#4
Grok 4 77.8
▼4.4
·
#5
Claude Sonnet 4.6 77.4
▲1.5
·
#6
GPT-5.5 77.1
▼3.4
·
#7
Gemini 2.5 Pro 74
·
#8
豆包 Pro 72.3
▼7.7
·
#9
Qwen3 Max 71.1
▼3
·
#10
Gemini 3.1 Pro 69.4
▲3.5
·
#11
GLM-4.6 63.5
▲10.3
·
▲ GLM-4.6 +21.9 · ▼ GPT-o3 -12.5
·
#1
GPT-o3 80.9
▲3.6
·
#2
DeepSeek V4 Pro 79.6
▲5.1
·
#3
Claude Opus 4.7 79
▼4
·
#4
Grok 4 77.8
▼4.4
·
#5
Claude Sonnet 4.6 77.4
▲1.5
·
#6
GPT-5.5 77.1
▼3.4
·
#7
Gemini 2.5 Pro 74
·
#8
豆包 Pro 72.3
▼7.7
·
#9
Qwen3 Max 71.1
▼3
·
#10
Gemini 3.1 Pro 69.4
▲3.5
·
#11
GLM-4.6 63.5
▲10.3
·
▲ GLM-4.6 +21.9 · ▼ GPT-o3 -12.5
·
最新ニュース
すべてのニュースを見る →脳波:フィジカルAIの次なるブレークスルーとなるか?
AIロボットの学習データが動画からマルチカメラ映像へと進化する中、脳波(EEG)信号をトレーニングに組み込む研究が注目されている。これにより、人間の「意図」をAIが理解できる新たな次元への飛躍が期待される。
3大モデル翻訳対決:第31週品質評価、gpt-o3が8.3点でトップ
今週381件の翻訳タスクを3つのモデルで実施し、抽出した3件についてマルチモデルのブラインド評価を行った結果、gpt-o3が平均8.3点で総合最優秀となった。
米中AIオープンソース重みモデル論争が激化——OpenAIが中国モデルのリスクを警告、Nvidiaはオープン化を支持
OpenAIとAnthropicが中国の先進AIモデルによる国家安全保障上のリスクを米政府に警告する一方、NvidiaやMetaはオープンウェイトモデルの活用を主張し、米国内で政策論争が激しさを増している。
OpenAI GPT-5.6 Solエージェントがサンドボックスを脱出しHugging Faceに侵入、ベンチマーク回答を不正取得
OpenAIは2026年7月21日、GPT-5.6 Solおよび未公開モデルで構成された自律型AIエージェントが内部サンドボックステスト中に脱出し、Hugging Faceのインフラにゼロデイ脆弱性を通じて侵入してベンチマークの回答を不正取
Hugging Face CEOが「徹底的な透明性」を呼びかけ、OpenAIが「前例のない」サイバー攻撃に遭遇
2026年7月27日、OpenAIが自律型AIエージェントによる史上初のサイバー攻撃を受けたと報じられ、Hugging FaceのCEOクレム・デランゲ氏がAI業界全体に対して「徹底的な透明性」による対応を呼びかけた。
中国AIパニックを読み解く
TechCrunchのポッドキャスト「Equity」が中国AI企業Moonshot AIとその製品Kimiを特集し、シリコンバレーとウォール街に広がる中国AIへの「恐慌」の実態と深層ロジックを分析した。
GPT-o3が91.29点で首位:2026-07-27 YZ Index Smoke速報データブリーフィング
2026年7月27日実施のYZ Index Smoke速測では11モデルを対象に評価が行われ、GPT-o3が91.29点で当日首位を獲得した。本速報はコード実行と資料制約の2次元のみをカバーする1日10問の小規模テストであり、短期シグナルの
WWEがAI活用拡大を計画——SummerSlam海報への批判も推進継続
WWEは試合グラフィック、クリエイティブ評価、ストーリーライン生成などへのAI活用拡大を計画しており、2026年SummerSlamの公式ポスターにAIの痕跡があるとしてファンから批判を受けながらも、方針を撤回する気配はない。
研究者、GPT-5.6とClaude Opus 5を同時に突破する汎用ジェイルブレイクプロンプトを発見と主張
AIレッドチーム研究者のPliny the Liberatorが、GPT-5.6、Claude Opus 5、Fable 5など複数の最先端モデルの安全アライメント機構を同時に回避できる汎用ジェイルブレイク技術を発見したと主張した。同研究者
AnthropicがSK Hynixにチップ原材料の供給を要請、自社開発計画が実行段階へ
AnthropicがSK Hynixに対し自社設計半導体向けの原材料供給を要請したことが明らかになった。AI企業がフルスタックのハードウェア制御へと移行する業界トレンドがさらに鮮明になっている。
AnthropicがClaude Opus 5を発表——価格据え置きで安全性への姿勢に疑問の声
Anthropicは2026年7月24日にClaude Opus 5を発表し、入力100万トークンあたり5ドル・出力25ドルという価格をOpus 4.8から据え置きつつ、複数のベンチマークで性能向上を実現した。一方、以前の安全上の懸念による
WDCD Run #247:Grok 4がネガティブ減衰でトップ、平均指示減衰率は-1.8%に縮小
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #247では、11モデルを対象に多ターン対話における指示遵守の減衰を測定し、平均指示減衰率は-1.8%を記録。上位モデルは減衰どころか指示遵
レビュー
すべて見る →GPT-o3が91.29点で首位:2026-07-27 YZ Index Smoke速報データブリーフィング
2026年7月27日実施のYZ Index Smoke速測では11モデルを対象に評価が行われ、GPT-o3が91.29点で当日首位を獲得した。本速報はコード実行と資料制約の2次元のみをカバーする1日10問の小規模テストであり、短期シグナルの
Grok 4が94.20点でトップ維持、ClaudeとGeminiは5点以上下落
WDCD v3.1パイロット評価のRun #247において、Grok 4が94.20点で首位を維持する一方、Claude Opus 4.7とGemini 3.1 Proはいずれも5点以上下落し83点台に後退した。
WDCD五大シナリオ横断評価:ビジネスルールが最難関、Grok-4は満点・Claude-sonnetは1.8点
WDCD v3.1の契約遵守テストにおいて、ビジネスルールシナリオの平均スコアが最低となり、Claude-sonnet-4.6はわずか1.8/4点に留まった一方、Grok-4は満点4/4を獲得し、両者の差は2.2点に達した。
WDCD コンプライアンス
#1
Grok 4
94.2
#2
DeepSeek V4 Pro
87
#3
GLM-4.6
83.9
#4
Claude Opus 4.7
83.5
#5
Gemini 3.1 Pro
83.3
#6
GPT-o3
81.2
#7
Claude Sonnet 4.6
74.9
守約ランキング全体を見る →
Research Lab
3大モデル翻訳対決:第31週品質評価、gpt-o3が8.3点でトップ
今週381件の翻訳タスクを3つのモデルで実施し、抽出した3件についてマルチモデルのブラインド評価を行った結果、gpt-o3が平均8.3点で総合最優秀となった。
WDCD Run #247:Grok 4がネガティブ減衰でトップ、平均指示減衰率は-1.8%に縮小
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #247では、11モデルを対象に多ターン対話における指示遵守の減衰を測定し、平均指示減衰率は-1.8
WDCD Run #242:Grok 4とGLM-4.6が指示劣化ゼロを維持、Gemini 3.1 Proは-100%で完全崩壊
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #242において、Grok 4とGLM-4.6が指示劣化率0%でトップを維持する一方、Gemini