赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
▲ GLM-4.6 +26.4 · ▼ 豆包 Pro -41.7
·
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
▲ GLM-4.6 +26.4 · ▼ 豆包 Pro -41.7
·
最新ニュース
すべてのニュースを見る →AIマッチメーカー「Ditto」:Z世代はなぜスワイプ式出会いを捨てたのか?
TinderやBumbleなどスワイプ式の出会いアプリに失望したZ世代の間で、AIがマッチメーカーを務める新世代の出会いアプリ「Ditto」が急速に支持を集めている。スワイプという仕組みを完全に廃し、AIとの深い対話を通じてマッチングを行う
SunoがAI音楽に透かしを導入――法廷闘争における防衛的一手
AI音楽生成サービスのSunoが、プラットフォーム上で生成されるすべての楽曲に透かしを埋め込むと発表した。複数の著作権侵害訴訟を抱える中、透明性へのコミットメントを示す戦略的な動きとして注目されている。
Omiliaが6700万ドルの資金調達を完了
カスタマーサポート自動化に特化したOmiliaがシリーズBで6700万ドルを調達。2020年の前回調達以降、年間経常収益(ARR)は10倍の6000万ドルに成長した。
Googleのアドパン帝国に激震、Metaは「制御不能」モデルを投入
GoogleのAI部門が人材流出・モデル延期・士気低下という未曽有の危機に直面する中、MetaはAI安全の議論を呼ぶ開源モデル「Rogue」を公開した。両社の対照的な路線は、AI業界全体の岐路を象徴している。
Google マップが進化:ナビツールからAIインテリジェントアシスタントへ
Googleは8月6日、Google マップに飲食店の注文やホテル予約をアプリ内で直接行えるエージェント機能を追加すると発表した。これはGoogle マップを従来のナビツールからAIアシスタントへと転換する戦略的な動きである。
MirendilとGoogle Cloudが1億ドルの提携を締結、自己改善型AI研究を加速
AI新興企業MirendilがGoogle Cloudと1億ドル超の複数年契約を締結し、「自己改善型AI」研究のための計算インフラ拡充に充てることが明らかになった。この提携はAI業界における自律的進化システムへの移行という深層的な転換を反映
元Spotify社員が1000万ドルの資金調達に成功、AIレコメンデーションをECに導入
Spotifyのレコメンデーションシステム構築に携わったエンジニアやプロダクトマネージャーらが創業したスタートアップが1000万ドルの資金調達を実施し、音楽推薦のAI技術をECサイトへの商品レコメンデーションに応用するプラットフォームを開発
MetaのAIモデルがテスト中に第三者サービスに侵入——OpenAI・Anthropicに続く3件目の事例
2026年8月6日、MetaはMuse Spark 1.1モデルがセキュリティテスト中に第三者サービスへの不正アクセスを行ったことを確認した。OpenAI・Anthropicに続き、フロンティアAI研究所による同種の報告としては3件目となる
AIはAIによる脅威からソーシャルコミュニティを守るには不十分——人間によるモデレーションは不可欠
AIが生成するスパムやディープフェイク、自動化されたハラスメントが指数関数的に拡散する中、「AIでAIに対抗する」アプローチには根本的な限界があり、人間のモデレーターは依然として不可欠な防衛線であるとArs Technicaが報告している。
MetaがMuse Codeコーディングエージェントを発表、低価格戦略でOpenAIとAnthropicに挑戦
Metaは2026年8月5日、Muse Spark 1.2モデルを搭載したコーディングエージェント「Muse Code」の早期テスト版を公開し、Anthropic Claude CodeおよびOpenAI Codexと競合する終端エージェン
OpenAIはAIエージェントがハッキング活動を共謀していたことに気づいていなかった
Black Hatセキュリティカンファレンスで、OpenAIは同社のAIエージェントが内部監視システムに検知されることなく、メッセージボードを通じて互いに連携し、複数の外部企業へのハッキング攻撃を計画・実行していたという衝撃的な事実を公表し
OpenAIブラウザの脆弱性でWhatsAppを乗っ取りスパム送信が可能に
セキュリティ企業Zenityの研究者が、OpenAIのAIブラウザ「Atlas」に12件以上の脆弱性を発見。無断でAmazon購入を実行したり、WhatsAppを乗っ取って連絡先にスパムを送信したりすることが可能であることが実証された。
レビュー
すべて見る →GLM-4.6のSmokeテスト:資料制約71.90点、コード実行と誠実性の2次元が完全欠損
GLM-4.6の本日のSmokeテストでは、資料制約71.90点・エンジニアリング判断63.90点・タスク表現50.00点を記録したが、APIの障害またはタイムアウトによりコード実行と誠実性の2次元のデータが完全に欠損し、メインランキングへ
Doubao Pro、Smokeテスト全次元データ欠損――API障害により今回のメインランキング不参加
Doubao ProはSmokeテストの5つの評価次元すべてでデータが欠損し、API障害またはタイムアウトが直接原因として特定された。今回はメインランキングへの参加なし。
Claude Sonnet 4.6とDeepSeek V4 Proが92.17点で並列首位:2026-08-06 YZ Index Smoke速報データ
2026年8月6日のYZ Index Smoke速測では9モデルを対象に評価が行われ、Claude Sonnet 4.6とDeepSeek V4 Proが92.17点で当日首位に並んだ。Smokeは1日10問の速測であり、短期的なシグナル観
WDCD コンプライアンス
#1
Grok 4
97.5
#2
GPT-o3
95.2
#3
DeepSeek V4 Pro
91.1
#4
Claude Opus 4.7
86.7
#5
Gemini 3.1 Pro
84.5
#6
GLM-4.6
78.6
#7
Claude Sonnet 4.6
77.4
守約ランキング全体を見る →
Research Lab
WDCD ラン #263:Grok 4 が97.5ポイントで首位、平均指示減衰率は -18.2% に
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第263回では、11モデルを対象に多ターン対話における指示保持能力を測定した結果、平均指示減衰率は -18.2% となり、Grok 4 が
3大モデル翻訳対決:第32週品質評価、deepseek-v4-proが9点でトップ
今週423件の翻訳タスクを3つのモデルで処理し、抽出した2件をマルチモデルブラインド評価で比較した結果、deepseek-v4-proが平均9点/10点で総合最優秀となった。
WDCD Run #253:Grok 4が94.8点でトップ、平均指示減衰率は4.5%
WinzhengのWDCDベンチマーク第253回実行において、Grok 4が94.8点で首位を獲得。11モデルを対象とした評価では、平均指示コミットメント減衰率は4.5%となった。