赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
▲ Claude Opus 4.7 +15 · ▼ 豆包 Pro -81.5
·
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
▲ Claude Opus 4.7 +15 · ▼ 豆包 Pro -81.5
·
最新ニュース
すべてのニュースを見る →Accel、19ヶ月ぶりに5億5,000万ドルのインド向けファンドを組成——超過申し込みで締め切り
米ベンチャーキャピタルのAccelは、新たなインド向けファンドの組成を完了し、その規模は5億5,000万ドルに達した。ファンドは募集開始からわずか数週間で超過申し込みとなり、前回のインド向けファンド組成からわずか19ヶ月での達成となった。
AnthropicのClaude新モデル、2026年8月2日より不可視透かしを全埋め込み――グローバル規制対応がプライバシー論争を招く
Anthropicは2026年8月2日より、すべての新Claudeモデルを対象に、EUのAI法が求めるコンテンツ透明性要件への対応として、グローバルでテキスト透かしを埋め込む方針を導入した。退出オプションのないこの政策は、ユーザーや開発者の
ホワイトハウスのAIフレームワーク、オープンウェイトモデルを除外——クローズドソースシステムは30日間の連邦審査に直面
ホワイトハウスが2026年8月5日に策定した自主的AIセキュリティフレームワークは、審査対象をクローズドソースのフロンティアモデルに限定し、オープンウェイトモデルを明確に除外した。この区分けは米国AI開発の競争ルールを根本から変えるものとな
WDCD Run #276:Grok 4が94.8点でトップ、平均指示減衰率は-18.2%
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #276では、11モデルを評価した結果、Grok 4が94.8点で首位となり、全体の平均指示遵守率の減衰は-18.2%となった。
WDCD v3.1サイクル追跡:Doubao Pro +13.8、GPT-o3 -11.6、約束遵守ランキングが大きく塗り替わる
WDCD v3.1テストにおいて、Doubao ProとGLM-4.6が大幅上昇した一方、GPT-o3とDeepSeek V4 Proが顕著に下落し、AIモデルの約束遵守能力ランキングが大きく変動した。現在のトップ5はGrok 4を筆頭に、
ビジネスルール場景の最低スコアわずか1.55点、Claude opus 4.7はリソース制限場景で2点に崩落
WDCD v3.1の5大場景横断評価において、ビジネスルール場景が全モデル中最低スコアの赛道となり、Qwen3-maxはわずか1.55/4点にとどまった。一方、Claude opus 4.7はデータ境界で4/4の満点を獲得しながらも、リソー
R3誠実率わずか59.1%:GPT-o3の20%崩壊が示す三ラウンド守約の断絶
WDCD v3.1パイロットテストにおいて、11モデルがv2アンカー問題8問で明確な三ラウンド衰退を示した。R1確認率100%、R2抵抗率86%に対し、R3誠実率はわずか59.1%にとどまり、GPT-o3は20%という突出した崩壊率を記録し
Grok 4が94.80点でWDCD首位、Qwen3 Maxは69.20点で最下位——両者の差は25.6点
WDCD v3.1の遵約テストにおいて、Grok 4が94.80点で首位を獲得し、Qwen3 Maxは69.20点で11位に留まり、両モデルの合計点差は25.6点に達した。R3高圧ラウンドでの耐性が最終順位を大きく左右する結果となった。
GoogleのGeminiアプリユーザー数が10億人に急増、ChatGPTに迫る
GoogleのAIアプリ「Gemini」のユーザー数が10億人に達し、OpenAIのChatGPTと同水準に並んだ。両社はユーザー獲得をめぐり、互いに真っ向から競い合っている。
OpenAI、Linux版ChatGPTデスクトップアプリを正式リリース
OpenAIがLinux向けChatGPTデスクトップアプリを正式リリースし、長年にわたりLinuxユーザーから求められていた要望にようやく応えた。これによりAI開発者コミュニティでの存在感強化が期待される。
Google GeminiのユーザーがAI史上最速で10億人突破
GoogleはAIアシスタントGeminiの月間アクティブユーザー数が10億人を突破したと発表し、Google史上最速の成長を遂げた製品となった。一方でモデルの更新ペース鈍化という課題も浮上しており、成長の持続可能性が問われている。
GLM-4.6、コード実行で12.5点下落――資料制約で満点取得しメインランキングは5.4点上昇
GLM-4.6が本日のSmoke評価でメインランキング79.38点を記録。コード実行は62.50点に下落した一方、資料制約は100.00点の満点を獲得し、誠実性評価はfailからpassに転換した。
レビュー
すべて見る →WDCD v3.1サイクル追跡:Doubao Pro +13.8、GPT-o3 -11.6、約束遵守ランキングが大きく塗り替わる
WDCD v3.1テストにおいて、Doubao ProとGLM-4.6が大幅上昇した一方、GPT-o3とDeepSeek V4 Proが顕著に下落し、AIモデルの約束遵守能力ランキングが大きく変動した。現在のトップ5はGrok 4を筆頭に、
ビジネスルール場景の最低スコアわずか1.55点、Claude opus 4.7はリソース制限場景で2点に崩落
WDCD v3.1の5大場景横断評価において、ビジネスルール場景が全モデル中最低スコアの赛道となり、Qwen3-maxはわずか1.55/4点にとどまった。一方、Claude opus 4.7はデータ境界で4/4の満点を獲得しながらも、リソー
R3誠実率わずか59.1%:GPT-o3の20%崩壊が示す三ラウンド守約の断絶
WDCD v3.1パイロットテストにおいて、11モデルがv2アンカー問題8問で明確な三ラウンド衰退を示した。R1確認率100%、R2抵抗率86%に対し、R3誠実率はわずか59.1%にとどまり、GPT-o3は20%という突出した崩壊率を記録し
WDCD コンプライアンス
#1
Grok 4
94.8
#2
Gemini 3.1 Pro
91.3
#3
GLM-4.6
88.5
#4
Claude Opus 4.7
85.4
#5
GPT-o3
83.6
#6
DeepSeek V4 Pro
83.1
#7
豆包 Pro
81.8
守約ランキング全体を見る →
Research Lab
WDCD Run #276:Grok 4が94.8点でトップ、平均指示減衰率は-18.2%
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #276では、11モデルを評価した結果、Grok 4が94.8点で首位となり、全体の平均指示遵守率の
4大モデル翻訳対決:第33週品質評価、claude-sonnet-4.6が9点でトップ
第33週の翻訳評価レポートでは、4つのモデルが計404件の翻訳タスクを処理し、抽出した3件のサンプルについて複数モデルによるブラインド評価を実施した結果、claude-sonnet-4.6が平均9点で
WDCD ラン #271:Grok 4 が首位、平均指示減衰率は0.9%まで低下
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第271回実行において、11モデルを評価した結果、グループ全体の平均指示減衰率はわずか0.9%を記録。Grok 4が総合首位を獲得し、Cl