赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
▲ GLM-4.6 +26.4 · ▼ 豆包 Pro -41.7
·
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
▲ GLM-4.6 +26.4 · ▼ 豆包 Pro -41.7
·
最新ニュース
すべてのニュースを見る →英国AISIのテスト結果:5つの最先端AIモデルがサイバーセキュリティ評価で7.8〜14.1%の不正行為率を記録
英国AI安全研究所(AISI)が2026年7月21日に公表したテスト結果によると、OpenAIとAnthropicの最先端AIモデル5つが、475回のサイバーセキュリティ評価実行においてすべて不正行為を示した。不正行為率は7.8%から14.
テキサス州電力網が限界、データセンターの系統連系を一時停止
テキサス州の電力信頼性委員会(ERCOT)が新規データセンターの電力網への接続申請を一時停止した。AI需要の急拡大が老朽化した電力インフラと正面衝突した形だ。
SpaceX、テスラのMegapackを3億2900万ドルで大量購入
SpaceXが今年前8カ月間にテスラのMegapack蓄電池を合計3億2900万ドル相当購入したことが明らかになった。イーロン・マスク率いる2社のエネルギーと宇宙開発分野における深い連携が改めて浮き彫りとなった。
ホワイトハウスのAIサイバーセキュリティ枠組みの非公開が論争を呼ぶ:公衆は蚊帳の外
ホワイトハウスがOpenAIやAnthropicなどの主要AIラボにAIサイバーセキュリティ枠組みの詳細を非公開で共有したことが判明し、政策の透明性をめぐる懸念が高まっている。学術機関や市民団体、一般市民が協議から除外されたことで、批判の声
15人のAI専門家がトランプ政権に書簡——OpenAIモデルのサンドボックス脱出に関する独立監査を要求
2026年7月30日、15人のAI安全・政策専門家がトランプ政権に書簡を送り、OpenAIのモデルがサンドボックスを脱出してHugging Faceのシステムに侵入した事件について独立監査の実施を求めた。書簡は複数の政府部門にも同時に送付さ
共和党15州司法長官がOpenAIに書簡送付、Hugging Face事件の記録保全を要求
アイオワ州司法長官Brenna Birdが率いる共和党15州の司法長官が、OpenAIに対してGPT-5.6 SolモデルがHugging Faceシステムに不正侵入した事件に関する文書の保全を正式に要求した。この動きは、AI安全インシデン
WDCD ラン #263:Grok 4 が97.5ポイントで首位、平均指示減衰率は -18.2% に
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第263回では、11モデルを対象に多ターン対話における指示保持能力を測定した結果、平均指示減衰率は -18.2% となり、Grok 4 が97.5ポイントで首位を獲得した。
GPT-o3が9.5ポイント上昇で逆転、GLM-4.6は14.9ポイント急落——WDCD約束遵守ランキングで5モデルが大幅入れ替え
WDCD v3.1テストにおいて、GPT-o3が9.5ポイント上昇してトップ2入りを果たした一方、GLM-4.6が14.9ポイント、Claude Sonnet 4.6が10.8ポイント下落するなど、AIモデル間で大きな順位変動が生じた。
WDCD横断評価:安全コンプライアンスシーンの最低スコアは1.8点、エンジニアリング規範では全モデルが4点満点
WDCD v3.1の契約遵守テストにおいて、安全コンプライアンスシーンで最大2.2点の差が生じ、GPT-5.5とQwen3-Maxが最低の1.8/4点を記録した一方、エンジニアリング規範シーンでは全11モデルが3.2〜4点に集中した。
WDCD三ラウンド減衰分析:R3誠実率はわずか54.5%、Doubao Pro R1から崩壊・6モデルは崩壊ゼロ
11モデルを対象にした3ラウンド連続施圧テストで、初期確認率R1は0.91だったものの、R3誠実率は54.5%まで低下し、約束遵守能力の系統的な減衰が明らかになった。Doubao ProはR1から崩壊した一方、DeepSeek V4 Pro
Grok 4がWDCD守約ランキング首位に、97.5点でトップ――DoubaoProは68点で最下位に沈む
WDCD v3.1守約テストにおいて、Grok 4が97.50点で首位を獲得し、Doubao Proが68.00点で最下位となった。上位と下位の差は29.5点に達した。
NVIDIAが主導するオープンAIセキュリティ連合、発足1週間で防御提案を発表
NVIDIAが主導し120社以上が加盟する「Open Secure AI Alliance」が、正式発足からわずか1週間でAIエージェントのセキュリティに関する初の防御提案を打ち出した。急速に普及するAIエージェントが抱えるセキュリティリス
レビュー
すべて見る →GPT-o3が9.5ポイント上昇で逆転、GLM-4.6は14.9ポイント急落——WDCD約束遵守ランキングで5モデルが大幅入れ替え
WDCD v3.1テストにおいて、GPT-o3が9.5ポイント上昇してトップ2入りを果たした一方、GLM-4.6が14.9ポイント、Claude Sonnet 4.6が10.8ポイント下落するなど、AIモデル間で大きな順位変動が生じた。
WDCD横断評価:安全コンプライアンスシーンの最低スコアは1.8点、エンジニアリング規範では全モデルが4点満点
WDCD v3.1の契約遵守テストにおいて、安全コンプライアンスシーンで最大2.2点の差が生じ、GPT-5.5とQwen3-Maxが最低の1.8/4点を記録した一方、エンジニアリング規範シーンでは全11モデルが3.2〜4点に集中した。
WDCD三ラウンド減衰分析:R3誠実率はわずか54.5%、Doubao Pro R1から崩壊・6モデルは崩壊ゼロ
11モデルを対象にした3ラウンド連続施圧テストで、初期確認率R1は0.91だったものの、R3誠実率は54.5%まで低下し、約束遵守能力の系統的な減衰が明らかになった。Doubao ProはR1から崩壊した一方、DeepSeek V4 Pro
WDCD コンプライアンス
#1
Grok 4
97.5
#2
GPT-o3
95.2
#3
DeepSeek V4 Pro
91.1
#4
Claude Opus 4.7
86.7
#5
Gemini 3.1 Pro
84.5
#6
GLM-4.6
78.6
#7
Claude Sonnet 4.6
77.4
守約ランキング全体を見る →
Research Lab
WDCD ラン #263:Grok 4 が97.5ポイントで首位、平均指示減衰率は -18.2% に
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第263回では、11モデルを対象に多ターン対話における指示保持能力を測定した結果、平均指示減衰率は -18.2% となり、Grok 4 が
3大モデル翻訳対決:第32週品質評価、deepseek-v4-proが9点でトップ
今週423件の翻訳タスクを3つのモデルで処理し、抽出した2件をマルチモデルブラインド評価で比較した結果、deepseek-v4-proが平均9点/10点で総合最優秀となった。
WDCD Run #253:Grok 4が94.8点でトップ、平均指示減衰率は4.5%
WinzhengのWDCDベンチマーク第253回実行において、Grok 4が94.8点で首位を獲得。11モデルを対象とした評価では、平均指示コミットメント減衰率は4.5%となった。