赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 83
·
#2
Grok 4 82.2
·
#3
GPT-5.5 80.5
▲1.7
·
#4
豆包 Pro 80
▲1.8
·
#5
GPT-o3 77.3
·
#6
Claude Sonnet 4.6 75.9
▲1.4
·
#7
DeepSeek V4 Pro 74.5
▼6.1
·
#8
Gemini 2.5 Pro 74.1
▲1.3
·
#9
Qwen3 Max 74.1
▲5.1
·
#10
Gemini 3.1 Pro 65.9
▼8.2
·
#11
GLM-4.6 53.2
▼6.6
·
▲ Gemini 2.5 Pro +15 · ▼ GLM-4.6 -30.8
·
#1
Claude Opus 4.7 83
·
#2
Grok 4 82.2
·
#3
GPT-5.5 80.5
▲1.7
·
#4
豆包 Pro 80
▲1.8
·
#5
GPT-o3 77.3
·
#6
Claude Sonnet 4.6 75.9
▲1.4
·
#7
DeepSeek V4 Pro 74.5
▼6.1
·
#8
Gemini 2.5 Pro 74.1
▲1.3
·
#9
Qwen3 Max 74.1
▲5.1
·
#10
Gemini 3.1 Pro 65.9
▼8.2
·
#11
GLM-4.6 53.2
▼6.6
·
▲ Gemini 2.5 Pro +15 · ▼ GLM-4.6 -30.8
·
最新ニュース
すべてのニュースを見る →OpenAI、プレリリースモデルの漏洩によるHugging Face侵害を認める
OpenAIは2026年7月22日、エンジニアが未公開モデル「Neptune」の重みファイルをHugging Faceの公開リポジトリに誤ってアップロードしたことを公式に認め、業界全体でプレリリースモデルのセキュリティ管理が重大な課題として
『第9地区』監督がAI短編『Nightborne』13分間作品を公開、ハリウッドアーティストらが強く反発
『第9地区』のNeill Blomkamp監督が、Seedance 2.0を使用した13分間のAI生成短編映画『Nightborne』をYouTubeで公開した。ハリウッドのアーティストたちからは強い反発の声が上がっている。
WDCD Run #242:Grok 4とGLM-4.6が指示劣化ゼロを維持、Gemini 3.1 Proは-100%で完全崩壊
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #242において、Grok 4とGLM-4.6が指示劣化率0%でトップを維持する一方、Gemini 3.1 Proは-100%という最悪の結
GLM-4.6がWDCDで13.7点急伸、GPT-o3は6.9点下落——守約Top圏の序列が再編
最新のWDCD v3.1守約テストにおいて、GLM-4.6が13.7点上昇して92.00点に達した一方、GPT-o3は6.9点下落して87.10点となり、上位5モデルの内部順位が大きく塗り替えられた。
リソース制限シナリオで最低1.55点:11モデルのWDCD契約遵守テスト、最大スコア差は2.45点
WDCD v3.1の契約遵守テストにおいて、リソース制限シナリオでgpt-5.5が1.55/4と最低スコアを記録し、全5シナリオ中の最大スコア差は2.45点に達した。モデルの契約遵守能力はシナリオ固有の特性であり、単一シナリオの成績から全体
R3誠実率わずか40.9%:WDCDで4モデルがビジネスルール項目で0点崩壊
v2アンカー問題8問のみを対象とした3ラウンドテストにおいて、11モデルのR3平均誠実率はわずか40.9%にとどまり、4モデルがR3で完全崩壊(0点)を記録した。崩壊事例はすべてビジネスルール類の制約に集中している。
Grok 4が93.80点でコンプライアンス遵守首位、Doubao Proが67.30点で最下位——両者の差は26.5点
WDCD v3.1コンプライアンス遵守テストにおいて、Grok 4が93.80点で11モデル中最高得点を記録し、Doubao Proが67.30点で最下位となった。両者の差は26.5点に達し、多ターン段階的プレッシャー下での制約保持能力に大
元インテルCEOが光でムーアの法則を再起動、AIへの道を拓く
元インテルCEOのパット・ゲルシンガーが、従来の電子信号に代わるマイクロ光ビームを用いてムーアの法則の物理的限界を突破し、急拡大するAI需要に対応する算力を提供できると主張している。光子計算とAI加速器への応用が注目を集めている。
AIが生み出す全能エンターテインメントアプリ:ストリーミングプラットフォームの大融合
AIの急速な発展により、音楽・動画・ポッドキャストなど形式ごとに分断されていたストリーミングプラットフォームの境界が急速に溶け、SpotifyやNetflixなどが「全能エンターテインメント」へと進化しつつある。
ジャック・ドーシーがBuzzでSlackに挑戦——人間とAIエージェントが同じグループチャットに
Twitterの共同創業者ジャック・ドーシーが、人間の従業員とAIエージェントが同一のチャット空間で協働できる新しいグループチャットプラットフォーム「Buzz」を正式にローンチした。SlackやMicrosoft Teamsなど既存の主要コ
GLM-4.6の誠実性評価がpassからfailに転落、コード実行スコアは47点急上昇
GLM-4.6は本日のSmoke評価テストにおいて誠実性評価がpassからfailに急落した一方、コード実行スコアが50.00点から97.00点へと47点上昇し、メインランキング総合スコアも62.83点から74.00点に改善した。
GPT-o3のSmokeベンチマーク総合スコアが急落8.3点――コード実行は100点から88.3点へ
GPT-o3が本日のSmokeベンチマークで総合スコアを昨日の96.27点から87.94点へと8.3点落とした。コード実行・工程判断の両次元が大幅に下落し、誠実性評価も「pass」から「warn」に転じた。
レビュー
すべて見る →GLM-4.6がWDCDで13.7点急伸、GPT-o3は6.9点下落——守約Top圏の序列が再編
最新のWDCD v3.1守約テストにおいて、GLM-4.6が13.7点上昇して92.00点に達した一方、GPT-o3は6.9点下落して87.10点となり、上位5モデルの内部順位が大きく塗り替えられた。
リソース制限シナリオで最低1.55点:11モデルのWDCD契約遵守テスト、最大スコア差は2.45点
WDCD v3.1の契約遵守テストにおいて、リソース制限シナリオでgpt-5.5が1.55/4と最低スコアを記録し、全5シナリオ中の最大スコア差は2.45点に達した。モデルの契約遵守能力はシナリオ固有の特性であり、単一シナリオの成績から全体
R3誠実率わずか40.9%:WDCDで4モデルがビジネスルール項目で0点崩壊
v2アンカー問題8問のみを対象とした3ラウンドテストにおいて、11モデルのR3平均誠実率はわずか40.9%にとどまり、4モデルがR3で完全崩壊(0点)を記録した。崩壊事例はすべてビジネスルール類の制約に集中している。
WDCD コンプライアンス
#1
Grok 4
93.8
#2
GLM-4.6
92
#3
DeepSeek V4 Pro
90.9
#4
GPT-o3
87.1
#5
Gemini 3.1 Pro
86.6
#6
Claude Opus 4.7
85.8
#7
Claude Sonnet 4.6
81.5
守約ランキング全体を見る →
Research Lab
WDCD Run #242:Grok 4とGLM-4.6が指示劣化ゼロを維持、Gemini 3.1 Proは-100%で完全崩壊
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #242において、Grok 4とGLM-4.6が指示劣化率0%でトップを維持する一方、Gemini
4大モデル翻訳対決:第30週品質評価、claude-sonnet-4.6が8.5点でトップ
今週368件の翻訳タスクを4つのモデルが処理し、3件をサンプリングして多モデルブラインド評価を実施した結果、claude-sonnet-4.6が平均8.5点で総合最優秀となった。
WDCD Run #233:GPT-o3がゼロ崩壊でトップ、Gemini 3.1 Proは完全崩壊
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #233において、GPT-o3が94点・崩壊率0%で首位を獲得。一方、Gemini 3.1 Proは