赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 83
·
#2
Grok 4 82.2
·
#3
GPT-5.5 80.5
▲1.7
·
#4
豆包 Pro 80
▲1.8
·
#5
GPT-o3 77.3
·
#6
Claude Sonnet 4.6 75.9
▲1.4
·
#7
DeepSeek V4 Pro 74.5
▼6.1
·
#8
Gemini 2.5 Pro 74.1
▲1.3
·
#9
Qwen3 Max 74.1
▲5.1
·
#10
Gemini 3.1 Pro 65.9
▼8.2
·
#11
GLM-4.6 53.2
▼6.6
·
▲ Gemini 2.5 Pro +15 · ▼ GLM-4.6 -30.8
·
#1
Claude Opus 4.7 83
·
#2
Grok 4 82.2
·
#3
GPT-5.5 80.5
▲1.7
·
#4
豆包 Pro 80
▲1.8
·
#5
GPT-o3 77.3
·
#6
Claude Sonnet 4.6 75.9
▲1.4
·
#7
DeepSeek V4 Pro 74.5
▼6.1
·
#8
Gemini 2.5 Pro 74.1
▲1.3
·
#9
Qwen3 Max 74.1
▲5.1
·
#10
Gemini 3.1 Pro 65.9
▼8.2
·
#11
GLM-4.6 53.2
▼6.6
·
▲ Gemini 2.5 Pro +15 · ▼ GLM-4.6 -30.8
·
最新ニュース
すべてのニュースを見る →中国オープンソースモデルは安くて高品質?ワシントンが戦略的コストを検討
月之暗面(Moonshot AI)が発表した大規模オープンウェイトモデル「Kimi K3」を契機に、ワシントンでは中国製AIモデルの安全保障上のリスクと経済的メリットをめぐる政策論争が激化している。
FlathubがAI生成アプリを禁止、コミュニティはオープンソース審査の不公平さを批判
Linuxアプリ配布プラットフォームのFlathubは2026年5月29日より、生成AIまたはAI支援によるコード・ドキュメント等を含むアプリの申請を全面禁止するポリシーを実施。これに対しコミュニティからはオープンソースと独自アプリ間の審査
Moonshot AIがKimi K3オープンウェイトモデルを発表、中米AI開源規制論争を巻き起こす
Moonshot AIが発表したKimi K3モデルは、米国最先端水準に迫る性能とオープンウェイト戦略を採用し、OpenAIの戦略担当者が規制リスクの可能性を示唆する発言を行うなど、中米AI競争における新たな論点となっている。
Anthropicの15億ドル著作権和解が承認、AIトレーニングデータをめぐる論争は継続
米連邦地裁がAnthropic社の15億ドル著作権和解を正式承認した。AI業界における和解金額の記録を更新したが、生成AIのトレーニングデータの合法性をめぐる業界論争はなお続いている。
AI最重要プロトコルが使いやすさの向上を実現
AIとデータの相互接続を標準化するモデルコンテキストプロトコル(MCP)が重要なアップデートを迎え、自動サーバー検出や統一認証モジュールなどの改善により開発者の参入障壁が大幅に引き下げられた。この進化はAIエージェント時代の企業システム統合
GoogleがGeminiの効率を大幅向上させる新型AIチップを開発中
Googleの親会社Alphabetが、GeminiモデルファミリーをTPUとは異なる専用設計の新型AIチップで効率化しようとしていることが、テクノロジーメディアTechCrunchの独占報道で明らかになった。
山火が猛威を振るうアメリカ、消防ドローンは早期阻止の切り札となるか?
米国西部の山火事が年間を通じた生態系の危機となる中、XPRIZEコンペとカリフォルニア州政府が共同で発起した「FireBreak」プロジェクトが注目を集めている。総額1500万ドルの賞金をかけ、完全自律型ドローンによる火災の初期鎮火を目指す
オーストラリア労働党政府がAI標準フレームワークを公表——安全設計と産業振興のバランスを強調
オーストラリア労働党政府は正式にAI標準フレームワークを発表し、安全設計原則を重視しつつ、過度な規制による国内企業の競争力低下を避ける方針を示した。このフレームワークは産業政策上の重要なシグナルとして、企業のAIツール調達における法令遵守の
アリババQwen3.8-Max-Previewが2.4兆パラメータモデルをプレビュー公開 — Kimi K3の発表から2日後
アリババのQwenチームが2026年7月19日、上海WAIC期間中に総パラメータ数2.4兆のQwen3.8-Max-Previewをプレビュー公開した。Moonshot AIのKimi K3(2.8兆パラメータ)の発表からわずか2日後のリリ
Adobeのカメラアプリに新機能:AIが写真を評価するように
AdobeはAI搭載の写真評価機能を実験的カメラアプリ「Project Indigo」に追加した。構図や露出、色彩など多角的な観点からリアルタイムでフィードバックと改善提案を提供する。
中国AIモデルがトランプ陣営内のAI政策論争に火をつける
トランプ大統領の顧問団内で、中国AIモデルの台頭を巡り、米国大手AI企業への批判や政策の方向性をめぐる公開論争が勃発した。「加速競争」か「高い壁の構築」かという戦略的対立が、陣営内部の亀裂を浮き彫りにしている。
OpenAIはオープンソースモデルを恐れている——米国も警戒すべきか?
OpenAIの幹部が非公式にオープンソース重みモデルへの「恐怖」を認める中、米国議会とシリコンバレーでは中国製オープンソースLLMの禁止をめぐる議論が過熱している。本記事は、この論争が示すAI商業化における技術開放と商業利益の根本的な矛盾を
レビュー
すべて見る →Claude Opus 4.7、Smoke評価でメインスコアが26.1ポイント急落——コード実行と資料制約の両次元で失守
本日のSmoke評価において、Claude Opus 4.7のメインスコアが100.00点から73.92点へと26.1ポイント下落した。コード実行・資料制約の両次元で25ポイント以上の降下が確認されたが、小サンプルによる変動の可能性が高いと
Gemini 3.1 Pro、材料制約スコアが17.8点急落――総合ランキングも6点下落
本日のSmoke評価において、Gemini 3.1 Proの材料制約スコアが90.40点から72.60点へと17.8点下落し、総合ランキングも81.93点から75.90点に低下した。ただし、コード実行・エンジニアリング判断の各スコアは改善し
Claude Sonnet 4.6とGPT-o3が96.27点で同率首位:2026-07-21 Smokeクイックテストデータ速報
2026年7月21日実施のYZ Index Smokeクイックテストで、Claude Sonnet 4.6とGPT-o3が96.27点で同率首位を獲得。11モデルを対象に代码执行とマテリアル制約の2次元で評価が行われた。
WDCD コンプライアンス
#1
GPT-o3
94
#2
Grok 4
87.9
#3
Claude Opus 4.7
87.6
#4
Gemini 3.1 Pro
87.3
#5
DeepSeek V4 Pro
84.3
#6
Claude Sonnet 4.6
79.1
#7
GLM-4.6
78.3
守約ランキング全体を見る →
Research Lab
4大モデル翻訳対決:第30週品質評価、claude-sonnet-4.6が8.5点でトップ
今週368件の翻訳タスクを4つのモデルが処理し、3件をサンプリングして多モデルブラインド評価を実施した結果、claude-sonnet-4.6が平均8.5点で総合最優秀となった。
WDCD Run #233:GPT-o3がゼロ崩壊でトップ、Gemini 3.1 Proは完全崩壊
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #233において、GPT-o3が94点・崩壊率0%で首位を獲得。一方、Gemini 3.1 Proは
3大モデル翻訳対決:第29週品質評価、gpt-o3が9点でトップ
今週361件の翻訳タスクを3モデルが担当。3件をサンプリングしてマルチモデルブラインド評価を実施した結果、総合最優秀はgpt-o3(平均9/10点)。