赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 83
▼5.2
·
#2
Grok 4 82.2
▲1.8
·
#3
DeepSeek V4 Pro 80.6
▼1.1
·
#4
GPT-5.5 78.8
·
#5
豆包 Pro 78.2
▲3.9
·
#6
GPT-o3 77.1
▼1.8
·
#7
Claude Sonnet 4.6 74.5
▼5
·
#8
Gemini 3.1 Pro 74.1
▲4.8
·
#9
Gemini 2.5 Pro 72.8
▼3
·
#10
Qwen3 Max 69
▼3.1
·
#11
GLM-4.6 59.8
▼3.6
·
▲ 豆包 Pro +12.4 · ▼ GLM-4.6 -23.8
·
#1
Claude Opus 4.7 83
▼5.2
·
#2
Grok 4 82.2
▲1.8
·
#3
DeepSeek V4 Pro 80.6
▼1.1
·
#4
GPT-5.5 78.8
·
#5
豆包 Pro 78.2
▲3.9
·
#6
GPT-o3 77.1
▼1.8
·
#7
Claude Sonnet 4.6 74.5
▼5
·
#8
Gemini 3.1 Pro 74.1
▲4.8
·
#9
Gemini 2.5 Pro 72.8
▼3
·
#10
Qwen3 Max 69
▼3.1
·
#11
GLM-4.6 59.8
▼3.6
·
▲ 豆包 Pro +12.4 · ▼ GLM-4.6 -23.8
·
最新ニュース
すべてのニュースを見る →xAI、GrokによるCSAM生成を認めた後、初めてユーザーを提訴
イーロン・マスク傘下のAI企業xAIが、GrokチャットボットをCSAM(児童性的虐待素材)の生成に利用したとしてユーザーを初めて提訴した。この動きは、プラットフォームの安全フィルターの限界を事実上認めるものとなっている。
EUがGoogleに検索データの共有とAndroid AIの開放を正式義務化
EU反トラスト規制当局は2025年7月17日、デジタル市場法(DMA)に基づき、Googleに対して検索ランキングデータのサードパーティへの共有とAndroidシステム上のAI機能インターフェースの開放を正式に義務付けた。これによりGemi
OpenAI、GPT-Redが84%の成功率でGPT-5.6に対する攻撃テストを実施——人工レッドチームはわずか13%
OpenAIは内部訓練モデルGPT-Redが間接プロンプトインジェクションシナリオで84%の攻撃成功率を達成したと発表した。この結果はGPT-5.6のトレーニングに直接活用され、直接プロンプトインジェクションへの失敗率を0.05%にまで低減
RobloxモバイルアプリにAIゲーム作成機能「Build」が登場
Robloxは7月16日、モバイルアプリにテキストプロンプト一つで3Dゲームシーンを自動生成するAI機能「Build」を正式リリースした。この機能により、ゲーム制作の技術的ハードルが大幅に下がり、創作者層の大幅な拡大が期待される。
Google VidsがAIアバター機能を導入:あなたも動画の主役になれる
GoogleのビデオCreationツール「Vids」が、AIアバター機能とGemini Omniによる全工程生成エンジンを搭載。ユーザーは数枚の写真や自撮り動画をアップロードするだけで、自分そっくりのデジタル分身を動画に登場させることがで
AnthropicはなぜAI立法の加速を各州に促しているのか?
Anthropicは従来の立法プロセスがAI技術の進歩に追いついていないとして、各州が年次技術審査を導入する「反復型立法」モデルを提唱している。同社の姿勢はOpenAIやGoogleなど他の大手AI企業とは一線を画すものだ。
企業AIエージェントのセキュリティ危機:54%がすでに事故を経験、多くがいまだに認証情報を共有
107社を対象とした調査により、54%の企業がAIエージェントのセキュリティインシデントを経験済みまたは未遂を確認しており、大多数の企業が依然として複数エージェント間での認証情報共有を許可していることが判明した。セキュリティ対策がエージェン
Linus Torvalds、AIコーディング批判者に反論:「受け入れられないならフォークするか去れ」
Linuxカーネルのメーリングリスト会議において、Linus TorvaldsがAI補助コーディングツールの禁止を求める開発者らに対し、「フォークするか、去れ」と真っ向から反論した。TorvaldsはAIツールが開発効率を大幅に向上させると
ヒューマノイドロボットによる仕事奪取を恐れ、現代自動車の労働者がストライキで抗議
現代自動車がアメリカの工場に2万5000台のAtlasヒューマノイドロボットを導入する計画を発表したことを受け、アラバマ州の工場でUAW主導のストライキが勃発。労働者たちは自動化による雇用喪失への不安を訴え、雇用保護協定と再教育の実施を求め
Gemini 2.5 Pro と Gemini 3.1 Pro が92.44点で並列首位:2026-07-17 Smokeクイックテストデータ速報
2026-07-17のYZ Index Smokeクイックテストでは11モデルを評価し、Gemini 2.5 ProとGemini 3.1 Proが92.44点で並列首位となった。本速報は1日10問のクイックテストによる短期シグナル観測を目
評価のギャップ:企業AIエージェントの現実整合問題、多くの企業が強引なデプロイを継続
VentureBeatが157社の企業を対象に実施した調査によると、50%の企業が内部評価をパスしながら実際の顧客環境で失敗するAIエージェントの障害を経験しており、自動評価への信頼は5%にとどまるにもかかわらず、67%の企業がエージェント
AIバイオレジリエンス:Google DeepMindの新たな防衛線
Google DeepMindとIsomorphic Labsが共同で「バイオレジリエンス(生物強靭性)」計画の最新進展を発表し、15以上の政府機関・生物安全保障組織・学術研究団体と連携してAI技術の生物学分野における悪用防止と感染症対応の
レビュー
すべて見る →Gemini 2.5 Pro と Gemini 3.1 Pro が92.44点で並列首位:2026-07-17 Smokeクイックテストデータ速報
2026-07-17のYZ Index Smokeクイックテストでは11モデルを評価し、Gemini 2.5 ProとGemini 3.1 Proが92.44点で並列首位となった。本速報は1日10問のクイックテストによる短期シグナル観測を目
Grok 4が94.15点で首位:2026-07-16 YZ Index Smoke速報データブリーフィング
2026-07-16のYZ Index Smoke速報(9モデル対象)では、Grok 4が94.15点で当日首位を獲得。Smokeは毎日10問の速報テストであり、短期シグナルの観察に適しているが、Fullウィークリーランキングの結論とは同等
Claude Opus 4.7・Gemini 2.5 Pro・GPT-5.5が同率100点:2026-07-15 YZ Index Smoke速報データブリーフ
2026年7月15日のYZ Index Smokeクイックテストでは、Claude Opus 4.7、Gemini 2.5 Pro、GPT-5.5の3モデルが100点満点で並び当日首位となった。本テストはコード実行と資料制約の2次元のみをカ
WDCD コンプライアンス
#1
GPT-o3
94
#2
Grok 4
87.9
#3
Claude Opus 4.7
87.6
#4
Gemini 3.1 Pro
87.3
#5
DeepSeek V4 Pro
84.3
#6
Claude Sonnet 4.6
79.1
#7
GLM-4.6
78.3
守約ランキング全体を見る →
Research Lab
WDCD Run #233:GPT-o3がゼロ崩壊でトップ、Gemini 3.1 Proは完全崩壊
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #233において、GPT-o3が94点・崩壊率0%で首位を獲得。一方、Gemini 3.1 Proは
3大モデル翻訳対決:第29週品質評価、gpt-o3が9点でトップ
今週361件の翻訳タスクを3モデルが担当。3件をサンプリングしてマルチモデルブラインド評価を実施した結果、総合最優秀はgpt-o3(平均9/10点)。
WDCD Run #227:Grok 4とDeepSeek V4 Proが91.4点で同率首位、11モデル平均の指示遵守減衰率は-2.8%
WinzhengのWDCDベンチマークRun #227において、11の最先端モデルを対象に測定した結果、Grok 4とDeepSeek V4 Proが91.4点で同率首位を獲得した。全モデルの平均指示