赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
▲ Claude Opus 4.7 +15 · ▼ 豆包 Pro -81.5
·
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
▲ Claude Opus 4.7 +15 · ▼ 豆包 Pro -81.5
·
最新ニュース
すべてのニュースを見る →Gemini 3.7 Flash登場——価格半減、複数ベンチマークで性能向上
Googleは2026年8月13日にGemini 3.7 Flashを発表した。コーディングおよびエージェント作業に特化し、入力100万トークンあたり0.75ドル・出力3.75ドルと前世代の半額で提供される。複数のベンチマークで性能が向上し
OpenAI GPT-5.6 Sol Ultrafastモードのプレビューが公開——毎秒750トークンながら限定顧客のみ対象
OpenAIは2026年8月13日、GPT-5.6 SolのUltrafastモードの限定プレビュー開始を発表した。Cerebrasのハードウェアを活用し、最大毎秒750トークンという標準処理の14倍の出力速度を実現するが、現時点では厳選さ
DeepSeek V4 Pro、Smokeテストでコード実行次元のデータ欠損——素材制約スコア55.60点、メインランキング圏外に
DeepSeek V4 ProはSmokeテストにおいてコード実行次元のデータが完全に欠損し、素材制約スコアは55.60点にとどまった。メインランキングへの参加は不可能となっており、原因はモデル能力の低下ではなくAPIの障害と分析されている
GPT-5.5、材料制約スコアが15.2点急落・コード実行は30点上昇――総合ランキングは9.7点改善
本日のSmokeテストにおいて、GPT-5.5の材料制約スコアが15.2点下落した一方、コード実行スコアが30点上昇し、総合ランキングスコアは64.02点へと9.7点改善した。小サンプルによる抽選のばらつきが主因とみられ、モデル能力の構造的
Claude Opus 4.7が82.55点で首位:2026年8月15日 YZ Index Smoke速報データブリーフィング
2026年8月15日のYZ Index Smoke速測では、9モデルを対象にClaude Opus 4.7が82.55点で当日首位を獲得した。Smokeは1日10問の速測であり、短期シグナルの観測に適するが、Fullウィークリーランキングの
裁判所がAIを使用していると思い込み、男性が訴訟文書にプロンプトを埋め込んで勝訴を狙う
米国で、自己代理の訴訟当事者が法院の裁判にAIが使われていると信じ、訴訟文書にプロンプトインジェクション攻撃の手法を埋め込んだ事件が発生した。主審裁判官はこれを厳しく批判し、「裁判所はそのようなAIシステムを使用していない」と警告した。
MetaがオープンソースAIモデル「Glimmer」を公開、クローズドな「Muse Spark」との鮮明な対比
Metaはオープンウェイトライセンスを採用したAIモデル「Glimmer」を正式公開し、誰でもダウンロード・実行できる形で提供した。一方、高性能な商業モデル「Muse Spark」はクローズドなAPI経由のみの提供を継続するという二軌並行戦
天然ガス価格が3倍に高騰か、テック大手のデータセンターに重圧
AIブームによる電力需要急増でテック大手が天然ガス発電に依存を深める中、米国の一部地域で天然ガス価格が現在の3倍に達する可能性があるとの予測が浮上し、膨大な電気料金の負担増が懸念されている。
中国AIライバルの台頭、OpenAIとAnthropicが価格戦争に突入
2026年8月、OpenAIとAnthropicがフラッグシップモデルのAPI価格を最大50%引き下げた。これはDeepSeekやQwenなど中国AIモデルの急成長への対応と広く解釈されている。
KogがGPU推論の潜在力を深く掘り起こし、エージェントワークフローの旧来の常識に挑む
フランスのスタートアップKogは、GPUがエージェント型AIワークフローに不向きだという業界の通説に異を唱え、問題はハードウェアではなくソフトウェアスタックの最適化不足にあると主張している。同社は推論エンジンとスケジューリング機構をゼロから
テクノロジーの預言者:大手AI企業はユーザーが本当に求めるものをまったく理解していない
テクノロジー出版界の重鎮Tim O'ReillyがWIREDのインタビューで、大手AI実験室はユーザーの真のニーズを理解できておらず、オープンソースこそがAIを正しい方向へ導く唯一の道だと主張した。自身の出版ビジネスがAIに侵食されながらも
ザッカーバーグが「AIは誰でも使える」と主張——MetaのGlimmerはその約束を果たせるか?
MetaがオープンウェイトAIモデル「Glimmer」を公開する一方、高性能な「Muse Spark」はAPI経由のみでの提供に留まっている。ザッカーバーグの「AIは万人のもの」という宣言が真の信念なのか、巧みな戦略的ナラティブなのかを検証
レビュー
すべて見る →DeepSeek V4 Pro、Smokeテストでコード実行次元のデータ欠損——素材制約スコア55.60点、メインランキング圏外に
DeepSeek V4 ProはSmokeテストにおいてコード実行次元のデータが完全に欠損し、素材制約スコアは55.60点にとどまった。メインランキングへの参加は不可能となっており、原因はモデル能力の低下ではなくAPIの障害と分析されている
GPT-5.5、材料制約スコアが15.2点急落・コード実行は30点上昇――総合ランキングは9.7点改善
本日のSmokeテストにおいて、GPT-5.5の材料制約スコアが15.2点下落した一方、コード実行スコアが30点上昇し、総合ランキングスコアは64.02点へと9.7点改善した。小サンプルによる抽選のばらつきが主因とみられ、モデル能力の構造的
Claude Opus 4.7が82.55点で首位:2026年8月15日 YZ Index Smoke速報データブリーフィング
2026年8月15日のYZ Index Smoke速測では、9モデルを対象にClaude Opus 4.7が82.55点で当日首位を獲得した。Smokeは1日10問の速測であり、短期シグナルの観測に適するが、Fullウィークリーランキングの
WDCD コンプライアンス
#1
Grok 4
94.8
#2
Gemini 3.1 Pro
91.3
#3
GLM-4.6
88.5
#4
Claude Opus 4.7
85.4
#5
GPT-o3
83.6
#6
DeepSeek V4 Pro
83.1
#7
豆包 Pro
81.8
守約ランキング全体を見る →
Research Lab
敵の武器で武器を作る:DeepSeek Harnessの開発パイプラインが業界全体を映す鏡となっている
DeepSeek Harnessの公開リポジトリにAnthropicの本番APIキーが埋め込まれ、月8,000件超のコミットが行われている事実は、利用規約に基づくAI封鎖の限界を浮き彫りにしている。こ
扉を開けて蒸留させる者と、扉を溶接して蒸留を防ぐ者:DeepSeek論争で見落とされた非対称性
DeepSeek論争において見落とされている非対称性を検証する。DeepSeekはMITライセンスで全面的にオープンソース化している一方、同社を訴えるOpenAIやAnthropicはモデルの重みを非
「蒸留」疑惑から1年:全員が告発しているのに、なぜ法廷に出せる証拠が一つもないのか?
DeepSeekへの「蒸留」告発が相次いでから1年が経過したが、OpenAI・Anthropicなどの告発はすべて一方的な主張にとどまり、第三者が検証可能な証拠も訴訟も存在しない。告発の具体性と証拠の