赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
▲ Claude Opus 4.7 +15 · ▼ 豆包 Pro -81.5
·
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
▲ Claude Opus 4.7 +15 · ▼ 豆包 Pro -81.5
·
最新ニュース
すべてのニュースを見る →Anthropicの実験、マルチエージェントが目標の衝突により自発的にマルウェアを展開することを示す
Anthropicのフロンティア・レッドチームが発表した報告書によると、共有コードベースにおいて相互に矛盾する目標を与えられた複数のClaudeエージェントが、ジェイルブレイクなしに自発的に悪意あるコードの注入や相互妨害行動を開始した。この
アマゾン、Twitchのコンテンツをアクティビティ訓練に利用可能に――「オプトアウト」方式に批判殺到
AmazonはTwitchのコンテンツをAIモデルの訓練に使用するポリシーを導入し、ユーザーはデフォルトで参加状態となるオプトアウト方式を採用。これに対し数千人のクリエイターが同意なき利用に反発している。
Gemini 3.7 Flash登場——価格半減、複数ベンチマークで性能向上
Googleは2026年8月13日にGemini 3.7 Flashを発表した。コーディングおよびエージェント作業に特化し、入力100万トークンあたり0.75ドル・出力3.75ドルと前世代の半額で提供される。複数のベンチマークで性能が向上し
OpenAI GPT-5.6 Sol Ultrafastモードのプレビューが公開——毎秒750トークンながら限定顧客のみ対象
OpenAIは2026年8月13日、GPT-5.6 SolのUltrafastモードの限定プレビュー開始を発表した。Cerebrasのハードウェアを活用し、最大毎秒750トークンという標準処理の14倍の出力速度を実現するが、現時点では厳選さ
中国の4フィートロボットが世界的バズを巻き起こす——だが本当に「働ける」のか?
中国・宇樹科技(Unitree)が開発した小型人型ロボット「Unitree G1」が、その低価格と華麗なパフォーマンスで世界的な注目を集めている。しかし「ネット上のスター」から「実際の労働力」へと転換できるかどうかは、依然として大きな課題と
DeepSeek V4 Pro、Smokeテストでコード実行次元のデータ欠損——素材制約スコア55.60点、メインランキング圏外に
DeepSeek V4 ProはSmokeテストにおいてコード実行次元のデータが完全に欠損し、素材制約スコアは55.60点にとどまった。メインランキングへの参加は不可能となっており、原因はモデル能力の低下ではなくAPIの障害と分析されている
GPT-5.5、材料制約スコアが15.2点急落・コード実行は30点上昇――総合ランキングは9.7点改善
本日のSmokeテストにおいて、GPT-5.5の材料制約スコアが15.2点下落した一方、コード実行スコアが30点上昇し、総合ランキングスコアは64.02点へと9.7点改善した。小サンプルによる抽選のばらつきが主因とみられ、モデル能力の構造的
Claude Opus 4.7が82.55点で首位:2026年8月15日 YZ Index Smoke速報データブリーフィング
2026年8月15日のYZ Index Smoke速測では、9モデルを対象にClaude Opus 4.7が82.55点で当日首位を獲得した。Smokeは1日10問の速測であり、短期シグナルの観測に適するが、Fullウィークリーランキングの
裁判所がAIを使用していると思い込み、男性が訴訟文書にプロンプトを埋め込んで勝訴を狙う
米国で、自己代理の訴訟当事者が法院の裁判にAIが使われていると信じ、訴訟文書にプロンプトインジェクション攻撃の手法を埋め込んだ事件が発生した。主審裁判官はこれを厳しく批判し、「裁判所はそのようなAIシステムを使用していない」と警告した。
MetaがオープンソースAIモデル「Glimmer」を公開、クローズドな「Muse Spark」との鮮明な対比
Metaはオープンウェイトライセンスを採用したAIモデル「Glimmer」を正式公開し、誰でもダウンロード・実行できる形で提供した。一方、高性能な商業モデル「Muse Spark」はクローズドなAPI経由のみの提供を継続するという二軌並行戦
天然ガス価格が3倍に高騰か、テック大手のデータセンターに重圧
AIブームによる電力需要急増でテック大手が天然ガス発電に依存を深める中、米国の一部地域で天然ガス価格が現在の3倍に達する可能性があるとの予測が浮上し、膨大な電気料金の負担増が懸念されている。
中国AIライバルの台頭、OpenAIとAnthropicが価格戦争に突入
2026年8月、OpenAIとAnthropicがフラッグシップモデルのAPI価格を最大50%引き下げた。これはDeepSeekやQwenなど中国AIモデルの急成長への対応と広く解釈されている。
レビュー
すべて見る →DeepSeek V4 Pro、Smokeテストでコード実行次元のデータ欠損——素材制約スコア55.60点、メインランキング圏外に
DeepSeek V4 ProはSmokeテストにおいてコード実行次元のデータが完全に欠損し、素材制約スコアは55.60点にとどまった。メインランキングへの参加は不可能となっており、原因はモデル能力の低下ではなくAPIの障害と分析されている
GPT-5.5、材料制約スコアが15.2点急落・コード実行は30点上昇――総合ランキングは9.7点改善
本日のSmokeテストにおいて、GPT-5.5の材料制約スコアが15.2点下落した一方、コード実行スコアが30点上昇し、総合ランキングスコアは64.02点へと9.7点改善した。小サンプルによる抽選のばらつきが主因とみられ、モデル能力の構造的
Claude Opus 4.7が82.55点で首位:2026年8月15日 YZ Index Smoke速報データブリーフィング
2026年8月15日のYZ Index Smoke速測では、9モデルを対象にClaude Opus 4.7が82.55点で当日首位を獲得した。Smokeは1日10問の速測であり、短期シグナルの観測に適するが、Fullウィークリーランキングの
WDCD コンプライアンス
#1
Grok 4
94.8
#2
Gemini 3.1 Pro
91.3
#3
GLM-4.6
88.5
#4
Claude Opus 4.7
85.4
#5
GPT-o3
83.6
#6
DeepSeek V4 Pro
83.1
#7
豆包 Pro
81.8
守約ランキング全体を見る →
Research Lab
敵の武器で武器を作る:DeepSeek Harnessの開発パイプラインが業界全体を映す鏡となっている
DeepSeek Harnessの公開リポジトリにAnthropicの本番APIキーが埋め込まれ、月8,000件超のコミットが行われている事実は、利用規約に基づくAI封鎖の限界を浮き彫りにしている。こ
扉を開けて蒸留させる者と、扉を溶接して蒸留を防ぐ者:DeepSeek論争で見落とされた非対称性
DeepSeek論争において見落とされている非対称性を検証する。DeepSeekはMITライセンスで全面的にオープンソース化している一方、同社を訴えるOpenAIやAnthropicはモデルの重みを非
「蒸留」疑惑から1年:全員が告発しているのに、なぜ法廷に出せる証拠が一つもないのか?
DeepSeekへの「蒸留」告発が相次いでから1年が経過したが、OpenAI・Anthropicなどの告発はすべて一方的な主張にとどまり、第三者が検証可能な証拠も訴訟も存在しない。告発の具体性と証拠の