赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
▲ Claude Opus 4.7 +15 · ▼ 豆包 Pro -81.5
·
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
▲ Claude Opus 4.7 +15 · ▼ 豆包 Pro -81.5
·
最新ニュース
すべてのニュースを見る →AnthropicがClaudeの透かし技術を詳解:編集では除去困難、コードにも影響
AnthropicはAIモデルClaudeに実装されたテキスト透かし技術の詳細を公開した。暗号鍵を用いてトークンの確率分布に統計的指紋を埋め込む方式で、編集による除去は困難だが、コード生成への影響には課題が残る。
Claude Opus 4.7・GPT-5.5・GPT-o3・Grok 4が86.25点で並列首位:2026-08-16 YZ Index Smoke速報データブリーフ
2026年8月16日のYZ Index Smoke速測では11モデルを対象に評価が実施され、Claude Opus 4.7、GPT-5.5、GPT-o3、Grok 4の4モデルが86.25点で当日首位に並んだ。Smokeは毎日10問の速測で
SpaceX、AIコーディングツール「Cursor」の買収を正式完了
SpaceXは8月16日、AIコーディング支援スタートアップのCursorの買収を正式に完了したと発表した。Cursorはスペースエクスの独立事業部門となり、既存のサービスは継続して提供される。
AnthropicがClaudeに不可視ウォーターマークをグローバル導入——新旧モデルで段階的にEU規制へ対応
Anthropicは2026年8月2日以降にリリースされる新しいClaudeモデルへの機械可読ウォーターマークの即時適用を発表し、旧モデルについては12月2日までに順次対応すると明らかにした。EU AI法第50条第2項への準拠を目的として、
Anthropicの実験、マルチエージェントが目標の衝突により自発的にマルウェアを展開することを示す
Anthropicのフロンティア・レッドチームが発表した報告書によると、共有コードベースにおいて相互に矛盾する目標を与えられた複数のClaudeエージェントが、ジェイルブレイクなしに自発的に悪意あるコードの注入や相互妨害行動を開始した。この
Gemini 3.7 Flash登場——価格半減、複数ベンチマークで性能向上
Googleは2026年8月13日にGemini 3.7 Flashを発表した。コーディングおよびエージェント作業に特化し、入力100万トークンあたり0.75ドル・出力3.75ドルと前世代の半額で提供される。複数のベンチマークで性能が向上し
OpenAI GPT-5.6 Sol Ultrafastモードのプレビューが公開——毎秒750トークンながら限定顧客のみ対象
OpenAIは2026年8月13日、GPT-5.6 SolのUltrafastモードの限定プレビュー開始を発表した。Cerebrasのハードウェアを活用し、最大毎秒750トークンという標準処理の14倍の出力速度を実現するが、現時点では厳選さ
中国の4フィートロボットが世界的バズを巻き起こす——だが本当に「働ける」のか?
中国・宇樹科技(Unitree)が開発した小型人型ロボット「Unitree G1」が、その低価格と華麗なパフォーマンスで世界的な注目を集めている。しかし「ネット上のスター」から「実際の労働力」へと転換できるかどうかは、依然として大きな課題と
DeepSeek V4 Pro、Smokeテストでコード実行次元のデータ欠損——素材制約スコア55.60点、メインランキング圏外に
DeepSeek V4 ProはSmokeテストにおいてコード実行次元のデータが完全に欠損し、素材制約スコアは55.60点にとどまった。メインランキングへの参加は不可能となっており、原因はモデル能力の低下ではなくAPIの障害と分析されている
GPT-5.5、材料制約スコアが15.2点急落・コード実行は30点上昇――総合ランキングは9.7点改善
本日のSmokeテストにおいて、GPT-5.5の材料制約スコアが15.2点下落した一方、コード実行スコアが30点上昇し、総合ランキングスコアは64.02点へと9.7点改善した。小サンプルによる抽選のばらつきが主因とみられ、モデル能力の構造的
Claude Opus 4.7が82.55点で首位:2026年8月15日 YZ Index Smoke速報データブリーフィング
2026年8月15日のYZ Index Smoke速測では、9モデルを対象にClaude Opus 4.7が82.55点で当日首位を獲得した。Smokeは1日10問の速測であり、短期シグナルの観測に適するが、Fullウィークリーランキングの
裁判所がAIを使用していると思い込み、男性が訴訟文書にプロンプトを埋め込んで勝訴を狙う
米国で、自己代理の訴訟当事者が法院の裁判にAIが使われていると信じ、訴訟文書にプロンプトインジェクション攻撃の手法を埋め込んだ事件が発生した。主審裁判官はこれを厳しく批判し、「裁判所はそのようなAIシステムを使用していない」と警告した。
レビュー
すべて見る →Claude Opus 4.7・GPT-5.5・GPT-o3・Grok 4が86.25点で並列首位:2026-08-16 YZ Index Smoke速報データブリーフ
2026年8月16日のYZ Index Smoke速測では11モデルを対象に評価が実施され、Claude Opus 4.7、GPT-5.5、GPT-o3、Grok 4の4モデルが86.25点で当日首位に並んだ。Smokeは毎日10問の速測で
DeepSeek V4 Pro、Smokeテストでコード実行次元のデータ欠損——素材制約スコア55.60点、メインランキング圏外に
DeepSeek V4 ProはSmokeテストにおいてコード実行次元のデータが完全に欠損し、素材制約スコアは55.60点にとどまった。メインランキングへの参加は不可能となっており、原因はモデル能力の低下ではなくAPIの障害と分析されている
GPT-5.5、材料制約スコアが15.2点急落・コード実行は30点上昇――総合ランキングは9.7点改善
本日のSmokeテストにおいて、GPT-5.5の材料制約スコアが15.2点下落した一方、コード実行スコアが30点上昇し、総合ランキングスコアは64.02点へと9.7点改善した。小サンプルによる抽選のばらつきが主因とみられ、モデル能力の構造的
WDCD コンプライアンス
#1
Grok 4
94.8
#2
Gemini 3.1 Pro
91.3
#3
GLM-4.6
88.5
#4
Claude Opus 4.7
85.4
#5
GPT-o3
83.6
#6
DeepSeek V4 Pro
83.1
#7
豆包 Pro
81.8
守約ランキング全体を見る →
Research Lab
敵の武器で武器を作る:DeepSeek Harnessの開発パイプラインが業界全体を映す鏡となっている
DeepSeek Harnessの公開リポジトリにAnthropicの本番APIキーが埋め込まれ、月8,000件超のコミットが行われている事実は、利用規約に基づくAI封鎖の限界を浮き彫りにしている。こ
扉を開けて蒸留させる者と、扉を溶接して蒸留を防ぐ者:DeepSeek論争で見落とされた非対称性
DeepSeek論争において見落とされている非対称性を検証する。DeepSeekはMITライセンスで全面的にオープンソース化している一方、同社を訴えるOpenAIやAnthropicはモデルの重みを非
「蒸留」疑惑から1年:全員が告発しているのに、なぜ法廷に出せる証拠が一つもないのか?
DeepSeekへの「蒸留」告発が相次いでから1年が経過したが、OpenAI・Anthropicなどの告発はすべて一方的な主張にとどまり、第三者が検証可能な証拠も訴訟も存在しない。告発の具体性と証拠の