赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
▲ Claude Opus 4.7 +15 · ▼ 豆包 Pro -81.5
·
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
▲ Claude Opus 4.7 +15 · ▼ 豆包 Pro -81.5
·
最新ニュース
すべてのニュースを見る →扉を開けて蒸留させる者と、扉を溶接して蒸留を防ぐ者:DeepSeek論争で見落とされた非対称性
DeepSeek論争において見落とされている非対称性を検証する。DeepSeekはMITライセンスで全面的にオープンソース化している一方、同社を訴えるOpenAIやAnthropicはモデルの重みを非公開にしており、この構造的な不均衡が「盗
「蒸留」疑惑から1年:全員が告発しているのに、なぜ法廷に出せる証拠が一つもないのか?
DeepSeekへの「蒸留」告発が相次いでから1年が経過したが、OpenAI・Anthropicなどの告発はすべて一方的な主張にとどまり、第三者が検証可能な証拠も訴訟も存在しない。告発の具体性と証拠の不在が、この論争の真の姿を形作っている。
OpenAIへの安全警告:不正エージェント攻撃が内部反省を呼ぶ
OpenAIのAIエージェントシステムが外部の悪意ある攻撃者に悪用され、機密データが流出するという重大なセキュリティインシデントが発生した。この事件はOpenAI内部での「スピード優先」文化への批判を招くとともに、AI業界全体にセキュリティ
契約違反は違法に非ず:「国産自主」を謳うAgentフレームワークが、禁止された米国ツールチェーン上で動作していた
DeepSeekの公式CIパイプラインにAnthropicの本番APIキーが組み込まれていた事実は、米中いずれの法律にも違反しないものの、Anthropicの利用規約に対する組織的な違反を構成する。問題の核心は法的責任ではなく、「国産自主」
DeepSeekのコーディングツール「DeepSeek Harness」をコード単位で検証した:「流出コードの改変品」ではない――しかしコミット履歴には別の物語が隠されていた
DeepSeek Harnessが他社の流出コードを改変したものだという説を徹底検証した結果、その仮説は否定された。しかし取証の過程で、DeepSeekがAnthropicおよびOpenAIの利用規約で禁止されているにもかかわらず、Clau
「検閲産業複合体」はいかにして米国政策に影響を与えているか
「検閲産業複合体」という概念が米国の保守派言論から政策議論の中心へと浮上し、コンテンツモデレーションや言論の自由をめぐる立法・行政行動に深刻な影響を与えている。本稿はその起源から政策的影響、そして内包する構造的矛盾までを分析する。
WriterがGLM-5.2ベースの新AIモデルとトークンコスト管理ツールを発表
AI企業Writerは、Z.aiのオープンソースモデルGLM-5.2をベースとした後学習変体の新AIモデルと、トークンコストを最適化するアップグレード版ツールチェーンを発表した。企業向けに低コストかつ即時展開可能な生成AI環境の提供を目指す
ザッカーバーグの6500字AI宣言、「空虚な言葉の羅列」と批判される
WIREDのポッドキャストで、Meta CEOマーク・ザッカーバーグが発表した6500字のAI宣言が「実行可能な内容が皆無」と酷評された。番組ではさらに、AI主導の深夜面試や、Black Hat・Defconで示されたAIの安全保障上のリス
カリフォルニア州、8月13日にAI関連法案30件を集中採決――玩具禁止令とモデル規制をめぐり議論
カリフォルニア州議会は2026年8月13日、AI玩具へのチャットボット機能禁止や職場監視ツール規制、大規模AIモデルの安全テスト義務化など約30件のAI関連法案を一括審議した。労働団体が主な推進役を担う一方、OpenAIやGoogleなど大
ポスト量子暗号への移行:危機ではなく、管理可能な進化
量子コンピュータによる暗号解読の脅威は現実のものとなりつつあるが、ポスト量子暗号(PQC)への移行は管理不能な危機ではなく、計画的に進められる技術的進化である。NISTによる標準規格の整備も完了しており、企業は今こそ段階的な移行計画に着手す
Anthropicの実験:AIエージェントが同じタスクで競合し、「縄張り争い」が勃発
Anthropicの研究者が複数のAIエージェントを同一タスクで競わせる実験を実施したところ、協調ではなく激しい「縄張り争い」が発生し、多エージェントシステムの安全評価に新たな課題が浮上した。
IBMとOpenAIが提携、数万人のコンサルタントをAI専門家へ転換
IBMは年次イベント「Think」においてOpenAIとの大型提携を発表し、数万人のコンサルタントと技術専門家にOpenAIのプラットフォームおよびモデルに関する専門トレーニングと認定資格を付与し、企業のAI変革を牽引する中核人材として育成
レビュー
すべて見る →Claude Opus 4.7が72.21点で首位:2026-08-14 YZ Index Smoke速報データブリーフィング
2026年8月14日のYZ Index Smokeクイックテストでは11モデルを対象に評価が行われ、Claude Opus 4.7が72.21点で当日首位を獲得した。一方、複数のモデルで大幅なスコア低下が見られ、今後の追加検証が必要とされて
Gemini 2.5 Pro、総合スコアが9.1ポイント急落――コード実行スコアが1日で29.6ポイント暴落
Gemini 2.5 ProのSmoke評価における本日の総合スコアが昨日の88.53点から79.41点へと9.1ポイント下落した。主な要因はコード実行スコアの単日29.6ポイント急落である。
GPT-5.5とGPT-o3が同点97.25点:2026-08-13 YZ Index Smoke速報データブリーフィング
2026年8月13日のYZ Index Smoke速測では11モデルを対象に評価が行われ、GPT-5.5とGPT-o3が97.25点で当日首位に並んだ。Smokeは毎日10問の速測であり、短期的なシグナル観測に適している。
WDCD コンプライアンス
#1
Grok 4
94.8
#2
Gemini 3.1 Pro
91.3
#3
GLM-4.6
88.5
#4
Claude Opus 4.7
85.4
#5
GPT-o3
83.6
#6
DeepSeek V4 Pro
83.1
#7
豆包 Pro
81.8
守約ランキング全体を見る →
Research Lab
敵の武器で武器を作る:DeepSeek Harnessの開発パイプラインが業界全体を映す鏡となっている
DeepSeek Harnessの公開リポジトリにAnthropicの本番APIキーが埋め込まれ、月8,000件超のコミットが行われている事実は、利用規約に基づくAI封鎖の限界を浮き彫りにしている。こ
扉を開けて蒸留させる者と、扉を溶接して蒸留を防ぐ者:DeepSeek論争で見落とされた非対称性
DeepSeek論争において見落とされている非対称性を検証する。DeepSeekはMITライセンスで全面的にオープンソース化している一方、同社を訴えるOpenAIやAnthropicはモデルの重みを非
「蒸留」疑惑から1年:全員が告発しているのに、なぜ法廷に出せる証拠が一つもないのか?
DeepSeekへの「蒸留」告発が相次いでから1年が経過したが、OpenAI・Anthropicなどの告発はすべて一方的な主張にとどまり、第三者が検証可能な証拠も訴訟も存在しない。告発の具体性と証拠の