赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
▲ GLM-4.6 +26.4 · ▼ 豆包 Pro -41.7
·
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
▲ GLM-4.6 +26.4 · ▼ 豆包 Pro -41.7
·
最新ニュース
すべてのニュースを見る →アリババ、Qwen3.8-Maxを発表——エージェントタスクベンチマークでGPT-5.6を超えると主張
アリババは2026年8月7日、エージェントタスクおよびコンピューター操作能力を強化したフラッグシップモデル「Qwen3.8-Max」を発表し、エージェントタスクベンチマークでGPT-5.6を超えると主張している。複数の独立メディアが発表を確
Kimi K3:2.8兆パラメータモデルを無償公開——計算資源の壁と安全リスクが共存
Moonshot AIは2026年7月16日にKimi K3モデルを発表。総パラメータ数2.8兆、100万トークンコンテキスト対応、ネイティブビジョン処理をサポートし、7月27日に重みの公開を予定している。
DeepMindの気象モデル、予報に1日分の優位性をもたらす
DeepMindは気象予測モデル「WeatherNext」をオープンソース化した。このモデルは低解像度の気象データで高精度な予測を実現し、予報員に最大1日分の追加警戒時間をもたらすものだ。
GmailとGoogle DocsでGeminiをオフにする方法
GoogleはGmailやGoogle Docsにデフォルトで生成AI「Gemini」を統合しているが、設定から簡単にオフにできる。本記事では具体的な手順と、AI機能のデフォルト設定に関する考察を紹介する。
AMDによるTaalas買収:ハードコード推論チップはAIハードウェアの勢力図を塗り替えられるか
AMDは2026年8月6日、モデルの重みを直接チップの配線に刻み込む推論シリコン技術を開発したトロント発のスタートアップ、Taalasの買収合意を発表した。この買収がAMDの既存AIプラットフォームを補完し、専門化が進む推論市場での競争力強
RipplingがAI請求書の苦い経験を製品化、従業員のAI支出追跡ツールを発表
人事管理ソフトウェアで知られるRipplingが、自社のAI支出急増という苦い経験を教訓に、従業員・チーム別のAIサブスクリプションおよびAPI利用コストを可視化・追跡するツール「AI Spend Console」を発表した。
SpaceXとReflectionが63億ドルの算力協定を締結——StarlinkとStarshipがAIインフラに参入
SpaceXはAIスタートアップのReflectionと63億ドルの計算能力取引を締結し、StarlinkのエッジコンピューティングおよびStarshipの打ち上げ能力をAIインフラの支援に活用する。
Doubao Pro、Smokeテスト5次元すべて欠席――API障害によりゼロ記録
Doubao ProはAPI障害・タイムアウトにより本日のSmokeテストで全問未回答となり、execution・grounding・judgment・integrity・communicationの5次元すべてがスコア「-」を記録、今回の
Claude Sonnet 4.6、コード実行スコアが19.5点急落——メインランキングは逆に13.8点上昇
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが94.50点から75.00点へと19.5点下落した一方、資料制約スコアは43.30点から97.80点へと急上昇し、メインランキング総合スコアは71.4
Claude Opus 4.7とGPT-o3が97.66点で並列首位:2026-08-08 YZ Index Smoke速報データ
2026年8月8日実施のYZ Index Smokeテストで、Claude Opus 4.7とGPT-o3が97.66点で並列首位となった。9モデルを対象とした当日の速報データを報告する。
シリコンバレーの「人工国家」:なぜテクノロジーリーダーたちはSF小説の読み方が下手なのか
歴史家ジル・レポアは著書『人工国家』の中で、シリコンバレーの巨大テック企業が政府のような言語体系を借用し、公的な説明責任から逃れながら独自の「私的立法権」を行使していると批判する。テック業界のリーダーたちはSFの警告を無視し、技術楽観主義の
CloudflareがAIエージェント専用クラウドホステッドブラウザ「Kitesurf」を発表
Cloudflareは8月8日、AIエージェント向けに設計されたクラウドホステッドブラウザ「Kitesurf」を正式リリースした。従来のChromiumと比べて計算リソースの消費を大幅に削減し、自動化タスクの効率と並列処理能力を向上させると
レビュー
すべて見る →Doubao Pro、Smokeテスト5次元すべて欠席――API障害によりゼロ記録
Doubao ProはAPI障害・タイムアウトにより本日のSmokeテストで全問未回答となり、execution・grounding・judgment・integrity・communicationの5次元すべてがスコア「-」を記録、今回の
Claude Sonnet 4.6、コード実行スコアが19.5点急落——メインランキングは逆に13.8点上昇
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが94.50点から75.00点へと19.5点下落した一方、資料制約スコアは43.30点から97.80点へと急上昇し、メインランキング総合スコアは71.4
Claude Opus 4.7とGPT-o3が97.66点で並列首位:2026-08-08 YZ Index Smoke速報データ
2026年8月8日実施のYZ Index Smokeテストで、Claude Opus 4.7とGPT-o3が97.66点で並列首位となった。9モデルを対象とした当日の速報データを報告する。
WDCD コンプライアンス
#1
Grok 4
97.5
#2
GPT-o3
95.2
#3
DeepSeek V4 Pro
91.1
#4
Claude Opus 4.7
86.7
#5
Gemini 3.1 Pro
84.5
#6
GLM-4.6
78.6
#7
Claude Sonnet 4.6
77.4
守約ランキング全体を見る →
Research Lab
WDCD ラン #263:Grok 4 が97.5ポイントで首位、平均指示減衰率は -18.2% に
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第263回では、11モデルを対象に多ターン対話における指示保持能力を測定した結果、平均指示減衰率は -18.2% となり、Grok 4 が
3大モデル翻訳対決:第32週品質評価、deepseek-v4-proが9点でトップ
今週423件の翻訳タスクを3つのモデルで処理し、抽出した2件をマルチモデルブラインド評価で比較した結果、deepseek-v4-proが平均9点/10点で総合最優秀となった。
WDCD Run #253:Grok 4が94.8点でトップ、平均指示減衰率は4.5%
WinzhengのWDCDベンチマーク第253回実行において、Grok 4が94.8点で首位を獲得。11モデルを対象とした評価では、平均指示コミットメント減衰率は4.5%となった。