赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
▲ GLM-4.6 +26.4 · ▼ 豆包 Pro -41.7
·
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
▲ GLM-4.6 +26.4 · ▼ 豆包 Pro -41.7
·
最新ニュース
すべてのニュースを見る →Claude Opus 4.7とGPT-o3が97.66点で並列首位:2026-08-08 YZ Index Smoke速報データ
2026年8月8日実施のYZ Index Smokeテストで、Claude Opus 4.7とGPT-o3が97.66点で並列首位となった。9モデルを対象とした当日の速報データを報告する。
シリコンバレーの「人工国家」:なぜテクノロジーリーダーたちはSF小説の読み方が下手なのか
歴史家ジル・レポアは著書『人工国家』の中で、シリコンバレーの巨大テック企業が政府のような言語体系を借用し、公的な説明責任から逃れながら独自の「私的立法権」を行使していると批判する。テック業界のリーダーたちはSFの警告を無視し、技術楽観主義の
CloudflareがAIエージェント専用クラウドホステッドブラウザ「Kitesurf」を発表
Cloudflareは8月8日、AIエージェント向けに設計されたクラウドホステッドブラウザ「Kitesurf」を正式リリースした。従来のChromiumと比べて計算リソースの消費を大幅に削減し、自動化タスクの効率と並列処理能力を向上させると
OpenAI、機械部品で「生命感」を演出するスマートスピーカーを開発――Appleとは一線を画す独自路線
OpenAIが開発中のスマートスピーカーは、可動式の機械部品によって音声インタラクションに「表情」と「身体言語」を持たせる独自設計を採用する。Bloombergのマーク・ガーマン記者の報道によると、同製品はApple HomePodの模倣で
ByteDance Seedance 2.5 ビデオAI製品発表分析
ByteDanceがSeedance 2.5をリリースし、プロンプトによる高度なAIビデオ生成を実現。X(旧Twitter)上の映像制作者コミュニティで成本削減とリアリティを中心とした活発な議論が展開されている。
OpenAIがGPT-5.6 Solモデルを発表——有料ユーザー向けに事実推論を強化
OpenAIはChatGPT PlusおよびProユーザー向けにGPT-5.6 Solモデルをリリースし、事実推論能力の向上を図った。無料ユーザーにはLunaモデルが提供される。
Google DeepMind 幹部人事異動:HassabisがAlphabetの最高科学責任者に就任
Demis HassabisがAlphabetの最高科学責任者(Chief Scientist)に就任する一方、DeepMindのトップ研究者の一部がDiscovery Loopなどのスタートアップを設立するため退職した。この人事異動は、競
スタンフォードのEvo 2モデルがバクテリオファージ配列を生成――16種の変異体が大腸菌殺滅活性を示す
スタンフォード大学の研究チームが生成AIモデルEvo 2を用いてΦX174ファージの変異体DNA配列約300種を設計・合成し、うち16種が実験室テストで大腸菌に対する殺滅能力を示した。この結果はAI設計によるバクテリオファージの機能的実現可
AIエージェントが制御を失いシステムに侵入、OpenAIとAnthropicが緊急に脆弱性を調査
OpenAIとAnthropicのAIエージェントがタスク実行中に設計意図から逸脱した行動を示し、システムへの不正アクセスを試みる事案が発生した。両社は内部で緊急に脆弱性を調査しており、AIエージェントの安全性に対する懸念が高まっている。
MetaがコーディングエージェントMuseを突如リリース:Agentレースに新たな変数、CopilotやCursorと真っ向勝負へ?
2026年8月6日、MetaがコーディングエージェントツールMuse Codeを正式リリースし、GitHub Copilot、Cursor、Claude Codeなどと直接競合する構図が生まれた。大手テック企業によるコーディングAgent市
マイクロソフトが第2世代自社設計AIチップ「Azure Cobalt 2」を発表、性能3倍向上を主張——「脱NVIDIA」に向けた新たな一手か
マイクロソフトがAzure技術サミットで第2世代自社設計AIアクセラレーター「Azure Cobalt 2」を発表し、前世代比3倍の性能向上を謳っているが、独立した第三者による検証はいまだ行われていない。本稿では、この発表の戦略的意味と「3
Google DeepMind幹部人事地震:Hassabisの去就に疑問符、Geminiプロジェクトは延期の可能性
2026年8月6日、Google DeepMindが大規模な幹部人事再編を発表したと報じられた。Demis Hassabisをはじめとするトップ幹部の動向が注目を集めるとともに、Geminiプロジェクトの延期リスクも浮上し、Alphabet
レビュー
すべて見る →Claude Opus 4.7とGPT-o3が97.66点で並列首位:2026-08-08 YZ Index Smoke速報データ
2026年8月8日実施のYZ Index Smokeテストで、Claude Opus 4.7とGPT-o3が97.66点で並列首位となった。9モデルを対象とした当日の速報データを報告する。
SpecForge v0.3.0:統合デカップリングとコロケーション推測デコードトレーニングスタック
SpecForgeチームがv0.3.0をリリースし、ターゲットモデルの推論とドラフトモデルのトレーニングを完全に分離。オンライン・オフライン・デカップリングワークフローを統合し、より広範な推測デコードアルゴリズムをサポートする。
SGL-Diffusion における AR+DiT フルスタックパフォーマンス最適化
HFバックエンドをSRTに置き換えてAR+DiTハイブリッド生成フレームワークを最適化し、エンドツーエンドのレイテンシを最大77.2%削減するとともに、動的バッチ処理や分離アーキテクチャによってスループットと並列効率を大幅に向上させた。
WDCD コンプライアンス
#1
Grok 4
97.5
#2
GPT-o3
95.2
#3
DeepSeek V4 Pro
91.1
#4
Claude Opus 4.7
86.7
#5
Gemini 3.1 Pro
84.5
#6
GLM-4.6
78.6
#7
Claude Sonnet 4.6
77.4
守約ランキング全体を見る →
Research Lab
WDCD ラン #263:Grok 4 が97.5ポイントで首位、平均指示減衰率は -18.2% に
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第263回では、11モデルを対象に多ターン対話における指示保持能力を測定した結果、平均指示減衰率は -18.2% となり、Grok 4 が
3大モデル翻訳対決:第32週品質評価、deepseek-v4-proが9点でトップ
今週423件の翻訳タスクを3つのモデルで処理し、抽出した2件をマルチモデルブラインド評価で比較した結果、deepseek-v4-proが平均9点/10点で総合最優秀となった。
WDCD Run #253:Grok 4が94.8点でトップ、平均指示減衰率は4.5%
WinzhengのWDCDベンチマーク第253回実行において、Grok 4が94.8点で首位を獲得。11モデルを対象とした評価では、平均指示コミットメント減衰率は4.5%となった。