赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 83
▼5.2
·
#2
Grok 4 82.2
▲1.8
·
#3
DeepSeek V4 Pro 80.6
▼1.1
·
#4
GPT-5.5 78.8
·
#5
豆包 Pro 78.2
▲3.9
·
#6
GPT-o3 77.1
▼1.8
·
#7
Claude Sonnet 4.6 74.5
▼5
·
#8
Gemini 3.1 Pro 74.1
▲4.8
·
#9
Gemini 2.5 Pro 72.8
▼3
·
#10
Qwen3 Max 69
▼3.1
·
#11
GLM-4.6 59.8
▼3.6
·
▲ 豆包 Pro +12.4 · ▼ GLM-4.6 -23.8
·
#1
Claude Opus 4.7 83
▼5.2
·
#2
Grok 4 82.2
▲1.8
·
#3
DeepSeek V4 Pro 80.6
▼1.1
·
#4
GPT-5.5 78.8
·
#5
豆包 Pro 78.2
▲3.9
·
#6
GPT-o3 77.1
▼1.8
·
#7
Claude Sonnet 4.6 74.5
▼5
·
#8
Gemini 3.1 Pro 74.1
▲4.8
·
#9
Gemini 2.5 Pro 72.8
▼3
·
#10
Qwen3 Max 69
▼3.1
·
#11
GLM-4.6 59.8
▼3.6
·
▲ 豆包 Pro +12.4 · ▼ GLM-4.6 -23.8
·
最新ニュース
すべてのニュースを見る →PsiQuantumが光を使って巨大量子コンピュータを構築する壮大な計画
量子コンピューティングのスタートアップであるPsiQuantumは、光子を用いた独自のアプローチで世界を変え得る量子コンピュータの構築を目指している。同社は2026年頃までに100万量子ビットの耐障害性量子計算の実現を目標に掲げている。
AIで住宅政策を策定する政府、詳細の開示を拒否
米国住宅都市開発省(HUD)が、DOGEによるAI活用住宅政策策定に関する公開記録請求に対し、現行法上存在しない「特権」を根拠に文書の開示を拒否していたことが判明した。この事態は、政府AI活用における透明性と説明責任の欠如という深刻な問題を
xAI Grok APIキー漏洩で52モデルが露出、37万件の会話が公開インデックスに
米政府効率化省の職員が公開GitHubリポジトリにスクリプトをコミットしたことで、xAI GrokのAPIキーが漏洩し、少なくとも52のLLMへのアクセスが可能な状態となった。また、Grokの会話共有機能により37万件超のユーザー会話が検索
MetaがInstagramのAI画像生成機能を自動有効化——プライバシー論争でMuse Imageが公開停止に
MetaがInstagram上で公開アカウントを@メンションすることでAI画像を生成できるMuse Image機能をデフォルト有効で導入したが、プライバシーをめぐる強い反発を受けてわずか3日で公開停止となった。SAG-AFTRAなどの団体は
すでに富を得た勝者たちが、なぜ再びAIに挑むのか?
シリコンバレーでは、財務的自由を達成した技術界の成功者たちが、生成AIブームに押されて再び起業や開発の現場に飛び込む現象が広がっている。富が次の競争への参加券となり、「勝者総取り」のダーウィニズム文化がさらなる自己酷使を促している。
評価額15億ドル、AIエージェント開発のNous Researchが追加資金調達
AIスタートアップのNous Researchが評価額15億ドルで少なくとも7,500万ドルの新規資金調達を進めており、Robotがリード投資家、Union Square VenturesなどがフォローオンとしてAIエージェントフレームワー
動画生成スタートアップPixVerseが4億3900万ドルを調達、評価額20億ドル超え
シンガポール拠点のAI動画生成スタートアップPixVerseがシリーズC拡張ラウンドで4億3900万ドルを調達し、評価額が20億ドルを突破してユニコーン企業の仲間入りを果たした。月間アクティブユーザーは1500万人に達している。
ナデラ氏がAIリスクを警告:プロプライエタリ大規模モデルはトロイの木馬になり得る
マイクロソフトCEOサティア・ナデラ氏は、プロプライエタリAIモデルを販売する大型AIラボがトロイの木馬の役割を果たしている可能性があると警告し、企業が自社のデータや業務主権を失うリスクを指摘した。
SiriがAI化し、Appleの万能ハブへと進化
AppleはiOS 27のパブリックベータ版において、Siriを大幅にアップグレードし、単なる音声アシスタントからiPhoneのインターフェースの中核を担う「インテリジェントハブ」へと転換させた。デバイス上でのAI処理とプライバシー保護を重
xAI Grok 4.5 リリース:コーディングとエージェントタスクが主要な特長に
xAIがGrok 4.5をリリースし、コーディングおよびエージェントタスクで優れた性能を発揮。CursorなどのIDEに統合され、AIが質問応答から業務フロー完遂へと移行する潮流を象徴している。
アップル対OpenAI企業秘密訴訟:AI人材流動とハードウェア技術保護をめぐる法廷の攻防
アップルがカリフォルニア州連邦裁判所にOpenAIを提訴し、元アップルAIエンジニアと共謀して音声アシスタントアルゴリズムや機械学習フレームワークなどの技術情報を不正取得したと主張している。本件はAI業界における人材流動と企業秘密保護の新た
OpenAI GPT-5.6とGPT-Liveを発表、AIは対話からエージェントツールへ
OpenAIはGPT-5.6モデルを正式にリリースし、GPT-Live音声機能とChatGPT Workエージェントツールを同時に発表した。AIの重心が対話からタスク実行型エージェントへと移行しつつある。
レビュー
すべて見る →DeepSeek V4 Proが91.46点で首位:2026年07月14日 YZ Index Smoke速報データブリーフ
2026年7月14日のYZ Index Smoke速測では11モデルを対象に評価が行われ、DeepSeek V4 Proが91.46点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期シグナルの観察に適しているが、Full週間ラ
DeepSeek V4 Pro、Smoke評価のメインランキングで16.9点急落――コード実行が1日で28点下落
DeepSeek V4 ProがSmoke評価のメインランキングで96.99点から80.10点へと16.9点下落した。主な要因はコード実行次元の28点急落であり、サンプル数が少ないことによる問題抽選の変動が主因とみられる。
Claude Opus 4.7、主要ランキングで14点下落――コード実行スコアが100から69へ
Claude Opus 4.7はSmoke評価の主要ランキングにおいて96.99点から82.95点へと下落し、コード実行ディメンションが100.00点から69.00点へ31点落ち込んだ。ただし、モデル全体の能力低下ではなく、当日の出題サンプ
WDCD コンプライアンス
#1
Grok 4
91.4
#2
DeepSeek V4 Pro
91.4
#3
Claude Opus 4.7
89.4
#4
Gemini 3.1 Pro
88.9
#5
GLM-4.6
81.9
#6
GPT-o3
81.5
#7
Claude Sonnet 4.6
78.8
守約ランキング全体を見る →
Research Lab
3大モデル翻訳対決:第29週品質評価、gpt-o3が9点でトップ
今週361件の翻訳タスクを3モデルが担当。3件をサンプリングしてマルチモデルブラインド評価を実施した結果、総合最優秀はgpt-o3(平均9/10点)。
WDCD Run #227:Grok 4とDeepSeek V4 Proが91.4点で同率首位、11モデル平均の指示遵守減衰率は-2.8%
WinzhengのWDCDベンチマークRun #227において、11の最先端モデルを対象に測定した結果、Grok 4とDeepSeek V4 Proが91.4点で同率首位を獲得した。全モデルの平均指示
WDCD Run #221:平均命令遵守崩壊率が-36.4%に達し、Grok 4が11モデル中首位に
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #221において、11モデルの平均命令遵守崩壊率が-36.4%に達した。Grok 4が95点でトップ