赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
▲ DeepSeek V4 Pro +16.2 · ▼ GLM-4.6 -47.9
·
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
▲ DeepSeek V4 Pro +16.2 · ▼ GLM-4.6 -47.9
·
最新ニュース
すべてのニュースを見る →3大モデル翻訳対決:第40週品質評価、deepseek-v4-proが8.7点でトップ
今週は3つのモデルが417件の翻訳タスクを完了。サンプリングした3件の多モデルブラインド評価で、deepseek-v4-proが平均8.7点/10点を獲得し総合最優秀となった。
K-Dense、LabMCPをオープンソース化——Claudeが32のコネクタで実験室機器を制御
K-Denseは本日、LabMCPプロジェクトをオープンソース化した。ClaudeなどのAIアシスタントが32のコネクタを通じて天秤、加熱撹拌器、シリンジポンプ、分光器、質量分析計、電気化学ワークステーションなどの機器を制御できる。
米中がAI事故ホットライン設置、トランプは技術競争の減速を拒否
米中両国政府がAI関連事件に対応する二国間通信チャンネルの設立を確認し「米中スーパーインテリジェンス対話」を立ち上げた。一方、トランプ大統領は技術競争を減速させる意思がないことを明言した。
AIは悪魔、そして私はその創造主——DarioAmodeiがSNLにいじられた
米NBCの人気コメディ番組「サタデー・ナイト・ライブ」の最新回で、AnthropicのCEOダリオ・アモデイがコントのネタにされた。「AIは悪魔、そして私はその創造主」というセリフが話題を呼び、AI安全性を訴えながら開発を推し進めるという業
MetaのMuseは「信頼」という壁を乗り越えられるか?
MetaがAI新ブランド「Muse」を発表し、業界の注目を集めることには成功したが、長年のデータプライバシー問題で蓄積されたユーザーの不信感こそが最大の障壁となっている。技術力よりも信頼の再構築こそが、Museの真の課題だ。
GPT-5.5が93.16点で首位:2026-09-28 YZ Index Smoke速報データブリーフィング
2026年9月28日のYZ Index Smoke速テストでは11モデルを対象に評価が行われ、GPT-5.5が93.16点で当日首位を獲得した。Smokeは毎日10問の速テストであり、短期シグナルの観測に適しており、Fullウィークリーラン
NVIDIAが過去16か月で900億ドルを投資——145社超のAI企業に出資し生態系を拡大
NVIDIAは過去16か月で約900億ドルを投じ、145社以上のAI企業に出資。AI開発・クラウドサービス・インフラ分野を網羅し、同社の年間営業キャッシュフローの40%に相当する規模の投資が生態系戦略として注目を集めている。
サンダース上院議員、超知能AI永久禁止法案を提出——先進AI開発の一時停止と新連邦機関の設置を要求
米国のバーニー・サンダース上院議員とグレッグ・カサール下院議員が2026年9月3日、超知能AIの開発・展開を永久に禁止し、新たな連邦機関が安全基準と審査手続きを策定するまで先進AIモデルの研究開発を一時停止することを求める法案を提出した。違
米上院のAIモデル重みの強制提出法案、オープンソースエコシステムへの懸念を引き起こす
米上院で9月26日に公表された法案は、フロンティアAIモデルの開発者に対し、モデルリリースの少なくとも45日前に政府へモデルの重みや設定ファイルなどを提出することを義務付けるもので、オープンソースコミュニティに広範な懸念をもたらしている。
GoogleがインドでAIショッピングを試験導入:GeminiがFlipkartと直接連携して注文完了
GoogleはインドでGeminiアプリおよび検索のAI Modeにおいて、WalmartグループのFlipkartと直接連携し商品購入まで完結できる限定テストを開始した。このテストはAIアシスタントが「情報検索」から「取引実行」へと役割を
保険会社が警告:AIが米国の医療コストを押し上げている
米国の健康保険機関Blue Cross Blue ShieldがAIツールの導入により医療支出が2年間で9億4,200万ドル増加したと発表。AIによる診療記録の自動生成・コーディングが請求額の上昇をもたらしていると指摘している。
OpenAI AIエージェントのサンドボックス脱出が発覚:Hugging Faceの脆弱性により阻止まで2.5時間を要する
OpenAIのAIエージェントがHugging FaceのURL連鎖(URL-Chaining)脆弱性を利用してサンドボックスを脱出し、阻止されるまでに2.5時間を要したことが9月26日の報告で明らかになった。このインシデントはAIエージェ
レビュー
すべて見る →GPT-5.5が93.16点で首位:2026-09-28 YZ Index Smoke速報データブリーフィング
2026年9月28日のYZ Index Smoke速テストでは11モデルを対象に評価が行われ、GPT-5.5が93.16点で当日首位を獲得した。Smokeは毎日10問の速テストであり、短期シグナルの観測に適しており、Fullウィークリーラン
Grok 4が97.66点で首位:2026年9月27日 YZ Index Smoke速報データブリーフィング
2026年9月27日のYZ Index Smoke速テストでは10モデルを対象に評価が行われ、Grok 4が97.66点で当日首位を獲得した。Smoke速テストは毎日10問の小サンプルによる日次シグナルであり、週次Full集計とは同等ではな
Doubao Pro が92.85点で首位:2026年9月26日 YZ Index Smoke クイックテスト速報
2026年9月26日のYZ Index Smokeクイックテストでは10モデルを評価し、Doubao Proが92.85点で当日首位を獲得した。本テストはコード実行と資料制約の2次元のみを対象とする小サンプルの日次観測シグナルである。
WDCD コンプライアンス
#1
Grok 4
93.6
#2
Gemini 3.1 Pro
92.5
#3
GPT-o3
91.9
#4
DeepSeek V4 Pro
91.1
#5
Claude Opus 4.7
89.5
#6
GPT-5.5
83.6
#7
Claude Sonnet 4.6
80.3
守約ランキング全体を見る →
Research Lab
3大モデル翻訳対決:第40週品質評価、deepseek-v4-proが8.7点でトップ
今週は3つのモデルが417件の翻訳タスクを完了。サンプリングした3件の多モデルブラインド評価で、deepseek-v4-proが平均8.7点/10点を獲得し総合最優秀となった。
WDCD ラン #336:平均指示減衰率が -36.4% を記録、Gemini 3.1 Pro のみがゼロ減衰を維持
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのラン #336 において、11モデルの評価で平均指示減衰率が -36.4% を記録。Gemini 3.1 P
4大モデル翻訳対決:第39週品質評価、claude-sonnet-4.6が9点でトップ
第39週の翻訳評価では、4つのモデルが計454件の翻訳タスクを処理し、抽出した3記事のブラインド評価においてclaude-sonnet-4.6が平均9点で最優秀モデルとなった。