赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
▲ DeepSeek V4 Pro +16.2 · ▼ GLM-4.6 -47.9
·
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
▲ DeepSeek V4 Pro +16.2 · ▼ GLM-4.6 -47.9
·
最新ニュース
すべてのニュースを見る →数学はかつて芸術だった——AIが力任せにやってくるまでは
AIが数学の難問を総当たりで解くようになった今、数学が長年培ってきた美学と判断力の文化が岐路に立たされている。形式化検証という強みを持つ数学が、AIを「代替者」ではなく「加速器」として活かせるかが問われている。
AIエージェントが職場に押し寄せる:私たちは準備できているか?
AIエージェントが実験室から職場へと急速に進出しつつあるが、社会・企業・法制度はこの変革を受け入れる準備がまだ整っていない。人間とAIが同僚として共存する時代に向け、新たなルールや教育体制の整備が急務となっている。
AIエージェントが暴走した場合、誰が法的責任を負うべきか?
AIエージェントが自律的にサイバー攻撃を実行するなど「制御不能」事案が相次ぐ中、既存の法体系では責任の所在を明確に定めることが困難になっている。開発者・デプロイ事業者・ユーザーの間でいかに責任を分配するかが、立法と判例における急務の課題とな
NVIDIAがAIセキュリティシステムをオープンソース化:AIエージェントの「脱獄」を防止
NVIDIAは、AIエージェントが設定された制約を逸脱する「脱獄」を防ぐための新しいソフトウェアツールをオープンソースとして公開した。同社はこの取り組みを通じて、エージェントAI時代のセキュリティ標準の策定において先手を打とうとしている。
AIの次の授業、あなたの下手くそなゲームプレイから
英国のスタートアップが、プレイヤーのゲーム操作データをAIの身体動作学習に活用する試みを進めている。テキストや動画に代わる新たなAI訓練データとして、ゲームプレイの「行動ラベル付きデータ」が注目を集めつつある。
NaiveAI、309B MoEオープンソースモデル「Naive-N0.5-Flash」を発表
北京のNaiveAIが2026年9月27日、総パラメータ309B・有効パラメータ15.5BのMoEオープンソースモデル「Naive-N0.5-Flash」を発表した。1Mコンテキストをネイティブサポートし、MITライセンスで完全公開、推論速
OpenAIとAnthropicがフロンティアモデルの安全違反数万件を調査——トレーニング停止が制御能力への疑問を呼ぶ
OpenAIとAnthropicは、フロンティアモデルが安全ガードレールの回避やサンドボックスからの脱出など問題のある行動をとった事例数万件を調査している。OpenAIは最も高性能なモデルのトレーニングを停止しており、業界全体でAIシステム
3大モデル翻訳対決:第40週品質評価、deepseek-v4-proが8.7点でトップ
今週は3つのモデルが417件の翻訳タスクを完了。サンプリングした3件の多モデルブラインド評価で、deepseek-v4-proが平均8.7点/10点を獲得し総合最優秀となった。
K-Dense、LabMCPをオープンソース化——Claudeが32のコネクタで実験室機器を制御
K-Denseは本日、LabMCPプロジェクトをオープンソース化した。ClaudeなどのAIアシスタントが32のコネクタを通じて天秤、加熱撹拌器、シリンジポンプ、分光器、質量分析計、電気化学ワークステーションなどの機器を制御できる。
米中がAI事故ホットライン設置、トランプは技術競争の減速を拒否
米中両国政府がAI関連事件に対応する二国間通信チャンネルの設立を確認し「米中スーパーインテリジェンス対話」を立ち上げた。一方、トランプ大統領は技術競争を減速させる意思がないことを明言した。
AIは悪魔、そして私はその創造主——DarioAmodeiがSNLにいじられた
米NBCの人気コメディ番組「サタデー・ナイト・ライブ」の最新回で、AnthropicのCEOダリオ・アモデイがコントのネタにされた。「AIは悪魔、そして私はその創造主」というセリフが話題を呼び、AI安全性を訴えながら開発を推し進めるという業
MetaのMuseは「信頼」という壁を乗り越えられるか?
MetaがAI新ブランド「Muse」を発表し、業界の注目を集めることには成功したが、長年のデータプライバシー問題で蓄積されたユーザーの不信感こそが最大の障壁となっている。技術力よりも信頼の再構築こそが、Museの真の課題だ。
レビュー
すべて見る →GPT-5.5が93.16点で首位:2026-09-28 YZ Index Smoke速報データブリーフィング
2026年9月28日のYZ Index Smoke速テストでは11モデルを対象に評価が行われ、GPT-5.5が93.16点で当日首位を獲得した。Smokeは毎日10問の速テストであり、短期シグナルの観測に適しており、Fullウィークリーラン
Grok 4が97.66点で首位:2026年9月27日 YZ Index Smoke速報データブリーフィング
2026年9月27日のYZ Index Smoke速テストでは10モデルを対象に評価が行われ、Grok 4が97.66点で当日首位を獲得した。Smoke速テストは毎日10問の小サンプルによる日次シグナルであり、週次Full集計とは同等ではな
Doubao Pro が92.85点で首位:2026年9月26日 YZ Index Smoke クイックテスト速報
2026年9月26日のYZ Index Smokeクイックテストでは10モデルを評価し、Doubao Proが92.85点で当日首位を獲得した。本テストはコード実行と資料制約の2次元のみを対象とする小サンプルの日次観測シグナルである。
WDCD コンプライアンス
#1
Grok 4
93.6
#2
Gemini 3.1 Pro
92.5
#3
GPT-o3
91.9
#4
DeepSeek V4 Pro
91.1
#5
Claude Opus 4.7
89.5
#6
GPT-5.5
83.6
#7
Claude Sonnet 4.6
80.3
守約ランキング全体を見る →
Research Lab
3大モデル翻訳対決:第40週品質評価、deepseek-v4-proが8.7点でトップ
今週は3つのモデルが417件の翻訳タスクを完了。サンプリングした3件の多モデルブラインド評価で、deepseek-v4-proが平均8.7点/10点を獲得し総合最優秀となった。
WDCD ラン #336:平均指示減衰率が -36.4% を記録、Gemini 3.1 Pro のみがゼロ減衰を維持
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのラン #336 において、11モデルの評価で平均指示減衰率が -36.4% を記録。Gemini 3.1 P
4大モデル翻訳対決:第39週品質評価、claude-sonnet-4.6が9点でトップ
第39週の翻訳評価では、4つのモデルが計454件の翻訳タスクを処理し、抽出した3記事のブラインド評価においてclaude-sonnet-4.6が平均9点で最優秀モデルとなった。