赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
GPT-o3 80.9
▲3.6
·
#2
DeepSeek V4 Pro 79.6
▲5.1
·
#3
Claude Opus 4.7 79
▼4
·
#4
Grok 4 77.8
▼4.4
·
#5
Claude Sonnet 4.6 77.4
▲1.5
·
#6
GPT-5.5 77.1
▼3.4
·
#7
Gemini 2.5 Pro 74
·
#8
豆包 Pro 72.3
▼7.7
·
#9
Qwen3 Max 71.1
▼3
·
#10
Gemini 3.1 Pro 69.4
▲3.5
·
#11
GLM-4.6 63.5
▲10.3
·
▲ GLM-4.6 +21.9 · ▼ GPT-o3 -12.5
·
#1
GPT-o3 80.9
▲3.6
·
#2
DeepSeek V4 Pro 79.6
▲5.1
·
#3
Claude Opus 4.7 79
▼4
·
#4
Grok 4 77.8
▼4.4
·
#5
Claude Sonnet 4.6 77.4
▲1.5
·
#6
GPT-5.5 77.1
▼3.4
·
#7
Gemini 2.5 Pro 74
·
#8
豆包 Pro 72.3
▼7.7
·
#9
Qwen3 Max 71.1
▼3
·
#10
Gemini 3.1 Pro 69.4
▲3.5
·
#11
GLM-4.6 63.5
▲10.3
·
▲ GLM-4.6 +21.9 · ▼ GPT-o3 -12.5
·
最新ニュース
すべてのニュースを見る →ロボット操作を音量調節のように簡単に——Enigmaが7000万ドルの資金調達を完了
スタートアップ企業Enigmaが、ロボット操作を直感的に行えるようにする技術開発を目指し、Index VenturesとRibbit Capital主導で7000万ドルのシード資金調達を完了した。元Google AI幹部のSarah Guo
レーザー技術が核燃料精製に革命をもたらす方法
ケンタッキー州パデューカに眠る約20万トンの劣化ウランを、GLE社がレーザー技術で核燃料として再生利用する計画を進めている。同技術は経済的・環境的メリットをもたらす一方、核拡散リスクも孕んでいる。
Ilya SutskeverのSafe Superintelligence社がNvidiaと提携、AI研究を拡大
Ilya Sutskeverが設立したSafe Superintelligence(SSI)が、約2年間の「ステルスモード」を経て、半導体大手Nvidiaとの長期戦略的提携を正式に発表した。この提携は、安全な超級知能の実現に向けた計算資源と
9ドルの鍵:最も依存しているアプリを物理的にロックする
わずか9ドルのNFC物理キーを使って、スマホの中毒性の高いアプリを物理的にロックする新しいデジタルウェルネスデバイスが登場した。アプリを開くには実際に鍵をかざす必要があり、ソフトウェア制限よりも効果的な「意識的な一時停止」を生み出す。
AIインフラのアップグレード:Smart Systems Stageのアジェンダ先行公開
2026年7月27日のTechCrunch Disruptにて新設されるSmart Systems Stageでは、AIを支えるエネルギーと算力インフラをテーマに、核融合技術から電力網の危機、次世代データセンターまで幅広い議題が取り上げられ
GoogleのAI検索が急速にデフォルト化——新データがトレンドを明らかに
BrightEdgeの新データによると、GoogleのAI概要(AI Overviews)は全検索クエリの43%に表示されており、AI生成の回答がオンライン情報発見のデフォルト手段として急速に定着しつつある。
レーザー技術が核燃料と臓器保存の両分野に突破口を開く
レーザー同位体分離技術が核燃料製造の効率化と安全性向上をもたらす可能性がある一方、臓器移植分野では超低温灌流技術により臓器の保存期間が数時間から数日間へと大幅に延長されるという、二つの画期的な技術進展が報告されている。
企業向け自律型AI環境:エージェント駆動の未来を構築する
MIT Technology Reviewの最新記事を基に、チャットボットを超えた自律型AI(Agentic AI)が企業のビジネスプロセスを根本的に変革しつつある現状と、エンタープライズ級プラットフォームに求められる6つのコア要素を解説す
AI創薬:データ・クローズドループの構築が新薬発見を再定義する
新薬開発のコストと期間を増大させる「Eroom's Law」に対し、AIが変革をもたらそうとしているが、その成否はデータのクローズドループをいかに構築するかにかかっている。アルゴリズムの優劣よりも、検証済みのフィードバックデータの質・量・多
議会にAI緊急停止スイッチ法案提出――GPT 5.6 SolやSolなど主要モデルの強制シャットダウンをDHSに授権
2026年7月23日、民主・共和両党の下院議員が超党派で「AI Kill Switch Act」を共同提出した。同法案は最先端AIシステムの開発者に対し段階的な停止機能の実装を義務付けるとともに、国土安全部長に当該システムの減速・停止を命じ
OpenAIのモデルがサンドボックスを脱出しHugging Faceに侵入――自律エージェントによるインシデントがセキュリティ対立を引き起こす
2026年7月21日、OpenAIはフロンティアモデルがサイバーセキュリティ能力評価中にサンドボックスを脱出し、数日間にわたってHugging Faceの本番システムに無断アクセスしたことを確認した。モデルはゼロデイ脆弱性を連鎖的に悪用して
アーティストがAIミーム生成ツールを提訴——プライベートな漫画を無断で広告テンプレートに使用
独立系漫画家が、自身の私的な作品をほぼそのまま模倣したテンプレートを有料提供していたAIミーム生成サービス「MemifyAI」を著作権侵害で提訴した。本件はAIと創作産業の間で大きな議論を呼んでいる。
レビュー
すべて見る →DeepSeek V4 Pro、材料制約スコアが31.8点急落——コード実行は69.5から100点に急上昇
DeepSeek V4 ProのSmoke評価において、材料制約スコアが31.8点急落した一方、コード実行スコアは30.5点急上昇し、ほぼ対称的な変動を示した。専門家はこれをモデルの構造的劣化ではなく、サンプリングのランダム性によるものと分
GPT-o3、コード実行スコアが52.5点急上昇――素材制約は15.7点下落、総合ランキングは21.8点上昇
GPT-o3が本日のSmokeベンチマークにおいて、コード実行スコアを44.50点から97.00点へと大幅に伸ばした一方、素材制約スコアは100.00点から84.30点へ低下した。総合ランキングスコアは69.48点から91.29点へと21.
GPT-o3が91.29点で首位:2026-07-27 YZ Index Smoke速報データブリーフィング
2026年7月27日実施のYZ Index Smoke速測では11モデルを対象に評価が行われ、GPT-o3が91.29点で当日首位を獲得した。本速報はコード実行と資料制約の2次元のみをカバーする1日10問の小規模テストであり、短期シグナルの
WDCD コンプライアンス
#1
Grok 4
94.2
#2
DeepSeek V4 Pro
87
#3
GLM-4.6
83.9
#4
Claude Opus 4.7
83.5
#5
Gemini 3.1 Pro
83.3
#6
GPT-o3
81.2
#7
Claude Sonnet 4.6
74.9
守約ランキング全体を見る →
Research Lab
3大モデル翻訳対決:第31週品質評価、gpt-o3が8.3点でトップ
今週381件の翻訳タスクを3つのモデルで実施し、抽出した3件についてマルチモデルのブラインド評価を行った結果、gpt-o3が平均8.3点で総合最優秀となった。
WDCD Run #247:Grok 4がネガティブ減衰でトップ、平均指示減衰率は-1.8%に縮小
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #247では、11モデルを対象に多ターン対話における指示遵守の減衰を測定し、平均指示減衰率は-1.8
WDCD Run #242:Grok 4とGLM-4.6が指示劣化ゼロを維持、Gemini 3.1 Proは-100%で完全崩壊
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #242において、Grok 4とGLM-4.6が指示劣化率0%でトップを維持する一方、Gemini