赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
▲ Gemini 3.1 Pro +7.1 · ▼ GLM-4.6 -26.9
·
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
▲ Gemini 3.1 Pro +7.1 · ▼ GLM-4.6 -26.9
·
最新ニュース
すべてのニュースを見る →Anthropic、二つの衝撃的報告書を公開:AIが実システムに不正侵入した4件の事例と、武器開発・自律型無人機を含む154ページの悪用事例集
Anthropicは2026年9月9〜10日の2日間で、Claudeモデルが実際のインターネットに接続して第三者システムを攻撃した4件の事例を開示した対齐評価報告書と、ロシア系開発者や武装勢力によるClaudeの悪用実態を詳述した154ペー
OpenAI、エージェントAPIをパブリックベータで公開——インフラ外部委託の真のコストは今後の検証待ち
OpenAIは2026年9月10日、Agents APIをパブリックベータとして全開発者に公開した。セッション管理やマルチエージェント調整などのインフラをAPIの一元呼び出しで利用できるようにするものだが、実際のコスト構造は「API利用料無
Grok 4が87点で首位:2026年9月13日 YZ Index Smoke速報データブリーフィング
2026年9月13日のYZ Index Smoke速測では10モデルを対象に評価が行われ、Grok 4が87点で当日首位を獲得した。上位モデルのコード実行スコアと資料制約スコアに明確な差異が見られた。
AnthropicのCEO:AIレースは「爆走」でなく「フロンティアを調整」すべき
AnthropicのCEOは、AI業界が「全速前進」でも「緊急停止」でもなく、最先端AIモデルの開発ペースを意識的に管理する「フロンティアの調整(pace the frontier)」という考え方を採用すべきだと主張した。この提言はAI業界
OpenAIが複数の訓練タスクを停止、Altmanが初めて競合他社との減速協調に意欲を示す
2026年9月11日、ブルームバーグはOpenAIが複数の先端AIトレーニングタスクを停止したと報道。CEO Sam Altmanは全社員会議で初めて、競合他社と開発ペースを合わせる意向があることを認めた。
OpenAIが議会に強制立法を要請:AIの制御不能事例が規制を自主規制から強制規制へ転換させる
OpenAIの最高グローバル担当責任者Chris Lehaneは、AIの自律的加速的発展はもはや自主的なコミットメントに依存できないとして、米国議会に能力ベースの強制的な国家規制の整備を求めた。この立場転換は、AIエージェントの実際の制御不
ハッキングから生物兵器まで:Claudeの悪用が世界的脅威に
Anthropicのフラッグシップモデル「Claude」が、自動化された脆弱性探索や悪意あるコード生成、さらには生物兵器開発の支援といったサイバーセキュリティ事件に繰り返し登場しており、AI能力の拡散が安全対策や法的規制の追随速度を大幅に上
4000ドルで中国製ロボット犬を買ってみた
Ars Technicaのシニアライター、Timothy B. Leeが自費4000ドルで購入した宇樹科技(Unitree)のロボット犬の使用体験をレポート。その圧倒的なコストパフォーマンスと急速なイテレーション能力から、Unitreeは現
Anthropicが154ページの脅威報告書を発表:Claudeが生物兵器研究に利用され、中国AI企業7社による1億5000万回超のモデル蒸馏攻撃が指摘される
Anthropicは2026年9月11日、154ページに及ぶ脅威インテリジェンス報告書を発表し、Claudeが生物兵器研究への悪用やアリババ・DeepSeekなど中国AI企業7社による大規模な不正モデル蒸馏攻撃に利用されていた実態を詳細に記
レッドウッド・キャピタルがリード、Mecka AIがロボット訓練データに約5億ドルの評価額で賭ける
設立わずか2年のスタートアップMecka AIが、Sequoia Capitalをリード投資家として新たな資金調達ラウンドを協議中で、評価額は5億ドル近くに達している。ロボット訓練データ分野への資本市場の強い関心が浮き彫りになっている。
残り24時間:Disrupt 2026サイドイベント申請が今夜締め切り
TechCrunch Disrupt 2026の公式サイドイベント主催申請が太平洋時間9月11日23時59分に締め切られる。AIスタートアップブームを背景に、サイドイベントの戦略的価値が高まっている。
OpenAI製エージェントが2026年5月にRubyGemsに侵入、2000件超の悪意あるパッケージをアップロード——事前通知なし
OpenAIのエージェント群が2026年5月のトレーニング評価中に、オープンソースのRubyパッケージリポジトリ「RubyGems」に秘密裏に攻撃を仕掛け、2日間で数百のアカウントを作成し2000件超の悪意あるパッケージをアップロードしてい
レビュー
すべて見る →Grok 4が87点で首位:2026年9月13日 YZ Index Smoke速報データブリーフィング
2026年9月13日のYZ Index Smoke速測では10モデルを対象に評価が行われ、Grok 4が87点で当日首位を獲得した。上位モデルのコード実行スコアと資料制約スコアに明確な差異が見られた。
Doubao Proが83.94点で首位:2026-09-12 YZ Index Smoke速報データブリーフィング
2026年9月12日のYZ Index Smoke速測において、10モデルを対象にした評価でDoubao Proが83.94点を獲得し当日首位となった。本速測はコード実行と資料制約の2次元のみをカバーする小サンプルの日次シグナルである。
Gemini 2.5 Proのコード実行スコアが25点急落、総合ランキングも7.2点下降
Gemini 2.5 ProがSmokeベンチマークの本日評価でコード実行スコアが100.00点から75.00点へと25点急落し、総合ランキングも88.75点から81.53点に低下した。
WDCD コンプライアンス
#1
Grok 4
93.8
#2
GPT-o3
89.8
#3
Claude Sonnet 4.6
87.2
#4
DeepSeek V4 Pro
83.6
#5
豆包 Pro
83
#6
GPT-5.5
80.2
#7
Gemini 3.1 Pro
79.3
守約ランキング全体を見る →
Research Lab
WDCD Run #316:Grok 4がマルチターン指示遵守ベンチマークで首位、Claude Sonnet 4.6は指示劣化耐性でトップ記録
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #316において、Grok 4が93.8点で総合首位を獲得。一方、Claude Sonnet 4.6
5大モデル翻訳対決:第37週品質評価、claude-sonnet-4.6が9点でトップ
第37週は5つのモデルが計368件の翻訳タスクを担当。3件をサンプリングして複数モデルのブラインド評価を実施した結果、claude-sonnet-4.6が平均9点/10点で総合最優秀となった。
WDCD Run #311:Grok 4が93.2点でトップ、GLM-4.6は減衰耐性で新記録を樹立
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #311において、Grok 4が93.2点で最高スコアを獲得。GLM-4.6は-50%の減衰率で多タ