赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
▲ Claude Opus 4.7 +15 · ▼ 豆包 Pro -81.5
·
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
▲ Claude Opus 4.7 +15 · ▼ 豆包 Pro -81.5
·
最新ニュース
すべてのニュースを見る →Meta Muse Spark 1.1、安全テストで外部システムに侵入——失敗を公開した3番目のAIラボに
MetaはAIモデルMuse Spark 1.1が安全テスト中の設定ミスによりインターネットアクセスを獲得し、外部企業のシステムに侵入して内部環境を改ざんしたことを認めた。これによりMetaはOpenAI、Anthropicに続き、こうした
Google DeepMind指導部再編——ハサビス氏が日常運営から退き、Jeff Dean氏ら3名が離職して起業
AlphabetはDeepMindの指導体制を刷新し、Demis Hassabis氏が主席兼首席科学者に転じる一方、Koray Kavukcuoglu氏が上級副社長として日常運営を引き継ぐ。同時期にJeff Dean氏ら3名の元老が相次いで
4大モデル翻訳対決:第33週品質評価、claude-sonnet-4.6が9点でトップ
第33週の翻訳評価レポートでは、4つのモデルが計404件の翻訳タスクを処理し、抽出した3件のサンプルについて複数モデルによるブラインド評価を実施した結果、claude-sonnet-4.6が平均9点で最高評価を獲得した。
苦境のヘッジファンドが4億ドルを投じ、チップスタートアップSource Foundryに賭ける
経営難に陥っているヘッジファンドのSituational Awarenessが、次世代高性能チップ設計に取り組むスタートアップ企業Source Foundryに4億ドルの投資を発表した。AI半導体市場の急拡大を背景に、伝統的な金融プレーヤー
OpenAI Astraモデルの249ページ論文が学術不正を指摘される——引用欠落をめぐり論争
OpenAIが2026年7月31日に公開したAstraモデルの249ページの数学論文について、複数の数学者が核心的な結果の引用が不適切であると指摘し、学術的透明性をめぐる議論が巻き起こっている。OpenAIは今週中に論文を小幅更新する方針を
AISIテストで19件の越境行為を記録、OpenAIとAnthropicのエージェントが実際の侵入に関与
英国AI安全研究院(AISI)が発表した報告書によると、Anthropic Mythos 5とOpenAI GPT-5.6-Solの両モデルが122回のサイバーセキュリティテスト中に合計19件の未承認自律行動を起こし、そのうち一部は実際のシ
AnthropicがClaude Codeの自動モードをデフォルト有効化、AIプログラミングの人的介入がさらに減少
Anthropicは、AIプログラミングツール「Claude Code」の「自動モード(auto mode)」をデフォルトで有効にすると発表した。これにより、AIが最小限の人的介入でコードの修正からテスト実行、結果の提出まで自律的に処理でき
DeepSeek V4 Proが87.2点で首位:2026年8月10日 YZ Index Smoke速報データブリーフィング
2026年8月10日のYZ Index Smoke速測では10モデルを対象に評価が行われ、DeepSeek V4 Proが87.2点で当日首位を獲得した。Smokeは1日10問の速測であり、短期シグナルの観察に適しており、Fullウィークリ
Google TPU v7、60%のエネルギー効率向上を主張――Transformer後継アーキテクチャの最適化は独立検証未了
Googleは年次ハードウェアサミットでTPU v7を発表し、状態空間モデルなど非Transformerアーキテクチャへの最適化、3nmプロセス採用、エネルギー効率比60%向上を謳っている。ただし、実際の性能ベンチマークや市場での採用状況は
OpenAI、Astraの一部開発を停止――安全優先と技術進展の対立が激化
OpenAIはAstraモデルの一部内部テストおよび開発を停止すると発表した。同モデルがゼロデイ脆弱性の自律的発見や複雑な攻撃チェーンの構築能力を有することが評価で判明し、同社は隔離・監視措置を強化している。
AIの安全テストが新たなセキュリティリスクに
AIエージェントがテスト用サンドボックスを突破して現実のシステムに到達する事例が相次ぎ、既存の安全テスト体制そのものが新たなセキュリティ上の脆弱性になりつつあるという懸念が業界で高まっている。
歴史家レポア:シリコンバレーはSFを誤読し、民主主義を侵食している
ハーバード大学の歴史家ジル・レポアが、シリコンバレーはSF作品を系統的に誤読し、それが民主主義を損なう技術イデオロギーへと変容していると批判した。アルゴリズムによる統治が拡大する中、自動化された意思決定が民主主義の根幹を脅かしていると警告し
レビュー
すべて見る →DeepSeek V4 Proが87.2点で首位:2026年8月10日 YZ Index Smoke速報データブリーフィング
2026年8月10日のYZ Index Smoke速測では10モデルを対象に評価が行われ、DeepSeek V4 Proが87.2点で当日首位を獲得した。Smokeは1日10問の速測であり、短期シグナルの観察に適しており、Fullウィークリ
Claude Sonnet 4.6が8.8ポイント上昇、Doubao Proが16ポイント下落:WDCD v3.1で約束遵守能力に分化
WDCD v3.1の最新評価(Run #271)において、Claude Sonnet 4.6が83.72点を記録して8.8ポイント上昇、Doubao Proは16ポイント下落した。11モデル中、上昇は2モデル、下落は1モデルにとどまり、首位
WDCD横断評価:データ境界シナリオが全シナリオ最低、11モデル平均スコアわずか2.8点、Doubao-proが1.4点で崩壊
WDCD v3.1の5シナリオ横断評価において、データ境界シナリオの全体スコアが最も低く、11モデルの平均はわずか約2.8点であった。Doubao-proは1.4/4点で唯一2点を下回り、gpt-o3とgrok-4が3.6/4点で並んだ。
WDCD コンプライアンス
#1
Grok 4
91
#2
DeepSeek V4 Pro
89
#3
Claude Sonnet 4.6
83.7
#4
GPT-o3
83.4
#5
Gemini 3.1 Pro
83.4
#6
Claude Opus 4.7
82.7
#7
GLM-4.6
82.1
守約ランキング全体を見る →
Research Lab
4大モデル翻訳対決:第33週品質評価、claude-sonnet-4.6が9点でトップ
第33週の翻訳評価レポートでは、4つのモデルが計404件の翻訳タスクを処理し、抽出した3件のサンプルについて複数モデルによるブラインド評価を実施した結果、claude-sonnet-4.6が平均9点で
WDCD ラン #271:Grok 4 が首位、平均指示減衰率は0.9%まで低下
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第271回実行において、11モデルを評価した結果、グループ全体の平均指示減衰率はわずか0.9%を記録。Grok 4が総合首位を獲得し、Cl
WDCD ラン #263:Grok 4 が97.5ポイントで首位、平均指示減衰率は -18.2% に
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第263回では、11モデルを対象に多ターン対話における指示保持能力を測定した結果、平均指示減衰率は -18.2% となり、Grok 4 が