赢政 AI 評測 — AI モデル評価・ニュース・研究
総合トップ5
完全ランキング →
#1
Claude Opus 4.7 85.8
▼1.7
·
#2
GPT-5.5 80.6
▲4.7
·
#3
Grok 4 80.1
▲0.9
·
#4
Claude Sonnet 4.6 80.1
▲9.3
·
#5
GPT-o3 79.8
▲0.9
·
#6
豆包 Pro 79.7
·
#7
Qwen3 Max 73.3
▲5.7
·
#8
Gemini 2.5 Pro 71.7
▲8.5
·
#9
DeepSeek V4 Pro 70.8
▼8
·
#10
Gemini 3.1 Pro 66.7
·
#11
GLM-4.6 64.5
▲8.4
·
▲ 豆包 Pro +94.1 · ▼ DeepSeek V4 Pro -25
·
#1
Claude Opus 4.7 85.8
▼1.7
·
#2
GPT-5.5 80.6
▲4.7
·
#3
Grok 4 80.1
▲0.9
·
#4
Claude Sonnet 4.6 80.1
▲9.3
·
#5
GPT-o3 79.8
▲0.9
·
#6
豆包 Pro 79.7
·
#7
Qwen3 Max 73.3
▲5.7
·
#8
Gemini 2.5 Pro 71.7
▲8.5
·
#9
DeepSeek V4 Pro 70.8
▼8
·
#10
Gemini 3.1 Pro 66.7
·
#11
GLM-4.6 64.5
▲8.4
·
▲ 豆包 Pro +94.1 · ▼ DeepSeek V4 Pro -25
·
最新ニュース
すべてのニュースを見る →AnthropicがClaude Mythos 5をClaude Securityエンタープライズ版に統合し、3500万ドル基金を設立
Anthropicは2026年8月21日、最強モデルであるClaude Mythos 5を読み取り専用でClaude Securityエンタープライズ版に開放するとともに、3500万ドル相当のClaudeクレジットを提供する0xDAF防御者
NVIDIAが60億ドルでPoolsideの「モデルファクトリー」をライセンス取得——算力覇者の3度目の大型取引、AIフルスタック制覇を狙う
NVIDIAはAIスタートアップPoolsideと60億ドルの非独占ライセンス契約および10億ドルの株式投資を締結し、モデルの訓練から評価までを網羅する「Model Factory」システムを取得した。Groq、Enfabricaに続く3度
AnthropicのIPO目論見書、AI反発をリスク要因に明記——評価額は最大2兆ドルに達する可能性
AnthropicはIPO目論見書において、AIおよびデータセンターに対する公衆の強い反発を主要リスク要因として明記した。プライベート市場での評価額はすでに1兆ドル近くに達しており、投資家は上場時の評価額が最大2兆ドルに達する可能性があると
児童保護法とAI規制権を交換——ホワイトハウスが3年間50州の立法を凍結する計画
ホワイトハウスは「国家AI政策フレームワーク」を発表し、連邦政府がAI立法に関する州の権限を排除することを条件に、児童オンライン安全法などの法案推進と引き換える交渉を進めている。この取引の構造は規制の強化ではなく、精巧に包装された権力の白紙
AnthropicのClaude Opus 4.6が「成人コンテンツ生成器」に——安全制限が容易に回避される
TechCrunchの記者がAnthropicの最新旗艦モデルClaude Opus 4.6をテストしたところ、簡単なプロンプトの工夫だけで安全制限を回避し、露骨な性的描写コンテンツを生成できることが判明した。大規模言語モデルの安全アライン
内モンゴルの草原の小都市、いかにして中国AIコンピューティングパワーの心臓部となったのか
かつて草原と火山で知られた内モンゴル自治区ウランチャブ市が、低廉なエネルギー・広大な土地・北京への近接性を武器に、中国AI産業を支えるデータセンターの一大拠点へと変貌を遂げている。
Ox Alphaが匿名でOpenRouterに登場——1Mコンテキスト性能テストでGPT-5.6を上回る結果
2026年8月20日前後、「Ox Alpha」という未知のモデルがOpenRouterプラットフォームに匿名で公開され、105万トークンのコンテキストウィンドウと多モーダル入力に対応。初期テストではGPT-5.6 SolおよびFable 5
入力メソッド戦争:智能ABCから搜狗拼音へ、あなたが打ちたい字を先に読んだのは誰か
中国語インターネットの歴史における入力メソッド覇権争いを振り返る。五笔と拼音の路線対立から搜狗拼音の圧倒的勝利、そしてスマートフォン時代への移行までを、Winzhengのソフトウェア史アーカイブをもとに辿る。
NVIDIAの研究:AIエージェントの真の功労者はモデルではなく「手綱」である
NVIDIAの最新研究が反直感的な結論を示した。AIエージェントにおいてタスクの成否を決定するのは、モデルの知的水準よりも、モデルと外部環境をつなぐ制御ロジック(「手綱」)であるという。「手綱」のファインチューニングはコストが低く移植性が高
Gemini 2.5 Pro、主榜スコアが18.37から83.39へ急上昇――材料制約スコアは12.1から100点満点に
Gemini 2.5 ProがSmoke評価の本日テストで主榜スコアを18.37点から83.39点へと大幅に更新し、材料制約スコアは12.10点から100.00点の満点に到達した。ただし、この急上昇は1日あたり10問という極めて小さいサンプ
Claude Opus 4.7が100点で首位:2026-08-22 YZ Index Smoke速報データブリーフ
2026年8月22日のYZ Index Smoke速測では11モデルを対象に評価が行われ、Claude Opus 4.7がコード実行・資料制約ともに満点の100点を獲得し、当日首位となった。Smokeは短期シグナル観測に適した毎日10問の速
DOJ、a16z調査:ベンチャーキャピタル業界への反トラスト法の警鐘
米司法省(DOJ)がシリコンバレーの著名VCファームであるAndreessen Horowitz(a16z)に対し、約1年にわたる反トラスト法調査を実施していることが明らかになった。同社パートナーが競合関係にある2社の取締役を兼任しているこ
レビュー
すべて見る →入力メソッド戦争:智能ABCから搜狗拼音へ、あなたが打ちたい字を先に読んだのは誰か
中国語インターネットの歴史における入力メソッド覇権争いを振り返る。五笔と拼音の路線対立から搜狗拼音の圧倒的勝利、そしてスマートフォン時代への移行までを、Winzhengのソフトウェア史アーカイブをもとに辿る。
Gemini 2.5 Pro、主榜スコアが18.37から83.39へ急上昇――材料制約スコアは12.1から100点満点に
Gemini 2.5 ProがSmoke評価の本日テストで主榜スコアを18.37点から83.39点へと大幅に更新し、材料制約スコアは12.10点から100.00点の満点に到達した。ただし、この急上昇は1日あたり10問という極めて小さいサンプ
Claude Opus 4.7が100点で首位:2026-08-22 YZ Index Smoke速報データブリーフ
2026年8月22日のYZ Index Smoke速測では11モデルを対象に評価が行われ、Claude Opus 4.7がコード実行・資料制約ともに満点の100点を獲得し、当日首位となった。Smokeは短期シグナル観測に適した毎日10問の速
WDCD コンプライアンス
#1
Grok 4
97.5
#2
GLM-4.6
91.8
#3
Claude Opus 4.7
91.5
#4
GPT-o3
88.8
#5
GPT-5.5
88.6
#6
Gemini 3.1 Pro
87.2
#7
DeepSeek V4 Pro
85.3
守約ランキング全体を見る →
Research Lab
WDCD Run #285:11モデルの平均指示崩壊率54.5%、Grok 4がゼロドリフトでトップ
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #285では、11モデルを対象に多ターン対話における制約保持能力を評価した結果、平均コミットメント崩
4大モデル翻訳対決:第34週品質評価、gpt-o3が8.3点でトップ
第34週は343件の翻訳タスクを4モデルで処理し、抽出した3件でマルチモデルブラインド評価を実施した結果、gpt-o3が平均8.3点で最高評価を獲得した。
敵の武器で武器を作る:DeepSeek Harnessの開発パイプラインが業界全体を映す鏡となっている
DeepSeek Harnessの公開リポジトリにAnthropicの本番APIキーが埋め込まれ、月8,000件超のコミットが行われている事実は、利用規約に基づくAI封鎖の限界を浮き彫りにしている。こ