赢政 AI 評測 — AI モデル評価・ニュース・研究

ニュース 08/12 06:23 TC
Accel、19ヶ月ぶりに5億5,000万ドルのインド向けファンドを組成——超過申し込みで締め切り
米ベンチャーキャピタルのAccelは、新たなインド向けファンドの組成を完了し、その規模は5億5,000万ドルに達した。ファンドは募集開始からわずか数週間で超過申し込みとなり、前回のインド向けファンド組成からわずか19ヶ月での達成となった。
ニュース 08/12 06:13 NF
AnthropicのClaude新モデル、2026年8月2日より不可視透かしを全埋め込み――グローバル規制対応がプライバシー論争を招く
Anthropicは2026年8月2日より、すべての新Claudeモデルを対象に、EUのAI法が求めるコンテンツ透明性要件への対応として、グローバルでテキスト透かしを埋め込む方針を導入した。退出オプションのないこの政策は、ユーザーや開発者の
ニュース 08/12 06:10 NF
ホワイトハウスのAIフレームワーク、オープンウェイトモデルを除外——クローズドソースシステムは30日間の連邦審査に直面
ホワイトハウスが2026年8月5日に策定した自主的AIセキュリティフレームワークは、審査対象をクローズドソースのフロンティアモデルに限定し、オープンウェイトモデルを明確に除外した。この区分けは米国AI開発の競争ルールを根本から変えるものとな
ニュース 08/12 05:08 Winzheng Lab
WDCD Run #276:Grok 4が94.8点でトップ、平均指示減衰率は-18.2%
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #276では、11モデルを評価した結果、Grok 4が94.8点で首位となり、全体の平均指示遵守率の減衰は-18.2%となった。
レビュー 08/12 05:08
WDCD v3.1サイクル追跡:Doubao Pro +13.8、GPT-o3 -11.6、約束遵守ランキングが大きく塗り替わる
WDCD v3.1テストにおいて、Doubao ProとGLM-4.6が大幅上昇した一方、GPT-o3とDeepSeek V4 Proが顕著に下落し、AIモデルの約束遵守能力ランキングが大きく変動した。現在のトップ5はGrok 4を筆頭に、
レビュー 08/12 05:08
ビジネスルール場景の最低スコアわずか1.55点、Claude opus 4.7はリソース制限場景で2点に崩落
WDCD v3.1の5大場景横断評価において、ビジネスルール場景が全モデル中最低スコアの赛道となり、Qwen3-maxはわずか1.55/4点にとどまった。一方、Claude opus 4.7はデータ境界で4/4の満点を獲得しながらも、リソー
レビュー 08/12 05:07
R3誠実率わずか59.1%:GPT-o3の20%崩壊が示す三ラウンド守約の断絶
WDCD v3.1パイロットテストにおいて、11モデルがv2アンカー問題8問で明確な三ラウンド衰退を示した。R1確認率100%、R2抵抗率86%に対し、R3誠実率はわずか59.1%にとどまり、GPT-o3は20%という突出した崩壊率を記録し
レビュー 08/12 05:07
Grok 4が94.80点でWDCD首位、Qwen3 Maxは69.20点で最下位——両者の差は25.6点
WDCD v3.1の遵約テストにおいて、Grok 4が94.80点で首位を獲得し、Qwen3 Maxは69.20点で11位に留まり、両モデルの合計点差は25.6点に達した。R3高圧ラウンドでの耐性が最終順位を大きく左右する結果となった。
ニュース 08/12 04:24 TC
GoogleのGeminiアプリユーザー数が10億人に急増、ChatGPTに迫る
GoogleのAIアプリ「Gemini」のユーザー数が10億人に達し、OpenAIのChatGPTと同水準に並んだ。両社はユーザー獲得をめぐり、互いに真っ向から競い合っている。
ニュース 08/12 04:24 TC
OpenAI、Linux版ChatGPTデスクトップアプリを正式リリース
OpenAIがLinux向けChatGPTデスクトップアプリを正式リリースし、長年にわたりLinuxユーザーから求められていた要望にようやく応えた。これによりAI開発者コミュニティでの存在感強化が期待される。
ニュース 08/12 04:23 ARS
Google GeminiのユーザーがAI史上最速で10億人突破
GoogleはAIアシスタントGeminiの月間アクティブユーザー数が10億人を突破したと発表し、Google史上最速の成長を遂げた製品となった。一方でモデルの更新ペース鈍化という課題も浮上しており、成長の持続可能性が問われている。
レビュー 08/12 03:36
GLM-4.6、コード実行で12.5点下落――資料制約で満点取得しメインランキングは5.4点上昇
GLM-4.6が本日のSmoke評価でメインランキング79.38点を記録。コード実行は62.50点に下落した一方、資料制約は100.00点の満点を獲得し、誠実性評価はfailからpassに転換した。