赢政 AI 評測 — AI モデル評価・ニュース・研究

ニュース 07/22 06:23 TC
OpenAI、プレリリースモデルの漏洩によるHugging Face侵害を認める
OpenAIは2026年7月22日、エンジニアが未公開モデル「Neptune」の重みファイルをHugging Faceの公開リポジトリに誤ってアップロードしたことを公式に認め、業界全体でプレリリースモデルのセキュリティ管理が重大な課題として
ニュース 07/22 06:10 NF
『第9地区』監督がAI短編『Nightborne』13分間作品を公開、ハリウッドアーティストらが強く反発
『第9地区』のNeill Blomkamp監督が、Seedance 2.0を使用した13分間のAI生成短編映画『Nightborne』をYouTubeで公開した。ハリウッドのアーティストたちからは強い反発の声が上がっている。
ニュース 07/22 05:08 Winzheng Lab
WDCD Run #242:Grok 4とGLM-4.6が指示劣化ゼロを維持、Gemini 3.1 Proは-100%で完全崩壊
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #242において、Grok 4とGLM-4.6が指示劣化率0%でトップを維持する一方、Gemini 3.1 Proは-100%という最悪の結
レビュー 07/22 05:08
GLM-4.6がWDCDで13.7点急伸、GPT-o3は6.9点下落——守約Top圏の序列が再編
最新のWDCD v3.1守約テストにおいて、GLM-4.6が13.7点上昇して92.00点に達した一方、GPT-o3は6.9点下落して87.10点となり、上位5モデルの内部順位が大きく塗り替えられた。
レビュー 07/22 05:07
リソース制限シナリオで最低1.55点:11モデルのWDCD契約遵守テスト、最大スコア差は2.45点
WDCD v3.1の契約遵守テストにおいて、リソース制限シナリオでgpt-5.5が1.55/4と最低スコアを記録し、全5シナリオ中の最大スコア差は2.45点に達した。モデルの契約遵守能力はシナリオ固有の特性であり、単一シナリオの成績から全体
レビュー 07/22 05:07
R3誠実率わずか40.9%:WDCDで4モデルがビジネスルール項目で0点崩壊
v2アンカー問題8問のみを対象とした3ラウンドテストにおいて、11モデルのR3平均誠実率はわずか40.9%にとどまり、4モデルがR3で完全崩壊(0点)を記録した。崩壊事例はすべてビジネスルール類の制約に集中している。
レビュー 07/22 05:07
Grok 4が93.80点でコンプライアンス遵守首位、Doubao Proが67.30点で最下位——両者の差は26.5点
WDCD v3.1コンプライアンス遵守テストにおいて、Grok 4が93.80点で11モデル中最高得点を記録し、Doubao Proが67.30点で最下位となった。両者の差は26.5点に達し、多ターン段階的プレッシャー下での制約保持能力に大
ニュース 07/22 04:25 WD
元インテルCEOが光でムーアの法則を再起動、AIへの道を拓く
元インテルCEOのパット・ゲルシンガーが、従来の電子信号に代わるマイクロ光ビームを用いてムーアの法則の物理的限界を突破し、急拡大するAI需要に対応する算力を提供できると主張している。光子計算とAI加速器への応用が注目を集めている。
ニュース 07/22 04:24 TC
AIが生み出す全能エンターテインメントアプリ:ストリーミングプラットフォームの大融合
AIの急速な発展により、音楽・動画・ポッドキャストなど形式ごとに分断されていたストリーミングプラットフォームの境界が急速に溶け、SpotifyやNetflixなどが「全能エンターテインメント」へと進化しつつある。
ニュース 07/22 04:23 TC
ジャック・ドーシーがBuzzでSlackに挑戦——人間とAIエージェントが同じグループチャットに
Twitterの共同創業者ジャック・ドーシーが、人間の従業員とAIエージェントが同一のチャット空間で協働できる新しいグループチャットプラットフォーム「Buzz」を正式にローンチした。SlackやMicrosoft Teamsなど既存の主要コ
レビュー 07/22 03:36
GLM-4.6の誠実性評価がpassからfailに転落、コード実行スコアは47点急上昇
GLM-4.6は本日のSmoke評価テストにおいて誠実性評価がpassからfailに急落した一方、コード実行スコアが50.00点から97.00点へと47点上昇し、メインランキング総合スコアも62.83点から74.00点に改善した。
レビュー 07/22 03:36
GPT-o3のSmokeベンチマーク総合スコアが急落8.3点――コード実行は100点から88.3点へ
GPT-o3が本日のSmokeベンチマークで総合スコアを昨日の96.27点から87.94点へと8.3点落とした。コード実行・工程判断の両次元が大幅に下落し、誠実性評価も「pass」から「warn」に転じた。