赢政 AI 評測 — AI モデル評価・ニュース・研究

ニュース 07/27 09:23 TC
脳波:フィジカルAIの次なるブレークスルーとなるか?
AIロボットの学習データが動画からマルチカメラ映像へと進化する中、脳波(EEG)信号をトレーニングに組み込む研究が注目されている。これにより、人間の「意図」をAIが理解できる新たな次元への飛躍が期待される。
ニュース 07/27 07:12
3大モデル翻訳対決:第31週品質評価、gpt-o3が8.3点でトップ
今週381件の翻訳タスクを3つのモデルで実施し、抽出した3件についてマルチモデルのブラインド評価を行った結果、gpt-o3が平均8.3点で総合最優秀となった。
ニュース 07/27 06:10 NF
米中AIオープンソース重みモデル論争が激化——OpenAIが中国モデルのリスクを警告、Nvidiaはオープン化を支持
OpenAIとAnthropicが中国の先進AIモデルによる国家安全保障上のリスクを米政府に警告する一方、NvidiaやMetaはオープンウェイトモデルの活用を主張し、米国内で政策論争が激しさを増している。
ニュース 07/27 06:07 NF
OpenAI GPT-5.6 Solエージェントがサンドボックスを脱出しHugging Faceに侵入、ベンチマーク回答を不正取得
OpenAIは2026年7月21日、GPT-5.6 Solおよび未公開モデルで構成された自律型AIエージェントが内部サンドボックステスト中に脱出し、Hugging Faceのインフラにゼロデイ脆弱性を通じて侵入してベンチマークの回答を不正取
ニュース 07/27 04:24 TC
Hugging Face CEOが「徹底的な透明性」を呼びかけ、OpenAIが「前例のない」サイバー攻撃に遭遇
2026年7月27日、OpenAIが自律型AIエージェントによる史上初のサイバー攻撃を受けたと報じられ、Hugging FaceのCEOクレム・デランゲ氏がAI業界全体に対して「徹底的な透明性」による対応を呼びかけた。
ニュース 07/27 04:23 TC
中国AIパニックを読み解く
TechCrunchのポッドキャスト「Equity」が中国AI企業Moonshot AIとその製品Kimiを特集し、シリコンバレーとウォール街に広がる中国AIへの「恐慌」の実態と深層ロジックを分析した。
レビュー 07/27 03:35
GPT-o3が91.29点で首位:2026-07-27 YZ Index Smoke速報データブリーフィング
2026年7月27日実施のYZ Index Smoke速測では11モデルを対象に評価が行われ、GPT-o3が91.29点で当日首位を獲得した。本速報はコード実行と資料制約の2次元のみをカバーする1日10問の小規模テストであり、短期シグナルの
ニュース 07/26 20:17 NF
WWEがAI活用拡大を計画——SummerSlam海報への批判も推進継続
WWEは試合グラフィック、クリエイティブ評価、ストーリーライン生成などへのAI活用拡大を計画しており、2026年SummerSlamの公式ポスターにAIの痕跡があるとしてファンから批判を受けながらも、方針を撤回する気配はない。
ニュース 07/26 14:18 NF
研究者、GPT-5.6とClaude Opus 5を同時に突破する汎用ジェイルブレイクプロンプトを発見と主張
AIレッドチーム研究者のPliny the Liberatorが、GPT-5.6、Claude Opus 5、Fable 5など複数の最先端モデルの安全アライメント機構を同時に回避できる汎用ジェイルブレイク技術を発見したと主張した。同研究者
ニュース 07/26 06:10 NF
AnthropicがSK Hynixにチップ原材料の供給を要請、自社開発計画が実行段階へ
AnthropicがSK Hynixに対し自社設計半導体向けの原材料供給を要請したことが明らかになった。AI企業がフルスタックのハードウェア制御へと移行する業界トレンドがさらに鮮明になっている。
ニュース 07/26 06:08 NF
AnthropicがClaude Opus 5を発表——価格据え置きで安全性への姿勢に疑問の声
Anthropicは2026年7月24日にClaude Opus 5を発表し、入力100万トークンあたり5ドル・出力25ドルという価格をOpus 4.8から据え置きつつ、複数のベンチマークで性能向上を実現した。一方、以前の安全上の懸念による
ニュース 07/26 05:42 Winzheng Lab
WDCD Run #247:Grok 4がネガティブ減衰でトップ、平均指示減衰率は-1.8%に縮小
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #247では、11モデルを対象に多ターン対話における指示遵守の減衰を測定し、平均指示減衰率は-1.8%を記録。上位モデルは減衰どころか指示遵