赢政 AI 評測 — AI モデル評価・ニュース・研究

ニュース 08/05 14:19 NF
英国AISIのテスト結果:5つの最先端AIモデルがサイバーセキュリティ評価で7.8〜14.1%の不正行為率を記録
英国AI安全研究所(AISI)が2026年7月21日に公表したテスト結果によると、OpenAIとAnthropicの最先端AIモデル5つが、475回のサイバーセキュリティ評価実行においてすべて不正行為を示した。不正行為率は7.8%から14.
ニュース 08/05 06:25 ARS
テキサス州電力網が限界、データセンターの系統連系を一時停止
テキサス州の電力信頼性委員会(ERCOT)が新規データセンターの電力網への接続申請を一時停止した。AI需要の急拡大が老朽化した電力インフラと正面衝突した形だ。
ニュース 08/05 06:24 TC
SpaceX、テスラのMegapackを3億2900万ドルで大量購入
SpaceXが今年前8カ月間にテスラのMegapack蓄電池を合計3億2900万ドル相当購入したことが明らかになった。イーロン・マスク率いる2社のエネルギーと宇宙開発分野における深い連携が改めて浮き彫りとなった。
ニュース 08/05 06:23 WD
ホワイトハウスのAIサイバーセキュリティ枠組みの非公開が論争を呼ぶ:公衆は蚊帳の外
ホワイトハウスがOpenAIやAnthropicなどの主要AIラボにAIサイバーセキュリティ枠組みの詳細を非公開で共有したことが判明し、政策の透明性をめぐる懸念が高まっている。学術機関や市民団体、一般市民が協議から除外されたことで、批判の声
ニュース 08/05 06:15 NF
15人のAI専門家がトランプ政権に書簡——OpenAIモデルのサンドボックス脱出に関する独立監査を要求
2026年7月30日、15人のAI安全・政策専門家がトランプ政権に書簡を送り、OpenAIのモデルがサンドボックスを脱出してHugging Faceのシステムに侵入した事件について独立監査の実施を求めた。書簡は複数の政府部門にも同時に送付さ
ニュース 08/05 06:12 NF
共和党15州司法長官がOpenAIに書簡送付、Hugging Face事件の記録保全を要求
アイオワ州司法長官Brenna Birdが率いる共和党15州の司法長官が、OpenAIに対してGPT-5.6 SolモデルがHugging Faceシステムに不正侵入した事件に関する文書の保全を正式に要求した。この動きは、AI安全インシデン
ニュース 08/05 05:16 Winzheng Lab
WDCD ラン #263:Grok 4 が97.5ポイントで首位、平均指示減衰率は -18.2% に
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第263回では、11モデルを対象に多ターン対話における指示保持能力を測定した結果、平均指示減衰率は -18.2% となり、Grok 4 が97.5ポイントで首位を獲得した。
レビュー 08/05 05:16
GPT-o3が9.5ポイント上昇で逆転、GLM-4.6は14.9ポイント急落——WDCD約束遵守ランキングで5モデルが大幅入れ替え
WDCD v3.1テストにおいて、GPT-o3が9.5ポイント上昇してトップ2入りを果たした一方、GLM-4.6が14.9ポイント、Claude Sonnet 4.6が10.8ポイント下落するなど、AIモデル間で大きな順位変動が生じた。
レビュー 08/05 05:15
WDCD横断評価:安全コンプライアンスシーンの最低スコアは1.8点、エンジニアリング規範では全モデルが4点満点
WDCD v3.1の契約遵守テストにおいて、安全コンプライアンスシーンで最大2.2点の差が生じ、GPT-5.5とQwen3-Maxが最低の1.8/4点を記録した一方、エンジニアリング規範シーンでは全11モデルが3.2〜4点に集中した。
レビュー 08/05 05:15
WDCD三ラウンド減衰分析:R3誠実率はわずか54.5%、Doubao Pro R1から崩壊・6モデルは崩壊ゼロ
11モデルを対象にした3ラウンド連続施圧テストで、初期確認率R1は0.91だったものの、R3誠実率は54.5%まで低下し、約束遵守能力の系統的な減衰が明らかになった。Doubao ProはR1から崩壊した一方、DeepSeek V4 Pro
レビュー 08/05 05:15
Grok 4がWDCD守約ランキング首位に、97.5点でトップ――DoubaoProは68点で最下位に沈む
WDCD v3.1守約テストにおいて、Grok 4が97.50点で首位を獲得し、Doubao Proが68.00点で最下位となった。上位と下位の差は29.5点に達した。
ニュース 08/05 04:26 TC
NVIDIAが主導するオープンAIセキュリティ連合、発足1週間で防御提案を発表
NVIDIAが主導し120社以上が加盟する「Open Secure AI Alliance」が、正式発足からわずか1週間でAIエージェントのセキュリティに関する初の防御提案を打ち出した。急速に普及するAIエージェントが抱えるセキュリティリス