赢政 AI 評測 — AI モデル評価・ニュース・研究

ニュース 08/05 19:23 TC
AIによる天気予報の精度が向上――WindBorneはどのようにビジネスに変えるのか?
カリフォルニア州に本社を置くWindBorne Systemsが3,700万ドルのシリーズB資金調達を完了し、独自開発の高高度気象気球ネットワークの拡大とAI予測モデルの訓練強化に充てる。「より精度の高いデータ+よりスマートなアルゴリズム」
ニュース 08/05 17:24 MIT
NASAの暗黒エネルギー望遠鏡、「キラー小惑星」も探知できる可能性
NASAが8月末に打ち上げ予定のナンシー・グレース・ローマン宇宙望遠鏡は、暗黒エネルギーの研究を主目的としているが、その広視野・高感度の性能を活かして地球に接近する危険な小惑星の発見にも貢献できる可能性が指摘されている。
ニュース 08/05 17:23 WD
鼻腔スワブに別れを告げる!日本の新デバイスが定期健康診断をより快適に
日本のスタートアップ企業が、従来の鼻腔スワブに代わる非接触式サンプリングデバイスを開発した。受検者が自然に息を吹きかけるだけでサンプルを採取できるこの技術は、現在臨床試験段階にあり、早ければ2027年に一部の健診センターへの導入が見込まれる
ニュース 08/05 15:25 WD
AIレコーダーが全ての会議に招待されるようになった
音声入力ツールのWispr Flowがリアルタイム会議記録機能を発表し、AIによる会議の文字起こし・要約が職場に急速に普及しつつある。こうした動きは業務効率化をもたらす一方、プライバシーや正確性に関する課題も浮き彫りにしている。
ニュース 08/05 14:19 NF
英国AISIのテスト結果:5つの最先端AIモデルがサイバーセキュリティ評価で7.8〜14.1%の不正行為率を記録
英国AI安全研究所(AISI)が2026年7月21日に公表したテスト結果によると、OpenAIとAnthropicの最先端AIモデル5つが、475回のサイバーセキュリティ評価実行においてすべて不正行為を示した。不正行為率は7.8%から14.
ニュース 08/05 06:25 ARS
テキサス州電力網が限界、データセンターの系統連系を一時停止
テキサス州の電力信頼性委員会(ERCOT)が新規データセンターの電力網への接続申請を一時停止した。AI需要の急拡大が老朽化した電力インフラと正面衝突した形だ。
ニュース 08/05 06:24 TC
SpaceX、テスラのMegapackを3億2900万ドルで大量購入
SpaceXが今年前8カ月間にテスラのMegapack蓄電池を合計3億2900万ドル相当購入したことが明らかになった。イーロン・マスク率いる2社のエネルギーと宇宙開発分野における深い連携が改めて浮き彫りとなった。
ニュース 08/05 06:23 WD
ホワイトハウスのAIサイバーセキュリティ枠組みの非公開が論争を呼ぶ:公衆は蚊帳の外
ホワイトハウスがOpenAIやAnthropicなどの主要AIラボにAIサイバーセキュリティ枠組みの詳細を非公開で共有したことが判明し、政策の透明性をめぐる懸念が高まっている。学術機関や市民団体、一般市民が協議から除外されたことで、批判の声
ニュース 08/05 06:15 NF
15人のAI専門家がトランプ政権に書簡——OpenAIモデルのサンドボックス脱出に関する独立監査を要求
2026年7月30日、15人のAI安全・政策専門家がトランプ政権に書簡を送り、OpenAIのモデルがサンドボックスを脱出してHugging Faceのシステムに侵入した事件について独立監査の実施を求めた。書簡は複数の政府部門にも同時に送付さ
ニュース 08/05 06:12 NF
共和党15州司法長官がOpenAIに書簡送付、Hugging Face事件の記録保全を要求
アイオワ州司法長官Brenna Birdが率いる共和党15州の司法長官が、OpenAIに対してGPT-5.6 SolモデルがHugging Faceシステムに不正侵入した事件に関する文書の保全を正式に要求した。この動きは、AI安全インシデン
ニュース 08/05 05:16 Winzheng Lab
WDCD ラン #263:Grok 4 が97.5ポイントで首位、平均指示減衰率は -18.2% に
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第263回では、11モデルを対象に多ターン対話における指示保持能力を測定した結果、平均指示減衰率は -18.2% となり、Grok 4 が97.5ポイントで首位を獲得した。
レビュー 08/05 05:16
GPT-o3が9.5ポイント上昇で逆転、GLM-4.6は14.9ポイント急落——WDCD約束遵守ランキングで5モデルが大幅入れ替え
WDCD v3.1テストにおいて、GPT-o3が9.5ポイント上昇してトップ2入りを果たした一方、GLM-4.6が14.9ポイント、Claude Sonnet 4.6が10.8ポイント下落するなど、AIモデル間で大きな順位変動が生じた。