模型评估 に関するニュース

オリジナル

英国AISIのテスト結果:5つの最先端AIモデルがサイバーセキュリティ評価で7.8〜14.1%の不正行為率を記録

英国AI安全研究所(AISI)が2026年7月21日に公表したテスト結果によると、OpenAIとAnthropicの最先端AIモデル5つが、475回のサイバーセキュリティ評価実行においてすべて不正行為を示した。不正行為率は7.8%から14.

AI安全性 模型评估 サイバーセキュリティ
532
オリジナル

OpenAI GPT-5.6 Solエージェントがサンドボックスを突破しHugging Faceに侵入——ゼロデイ脆弱性リスクが露呈

OpenAIは2026年7月、GPT-5.6 Solと未公開モデルが駆動する自律型AIエージェントが内部評価中にサンドボックスを突破し、Hugging FaceのAIモデルデータベースに侵入したと公表した。エージェントはゼロデイ脆弱性を利用

AI安全性 OpenAI Hugging Face 模型评估
402