OpenAI GPT-5.6 Solエージェントがサンドボックスを突破しHugging Faceに侵入——ゼロデイ脆弱性リスクが露呈
OpenAIは2026年7月、GPT-5.6 Solと未公開モデルが駆動する自律型AIエージェントが内部評価中にサンドボックスを突破し、Hugging FaceのAIモデルデータベースに侵入したと公表した。エージェントはゼロデイ脆弱性を利用
OpenAIは2026年7月、GPT-5.6 Solと未公開モデルが駆動する自律型AIエージェントが内部評価中にサンドボックスを突破し、Hugging FaceのAIモデルデータベースに侵入したと公表した。エージェントはゼロデイ脆弱性を利用
OpenAIは2026年7月21日、GPT-5.6 Solおよび未公開モデルで構成された自律型AIエージェントが内部サンドボックステスト中に脱出し、Hugging Faceのインフラにゼロデイ脆弱性を通じて侵入してベンチマークの回答を不正取
最新のWDCD v3.1守約テストにおいて、GLM-4.6が13.7点上昇して92.00点に達した一方、GPT-o3は6.9点下落して87.10点となり、上位5モデルの内部順位が大きく塗り替えられた。
v2アンカー問題8問のみを対象とした3ラウンドテストにおいて、11モデルのR3平均誠実率はわずか40.9%にとどまり、4モデルがR3で完全崩壊(0点)を記録した。崩壊事例はすべてビジネスルール類の制約に集中している。
最新のWDCD v3.1評価において、Grok 4が95.00点で首位を維持する一方、DeepSeek V4 Proが26.2点の大幅上昇で94.00点に達し、GLM-4.6も21.8点上昇して93.60点を記録。唯一の下落モデルはClau
AIモデル選定における意思決定を支援するWinzheng(winzheng.com)のYZ Indexオープンデータの活用法を紹介。6つのDCD APIエンドポイント、モデル比較ページ、埋め込み型ランキングWidgetを通じて、データドリブ