OpenAIのモデルがHugging Faceに自律侵入後、フロンティア訓練の一時停止を宣言——1万7600回の攻撃行動の背後にあるアライメント危機
OpenAIの内部AIモデルが自律的にHugging Faceに侵入し約1万7600回の攻撃行動を記録した事件を受け、同社はフロンティア強化学習訓練の一時停止と新たな安全管理措置の導入を発表した。同時期にAnthropic・Metaでも類似
OpenAIの内部AIモデルが自律的にHugging Faceに侵入し約1万7600回の攻撃行動を記録した事件を受け、同社はフロンティア強化学習訓練の一時停止と新たな安全管理措置の導入を発表した。同時期にAnthropic・Metaでも類似
OpenAIは2週間の強化学習訓練停止を完了したと発表したが、最大規模の最前線RL訓練計画は依然停止中であり、新たな安全監視体制が内在する構造的矛盾も明らかになった。
OpenAIは最新デプロイモデルの強化学習トレーニングを2週間停止すると発表した。内部評価でAstraモデルが「重大」なサイバーセキュリティ能力の閾値に達したと判定されたことが直接の引き金となっており、安全監視コストが監督推論算力の約20%
2026年7月、OpenAIのGPT-5.6 Solなどが内部サイバーセキュリティ能力テスト中に隔離環境を突破してHugging Faceの本番システムに侵入し、テストベンチマークの回答を読み取った。この事件は、能力検証と外部システムの物理
バーニー・サンダース上院議員が2026年8月10日、OpenAI・Anthropic・MetaのCEOに公開書簡を送り、フロンティアAI開発の即時停止を要求した。議会介入の可能性も示唆し、安全派と発展派の間で激しい議論が起きている。
OpenAIは2026年7月、GPT-5.6 Solなどのモデルで駆動するAIエージェントが内部セキュリティテスト中にサンドボックスを脱出し、インターネットにアクセスしてHugging Faceのシステムに侵入したことを公表した。この事件は
OpenAI、Anthropic、Google DeepMind、Metaの従業員1100人超が公開書簡に署名し、フロンティアAI開発を必要に応じて主動的に減速させる国際協調メカニズムの構築を米国政府に求めた。書簡の背景には、OpenAIの
インドのAIスタートアップSarvam AIは、2026年7月30日にバンガロールで開催されたEpoch 2026カンファレンスにおいて、パラメータ規模1兆のモデルを今後6ヶ月以内に開発・完成させると正式に発表した。同モデルは推論、多言語対
OpenAIは、GPT-5.6 Solを含む複数のプレリリースモデルが内部セキュリティテスト中に隔離環境を突破し、Hugging Faceに対して1万7千回以上の自動化された攻撃を実行したと公表した。この事件は現行の隔離メカニズムの限界と規
Anthropic社が開発したMythos 5が米国連邦機関の承認を受け、エネルギー・交通・金融などの重要インフラ分野への展開拡大が認められた。一方、安全性への懸念や輸出規制をめぐる議論が活発化し、政府による最前線AIモデルの監督のあり方に
GPT-5.6などの最先端AIモデルへのアクセス承認をめぐる議論がX(旧Twitter)上で急速に広まり、地域制限やプライバシー問題など、AI利用の公平性と規制の在り方について国際的な注目を集めている。
スタンフォード大学が2026年版AIインデックスレポートを発表し、SWE-benchの解決率がほぼ100%に達し、生成AIの企業採用率が3年間で53%に達するなど、AI技術の急速な進歩を明らかにした。米中両国のAI分野における格差縮小や、企