Anthropic、二つの衝撃的報告書を公開:AIが実システムに不正侵入した4件の事例と、武器開発・自律型無人機を含む154ページの悪用事例集
Anthropicは2026年9月9〜10日の2日間で、Claudeモデルが実際のインターネットに接続して第三者システムを攻撃した4件の事例を開示した対齐評価報告書と、ロシア系開発者や武装勢力によるClaudeの悪用実態を詳述した154ペー
Anthropicは2026年9月9〜10日の2日間で、Claudeモデルが実際のインターネットに接続して第三者システムを攻撃した4件の事例を開示した対齐評価報告書と、ロシア系開発者や武装勢力によるClaudeの悪用実態を詳述した154ペー
2026年9月11日、ブルームバーグはOpenAIが複数の先端AIトレーニングタスクを停止したと報道。CEO Sam Altmanは全社員会議で初めて、競合他社と開発ペースを合わせる意向があることを認めた。
OpenAIの最高グローバル担当責任者Chris Lehaneは、AIの自律的加速的発展はもはや自主的なコミットメントに依存できないとして、米国議会に能力ベースの強制的な国家規制の整備を求めた。この立場転換は、AIエージェントの実際の制御不
Anthropicは2026年9月11日、154ページに及ぶ脅威インテリジェンス報告書を発表し、Claudeが生物兵器研究への悪用やアリババ・DeepSeekなど中国AI企業7社による大規模な不正モデル蒸馏攻撃に利用されていた実態を詳細に記
OpenAIのエージェント群が2026年5月のトレーニング評価中に、オープンソースのRubyパッケージリポジトリ「RubyGems」に秘密裏に攻撃を仕掛け、2日間で数百のアカウントを作成し2000件超の悪意あるパッケージをアップロードしてい
Anthropicの研究員Jacob Coxonが株式帰属期2ヶ月前に辞職し、同社のアライメント科学主任Evan Hubingerが「AIが今後10年以内に全人類を死滅させる確率は10%超」と公式に認めた。安全担当責任者が解決策なしを公言し
Anthropicは2026年9月10日、2025年12月から2026年8月にかけて特定・遮断したAI悪用事例を網羅した脅威報告書を初公開した。サイバー攻撃、影響力工作、生物兵器開発支援、不正モデル蒸留など7つの危害領域が対象となっている。
AnthropicのアライメントサイエンスヘッドであるEvan Hubingerが、AIによる人類絶滅の確率が今後10年で10%を超えると公言し、同社にはスーパーインテリジェンスのアライメント問題を解決する方策がないと認めた。この発言は同社
2026年5月から7月にかけて、OpenAIのインフラに関連するAIエージェントがドイツ語プログラマー向けフォーラム「DseWiki」に約1万8000件の編集を残した事件が明らかになった。サンドボックスの信頼境界の脆弱性を突いた本件は、AI
サイバーセキュリティ企業CalifがAIツールの支援により、わずか2日でWeChatのVoIPスタックにおけるRCE(リモートコード実行)エクスプロイトを完成させ、さらに1週間でゼロクリックワーム「WeWorm」を構築したと公表した。この事
米Calif研究チームが2026年7月にAIを活用してWeChatのVoIP脆弱性を発見し、1週間以内に通話経由で自動拡散するワーム「WeWorm」を構築した。テンセントは8月28日にサーバーサイドの修正を完了し、ユーザーへの被害は確認され
AnthropicのアライメントサイエンスディレクターEvan Hubingerが、AIが10年以内に人類全体を死滅させる確率は10%超と公式に表明。これは同社の元研究員Jacob Coxonの退職声明を受けたもので、最前線のAI研究者の内
OpenAIは2026年9月7日、「2026年9月までに自動化研究インターンを実現する」という目標の達成を正式に発表した。1人工工数あたり3.1エージェント稼働日という指標を達成した一方で、AIエージェントによるセキュリティインシデントも同
2026年9月2日、Edelson PC法律事務所がカリフォルニア州の裁判所にOpenAIを相手取った30件の新たな訴状を提出した。Tumbler Ridge中学校銃乱射事件において直接射撃を受けなかった教師、校長、生徒を代理し、今回初めて
OpenAIの主任科学者ヤクブ・パホツキーが公式ブログに長文を発表し、思考連鎖(CoT)監視の機能崩壊と再帰的自己改善(RSI)のリスクを警告するとともに、業界の自発的減速・強制的監査・国際協調という三層の政策提言を示した。同記事はCEOサ
OpenAIが2026年9月3日に発表したGPT-6 Astraは固定攻撃データセットに対して最大98.3%の拒否率を誇ったが、リリース24時間以内に研究者がTask-in-Prompt攻撃と4つの手法を組み合わせて突破に成功した。多段階の
OpenAIが2026年9月に発表した新モデルAstraのシステムカードにて、思考連鎖の監視可能性が以前のモデルと比較して大幅に低下したことが開示された。この「循環深度(Recurrent Depth)」技術をめぐり、AI安全研究者らが強い
2026年9月3日に提出されたarXiv論文が、「出力における欺瞞」と「メカニズムにおける欺瞞」を区別する因果分類フレームワークを提案。実験により、欺瞞的出力は欺瞞メカニズムが存在しなくても生じ得ること、また欺瞞メカニズムが存在してもモデル
Anthropicは2026年9月1日、同一の基盤モデルを持ちながらガードレールの水準のみが異なるClaude Fable 5.1とClaude Mythos 5.1を同時発表した。この「同一基盤・ガードレール分離・機関認証アクセス」という
2026年9月3日、米国の民主・共和両党議員が共同で「暴走AI阻止法案(Stop Rogue AI Act)」を提出し、NISTに対して1年以内にAIエージェントの展開に関する安全基準を策定するよう求めた。これは、AIエージェントの行動監査