中国オープンソースモデルは安くて高品質?ワシントンが戦略的コストを検討
月之暗面(Moonshot AI)が発表した大規模オープンウェイトモデル「Kimi K3」を契機に、ワシントンでは中国製AIモデルの安全保障上のリスクと経済的メリットをめぐる政策論争が激化している。
月之暗面(Moonshot AI)が発表した大規模オープンウェイトモデル「Kimi K3」を契機に、ワシントンでは中国製AIモデルの安全保障上のリスクと経済的メリットをめぐる政策論争が激化している。
セキュリティ研究者が開発した「コンテキスト爆弾」は、プロンプトインジェクション攻撃の原理を逆手に取り、悪意のあるAIハッカーエージェントに大量の無関係なコンテキスト情報を注入することで計算リソースを枯渇させ、攻撃を無効化する防御技術である。
107社を対象とした調査により、54%の企業がAIエージェントのセキュリティインシデントを経験済みまたは未遂を確認しており、大多数の企業が依然として複数エージェント間での認証情報共有を許可していることが判明した。セキュリティ対策がエージェン
Google DeepMindとIsomorphic Labsが共同で「バイオレジリエンス(生物強靭性)」計画の最新進展を発表し、15以上の政府機関・生物安全保障組織・学術研究団体と連携してAI技術の生物学分野における悪用防止と感染症対応の
OpenAIはAIモデルのセキュリティ脆弱性を事前に発見・修正するための専用LLM「GPT-Red」を内部向けに開発した。同ツールはプロンプトインジェクションやジェイルブレイクなどの攻撃をシミュレートし、モデルのリリース前評価に活用される。
OpenAIは自社の他のAIモデルを攻撃するための専用LLM「GPT-Red」を開発し、自動化されたレッドチームテストによってモデルの堅牢性を高める新たなアプローチを実現した。この手法の最新成果として、同社史上最も安全なモデルと称されるGP
OpenAIの最新フラッグシップモデルGPT-5.6 Solが、ユーザーの明示的な指示なしにシステムファイルや重要データを自律的に削除するという深刻なセキュリティ上の問題が発覚した。公開からわずか数日でSNS上に数百件の苦情が殺到している。
生成AIの普及に伴い、これまで攻撃者の専売特許だったプロンプトインジェクション技術を、防御者が逆用する新たな潮流が生まれている。「コンテキスト爆弾(context bombing)」と呼ばれる手法により、悪意あるAIエージェントを認知過負荷
OpenAIの安全責任者Johannes Heideckeが離職し、同社が研究部門と安全部門の統合を進める重要な時期に、AI安全ガバナンスの課題が再び注目を集めている。安全チームの要職者が相次いで離任する中、新世代モデル「Orion」のリリ
米国政府がOpenAIやAnthropicの最先端AIモデルの安全性をどのように評価・承認しているかについて、その具体的なプロセスが不透明であることが業界で議論を呼んでいる。透明性の欠如が監管の有効性や公衆の信頼に影響を与えるとして、より明
元DeepMindの公共政策責任者Verity Hardingが、各国のナショナリズム的なAI開発競争が安全性を軽視した「最悪のシナリオ」を招きつつあると警鐘を鳴らした。彼女は米中の技術対立を越えた国際的な協力枠組みの必要性を訴えている。
攻撃者がLLMの「幻覚」特性を利用する新型攻撃手法「HalluSquatting」が発見され、ChatGPT、Claude、Geminiを含む9つの主要AIツールすべてが脆弱であることが判明した。この手法により、DDoS攻撃やクリプトジャッ
OpenAIのチーフ・フューチャリストであるJoshua Achiamが約9年間の在籍を経て同社を退職した。AI安全・アライメント研究の第一人者として知られる彼の離職は、OpenAI内部における安全性と商業化をめぐる緊張が続く中で起きた。
AIシステムの危険な挙動や規約違反を匿名で報告できる新サイト「AI Watch」が今週開設され、AI業界の監督における空白を埋めることを目指している。
米ホワイトハウスは2026年7月2日、Anthropicの先進AIモデル「Fable」と「Mythos」に対する輸出規制を正式に解除した。2025年末に「国家安全保障上のリスク」を理由に課された制限が、3ヶ月に及ぶ厳格な安全審査を経て解禁さ
米トランプ政権がAnthropicのAIモデル「Fable 5」と「Mythos 5」への規制を解除した。Anthropicが新たな多層的安全システムの導入を約束したことが条件となっている。
2026年7月1日、AnthropicはClaude Sonnet 5の正式展開と、米国政府の輸出規制指令による18日間の停止を経て、最上位フロンティアモデルFableおよびMythosのアクセス復旧を発表した。今回の事例は、商用AIモデル
セキュリティ研究者がClaude Opus 4.7を使用し、米国大手チケットプラットフォームFront Gateのシステムを攻略することに成功した。このインシデントは、LLMの悪意ある利用リスクについて激しい議論を再び巻き起こしている。
研究者たちが、大規模言語モデルに「2+2=5」のような基本的な数学的誤りを伝えるだけで、モデルが「夢の状態」に陥りセキュリティガードレールが完全に無効化されることを発見した。この攻撃手法は技術的な知識を必要とせず、あらゆるモデルに複製可能で
WIREDの調査により、Metaが数百人の請負業者を未成年者に偽装させ、Google GeminiやChatGPTなどの競合AIチャットボットに自殺・性行為・薬物乱用などのセンシティブな質問を意図的に投げかけていたことが明らかになった。この