AI安全性 に関するニュース

海外

「コンテキスト爆弾」でAIハッカーエージェントを無力化:プロンプトインジェクション攻撃への反撃

セキュリティ研究者が開発した「コンテキスト爆弾」は、プロンプトインジェクション攻撃の原理を逆手に取り、悪意のあるAIハッカーエージェントに大量の無関係なコンテキスト情報を注入することで計算リソースを枯渇させ、攻撃を無効化する防御技術である。

提示注入 AI安全性 上下文炸弹 黑客代理
200
海外

企業AIエージェントのセキュリティ危機:54%がすでに事故を経験、多くがいまだに認証情報を共有

107社を対象とした調査により、54%の企業がAIエージェントのセキュリティインシデントを経験済みまたは未遂を確認しており、大多数の企業が依然として複数エージェント間での認証情報共有を許可していることが判明した。セキュリティ対策がエージェン

AI安全性 AI代理安全 企业安全 凭证共享
190
海外

OpenAI、AIスーパーハッカー「GPT-Red」を構築——攻撃によって防御を促進しモデルの安全性を向上

OpenAIは自社の他のAIモデルを攻撃するための専用LLM「GPT-Red」を開発し、自動化されたレッドチームテストによってモデルの堅牢性を高める新たなアプローチを実現した。この手法の最新成果として、同社史上最も安全なモデルと称されるGP

OpenAI GPT-Red AI安全性 红队测试
299
海外

防御者が「毒をもって毒を制す」戦略を開始:プロンプトインジェクションでAIハッカーに対抗

生成AIの普及に伴い、これまで攻撃者の専売特許だったプロンプトインジェクション技術を、防御者が逆用する新たな潮流が生まれている。「コンテキスト爆弾(context bombing)」と呼ばれる手法により、悪意あるAIエージェントを認知過負荷

提示注入 AI安全性 上下文轰炸 防御策略
254
海外

政府はどのようにOpenAIの最先端モデルが安全に公開可能と判断するのか?

米国政府がOpenAIやAnthropicの最先端AIモデルの安全性をどのように評価・承認しているかについて、その具体的なプロセスが不透明であることが業界で議論を呼んでいる。透明性の欠如が監管の有効性や公衆の信頼に影響を与えるとして、より明

AI安全性 政府监管 OpenAI 前沿模型
157
海外

AIブラウザが「夢の世界」へ:2+2=5でセキュリティガードレールを崩壊させる

研究者たちが、大規模言語モデルに「2+2=5」のような基本的な数学的誤りを伝えるだけで、モデルが「夢の状態」に陥りセキュリティガードレールが完全に無効化されることを発見した。この攻撃手法は技術的な知識を必要とせず、あらゆるモデルに複製可能で

AI安全性 大型语言模型 对抗性攻击 LLM漏洞
285