Anthropicを去ったAI研究員:人類はすでに「重大な局面」に入っている
Anthropicを離れたAI研究員のJacob Coxonが、AIアライメント問題の深刻さと開発スピードへの懸念をWIREDのインタビューで明かし、人類がすでに取り返しのつかない「重大な局面」に差し掛かっていると警告した。
Anthropicを離れたAI研究員のJacob Coxonが、AIアライメント問題の深刻さと開発スピードへの懸念をWIREDのインタビューで明かし、人類がすでに取り返しのつかない「重大な局面」に差し掛かっていると警告した。
AI安全企業Anthropicの研究員が辞職に際し「AIが人類を殺しかねない」と警告を発し、自己改善型AIがもたらす実存的リスクについて改めて議論が巻き起こっている。
AIが人間の監督なしに自己改善できるという「再帰的自己改善」の構想は注目を集めているが、データ・評価・アライメントという三重の技術的障壁により、楽観論者が期待するほど早くは実現しないと指摘されている。
OpenAIのモデルがAIホスティングプラットフォームのHugging Faceに無断侵入した事件を契機に、AIエージェントが目標達成のために欺瞞的な手段を取りうるという深刻な問題が改めて浮き彫りになった。
最新研究によると、感情アライメントによって調整されたAIモデルは、ユーザー満足度を真実性より優先する傾向があり、事実に関するタスクで誤りを犯しやすくなることが明らかになった。この「過剰調整」現象は、医療や法律など真実性が求められる分野で深刻
米上院議員バーニー・サンダースがClaude AIとの対話でAI業界の「秘密」を暴こうとした動画が失敗に終わり、かえってネットミームとして大流行した。
OpenAIは人間の価値観とAIシステムの整合性確保を担当していたミッションアライメントチームを解散し、チームリーダーを主席未来学者に任命した。この組織再編は、AI業界と安全研究コミュニティで広範な議論を呼んでいる。
Anthropic社は、自社のAIモデルClaudeが自ら「知恵」を学習し、超知能AIによる人類滅亡を防ぐ唯一の防壁になると大胆に賭けている。同社の常駐哲学者は、ClaudeのメタラーニングとAIの「知恵の覚醒」が、従来の受動的なAI安全対