海外 AIが「ノー」と言う能力を過信するな:アライメント言説の神話 AIが有害なリクエストを「拒否する」能力は安全性の指標として広く期待されているが、モデルの拒否は人間の道徳的判断ではなく条件反射的な統計パターンに過ぎず、真の安全はシステムレベルの構造的制約によって実現されるべきだと論じる。 AI对齐 AI安全性 拒绝式对齐 大模型越狱 4時間前 75