MIT Technology Review · AI· Arthur Holland Michel·· 4 小时前AI 评分40
我们对 AI 说"不"的能力寄予了过多信任
We’re putting too much faith in AI’s ability to say no
AI 导读
AI 公司普遍把"拒绝回答"训练成模型的安全核心机制,用红队测试、模型互训和多层防御让模型拒绝有害请求,但 Anthropic、OpenAI 等公司的前员工指出,最新模型在网络入侵和制造生物病原体等方面的能力与拒绝机制同步增长,机制本身是概率性的,作恶者已经多次绕过。
来源:MIT Technology Review · AI · technologyreview.com