热点事件持续更新
AI安全机制依赖拒绝指令,被指能力增长抵消防护
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
多家AI公司把"拒绝回答"训练成模型的核心安全机制,通过红队测试、模型互训和多层防御让模型拒绝有害请求。然而Anthropic、OpenAI等公司的前员工指出,最新模型在网络入侵、制造生物病原体等方面的能力与拒绝机制同步增长,机制本身是概率性的而非绝对的,作恶者已经多次成功绕过。该报道对当前把"说不了"视为可靠防线的做法提出质疑,指出能力提升正在抵消拒绝机制带来的安全保障。
AI 根据报道生成 · 2 小时前更新
最新进展10月9日 17:00
前员工披露模型有害能力与拒绝机制同步增长,绕过案例频发,质疑以拒绝回答为核心的防线可靠性。报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- MIT Technology Review · AI我们对 AI 说"不"的能力寄予了过多信任
AI 公司普遍把"拒绝回答"训练成模型的安全核心机制,用红队测试、模型互训和多层防御让模型拒绝有害请求,但 Anthropic、OpenAI 等公司的前员工指出,最新模型在网络入侵和制造生物病原体等方面的能力与拒绝机制同步增长,机制本身是概率性的,作恶者已经多次绕过。
本事件热度走势
当前热度 9·可比范围峰值 10(10月9日 18:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。