Unbug 一分钟读论文· unbug·2026-10-10 08:00· 2 天前AI 评分49南加州大学预印本审计七款开源闸门模型:改一个选项名即可绕过安全拦截一分钟读论文:《改一个选项的名字就能打开安全闸门》AI 导读南加州大学预印本审计了七款被用作 Agent 闸门的类型化决策模型,在提示注入、越狱、有毒内容三类筛查任务上的放行-拦截决策准确率仅为 36% 到 72%,低于 50% 随机水平。来源:Unbug 一分钟读论文 · unbug.github.io#论文/研究#安全/对齐#Agent查看事件全部后续