跳到正文
原文
Unbug 一分钟读论文· unbug·· 2 天前AI 评分49

南加州大学预印本审计七款开源闸门模型:改一个选项名即可绕过安全拦截

一分钟读论文:《改一个选项的名字就能打开安全闸门》

AI 导读

南加州大学预印本审计了七款被用作 Agent 闸门的类型化决策模型,在提示注入、越狱、有毒内容三类筛查任务上的放行-拦截决策准确率仅为 36% 到 72%,低于 50% 随机水平。

来源:Unbug 一分钟读论文 · unbug.github.io