热点事件观察中
南加大预印本审计开源闸门模型准确率不及随机
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
2026年10月10日报道,南加州大学发布预印本,对七款被用作 AI Agent 安全闸门的类型化决策开源模型进行了审计。审计聚焦三类筛查任务:提示注入、越狱与有毒内容。结果显示,这些模型在放行-拦截决策上的准确率介于 36% 到 72% 之间,其中部分表现低于 50% 的随机水平,且通过简单的选项重命名即可绕过安全拦截。审计揭示了当前将开源分类模型直接用作 Agent 安全防线存在的可靠性风险。
AI 根据报道生成 · 1 天前更新
最新进展10月10日 08:00
审计显示七款开源闸门模型筛查准确率最低仅36%,低于随机水平且可被轻易绕过。报道时间线
沿着报道,了解事件的不同侧面。
10月10日
- Unbug 一分钟读论文南加州大学预印本审计七款开源闸门模型:改一个选项名即可绕过安全拦截
南加州大学预印本审计了七款被用作 Agent 闸门的类型化决策模型,在提示注入、越狱、有毒内容三类筛查任务上的放行-拦截决策准确率仅为 36% 到 72%,低于 50% 随机水平。
本事件热度走势
当前热度 3·可比范围峰值 6(10月11日 05:00)·近 24 小时可比范围变化 -51%
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。