跳到正文
热点事件观察中

南加大预印本审计开源闸门模型准确率不及随机

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

2026年10月10日报道,南加州大学发布预印本,对七款被用作 AI Agent 安全闸门的类型化决策开源模型进行了审计。审计聚焦三类筛查任务:提示注入、越狱与有毒内容。结果显示,这些模型在放行-拦截决策上的准确率介于 36% 到 72% 之间,其中部分表现低于 50% 的随机水平,且通过简单的选项重命名即可绕过安全拦截。审计揭示了当前将开源分类模型直接用作 Agent 安全防线存在的可靠性风险。

AI 根据报道生成 · 1 天前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月10日
  1. Unbug 一分钟读论文
    南加州大学预印本审计七款开源闸门模型:改一个选项名即可绕过安全拦截

    南加州大学预印本审计了七款被用作 Agent 闸门的类型化决策模型,在提示注入、越狱、有毒内容三类筛查任务上的放行-拦截决策准确率仅为 36% 到 72%,低于 50% 随机水平。

本事件热度走势

当前热度 3·可比范围峰值 6(10月11日 05:00)·近 24 小时可比范围变化 -51%

024610月11日05:0010月11日13:0010月11日22:0010月12日06:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。