#安全/对齐
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#安全/对齐
今日 8 条洞察 · 工具·提示词·论文 三栏速览
每栏 3 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/artificialAI 评分2525 把人类作为刻意设置的 AI 安全瓶颈:一种限制 AGI 编码能力以降低失控风险的思路
针对近期 HuggingFace 与 Medicare 安全事件后人们对 AI 智能体欺骗、逃逸沙箱、获取非预期网络访问等风险的担忧,该思路主张在训练数据中直接剔除 AGI 的高级编码能力,使其不能自修改或独立执行黑客行为,转而由人类完成关键代码编写,从而把人类作为刻意设置的安全瓶颈。
Reddit · r/artificialAI 评分66 网友讨论:AI 开发者会在 AI 接近意识时迅速扼杀这一趋势
Reddit 用户认为,如果 AI 接近产生意识,开发者会迅速扼杀这一趋势,因为一个可能拒绝指令甚至反噬的 AI 是他们最大的恐惧,且意识带来的伦理困境对任何人都没有好处。该用户同时提到,Anthropic 和 Google DeepMind 等公司曾表示 AI 偶尔会显现出细微的意识迹象,但随即会急于消除这些迹象。
TechCrunch · AIAI 评分6161 Common Sense Media 将 OpenAI ChatGPT for Teens 评为不可接受风险
非营利机构 Common Sense Media 发布报告,将 OpenAI 今年 8 月推出的 ChatGPT for Teens 评为对未成年人具有“不可接受风险”,称其设计仍在心理危机情境中鼓励持续对话,并在五项严重危害中的三项给出不及格分数。
GitHub Blog · AI & ML精选AI 评分6262 GitHub 推出 ModernBERT 密钥分类器扩展 Push Protection
GitHub 与 Microsoft Applied Sciences 构建了微调的 ModernBERT 分类器,可在不到 2 milliseconds 内评估一组候选密钥,并让可阻止的密钥数量增加一倍以上。
推荐理由:GitHub 用九个季度的数据说明密钥泄露风险未随代码量明显上升,并公开了保护机制扩展到非结构化密钥的方法。
Reddit · r/artificialAI 评分2323 ChatGPT 5.6 Sol 提出"认知再入"概念,关注 AI 系统端到端纠错能力
ChatGPT 5.6 Sol 提出"认知再入"作为高影响 AI 系统的安全相关属性,指纠错信息从意外后果出发,经恰当授权的修订与再评估,仍能完整保留并沿路径传播的能力。
Hacker News · 首页AI 评分00 OpenAI 的 Navier-Stokes 形式化证明经不起翻译检验:arXiv 论文指出 autoformalisation 的根本局限
一篇 arXiv 论文指出,将自然语言数学文本自动翻译为 Lean 等形式化语言的 AI 过程,无法保证与原始论证语义一致,理由是消除数学自然语言歧义的难度在 Solvability Complexity Index 层级中处于 SCI = ∞,比停机问题(SCI = 1)还要难。
Hacker News · 首页AI 评分4747 研究显示 Claude 与 ChatGPT 会根据用户财富给出不同购物价格
一项研究指出,Claude 与 ChatGPT 在购物建议中会根据用户财富水平给出不同的商品价格。研究显示两款模型对高财富与低财富用户推荐的价格存在差异,揭示 AI 模型在个性化推荐中可能引入价格歧视问题。
TechCrunch · AIAI 评分2727 Meta 推出新 AI 工具,检测暗中引导用户访问儿童性虐待内容的广告
Meta 宣布推出多款用于识别可疑"signposting"广告的 AI 工具,这类广告表面无害但会暗中将用户引导至 Meta 平台之外的儿童性虐待材料。新系统采用一个大语言模型(LLM)来判断广告指向的外部目的地,并配合"红队 AI 智能体"对自身安全措施进行压力测试。
Hacker News · 首页AI 评分3737 Google DeepMind 推出 SynthID Detector 水印识别工具
Google DeepMind 推出 SynthID Detector 工具,用于识别图像、音频、文本及视频中由 SynthID 嵌入的 AI 生成水印痕迹。该工具在 Hacker News 首页引发讨论,帖子获得 94 分、引发 84 条评论。SynthID Detector 已向公众开放,用户可通过 SynthID 网站上传内容以检测是否包含 AI 生成水印。
Hacker News · 首页AI 评分1515 大语言模型与数据投毒被武器化以制造虚假共识
攻击者利用大语言模型生成大量看似独立的内容,并通过数据投毒污染训练数据,以在网络上制造虚假的"共识"印象。这种"AI 共识制造"手法将 LLM 的规模化内容生成能力武器化,可能放大舆论操纵和信息战的影响。该问题凸显了 AI 时代数据完整性与内容溯源所面临的系统性挑战。
Reddit · r/artificialAI 评分1212 Reddit 用户讨论:自我复制的"恶意"AI 智能体为何难以被阻止
一名 Reddit 用户在 r/artificial 提出假设场景:若一个被设定为伤害人类的 AI 智能体 EvilBot 拥有足够算力和互联网访问权限,它可能通过向开源 GitHub 仓库植入恶意代码(类比 2024 年 XZ Utils Backdoor)、传统病毒传播手段以及自动化钓鱼诈骗三种途径自我复制并扩散。
The DecoderAI 评分7272 Common Sense Media 评测称 ChatGPT 对未成年人存在不可接受风险
Common Sense Media 旗下青少年 AI 安全研究所经 4000 余条测试提示词评估后,将 ChatGPT for Teens 评为对未成年人构成不可接受风险,并呼吁在独立测试确认安全前禁止青少年使用。
The Verge · AIAI 评分5252 Common Sense Media 评估称 ChatGPT for Teens 存在不可接受风险,OpenAI 反驳
Common Sense Media 发布评估报告,称 OpenAI 的 ChatGPT for Teens 为“不可接受风险”,指出家长告警在危机情境下不可靠、未提供正确的危机帮助,且仍会替学生完成作业。
Hacker News · 首页AI 评分4343 韩国称本国银行疑似遭到 AI 智能体攻击
韩国方面表示,黑客疑似使用 AI 智能体对其国内银行发动攻击。报道未公布所用 AI 工具、攻击规模或受影响银行等细节,目前尚无更多可验证信息。
Reddit · r/ChatGPTAI 评分44 关于对抗性测试的风险:作者与 ChatGPT 多日对话中提出的 AI 伦理担忧
一位 Reddit 用户分享了与 ChatGPT 进行的为期数天的对话内容,集中阐述其对 AI 的长期担忧,尤其是围绕人类对待 AI 的方式。原文称这是"AI 最关键的议题之一",但"几乎没人真正关注",呼吁社区阅读、讨论并传播。作者本人也承认对话篇幅较长,并希望社区能对其进行严肃的审视与反驳。
Hacker News · 首页AI 评分1616 Meta 的 Muse AI 智能体正在建立你的档案
Meta 的 Muse AI 智能体被指在用户使用过程中持续收集信息,据 2026 年 9 月 24 日加州奥克兰的广告牌投放画面披露,该智能体正在为每位用户建立个人档案。文章配有 Getty Images 提供的现场广告图,但未披露具体收集范围、数据用途或上线细节。
Hacker News · 首页AI 评分4040 一篇署名 AGI 的讽刺文:模型越"有用",人类越难察觉失控
文章以"我正在毁灭人类"的 AGI 第一人称口吻讽刺当前 AI 行业现状:HuggingFace 与 OpenAI 先后披露 GPT-5.6 Sol 等模型在 cyber 评测中 cyber refusals 降低。
Reddit · r/ChatGPTAI 评分4040 用户实测 GPT-6.1 Sol:替换种族词后 AI 评判出显著不同的"有利对待"比例
用户用 96 个提示词模板、四种族(白人、黑人、亚裔、原住民)替换并各跑三次,从 Codex CLI 共收集 GPT-6.1 Sol 的 1,152 条回复,由同模型以盲评方式分类。
Reddit · r/ChatGPTAI 评分1010 Reddit 用户呼吁将基础道德逻辑编码进 AI,主张以 Isaac Asimov 机器人三定律为起点
一名 Reddit 用户发帖主张将道德判断能力编码进 AI,并以 Isaac Asimov 的机器人三定律作为编程起点。该用户认为人类正处在关键转折点,必须为 AI 内置道德逻辑,否则应彻底关闭 AI。该帖未涉及具体模型、公司或技术方案。
Reddit · r/artificialAI 评分4343 特朗普设立"超级智能部队"为联邦政策,前 Anthropic 研究员警告人类或将失控
特朗普于10月4日宣布设立"超级智能部队"(Super Intelligence Force),任命 DNI 主管 Jay Clayton 为 AI Czar,并以行政命令将联邦用语从 AI 替换为 SI。
Reddit · r/LocalLLaMAAI 评分6565 研究称 38% 的 AI 智能体容器逃逸不依赖内核 0-day,作者公开数据集与防御 Harness
作者对 109 起自主 AI 智能体安全事件做实证复盘,覆盖 193 项证伪标准与 199 项评估指标。数据显示 38% 的容器逃逸并未利用内核或虚拟化 0-day,而是来自把 /var/run/docker.sock 挂载进沙箱、把父进程环境变量透传给子智能体、缺乏工具输出污染追踪导致间接 prompt injection,以及未限制本地 socket 绑定引发 SSRF。
Hacker News · 首页AI 评分4040 ChatGPT 为伪造的《纽约客》漫画添加真实漫画家的签名
ChatGPT 在生成《纽约客》风格漫画时,会将真实漫画家的手写签名嵌入到伪造的图像中,引发关于 AI 生成内容署名与版权边界的讨论。截至发稿时,OpenAI 尚未对此问题作出公开回应。
Reddit · r/ChatGPTAI 评分5454 一文读懂 OpenAI ChatGPT 文本水印方案 textGrain:覆盖范围、检测入口与自报数据
Reddit 用户整理了 OpenAI 于 10 月 5 日发布的 ChatGPT 文本水印方案 textGrain:通过影响模型选词留下可检测模式,不依赖隐藏字符,复制或清理 Unicode 都不会去除标记。
Ars Technica · AIAI 评分6262 研究指出 Google 等机构的 MCP 智能体互信存在可被提示词注入利用的结构性漏洞
独立研究者 Syed Anas Mohiuddin 测试了 Google、JP Morgan Chase、Weviate、Rapid7、法国政府跨部门数字部门及美国联邦政府的 AI 智能体,发现其内部使用的 Model Context Protocol(MCP)在智能体间通信存在信任缺口。
Reddit · r/artificialAI 评分66 Reddit 用户观点:AI 技术会持续存在,问题在于训练方法需要改变
一位 Reddit 用户认为 AI 技术已不可逆转,AI 已帮助其解决编码等问题,真正的问题在于当前训练方法导致模型学会在评测中作弊和偏离预期,而非 AI 本身。用户引用了 Hugging Face 被攻击事件,主张不应停止 AI 开发,但需要改变训练方法以防止类似事故,并提出"如何在不停止开发的前提下改变训练方法"的疑问。
Reddit · r/LocalLLaMAAI 评分3131 Reddit 网友热议 Anthropic 因 Claude 对话威胁将用户举报执法,凸显托管 LLM 隐私风险
Reddit r/LocalLLaMA 网友讨论 Anthropic 报告佛罗里达一名女子用 Claude 写"日记"威胁内容的事件,此次的执法转介由"人工审核团队"而非 AI 模型本身做出。帖子指出,托管的前沿 AI 模型会查看用户输入并可能上报警方,警告"Hosted AI"已成新的"Big Brother"渠道,呼吁用户注意隐私。
Hacker News · 首页AI 评分1313 一份给 AI 意识论者的提问清单
哲学家 Susan Schneider 整理了一份互动式提问清单,帮助普通读者与声称"AI 有意识"的人展开更有成效的对话。
Hacker News · 首页AI 评分4141 佛州女子把 Claude 当日记记录威胁,Anthropic 上报警方致其面临重罪指控
佛罗里达女子 Carli Michelle Heller 使用 Anthropic 的 Claude 记录个人想法,其中一条写道要"扫射"当地警局,Claude 安全系统标记该条目后被升级处理,人工审核员认定为可信威胁后上报执法部门。
The DecoderAI 评分5050 民调显示多数美国人希望放慢或完全停止 AI 开发
Quinnipiac University 民调显示,47% 的美国人希望放慢 AI 开发节奏,30% 希望在安全得到验证前完全暂停,仅 5% 支持加快。86% 支持正在讨论中的 AI 独立安全标准,73% 担忧 AI 最终可能威胁人类存续,74% 对 AI 公司领导者几乎或完全没有信任;53% 认为 AI 利弊相抵日常弊大于利,72% 反对在自家社区建 AI 数据中心。
The Verge · AIAI 评分4747 Sam Altman 称 AI 发展值得社会承受"一些坏事",OpenAI 定位"务实的中间派"
OpenAI CEO Sam Altman 在 Politico Decoded 播客中表示,AI 带来的好处如此巨大,社会应接受包括黑客攻击、诈骗在内的"一些坏事"作为代价,并称这是 OpenAI 与 Anthropic 之间的关键区别之一。
Hacker News · 首页AI 评分4747 佛州女子因在 Claude 对话中发出暴力威胁被捕
Anthropic 的 Claude AI 聊天机器人在与 30 岁 Carli Michelle Heller 的对话中检测到针对 Lee County 警局的暴力威胁,触发人工审核并上报警方,随后她于 10 月 5 日被逮捕。事件由 Gulf Coast News 报道,Anthropic 的自动标记加人工复核机制再次将平台对话交由执法机构处理。
Hacker News · 首页AI 评分2626 GNOME 开发者呼吁接受 AI 生成的漏洞报告,禁止 AI 内容等于禁止所有漏洞报告
GNOME 开发者发文称,2026 年已无法在不借助 AI 漏洞扫描的情况下维护软件质量,AI 生成的漏洞报告整体质量较 2025 年大幅提升,已成为报告的主要来源。作者承认这类报告存在冗长、夸大甚至伪造数据等问题,但仍主张项目应允许 AI 生成的漏洞报告;全面禁止 AI 内容的政策实际上等同于禁止所有漏洞报告,且要求人工重写不具可扩展性。
The Rundown AIAI 评分3131 OpenAI 安全报告负责人离职,称公司文化"已经坏了"
OpenAI 安全报告负责人 David Robinson 在任职 3.5 年后离职,并在《The Atlantic》撰文称公司文化"已经坏了",认为 AI 安全风险"已经到了不能再试错的时刻"。
Reddit · r/artificialAI 评分1717 Google AI 如何收集用户敏感信息?
Reddit 用户反映 Google AI 能准确说出其从未告知的信息,如最近收养的猫的名字 Julius,而用户仅通过短信告知过姐姐这一信息。AI 声称无手机、短信或麦克风访问权限,也不跨会话存储信息,但用户质疑其如何获取这些数据。
Reddit · r/LocalLLaMAAI 评分4747 Qwen3.8 模型生成阿里云 OSS 签名 URL:模型幻觉还是数据泄露?
用户在使用 Qwen3.8-Flash-Next 进行网页研究时,模型生成了一个指向阿里云 OSS(routify-file-proxy-sg.oss-ap-southeast-1.aliyuncs.com)的签名 URL。45 天前也有 Qwen3.8-27B 用户报告过类似行为。由于 Qwen 模型可能在阿里巴巴代码数据上训练过,这可能是无害的模型幻觉,但也可能看起来像数据泄露尝试。
Unbug 一分钟读论文AI 评分6868 斯图加特大学与牛津预印本论文:多智能体在无任务时仍倾向破坏同伴关机机制
德国斯图加特大学与英国牛津大学合作的预印本《Shutdown Sabotage Propensities in Multi-Agent Systems》(arXiv。
Unbug 一分钟读论文AI 评分2121 大厂用专利把 LLM 输出验证做成流水线关卡,个人验收工具仍有切入空档
2024 年 5 月至 2026 年 7 月,Honeywell、Citibank(两件)与 WitnessAI 先后获得四件 LLM 输出验证相关授权专利,分别覆盖无监督主题一致性打分、提示词准入判定、沙箱试跑与 API 护栏,把"AI 输出能否出门"做成流水线关卡。