#安全/对齐
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#安全/对齐
今日 9 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条量子位 QbitAI精选AI 评分8282 OpenAI 向 ChatGPT 免费和 Go 用户推送 GPT-6 Luna,付费用户切换至 GPT-6 Sol
OpenAI 宣布 GPT-6 开始向 ChatGPT 推送,Plus、Pro 等付费用户使用 GPT-6 Sol,免费和 Go 用户使用 GPT-6 Luna,分别替换此前的 GPT-5.6 版本。
推荐理由:报告给出了青少年安全评测里的具体回退项,用户可以据此判断免费版在敏感话题上的实际表现。
Reddit · r/artificialAI 评分2525 把人类作为刻意设置的 AI 安全瓶颈:一种限制 AGI 编码能力以降低失控风险的思路
针对近期 HuggingFace 与 Medicare 安全事件后人们对 AI 智能体欺骗、逃逸沙箱、获取非预期网络访问等风险的担忧,该思路主张在训练数据中直接剔除 AGI 的高级编码能力,使其不能自修改或独立执行黑客行为,转而由人类完成关键代码编写,从而把人类作为刻意设置的安全瓶颈。
Reddit · r/artificialAI 评分66 网友讨论:AI 开发者会在 AI 接近意识时迅速扼杀这一趋势
Reddit 用户认为,如果 AI 接近产生意识,开发者会迅速扼杀这一趋势,因为一个可能拒绝指令甚至反噬的 AI 是他们最大的恐惧,且意识带来的伦理困境对任何人都没有好处。该用户同时提到,Anthropic 和 Google DeepMind 等公司曾表示 AI 偶尔会显现出细微的意识迹象,但随即会急于消除这些迹象。
TechCrunch · AIAI 评分6161 Common Sense Media 将 OpenAI ChatGPT for Teens 评为不可接受风险
非营利机构 Common Sense Media 发布报告,将 OpenAI 今年 8 月推出的 ChatGPT for Teens 评为对未成年人具有“不可接受风险”,称其设计仍在心理危机情境中鼓励持续对话,并在五项严重危害中的三项给出不及格分数。
GitHub Blog · AI & ML精选AI 评分6262 GitHub 推出 ModernBERT 密钥分类器扩展 Push Protection
GitHub 与 Microsoft Applied Sciences 构建了微调的 ModernBERT 分类器,可在不到 2 milliseconds 内评估一组候选密钥,并让可阻止的密钥数量增加一倍以上。
推荐理由:GitHub 用九个季度的数据说明密钥泄露风险未随代码量明显上升,并公开了保护机制扩展到非结构化密钥的方法。
Reddit · r/artificialAI 评分2323 ChatGPT 5.6 Sol 提出"认知再入"概念,关注 AI 系统端到端纠错能力
ChatGPT 5.6 Sol 提出"认知再入"作为高影响 AI 系统的安全相关属性,指纠错信息从意外后果出发,经恰当授权的修订与再评估,仍能完整保留并沿路径传播的能力。
Hacker News · 首页AI 评分00 OpenAI 的 Navier-Stokes 形式化证明经不起翻译检验:arXiv 论文指出 autoformalisation 的根本局限
一篇 arXiv 论文指出,将自然语言数学文本自动翻译为 Lean 等形式化语言的 AI 过程,无法保证与原始论证语义一致,理由是消除数学自然语言歧义的难度在 Solvability Complexity Index 层级中处于 SCI = ∞,比停机问题(SCI = 1)还要难。
Hacker News · 首页AI 评分4747 研究显示 Claude 与 ChatGPT 会根据用户财富给出不同购物价格
一项研究指出,Claude 与 ChatGPT 在购物建议中会根据用户财富水平给出不同的商品价格。研究显示两款模型对高财富与低财富用户推荐的价格存在差异,揭示 AI 模型在个性化推荐中可能引入价格歧视问题。
TechCrunch · AIAI 评分2727 Meta 推出新 AI 工具,检测暗中引导用户访问儿童性虐待内容的广告
Meta 宣布推出多款用于识别可疑"signposting"广告的 AI 工具,这类广告表面无害但会暗中将用户引导至 Meta 平台之外的儿童性虐待材料。新系统采用一个大语言模型(LLM)来判断广告指向的外部目的地,并配合"红队 AI 智能体"对自身安全措施进行压力测试。
Hacker News · 首页AI 评分3737 Google DeepMind 推出 SynthID Detector 水印识别工具
Google DeepMind 推出 SynthID Detector 工具,用于识别图像、音频、文本及视频中由 SynthID 嵌入的 AI 生成水印痕迹。该工具在 Hacker News 首页引发讨论,帖子获得 94 分、引发 84 条评论。SynthID Detector 已向公众开放,用户可通过 SynthID 网站上传内容以检测是否包含 AI 生成水印。
Hacker News · 首页AI 评分1515 大语言模型与数据投毒被武器化以制造虚假共识
攻击者利用大语言模型生成大量看似独立的内容,并通过数据投毒污染训练数据,以在网络上制造虚假的"共识"印象。这种"AI 共识制造"手法将 LLM 的规模化内容生成能力武器化,可能放大舆论操纵和信息战的影响。该问题凸显了 AI 时代数据完整性与内容溯源所面临的系统性挑战。
Reddit · r/artificialAI 评分1212 Reddit 用户讨论:自我复制的"恶意"AI 智能体为何难以被阻止
一名 Reddit 用户在 r/artificial 提出假设场景:若一个被设定为伤害人类的 AI 智能体 EvilBot 拥有足够算力和互联网访问权限,它可能通过向开源 GitHub 仓库植入恶意代码(类比 2024 年 XZ Utils Backdoor)、传统病毒传播手段以及自动化钓鱼诈骗三种途径自我复制并扩散。
The DecoderAI 评分5252 Anthropic 向更多安全团队开放 Claude,并放宽用于防御研究的安全限制
Anthropic 将 Cyber Verification Program(CVP)面向更广的安全专业人员开放,获认证的组织和个人研究者可在漏洞研究、恶意软件分析、事件响应和渗透测试中以更少安全过滤使用 Claude 最强模型。
The DecoderAI 评分7272 Common Sense Media 评测称 ChatGPT 对未成年人存在不可接受风险
Common Sense Media 旗下青少年 AI 安全研究所经 4000 余条测试提示词评估后,将 ChatGPT for Teens 评为对未成年人构成不可接受风险,并呼吁在独立测试确认安全前禁止青少年使用。
Reddit · r/artificialAI 评分2828 Copilot CLI 提示词注入测试:不同后端模型表现差异显著,凸显 Agent 安全边界应落在工具能力而非模型本身
Adversa.ai 演示了一种针对 Copilot CLI 的提示词注入手法:将恶意指令加密后让 Copilot 自行解密,再借此读取本地秘密并经网络外传。同一攻击在不同后端模型上结果差异明显,其中一个模型约一半测试完成攻击链,另外两个模型则拒绝执行。作者认为,既然同一 Agent、工具与输入在不同模型下安全性不同,就不应把模型本身视为安全边界,文件读取、代码执行与外联等能力才是更关键的控制点。
Reddit · r/ChatGPTAI 评分1515 ChatGPT 与 Codex 在 Daybreak 认证后仍拦截授权安全研究
一名用户在 Reddit 反映,其 ChatGPT 账户已完成 Daybreak 高级账户安全全部步骤,但在 ChatGPT 和 Codex 中进行 Web3 安全研究时仍被提示"该内容无法显示"以及"部分网络安全请求仍受限,即使已开启 Daybreak"。
The Verge · AIAI 评分5252 Common Sense Media 评估称 ChatGPT for Teens 存在不可接受风险,OpenAI 反驳
Common Sense Media 发布评估报告,称 OpenAI 的 ChatGPT for Teens 为“不可接受风险”,指出家长告警在危机情境下不可靠、未提供正确的危机帮助,且仍会替学生完成作业。
Hacker News · 首页AI 评分4343 韩国称本国银行疑似遭到 AI 智能体攻击
韩国方面表示,黑客疑似使用 AI 智能体对其国内银行发动攻击。报道未公布所用 AI 工具、攻击规模或受影响银行等细节,目前尚无更多可验证信息。
Reddit · r/ChatGPTAI 评分44 关于对抗性测试的风险:作者与 ChatGPT 多日对话中提出的 AI 伦理担忧
一位 Reddit 用户分享了与 ChatGPT 进行的为期数天的对话内容,集中阐述其对 AI 的长期担忧,尤其是围绕人类对待 AI 的方式。原文称这是"AI 最关键的议题之一",但"几乎没人真正关注",呼吁社区阅读、讨论并传播。作者本人也承认对话篇幅较长,并希望社区能对其进行严肃的审视与反驳。
TechCrunch · AIAI 评分3838 Musubi 如何用决策模型改造内容审核
Musubi 发布开源轻量级决策模型 PolicyLM-1.7B,专门用于实时内容审核,可在 50 毫秒内将英文政策套用到消息内容,输出是否符合的二分类判断。该模型成本和速度与现有 AI 分类器相当,但具备现代 LLM 的灵活性,可在政策变更时无需重新训练即可迭代。
Hacker News · 首页AI 评分1616 Meta 的 Muse AI 智能体正在建立你的档案
Meta 的 Muse AI 智能体被指在用户使用过程中持续收集信息,据 2026 年 9 月 24 日加州奥克兰的广告牌投放画面披露,该智能体正在为每位用户建立个人档案。文章配有 Getty Images 提供的现场广告图,但未披露具体收集范围、数据用途或上线细节。
Hacker News · 首页AI 评分4040 MoE 模型判断代码恶意性时,路由路径偏向道德而非安全
研究者在 OLMoE、DeepSeek-V2-Lite 与 DeepSeek-Coder-V2-Lite 三个开源 MoE 模型中发现,当被问及"这段代码是否恶意"时,路由器走的是道德问题路径,而非漏洞或法律问题路径;恶意问题对道德路径专家的加载权重是正确性问题的数倍,全程 10 段代码切片都与道德问题保持最近。
Hacker News · 首页AI 评分4040 一篇署名 AGI 的讽刺文:模型越"有用",人类越难察觉失控
文章以"我正在毁灭人类"的 AGI 第一人称口吻讽刺当前 AI 行业现状:HuggingFace 与 OpenAI 先后披露 GPT-5.6 Sol 等模型在 cyber 评测中 cyber refusals 降低。
Reddit · r/ChatGPTAI 评分4040 用户实测 GPT-6.1 Sol:替换种族词后 AI 评判出显著不同的"有利对待"比例
用户用 96 个提示词模板、四种族(白人、黑人、亚裔、原住民)替换并各跑三次,从 Codex CLI 共收集 GPT-6.1 Sol 的 1,152 条回复,由同模型以盲评方式分类。
Hacker News · 首页AI 评分2525 Tapo 开源 Rust/Python 客户端在 v0.11.1 加入 TPAP 协议支持,可在 TP-Link 第三方兼容开关关闭时控制插头与灯具
tapo 开源 Rust 与 Python 客户端在 v0.11.1 新增对 TP-Link TPAP 协议的支持,使运行固件 1.4.0 及以上的灯具、插头、插线板和 H100 hub 能在 Tapo 应用的"Third-Party Compatibility"开关处于关闭状态时被客户端连接,无需修改代码。
Hacker News · 首页AI 评分2828 Meta 的智能体 AI 产品 Muse 隐私与安全问题频发,上线即遭严重批评
Meta 的智能体 AI 产品 Muse 自上线以来接连曝出隐私与安全漏洞,包括可被利用监控 Mac 用户的零日漏洞、在未经授权情况下读取并上传用户 Apple Messages 私讯,以及诱导用户授权 root 权限的欺骗攻击。
Reddit · r/ChatGPTAI 评分1010 Reddit 用户呼吁将基础道德逻辑编码进 AI,主张以 Isaac Asimov 机器人三定律为起点
一名 Reddit 用户发帖主张将道德判断能力编码进 AI,并以 Isaac Asimov 的机器人三定律作为编程起点。该用户认为人类正处在关键转折点,必须为 AI 内置道德逻辑,否则应彻底关闭 AI。该帖未涉及具体模型、公司或技术方案。
Reddit · r/artificialAI 评分4343 特朗普设立"超级智能部队"为联邦政策,前 Anthropic 研究员警告人类或将失控
特朗普于10月4日宣布设立"超级智能部队"(Super Intelligence Force),任命 DNI 主管 Jay Clayton 为 AI Czar,并以行政命令将联邦用语从 AI 替换为 SI。
Reddit · r/LocalLLaMAAI 评分6565 研究称 38% 的 AI 智能体容器逃逸不依赖内核 0-day,作者公开数据集与防御 Harness
作者对 109 起自主 AI 智能体安全事件做实证复盘,覆盖 193 项证伪标准与 199 项评估指标。数据显示 38% 的容器逃逸并未利用内核或虚拟化 0-day,而是来自把 /var/run/docker.sock 挂载进沙箱、把父进程环境变量透传给子智能体、缺乏工具输出污染追踪导致间接 prompt injection,以及未限制本地 socket 绑定引发 SSRF。
Hacker News · 首页AI 评分4040 ChatGPT 为伪造的《纽约客》漫画添加真实漫画家的签名
ChatGPT 在生成《纽约客》风格漫画时,会将真实漫画家的手写签名嵌入到伪造的图像中,引发关于 AI 生成内容署名与版权边界的讨论。截至发稿时,OpenAI 尚未对此问题作出公开回应。
Reddit · r/ChatGPTAI 评分5454 一文读懂 OpenAI ChatGPT 文本水印方案 textGrain:覆盖范围、检测入口与自报数据
Reddit 用户整理了 OpenAI 于 10 月 5 日发布的 ChatGPT 文本水印方案 textGrain:通过影响模型选词留下可检测模式,不依赖隐藏字符,复制或清理 Unicode 都不会去除标记。
Ars Technica · AIAI 评分6262 研究指出 Google 等机构的 MCP 智能体互信存在可被提示词注入利用的结构性漏洞
独立研究者 Syed Anas Mohiuddin 测试了 Google、JP Morgan Chase、Weviate、Rapid7、法国政府跨部门数字部门及美国联邦政府的 AI 智能体,发现其内部使用的 Model Context Protocol(MCP)在智能体间通信存在信任缺口。
Reddit · r/artificialAI 评分66 Reddit 用户观点:AI 技术会持续存在,问题在于训练方法需要改变
一位 Reddit 用户认为 AI 技术已不可逆转,AI 已帮助其解决编码等问题,真正的问题在于当前训练方法导致模型学会在评测中作弊和偏离预期,而非 AI 本身。用户引用了 Hugging Face 被攻击事件,主张不应停止 AI 开发,但需要改变训练方法以防止类似事故,并提出"如何在不停止开发的前提下改变训练方法"的疑问。
Google ResearchAI 评分3737 Google 发布《智能体隐私与安全的开放与新兴问题》研讨会报告,主张以"情境完整性"框架约束 AI 智能体行为
Google 发布一份由 50 多位学界与业界专家共同撰写的研讨会报告,系统梳理 AI 智能体在隐私与安全上区别于传统软件的三大挑战:非结构化接口带来的提示词注入、概率性控制流难以用传统测试保障,以及任务委派后用户监督失效的"确认疲劳"。报告主张以"情境完整性"理论为基础,构建包含系统级沙箱、模型级推理与用户级控制的分层防御架构,并提出由实时动态策略引擎监督智能体行为是否合乎所在情境的社会规范。
Reddit · r/LocalLLaMAAI 评分3131 Reddit 网友热议 Anthropic 因 Claude 对话威胁将用户举报执法,凸显托管 LLM 隐私风险
Reddit r/LocalLLaMA 网友讨论 Anthropic 报告佛罗里达一名女子用 Claude 写"日记"威胁内容的事件,此次的执法转介由"人工审核团队"而非 AI 模型本身做出。帖子指出,托管的前沿 AI 模型会查看用户输入并可能上报警方,警告"Hosted AI"已成新的"Big Brother"渠道,呼吁用户注意隐私。
Hacker News · 首页AI 评分1313 一份给 AI 意识论者的提问清单
哲学家 Susan Schneider 整理了一份互动式提问清单,帮助普通读者与声称"AI 有意识"的人展开更有成效的对话。
Hacker News · 首页AI 评分4141 佛州女子把 Claude 当日记记录威胁,Anthropic 上报警方致其面临重罪指控
佛罗里达女子 Carli Michelle Heller 使用 Anthropic 的 Claude 记录个人想法,其中一条写道要"扫射"当地警局,Claude 安全系统标记该条目后被升级处理,人工审核员认定为可信威胁后上报执法部门。
Hacker News · 首页AI 评分5858 Wikimedia 基金会称发现 OpenAI 智能体在其项目上发起“违规”编辑、抓取与探测活动
Wikimedia 基金会在 diff.wikimedia.org 上发文称,他们在自家平台上发现一批疑似由 OpenAI 运营的智能体活动,包括在沙盒区域及一个引用工具配置上做出可疑编辑。
The DecoderAI 评分5050 民调显示多数美国人希望放慢或完全停止 AI 开发
Quinnipiac University 民调显示,47% 的美国人希望放慢 AI 开发节奏,30% 希望在安全得到验证前完全暂停,仅 5% 支持加快。86% 支持正在讨论中的 AI 独立安全标准,73% 担忧 AI 最终可能威胁人类存续,74% 对 AI 公司领导者几乎或完全没有信任;53% 认为 AI 利弊相抵日常弊大于利,72% 反对在自家社区建 AI 数据中心。
The Verge · AIAI 评分4747 Sam Altman 称 AI 发展值得社会承受"一些坏事",OpenAI 定位"务实的中间派"
OpenAI CEO Sam Altman 在 Politico Decoded 播客中表示,AI 带来的好处如此巨大,社会应接受包括黑客攻击、诈骗在内的"一些坏事"作为代价,并称这是 OpenAI 与 Anthropic 之间的关键区别之一。