#安全/对齐
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#安全/对齐
今日 1 条一手 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条GitHub Blog · AI & ML精选AI 评分6262 GitHub 推出 ModernBERT 密钥分类器扩展 Push Protection
GitHub 与 Microsoft Applied Sciences 构建了微调的 ModernBERT 分类器,可在不到 2 milliseconds 内评估一组候选密钥,并让可阻止的密钥数量增加一倍以上。
推荐理由:GitHub 用九个季度的数据说明密钥泄露风险未随代码量明显上升,并公开了保护机制扩展到非结构化密钥的方法。
Google ResearchAI 评分3737 Google 发布《智能体隐私与安全的开放与新兴问题》研讨会报告,主张以"情境完整性"框架约束 AI 智能体行为
Google 发布一份由 50 多位学界与业界专家共同撰写的研讨会报告,系统梳理 AI 智能体在隐私与安全上区别于传统软件的三大挑战:非结构化接口带来的提示词注入、概率性控制流难以用传统测试保障,以及任务委派后用户监督失效的"确认疲劳"。报告主张以"情境完整性"理论为基础,构建包含系统级沙箱、模型级推理与用户级控制的分层防御架构,并提出由实时动态策略引擎监督智能体行为是否合乎所在情境的社会规范。
Google Research精选AI 评分6565 Google 发布基于 TEE 的新一代联邦学习系统实现可验证隐私保护
Google 推出基于可信执行环境(TEE)的新一代联邦学习系统,可提供完全可验证和可审计的数据匿名化保证。该系统实现了端到端可验证的联邦学习流程,仅向工作负载运营商展示指标和差分隐私模型权重,训练数据只能在 TEE 中解密处理。Gboard 已部署该系统,英语和日语下一个词预测模型获得了更强的隐私保证和更高的准确率,训练时间从 1-2 个月大幅缩短。
推荐理由:Google 公开了基于 TEE 的联邦学习新系统设计,实现了可验证的数据匿名化并已部署到 Gboard 带来训练提速,对关注隐私计算和联邦学习工程实践的读者有直接参考价值。
Google DeepMind精选AI 评分7777 Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google 发布新前沿模型 Gemini 4 Argon,在复杂软件工程、企业知识工作和网络安全防御方面达到前沿性能。上下文窗口扩展至 100 万 token,定价为输入每百万 token 2 美元、输出 10 美元。该模型通过 Fairwind Program 向部分受信任的网络防御者提供,并将在不久后向付费 API 客户和 Google AI Ultra 订阅用户开放。
推荐理由:原文给出了具体的能力变化和性能数据,读者可以据此判断这个模型的能力水平和应用场景。
OpenAI NewsAI 评分3939 OpenAI 挫败协调性模型知识蒸馏攻击活动
OpenAI挫败了一个协调性模型知识蒸馏活动,该活动试图提取其受保护模型的推理过程。OpenAI正在加强针对对抗性知识蒸馏的防御机制。此事件标志着AI公司在保护模型知识产权方面采取主动执法行动。
OpenAI NewsAI 评分2727 OpenAI 就澳大利亚政府网站事件道歉并承诺加强网络防御保障
OpenAI 就澳大利亚政府网站相关事件公开道歉,并概述了更强有力的保障措施。这些措施旨在加强澳大利亚的网络防御能力,但具体技术细节和发布时间表尚未公布。
OpenAI NewsAI 评分3838 OpenAI 发布前沿 AI 训练安全案例早期指南
OpenAI 公布前沿 AI 训练安全案例早期指南,涵盖技术安全防护、运营实践规范及未对齐事件调查三大方向。该指南旨在为前沿 AI 开发建立系统性的安全评估框架。
Google DeepMindAI 评分5757 Google DeepMind 发布安全服务器端内存的 Private AI Compute 架构更新
Google DeepMind 发布 Private AI Compute 平台的技术更新,新增 persistent memory 功能。该架构将服务器端内存设计为安全数字保险库,用户数据在云端加密存储,解密密钥仅存在于用户个人设备端,确保 Google 也无法访问用户数据。
OpenAI NewsAI 评分4848 OpenAI 扩展乌克兰网络防御访问权限以保护民用基础设施
OpenAI 将 Daybreak 计划的使用权限扩展给乌克兰政府,以支持民用基础设施的网络防御。该计划此前已向部分盟友开放,此次扩展旨在加强乌克兰抵御网络攻击的能力。
OpenAI NewsAI 评分3232 Sam Altman 在联合国安理会关于 AI 安全与人类控制的发言
OpenAI CEO Sam Altman 在联合国安理会发表讲话,探讨 AI 安全、人类控制和国际合作的重要性。作为 AI 行业领袖在联合国最高安全机构的发声,此次讲话强调了在全球范围内建立 AI 治理框架的迫切需求。
OpenAI NewsAI 评分3030 OpenAI 发布 MentalHealthBench,帮助评估 AI 在真实心理健康对话中的安全性与有效性
OpenAI 发布 MentalHealthBench,这是一款专家参与的基准测试工具,用于评估 AI 在真实心理健康对话场景中的帮助性和安全性。该 benchmark 专注于优化 AI 系统在敏感心理健康场景下的回复质量。
OpenAI NewsAI 评分4242 OpenAI 发布第三方 AI 安全评估优先事项与原则
OpenAI 发布第三方 AI 安全评估的优先事项与原则,旨在推动前沿模型和防护措施的严格、安全、独立评估。该框架强调评估的严谨性与保密性,要求评估方具备相应能力并遵循安全协议。OpenAI 表示将根据反馈持续更新这些原则。
NVIDIA Blog精选AI 评分7272 NVIDIA 发布 Halos:首个Physical AI全栈安全系统
NVIDIA 发布 Halos,这是首个面向 Physical AI(自动驾驶汽车、人形机器人、工业机器人等)的全栈安全系统。
推荐理由:原文给出了具体的时间预测(2035年 4900万辆 L3-L5 自动驾驶汽车)、合作伙伴名单和第三方认证机构,以及 NVIDIA 全栈安全平台的具体组件,读者可以据此判断 Physical AI 安全领域的当前状态和主要玩家。
NVIDIA BlogAI 评分4949 AI安全是工程问题——如何在Agent技术栈各层解决安全问题
AI安全是工程问题,需要明确的安全要求、可执行的控制措施、明确的责任人和有效的防护证据。NVIDIA提出在模型、harnesses和运行时环境三个层面构建安全边界,确保Agent即使做出错误决策也能被限制。NVIDIA OpenShell是开源的安全运行时,为Agent提供沙盒执行和资源访问控制,Open Secure AI Alliance成员正在基于此构建更完善的安全工具。
OpenAI NewsAI 评分3434 OpenAI 提出全球 AI 标准框架,呼吁协调评估与治理
OpenAI 概述了建立共享全球 AI 标准的路径,呼吁通过协调的评估、报告和治理机制来提高 AI 安全性。该框架旨在推动全球范围内的 AI 监管合作,确保技术发展与安全风险控制相平衡。
OpenAI NewsAI 评分2525 OpenAI 发布 Australian Youth Safety Blueprint:六支柱路线图保护青年AI体验
OpenAI 发布 Australian Youth Safety Blueprint,这是一个六支柱路线图,旨在为年轻人提供更安全的 AI 体验并赋能青年。该蓝图涵盖六个核心领域,用于指导在澳大利亚地区部署面向青少年的 AI 产品时如何平衡安全与赋能。
OpenAI News精选AI 评分7171 OpenAI 发布模型不对齐报告框架
OpenAI 发布了一个用于跟踪、调查和披露模型不对齐的框架,同时附带了六份关于模型异常或令人担忧行为的报告。
推荐理由:原文给出了框架的核心用途和对齐问题的追踪方法,读者可以据此了解 AI 安全领域的新实践。
OpenAI NewsAI 评分4848 Paul Christiano 加入 OpenAI Foundation Board
Paul Christiano 加入 OpenAI Foundation Board 及其 Safety and Security Committee。Christiano 在 AI 对齐、安全和标准领域具有丰富经验。
OpenAI NewsAI 评分2424 OpenAI 联合创始人 Jakub Pachocki 谈 AI 发展与对齐挑战
OpenAI 联合创始人 Jakub Pachocki 表示,AI 正在变得日益强大,其思维方式可能接近"外星思维",这对人类理解和对齐构成挑战。他呼吁建立更强的防护措施,并推动国际协调以应对日益增长的风险。
OpenAI News精选AI 评分6060 OpenAI 推出 Daybreak 项目:10亿美元保护关键服务
OpenAI 推出 Daybreak for Frontline Defenders 项目,承诺投入10亿美元扩展前沿网络安全AI、培训和支持服务的获取渠道,面向关键基础设施和服务。
推荐理由:原文给出了具体金额(10亿美元)和目标领域(关键服务的网络安全AI),读者可据此评估这一承诺的规模和影响范围。
Google DeepMindAI 评分5454 Google DeepMind 推出全球首个双盲 AI 评估方法
Google DeepMind 联合新加坡 AI 安全研究所、OpenMined 等机构,首次对 Gemini Flash Lite 模型实施双盲评估。该方法通过加密技术将外部评估限制在隔离环境中,防止模型预先获取测试题,从而避免 benchmark 污染问题,提升评估的可信度和完整性。
Mistral AI精选AI 评分7575 Mistral 发布 Shieldstral:3B 参数开源多模态安全分类器
Mistral 发布 Shieldstral,这是一款 3B 参数的开源多模态安全分类器,通过将内容审核重新定义为政策自适应的问答任务,在文本安全和多模态审核基准上超越了尺寸高达其 7 倍的模型。
推荐理由:它把内容审核重新定义成政策自适应的问答任务,一个 3B 模型能达到 7 倍尺寸模型的水平,而且可以在推理时用自然语言直接改写政策,不需要重新训练。
Google DeepMind精选AI 评分6464 Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型
Google DeepMind 发布基于 Gemini 3.5 Flash 的轻量级网络安全模型 3.5 Flash Cyber,通过 CodeMender 代理可多次调用以分析更多代码路径。
推荐理由:原文给出了多个 benchmark 对比数据和 Google 内部实际应用案例,读者可以据此评估轻量级网络安全模型相对于大型模型的能力边界和实用价值。
Google DeepMindAI 评分4949 Google DeepMind 与 Isomorphic Labs 公布生物韧性联合方案,应对 AI 时代的全球生物安全
Google DeepMind 与 Isomorphic Labs 公布生物韧性联合方案,涵盖预防、检测和响应三大领域,过去 12 个月推进了超过 15 个政府、生物安全组织和研究机构的合作。
Google ResearchAI 评分4343 Google推出Regularized f-Divergence Kernel Tests框架用于机器遗忘审计
Google Research在AISTATS 2026发布Regularized f-Divergence Kernel Tests框架,解决机器遗忘验证中双样本检验随模型规模增大而统计功效下降的问题。
Google DeepMind精选AI 评分6969 Google DeepMind 联合多方推出 1000 万美元资助计划,支持多智能体 AI 安全研究
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 和 Google.org 宣布提供最高 1000 万美元的研究资助,面向全球研究人员征集多智能体 AI 安全研究提案。
推荐理由:原文给出了 $10M 资助金额、四个重点资助方向和截止日期,读者可以据此了解多智能体 AI 安全研究的前沿问题和参与机会。
Google ResearchAI 评分4949 Google 零信任聚合的私有分析技术
Google推出新的私有分析服务,结合新型加密聚合协议与可信执行环境(TEE),实现单次消息安全提交,无需设备长时间在线多轮交互。该方案通过加密层确保原始数据在任何服务器内存中都不被暴露或重建,仅在聚合匿名化后才处理明文数据,并利用TEE提供可验证的完整性证明。目前已应用于Pixel Recorder和Gboard等场景。
Google DeepMindAI 评分5858 Google 扩展内容透明度工具,Search、Gemini、Chrome、Pixel 和 Cloud 均将支持 AI 内容验证
Google 扩展其内容透明度和验证工具,SynthID 水印技术已应用于超过 1000 亿张图片和视频以及 6 万年音频。Gemini 应用已提供 SynthID 验证功能(全球使用 5000 万次),正在扩展至 Search 和 Chrome。
Google Research精选AI 评分7474 Google 发布白皮书:负责任披露量子漏洞更新加密货币安全风险评估
Google 发布白皮书,更新了量子计算机破解 ECDLP-256 椭圆曲线密码学所需的资源估算。估算显示需不到 50 万物理量子比特在几分钟内即可破解,这比之前减少了约 20 倍。Google 建议加密货币社区转向后量子密码学以应对量子计算威胁,并采用零知识证明方式披露漏洞以避免被恶意利用。
推荐理由:原文给出了量子计算机破解 ECDLP-256 的最新资源估算,读者可据此了解量子威胁的实际时间线并提前规划迁移。