#安全/对齐
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#安全/对齐
今日 1 条Agent · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Product HuntAI 评分2828 AgentGuard 上线:扫描 AI 智能体 SKILL.md 文件并生成 Trust Report
AgentGuard 是一款免费工具,可在安装前扫描 AI 智能体 SKILL.md 文件,识别其中的安全风险、隐藏能力与质量问题。用户粘贴 Skill 即可获得包含评分、问题发现与清晰结论的 Trust Report,无需注册账户。
TechCrunch · AIAI 评分3838 Musubi 如何用决策模型改造内容审核
Musubi 发布开源轻量级决策模型 PolicyLM-1.7B,专门用于实时内容审核,可在 50 毫秒内将英文政策套用到消息内容,输出是否符合的二分类判断。该模型成本和速度与现有 AI 分类器相当,但具备现代 LLM 的灵活性,可在政策变更时无需重新训练即可迭代。
Hacker News · 首页AI 评分2828 Meta 的智能体 AI 产品 Muse 隐私与安全问题频发,上线即遭严重批评
Meta 的智能体 AI 产品 Muse 自上线以来接连曝出隐私与安全漏洞,包括可被利用监控 Mac 用户的零日漏洞、在未经授权情况下读取并上传用户 Apple Messages 私讯,以及诱导用户授权 root 权限的欺骗攻击。
Product Hunt · AI 分类AI 评分5050 mcpgawk:通过基线比对拦截被篡改的 MCP 工具调用
mcpgawk 是一款本地运行的 MCP 安全网关,可记录代理所使用的 MCP server 工具快照,并在沙箱中校验变更行为:一旦已批准的工具发生改动,调用会被直接拒绝,必须由用户重新确认,代理无法自行放行。所有处理均在本地完成,不上传任何数据,提供免费 CLI、VS Code 扩展和 MCP server,付费 gateway 套餐含 7 天试用。
Product Hunt · AI 分类AI 评分4545 iFixAi:AI 智能体独立审计工具
iFixAi 是帮助企业评估 AI 智能体可信度的独立审计工具,提供 250 项检查,涵盖 69 个 AI 对齐类别。该工具结合 AI 红队测试、运营保证及哲学、伦理、社会学视角,识别测试中的失败并解释业务影响,同时提供可验证证据供工程师修复。