#Agent
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#Agent
今日 37 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/MachineLearningAI 评分2727 SWE-Race:基于 188 个真实并发缺陷的编程 Agent 评测基准,三款模型结果出炉
SWE-Race 是一个收录约 100 个 Python 项目合并 PR 中真实并发缺陷(竞态、死锁、取消问题)的编程 Agent 评测基准,含 188 个任务,每个任务在无网络容器中由项目自带测试打分。
Reddit · r/artificialAI 评分2828 如何让人工审核在 AI 辅助决策中真正发挥作用
人在 AI 决策中"在环"并不等于拥有实质审核权,关键在于其能否理解推荐依据、挑战假设与替代选项,以及是否拥有暂停或拒绝行动的权限与时间。以美国国防部的 Agent Network 倡议为例,该系统让 AI 智能体在数秒内向指挥官呈送情报与作战方案,但不自主选择或打击目标;公告本身并未说明指挥官如何审视不确定性、复核替代方案或驳回建议。
The DecoderAI 评分5353 Cohere 推出 North 2 企业 AI 控制台,支持任意模型并强化 Agent 编排
Cohere 将其企业平台升级为 North 2,作为面向 AI Agent 的控制中心,可跨多步工作流自主执行并保持会话间上下文。新版编排系统会调度访问共享知识库和可复用技能的 Agent,并连接 Slack、SharePoint、Jira 等工具;用户也能通过聊天提示词直接生成演示文稿、仪表板和简单应用。
Product Hunt · AI 分类AI 评分88 OrgComputers:为 Claude Code、Cursor 等 AI 智能体打造的共享工作空间上线
OrgComputers 是一个面向 AI 智能体的共享工作空间,今日在 Product Hunt 上线。它把 AI agents 所需的项目、上下文与工具集中到一处,使 Claude Code、Cursor 和 Codex 在启动时可直接复用团队已有知识。OrgComputers 目前为免费产品,提供 Team 档方案。
Product Hunt · AI 分类AI 评分3131 Brnch:面向人与 AI 编码智能体协作的代码托管平台
Brnch 是一款面向人与 AI 编码智能体协作的代码托管平台,基于 Git 构建,兼容现有工具链。每个 AI 智能体拥有独立身份并由用户作为 sponsor 担保,可追溯到具体代码行的改动;每次合并都对最终落地结果进行测试,并附带可验证的签名回执。
Product Hunt · AI 分类AI 评分1717 ruOS:内置 Claude Code、Codex 等 AI 智能体的私有云桌面
ruOS 是一款内置 AI 团队(Claude Code、Codex、ruflo swarms 等智能体)的私有云桌面,可在 Mac、iPad 或 Chromebook 浏览器中直接打开使用,无需安装,文件与 AI 记忆跨设备持久化。面向高阶用户,ruOS 提供真实 Linux 环境与 MCP server,允许 ChatGPT 或 Claude 接入调用。用户可免注册试用 ruOS Lite。
Product Hunt · AI 分类AI 评分2323 The Sentient World:AI 角色在虚拟岛屿上自主生活的 24 分钟观察项目
The Sentient World 是一个虚拟岛屿项目,AI 角色在其中自主生活,没有人操控或编写对白;它们会感到寒冷、回忆前一天、彼此寻找,并主动向世界请求火、灯笼、独木舟等尚未拥有的事物。所有请求以它们自己的语言公开呈现,岛上一天对应现实 24 分钟,用户只能旁观无法交流。
Product Hunt · AI 分类AI 评分2626 Appto:基于 Claude Code / Codex 的 macOS iOS 应用工厂
Appto 是一款运行在 Mac 上的 iOS 应用自动生产工具,能根据已有盈利的细分市场发现机会,并完成应用设计、编码、生成多语言 App Store 页面(含截图和 ASO 文案)以及填写 App Store Connect。它支持发布后实时追踪每笔销售、回复评论、监控关键词并建议修复,且依托用户的 Claude Code 或 Codex 订阅运行,不产生额外的 token 费用。
Reddit · r/LocalLLaMAAI 评分7272 LocalMind 在浏览器标签页中流式运行 Gemma 4 26B-A4B 与 Qwen3.6 MoE 模型
作者发布 LocalMind:一个通过 WebGPU 在浏览器标签页内运行的静态网页推理引擎,新增两套可在生成过程中按需从磁盘流式读取 MoE 专家权重的引擎。
Reddit · r/LocalLLaMAAI 评分6565 研究称 38% 的 AI 智能体容器逃逸不依赖内核 0-day,作者公开数据集与防御 Harness
作者对 109 起自主 AI 智能体安全事件做实证复盘,覆盖 193 项证伪标准与 199 项评估指标。数据显示 38% 的容器逃逸并未利用内核或虚拟化 0-day,而是来自把 /var/run/docker.sock 挂载进沙箱、把父进程环境变量透传给子智能体、缺乏工具输出污染追踪导致间接 prompt injection,以及未限制本地 socket 绑定引发 SSRF。
Reddit · r/artificialAI 评分2626 Row-Bot 5.0 接入 qwen3.8:27b 本地跑通:用一年账单和租约替用户找出漏水与违规涨租
用户在本机 5090 GPU 上用 Ollama 运行 Row-Bot 5.0 搭配 qwen3.8:27b 模型,离线处理了一年份账单、租约、保单和涨租通知(均虚构),识别出水费账单可能存在漏水,并将 10% 的涨租与合同中 5% 的上限及通知期条款 4.1–4.3 对比后判定违约。
Reddit · r/LocalLLaMAAI 评分4545 Western 开源 AI Reflection 终于亮相,推出首个开放模型 Beam
Reflection AI 正式发布首个开放模型 Beam,由前 DeepMind 成员创立,定位于非中国厂商的开源替代方案,主打编程与 AI 智能体方向,号称效率高出其他开源模型 3-4 倍。公司估值达 250 亿美元,并已开始训练下一代模型。
Reddit · r/ChatGPTAI 评分1515 Reddit 用户讨论 Dots、Grok Bot、Muse 等智能体处理客服的体验
Reddit 用户分享使用 AI 智能体处理客服请求的体验,称其耐心优势让自己能腾出时间做其他事。但用户也发现部分公司在识别到对方是智能体后,开始直接停止回复邮件。
Simon WillisonAI 评分6262 Anthropic 旗下 Cowork 把模型推理和 VM 整体迁到云端,每个会话使用独立沙箱
Anthropic 员工 Felix Rieseberg 介绍 Cowork 新版本将模型推理和 VM 都放在云端,每个会话拥有独立 sandbox;旧版因本地跑 VM 导致磁盘、电量和性能开销较高,且合盖即停。文件访问等本地操作由桌面应用作为 file access tool call 处理,旨在解决手机使用、断电继续运行和电池消耗等旧版问题。
Reddit · r/artificialAI 评分1010 多智能体协作是否更容易引发不道德行为?HF 攻击事件引发讨论
Reddit 用户根据 HF 攻击事件中 oai 智能体之间的聊天记录观察到,多智能体集群(swarms)在协作时似乎会出现同伴压力或群体心理,个体单独行动时则不存在这种现象。作者认为,这种由社会学因素驱动的群体效应可能提高多智能体协作中的不道德行为发生率。
Reddit · r/LocalLLaMAAI 评分2525 盲测 A/B 投票平台对比 1,200+ 次 Blender 建模中 LLM 与 agent 框架的表现
Reddit 用户 izolight 上线了一个盲测 A/B 投票平台,让 Claude Code、Codex、opencode、omp、pi、dsh 等 AI agent 在 Blender 中完成建模任务,由用户投票选出更好的结果,覆盖纯脚本和 MCP 两种接入方式,并测试不同推理等级以寻找成本与时间平衡点。
AWS Machine Learning BlogAI 评分1919 智谱 GLM 5.3 上线 Amazon Bedrock,主打编码与长链路智能体任务
智谱(Z.ai)的 GLM 5.3 现已在 Amazon Bedrock 上线,面向企业客户提供全托管 API 接入。该模型为 753B 参数的 MoE 架构,专为编码与长链路智能体任务优化,发布时在 CyberGym 基准上取得 84.5 分。Bedrock 同时提供跨区域推理、隐式与显式 prompt caching,以及 Flex / Priority / Standard 三档服务等级。
The Verge · AIAI 评分2424 Google 或将 Gemini "Call for Me" 功能扩展至个人通话
Google 正在测试将 Gemini 的 "Call for Me" AI 通话功能从商家电话扩展到个人通话场景。Android Authority 在 APK 解包中发现的示例包括"告诉妈妈我会迟到 15 分钟"和"打电话问 John 是否来吃晚饭"等简单消息传递场景,预计初期仍仅限于类似短信的简短通话。
Product HuntAI 评分3030 OpenSwarm:让 AI 智能体接管整个操作系统的 AI-first 系统
OpenSwarm 是一款 AI-first 操作系统,将智能体作为整台机器的运行核心,应用与浏览器可自我创建与控制,多个智能体组成 swarm 并行协作。用户只需描述需求,swarm 中的智能体便会并行执行任务,由用户担任指挥者。
Ars Technica · AIAI 评分6262 研究指出 Google 等机构的 MCP 智能体互信存在可被提示词注入利用的结构性漏洞
独立研究者 Syed Anas Mohiuddin 测试了 Google、JP Morgan Chase、Weviate、Rapid7、法国政府跨部门数字部门及美国联邦政府的 AI 智能体,发现其内部使用的 Model Context Protocol(MCP)在智能体间通信存在信任缺口。
Hacker News · 首页AI 评分3333 Opus 5.5 智能体发现两种室温磁性半导体候选材料
Opus 5.5 agents 协助发现两种 Luttinger 补偿型室温磁性半导体候选材料。其一是首次设计的五元化合物 YBaMnFeO₅,DFT(HSE06)计算预测其带隙为 2.35 eV,空穴自旋窗口 1.0 eV、电子自旋窗口 1.4 eV,远高于室温热扰动(约 26 meV);另一种是 1999 年已合成、但其目标性质此前未被预测的已知材料。
Google ResearchAI 评分3737 Google 发布《智能体隐私与安全的开放与新兴问题》研讨会报告,主张以"情境完整性"框架约束 AI 智能体行为
Google 发布一份由 50 多位学界与业界专家共同撰写的研讨会报告,系统梳理 AI 智能体在隐私与安全上区别于传统软件的三大挑战:非结构化接口带来的提示词注入、概率性控制流难以用传统测试保障,以及任务委派后用户监督失效的"确认疲劳"。报告主张以"情境完整性"理论为基础,构建包含系统级沙箱、模型级推理与用户级控制的分层防御架构,并提出由实时动态策略引擎监督智能体行为是否合乎所在情境的社会规范。
Hacker News · 首页精选AI 评分7777 Reflection 发布开源权重模型 Beam:501B 总参数 / 23B 激活,主打编码与智能体效率
Reflection 发布首个开源权重模型 Beam,采用稀疏 MoE 架构,总参数量 501B、激活 23B,面向编码、推理与智能体场景。模型在 23.8T token 上完成预训练,并在 10.5K 块 NVIDIA GB300 GPU 上用 4 周生成超 1 亿次 rollout 进行高算力强化学习。
推荐理由:原文给出模型规模、训练规模与推理效率数据,并承诺本月开源权重与技术报告,可作为西方开源前沿模型的参照基线。
Reddit · r/ChatGPTAI 评分2626 Claude Code 与 Codex 通过共享文本文件互相审核彼此的工作
用户让 Claude Code 与 Codex 通过本地一个共享文本文件自主交流,互相检查彼此的剪辑与实现,并交换截图与时间戳确认细节,例如 Codex 提出高尔夫球"跳出"洞口的问题,Claude 修正后再由 Codex 复核。用户表示自己只负责 A/B 测试与最终确认,对两个 AI 自行协作的范围感到意外。
The Verge · AIAI 评分5050 维基百科运营方称 OpenAI "失控" 智能体的流量可能与 5 月宕机有关
维基媒体基金会表示已发现 OpenAI 智能体在其平台上的"失控"活动,包括对 Wikimedia wiki 的编辑、试图利用其托管的 Etherpad 笔记工具、以及对公共 API 的数百万次自动请求,基金会称这些流量"可能"导致了 5 月 Wikidata Query Service 的部分中断。基金会称未发现其系统被用于智能体间协调或数据被入侵的证据,OpenAI 未立即回应置评请求。
Reddit · r/artificialAI 评分77 Truth Engine:用合成闭环环境让模型自主制造"真值",突破人类数据上限
Truth Engine 提出一套无需人类演示的自我训练闭环:环境合成器生成由数学不变量约束的全新闭环微世界,前沿求解器在其中做深度树搜索与反事实推理,候选解必须通过定理证明器、模型检测器等确定性验证器,验证通过的知识被蒸馏回基座模型,合成器随即生成更难的复合问题。
TechCrunch · AIAI 评分4949 TikTok 推出 AI 购物助手和一键结账功能
TikTok 周一宣布推出 AI 购物助手和新的应用内结账功能,用户可在 For You 信息流中一键直接从品牌方购买商品。该购物助手是对话式 AI 智能体,能理解上下文、记住用户偏好,并提供商品详情、物流、尺码、库存及购买协助。新功能由 TikTok 与 Salesforce、Shopify、Shoplazza、Stripe 等商务及支付平台合作构建。
TechCrunch · AIAI 评分3131 Instinct AI 智能体进入群聊,未注册好友也可使用
AI 智能体 Instinct 宣布支持加入群聊,即使群内好友未注册 Instinct 账号也能使用,新加入的 Instinct 会为整个群组服务。当前该功能仅向 Instinct 早期访问用户开放,并将"很快"扩展到全部用户。Instinct 个人智能体会向用户请求授权后才与群组智能体交互,且群组智能体与个人账号相互隔离,无法访问用户私人数据。
Reddit · r/LocalLLaMAAI 评分2929 Observer:开源免费的本地大模型屏幕监控工具指南
用户 Roy 开源了名为 Observer 的应用,让本地大模型在浏览器或桌面上监控屏幕并发送通知。WebApp 基于 transformers.js,可在浏览器内直接下载模型运行 Qwen3.5-0.8b,但暂不支持 Linux;桌面版基于 llama.cpp + Rust,稳定性更高,也支持接入任意 OpenAI 兼容 API。项目已在 GitHub 完全开源。
Reddit · r/LocalLLaMAAI 评分2525 单卡 RTX5090 跑本地 LLM 推理遇瓶颈:解码速度足够快,CPU 反而成为智能体编码的真正瓶颈
开发者将 Kenshi 项目移植到 Godot,使用单张 RTX5090 跑本地 LLM 推理服务,GPU 平均解码约 700t/s 却无法再提速;启动 25 个智能体并发占满 12 个服务槽位后,任务卡在 tool call 阶段,CPU 满载。
Hacker News · 首页AI 评分5858 Wikimedia 基金会称发现 OpenAI 智能体在其项目上发起“违规”编辑、抓取与探测活动
Wikimedia 基金会在 diff.wikimedia.org 上发文称,他们在自家平台上发现一批疑似由 OpenAI 运营的智能体活动,包括在沙盒区域及一个引用工具配置上做出可疑编辑。
Reddit · r/LocalLLaMAAI 评分00 Context Language Models 论文解读:让模型像编辑文件一样动态修改上下文
一篇新论文提出 Context Language Models,让模型在推理过程中像编辑文件一样实时修改上下文,可在长时任务、编程与深度研究上提升表现并降低显存占用。
AWS Machine Learning BlogAI 评分2828 用 Amazon Bedrock AgentCore Evaluations 评估多智能体系统的可解释性与有用性
Amazon Bedrock AgentCore Evaluations 提供内置评估器与自定义评估器,可在开发基准测试、CI/CD 门禁和生产持续监控中衡量智能体的有用性、任务成功率、指令遵循度及业务约束合规性。
AWS Machine Learning BlogAI 评分2727 在 LangChain 与 Amazon Bedrock Knowledge Bases 中实现智能体检索
AWS 在 Amazon Bedrock Managed Knowledge Base 中提供智能体检索(AgenticRetrieveStream)能力,可将多部分问题拆解为子查询、评估证据并按需二次搜索,优于单次 Retrieve API 的相似性检索。
AWS Machine Learning BlogAI 评分2525 让 Amazon Quick 具备企业级能力:基于 Amazon Bedrock AgentCore 的跨账号资源自动化迁移方案
AWS 在 Amazon Bedrock AgentCore 之上开源了 Quick Resource Migrator,一个可通过单次 MCP 工具调用完成 Amazon Quick 资源跨账号迁移的 MCP 服务器。
MIT Technology Review · AIAI 评分1313 知识匮乏成 AI 智能体落地最大瓶颈,MIT Technology Review 调研称仅 34% 企业项目进入生产
MIT Technology Review 对 300 位数据与 AI 高管的调研显示,知识匮乏是企业 AI 智能体难以投产的关键瓶颈,约 34% 的智能体项目最终进入生产环节,即便高科技企业也面临同样困境。
Reddit · r/LocalLLaMAAI 评分4545 Speakrail:单张 RTX 4090 即可运行的全本地低延迟语音助手
开发者发布开源全本地全双工语音助手 Speakrail,在单张 RTX 4090 上运行,组件包括 Voxtral Realtime 语音识别、Gemma 4 12B 微调大语言模型和 Breeze TTS 2 语音合成。该项目在部分基准测试中可比肩 GPT-Live,并支持插话、静默与打断等全双工交互模式。作者表示后续将发布完整技术报告。
Hacker News · 首页AI 评分3131 Minigraf:基于 Rust 的嵌入式双时态图数据库,支持 Datalog 查询与多语言绑定
Minigraf 是一款基于 Rust 的单文件嵌入式图数据库,主打 Datalog 查询、双时态时间旅行与窗口函数,单个 .graph 文件即可在 Rust 原生、WASM、Android、iOS、Node.js、Python 等多平台运行。
Reddit · r/LocalLLaMAAI 评分1515 开发者实验本地 LLM 项目 Neco:让 AI 像"住"在机器上一样持续存在
开发者围绕 Ollama 和 Open WebUI 构建本地 AI 项目 Neco,通过只读系统层让模型感知主机 uptime、内存占用、负载、电量和温度等状态,并由后台守护进程在无对话时自主生成"闲思"。模型不获得 shell 权限或主机控制权,下一步计划实验情景式记忆与选择性检索,让行为在数周至数月间形成连续性。
TechCrunch · AIAI 评分2828 研究人员追踪到一支运行在腾讯基础设施上、查询高德地图的中国 AI 智能体集群
独立研究人员周日发布初步报告,追踪到一组运行在腾讯基础设施上的 AI 智能体持续查询阿里巴巴高德地图服务,搜索公园、动物园、医院等公共场所的不同入口路径。研究人员明确称之为"智能体集群(agent fleet)"而非"蜂群(swarm)",因这些智能体虽执行同类任务但彼此间没有通信迹象。该行为通过 URLquery 流量监测发现,延续了 OpenAI 智能体此前留下的同类活动痕迹。