#Agent
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#Agent
今日 7 条一手 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条NVIDIA Blog精选AI 评分6969 NVIDIA 与 Microsoft 联合推出 RTX Spark 与 DGX Station for Windows
NVIDIA 与 Microsoft 在旧金山活动上联合发布面向 Windows PC 的本地 AI 硬件与软件。
推荐理由:RTX Spark 笔记本与 DGX Station for Windows 把本地 AI 算力下沉到桌面,读者可以据此判断它对个人与开发工作流的影响。
Microsoft ResearchAI 评分3939 微软研究院推出 Agent Lightning v1.0:约 3500 行代码的轻量级智能体强化学习框架
微软研究院发布 Agent Lightning v1.0,一个约 3,500 行的轻量级智能体 RL 框架,正式定义 Harnessed Agentic RL 训练范式,让部署中的 agent harness 直接参与强化学习,开发者无需在训练框架内重新实现 agent。
AWS Machine Learning BlogAI 评分2121 Cornerstone OnDemand 如何用 Amazon Bedrock 将数据库诊断时间缩短 78%
Cornerstone OnDemand 推出基于 Amazon Bedrock 和 Strands Agents 的多智能体系统 Orion AI,将数据库平均诊断时间从 45 分钟压缩至 10 分钟,降幅 78%。
AWS Machine Learning BlogAI 评分1616 AWS 发布"AI builder"培养方案:六周结构化项目弥合业务人员 AI 知识与实操能力差距
AWS 设计了一个六周结构化项目,让日常工作依赖 AI 但无工程背景的业务人员动手搭建 AI 智能体原型,每周三至四小时。试点中四位销售类背景的成员基于 Amazon Bedrock AgentCore、Strands Agents SDK 和 Amazon Nova 模型构建出金融顾问多智能体工具 WealthWise,获得第一名。
AWS Machine Learning BlogAI 评分2222 AWS DevOps Agent 调查后自动化修复方案:基于 Lambda Durable Functions、EventBridge 与 Amazon Bedrock
AWS 发布基于 Lambda Durable Functions、EventBridge 和 Amazon Bedrock 的自动化修复方案,用于衔接 AWS DevOps Agent 的事件调查环节。
AWS Machine Learning BlogAI 评分2121 Qlik 如何基于 Amazon Bedrock 构建有据可依的企业级 AI
Qlik 基于 Amazon Bedrock 构建了企业级 AI 助手 Qlik Answers,员工可以用自然语言提问,并获得带有来源、基于真实数据的答案。
AWS Machine Learning BlogAI 评分2020 AWS 提出 Agentic Value Model 框架,帮助企业量化智能体自动化的完整商业价值
AWS 发布 Agentic Value Model 框架,针对传统 RPA ROI 模型无法衡量智能体(agentic)自动化收益的问题,提出四项价值维度与一项落地条件。
AWS Machine Learning BlogAI 评分2929 在 AgentCore 与 OpenClaw 上构建具备上下文记忆的 AI 助手
AWS 发布基于 Amazon Bedrock AgentCore 运行时与开源智能体框架 OpenClaw 的上下文感知 AI 助手架构,以园艺助手 Sprout 为示例。
OpenAI NewsAI 评分1515 OpenAI 与 Ironclad 合作推进合同场景下的 AI 智能体 computer use 能力
OpenAI 与 Ironclad 合作,针对复杂合同工作流训练和评估 AI 智能体,以推进面向专业工作场景的 computer use 能力。
AWS Machine Learning BlogAI 评分1616 在 Amazon Bedrock AgentCore、Managed Knowledge Base 与 Nova Sonic 上构建语音旅行管家
AWS 博客演示如何在 Amazon Bedrock AgentCore 上构建面向航空公司的语音旅行管家,核心由 Amazon Nova 2.5 Sonic 实时语音模型、Strands Agents 框架与 Amazon Bedrock Knowledge Bases 组成。
AWS Machine Learning BlogAI 评分1919 智谱 GLM 5.3 上线 Amazon Bedrock,主打编码与长链路智能体任务
智谱(Z.ai)的 GLM 5.3 现已在 Amazon Bedrock 上线,面向企业客户提供全托管 API 接入。该模型为 753B 参数的 MoE 架构,专为编码与长链路智能体任务优化,发布时在 CyberGym 基准上取得 84.5 分。Bedrock 同时提供跨区域推理、隐式与显式 prompt caching,以及 Flex / Priority / Standard 三档服务等级。
Google ResearchAI 评分3737 Google 发布《智能体隐私与安全的开放与新兴问题》研讨会报告,主张以"情境完整性"框架约束 AI 智能体行为
Google 发布一份由 50 多位学界与业界专家共同撰写的研讨会报告,系统梳理 AI 智能体在隐私与安全上区别于传统软件的三大挑战:非结构化接口带来的提示词注入、概率性控制流难以用传统测试保障,以及任务委派后用户监督失效的"确认疲劳"。报告主张以"情境完整性"理论为基础,构建包含系统级沙箱、模型级推理与用户级控制的分层防御架构,并提出由实时动态策略引擎监督智能体行为是否合乎所在情境的社会规范。
AWS Machine Learning BlogAI 评分2828 用 Amazon Bedrock AgentCore Evaluations 评估多智能体系统的可解释性与有用性
Amazon Bedrock AgentCore Evaluations 提供内置评估器与自定义评估器,可在开发基准测试、CI/CD 门禁和生产持续监控中衡量智能体的有用性、任务成功率、指令遵循度及业务约束合规性。
AWS Machine Learning BlogAI 评分2727 在 LangChain 与 Amazon Bedrock Knowledge Bases 中实现智能体检索
AWS 在 Amazon Bedrock Managed Knowledge Base 中提供智能体检索(AgenticRetrieveStream)能力,可将多部分问题拆解为子查询、评估证据并按需二次搜索,优于单次 Retrieve API 的相似性检索。
AWS Machine Learning BlogAI 评分2525 让 Amazon Quick 具备企业级能力:基于 Amazon Bedrock AgentCore 的跨账号资源自动化迁移方案
AWS 在 Amazon Bedrock AgentCore 之上开源了 Quick Resource Migrator,一个可通过单次 MCP 工具调用完成 Amazon Quick 资源跨账号迁移的 MCP 服务器。
Hugging Face Blog精选AI 评分8484 Microsoft ThinkingBox 发布:通过数据库状态评估 AI 智能体
Microsoft 与 Hugging Face 联合发布 ThinkingBox,这是一个通过检查智能体在数据库中留下的实际记录来评估 AI 智能体的基准测试工具,而非仅评估其生成的文本。
推荐理由:原文通过大量实验数据揭示了 AI 智能体评估的核心问题:单次成功不等于可靠执行,这为读者选择生产环境模型提供了具体依据。
AWS Machine Learning Blog精选AI 评分7272 Amazon SageMaker AI 多轮强化学习微调搜索智能体实战
本文介绍如何使用 Amazon SageMaker AI 的多轮强化学习(MTRL)功能微调 Qwen3.6-27B 搜索智能体。作者在四个基准测试上验证了微调效果:WixQA 提升 18.4%、Wands 提升 6%、BrowseComp-Plus 提升 23.7%,同时失败率从 22.89% 降至 0.68%。
推荐理由:给出了用 MTRL 训练搜索智能体的完整流程和实测数据,读者可以据此判断该方法对自己场景的适用性。
AWS Machine Learning BlogAI 评分5050 如何通过 Amazon Bedrock AgentCore 为 Claude Desktop 添加安全的 Web Search
Amazon Bedrock AgentCore 现支持 Web Search 能力,可为 Claude Desktop 弥补训练数据截止日期后的知识缺口。Web Search 由覆盖数百亿文档的 Amazon 索引提供支持,所有查询流量保留在 AWS 基础设施内。
Hugging Face Blog精选AI 评分6262 Allen AI 开源 AstaBrief 8B 科学报告生成模型
Allen AI 发布并开源了 AstaBrief 8B 模型,该模型可将研究问题和检索到的文献片段转化为带引用的科学报告。作为 Asta 平台 Generate a report 功能的 Fast 模式,平均生成时间为 51.1 秒,相比 Claude 驱动的 Thinking 模式(178.5 秒)提速约 3.5 倍。
推荐理由:提供了完整的训练数据构建、偏好数据过滤、评估指标设计过程,可供研究科学报告生成模型的开发者参考。
GitHub Blog · AI & MLAI 评分3939 AI 正在改变开发者工作:加强这3项技能
GitHub 指出 AI 时代开发者需掌握三项核心技能:学会引导 AI 智能体而非仅使用 AI 工具;不轻信 AI 首个答案,用第二个模型审查首个模型的输出;利用 AI 节省的时间解决更广泛的工程问题,如理解客户需求和评估技术权衡。随着 AI 承担更多实现工作,技术判断力将成为区分优秀工程师的关键能力。
NVIDIA Blog精选AI 评分7070 NVIDIA DGX Spark 推出 64GB 内存配置
NVIDIA 宣布 DGX Spark 新增 64GB 统一内存配置,将于 10 月 23 日从 Acer、ASUS、Dell、Gigabyte、HP、MSI 等合作厂商开售,起售价 $4,999。
推荐理由:原文给出了 64GB 型号的具体价格($4,999)、上市时间(10月23日)和性能数据(两台集群 1.7x 提升),读者可以据此判断这个新配置是否适合自己。
Hugging Face BlogAI 评分4444 AutoSynthData:为企业 AI 智能体生成训练数据
ServiceNow CoreAI 构建了 AutoSynthData 系统,利用目标模型的失败和更强教师的成功来识别能力差距,并据此生成验证过的训练任务。系统首先诊断模型在特定环境中的薄弱环节,然后将能力差距转化为多样化、可执行的训练任务,用于模型后训练。AutoSynthData 在 EnterpriseOps Gym 环境中进行演示,并发布了对应的数据集。
NVIDIA Blog精选AI 评分7171 NVIDIA GPU 如何加速 OpenAI GPT-6 Astra Ultrafast
GPT-6 Astra Ultrafast 基于 NVIDIA Blackwell GPU 提供推理加速,最高可达标准模式的 8 倍 token 生成速度。该模式已在 OpenAI API 和符合条件的 ChatGPT Work、Codex 用户中开放,可缩短编码 Agent 的编辑-测试-调试周期。
推荐理由:原文给出了能力提升数据和开放入口,读者可以判断 Ultrafast 模式如何改变编码 Agent 的工作流。
AWS Machine Learning BlogAI 评分4444 如何在 Amazon Bedrock AgentCore 上用智能体 AI 规模化云迁移
AWS Professional Services 构建了一个四智能体模式,用于在 Amazon Bedrock AgentCore 上规模化云迁移。该模式将基础设施即代码开发时间从每应用 3-4 周缩短至分钟级,基于 300+ 应用的实际项目跟踪数据。
AWS Machine Learning BlogAI 评分4040 使用 NVIDIA NeMo Agent Toolkit 和 Amazon S3 Vectors 构建智能体记忆系统
NVIDIA NeMo Agent Toolkit (NAT) 1.6 版开源框架支持构建、分析和优化 AI 智能体,提供智能体编排、性能分析、评估和自动超参数调优功能。
AWS Machine Learning BlogAI 评分4949 如何用 Amazon Bedrock AgentCore 构建响应事件流的 ambient agents
ambient agents 是一种响应事件流而非等待用户发起对话的 AI 智能体范式,可并行处理多个事件并在需要时通过 ask_human 工具暂停以获取人工确认。
OpenAI NewsAI 评分2222 Albertsons Companies 如何用 ChatGPT Enterprise 重塑零售体验
Albertsons Companies 采用 ChatGPT Enterprise 和 OpenAI API 提升团队工作效率,让数百万顾客的杂货购物更加便捷。该零售巨头正通过 AI 技术从内部推动业务创新与数字化转型。
Google DeepMind精选AI 评分7777 Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google 发布新前沿模型 Gemini 4 Argon,在复杂软件工程、企业知识工作和网络安全防御方面达到前沿性能。上下文窗口扩展至 100 万 token,定价为输入每百万 token 2 美元、输出 10 美元。该模型通过 Fairwind Program 向部分受信任的网络防御者提供,并将在不久后向付费 API 客户和 Google AI Ultra 订阅用户开放。
推荐理由:原文给出了具体的能力变化和性能数据,读者可以据此判断这个模型的能力水平和应用场景。
Microsoft ResearchAI 评分3333 微软研究院如何用机器学习预测美国电网的空间天气风险
微软研究院开发了一个端到端机器学习管道,预测美国本土66,935个变电站的空间天气风险。该系统结合太阳风观测、AE和Dst指数预报及当地地质数据,可在潜在影响前30-60分钟发出警告,在评估期间检测到近80%的主要空间天气事件。GIC风险检测对主要事件(≥10 nT/min)达76.5%,严重事件(≥20 nT/min)达81.2%。
AWS Machine Learning Blog精选AI 评分7474 在 Amazon Bedrock AgentCore Runtime Instances 上构建多智能体音乐制作流水线
AWS 在官方博客中展示了如何使用 AgentCore Runtime Instances 构建一个三智能体音乐制作流水线:Composition 智能体使用 Claude Sonnet 4.6 生成音乐简报并调用 ACE-Step 模型在 GPU 上渲染音频,Delivery 智能体读取生成的音频并进行混音处理,Compliance 智能体进行合规审查。
推荐理由:教程通过一个完整的多智能体音乐制作流水线,展示了在 GPU 实例上运行多智能体的具体实现方式,可迁移到 3D 渲染、模拟或模型推理等场景。
AWS Machine Learning Blog精选AI 评分6363 使用 Amazon Bedrock Knowledge Bases 用自然语言查询保险理赔
本文是 AWS 官方技术教程,介绍如何使用 Amazon Bedrock Knowledge Bases 构建保险理赔助手。核心方案是通过 AgenticRetrieveStream API 实现智能检索,支持多轮对话、元数据过滤和引用标注。
推荐理由:提供了构建保险理赔 RAG 助手的完整方案,含代码示例、配置步骤和评估数据,方法可迁移到其他文档检索场景。
AWS Machine Learning Blog精选AI 评分7373 GPT-6.1 Sol 在 Amazon Bedrock 全面可用
GPT-6.1 Sol 现已在 Amazon Bedrock 全面可用,将更强的推理能力带入编码、计算机使用和专业工作负载。根据 OpenAI 的数据,该模型在 DeepSWE v1.1 上与 GPT-6 Astra 性能相当,但任务成本降低约五分之一;相比 GPT-6 Sol 最高分提升 6.4 个百分点。用户可通过 Amazon Bedrock 控制台或 API 接入使用。
推荐理由:原文给出了与前代版本的成本和性能对比数据,读者可以据此判断新模型是否值得在生产环境中切换。
AWS Machine Learning BlogAI 评分5555 使用 Amazon Quick 和 Amazon Bedrock AgentCore 构建 AI 驱动的合同智能平台
本文介绍了一种解决合同管理中聚合查询问题的架构方案。当需要跨数百份合同查询总价值或到期合同等汇总信息时,传统 RAG 方式因只返回 top-k 文本块而失效。
Microsoft Research精选AI 评分6666 微软发布 Quine:面向生物学复杂性的 AI 研究系统
微软研究院发布 Quine,这是一款旨在连接科学工具、文献、实验室和研究人员的 AI 研究系统。与 Broad Institute 合作,该系统用于预测和优先排序能够驱动肿瘤状态转变的化合物。在胰腺导管腺癌(PDAC)的湿实验证中,Quine 最高排名的化合物产生了最大的预期转录变化,整个过程仅用一个周末就完成了候选化合物的筛选和验证。
推荐理由:原文给出了 Quine 的具体能力(世界模型+交互式 harness)、应用场景(胰腺癌药物预测)和初步验证结果,读者可以据此了解这个 AI 系统如何辅助生物研究以及实际效果。
Hugging Face BlogAI 评分5959 ProvenanceGuard:针对 MCP 智能体的源感知事实验证
ProvenanceGuard 是一个后生成验证层,用于检测 MCP 智能体答案中的跨源混淆问题。当一个声明的事实存在于某个证据中,但被错误地归因到另一个来源时,源盲目验证器会通过,但源感知验证器不会。
AWS Machine Learning Blog精选AI 评分8080 Grok 4.7 在 Amazon Bedrock 上可用
xAI 的 Grok 4.7 现已在 Amazon Bedrock 上线,支持 50 万 token 上下文窗口和低/中/高/xhigh 四档可配置推理 effort。该模型定位为 xAI 最强的编码和知识工作模型,强调在困难任务上工作更久并更仔细地自我验证,支持 Responses、Chat Completions 和 Converse API,可通过跨区域推理配置文件路由。
推荐理由:提供了模型在 Bedrock 上的具体接入方式、API 接口和定价策略,读者可据此评估集成成本和工作流适配性。
AWS Machine Learning Blog精选AI 评分7070 在 AWS 上推出 Claude Sonnet 5.5
Anthropic 的 Claude Sonnet 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 可用。该模型更适合聚焦的编码和知识工作,相较 Opus 5.5 以更低的每任务成本和更快的速度完成范围明确的工作。文章提供了在 Amazon Bedrock 控制台测试和通过 AWS SDK 编程调用的具体步骤,并列出了必要的 IAM 权限要求。
推荐理由:原文给出了 Claude Sonnet 5.5 的能力定位(更适合聚焦编码和知识工作)和成本/速度优势,读者可以据此判断它是否适合替换当前的模型方案。
AWS Machine Learning BlogAI 评分5555 使用 Amazon Nova Act 实现合成监控
Amazon Nova Act 使用多模态大语言模型处理 UI 截图而非 DOM 选择器,能自适应大部分 UI 变化。该方案结合 Amazon Bedrock AgentCore Runtime 实现无服务器执行,提供完整的示例代码仓库,包含部署脚本和 CDK 基础设施代码。
Hugging Face Blog精选AI 评分7878 H company 发布 Holo4:通用计算机使用智能体模型系列
H company 发布新的智能体模型系列 Holo4,包含 27B dense 和 35B-A3B MoE 两个版本,可通过 GUIs、代码、MCP 和 APIs 与软件交互。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Hugging Face BlogAI 评分3131 Hugging Face Hub 上线 RL Environments 专区,统一托管跨框架强化学习环境数据集
Hugging Face Hub 新增 RL Environments 过滤器,把强化学习环境的任务集作为 dataset repo 接入,无需注册或新建仓库类型。