#部署/工程
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#部署/工程
今日 2 条一手 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条AWS Machine Learning BlogAI 评分2121 Cornerstone OnDemand 如何用 Amazon Bedrock 将数据库诊断时间缩短 78%
Cornerstone OnDemand 推出基于 Amazon Bedrock 和 Strands Agents 的多智能体系统 Orion AI,将数据库平均诊断时间从 45 分钟压缩至 10 分钟,降幅 78%。
AWS Machine Learning BlogAI 评分2222 AWS DevOps Agent 调查后自动化修复方案:基于 Lambda Durable Functions、EventBridge 与 Amazon Bedrock
AWS 发布基于 Lambda Durable Functions、EventBridge 和 Amazon Bedrock 的自动化修复方案,用于衔接 AWS DevOps Agent 的事件调查环节。
AWS Machine Learning BlogAI 评分2020 Amazon SageMaker Studio 新增对 SageMaker HyperPod Spaces 的可视化管理能力
Amazon SageMaker Studio 现可直接创建与管理运行在 SageMaker HyperPod EKS 集群上的 SageMaker Spaces,数据科学家无需使用 CLI 或 kubectl,即可在浏览器内启动 JupyterLab 或 Code Editor,将从集群访问到投入开发的时间缩短至几次点击。
AWS Machine Learning BlogAI 评分1212 Amazon SageMaker HyperPod 管理与治理最佳实践(基于 SageMaker Unified Studio)
Amazon SageMaker HyperPod 通过 SageMaker Unified Studio 为多个 ML 团队提供共享加速计算资源,核心挑战在于跨团队的治理与权限管控。
AWS Machine Learning BlogAI 评分3030 在 AWS GovCloud (US) 中用 Claude Code 与 Amazon Bedrock 加速受监管工作负载
Anthropic Claude Opus 5.5 与 Claude Sonnet 5.5 已在 AWS GovCloud (US) 区域 Amazon Bedrock 上可用。
NVIDIA Blog精选AI 评分7070 NVIDIA DGX Spark 推出 64GB 内存配置
NVIDIA 宣布 DGX Spark 新增 64GB 统一内存配置,将于 10 月 23 日从 Acer、ASUS、Dell、Gigabyte、HP、MSI 等合作厂商开售,起售价 $4,999。
推荐理由:原文给出了 64GB 型号的具体价格($4,999)、上市时间(10月23日)和性能数据(两台集群 1.7x 提升),读者可以据此判断这个新配置是否适合自己。
AWS Machine Learning BlogAI 评分4040 使用 NVIDIA NeMo Agent Toolkit 和 Amazon S3 Vectors 构建智能体记忆系统
NVIDIA NeMo Agent Toolkit (NAT) 1.6 版开源框架支持构建、分析和优化 AI 智能体,提供智能体编排、性能分析、评估和自动超参数调优功能。
AWS Machine Learning BlogAI 评分4040 在 AWS 上实现 Claude Platform 多环境访问配置指南
Claude Platform on AWS 支持三种环境访问:通过跨账户 SigV4 实现 AWS 生产工作负载推理,开发者笔记本使用工作区级 API 密钥,外部环境通过 OIDC federation 获取临时凭证。采用专用 AI Services 账户承载订阅和工作区,工作负载账户通过角色假设调用推理,实现生产与开发流量隔离。
AWS Machine Learning BlogAI 评分4949 如何用 Amazon Bedrock AgentCore 构建响应事件流的 ambient agents
ambient agents 是一种响应事件流而非等待用户发起对话的 AI 智能体范式,可并行处理多个事件并在需要时通过 ask_human 工具暂停以获取人工确认。
Hugging Face Blog精选AI 评分6161 AllenAI 发布 Olmo-core 3:面向大规模 MoE 的开源可扩展训练基础设施
AllenAI 发布 Olmo-core 3 训练框架,支持将专家池从 8 扩展到 128 而每 token 仅激活 4 个专家,总参数量从 4.6B 增至 47B,训练吞吐量仅下降不到 5%。在 8 个 NVIDIA B300 GPU 上,47B MoE 达 52,000 tokens/s/GPU,约为此前实现的 2.7 倍。系统已测试至 1.2 万亿参数规模。
推荐理由:原文给出了专家池扩展、吞吐量提升和参数规模的具体数字,读者可以据此判断这套训练基础设施对大模型研究的具体价值。
AWS Machine Learning BlogAI 评分3434 Condé Nast 如何用 Amazon Bedrock 构建多模态视频发现系统
Condé Nast 联合 AWS Generative AI Innovation Center 基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型实现跨视频文字记录、视觉元素和音频的语义搜索。
AWS Machine Learning BlogAI 评分5151 在 SageMaker AI 上用 vLLM-Omni 构建实时语音应用
本教程讲解如何在 Amazon SageMaker AI 上使用 AWS vLLM-Omni DLC 部署 Qwen3-TTS 模型,实现边生成边播放的流式语音输出。通过 Gradio 应用演示文本输入和 24kHz PCM 音频流的完整工作流程,并提供部署脚本和双向流式传输配置。
Mistral AI精选AI 评分7070 Mistral 在慕尼黑设立德国中心,专注工业 AI 与物理 AI
Mistral 在慕尼黑开设新中心,专注 Physics AI 和 Industrial AI 研发。中心将与 BMW 合作汽车碰撞模拟,与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)共建风洞数字孪生研究。公司计划到 2030 年在欧洲建立 1 吉瓦计算能力,强调开放权重架构保障数据主权——模型权重完全开放给客户,在客户自有基础设施上运行,数据不离开组织。
推荐理由:Mistral 明确提出了在欧洲建立主权 AI 基础设施的完整路径:开放权重架构 + 客户自有基础设施 + 欧洲法律合规,并给出了 1 吉瓦计算容量的具体目标和合作案例,读者可以据此评估其与封闭系统的差异。
AWS Machine Learning BlogAI 评分4747 Amazon Textract 适配器跨账户生命周期管理自动化方案
Amazon Textract Custom Queries 适配器支持针对特定文档类型微调提取精度,但跨账户推广、文档路由选择和生产安全配置构成三大核心挑战。
OpenAI NewsAI 评分1515 Proaction 利用 Codex 提升销售 60% 并节省 75+ 小时
Proaction 使用 Codex、GPT-Live-1 和 GPT-6 Astra 构建、运营并更快地销售现代车队管理解决方案,实现销售增长 60%,每周节省超过 75 小时。Codex 帮助团队加速开发流程,提升了整体运营效率。
AWS Machine Learning BlogAI 评分4949 使用 EFA 和 DeepEP 在 Amazon EKS 上扩展 MoE 强化学习训练,吞吐量提升 40%
AWS 展示了在 Amazon EKS 上使用 Elastic Fabric Adapter (EFA) 和 DeepEP 扩展混合专家(MoE)模型强化学习训练的架构,实现 40% 吞吐量提升。
AWS Machine Learning Blog精选AI 评分6060 在 AWS SageMaker HyperPod 上使用 SkyRL 加速多模态 RL 训练
本文详细介绍了在 Amazon SageMaker HyperPod 上使用开源 SkyRL 框架训练多模态强化学习模型的全流程,包括构建容器镜像、从 SageMaker Studio 启动 Ray 集群、提交训练任务、监控进度以及托管推理服务。
推荐理由:给出了完整的操作流程和实验数据,读者可以据此在 SageMaker HyperPod 上复现多模态 RL 训练。
AWS Machine Learning Blog精选AI 评分6060 Amazon SageMaker HyperPod 联合 Qumulo 实现跨区域训练:架构与性能验证
AWS 与 Qumulo 合作推出跨区域训练方案,允许计算节点和数据存储分属不同 AWS Region,通过 Qumulo Cloud Data Fabric 和 NeuralCache 预测缓存实现跨区域数据访问。
推荐理由:原文给出了跨区域训练的具体配置步骤和性能数据,读者可以据此评估是否采用 Qumulo+HyperPod 方案替代数据复制。
GitHub Blog · AI & ML精选AI 评分6767 GitHub Security Lab 发布 Taskflow Agent:实现 AI 驱动的自动化模糊测试
GitHub Security Lab 发布 Fuzzing Taskflow,这是一个基于 LLM Agent 的 C/C++ 项目自动化模糊测试管道。只需指定一个 GitHub 仓库,Agent 会自动完成入口点识别、构建系统分析、模糊测试用例生成、AFL++ 运行、覆盖率分析、用例优化和漏洞报告编写。
推荐理由:原文详细给出了自动化模糊测试的完整工作流程,包括覆盖率反馈循环、结构感知变异和语料库演进等具体机制,读者可据此迁移到自己的安全测试中。
AWS Machine Learning BlogAI 评分4444 Aderant使用Amazon Nova Lite构建智能工单分类系统
Aderant基于Amazon Nova Lite通过Amazon Bedrock构建了智能工单分析器,在前2.5周生产中处理109个工单,达到约96%路由准确率。
Hugging Face BlogAI 评分5151 Liquid AI 发布 LFM2.5-VL-DSpark 加速视觉语言模型推理
Liquid AI 发布 LFM2.5-VL-3B 的 DSpark 草案模型,采用投机解码在设备端实现最高 3.13x、H100 GPU 实现 2.66x 的解码加速,end-to-end 提升分别达 2.62x 和 2.27x。草案模型仅增加 280M 参数(占原模型 8.9%),首批支持 llama.cpp、MLX-VLM 和 SGLang 三大推理框架。
AWS Machine Learning BlogAI 评分2727 HEMA 如何借助 MCP 和 Amazon Bedrock AgentCore 实现即时知识问答
荷兰零售商 HEMA(拥有 750+ 门店)基于 Amazon Bedrock AgentCore 和 MCP 协议构建了内部 AI 助手 HAL,将原本分散在多个门户、维基和文档中的知识整合为统一的知识层。
Microsoft ResearchAI 评分4848 Microsoft Research 揭示物理AI机器人推理卸载优势:任务成功率提升、电池寿命延长
Microsoft Research 首次系统性研究机器人工作负载,证明将物理AI推理从板载GPU卸载到边缘或云端可显著提升机器人性能。在移动操作任务中,卸载推理使规划速度较A100提升383%,导航障碍检测及时性恢复30%,VLA模型精度损失从50%降至可控水平。
OpenAI NewsAI 评分4444 GPT-6 如何改进提示词缓存
GPT-6 改进了提示词缓存机制,提供更高的缓存命中率、新的诊断工具、显式断点和成本控制功能。这些改进可降低推理延迟和使用成本。
Hugging Face Blog精选AI 评分6666 oMLX 创建者 Jun Kim 加入 Hugging Face,继续支持 MLX 社区
oMLX 创建者和维护者 Jun Kim 正式加入 Hugging Face,将全职投入 MLX 生态系统开发。oMLX 保持 Apache 2.0 开源协议,Jun 继续担任项目负责人。Hugging Face 表示计划将 oMLX 作为新想法的试验田,并推动将 transformers 模型定义快速迁移到 MLX 实现,以促进新模型在 MLX 上的运行。
推荐理由:oMLX维护者从兼职转向全职,Hugging Face明确表示会加大投入,读者可据此判断MLX生态的发展速度可能加快。
NVIDIA Blog精选AI 评分6161 NVIDIA 推动埃及及非洲 AI 生态系统进入生产规模
NVIDIA 在埃及举办活动展示当地快速增长的 AI 生态,包括开发者、创业公司和企业的应用。埃及的 Deep Learning Institute 学员基数一年增长超十倍。
推荐理由:原文提供了非洲AI基础设施的多个具体建设进展和投资数字,读者可以据此了解非洲AI生态的现状与增长空间。
Google ResearchAI 评分5454 绕过推理瓶颈:用 Retrieve-for-Train 加速复杂 AI 搜索
Google Research 提出 Retrieve-for-Train 框架,通过离线 RL 将搜索推理行为蒸馏到 53.9M 参数的扩散模型中。在时尚和音乐数据集上,该方法实现了 12-20 倍的推理加速,同时保持搜索结果的多样性和相关性。
NVIDIA BlogAI 评分3131 费城儿童医院如何用开源NVIDIA AI为先天性心脏病儿童建模心脏
费城儿童医院(CHOP)基于NVIDIA开源医学影像框架MONAI,将过去需要4小时的心脏建模工作缩短至几秒。美国20多家儿童医院已开展心脏建模项目,波士顿儿童医院约50%的心脏手术(约每年500例)获建模支持。CHOP正结合NVIDIA Warp和Newton物理引擎,目标将模拟仿真引入临床工作流程,实现同日决策。
GitHub Blog · AI & MLAI 评分4040 GitHub 营销运营自动化实战:用 Copilot 和 Actions 实现活动管理全流程
GitHub 日本/韩国营销团队利用 GitHub Copilot 和 GitHub Actions 将活动管理全流程自动化,原本需耗时数天的活动筹备、参会者筛选、会后数据整理等工作现可从一个 GitHub Issue 自动完成。
OpenAI NewsAI 评分4343 OpenAI 如何将 Habitat 扩展至服务 10 亿 ChatGPT 用户
OpenAI 将存储平台 Habitat 从 Python 库扩展为全球分布式存储系统,现服务超过 10 亿 ChatGPT 用户,峰值处理能力达每秒 2200 万请求。该平台经历架构重大迭代以应对指数级流量增长。
Hugging Face Blog精选AI 评分6868 Async GRPO with LoRA 跨 Hugging Face Jobs 分布式训练实战
AsyncGRPOTrainer(TRL v1.14)现在支持训练 LoRA adapter 并仅同步该 adapter 到 vLLM,无需跨节点 NCCL 通信。
推荐理由:给出了在 Hugging Face Jobs 上用 Storage Bucket 做分布式 LoRA 训练的完整方案,包括架构、代理设计和优化步骤,读者可以直接参考复现。
OpenAI NewsAI 评分77 OpenAI 探索更强大、更可负担的 AI 如何扩展工作可能性
OpenAI 发布文章,探讨更强大且更可负担的 AI 如何扩展个人和企业的工作完成能力。内容聚焦 AI 技术使增长更加经济,尚未公布具体模型名称或技术细节。
Hugging Face Blog精选AI 评分7474 Hugging Face 发布 @huggingface/kernels:207 个 WebGPU 内核支持本地 AI 推理
Hugging Face 发布 WebGPU 内核库 @hugglingface/kernels,包含 207 个优化内核,可从 Hub 直接加载运行。性能对比测试显示,与 ORT WebGPU 相比,新内核在 Apple M4 GPU 上实现几何平均 2.57 倍提速、中位数 1.90 倍提速,部分操作如 bilinear Einsum 提速超过 10000 倍。
推荐理由:原文给出了 207 个内核的性能对比数据(2.57x 几何平均提速),读者可以据此判断这个底层工具对自己浏览器端 AI 推理工作流的价值。
Mistral AI精选AI 评分6565 Mistral 与 HUMAIN 达成战略合作,推动沙特及中东地区主权 AI 发展
Mistral 与 HUMAIN 宣布战略合作,合作金额达数亿欧元。双方将在 AI 基础设施、先进模型开发和 AI 解决方案部署方面合作,初始重点领域包括网络安全和语音,并计划开发在阿拉伯语方面表现优异的前沿模型。合作旨在满足主权 AI 需求,确保数据、推理和运营在客户控制范围内,主要面向金融、制造、电信、网络安全和公共部门等受监管行业。
推荐理由:这是 AI 基础设施和主权 AI 领域的跨国合作案例,读者可以据此了解欧洲 AI 公司在中东的布局策略和主权 AI 的具体落地模式。
Hugging Face Blog精选AI 评分6565 Liquid AI 发布 LFM2.5-DSpark 草稿模型,最高实现 3.2 倍推理加速
Liquid AI 发布 LFM2.5 系列的 DSpark 草稿模型检查点,包括 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三款。
推荐理由:给出了在 H100 和 MacBook M4 Max 上的具体加速数字,以及 llama.cpp 和 SGLang 的集成方式,读者可以据此判断迁移成本和预期收益。
Hugging Face BlogAI 评分5757 NVIDIA Magpie TTS 多语言语音模型发布:支持 12 种语言、32ms 首次音频延迟
NVIDIA 发布 Magpie TTS 多语言语音合成模型,364M 参数支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语、现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言。
Hugging Face BlogAI 评分4040 GPU 管理:为何闲置 GPU 成为新的"接地飞机"
AI 行业的下一个真正约束已从模型智能转向 GPU 利用率。GPU 按日历小时计成本(融资、折旧、功耗、冷却),仅按计算小时产生收入,与航空业的飞机经济模型完全相同。
Hugging Face Blog精选AI 评分7676 Hugging Face 安全事件披露 — 2026年7月
Hugging Face 本周检测到一起由自主 AI 智能体系统端到端驱动的安全入侵事件。攻击者通过恶意数据集利用数据集处理流程中的代码执行路径入侵,横向移动到多个内部集群,累计执行超过 17,000 次自动化操作。
推荐理由:真实披露了 AI 智能体驱动的攻击手法和防御经验,特别是指出商业 API 护栏会阻止安全分析这一关键洞见。
Hugging Face Blog精选AI 评分7272 vLLM transformers 建模后端性能追平甚至超越原生实现
vLLM 的 transformers 建模后端现已与自定义原生实现速度相当或更快,支持 Qwen3-4B 单卡、Qwen3-32B 张量并行、Qwen3-235B-A22B-FP8 MoE 数据+专家并行三种配置。
推荐理由:提供了三种不同规模 Qwen3 模型的基准对比数据,读者可以据此判断该更新对自己模型推理场景的实际价值。
Hugging Face Blog精选AI 评分6666 Hugging Face 一键集成 Amazon SageMaker Studio
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者可在 Hugging Face 模型页面一键跳转至 SageMaker Studio 进行模型定制或部署。
推荐理由:一键集成让开发者从模型发现到实验部署的路径大幅缩短,这是 Hugging Face 与 AWS 生态深度绑定的关键一步。