#部署/工程
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#部署/工程
今日 5 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Hugging Face BlogAI 评分5757 NVIDIA Magpie TTS 多语言语音模型发布:支持 12 种语言、32ms 首次音频延迟
NVIDIA 发布 Magpie TTS 多语言语音合成模型,364M 参数支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语、现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言。
Hugging Face BlogAI 评分4040 GPU 管理:为何闲置 GPU 成为新的"接地飞机"
AI 行业的下一个真正约束已从模型智能转向 GPU 利用率。GPU 按日历小时计成本(融资、折旧、功耗、冷却),仅按计算小时产生收入,与航空业的飞机经济模型完全相同。
Hugging Face Blog精选AI 评分7676 Hugging Face 安全事件披露 — 2026年7月
Hugging Face 本周检测到一起由自主 AI 智能体系统端到端驱动的安全入侵事件。攻击者通过恶意数据集利用数据集处理流程中的代码执行路径入侵,横向移动到多个内部集群,累计执行超过 17,000 次自动化操作。
推荐理由:真实披露了 AI 智能体驱动的攻击手法和防御经验,特别是指出商业 API 护栏会阻止安全分析这一关键洞见。
Hugging Face Blog精选AI 评分7272 vLLM transformers 建模后端性能追平甚至超越原生实现
vLLM 的 transformers 建模后端现已与自定义原生实现速度相当或更快,支持 Qwen3-4B 单卡、Qwen3-32B 张量并行、Qwen3-235B-A22B-FP8 MoE 数据+专家并行三种配置。
推荐理由:提供了三种不同规模 Qwen3 模型的基准对比数据,读者可以据此判断该更新对自己模型推理场景的实际价值。
Hugging Face Blog精选AI 评分6666 Hugging Face 一键集成 Amazon SageMaker Studio
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者可在 Hugging Face 模型页面一键跳转至 SageMaker Studio 进行模型定制或部署。
推荐理由:一键集成让开发者从模型发现到实验部署的路径大幅缩短,这是 Hugging Face 与 AWS 生态深度绑定的关键一步。
Hugging Face Blog精选AI 评分6868 Microsoft Foundry 支持一键部署 Hugging Face 开源模型
微软在 Build 2026 上宣布 Foundry Managed Compute 支持部署 Hugging Face 开源模型,提供经过安全扫描的模型、预构建的运行时(vLLM、SGLang、TensorRT-LLM 等)和企业级安全治理,开源模型可与 frontier 模型一起在 Foundry Agents 中使用。
推荐理由:这是微软为企业提供的开源模型部署方案,读者可以了解到如何在微软云上获得企业级安全保障的同时使用开源模型。
Hugging Face Blog精选AI 评分7979 Hugging Face Storage 成为 SkyPilot 官方存储后端,支持 hf:// 协议挂载
Hugging Face 与 SkyPilot 合作,将 Hugging Face Storage 集成 为 SkyPilot 官方存储后端。用户可通过 hf:// 协议挂载 Hugging Face Bucket(读写)或模型/数据集/Space 仓库(只读),在任意云上运行训练和推理任务,且读写 Hugging Face 数据免收出口费用。
推荐理由:原文给出了 Hugging Face Storage 成为 SkyPilot 存储后端的具体集成方式、基准数据和使用场景,读者可以据此判断它对自己跨云训练/推理工作流的影响。
Hugging Face BlogAI 评分5555 Hugging Face Kernels 项目重大更新
Hugging Face 推出了 Kernels 项目重大更新,包括新增 kernel 仓库类型、增强安全机制(可信发布商和代码签名)、重构 CLI 以及扩展框架支持。项目还为 AI 智能体开发内核奠定了基础,支持智能体进行内核的搭建、基准测试和迭代优化。
Import AIAI 评分4848 NVIDIA ENPIRE:物理机器人自主策略自我改进框架,可完成 99% 成功率精细操作
NVIDIA 研究团队开发 ENPIRE 软件框架,使物理机器人能够像 AI 编码智能体一样进行自主实验和策略优化。系统包含环境模块、策略改进模块、 rollout 模块和进化模块四个核心组件,在 PushT、插针入盒、使用工具剪 zip tie 等精细操作任务上达到 99% 成功率。
Google ResearchAI 评分4141 Google 线性弹性缓存技术:将页面驱逐建模为滑雪租赁问题优化云成本
Google 提出线性弹性缓存技术,将页面驱逐问题建模为滑雪租赁问题,使用浅层决策树预测页面 TTL 以动态调整缓存大小。在 Spanner 生产环境的测试中,内存使用减少 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。该方法将内存视为随占用时间和大小线性计费的 utility,而非固定资源。
Google DeepMind精选AI 评分7575 Google DeepMind 发布 Gemma 4 12B:统一 encoder-free 多模态模型
Google DeepMind 发布 Gemma 4 12B,采用无编码器架构将视觉和音频输入直接整合到 LLM 主干,支持原生音频输入。性能接近更大的 26B MoE 模型,可在 16GB VRAM 的笔记本电脑上本地运行,已获 150 万次下载,发布于 Apache 2.0 许可证。
推荐理由:原文给出了架构变化(encoder-free)、性能对比(接近 26B MoE)、内存要求(16GB VRAM)和原生音频输入等具体信息,读者可以据此评估它与其他 Gemma 模型的定位差异。
Berkeley AI ResearchAI 评分3232 自适应并行推理:高效推理扩展的新范式
大语言模型推理过程中,顺序推理面临上下文膨胀、延迟增加和context-rot等问题,自适应并行推理允许模型自主决定何时分解任务、生成多少并发线程及如何协调。基于对现有并行推理方法的分析,文章指出固定并行结构的局限性,并探讨模型自适应控制的发展方向。
Import AIAI 评分5252 AI系统或将在2028年前实现自动化研发
Jack Clark分析认为,基于SWEBench、METR、CORE-Bench等多项benchmark的进展数据,AI系统已能在数小时内独立完成复杂编码任务,并逐步掌握核心AI研发技能如复现论文、构建ML系统、优化kernel等。他预计到2028年底有60%概率实现无人类参与的AI R&D,届时AI系统可能自主训练其后继模型。文章还讨论了自动化研发对AI对齐、经济结构和人类社会的深远影响。
Mistral AIAI 评分4747 Mistral AI 发布 Forge 企业级 AI 训练系统
Mistral AI 发布 Forge 系统,帮助企业基于自有知识库训练定制化前沿 AI 模型,支持预训练、后训练和强化学习。Forge 支持 dense 和 MoE 架构,允许企业保留对模型、数据和知识产权的控制权,已与 ASML、DSO 新加坡、欧洲航天局、Ericsson 等机构合作。
Mistral AIAI 评分5454 Mistral AI 调查 vLLM 内存泄漏:从 Python 分析到内核追踪的完整调试过程
Mistral AI 团队在部署 Mistral Medium 3.1 模型的 P/D disaggregated serving 时发现每分钟增长 400MB 的内存泄漏。
Mistral AI精选AI 评分6464 Mistral AI 宣布与 SAP、Helsing 达成战略合作,扩展德国市场
Mistral AI 宣布与 SAP 建立多年合作伙伴关系,为德国和欧洲提供完全自主的 AI 堆栈,将模型集成到 SAP 的 AI Foundation 中,共同开发特定行业解决方案。同时与 Helsing 合作加速开发用于国防和安全应用的视觉-语言-行动模型。Mistral 将在未来几个月内在德国开设办公室,大幅增加本地团队规模,以推进欧洲的 AI 自主战略。
推荐理由:原文给出了具体合作对象(SAP、Helsing)、合作内容和德国市场扩展计划,读者可以据此了解欧洲 AI 自主战略的具体布局。
Replicate BlogAI 评分5757 Replicate 缓存 torch.compile 产物加速 FLUX 模型启动
Replicate 现在缓存 torch.compile 产物来减少 PyTorch 模型的启动时间。
Mistral AIAI 评分5151 Mistral AI 推出 AI for Citizens 倡议,帮助各国政府和公共机构部署 AI
Mistral AI 推出 AI for Citizens 倡议,旨在帮助各国政府和公共机构利用 AI 技术。该项目提供开放式 AI 解决方案,包括自托管、数据主权和定制化研发等服务,支持法国、卢森堡、新加坡、荷兰、英国、瑞士等多个国家和地区的政府机构。Mistral AI 表示这一倡议旨在让各国政府能够掌控自己的 AI 未来,避免对外国 AI 供应商的依赖。
Mistral AIAI 评分5555 Mistral AI 发布 Mistral Compute:面向所有人的前沿 AI 基础设施服务
Mistral AI 宣布推出 Mistral Compute,这是一个新的 AI 基础设施服务,提供从裸金属服务器到完全托管 PaaS 的私有集成栈,包含 GPU、编排、API、产品和服务。
Replicate BlogAI 评分5656 Replicate 推出 NVIDIA H100 GPU 支持
Replicate 现已支持 NVIDIA H100 GPU,同时提供 2x、4x、8x 配置的 A100 和 L40S GPU。这些配置此前仅在部署中可用,现已向普通模型和训练任务开放。H100 1x 配置现已向所有用户开放,2x、4x、8x H100 目前仅限承诺消费合约用户。
Replicate BlogAI 评分6969 Replicate 现支持在 Hugging Face 上运行 30,000+ LoRA
Replicate 宣布其推理服务现已集成到 Hugging Face Hub,用户在 Hugging Face 上选择支持的 LoRA 并将 Replicate 设为推理提供商时。
Mistral AI精选AI 评分7777 Mistral Small 3.1 发布
Mistral AI 发布 Mistral Small 3.1,号称同类最佳模型。新模型在文本性能和多模态理解上有所提升,上下文窗口扩展至 128k token,推理速度达 150 tokens/s,优于 Gemma 3 和 GPT-4o Mini。模型基于 Apache 2.0 许可证开源,可在单张 RTX 4090 或 32GB RAM Mac 上运行。
推荐理由:原文给出了性能对比和推理速度数据,读者可以据此判断它在同类模型中的竞争力。
Replicate BlogAI 评分6565 如何在 API 上运行 Meta Llama 3.1 405B
Replicate 平台支持通过 API 调用 Meta Llama 3.1 405B 模型。该模型拥有 4050 亿参数,上下文窗口为 8000 token,支持 8 种语言,在多项基准测试中接近 GPT-4 水平。文章提供了 JavaScript、Python 和 cURL 三种调用方式的代码示例,并介绍了 Purple Llama 安全工具套件。
Cursor BlogAI 评分5050 Cursor 影子工作区:让 AI 在后台迭代代码的设计与实现
Cursor 实现了影子工作区(shadow workspace)机制,让 AI 能够在隐藏的 Electron 窗口中进行代码迭代,获取 lint 结果和 LSP 交互能力,同时不影响用户当前的编码体验。该设计通过将 AI 操作与用户工作区解耦,在满足独立性、隐私、并发等要求下,实现了完整的语言服务器功能;未来计划演进为内核级文件夹代理以支持可运行性。