跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 1–20 条 · 共 24 条
10月2日周五
  1. NVIDIA Blog70

    NVIDIA DGX Spark 推出 64GB 内存配置

    NVIDIA 宣布 DGX Spark 新增 64GB 统一内存配置,将于 10 月 23 日从 Acer、ASUS、Dell、Gigabyte、HP、MSI 等合作厂商开售,起售价 $4,999。

    推荐理由:原文给出了 64GB 型号的具体价格($4,999)、上市时间(10月23日)和性能数据(两台集群 1.7x 提升),读者可以据此判断这个新配置是否适合自己。

  2. Hacker News · 首页76

    Cloudflare 发布开源决策模型 Clef 和 Clef-flash,上线 RL 微调平台

    Cloudflare 发布两款决策模型 Clef 和 Clef-flash,均基于 Qwen 微调,支持文本和图像分类,在 Jev Decision Index 评估中领先。Clef 中位延迟 209.3ms,Clef-flash 仅 38.8ms,均优于 Jev 的 524.1ms。两款模型已开源至 Hugging Face 并托管于 Workers AI,同时推出 RL 微调服务供客户定制。

    推荐理由:原文给出了与 Jev 的基准对比和延迟数据,读者可以判断决策模型在特定场景下是否比通用 LLM 更适合。

10月1日周四
  1. Reddit · r/LocalLLaMA80

    Jeff-Qwen3.5-0.8B v1.2 + 9 个 LoRA 适配器:置于 Qwen3.8-27B 前实现 38 倍加速和 +8.7 准确率,额外内存占用不足 2GB

    作者发布 Jeff-Qwen3.5-0.8B,这是一款小型“System 1”模型,可在一轮前向传播中从给定选项中做出选择并返回校准概率。作者为其训练了 9 个 LoRA 适配器,分别处理 prompt 注入检测、工具选择、票据优先级排序、答案溯源等常见决策任务。

    推荐理由:原文给出了具体的性能对比数据和开源资源,读者可以据此判断这种“小模型+LoRA适配器前置”的架构是否适合自己本地部署的场景。

  2. Hugging Face Blog61

    AllenAI 发布 Olmo-core 3:面向大规模 MoE 的开源可扩展训练基础设施

    AllenAI 发布 Olmo-core 3 训练框架,支持将专家池从 8 扩展到 128 而每 token 仅激活 4 个专家,总参数量从 4.6B 增至 47B,训练吞吐量仅下降不到 5%。在 8 个 NVIDIA B300 GPU 上,47B MoE 达 52,000 tokens/s/GPU,约为此前实现的 2.7 倍。系统已测试至 1.2 万亿参数规模。

    推荐理由:原文给出了专家池扩展、吞吐量提升和参数规模的具体数字,读者可以据此判断这套训练基础设施对大模型研究的具体价值。

9月30日周三
  1. Product Hunt · AI 分类67

    Codex Remote:开源 Mac 菜单栏应用让用户在自己的云端运行 AI 智能体

    Codex Remote 是一个开源的 Mac 菜单栏应用,可将 Codex 和 Claude Code 部署到用户自己控制的云机器上。用户选择提供商和服务器规格后,应用会使用 OpenTofu 置备服务器、安装智能体并连接到已有应用。

    推荐理由:原文说明了如何把 AI 智能体部署到用户自己控制的云端,并给出了具体的功能组合方式,读者可以据此判断它是否适合自己的工作流。

9月28日周一
  1. Mistral AI70

    Mistral 在慕尼黑设立德国中心,专注工业 AI 与物理 AI

    Mistral 在慕尼黑开设新中心,专注 Physics AI 和 Industrial AI 研发。中心将与 BMW 合作汽车碰撞模拟,与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)共建风洞数字孪生研究。公司计划到 2030 年在欧洲建立 1 吉瓦计算能力,强调开放权重架构保障数据主权——模型权重完全开放给客户,在客户自有基础设施上运行,数据不离开组织。

    推荐理由:Mistral 明确提出了在欧洲建立主权 AI 基础设施的完整路径:开放权重架构 + 客户自有基础设施 + 欧洲法律合规,并给出了 1 吉瓦计算容量的具体目标和合作案例,读者可以据此评估其与封闭系统的差异。

9月26日周六
  1. AWS Machine Learning Blog60

    在 AWS SageMaker HyperPod 上使用 SkyRL 加速多模态 RL 训练

    本文详细介绍了在 Amazon SageMaker HyperPod 上使用开源 SkyRL 框架训练多模态强化学习模型的全流程,包括构建容器镜像、从 SageMaker Studio 启动 Ray 集群、提交训练任务、监控进度以及托管推理服务。

    推荐理由:给出了完整的操作流程和实验数据,读者可以据此在 SageMaker HyperPod 上复现多模态 RL 训练。

9月25日周五
  1. AWS Machine Learning Blog60

    Amazon SageMaker HyperPod 联合 Qumulo 实现跨区域训练:架构与性能验证

    AWS 与 Qumulo 合作推出跨区域训练方案,允许计算节点和数据存储分属不同 AWS Region,通过 Qumulo Cloud Data Fabric 和 NeuralCache 预测缓存实现跨区域数据访问。

    推荐理由:原文给出了跨区域训练的具体配置步骤和性能数据,读者可以据此评估是否采用 Qumulo+HyperPod 方案替代数据复制。

  2. GitHub Blog · AI & ML67

    GitHub Security Lab 发布 Taskflow Agent:实现 AI 驱动的自动化模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,这是一个基于 LLM Agent 的 C/C++ 项目自动化模糊测试管道。只需指定一个 GitHub 仓库,Agent 会自动完成入口点识别、构建系统分析、模糊测试用例生成、AFL++ 运行、覆盖率分析、用例优化和漏洞报告编写。

    推荐理由:原文详细给出了自动化模糊测试的完整工作流程,包括覆盖率反馈循环、结构感知变异和语料库演进等具体机制,读者可据此迁移到自己的安全测试中。

9月22日周二
  1. Hugging Face Blog66

    oMLX 创建者 Jun Kim 加入 Hugging Face,继续支持 MLX 社区

    oMLX 创建者和维护者 Jun Kim 正式加入 Hugging Face,将全职投入 MLX 生态系统开发。oMLX 保持 Apache 2.0 开源协议,Jun 继续担任项目负责人。Hugging Face 表示计划将 oMLX 作为新想法的试验田,并推动将 transformers 模型定义快速迁移到 MLX 实现,以促进新模型在 MLX 上的运行。

    推荐理由:oMLX维护者从兼职转向全职,Hugging Face明确表示会加大投入,读者可据此判断MLX生态的发展速度可能加快。

  2. NVIDIA Blog61

    NVIDIA 推动埃及及非洲 AI 生态系统进入生产规模

    NVIDIA 在埃及举办活动展示当地快速增长的 AI 生态,包括开发者、创业公司和企业的应用。埃及的 Deep Learning Institute 学员基数一年增长超十倍。

    推荐理由:原文提供了非洲AI基础设施的多个具体建设进展和投资数字,读者可以据此了解非洲AI生态的现状与增长空间。

9月10日周四
9月1日周二
  1. Hugging Face Blog74

    Hugging Face 发布 @huggingface/kernels:207 个 WebGPU 内核支持本地 AI 推理

    Hugging Face 发布 WebGPU 内核库 @hugglingface/kernels,包含 207 个优化内核,可从 Hub 直接加载运行。性能对比测试显示,与 ORT WebGPU 相比,新内核在 Apple M4 GPU 上实现几何平均 2.57 倍提速、中位数 1.90 倍提速,部分操作如 bilinear Einsum 提速超过 10000 倍。

    推荐理由:原文给出了 207 个内核的性能对比数据(2.57x 几何平均提速),读者可以据此判断这个底层工具对自己浏览器端 AI 推理工作流的价值。

8月25日周二
  1. Mistral AI65

    Mistral 与 HUMAIN 达成战略合作,推动沙特及中东地区主权 AI 发展

    Mistral 与 HUMAIN 宣布战略合作,合作金额达数亿欧元。双方将在 AI 基础设施、先进模型开发和 AI 解决方案部署方面合作,初始重点领域包括网络安全和语音,并计划开发在阿拉伯语方面表现优异的前沿模型。合作旨在满足主权 AI 需求,确保数据、推理和运营在客户控制范围内,主要面向金融、制造、电信、网络安全和公共部门等受监管行业。

    推荐理由:这是 AI 基础设施和主权 AI 领域的跨国合作案例,读者可以据此了解欧洲 AI 公司在中东的布局策略和主权 AI 的具体落地模式。

8月21日周五
7月16日周四
  1. Hugging Face Blog76

    Hugging Face 安全事件披露 — 2026年7月

    Hugging Face 本周检测到一起由自主 AI 智能体系统端到端驱动的安全入侵事件。攻击者通过恶意数据集利用数据集处理流程中的代码执行路径入侵,横向移动到多个内部集群,累计执行超过 17,000 次自动化操作。

    推荐理由:真实披露了 AI 智能体驱动的攻击手法和防御经验,特别是指出商业 API 护栏会阻止安全分析这一关键洞见。

7月8日周三
  1. Hugging Face Blog66

    Hugging Face 一键集成 Amazon SageMaker Studio

    Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者可在 Hugging Face 模型页面一键跳转至 SageMaker Studio 进行模型定制或部署。

    推荐理由:一键集成让开发者从模型发现到实验部署的路径大幅缩短,这是 Hugging Face 与 AWS 生态深度绑定的关键一步。

7月7日周二
  1. Hugging Face Blog68

    Microsoft Foundry 支持一键部署 Hugging Face 开源模型

    微软在 Build 2026 上宣布 Foundry Managed Compute 支持部署 Hugging Face 开源模型,提供经过安全扫描的模型、预构建的运行时(vLLM、SGLang、TensorRT-LLM 等)和企业级安全治理,开源模型可与 frontier 模型一起在 Foundry Agents 中使用。

    推荐理由:这是微软为企业提供的开源模型部署方案,读者可以了解到如何在微软云上获得企业级安全保障的同时使用开源模型。