跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 21–24 条 · 共 24 条
7月7日周二
  1. Hugging Face Blog79

    Hugging Face Storage 成为 SkyPilot 官方存储后端,支持 hf:// 协议挂载

    Hugging Face 与 SkyPilot 合作,将 Hugging Face Storage 集成 为 SkyPilot 官方存储后端。用户可通过 hf:// 协议挂载 Hugging Face Bucket(读写)或模型/数据集/Space 仓库(只读),在任意云上运行训练和推理任务,且读写 Hugging Face 数据免收出口费用。

    推荐理由:原文给出了 Hugging Face Storage 成为 SkyPilot 存储后端的具体集成方式、基准数据和使用场景,读者可以据此判断它对自己跨云训练/推理工作流的影响。

6月9日周二
  1. Google DeepMind75

    Google DeepMind 发布 Gemma 4 12B:统一 encoder-free 多模态模型

    Google DeepMind 发布 Gemma 4 12B,采用无编码器架构将视觉和音频输入直接整合到 LLM 主干,支持原生音频输入。性能接近更大的 26B MoE 模型,可在 16GB VRAM 的笔记本电脑上本地运行,已获 150 万次下载,发布于 Apache 2.0 许可证。

    推荐理由:原文给出了架构变化(encoder-free)、性能对比(接近 26B MoE)、内存要求(16GB VRAM)和原生音频输入等具体信息,读者可以据此评估它与其他 Gemma 模型的定位差异。

11月19日周三
  1. Mistral AI64

    Mistral AI 宣布与 SAP、Helsing 达成战略合作,扩展德国市场

    Mistral AI 宣布与 SAP 建立多年合作伙伴关系,为德国和欧洲提供完全自主的 AI 堆栈,将模型集成到 SAP 的 AI Foundation 中,共同开发特定行业解决方案。同时与 Helsing 合作加速开发用于国防和安全应用的视觉-语言-行动模型。Mistral 将在未来几个月内在德国开设办公室,大幅增加本地团队规模,以推进欧洲的 AI 自主战略。

    推荐理由:原文给出了具体合作对象(SAP、Helsing)、合作内容和德国市场扩展计划,读者可以据此了解欧洲 AI 自主战略的具体布局。

3月17日周一
  1. Mistral AI77

    Mistral Small 3.1 发布

    Mistral AI 发布 Mistral Small 3.1,号称同类最佳模型。新模型在文本性能和多模态理解上有所提升,上下文窗口扩展至 128k token,推理速度达 150 tokens/s,优于 Gemma 3 和 GPT-4o Mini。模型基于 Apache 2.0 许可证开源,可在单张 RTX 4090 或 32GB RAM Mac 上运行。

    推荐理由:原文给出了性能对比和推理速度数据,读者可以据此判断它在同类模型中的竞争力。