跳到正文
热点事件持续更新

Qwen3.8-27B-FP8 在 RTX 5090 上的 vLLM 部署尝试

1 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

用户在 RTX 5090 上尝试用 vLLM 部署 Qwen3.8-27B-FP8 模型。据该用户反映,FP8 版本极难在 RTX 5090 上通过 vLLM 成功运行,即便勉强启动,也会因可用上下文不足而难以实用。该用户目前在 RTX 5090 上改用 NVFP4 量化版本,已实现稳定部署,可在去图像情况下支持 256k 上下文。由于 FP8 版本仓库体积达 30.9GB,该用户在权衡 FP8 与 NVFP4 之间的精度差异后,仍对 FP8 版本能否真正落地存在疑虑。截至目前,关于 FP8 版本能否通过其他配置或后续优化成功运行,暂无进一步明确结论。

AI 根据报道生成 · 59 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月11日
  1. Reddit · r/LocalLLaMA
    Qwen3.8-27B-FP8 能否在 RTX 5090 上用 vLLM 运行?

    用户在 RTX 5090 上测试用 vLLM 部署 Qwen3.8-27B-FP8 模型,发现极难成功,即便勉强运行也会因上下文不足而不实用。该用户目前已用 NVFP4 量化版本实现稳定部署,支持 256k 上下文(去图像)。由于 FP8 版本仓库体积达 30.9GB,他在权衡 FP8 与 NVFP4 的精度差异后仍不确定能否落地。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。