热点事件持续更新
Qwen3.8-27B-FP8 在 RTX 5090 上的 vLLM 部署尝试
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
用户在 RTX 5090 上尝试用 vLLM 部署 Qwen3.8-27B-FP8 模型。据该用户反映,FP8 版本极难在 RTX 5090 上通过 vLLM 成功运行,即便勉强启动,也会因可用上下文不足而难以实用。该用户目前在 RTX 5090 上改用 NVFP4 量化版本,已实现稳定部署,可在去图像情况下支持 256k 上下文。由于 FP8 版本仓库体积达 30.9GB,该用户在权衡 FP8 与 NVFP4 之间的精度差异后,仍对 FP8 版本能否真正落地存在疑虑。截至目前,关于 FP8 版本能否通过其他配置或后续优化成功运行,暂无进一步明确结论。
AI 根据报道生成 · 59 分钟前更新
最新进展10月11日 10:12
用户在 RTX 5090 上改用 NVFP4 量化版实现稳定部署,FP8 版本通过 vLLM 运行仍面临困难。报道时间线
沿着报道,了解事件的不同侧面。
10月11日
- Reddit · r/LocalLLaMAQwen3.8-27B-FP8 能否在 RTX 5090 上用 vLLM 运行?
用户在 RTX 5090 上测试用 vLLM 部署 Qwen3.8-27B-FP8 模型,发现极难成功,即便勉强运行也会因上下文不足而不实用。该用户目前已用 NVFP4 量化版本实现稳定部署,支持 256k 上下文(去图像)。由于 FP8 版本仓库体积达 30.9GB,他在权衡 FP8 与 NVFP4 的精度差异后仍不确定能否落地。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。