跳到正文
原文
Reddit · r/LocalLLaMA· /u/BitGreen1270·· 2 小时前AI 评分7

Qwen3.8-27B-FP8 能否在 RTX 5090 上用 vLLM 运行?

[vllm] Is it possible to run Qwen3.8-27B-FP8 on a 5090?

AI 导读

用户在 RTX 5090 上测试用 vLLM 部署 Qwen3.8-27B-FP8 模型,发现极难成功,即便勉强运行也会因上下文不足而不实用。该用户目前已用 NVFP4 量化版本实现稳定部署,支持 256k 上下文(去图像)。由于 FP8 版本仓库体积达 30.9GB,他在权衡 FP8 与 NVFP4 的精度差异后仍不确定能否落地。

来源:Reddit · r/LocalLLaMA · reddit.com