Reddit · r/LocalLLaMA· /u/BitGreen1270·· 2 小时前AI 评分7
Qwen3.8-27B-FP8 能否在 RTX 5090 上用 vLLM 运行?
[vllm] Is it possible to run Qwen3.8-27B-FP8 on a 5090?
AI 导读
用户在 RTX 5090 上测试用 vLLM 部署 Qwen3.8-27B-FP8 模型,发现极难成功,即便勉强运行也会因上下文不足而不实用。该用户目前已用 NVFP4 量化版本实现稳定部署,支持 256k 上下文(去图像)。由于 FP8 版本仓库体积达 30.9GB,他在权衡 FP8 与 NVFP4 的精度差异后仍不确定能否落地。
来源:Reddit · r/LocalLLaMA · reddit.com