Reddit · r/LocalLLaMA· /u/TacGibs·· 12 小时前AI 评分21
社区推出 Qwen 3.8 27B Swift 1.5 量化版,可在 48GB VRAM 下兼顾速度与质量
48Gb VRAM speed AND quality ! (Qwen 3.8 27B Swift 1.5 W8A16)
AI 导读
用户 TacGibs 自行制作并发布了 Qwen 3.8 27B Swift 1.5 量化模型,采用 8-bit AWQ + GPTQ 量化方法。该模型在作者配备的 4 张 RTX 3090(共 48GB VRAM)上运行,vLLM 配合 MTP=5 时解码速度可达接近 100 tok/s,单卡显存占用约 21.6GB,并支持 128k 上下文与 FP16 KV cache。
来源:Reddit · r/LocalLLaMA · reddit.com