跳到正文
原文
Reddit · r/LocalLLaMA· /u/TacGibs·· 12 小时前AI 评分21

社区推出 Qwen 3.8 27B Swift 1.5 量化版,可在 48GB VRAM 下兼顾速度与质量

48Gb VRAM speed AND quality ! (Qwen 3.8 27B Swift 1.5 W8A16)

AI 导读

用户 TacGibs 自行制作并发布了 Qwen 3.8 27B Swift 1.5 量化模型,采用 8-bit AWQ + GPTQ 量化方法。该模型在作者配备的 4 张 RTX 3090(共 48GB VRAM)上运行,vLLM 配合 MTP=5 时解码速度可达接近 100 tok/s,单卡显存占用约 21.6GB,并支持 128k 上下文与 FP16 KV cache。

来源:Reddit · r/LocalLLaMA · reddit.com