Reddit · r/LocalLLaMA· /u/Biomass23·· 7 天前AI 评分40
在 vLLM 上实现 6 卡张量并行:Qwen 3.8 27B 模型 padding 方案
tp=6 can work on vLLM, with padding
AI 导读
用户通过 padding 模型参数使其可被 6 整除,成功在 6 张 7900 XTX GPU 上运行 vLLM 的张量并行。实际部署 Qwen 3.8 27B BF16 模型支持 256k 上下文窗口,单用户 token 生成速度约 50 t/s,8 并发 prompts 聚合达 200 t/s。
来源:Reddit · r/LocalLLaMA · reddit.com