跳到正文
原文
Reddit · r/LocalLLaMA· /u/Biomass23·· 7 天前AI 评分40

在 vLLM 上实现 6 卡张量并行:Qwen 3.8 27B 模型 padding 方案

tp=6 can work on vLLM, with padding

AI 导读

用户通过 padding 模型参数使其可被 6 整除,成功在 6 张 7900 XTX GPU 上运行 vLLM 的张量并行。实际部署 Qwen 3.8 27B BF16 模型支持 256k 上下文窗口,单用户 token 生成速度约 50 t/s,8 并发 prompts 聚合达 200 t/s。

来源:Reddit · r/LocalLLaMA · reddit.com