跳到正文
原文
Reddit · r/LocalLLaMA· /u/matteiuspi·· 2 小时前AI 评分15

vllm-ascend 在双卡 Ascend 310P 上跑通 GLM-5.3-Flash,生成速度提升至 8-9 tok/s

vllm-ascend updates (GLM5.3-flash) on dual 310p Ascend cards

AI 导读

GLM-5.3-Flash(320B 参数 MoE,单 token 激活约 18B)已在双 DDR4x Ascend 96GB 310P 显卡上跑通 vllm-ascend,当前生成速度约 8-9 tok/s(冷启动 prefill 较慢,后续 prompt 更快);验证配置为单请求 311,040 tokens、640-token 切片 prefill、最多 4 路并发。

来源:Reddit · r/LocalLLaMA · reddit.com