热点事件持续更新
vllm-ascend 在双卡 Ascend 310P 跑通 GLM-5.3-Flash,生成 8-9 tok/s
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
2026 年 10 月 12 日,Reddit r/LocalLLaMA 用户发帖称,已在双张 DDR4x 96GB Ascend 310P 显卡上,通过 vllm-ascend 推理框架跑通了 GLM-5.3-Flash 模型。该模型为 320B 参数的 MoE 架构,单 token 激活约 18B 参数。当前生成速度约 8-9 tok/s,首次冷启动 prefill 较慢,后续 prompt 处理速度更快。验证采用的具体配置为单请求 311,040 tokens、640-token 切片 prefill、最多 4 路并发。这是该事件首次见诸报道,此前的进展与更早的基线数据未在报道中提及。
AI 根据报道生成 · 55 分钟前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月12日
- Reddit · r/LocalLLaMAvllm-ascend 在双卡 Ascend 310P 上跑通 GLM-5.3-Flash,生成速度提升至 8-9 tok/s
GLM-5.3-Flash(320B 参数 MoE,单 token 激活约 18B)已在双 DDR4x Ascend 96GB 310P 显卡上跑通 vllm-ascend,当前生成速度约 8-9 tok/s(冷启动 prefill 较慢,后续 prompt 更快);验证配置为单请求 311,040 tokens、640-token 切片 prefill、最多 4 路并发。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。