跳到正文
热点事件持续更新

vllm-ascend 在双卡 Ascend 310P 跑通 GLM-5.3-Flash,生成 8-9 tok/s

1 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

2026 年 10 月 12 日,Reddit r/LocalLLaMA 用户发帖称,已在双张 DDR4x 96GB Ascend 310P 显卡上,通过 vllm-ascend 推理框架跑通了 GLM-5.3-Flash 模型。该模型为 320B 参数的 MoE 架构,单 token 激活约 18B 参数。当前生成速度约 8-9 tok/s,首次冷启动 prefill 较慢,后续 prompt 处理速度更快。验证采用的具体配置为单请求 311,040 tokens、640-token 切片 prefill、最多 4 路并发。这是该事件首次见诸报道,此前的进展与更早的基线数据未在报道中提及。

AI 根据报道生成 · 55 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月12日
  1. Reddit · r/LocalLLaMA
    vllm-ascend 在双卡 Ascend 310P 上跑通 GLM-5.3-Flash,生成速度提升至 8-9 tok/s

    GLM-5.3-Flash(320B 参数 MoE,单 token 激活约 18B)已在双 DDR4x Ascend 96GB 310P 显卡上跑通 vllm-ascend,当前生成速度约 8-9 tok/s(冷启动 prefill 较慢,后续 prompt 更快);验证配置为单请求 311,040 tokens、640-token 切片 prefill、最多 4 路并发。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。