跳到正文
原文
Reddit · r/LocalLLaMA· /u/jacek2023·· 3 小时前AI 评分17

llama.cpp 的 ggml-cuda 为每个 warp 分配四个 GDN 状态列

ggml-cuda: assign four GDN state columns per warp by SongXiaoXi · Pull Request #30087 · ggml-org/llama.cpp

AI 导读

ggml-org/llama.cpp 的 ggml-cuda 提交 PR #30087,由 SongXiaoXi 实现为每个 warp 分配四个 GDN 状态列。测试显示,Qwen 3.x 的提示词处理速度提升:pp512 从 3075.24 增至 3243.60 t/s(+5.5%),pp4096 从 3059.87 增至 3221.08 t/s(+5.3%),tg128 提升 0.1%。

来源:Reddit · r/LocalLLaMA · reddit.com