跳到正文
热点事件持续更新

llama.cpp合并PR优化Qwen 3.x提示处理速度

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月8日,ggml-org/llama.cpp 的 ggml-cuda 提交 PR #30087,由 SongXiaoXi 实现为每个 warp 分配四个 GDN 状态列。测试显示,Qwen 3.x 的提示词处理速度提升:pp512 从 3075.24 增至 3243.60 t/s(+5.5%),pp4096 从 3059.87 增至 3221.08 t/s(+5.3%),tg128 提升 0.1%。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. Reddit · r/LocalLLaMA
    llama.cpp 的 ggml-cuda 为每个 warp 分配四个 GDN 状态列

    ggml-org/llama.cpp 的 ggml-cuda 提交 PR #30087,由 SongXiaoXi 实现为每个 warp 分配四个 GDN 状态列。测试显示,Qwen 3.x 的提示词处理速度提升:pp512 从 3075.24 增至 3243.60 t/s(+5.5%),pp4096 从 3059.87 增至 3221.08 t/s(+5.3%),tg128 提升 0.1%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。