RTX 3090运行Qwen3.8-27B本地编码性能测试
先了解这件事
2026年10月2日,有用户在Reddit社区r/LocalLLaMA分享了使用单张RTX 3090 24GB显卡运行Qwen3.8-27B(Q4_K_M量化版本,约16.8GB)进行本地编码AI智能体测试的结果。测试使用OpenCode作为编码助手,在131K上下文环境下进行,涵盖四个编码任务。结果显示,2K输入长度时吞吐量为36.4 tok/s,120K输入长度时吞吐量下降至20.9 tok/s,表明长上下文处理对本地部署推理速度有显著影响。2026年10月10日,该用户发布后续进展,借助Claude Opus 5.5为Qwen3.8-27B(Q4_K_M量化、单张RTX 3090)编写了一款定制CUDA megakernel,将整次投机解码cycle合并到单次kernel launch内,跑出140 tok/s的速度,较llama.cpp实现1.4–1.9倍提速。
AI 根据报道生成 · 38 分钟前更新
事件进展
- 10月10日 21:01 · 1 篇报道用户为Qwen3-27B编写CUDA megakernel,单卡3090代码生成达140 tok/sReddit · r/LocalLLaMA:Qwen3.8-27B 单卡 3090 跑出 140 tok/s:定制 CUDA megakernel 较 llama.cpp 提速 1.4–1.9x
- 10月2日 04:04 · 1 篇报道RTX 3090运行Qwen3.8-27B编码助手测试Reddit · r/LocalLLaMA:Qwen3.8-27B Q4_K_M 在单张 RTX 3090 上的本地编码测试:吞吐量与四个编码任务表现
报道时间线
沿着报道,了解事件的不同侧面。
- Reddit · r/LocalLLaMAQwen3.8-27B 单卡 3090 跑出 140 tok/s:定制 CUDA megakernel 较 llama.cpp 提速 1.4–1.9x
用户借助 Claude Opus 5.5 为 Qwen3.8-27B(Q4_K_M 量化、单张 RTX 3090)编写了一款 CUDA megakernel,将整次投机解码 cycle 合并到单次 kernel launch 内。
- Reddit · r/LocalLLaMAQwen3.8-27B Q4_K_M 在单张 RTX 3090 上的本地编码测试:吞吐量与四个编码任务表现
使用 RTX 3090 24GB 搭配 Qwen3.8-27B(Q4_K_M 量化,约 16.8GB)和 OpenCode 进行本地编码 AI 智能体测试,131K 上下文下吞吐量随输入长度下降(2K 输入 36.4 tok/s,120K 输入 20.9 tok/s)。
本事件热度走势
当前热度 3·可比范围峰值 3(10月3日 23:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。