跳到正文
热点事件持续更新

RTX 3090运行Qwen3.8-27B本地编码性能测试

2 篇报道1 个报道来源59 分钟前更新

先了解这件事

AI 综述

2026年10月2日,有用户在Reddit社区r/LocalLLaMA分享了使用单张RTX 3090 24GB显卡运行Qwen3.8-27B(Q4_K_M量化版本,约16.8GB)进行本地编码AI智能体测试的结果。测试使用OpenCode作为编码助手,在131K上下文环境下进行,涵盖四个编码任务。结果显示,2K输入长度时吞吐量为36.4 tok/s,120K输入长度时吞吐量下降至20.9 tok/s,表明长上下文处理对本地部署推理速度有显著影响。2026年10月10日,该用户发布后续进展,借助Claude Opus 5.5为Qwen3.8-27B(Q4_K_M量化、单张RTX 3090)编写了一款定制CUDA megakernel,将整次投机解码cycle合并到单次kernel launch内,跑出140 tok/s的速度,较llama.cpp实现1.4–1.9倍提速。

AI 根据报道生成 · 38 分钟前更新

事件进展

2 个进展
  1. 10月10日 21:01 · 1 篇报道
    用户为Qwen3-27B编写CUDA megakernel,单卡3090代码生成达140 tok/s
    Reddit · r/LocalLLaMA:Qwen3.8-27B 单卡 3090 跑出 140 tok/s:定制 CUDA megakernel 较 llama.cpp 提速 1.4–1.9x
  2. 10月2日 04:04 · 1 篇报道
    RTX 3090运行Qwen3.8-27B编码助手测试
    Reddit · r/LocalLLaMA:Qwen3.8-27B Q4_K_M 在单张 RTX 3090 上的本地编码测试:吞吐量与四个编码任务表现

报道时间线

沿着报道,了解事件的不同侧面。

10月10日
  1. Reddit · r/LocalLLaMA
    Qwen3.8-27B 单卡 3090 跑出 140 tok/s:定制 CUDA megakernel 较 llama.cpp 提速 1.4–1.9x

    用户借助 Claude Opus 5.5 为 Qwen3.8-27B(Q4_K_M 量化、单张 RTX 3090)编写了一款 CUDA megakernel,将整次投机解码 cycle 合并到单次 kernel launch 内。

10月2日
  1. Reddit · r/LocalLLaMA
    Qwen3.8-27B Q4_K_M 在单张 RTX 3090 上的本地编码测试:吞吐量与四个编码任务表现

    使用 RTX 3090 24GB 搭配 Qwen3.8-27B(Q4_K_M 量化,约 16.8GB)和 OpenCode 进行本地编码 AI 智能体测试,131K 上下文下吞吐量随输入长度下降(2K 输入 36.4 tok/s,120K 输入 20.9 tok/s)。

本事件热度走势

当前热度 3·可比范围峰值 3(10月3日 23:00)·近 24 小时可比范围变化 –

012310月3日23:0010月4日01:0010月4日02:0010月4日04:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。