Reddit · r/LocalLLaMA· /u/Adorable_Weakness_39·· 2 小时前AI 评分37
Qwen3.8-27B 单卡 3090 跑出 140 tok/s:定制 CUDA megakernel 较 llama.cpp 提速 1.4–1.9x
Qwen3.8-27B on a single 3090: 140 tok/s on code with a custom megakernel
AI 导读
用户借助 Claude Opus 5.5 为 Qwen3.8-27B(Q4_K_M 量化、单张 RTX 3090)编写了一款 CUDA megakernel,将整次投机解码 cycle 合并到单次 kernel launch 内。
来源:Reddit · r/LocalLLaMA · reddit.com