跳到正文
原文
Reddit · r/LocalLLaMA· /u/Adorable_Weakness_39·· 2 小时前AI 评分37

Qwen3.8-27B 单卡 3090 跑出 140 tok/s:定制 CUDA megakernel 较 llama.cpp 提速 1.4–1.9x

Qwen3.8-27B on a single 3090: 140 tok/s on code with a custom megakernel

AI 导读

用户借助 Claude Opus 5.5 为 Qwen3.8-27B(Q4_K_M 量化、单张 RTX 3090)编写了一款 CUDA megakernel,将整次投机解码 cycle 合并到单次 kernel launch 内。

来源:Reddit · r/LocalLLaMA · reddit.com