Reddit · r/LocalLLaMA· /u/Loose_Doubt367·· 3 小时前AI 评分6
如何在 llama.cpp Vulkan 下不解量化把 Tiel-Coder-35B-A3B 推到 30 tps 以上
Improve token per second without touching quant
AI 导读
用户在 AMD RX 6700 XT 12GB、DDR4-3200 与 R5 5600X 平台上,用 llama.cpp Vulkan SDK 跑 Tiel-Coder-35B-A3B 的 GGUF Q4_K_XL 版本,已稳定达到 30 tps,并在询问不解量化的前提下进一步冲到 40 tps 的方法。
来源:Reddit · r/LocalLLaMA · reddit.com