跳到正文
原文
Reddit · r/LocalLLaMA· /u/Loose_Doubt367·· 3 小时前AI 评分6

如何在 llama.cpp Vulkan 下不解量化把 Tiel-Coder-35B-A3B 推到 30 tps 以上

Improve token per second without touching quant

AI 导读

用户在 AMD RX 6700 XT 12GB、DDR4-3200 与 R5 5600X 平台上,用 llama.cpp Vulkan SDK 跑 Tiel-Coder-35B-A3B 的 GGUF Q4_K_XL 版本,已稳定达到 30 tps,并在询问不解量化的前提下进一步冲到 40 tps 的方法。

来源:Reddit · r/LocalLLaMA · reddit.com