跳到正文
原文
Reddit · r/LocalLLaMA· /u/Dreeew84·· 3 小时前AI 评分5

在 2 x RTX3060 上本地运行千问 Qwen3.8-Flash-Next 的 llama.cpp 参数求助

Please recommend Qwen3.8-Flash-Next llama parameters

AI 导读

用户用 vanilla llama.cpp 在 2 x RTX3060 12GB + 64GB RAM 配置上跑千问(Qwen)3.8-Flash-Next 的 IQ3_XXS 量化版本,think 模式最好成绩仅 15 tps,远低于 Strata 给出的 35 tps think / 50 tps 代码速度。

来源:Reddit · r/LocalLLaMA · reddit.com