Reddit · r/LocalLLaMA· /u/Dreeew84·· 3 小时前AI 评分5
在 2 x RTX3060 上本地运行千问 Qwen3.8-Flash-Next 的 llama.cpp 参数求助
Please recommend Qwen3.8-Flash-Next llama parameters
AI 导读
用户用 vanilla llama.cpp 在 2 x RTX3060 12GB + 64GB RAM 配置上跑千问(Qwen)3.8-Flash-Next 的 IQ3_XXS 量化版本,think 模式最好成绩仅 15 tps,远低于 Strata 给出的 35 tps think / 50 tps 代码速度。
来源:Reddit · r/LocalLLaMA · reddit.com