Reddit · r/LocalLLaMA· /u/zyxciss·· 3 小时前AI 评分32
用户在 llama.cpp 中实现 Qwen 3.8 Flash Next IQ2_XS 加速方案,RTX 3060 12GB + 16GB DDR4 达成约 21 tok/s
Qwen 3.8 Flash Next-GSQ-RCO-IQ2_XS at ~21 tok/s on just an RTX 3060 12GB + 16GB DDR4 RAM(No gate pruning, 100% bit-exact)
AI 导读
一位用户在 llama.cpp 中加入 `--moe-direct-io` 预测式 MoE expert 预取功能,在 RTX 3060 12GB + 16GB DDR4。
来源:Reddit · r/LocalLLaMA · reddit.com