Reddit · r/LocalLLaMA· /u/pmttyji·· 2 小时前AI 评分25
用户反馈 llama.cpp PR#29887(MoE 专家 GPU 缓存特性)在低显存环境下性能不及预期
Probably I'm doing something wrong using PR#29887 (Add a GPU cache for MoE experts kept in host memory)
AI 导读
一名用户在 8GB VRAM(4060)+ 32GB DDR5 内存的设备上测试 llama.cpp 的 PR#29887(新增 MoE 专家 GPU 缓存特性),使用 Qwen3.6-35B-A3B-IQ4_XS GGUF 模型,对比 `-cmoe` 和 `fit` 模式以及不同 `--moe-cache-mib` 取值。
来源:Reddit · r/LocalLLaMA · reddit.com