Reddit · r/LocalLLaMA· /u/vulcan4d·· 1 天前AI 评分15
ik_llama.cpp 在多 GPU 层拆分混合推理中为何反而慢于主线 llama.cpp
Why is ik_llama.cpp said to be faster than Mainline? On my hybrid multi-GPU rig, Mainline easily beats it
AI 导读
用户在 4 张异构 GPU(3 张 P102-100 + 1 张 RTX 3060 12GB)混合卸载 Qwen 3.8 Flash-Next 177B(IQ3_XXS)并配合 AVX-512 CPU 跑 32k 上下文时。
来源:Reddit · r/LocalLLaMA · reddit.com