跳到正文
原文
Reddit · r/LocalLLaMA· /u/vulcan4d·· 1 天前AI 评分15

ik_llama.cpp 在多 GPU 层拆分混合推理中为何反而慢于主线 llama.cpp

Why is ik_llama.cpp said to be faster than Mainline? On my hybrid multi-GPU rig, Mainline easily beats it

AI 导读

用户在 4 张异构 GPU(3 张 P102-100 + 1 张 RTX 3060 12GB)混合卸载 Qwen 3.8 Flash-Next 177B(IQ3_XXS)并配合 AVX-512 CPU 跑 32k 上下文时。

来源:Reddit · r/LocalLLaMA · reddit.com