Reddit · r/LocalLLaMA· /u/IceFog72·· 2 天前AI 评分19
ik_llama.cpp fork 新增 MoE 优化:专家常驻显存与自适应 CPU/GPU 混合执行,支持 Q2_0 量化
k_llama.cpp MoE Optimizations: Expert Residency, Hybrid CPU/GPU Execution, Q2_0 Support
AI 导读
开发者基于 ik_llama.cpp 推出新 fork,引入带宽自适应的 CPU/GPU 混合执行与 MoE 专家常驻(expert residency)机制,并新增 Q2_0 量化支持。
来源:Reddit · r/LocalLLaMA · reddit.com