跳到正文
原文
Reddit · r/LocalLLaMA· /u/IceFog72·· 2 天前AI 评分19

ik_llama.cpp fork 新增 MoE 优化:专家常驻显存与自适应 CPU/GPU 混合执行,支持 Q2_0 量化

k_llama.cpp MoE Optimizations: Expert Residency, Hybrid CPU/GPU Execution, Q2_0 Support

AI 导读

开发者基于 ik_llama.cpp 推出新 fork,引入带宽自适应的 CPU/GPU 混合执行与 MoE 专家常驻(expert residency)机制,并新增 Q2_0 量化支持。

来源:Reddit · r/LocalLLaMA · reddit.com