Reddit · r/LocalLLaMA· /u/jacek2023·· 7 天前AI 评分58
llama.cpp 合并 Qwen Flash Next 的 MTP 支持 PR
Qwen4Exp: add MTP by am17an · Pull Request #29761 · ggml-org/llama.cpp
AI 导读
llama.cpp 合并了 PR #29761,为 Qwen Flash Next 模型增加 MTP(Multi-Token Prediction)支持,开发耗时 17 小时。模型量化版本已上线 HuggingFace,用户可考虑是否从 Qwen 3.8 27B 切换。
来源:Reddit · r/LocalLLaMA · reddit.com