跳到正文
原文
Reddit · r/LocalLLaMA· /u/jacek2023·· 7 天前AI 评分58

llama.cpp 合并 Qwen Flash Next 的 MTP 支持 PR

Qwen4Exp: add MTP by am17an · Pull Request #29761 · ggml-org/llama.cpp

AI 导读

llama.cpp 合并了 PR #29761,为 Qwen Flash Next 模型增加 MTP(Multi-Token Prediction)支持,开发耗时 17 小时。模型量化版本已上线 HuggingFace,用户可考虑是否从 Qwen 3.8 27B 切换。

来源:Reddit · r/LocalLLaMA · reddit.com