跳到正文
原文
Reddit · r/LocalLLaMA· /u/Specific-Tax-6700·· 4 天前AI 评分72

AgrillaMoE:面向16GB GPU的Qwen3.6-35B MoE推理引擎发布

poorman inference engine for 16GB GPU and 35B moe Qwen 3.6for coding

AI 导读

作者基于llama.cpp服务器创建了AgrillaMoE,专门优化Qwen3.6-35B-A3B模型。在16GB V100上使用2-bit UD-Q2_K_XL量化实现57-60 tok/s生成速度,支持OpenAI和Anthropic API,Claude Code可直接调用。

来源:Reddit · r/LocalLLaMA · reddit.com