Reddit · r/LocalLLaMA· /u/jacek2023·· 4 小时前AI 评分36
27B 级别推理模型推出三值量化版本,可在 Apple M5 Max 等笔记本上以 ~47 tok/s 运行
Now you can grow Bonsai on your potato
AI 导读
基于 Qwen3.8-27B hybrid-attention 骨干,社区推出端到端三值量化(ternary)权重版本,在 llama.cpp(CUDA / Metal / CPU)上提供完整 27B 级 reasoning 能力,体积较 FP16 缩小约 9.3 倍、约 5.9 GB,可在 Apple M5 Max 笔记本上达到约 47 tok/s。
来源:Reddit · r/LocalLLaMA · reddit.com