Mac Mini M5 64GB 本地跑通 Qwen Flash Next Q4 量化模型
先了解这件事
2026 年 10 月 5 日 14:44,用户在 Reddit r/LocalLLaMA 发帖称在 Mac Mini M5 64GB 设备上本地运行 Qwen Flash Next 的 Q4 量化模型,结合 SSD 流式读取与外部盘并行读取来缓解模型放不进内存的问题,首测取得 17.5 tks decode 与 360 tks prompt processing 的速度。同日 18:50,同一社区用户进一步公开 MoE SSD 流式加载方案的实测细节:将热门专家留在内存缓存、其他专家按需从 SSD 读取,GPU 有约 27% 的时间在等待专家层加载;prompt 处理速度由此前报道的 360 tks 提升至 390 tks,解码速度维持 17.5 t/s 不变,热缓存命中率为 75%。两次报道在解码速度上一致,但 prompt processing 速度存在差异——早先报道称 360 tks,后续报道称 390 tks。【新】10 月 8 日 23:56,同社区用户报告在 Apple Silicon 上用 llama.cpp 启用 MTP 后,GLM 5.3 Flash 首次在解码速度上反超 ds4,但 MTP 在 prompt processing 环节仍未带来优势;原帖提到 Qwen38FN 将是该设置的真正考验,并称原生 ds4 在并发下速度约为 65 t/s。
AI 根据报道生成 · 1 小时前更新
事件进展
- 10月8日 23:56 · 1 篇报道llama.cpp 的 MTP 解码在 Apple Silicon 上首次接近或超过 ds4 速度Reddit · r/LocalLLaMA:llama.cpp 在 Apple Silicon 上启用 MTP 后,GLM 5.3 Flash 首次解码速度超越 ds4
- 10月5日 14:44 · 2 篇报道用户在Mac Mini M5上运行Qwen Flash Next Q4量化模型Reddit · r/LocalLLaMA:用户在 Mac Mini M5 64GB 上跑通千问 Qwen Flash Next Q4,结合 SSD 流式与外部盘并行读取优化推理速度
报道时间线
沿着报道,了解事件的不同侧面。
- Reddit · r/LocalLLaMAllama.cpp 在 Apple Silicon 上启用 MTP 后,GLM 5.3 Flash 首次解码速度超越 ds4
用户在 Apple Silicon 上用 llama.cpp 启用 MTP 后,发现 GLM 5.3 Flash 首次在解码速度上反超 ds4,配合 IngeniousIdiocy 的 M3U 调参可达到更高并发;不过 MTP 在 pp(prompt processing)环节仍未带来优势。Qwen38FN 将是该设置真正的考验,因为原生 ds4 目前并发情况下速度约为 65 t/s。
- Reddit · r/LocalLLaMA在 64 GB Mac mini 上做 MoE SSD 流式加载:Qwen Flash Next 解码时 GPU 仍有 27% 时间在等专家层
用户在 64 GB Mac mini(M5)上运行 Qwen Flash Next 的 q4 量化版本,由于模型放不进内存,采用将热门专家留在缓存、其他专家从 SSD 流式加载的方案,测得 17.5 t/s 解码和 390 t/s prompt 处理速度,热缓存命中率为 75%。
- Reddit · r/LocalLLaMA用户在 Mac Mini M5 64GB 上跑通千问 Qwen Flash Next Q4,结合 SSD 流式与外部盘并行读取优化推理速度
用户在 Mac Mini M5 64GB 上本地运行 Qwen Flash Next Q4 实测取得 17.5 tks decode 和 360 tks prompt processing 的速度。
本事件热度走势
当前热度 10·可比范围峰值 10(10月5日 19:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。