跳到正文
热点事件持续更新

Mac Mini M5 64GB 本地跑通 Qwen Flash Next Q4 量化模型

3 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 5 日 14:44,用户在 Reddit r/LocalLLaMA 发帖称在 Mac Mini M5 64GB 设备上本地运行 Qwen Flash Next 的 Q4 量化模型,结合 SSD 流式读取与外部盘并行读取来缓解模型放不进内存的问题,首测取得 17.5 tks decode 与 360 tks prompt processing 的速度。同日 18:50,同一社区用户进一步公开 MoE SSD 流式加载方案的实测细节:将热门专家留在内存缓存、其他专家按需从 SSD 读取,GPU 有约 27% 的时间在等待专家层加载;prompt 处理速度由此前报道的 360 tks 提升至 390 tks,解码速度维持 17.5 t/s 不变,热缓存命中率为 75%。两次报道在解码速度上一致,但 prompt processing 速度存在差异——早先报道称 360 tks,后续报道称 390 tks。【新】10 月 8 日 23:56,同社区用户报告在 Apple Silicon 上用 llama.cpp 启用 MTP 后,GLM 5.3 Flash 首次在解码速度上反超 ds4,但 MTP 在 prompt processing 环节仍未带来优势;原帖提到 Qwen38FN 将是该设置的真正考验,并称原生 ds4 在并发下速度约为 65 t/s。

AI 根据报道生成 · 1 小时前更新

事件进展

2 个进展
  1. 10月8日 23:56 · 1 篇报道
    llama.cpp 的 MTP 解码在 Apple Silicon 上首次接近或超过 ds4 速度
    Reddit · r/LocalLLaMA:llama.cpp 在 Apple Silicon 上启用 MTP 后,GLM 5.3 Flash 首次解码速度超越 ds4
  2. 10月5日 14:44 · 2 篇报道
    用户在Mac Mini M5上运行Qwen Flash Next Q4量化模型
    Reddit · r/LocalLLaMA:用户在 Mac Mini M5 64GB 上跑通千问 Qwen Flash Next Q4,结合 SSD 流式与外部盘并行读取优化推理速度

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. Reddit · r/LocalLLaMA
    llama.cpp 在 Apple Silicon 上启用 MTP 后,GLM 5.3 Flash 首次解码速度超越 ds4

    用户在 Apple Silicon 上用 llama.cpp 启用 MTP 后,发现 GLM 5.3 Flash 首次在解码速度上反超 ds4,配合 IngeniousIdiocy 的 M3U 调参可达到更高并发;不过 MTP 在 pp(prompt processing)环节仍未带来优势。Qwen38FN 将是该设置真正的考验,因为原生 ds4 目前并发情况下速度约为 65 t/s。

10月5日
  1. Reddit · r/LocalLLaMA
    在 64 GB Mac mini 上做 MoE SSD 流式加载:Qwen Flash Next 解码时 GPU 仍有 27% 时间在等专家层

    用户在 64 GB Mac mini(M5)上运行 Qwen Flash Next 的 q4 量化版本,由于模型放不进内存,采用将热门专家留在缓存、其他专家从 SSD 流式加载的方案,测得 17.5 t/s 解码和 390 t/s prompt 处理速度,热缓存命中率为 75%。

  2. Reddit · r/LocalLLaMA
    用户在 Mac Mini M5 64GB 上跑通千问 Qwen Flash Next Q4,结合 SSD 流式与外部盘并行读取优化推理速度

    用户在 Mac Mini M5 64GB 上本地运行 Qwen Flash Next Q4 实测取得 17.5 tks decode 和 360 tks prompt processing 的速度。

本事件热度走势

当前热度 10·可比范围峰值 10(10月5日 19:00)·近 24 小时可比范围变化 –

02.557.51010月5日16:0010月6日19:0010月7日22:0010月9日01:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。