Slipstream推理引擎发布 Mac本地运行Qwen3.8模型
先了解这件事
2026年10月2日,开发者发布Slipstream推理引擎,可在64GB内存的Mac上以41–52 tok/s的速度运行95.5 GiB的Qwen3.8-Flash-Next模型,据称速度比llama.cpp快1.76倍。10月11日,另一名用户在搭载64GB内存的M3 Max Mac上通过oMLX成功运行了Qwen3.8-Flash-Next-oQ4e-mtp量化版本,以58GB显存加载了一个100GB模型,并启用了最高130k的上下文窗口。该用户在短会话测试中测得Prompt Processing速度为140.0 tok/s、Token Generation为15.8 tok/s,缓存命中率为90.9%
AI 根据报道生成 · 3 小时前更新
事件进展
- 10月11日 08:00 · 1 篇报道用户在64GB Mac上成功运行oMLX推理Qwen大模型Reddit · r/LocalLLaMA:用户在 M3 Max 64GB Mac 上用 oMLX 成功运行 Qwen3.8-Flash-Next-oQ4e-mtp
- 10月2日 04:21 · 1 篇报道Slipstream推理引擎发布,性能提升1.76倍Reddit · r/LocalLLaMA:Slipstream 发布:可在 64GB Mac 上以 41-52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next
报道时间线
沿着报道,了解事件的不同侧面。
- Reddit · r/LocalLLaMA用户在 M3 Max 64GB Mac 上用 oMLX 成功运行 Qwen3.8-Flash-Next-oQ4e-mtp
一名用户反馈,在搭载 64GB 内存的 M3 Max Mac 上通过 oMLX 成功运行了 Qwen3.8-Flash-Next-oQ4e-mtp,用 58GB GPU 内存加载一个 100GB 模型,并实现了最高 130k 上下文窗口。短会话测试显示 Prompt Processing 速度 140.0 tok/s、Token Generation 15.8 tok/s,缓存命中率 90.9%。
- Reddit · r/LocalLLaMA精选Slipstream 发布:可在 64GB Mac 上以 41-52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next
开发者发布 Slipstream 引擎,可在 64GB Mac 上以 41-52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next 模型,比 llama.cpp 快 1.76 倍。
本事件热度走势
当前热度 9·可比范围峰值 10(10月11日 09:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。