跳到正文
热点事件持续更新

Slipstream推理引擎发布 Mac本地运行Qwen3.8模型

2 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月2日,开发者发布Slipstream推理引擎,可在64GB内存的Mac上以41–52 tok/s的速度运行95.5 GiB的Qwen3.8-Flash-Next模型,据称速度比llama.cpp快1.76倍。10月11日,另一名用户在搭载64GB内存的M3 Max Mac上通过oMLX成功运行了Qwen3.8-Flash-Next-oQ4e-mtp量化版本,以58GB显存加载了一个100GB模型,并启用了最高130k的上下文窗口。该用户在短会话测试中测得Prompt Processing速度为140.0 tok/s、Token Generation为15.8 tok/s,缓存命中率为90.9%

AI 根据报道生成 · 3 小时前更新

事件进展

2 个进展
  1. 10月11日 08:00 · 1 篇报道
    用户在64GB Mac上成功运行oMLX推理Qwen大模型
    Reddit · r/LocalLLaMA:用户在 M3 Max 64GB Mac 上用 oMLX 成功运行 Qwen3.8-Flash-Next-oQ4e-mtp
  2. 10月2日 04:21 · 1 篇报道
    Slipstream推理引擎发布,性能提升1.76倍
    Reddit · r/LocalLLaMA:Slipstream 发布:可在 64GB Mac 上以 41-52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next

报道时间线

沿着报道,了解事件的不同侧面。

10月11日
  1. Reddit · r/LocalLLaMA
    用户在 M3 Max 64GB Mac 上用 oMLX 成功运行 Qwen3.8-Flash-Next-oQ4e-mtp

    一名用户反馈,在搭载 64GB 内存的 M3 Max Mac 上通过 oMLX 成功运行了 Qwen3.8-Flash-Next-oQ4e-mtp,用 58GB GPU 内存加载一个 100GB 模型,并实现了最高 130k 上下文窗口。短会话测试显示 Prompt Processing 速度 140.0 tok/s、Token Generation 15.8 tok/s,缓存命中率 90.9%。

10月2日
  1. Reddit · r/LocalLLaMA精选
    Slipstream 发布:可在 64GB Mac 上以 41-52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next

    开发者发布 Slipstream 引擎,可在 64GB Mac 上以 41-52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next 模型,比 llama.cpp 快 1.76 倍。

本事件热度走势

当前热度 9·可比范围峰值 10(10月11日 09:00)·近 24 小时可比范围变化 –

02.557.51010月11日09:0010月11日10:0010月11日10:0010月11日11:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。