veloGB10 跑 Swift 1.5 模型达 110 tok/s,MLX 版登陆 M5 Ultra Mac Studio
先了解这件事
据 Reddit r/LocalLLaMA 报道,UkisAI 基于 Qwen3.8-Flash-Next 微调的 Swift 1.5(推理高效版)模型,在两台 DGX Spark 上借助 sf-stav 的 Rust/CUDA 推理引擎 veloGB10,实现了约 110 tok/s 的单流解码速度;运行 xhigh effort 档位时,其表现仍优于旧版 vLLM NVFP4 环境下 base Flash-Next 的 medium 档位中档 vLLM 表现。10 月 6 日,网友 DankpawsDev 针对搭载 M5 Ultra 的 96GB Mac Studio,发布了同一 Swift 1.5 模型的 MLX 校准量化版本,文件约 107GB,为纯文本模型,实测支持 179,200 token 上下文,将该模型从 DGX Spark/CUDA 平台扩展到了 Apple Silicon 平台。此前无更早相关报道。
AI 根据报道生成 · 2 天前更新
事件进展
- 10月6日 09:47 · 1 篇报道Dankpaws 发布 M5 Ultra 定制 MLX 量化模型Reddit · r/LocalLLaMA:社区为 96GB M5 Ultra Mac Studio 发布 Swift 1.5 Qwen3.8 Flash 的 MLX 量化版本
- 10月5日 23:04 · 1 篇报道veloGB10 运行 Swift 1.5 微调模型约 110 tok/sReddit · r/LocalLLaMA:在 veloGB10 上运行 Swift 1.5:xhigh 档位反超 base Flash-Next 中档 vLLM 表现
报道时间线
沿着报道,了解事件的不同侧面。
- Reddit · r/LocalLLaMA社区为 96GB M5 Ultra Mac Studio 发布 Swift 1.5 Qwen3.8 Flash 的 MLX 量化版本
网友 DankpawsDev 针对搭载 M5 Ultra 的 96GB Mac Studio,发布了 UkisAI Swift 1.5(基于 Qwen3.8 Flash)的 MLX 校准量化版本,文件约 107GB,仅文本、实测 179,200 token 上下文。
- Reddit · r/LocalLLaMA在 veloGB10 上运行 Swift 1.5:xhigh 档位反超 base Flash-Next 中档 vLLM 表现
在两台 DGX Spark 上,UkisAI 基于 Qwen3.8-Flash-Next 微调的 Swift 1.5(推理高效版)借助 sf-stav 的 Rust/CUDA 推理引擎 veloGB10 实现了约 110 tok/s 的单流解码速度,运行 xhigh effort 仍比旧 vLLM NVFP4 环境下 base Flash-Next medium 档更快。
本事件热度走势
当前热度 3·可比范围峰值 10(10月6日 00:00)·近 24 小时可比范围变化 -49%
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。