跳到正文
热点事件观察中

veloGB10 跑 Swift 1.5 模型达 110 tok/s,MLX 版登陆 M5 Ultra Mac Studio

2 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

据 Reddit r/LocalLLaMA 报道,UkisAI 基于 Qwen3.8-Flash-Next 微调的 Swift 1.5(推理高效版)模型,在两台 DGX Spark 上借助 sf-stav 的 Rust/CUDA 推理引擎 veloGB10,实现了约 110 tok/s 的单流解码速度;运行 xhigh effort 档位时,其表现仍优于旧版 vLLM NVFP4 环境下 base Flash-Next 的 medium 档位中档 vLLM 表现。10 月 6 日,网友 DankpawsDev 针对搭载 M5 Ultra 的 96GB Mac Studio,发布了同一 Swift 1.5 模型的 MLX 校准量化版本,文件约 107GB,为纯文本模型,实测支持 179,200 token 上下文,将该模型从 DGX Spark/CUDA 平台扩展到了 Apple Silicon 平台。此前无更早相关报道。

AI 根据报道生成 · 2 天前更新

事件进展

2 个进展
  1. 10月6日 09:47 · 1 篇报道
    Dankpaws 发布 M5 Ultra 定制 MLX 量化模型
    Reddit · r/LocalLLaMA:社区为 96GB M5 Ultra Mac Studio 发布 Swift 1.5 Qwen3.8 Flash 的 MLX 量化版本
  2. 10月5日 23:04 · 1 篇报道
    veloGB10 运行 Swift 1.5 微调模型约 110 tok/s
    Reddit · r/LocalLLaMA:在 veloGB10 上运行 Swift 1.5:xhigh 档位反超 base Flash-Next 中档 vLLM 表现

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. Reddit · r/LocalLLaMA
    社区为 96GB M5 Ultra Mac Studio 发布 Swift 1.5 Qwen3.8 Flash 的 MLX 量化版本

    网友 DankpawsDev 针对搭载 M5 Ultra 的 96GB Mac Studio,发布了 UkisAI Swift 1.5(基于 Qwen3.8 Flash)的 MLX 校准量化版本,文件约 107GB,仅文本、实测 179,200 token 上下文。

10月5日
  1. Reddit · r/LocalLLaMA
    在 veloGB10 上运行 Swift 1.5:xhigh 档位反超 base Flash-Next 中档 vLLM 表现

    在两台 DGX Spark 上,UkisAI 基于 Qwen3.8-Flash-Next 微调的 Swift 1.5(推理高效版)借助 sf-stav 的 Rust/CUDA 推理引擎 veloGB10 实现了约 110 tok/s 的单流解码速度,运行 xhigh effort 仍比旧 vLLM NVFP4 环境下 base Flash-Next medium 档更快。

本事件热度走势

当前热度 3·可比范围峰值 10(10月6日 00:00)·近 24 小时可比范围变化 -49%

02.557.51010月6日00:0010月6日19:0010月7日14:0010月8日09:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。