Qwen3.8系列模型在消费级硬件本地推理持续提速
先了解这件事
2026年9月30日,有用户在 Reddit r/LocalLLaMA 社区发布消息,称 Strata 推理引擎在配备 RTX 5070ti 12GB VRAM、64GB RAM 的笔记本上运行 Qwen3.8 flash 模型,在 43k 上下文深度下实现 51 t/s 的推理速度,较 stock llama.cpp 的 23 t/s 提升超过 2 倍,上下文读取速度达 1500 t/s。2026年10月4日,Hacker News 首页出现后续报道,称 Strata 项目让用户在搭载 RTX 5070(12 GB)或 RX 9070 XT 等消费级显卡、32 GB 以上内存的普通 PC 上本地运行 1250 亿参数的 Qwen3.8-Flash-Next 模型,其中 NVIDIA 平台 Q2_0 量化下写作速度最高 94 tokens/s,读取 32K prompt 达 2,650 tokens/s(标题中写作'约 100 tokens/s')。2026年10月10日,Reddit r/LocalLLaMA 出现两条新报道:一是介绍基于 Strata 改写、仅支持 Qwen3.8 Flash-Next 的 Blackwell 推理引擎 Basalt,在 5090 + 5060 Ti 双卡上以 IQ3_XXS 量化达成 665 tok/s 结构化输出与 354 tok/s 散文生成,速度约为 Strata 的 2.6 倍,单张 5090 也可运行且仅慢约 12%;二是开发者 yibie 推出 strata-mlx,一个基于 Strata 设计的非官方 MLX 引擎,可在 Mac 上直接读取 Strata 的 GGUF 文件运行 125B 参数的 MoE 模型 Qwen3.8-Flash-Next,无需改动权重。
AI 根据报道生成 · 2 小时前更新
事件进展
- 10月10日 16:03 · 1 篇报道开发者发布 Mac 本地运行 Qwen3 MoE 模型引擎 strata-mlxReddit · r/LocalLLaMA:strata-mlx:让 Qwen3.8-Flash-Next 125B MoE 模型在 Mac 上跑起来的非官方 MLX 引擎
- 10月10日 08:58 · 1 篇报道开源 Basalt 推理引擎优化 Qwen3.8 Flash-NextReddit · r/LocalLLaMA:Basalt:专为 Qwen3.8 Flash-Next 与 Blackwell 打造的推理引擎,5090 + 5060 Ti 双卡达 665 tok/s
- 10月4日 20:51 · 1 篇报道Strata开源工具支持在消费级硬件运行Qwen3.8 Flash Next 125B模型Hacker News · 首页:用消费级显卡(RTX 4090)本地运行 Qwen3.8-Flash-Next(125B),Strata 项目实测可达约 100 tokens/s
- 9月30日 12:01 · 1 篇报道Qwen3.8 flash 配合 Strata 推理引擎在 12GB VRAM 笔记本上实现 51t/s 推理与 150Reddit · r/LocalLLaMA:Qwen3.8 flash 配合 Strata 推理引擎在 12GB VRAM 笔记本上实现 51t/s 推理与 1500t/s 上下文读取
报道时间线
沿着报道,了解事件的不同侧面。
- Reddit · r/LocalLLaMAstrata-mlx:让 Qwen3.8-Flash-Next 125B MoE 模型在 Mac 上跑起来的非官方 MLX 引擎
开发者 yibie 推出 strata-mlx,一个基于 Strata 设计的非官方 MLX 引擎,可在 Mac 上直接读取 Strata 的 GGUF 文件运行 125B 参数的 MoE 模型 Qwen3.8-Flash-Next,无需改动权重。
- Reddit · r/LocalLLaMABasalt:专为 Qwen3.8 Flash-Next 与 Blackwell 打造的推理引擎,5090 + 5060 Ti 双卡达 665 tok/s
Basalt 是一款基于 Strata 改写的 Blackwell 推理引擎,仅支持 Qwen3.8 Flash-Next,在 5090 + 5060 Ti 双卡上以 IQ3_XXS 量化达成 665 tok/s 结构化输出与 354 tok/s 散文生成,速度约为 Strata 的 2.6 倍,单张 5090 也可运行且仅慢约 12%。
- Hacker News · 首页用消费级显卡(RTX 4090)本地运行 Qwen3.8-Flash-Next(125B),Strata 项目实测可达约 100 tokens/s
Strata 项目让用户在搭载 RTX 5070(12 GB)或 RX 9070 XT 等消费级显卡、32 GB 以上内存的普通 PC 上本地运行 1250 亿参数的 Qwen3.8-Flash-Next 模型,NVIDIA 平台 Q2_0 量化下写作速度最高 94 tokens/s、读取 32K prompt 达 2,650 tokens/s。
- Reddit · r/LocalLLaMAQwen3.8 flash 配合 Strata 推理引擎在 12GB VRAM 笔记本上实现 51t/s 推理与 1500t/s 上下文读取
Strata 推理引擎在配备 5070ti 12GB VRAM、64GB RAM 的笔记本上运行 Qwen3.8 flash 模型,43k 上下文深度下达 51 t/s,较 stock llama.cpp 的 23 t/s 提升超过 2 倍。
本事件热度走势
当前热度 10·可比范围峰值 10(10月10日 18:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。