跳到正文
热点事件持续更新

Qwen3.8-Flash-Next发布GGUF量化模型及Coder版本,随后更新LoRA微调方案

2 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年9月29日,Qwen3.8-Flash-Next量化模型正式发布。该模型为稀疏MoE架构,拥有512个路由专家层,总参数达176.9B。本次发布提供4个GGUF量化版本,量化精度范围为2.40-3.50 bpw。同时推出Coder版本,该版本通过RCO(Rank-Constrained Optimization)技术剪枝50%专家,旨在优化代码生成任务的性能表现。10月9日,该模型出现后续更新:有开发者更新了"LoRA over GGUF"系列微调方案,可在40 GiB VRAM上无需CPU卸载即可训练Qwen3.8-Flash-Next,其中提到的模型配置为125B-A6B外加51B engram参数(与首次发布时176.9B总参数的表述存在差异)。

AI 根据报道生成 · 2 小时前更新

事件进展

2 个进展
  1. 10月9日 11:54 · 1 篇报道
    LoRA over GGUF 训练方案可在 40G VRAM 训练 Qwen3.8-Flash-Next
    Reddit · r/LocalLLaMA:在 40 GiB VRAM 上 LoRA 微调 Qwen3.8-Flash-Next 的 GGUF 方案更新
  2. 9月29日 16:40 · 1 篇报道
    Qwen3.8-Flash-Next 发布 GSQ/RCO 量化 GGUF 模型,同时推出 50% 专家剪枝的 Code
    Reddit · r/LocalLLaMA:Qwen3.8-Flash-Next 发布 GSQ/RCO 量化 GGUF 模型,同时推出 50% 专家剪枝的 Coder 版本

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. Reddit · r/LocalLLaMA
    在 40 GiB VRAM 上 LoRA 微调 Qwen3.8-Flash-Next 的 GGUF 方案更新

    开发者更新了"LoRA over GGUF"系列方案,可在 40 GiB VRAM 上无 CPU 卸载训练 Qwen3.8-Flash-Next(125B-A6B + 51B engram)。

9月29日
  1. Reddit · r/LocalLLaMA
    Qwen3.8-Flash-Next 发布 GSQ/RCO 量化 GGUF 模型,同时推出 50% 专家剪枝的 Coder 版本

    ISTAQwen3.8-Flash-Next 量化模型发布,这是稀疏 MoE 模型(512 路由专家/层,176.9B 参数)。提供 4 个 GGUF 量化版本(2.40-3.50 bpw),以及通过 RCO 剪枝 50% 专家的 Coder 版本。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。