跳到正文
热点事件持续更新

网友在16GB显卡上量化运行Qwen3.8-27B并开启MTP

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月10日,Reddit r/LocalLLaMA用户报道,有网友在仅有16GB显存的RTX 4080显卡上运行Qwen3.8-27B模型。该网友将llmfan46发布的Qwen3.8-27B Heretic BF16版本进一步量化,得到UD-IQ4_XS等版本,在16GB显存限制下开启MTP head(即多token预测头)。测试结果显示,代码生成速度达55 tok/s,散文生成速度约50 tok/s;当关闭MTP时,速度降至29 tok/s。此外,在配置40K上下文长度的同一硬件条件下,生成速度可达68 tok/s。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月10日
  1. Reddit · r/LocalLLaMA
    玩家在 16GB 显卡上实现 Qwen3.8-27B UD-IQ4_XS Heretic + MTP 推理,代码任务达 55-68 tok/s

    网友在 RTX 4080 上将 llmfan46 的 Qwen3.8-27B Heretic BF16 量化成 UD-IQ4_XS 等版本,在 16GB 显存下开启 MTP head 实现 55 tok/s(代码)和 50 tok/s(散文)生成速度,关闭 MTP 时仅 29 tok/s;同卡配置 40K 上下文可达 68 tok/s。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。