跳到正文
热点事件持续更新

用户发布 Qwen 3.8 27B Swift 1.5 W8A16 量化模型

1 篇报道1 个报道来源11 小时前更新

先了解这件事

AI 综述

2026年10月11日,Reddit r/LocalLLaMA 用户 TacGibs 自行制作并发布了 Qwen 3.8 27B Swift 1.5 的量化版本。该模型采用 8-bit AWQ 叠加 GPTQ 的 W8A16 量化方案,目标是在 48GB VRAM 的硬件条件下兼顾推理速度与生成质量。据作者实测,在其 4 张 RTX 3090(共 48GB VRAM)的环境下,通过 vLLM 并设置 MTP=5 时,解码速度可接近 100 tok/s,单卡显存占用约 21.6GB,同时支持 128k 上下文长度与 FP16 KV cache。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月11日
  1. Reddit · r/LocalLLaMA
    社区推出 Qwen 3.8 27B Swift 1.5 量化版,可在 48GB VRAM 下兼顾速度与质量

    用户 TacGibs 自行制作并发布了 Qwen 3.8 27B Swift 1.5 量化模型,采用 8-bit AWQ + GPTQ 量化方法。该模型在作者配备的 4 张 RTX 3090(共 48GB VRAM)上运行,vLLM 配合 MTP=5 时解码速度可达接近 100 tok/s,单卡显存占用约 21.6GB,并支持 128k 上下文与 FP16 KV cache。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。