跳到正文
原文
Reddit · r/LocalLLaMA· /u/Crampappydime·· 6 天前AI 评分51

Qwen 3.8 Flash 量化版本发布

Qwen 3.8 flash for a single spark

AI 导读

开发者在 LocalLLaMA 社区发布了 Qwen 3.8 Flash base 的低比特量化版本,保留 95% 的 b16 精度,不会在长上下文场景下退化,推理速度约 40tok/s,支持 256kl 和 RoPE,可从 HuggingFace 下载。

来源:Reddit · r/LocalLLaMA · reddit.com