Reddit · r/LocalLLaMA· /u/Crampappydime·· 6 天前AI 评分51
Qwen 3.8 Flash 量化版本发布
Qwen 3.8 flash for a single spark
AI 导读
开发者在 LocalLLaMA 社区发布了 Qwen 3.8 Flash base 的低比特量化版本,保留 95% 的 b16 精度,不会在长上下文场景下退化,推理速度约 40tok/s,支持 256kl 和 RoPE,可从 HuggingFace 下载。
来源:Reddit · r/LocalLLaMA · reddit.com