Reddit · r/LocalLLaMA· /u/ayobluestarr·· 5 天前AI 评分60
Qwen3.8-Flash-Next 177B 在单张 RTX 5070 12GB 上达到 11-15 tok/s
Qwen3.8-Flash-Next 177B running at 11–15 tok/s on a single RTX 5070 12GB + 32GB RAM DDR4
AI 导读
用户在 Reddit 分享了在 Windows 上用 llama.cpp 优化 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS)推理的成果。
来源:Reddit · r/LocalLLaMA · reddit.com