热点事件持续更新
2×RTX3060 本地跑 Qwen3.8-Flash-Next 求助参数
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
用户在配备 2 张 RTX3060(各 12GB)和 64GB 内存的机器上,使用 vanilla 版 llama.cpp 加载千问(Qwen)3.8-Flash-Next 的 IQ3_XXS 量化版本以本地运行。开启 think 模式时最佳生成速度仅约 15 tps,明显低于 Strata 给出的 35 tps(think 模式)/ 50 tps(代码模式)参考速度。为缩小差距,用户发帖求助合适的 llama.cpp 运行参数与配置。当前尚无后续报道说明是否已找到更优参数或调整后的实测结果。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月12日
- Reddit · r/LocalLLaMA在 2 x RTX3060 上本地运行千问 Qwen3.8-Flash-Next 的 llama.cpp 参数求助
用户用 vanilla llama.cpp 在 2 x RTX3060 12GB + 64GB RAM 配置上跑千问(Qwen)3.8-Flash-Next 的 IQ3_XXS 量化版本,think 模式最好成绩仅 15 tps,远低于 Strata 给出的 35 tps think / 50 tps 代码速度。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。