跳到正文
热点事件持续更新

2×RTX3060 本地跑 Qwen3.8-Flash-Next 求助参数

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

用户在配备 2 张 RTX3060(各 12GB)和 64GB 内存的机器上,使用 vanilla 版 llama.cpp 加载千问(Qwen)3.8-Flash-Next 的 IQ3_XXS 量化版本以本地运行。开启 think 模式时最佳生成速度仅约 15 tps,明显低于 Strata 给出的 35 tps(think 模式)/ 50 tps(代码模式)参考速度。为缩小差距,用户发帖求助合适的 llama.cpp 运行参数与配置。当前尚无后续报道说明是否已找到更优参数或调整后的实测结果。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月12日
  1. Reddit · r/LocalLLaMA
    在 2 x RTX3060 上本地运行千问 Qwen3.8-Flash-Next 的 llama.cpp 参数求助

    用户用 vanilla llama.cpp 在 2 x RTX3060 12GB + 64GB RAM 配置上跑千问(Qwen)3.8-Flash-Next 的 IQ3_XXS 量化版本,think 模式最好成绩仅 15 tps,远低于 Strata 给出的 35 tps think / 50 tps 代码速度。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。