跳到正文
热点事件持续更新

玩家用4张BC-250矿卡组本地集群跑Qwen3.6

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

2026年10月11日,Reddit r/LocalLLaMA用户分享了一套基于4张二手BC-250矿卡的本地推理集群搭建方案。该用户以约500美元的单价购入这4张矿卡,搭配llama.cpp、Vulkan与RPC后端进行部署。在Qwen3.6 35B A3B模型上,单实例Next Flash IQ3_XXS量化在100K上下文长度下达到约60–70 tok/s,ppt约为150;当同时运行两个Qwen3.6 35B A3B IQ4_K_M实例时,总吞吐提升至约145 tok/s,ppt约450,可用上下文窗口同步扩展至258K。报道未披露更多后续进展或社区复现情况。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月11日
  1. Reddit · r/LocalLLaMA
    玩家用 4 张 BC-250 矿卡组本地集群,跑到 ~70 tok/s 100K 上下文 / 145 tok/s 双实例 Qwen3.6 35B A3B

    用户用 4 张二手约 $500 的 BC-250 矿卡组成本地推理集群,搭载 llama.cpp + Vulkan + RPC。Next Flash IQ3_XXS 实现 100K 上下文下 ~60–70 tok/s(ppt ~150),同时运行两实例 Qwen3.6 35B A3B IQ4_K_M 可达 145 tok/s(ppt ~450),可用上下文扩到 258K。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。