热点事件持续更新
玩家用4张BC-250矿卡组本地集群跑Qwen3.6
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
2026年10月11日,Reddit r/LocalLLaMA用户分享了一套基于4张二手BC-250矿卡的本地推理集群搭建方案。该用户以约500美元的单价购入这4张矿卡,搭配llama.cpp、Vulkan与RPC后端进行部署。在Qwen3.6 35B A3B模型上,单实例Next Flash IQ3_XXS量化在100K上下文长度下达到约60–70 tok/s,ppt约为150;当同时运行两个Qwen3.6 35B A3B IQ4_K_M实例时,总吞吐提升至约145 tok/s,ppt约450,可用上下文窗口同步扩展至258K。报道未披露更多后续进展或社区复现情况。
AI 根据报道生成 · 2 小时前更新
最新进展10月11日 12:27
4卡BC-250矿卡集群双实例Qwen3.6 35B A3B达145 tok/s,可用上下文扩至258K。报道时间线
沿着报道,了解事件的不同侧面。
10月11日
- Reddit · r/LocalLLaMA玩家用 4 张 BC-250 矿卡组本地集群,跑到 ~70 tok/s 100K 上下文 / 145 tok/s 双实例 Qwen3.6 35B A3B
用户用 4 张二手约 $500 的 BC-250 矿卡组成本地推理集群,搭载 llama.cpp + Vulkan + RPC。Next Flash IQ3_XXS 实现 100K 上下文下 ~60–70 tok/s(ppt ~150),同时运行两实例 Qwen3.6 35B A3B IQ4_K_M 可达 145 tok/s(ppt ~450),可用上下文扩到 258K。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。