跳到正文
热点事件持续更新

用户测试llama.cpp MoE专家GPU缓存PR:8GB显存下表现不及预期

1 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

2026年10月9日,Reddit r/LocalLLaMA 用户反馈,在8GB显存(4060显卡)搭配32GB DDR5内存的设备上测试llama.cpp的PR#29887(新增MoE专家GPU缓存特性)时,性能不及预期。测试使用Qwen3.6-35B-A3B-IQ4_XS GGUF模型,对比了 `-cmoe` 和 `fit` 模式以及不同 `--moe-cache-mib` 取值下的表现,但报道未披露具体测试数据与结论细节。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. Reddit · r/LocalLLaMA
    用户反馈 llama.cpp PR#29887(MoE 专家 GPU 缓存特性)在低显存环境下性能不及预期

    一名用户在 8GB VRAM(4060)+ 32GB DDR5 内存的设备上测试 llama.cpp 的 PR#29887(新增 MoE 专家 GPU 缓存特性),使用 Qwen3.6-35B-A3B-IQ4_XS GGUF 模型,对比 `-cmoe` 和 `fit` 模式以及不同 `--moe-cache-mib` 取值。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。