跳到正文
原文
Reddit · r/LocalLLaMA· /u/naklitechie·· 2 天前AI 评分72

LocalMind 在浏览器标签页中流式运行 Gemma 4 26B-A4B 与 Qwen3.6 MoE 模型

Gemma 4 26B-A4B and a 37 GB Qwen3.6 MoE running in a browser tab on a 24 GB Mac — experts streamed from disk, output matches llama.cpp

AI 导读

作者发布 LocalMind:一个通过 WebGPU 在浏览器标签页内运行的静态网页推理引擎,新增两套可在生成过程中按需从磁盘流式读取 MoE 专家权重的引擎。

来源:Reddit · r/LocalLLaMA · reddit.com