跳到正文
原文
Reddit · r/LocalLLaMA· /u/lkarlslund·· 2 天前AI 评分15

NInfer6000 在 RTX 6000 上跑 Qwen 3.8 Flash Next,token 生成达 400 tg/s

NInfer6000 - Qwen 3.8 Flash Next @ 400 tg/s & 13K pp/s

AI 导读

网友基于 NInfer 改写的 NInfer6000 分支在 RTX 6000(96GB VRAM)上运行 Qwen 3.8 Flash Next,将非专家层从 16-bit 下采样到 8-bit 并启用 MTP3 解码与小型 drafting head 后,在理想条件下达到 400 tok/s 生成速度。

来源:Reddit · r/LocalLLaMA · reddit.com