Hacker News · 首页· snehesht·· 4 天前AI 评分20
用消费级显卡(RTX 4090)本地运行 Qwen3.8-Flash-Next(125B),Strata 项目实测可达约 100 tokens/s
Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s
AI 导读
Strata 项目让用户在搭载 RTX 5070(12 GB)或 RX 9070 XT 等消费级显卡、32 GB 以上内存的普通 PC 上本地运行 1250 亿参数的 Qwen3.8-Flash-Next 模型,NVIDIA 平台 Q2_0 量化下写作速度最高 94 tokens/s、读取 32K prompt 达 2,650 tokens/s。
来源:Hacker News · 首页 · github.com