跳到正文
原文
Reddit · r/LocalLLaMA· /u/Chida82·· 4 天前AI 评分40

我把 antirez 的 ds4 精简成 Qwen3.8 Flash Next on Metal,速度提升约 10% 且保持位精确输出

I took antirez's ds4, stripped it down to Qwen3.8 Flash Next on Metal, ported a bunch of improvements, and it's now ~10% faster with bit-exact output

AI 导读

作者将 ds4 代码库从 85k 行精简至 45k 行,专门针对 Qwen3.8 Flash Next 在 Metal 上运行。在 M5 Max 128GB RAM 上,Q2 解码速度提升 9-13%,MTP 吞吐量从 75.8 提升至 86.7 tok/s,同时保持位精确输出。创建了 StarForge 仓库管理定制版本,fork 与上游保持同步。

来源:Reddit · r/LocalLLaMA · reddit.com