Reddit · r/LocalLLaMA· /u/SnooPredictions515·· 6 天前精选AI 评分81
Slipstream 发布:可在 64GB Mac 上以 41-52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next
Running 95.5 GiB Qwen3.8-Flash-Next at 41–52 tok/s on a 64GB Mac (1.76x faster than llama.cpp): Slipstream release, 130k context scaling, + Swift variant
AI 导读
开发者发布 Slipstream 引擎,可在 64GB Mac 上以 41-52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next 模型,比 llama.cpp 快 1.76 倍。
推荐理由
原文给出了新推理引擎的具体性能数据、架构设计和与 llama.cpp 的对比,读者可以据此判断它在本地运行大模型场景下的实际价值。
来源:Reddit · r/LocalLLaMA · reddit.com
最近 7 天的更新
- OpenAI 一次发布 372 项数学证明,包括唯一游戏猜想Hacker News · 首页·
- NVIDIA 与 Microsoft 联合推出 RTX Spark 与 DGX Station for WindowsNVIDIA Blog·
- Anthropic 发布 Claude Haiku 5.5,主打高吞吐低成本任务Hacker News · 首页·
- Mistral 发布 Mistral Large 4 公开预览,权重将于月底开源Hacker News · 首页·
- Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型Mistral AI·
- Reflection 发布开源权重模型 Beam:501B 总参数 / 23B 激活,主打编码与智能体效率Hacker News · 首页·
- Mistral 发布开源 24B 模型 Mistral Small 3,主打低延迟本地推理Mistral AI·
- Stable Diffusion 3.5 现已在 Replicate 可用Replicate Blog·
相关工具
- Aleph Alpha 发布开放权重模型 Kolibri,支持德语和英语82
- Jeff-Qwen3.5-0.8B v1.2 + 9 个 LoRA 适配器:置于 Qwen3.8-27B 前实现 38 倍加速和 +8.7 准确率,额外内存占用不足 2GB80
- OpenAI DevDay 2026 发布 Dots、GPT-6.1 Sol 等新品,ChatGPT 周活达 12 亿80
- OpenAI 推出常驻智能体 Dots,与 Meta Muse 竞争80
- Grok 4.7 在 Amazon Bedrock 上可用80
- Jevstiller:带 Disagreement Bound 的本地模型蒸馏工具79
- Earendil 发布 Pi Durable:用于构建持久化智能体的实验性框架78
- Hugging Face Diffusers 原生支持 Nunchaku 4-bit 扩散模型推理78