Slipstream 发布:可在 64GB Mac 上以 41-52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next
开发者发布 Slipstream 引擎,可在 64GB Mac 上以 41-52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next 模型,比 llama.cpp 快 1.76 倍。
推荐理由:原文给出了新推理引擎的具体性能数据、架构设计和与 llama.cpp 的对比,读者可以据此判断它在本地运行大模型场景下的实际价值。
每条发布 = 一张工具卡 · 命中 "新工具 / 产品更新 / 模型发布 / 平台" 标签(itemType=tool_release)· 按时间排序
开发者发布 Slipstream 引擎,可在 64GB Mac 上以 41-52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next 模型,比 llama.cpp 快 1.76 倍。
推荐理由:原文给出了新推理引擎的具体性能数据、架构设计和与 llama.cpp 的对比,读者可以据此判断它在本地运行大模型场景下的实际价值。
作者发布 Jeff-Qwen3.5-0.8B,这是一款小型“System 1”模型,可在一轮前向传播中从给定选项中做出选择并返回校准概率。作者为其训练了 9 个 LoRA 适配器,分别处理 prompt 注入检测、工具选择、票据优先级排序、答案溯源等常见决策任务。
推荐理由:原文给出了具体的性能对比数据和开源资源,读者可以据此判断这种“小模型+LoRA适配器前置”的架构是否适合自己本地部署的场景。
AllenAI 发布 Olmo-core 3 训练框架,支持将专家池从 8 扩展到 128 而每 token 仅激活 4 个专家,总参数量从 4.6B 增至 47B,训练吞吐量仅下降不到 5%。在 8 个 NVIDIA B300 GPU 上,47B MoE 达 52,000 tokens/s/GPU,约为此前实现的 2.7 倍。系统已测试至 1.2 万亿参数规模。
推荐理由:原文给出了专家池扩展、吞吐量提升和参数规模的具体数字,读者可以据此判断这套训练基础设施对大模型研究的具体价值。
Codex Remote 是一个开源的 Mac 菜单栏应用,可将 Codex 和 Claude Code 部署到用户自己控制的云机器上。用户选择提供商和服务器规格后,应用会使用 OpenTofu 置备服务器、安装智能体并连接到已有应用。
推荐理由:原文说明了如何把 AI 智能体部署到用户自己控制的云端,并给出了具体的功能组合方式,读者可以据此判断它是否适合自己的工作流。
Hugging Face 发布 WebGPU 内核库 @hugglingface/kernels,包含 207 个优化内核,可从 Hub 直接加载运行。性能对比测试显示,与 ORT WebGPU 相比,新内核在 Apple M4 GPU 上实现几何平均 2.57 倍提速、中位数 1.90 倍提速,部分操作如 bilinear Einsum 提速超过 10000 倍。
推荐理由:原文给出了 207 个内核的性能对比数据(2.57x 几何平均提速),读者可以据此判断这个底层工具对自己浏览器端 AI 推理工作流的价值。
Liquid AI 发布 LFM2.5 系列的 DSpark 草稿模型检查点,包括 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三款。
推荐理由:给出了在 H100 和 MacBook M4 Max 上的具体加速数字,以及 llama.cpp 和 SGLang 的集成方式,读者可以据此判断迁移成本和预期收益。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者可在 Hugging Face 模型页面一键跳转至 SageMaker Studio 进行模型定制或部署。
推荐理由:一键集成让开发者从模型发现到实验部署的路径大幅缩短,这是 Hugging Face 与 AWS 生态深度绑定的关键一步。
微软在 Build 2026 上宣布 Foundry Managed Compute 支持部署 Hugging Face 开源模型,提供经过安全扫描的模型、预构建的运行时(vLLM、SGLang、TensorRT-LLM 等)和企业级安全治理,开源模型可与 frontier 模型一起在 Foundry Agents 中使用。
推荐理由:这是微软为企业提供的开源模型部署方案,读者可以了解到如何在微软云上获得企业级安全保障的同时使用开源模型。
已经到底了