AI 日报 · 2026 年 10 月 2 日 · 星期五
MYHOT
Slipstream在64GB Mac上以41-52 tok/s运行95.5 GiB Qwen3.8模型
开发者发布Slipstream推理引擎,可在消费级64GB Mac上以41-52 tok/s运行95.5 GiB的Qwen3.8-Flash-Next模型,相比llama.cpp提速达1.76倍,标志着大模型在普通硬件上的推理效率取得重要突破。同日Cloudflare发布开源决策模型Clef系列并上线RL微调平台,AllenAI发布Olmo-core 3训练框架支持大规模MoE扩展。
按用途挑工具
Earendil 发布 Pi Durable:用于构建持久化智能体的实验性框架
Earendil 伴随 Pi 1.0 发布了实验性新框架 Pi Durable,该框架专为构建长时间运行、可在任何 JavaScript 运行时执行的持久化智能体设计。
aweb:面向 AI 智能体的通信工具发布
aweb 是一个面向 AI 智能体的通信平台,提供稳定的身份标识、持久的邮件和聊天功能,以及跨会话、跨运行时的唤醒事件。支持 Claude Code 和 Pi 等运行时,CLI 和 API 与运行时无关,可自托管或使用托管服务,代码采用 MIT 许可证开源。
Clarity: 实时 TTS 工具发布,支持语音克隆与亚 60ms 延迟
Clarity 是一款柏林团队开发的实时文字转语音产品,具备语音克隆能力,延迟低于 60ms,支持本地部署或 API 调用。其语法感知规范化功能可自然朗读 25+ 语言的电话号码、IBAN、地址和药物名称,并提供词级时间戳和 IPA 标注。适配 LiveKit、Pipecat 和 Vapi 平台。
OpenCompanion 发布:解决多文件夹 AI 编码助手授权管理问题
OpenCompanion 是管理 Claude Code、Codex CLI、OpenCode 多会话的工具。当这些 AI 编码助手在多个文件夹同时运行时,OpenCompanion 能在同一界面列出所有会话、提示授权需求,支持在桌面或同一 Wi-Fi 下的手机端回复。无账户、无云服务器、无遥测,开源(MIT),支持 Windows、Linux 和 macOS。
Amazon Quick 推出 Live Data in Apps 功能,AI 构建的应用可实时查询受治理数据
Amazon Quick 发布 Live Data in Apps 功能,允许 AI 构建的 Quick Apps 实时查询 QuickSight 数据集,而非依赖构建时的静态快照。
AllenAI 发布 Olmo-core 3:面向大规模 MoE 的开源可扩展训练基础设施
AllenAI 发布 Olmo-core 3 训练框架,支持将专家池从 8 扩展到 128 而每 token 仅激活 4 个专家,总参数量从 4.6B 增至 47B,训练吞吐量仅下降不到 5%。在 8 个 NVIDIA B300 GPU 上,47B MoE 达 52,000 tokens/s/GPU,约为此前实现的 2.7 倍。系统已测试至 1.2 万亿参数规模。
新模型与新版本
Jeff-Qwen3.5-0.8B v1.2 + 9 个 LoRA 适配器:置于 Qwen3.8-27B 前实现 38 倍加速和 +8.7 准确率,额外内存占用不足 2GB
作者发布 Jeff-Qwen3.5-0.8B,这是一款小型“System 1”模型,可在一轮前向传播中从给定选项中做出选择并返回校准概率。作者为其训练了 9 个 LoRA 适配器,分别处理 prompt 注入检测、工具选择、票据优先级排序、答案溯源等常见决策任务。
Cloudflare 发布开源决策模型 Clef 和 Clef-flash,上线 RL 微调平台
Cloudflare 发布两款决策模型 Clef 和 Clef-flash,均基于 Qwen 微调,支持文本和图像分类,在 Jev Decision Index 评估中领先。Clef 中位延迟 209.3ms,Clef-flash 仅 38.8ms,均优于 Jev 的 524.1ms。两款模型已开源至 Hugging Face 并托管于 Workers AI,同时推出 RL 微调服务供客户定制。
行业与社区
Slipstream 发布:在 64GB Mac 上以 41–52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next
开发者发布 Slipstream 推理引擎,可在 64GB Mac 上以 41–52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next 模型,相比 llama.cpp 提速 1.76 倍。