跳到正文

#部署/工程

今日 5 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月4日周日
  1. Reddit · r/LocalLLaMA32

    专用推理引擎的崛起

    一批针对特定模型和硬件优化的极窄化推理运行时正在兴起,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。这些引擎主动放弃 llama.cpp/vLLM 的通用性,换取特定配置下的最高性能。业界认为,这种通用运行时与专用高绩效引擎并存的模式,可能成为 AI 推理部署的未来常态。

10月3日周六
  1. 量子位 QbitAI67

    DeepSeek弹性计算团队大量招聘HC,尤其需要资深工程师

    DeepSeek弹性计算团队正在大量招聘,尤其需要资深工程师。其DSec系统已在生产环境部署多个分片,每个分片约160台服务器、3万CPU核心、250TB内存,每天服务约300万个沙盒,高峰期同时在线超38万个。系统通过镜像分层、按需加载实现1.71倍加速和57%磁盘减少,资源超卖率超50倍,支持轨迹分叉和四种执行后端。

  2. Hacker News · 首页19

    Debian 推理门户

    Debian 推出推理门户,为 Debian 贡献者提供 LLM 推理服务的自助门户。贡献者可通过该门户管理 API keys 并追踪预算消耗,目前仅向 Debian Developers 和 Debian Maintainers 开放访问。

10月2日周五
  1. Reddit · r/LocalLLaMA41

    CalDec v1 发布:完全开源的个人助手决策模型

    个人开发者发布 CalDec v1,一款完全开源权重的决策模型,专注于本地化、隐私保护的个人助手场景。该模型通过小规模数据集微调开发,尽管作者无专业 ML 背景,但实验结果超出预期,已在特定任务中证明可用性。模型、数据集和训练配方均已开源发布。

  2. NVIDIA Blog70

    NVIDIA DGX Spark 推出 64GB 内存配置

    NVIDIA 宣布 DGX Spark 新增 64GB 统一内存配置,将于 10 月 23 日从 Acer、ASUS、Dell、Gigabyte、HP、MSI 等合作厂商开售,起售价 $4,999。

    推荐理由:原文给出了 64GB 型号的具体价格($4,999)、上市时间(10月23日)和性能数据(两台集群 1.7x 提升),读者可以据此判断这个新配置是否适合自己。

  3. Reddit · r/LocalLLaMA21

    Qwen3.8-Flash-Next 在单张 r9700 上的性能:230k 上下文下 863 t/s prefill、35 t/s decode 是否正常?

    用户在单张 AMD r9700 显卡上运行 Qwen3.8-Flash-Next(exl3 格式,5.05 bpw),在 262144 上下文、q8 kv cache 配置下测得 prefill 速度 863 t/s(仅计算新增 101k tokens)、decode 速度 34.7 t/s,mtp drafting 接受率约 53-54%。该用户询问该性能表现是否达到预期,以及是否还有调优空间。

  4. Product Hunt · AI 分类49

    Lloyal:内置推理的 TypeScript AI 应用框架

    Lloyal 是一款 TypeScript AI 应用框架,内置推理引擎和多智能体运行时,支持智能体研究、读取本地文件、理解文档和组合专业模型。该框架可在离线环境下工作,用户无需 API 密钥或复杂配置即可使用,可快速定制部署至桌面、Web 或终端平台。

  5. Hacker News · 首页72

    DeepSeek 发布 Harness 桌面应用,支持 macOS 和 Windows

    DeepSeek 发布开源 harness 工具 DeepSeek Harness,现已在全球公开预览。该工具基于 Cordis 的“一切皆插件”架构,可作为桌面应用运行或从代码启动 Web UI,支持日常任务处理、编码和研究工作,并提供插件扩展功能。用户可通过 npx @deepseek-ai/dsh web 快速启动,或从 GitHub 克隆源码安装。

  6. Reddit · r/LocalLLaMA61

    Gufo vs Halogen 推理框架性能对比实测

    作者实测了开源推理框架 Gufo 0.4.0,发现其官方宣称的 70 tok/s 是在重复性提示词下通过投机解码达成的极限性能,普通提示词下仅为 39.4 tok/s。与 Halogen 对比,日常生成任务中 Halogen 单用户快 13%,4 用户快 18%;但 Gufo 处理长提示词快 16%。作者使用的是 Qwen3.8 27B Q4 模型在 APU 上测试。

  7. Reddit · r/LocalLLaMA44

    K2 Horizon 模型与 IFM 团队 AMA 问答预告

    IFM(Institute of Foundation Models)发布 K2 Horizon 模型组,包含 6 个完全开源模型,参数规模覆盖 0.9B 至 375B。除模型权重外,团队还开源了训练数据、训练代码、中间检查点、训练日志和评估结果。AMA 活动将于 10 月 5 日周一举行,话题涵盖预训练、后训练、设备端小模型、MoVA 与稀疏注意力、部署策略等。

  8. Hacker News · 首页76

    Cloudflare 发布开源决策模型 Clef 和 Clef-flash,上线 RL 微调平台

    Cloudflare 发布两款决策模型 Clef 和 Clef-flash,均基于 Qwen 微调,支持文本和图像分类,在 Jev Decision Index 评估中领先。Clef 中位延迟 209.3ms,Clef-flash 仅 38.8ms,均优于 Jev 的 524.1ms。两款模型已开源至 Hugging Face 并托管于 Workers AI,同时推出 RL 微调服务供客户定制。

    推荐理由:原文给出了与 Jev 的基准对比和延迟数据,读者可以判断决策模型在特定场景下是否比通用 LLM 更适合。

  9. AWS Machine Learning Blog40

    在 AWS 上实现 Claude Platform 多环境访问配置指南

    Claude Platform on AWS 支持三种环境访问:通过跨账户 SigV4 实现 AWS 生产工作负载推理,开发者笔记本使用工作区级 API 密钥,外部环境通过 OIDC federation 获取临时凭证。采用专用 AI Services 账户承载订阅和工作区,工作负载账户通过角色假设调用推理,实现生产与开发流量隔离。

10月1日周四
  1. Reddit · r/LocalLLaMA80

    Jeff-Qwen3.5-0.8B v1.2 + 9 个 LoRA 适配器:置于 Qwen3.8-27B 前实现 38 倍加速和 +8.7 准确率,额外内存占用不足 2GB

    作者发布 Jeff-Qwen3.5-0.8B,这是一款小型“System 1”模型,可在一轮前向传播中从给定选项中做出选择并返回校准概率。作者为其训练了 9 个 LoRA 适配器,分别处理 prompt 注入检测、工具选择、票据优先级排序、答案溯源等常见决策任务。

    推荐理由:原文给出了具体的性能对比数据和开源资源,读者可以据此判断这种“小模型+LoRA适配器前置”的架构是否适合自己本地部署的场景。