#部署/工程
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#部署/工程
今日 5 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Ars Technica · AIAI 评分5959 微软发布会推出 Surface Laptop Ultra 与 Windows 11 变更
微软在两年来的首次线下发布会上推出 Surface Laptop Ultra,起售价 2,599 美元,10 月 16 日开始发货,现已开启预订。
Reddit · r/LocalLLaMAAI 评分2626 双卡 CMP 170HX 64GB 部署 GLM-5.3-Flash 384K 上下文方案与 Qwen3.8 实测对比
玩家在两张 64GB CMP 170HX 显卡上跑通了 GLM-5.3-Flash 的 EXL3 3.05bpw 量化方案,目标权重约 125.2GB 全驻留 HBM,配合 DFlash2 6bpw 草稿模型实现 384K 上下文,单请求预算约 392,960 tokens,生成速度约 90 tok/s。
Reddit · r/LocalLLaMAAI 评分4141 利用 Strix Halo NPU 加速本地 coding agent:Halogen 0.17.1 实测
Halogen 0.16+ 将闲置的 XDNA2 NPU 暴露为 OpenAI 风格接口,作者将其中四个模型接入真实 coding agent。0.17.1 让 NPU 调用延迟降低约 30 倍,解码速度提升约 40%;联合投机解码使双流聚合吞吐达 72.7 tok/s,串行解码 59.6 tok/s,prefill 约 1,300 tok/s。
AWS Machine Learning BlogAI 评分2121 Cornerstone OnDemand 如何用 Amazon Bedrock 将数据库诊断时间缩短 78%
Cornerstone OnDemand 推出基于 Amazon Bedrock 和 Strands Agents 的多智能体系统 Orion AI,将数据库平均诊断时间从 45 分钟压缩至 10 分钟,降幅 78%。
AWS Machine Learning BlogAI 评分2222 AWS DevOps Agent 调查后自动化修复方案:基于 Lambda Durable Functions、EventBridge 与 Amazon Bedrock
AWS 发布基于 Lambda Durable Functions、EventBridge 和 Amazon Bedrock 的自动化修复方案,用于衔接 AWS DevOps Agent 的事件调查环节。
Reddit · r/LocalLLaMAAI 评分77 单卡 3090 跑 Qwen3.8-27B 用户考虑升级 128GB DDR5 以应对 Strata 炒作
一位 Reddit 用户目前用单张 3090 显卡运行 turboderp/Qwen3.8-27B-exl3 量化版,可达约 70t/s 的生成速度和约 150k 上下文,正考虑升级到 128GB DDR5 6000MHz 内存和 Ryzen 9700X,以便跑 IQ3 量化和 Strata。
Reddit · r/LocalLLaMAAI 评分3333 社区作者为 Ternary Bonsai 2 27B 微调 DFlash 2 drafter:L4 加速 2.2x,代码编辑 3.2x
网友基于 z-lab 的 DFlash 2 drafter,用 Bonsai 2 自身 1.5M tokens 的 greedy 输出做微调,使其适配 PrismML 的 Ternary Bonsai 2 27B。
AWS Machine Learning BlogAI 评分2020 Amazon SageMaker Studio 新增对 SageMaker HyperPod Spaces 的可视化管理能力
Amazon SageMaker Studio 现可直接创建与管理运行在 SageMaker HyperPod EKS 集群上的 SageMaker Spaces,数据科学家无需使用 CLI 或 kubectl,即可在浏览器内启动 JupyterLab 或 Code Editor,将从集群访问到投入开发的时间缩短至几次点击。
AWS Machine Learning BlogAI 评分1212 Amazon SageMaker HyperPod 管理与治理最佳实践(基于 SageMaker Unified Studio)
Amazon SageMaker HyperPod 通过 SageMaker Unified Studio 为多个 ML 团队提供共享加速计算资源,核心挑战在于跨团队的治理与权限管控。
Reddit · r/LocalLLaMAAI 评分1515 NInfer6000 在 RTX 6000 上跑 Qwen 3.8 Flash Next,token 生成达 400 tg/s
网友基于 NInfer 改写的 NInfer6000 分支在 RTX 6000(96GB VRAM)上运行 Qwen 3.8 Flash Next,将非专家层从 16-bit 下采样到 8-bit 并启用 MTP3 解码与小型 drafting head 后,在理想条件下达到 400 tok/s 生成速度。
Reddit · r/LocalLLaMAAI 评分3131 腾讯开源 Octop:本地自托管多智能体 AI 助手
腾讯开源 Octop,一款完全自托管的多智能体 AI 助手,提供 Web 控制台、CLI 与 IM 集成,单进程启动即可使用。它支持桌面客户端(Windows / macOS / Linux 及 FnOS NAS 包)和 Docker 部署,通过多智能体架构为团队、家庭和个人构建独立且协作的智能环境,所有数据完全运行在用户本地机器上。
Reddit · r/LocalLLaMAAI 评分3434 DynamicTune 用闭式权重手术让 Qwen3.5-0.8B 在 ARC-Challenge 上超越 2B 模型
DynamicTune 提出一种无需反向传播的闭式权重手术方法,仅用约 12 分钟在消费级硬件上把 4B 模型的轨迹动力学迁移进 Qwen3.5-0.8B 学生模型。
Reddit · r/MachineLearningAI 评分33 ML/DL 装机配置选购指南:GPU 之外的隐性规格要点
一名用户计划组装一台用于机器学习和深度学习的 PC,希望了解除 GPU 之外需要关注的硬件细节。原帖询问从经验角度容易被忽视的组件和规格注意事项,包括配件选择与整体搭配。帖子以求助形式发布,尚未包含具体回答或推荐配置。
Reddit · r/LocalLLaMAAI 评分2828 超频 DDR5 提升超出 VRAM 容量 MoE 模型的 prefill 与 decode 速度
在 AMD 7950X 平台(4× 双 rank DDR5-5600,128GB)上将 DDR5 从 3600MHz 超至 4800MHz,内存带宽提升约 36%,让超出 VRAM 容量的 MoE 模型在 Intel B70(32GB)上跑 llama.cpp 自定义 SYCL 后端时获得更快的 prefill(PP)与 token 生成(TG)。
Reddit · r/LocalLLaMAAI 评分1919 ik_llama.cpp fork 新增 MoE 优化:专家常驻显存与自适应 CPU/GPU 混合执行,支持 Q2_0 量化
开发者基于 ik_llama.cpp 推出新 fork,引入带宽自适应的 CPU/GPU 混合执行与 MoE 专家常驻(expert residency)机制,并新增 Q2_0 量化支持。
Reddit · r/LocalLLaMAAI 评分2424 PewDiePie 微调本地模型 Ajax 两次被 OpenAI 封号
PewDiePie 在自家电脑上微调一个 9B 本地模型 Ajax 时,因用 OpenAI API 输出来构建数据集,两次违反使用条款被封号、申诉解封后又立即再被封。他随后转向开源工具移除模型内置拒答与说教式回复,继续推进完全本地化的 9B agent 构建。该事件借 PewDiePie 的影响力,为开源模型带来了一次面向数百万观众的免费宣传。
Reddit · r/LocalLLaMAAI 评分88 NVIDIA Blackwell 4000 与 RTX 3060 能否组合用于本地 LLM 推理
用户询问能否将一张 NVIDIA Blackwell 4000 24GB 与旧款 RTX 3060 12GB 组合,用于本地运行大语言模型(侧重编程任务),并希望了解 tensor split 是否支持这种跨代显卡混搭配置。
Reddit · r/LocalLLaMAAI 评分2525 单卡 RTX5090 跑本地 LLM 推理遇瓶颈:解码速度足够快,CPU 反而成为智能体编码的真正瓶颈
开发者将 Kenshi 项目移植到 Godot,使用单张 RTX5090 跑本地 LLM 推理服务,GPU 平均解码约 700t/s 却无法再提速;启动 25 个智能体并发占满 12 个服务槽位后,任务卡在 tool call 阶段,CPU 满载。
AWS Machine Learning BlogAI 评分3030 在 AWS GovCloud (US) 中用 Claude Code 与 Amazon Bedrock 加速受监管工作负载
Anthropic Claude Opus 5.5 与 Claude Sonnet 5.5 已在 AWS GovCloud (US) 区域 Amazon Bedrock 上可用。
Reddit · r/LocalLLaMAAI 评分2424 在 veloGB10 上运行 Swift 1.5:xhigh 档位反超 base Flash-Next 中档 vLLM 表现
在两台 DGX Spark 上,UkisAI 基于 Qwen3.8-Flash-Next 微调的 Swift 1.5(推理高效版)借助 sf-stav 的 Rust/CUDA 推理引擎 veloGB10 实现了约 110 tok/s 的单流解码速度,运行 xhigh effort 仍比旧 vLLM NVFP4 环境下 base Flash-Next medium 档更快。
Reddit · r/LocalLLaMAAI 评分1818 在 64 GB Mac mini 上做 MoE SSD 流式加载:Qwen Flash Next 解码时 GPU 仍有 27% 时间在等专家层
用户在 64 GB Mac mini(M5)上运行 Qwen Flash Next 的 q4 量化版本,由于模型放不进内存,采用将热门专家留在缓存、其他专家从 SSD 流式加载的方案,测得 17.5 t/s 解码和 390 t/s prompt 处理速度,热缓存命中率为 75%。
Reddit · r/LocalLLaMAAI 评分44 如何真正学会使用 vLLM?一位本地部署用户的入门困惑
一位用户在 Reddit r/LocalLLaMA 求助如何上手 vLLM,表示官方文档难以厘清 server 与 client 库的区别。该用户目前用单卡 GPU 运行未量化的 voxtral 3B,想进一步学习量化等进阶用法。他同时用 llama.cpp 在 RX 7900 XTX 上跑量化版的 Qwen 3.8 27B。
Hacker News · 首页AI 评分2828 Homa:终结 AI 集群的 TCP 时代
论文 Homa 提出面向 AI 集群的新型网络传输协议,目标取代该场景长期使用的 TCP。AI 训练与推理集群对低延迟、高吞吐的需求与 TCP 机制存在错配,Homa 通过定制传输层设计回应这一挑战。该工作已在 Hacker News 引发讨论,目前尚未公布具体性能数据与开源安排。
Reddit · r/LocalLLaMAAI 评分2828 升级双 R9700 显卡配置咨询:如何搭建以运行 Qwen3.8-Flash-Next
Reddit 用户从单张 AMD Radeon AI PRO R9700 升级到双卡配置,以加速运行 Qwen3.8-Flash-Next(Q4/higher quants 27B)。主板已确认支持 x8/x8 显卡拆分,总价约 $6307.84。
Reddit · r/LocalLLaMAAI 评分2121 LLM Inference Dashboard:本地 LLM 推理资源监控工具
开发者正在构建一个轻量级(64mb)的本地 LLM 推理资源仪表板,支持 llama、strata、custom cuda engines、unsloth、LMS 等多种推理引擎,提供比默认 API 端点更丰富的日志和指标。该工具通过 collector 扩展网络 API 端点,目前尚未公开发布,作者在 Reddit 社区调研潜在用户兴趣。
Reddit · r/LocalLLaMAAI 评分4040 我把 antirez 的 ds4 精简成 Qwen3.8 Flash Next on Metal,速度提升约 10% 且保持位精确输出
作者将 ds4 代码库从 85k 行精简至 45k 行,专门针对 Qwen3.8 Flash Next 在 Metal 上运行。在 M5 Max 128GB RAM 上,Q2 解码速度提升 9-13%,MTP 吞吐量从 75.8 提升至 86.7 tok/s,同时保持位精确输出。创建了 StarForge 仓库管理定制版本,fork 与上游保持同步。
Reddit · r/LocalLLaMAAI 评分3939 Strata 分支在 IBM AC922 上运行 Qwen3.8-FN UD-Q4_K_XL 实现 7357 tok/s prefill 和 113 tok/s decode
开发者在 IBM AC922(双 POWER9 20 核 CPU + 4×16GB Tesla V100 GPU)上对 Strata 进行深度优化,使用 Qwen3.8-FN UD-Q4_K_XL 模型达到 7357 tok/s prefill 速度和 113 tok/s decode 速度。
Reddit · r/LocalLLaMAAI 评分5858 Intel 混合 CPU 用户运行 Strata 调优:解码速度提升近 3 倍
用户在 Intel 14700KF 混合 CPU 上运行 Strata 推理引擎,通过 calibrate 工具调整三个设置,使 Qwen3.8-Flash-Next IQ3_S 在 262K 上下文下的解码速度从 17.2 tok/s 提升到 53.5 tok/s。
Reddit · r/LocalLLaMAAI 评分2323 从单张 3090 到 20 节点 DGX Spark:我的本地大模型推理集群升级之路
一位工程师分享了他从单张 RTX 3090 逐步搭建本地大模型推理集群的过程,历经 16x3090、4x/8x ASUS GB10,最终扩展到 20 节点 NVIDIA DGX Spark,可本地运行 Kimi K3(2.8T)等顶级开源模型。通过优化在 300k 上下文下达到 20 t/s,从未订阅商业 API。
Hacker News · 首页AI 评分2020 用消费级显卡(RTX 4090)本地运行 Qwen3.8-Flash-Next(125B),Strata 项目实测可达约 100 tokens/s
Strata 项目让用户在搭载 RTX 5070(12 GB)或 RX 9070 XT 等消费级显卡、32 GB 以上内存的普通 PC 上本地运行 1250 亿参数的 Qwen3.8-Flash-Next 模型,NVIDIA 平台 Q2_0 量化下写作速度最高 94 tokens/s、读取 32K prompt 达 2,650 tokens/s。
Reddit · r/LocalLLaMAAI 评分4747 Strata 0.1.38 本地大模型推理性能测试:RTX 4090 48GB + 128GB RAM
在 RTX 4090 48GB + 128GB RAM 上测试 Strata 0.1.38 推理引擎,发现 n-gram 表加载到 RAM 仅提升 1.2% 解码速度但占用 28.4 GiB。
Reddit · r/LocalLLaMAAI 评分2020 不同推理引擎中 IQ3_S 模型表现差异:llama.cpp 可生成连贯答案
用户在"miracle engine"中运行 IQ3_S 模型让其评价帖子时,模型陷入 doom loop,10k tokens 后仍无法给出连贯答案。同一模型在 llama.cpp 中可以正常生成连贯回复。当前开源模型中仍缺乏有效减少谄媚(sycophancy)的方案。
Reddit · r/ChatGPTAI 评分4545 ChatGPT 停止转录音频
付费版 ChatGPT 用户反馈语音转录功能此前效果良好,但本周突然无法使用,ChatGPT 拒绝转录且未给出解释。官方建议的替代方案是使用 TurboScribe 生成 SRT 格式后再发送,但需将音频剪至 30 分钟以内,且每天仅支持 3 次。用户询问是否应转用 Gemini 等其他 AI 程序。
Reddit · r/LocalLLaMAAI 评分4141 64GB 系统内存的困境:Strata 让 Qwen3.8-Flash-Next 推理提速至 60 t/s,但模型加载后内存占用达 96%
用户在 64GB DDR5 内存机器上测试 Strata 框架运行 Qwen3.8-Flash-Next(IQ3_XXS 量化,约 70GB),推理速度从 llama.cpp 的 21 t/s 提升至 60 t/s,但加载 QFN 后系统内存使用率高达 96%,无法同时运行需要大量系统内存的 Minimax H3。
Reddit · r/LocalLLaMAAI 评分2222 本地大语言模型 Web Search 安全部署讨论
用户在 Reddit 询问如何在本地大语言模型(如 Hermes、pi 等)中安全部署 web search 功能。求助者实现了沙盒搜索系统但导致无限工具调用,希望防范 prompt injection 攻击并保护搜索隐私。暂无成熟方案。
Hacker News · 首页AI 评分2626 Docker 一直使用 microVM(自 2016 年起)
Docker 自 2015 年起使用 library VMM 技术,最初版本为 hyperkit,最新版本为 Docker VMM,基于 LinuxKit 提供精简内核和根文件系统。
Reddit · r/ChatGPTAI 评分1111 Codex 的 sub-agents 怎么这么烧预算?
用户在 Codex 中配置 3 个 sub-agents 加 1 个 orchestrator,仅 5 分钟就花掉 5 小时预算。对比之下,之前单独给 6.1 sol 分配 extra high effort 任务,30 分钟只用了 10% 预算。
Reddit · r/LocalLLaMAAI 评分5050 如何在 16GB RTX 3080 笔记本上运行 Qwen3.8 Flash Next 176B
利用 TensorSharp 推理引擎通过量化 + MoE 感知的跨内存层次统一调度(VRAM、RAM、SSD),在配备 16GB VRAM 的 RTX 3080 笔记本上成功运行 176B MoE 大语言模型。
Hacker News · 首页AI 评分7272 Vx:统一异构计算的系统编程语言
Vx 是一种面向异构计算的系统编程语言,将 CPU、GPU、NPU 和加速器内存纳入类型系统,在编译期防止数据放置错误、越界访问和内存溢出。该语言支持 H100、H200、B200、A100、MI300X、Apple M4 等硬件,编译结果可输出至 CPU、GPU 和 Apple AMX/ANE 后端,并提供机器描述文件以精确管理内存层次结构和带宽。
Reddit · r/LocalLLaMAAI 评分6262 NInfer 4080 发布:在 RTX 4080 16GB 上运行 Qwen-3.8-27B-GSQ
作者创建了 NInfer 4080,专门针对 RTX 4080 16GB 显存优化,可运行 ISTA-DASLab-Qwen-3.8-27B-GSQ 模型,支持 100k 上下文。