#部署/工程
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#部署/工程
今日 1 条洞察 · 工具·提示词·论文 三栏速览
每栏 3 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分2626 双卡 CMP 170HX 64GB 部署 GLM-5.3-Flash 384K 上下文方案与 Qwen3.8 实测对比
玩家在两张 64GB CMP 170HX 显卡上跑通了 GLM-5.3-Flash 的 EXL3 3.05bpw 量化方案,目标权重约 125.2GB 全驻留 HBM,配合 DFlash2 6bpw 草稿模型实现 384K 上下文,单请求预算约 392,960 tokens,生成速度约 90 tok/s。
Reddit · r/LocalLLaMAAI 评分77 单卡 3090 跑 Qwen3.8-27B 用户考虑升级 128GB DDR5 以应对 Strata 炒作
一位 Reddit 用户目前用单张 3090 显卡运行 turboderp/Qwen3.8-27B-exl3 量化版,可达约 70t/s 的生成速度和约 150k 上下文,正考虑升级到 128GB DDR5 6000MHz 内存和 Ryzen 9700X,以便跑 IQ3 量化和 Strata。
Reddit · r/LocalLLaMAAI 评分3333 社区作者为 Ternary Bonsai 2 27B 微调 DFlash 2 drafter:L4 加速 2.2x,代码编辑 3.2x
网友基于 z-lab 的 DFlash 2 drafter,用 Bonsai 2 自身 1.5M tokens 的 greedy 输出做微调,使其适配 PrismML 的 Ternary Bonsai 2 27B。
Reddit · r/LocalLLaMAAI 评分3434 DynamicTune 用闭式权重手术让 Qwen3.5-0.8B 在 ARC-Challenge 上超越 2B 模型
DynamicTune 提出一种无需反向传播的闭式权重手术方法,仅用约 12 分钟在消费级硬件上把 4B 模型的轨迹动力学迁移进 Qwen3.5-0.8B 学生模型。
Reddit · r/LocalLLaMAAI 评分2828 超频 DDR5 提升超出 VRAM 容量 MoE 模型的 prefill 与 decode 速度
在 AMD 7950X 平台(4× 双 rank DDR5-5600,128GB)上将 DDR5 从 3600MHz 超至 4800MHz,内存带宽提升约 36%,让超出 VRAM 容量的 MoE 模型在 Intel B70(32GB)上跑 llama.cpp 自定义 SYCL 后端时获得更快的 prefill(PP)与 token 生成(TG)。
Reddit · r/LocalLLaMAAI 评分2424 PewDiePie 微调本地模型 Ajax 两次被 OpenAI 封号
PewDiePie 在自家电脑上微调一个 9B 本地模型 Ajax 时,因用 OpenAI API 输出来构建数据集,两次违反使用条款被封号、申诉解封后又立即再被封。他随后转向开源工具移除模型内置拒答与说教式回复,继续推进完全本地化的 9B agent 构建。该事件借 PewDiePie 的影响力,为开源模型带来了一次面向数百万观众的免费宣传。
Reddit · r/LocalLLaMAAI 评分2525 单卡 RTX5090 跑本地 LLM 推理遇瓶颈:解码速度足够快,CPU 反而成为智能体编码的真正瓶颈
开发者将 Kenshi 项目移植到 Godot,使用单张 RTX5090 跑本地 LLM 推理服务,GPU 平均解码约 700t/s 却无法再提速;启动 25 个智能体并发占满 12 个服务槽位后,任务卡在 tool call 阶段,CPU 满载。
Reddit · r/LocalLLaMAAI 评分1818 在 64 GB Mac mini 上做 MoE SSD 流式加载:Qwen Flash Next 解码时 GPU 仍有 27% 时间在等专家层
用户在 64 GB Mac mini(M5)上运行 Qwen Flash Next 的 q4 量化版本,由于模型放不进内存,采用将热门专家留在缓存、其他专家从 SSD 流式加载的方案,测得 17.5 t/s 解码和 390 t/s prompt 处理速度,热缓存命中率为 75%。
Reddit · r/LocalLLaMAAI 评分44 如何真正学会使用 vLLM?一位本地部署用户的入门困惑
一位用户在 Reddit r/LocalLLaMA 求助如何上手 vLLM,表示官方文档难以厘清 server 与 client 库的区别。该用户目前用单卡 GPU 运行未量化的 voxtral 3B,想进一步学习量化等进阶用法。他同时用 llama.cpp 在 RX 7900 XTX 上跑量化版的 Qwen 3.8 27B。
Reddit · r/LocalLLaMAAI 评分2828 升级双 R9700 显卡配置咨询:如何搭建以运行 Qwen3.8-Flash-Next
Reddit 用户从单张 AMD Radeon AI PRO R9700 升级到双卡配置,以加速运行 Qwen3.8-Flash-Next(Q4/higher quants 27B)。主板已确认支持 x8/x8 显卡拆分,总价约 $6307.84。