#部署/工程
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#部署/工程
今日 5 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Hacker News · 首页AI 评分6262 Pi pod:可在自有服务器上运行 pi 编码智能体的沙盒环境
Pi pod 是一个围绕 pi 编码智能体构建的沙盒运行环境,提供隔离执行、RBAC 会话共享、浏览器和原生应用自动化等企业级功能。项目采用自托管设计,可自行部署。托管服务即将推出,v1 计划提供 7 天标准试用版(需绑定信用卡,10 活跃小时,$20/月)或付费专业版 $50/月。
Reddit · r/LocalLLaMAAI 评分3232 专用推理引擎的崛起
一批针对特定模型和硬件优化的极窄化推理运行时正在兴起,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。这些引擎主动放弃 llama.cpp/vLLM 的通用性,换取特定配置下的最高性能。业界认为,这种通用运行时与专用高绩效引擎并存的模式,可能成为 AI 推理部署的未来常态。
Reddit · r/LocalLLaMAAI 评分2121 用户用 3 张 RTX 3060 12GB 搭建 "Flash Next" 推理卡:速度达 38-40 t/s
Reddit 用户在 r/LocalLLaMA 分享使用 3 张 RTX 3060 12GB 显卡运行 Flash Next 框架的测试结果,在 IQ3 模型上达到 38-40 t/s 推理速度,同条件 llama.cpp 仅能实现 13.2 t/s。
Reddit · r/LocalLLaMAAI 评分3737 Strata 发布 MoE 缓存方案,性能超越 llama.cpp 5-10 倍
Strata 用约两周时间实现了 MoE 缓存优化,带来 5-10x prefill 和 3-4x decode 性能提升。方案基于 Qwen-3.8-flash-next 模型,在 8-16gb 显卡 + 64gb 内存配置下达 2000/70 t/s+ 速度,比 27b 模型更快。
Reddit · r/LocalLLaMAAI 评分4242 Hugging Face 多 harness RL 训练终极指南
Hugging Face post-training 团队发布指南,介绍如何使用 TRL 和 Harbor 框架在不同编程 harness 环境中训练开源模型。指南针对 Pi 等自定义 harness 提供性能优化方案,适用于各类开源模型。
量子位 QbitAIAI 评分6767 DeepSeek弹性计算团队大量招聘HC,尤其需要资深工程师
DeepSeek弹性计算团队正在大量招聘,尤其需要资深工程师。其DSec系统已在生产环境部署多个分片,每个分片约160台服务器、3万CPU核心、250TB内存,每天服务约300万个沙盒,高峰期同时在线超38万个。系统通过镜像分层、按需加载实现1.71倍加速和57%磁盘减少,资源超卖率超50倍,支持轨迹分叉和四种执行后端。
Hacker News · 首页AI 评分3838 如果 AI 以每秒 100 万 token 的速度工作会怎样
解析"每秒 100 万 token"可能代表的四种含义:上下文容量、输入处理速度、聚合吞吐量和单个智能体的输出速度。通过四个思想实验(1000 个故事结局、40 个 app 草稿、1 万个候选实验、1 万次对话排练)展示高速写作的潜在应用场景。
Reddit · r/LocalLLaMAAI 评分4848 MegaCapybara:针对 RTX5090 和 Qwen3.8 27B 的最快推理引擎
MegaCapybara 是一款专为 RTX5090 优化的推理引擎,针对 Qwen3.8 27B 设计,单任务解码速度比此前 RTX5090 最快的 Ninfer 引擎快约 2 倍,单任务最高达 650 t/s,12 个并发 slots 时最高达 2600 t/s。支持 100 万上下文,配备智能缓存管理、Loop Guard 机制和可视化 UI,将开源发布。
Hacker News · 首页AI 评分1919 Debian 推理门户
Debian 推出推理门户,为 Debian 贡献者提供 LLM 推理服务的自助门户。贡献者可通过该门户管理 API keys 并追踪预算消耗,目前仅向 Debian Developers 和 Debian Maintainers 开放访问。
Reddit · r/artificialAI 评分1414 求:8GB VRAM 本地 AI 视频生成工具推荐
用户寻求在 8GB VRAM 限制下运行的本地 AI 视频生成工具,要求支持文本和图片生成最长 10 秒视频,优先 2D 动画兼顾 3D。这是用户首次使用本地大语言模型,希望找容易上手且免费的解决方案。
Hacker News · 首页AI 评分6969 Redis 创建者发布 ds4 本地推理引擎,支持 DeepSeek V4、GLM 5.x、Qwen3.8
Redis 创建者推出 ds4 本地前沿模型推理引擎,基于 C 语言开发,支持 DeepSeek V4/V4.1 Flash、GLM 5.x 和 Qwen3.8 Flash Next,采用非对称 2-bit 量化技术将 2840 亿参数的 MoE 模型压缩至 128GB 内存设备可运行,提供 CLI、HTTP API 和原生智能体三种接口。已开源并提供下载脚本。
Reddit · r/artificialAI 评分2626 批评AI领域的"轮子再造":停止将重复包装宣传为革命性工具
作者批评当前AI领域普遍存在的重复包装现象,指出许多人只是在现有开源模型或API上简单套个UI就当作新产品发布,甚至试图通过Patreon或订阅收费。作者认为真正的AI工具价值在于抽象复杂性、简化工作流程或解决实际问题,而非简单包装现有技术。
Reddit · r/LocalLLaMAAI 评分2828 开源大语言模型指令模式性能引争议:新模型下降更严重,3.6 多个 coding benchmarks 领先 3.8
近期测试表明,新一代开源大语言模型在非思考/指令模式下的性能下降幅度大于旧模型,例如 3.6 版本在多个 coding benchmarks 的指令模式中超越了 3.8 版本。许多用户仍需无需长推理的指令模型,呼吁开源实验室继续优化这一方向。
Hacker News · 首页AI 评分66 如果停止使用 GPU 会怎样?[视频]
一个探讨视频提出了一个假设性问题:如果整个行业停止使用 GPU,会发生什么。该视频获得了 23 个点赞和 4 条评论,出现在 Hacker News 首页。
Reddit · r/LocalLLaMAAI 评分1212 Qwen3.8-Flash(IQ3_XXS 量化)vs Qwen3.8-27B(Q8 量化)哪个更好?
Reddit 用户在 IQ3_XXS 量化版 Qwen3.8-Flash 与 Q8 量化版 Qwen3.8-27B 之间犹豫,询问有实际使用经验的人哪款智能表现更好。该用户表示近期没有复杂任务需要处理,难以自行判断两者在 intelligence 方面的实际差距。
Reddit · r/LocalLLaMAAI 评分6060 Percepta 发布新架构 Spotlight:将智能与记忆分离,实现能力无限增长
Percepta 发布新架构 Spotlight,将传统 attention 替换为一种可无限增长的记忆机制。该架构将执行计算的智能模块与存储知识、程序和工作状态的内存分离,智能模块保持固定大小且权重不变,内存则可无限扩展。
Reddit · r/LocalLLaMAAI 评分6666 我用 iPhone 给 MacBook 当第二 GPU:Qwen 3.8 27B 预填充提速 29–44%
作者用 USB-C 线将 iPhone 17 Pro Max 连接到 24 GB M4 Pro MacBook,让手机分担 Qwen 3.8 27B(IQ4_XS)模型的部分层计算和注意力计算。
Reddit · r/LocalLLaMAAI 评分2424 yandex/AliceAI-80B-A3B 训练更新 #3:修复 NaN 问题后重新训练
作者在训练 yandex/AliceAI-80B-A3B 模型时,上一次运行因自定义 v100 kernels 导致的 NaN 问题使得除两层外所有梯度为零,训练失败。现已修复问题并重新开始训练,损失曲线显示正常。计划在版本完成后发布 GGUFs 和 llama.cpp patch。
Reddit · r/LocalLLaMAAI 评分5353 推理工程入门:本地大模型运行优化指南
前软件工程师转型为推理工程师,分享本地运行大模型的优化指南。内容涵盖运行时选择(Ollama 适合新手,llama.cpp 适合 CPU offload,VLLM 适合纯 GPU)。
Reddit · r/LocalLLaMAAI 评分2121 如何升级本地 LLM 硬件配置以运行更大模型或多实例
用户当前使用 Ryzen 5600X + 7900XTX + 64GB DDR4 配置运行 Qwen2.5 27B(3-4Q,128k-220k 上下文),速度达 50 token/s。考虑购买 2-4 张 MI50 16GB 显卡或额外 7900XTX 以运行更大模型或多实例并发,但受限于 X470 主板不适合多 GPU 组装。求问升级方案建议。
Reddit · r/LocalLLaMAAI 评分4141 CalDec v1 发布:完全开源的个人助手决策模型
个人开发者发布 CalDec v1,一款完全开源权重的决策模型,专注于本地化、隐私保护的个人助手场景。该模型通过小规模数据集微调开发,尽管作者无专业 ML 背景,但实验结果超出预期,已在特定任务中证明可用性。模型、数据集和训练配方均已开源发布。
NVIDIA Blog精选AI 评分7070 NVIDIA DGX Spark 推出 64GB 内存配置
NVIDIA 宣布 DGX Spark 新增 64GB 统一内存配置,将于 10 月 23 日从 Acer、ASUS、Dell、Gigabyte、HP、MSI 等合作厂商开售,起售价 $4,999。
推荐理由:原文给出了 64GB 型号的具体价格($4,999)、上市时间(10月23日)和性能数据(两台集群 1.7x 提升),读者可以据此判断这个新配置是否适合自己。
Reddit · r/LocalLLaMAAI 评分2121 Qwen3.8-Flash-Next 在单张 r9700 上的性能:230k 上下文下 863 t/s prefill、35 t/s decode 是否正常?
用户在单张 AMD r9700 显卡上运行 Qwen3.8-Flash-Next(exl3 格式,5.05 bpw),在 262144 上下文、q8 kv cache 配置下测得 prefill 速度 863 t/s(仅计算新增 101k tokens)、decode 速度 34.7 t/s,mtp drafting 接受率约 53-54%。该用户询问该性能表现是否达到预期,以及是否还有调优空间。
Reddit · r/LocalLLaMAAI 评分3333 llama.cpp 服务器新增 /v1/systemone API 支持多模型
llama.cpp 在 Pull Request #29818 中新增 /v1/systemone API 端点。该 API 支持 laya、julia-1、lev、openjev、kev 等多个模型。目前该 PR 已提交,正在等待审核。
Product Hunt · AI 分类AI 评分4949 Lloyal:内置推理的 TypeScript AI 应用框架
Lloyal 是一款 TypeScript AI 应用框架,内置推理引擎和多智能体运行时,支持智能体研究、读取本地文件、理解文档和组合专业模型。该框架可在离线环境下工作,用户无需 API 密钥或复杂配置即可使用,可快速定制部署至桌面、Web 或终端平台。
Reddit · r/LocalLLaMAAI 评分2020 本地大模型推理:6GB GPU + 24GB RAM 如何提升运行速度
用户在 RTX 4050 6GB GPU + 24GB RAM 环境下运行 Qwen2.5 27B 模型时速度过慢,咨询 weight inferencing 是否有助于提升推理速度,并寻求具体尝试方法。
Hacker News · 首页AI 评分7272 DeepSeek 发布 Harness 桌面应用,支持 macOS 和 Windows
DeepSeek 发布开源 harness 工具 DeepSeek Harness,现已在全球公开预览。该工具基于 Cordis 的“一切皆插件”架构,可作为桌面应用运行或从代码启动 Web UI,支持日常任务处理、编码和研究工作,并提供插件扩展功能。用户可通过 npx @deepseek-ai/dsh web 快速启动,或从 GitHub 克隆源码安装。
Reddit · r/LocalLLaMAAI 评分3737 6 块 BC-250 显卡集群运行 Qwen Next Flash IQ2_XS 与 3.6 35b Q4 模型
用户将 6 块 ex 挖矿显卡组成集群,4 块运行 Qwen Next Flash IQ2_XS 在 100k 上下文下达 28 tok/s,2 块运行 3.6 35b Q4 模型达 60 tok/s。采用 llama + vulkan 通过 1GbE 网络连接,支持超长上下文。这是用户首次尝试本地 AI 部署。
Reddit · r/LocalLLaMAAI 评分6161 Gufo vs Halogen 推理框架性能对比实测
作者实测了开源推理框架 Gufo 0.4.0,发现其官方宣称的 70 tok/s 是在重复性提示词下通过投机解码达成的极限性能,普通提示词下仅为 39.4 tok/s。与 Halogen 对比,日常生成任务中 Halogen 单用户快 13%,4 用户快 18%;但 Gufo 处理长提示词快 16%。作者使用的是 Qwen3.8 27B Q4 模型在 APU 上测试。
Reddit · r/LocalLLaMA精选AI 评分8181 Slipstream 发布:可在 64GB Mac 上以 41-52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next
开发者发布 Slipstream 引擎,可在 64GB Mac 上以 41-52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next 模型,比 llama.cpp 快 1.76 倍。
推荐理由:原文给出了新推理引擎的具体性能数据、架构设计和与 llama.cpp 的对比,读者可以据此判断它在本地运行大模型场景下的实际价值。
Reddit · r/LocalLLaMAAI 评分4444 DDR4/PCIe4 vs DDR5/PCIe5:LLM 预训练基准测试对比
在 Vast.ai 上对比 EPYC 7352 + 192GB DDR4/PCIe4 (26.3 GB/s) 与 9975WX + 256GB DDR5/PCIe5 (54.3 GB/s) 进行 LLM 预训练,DDR5/PCIe5 速度快 15-20%。
Reddit · r/LocalLLaMAAI 评分4444 K2 Horizon 模型与 IFM 团队 AMA 问答预告
IFM(Institute of Foundation Models)发布 K2 Horizon 模型组,包含 6 个完全开源模型,参数规模覆盖 0.9B 至 375B。除模型权重外,团队还开源了训练数据、训练代码、中间检查点、训练日志和评估结果。AMA 活动将于 10 月 5 日周一举行,话题涵盖预训练、后训练、设备端小模型、MoVA 与稀疏注意力、部署策略等。
AWS Machine Learning BlogAI 评分4040 使用 NVIDIA NeMo Agent Toolkit 和 Amazon S3 Vectors 构建智能体记忆系统
NVIDIA NeMo Agent Toolkit (NAT) 1.6 版开源框架支持构建、分析和优化 AI 智能体,提供智能体编排、性能分析、评估和自动超参数调优功能。
Hacker News · 首页精选AI 评分7676 Cloudflare 发布开源决策模型 Clef 和 Clef-flash,上线 RL 微调平台
Cloudflare 发布两款决策模型 Clef 和 Clef-flash,均基于 Qwen 微调,支持文本和图像分类,在 Jev Decision Index 评估中领先。Clef 中位延迟 209.3ms,Clef-flash 仅 38.8ms,均优于 Jev 的 524.1ms。两款模型已开源至 Hugging Face 并托管于 Workers AI,同时推出 RL 微调服务供客户定制。
推荐理由:原文给出了与 Jev 的基准对比和延迟数据,读者可以判断决策模型在特定场景下是否比通用 LLM 更适合。
AWS Machine Learning BlogAI 评分4040 在 AWS 上实现 Claude Platform 多环境访问配置指南
Claude Platform on AWS 支持三种环境访问:通过跨账户 SigV4 实现 AWS 生产工作负载推理,开发者笔记本使用工作区级 API 密钥,外部环境通过 OIDC federation 获取临时凭证。采用专用 AI Services 账户承载订阅和工作区,工作负载账户通过角色假设调用推理,实现生产与开发流量隔离。
AWS Machine Learning BlogAI 评分4949 如何用 Amazon Bedrock AgentCore 构建响应事件流的 ambient agents
ambient agents 是一种响应事件流而非等待用户发起对话的 AI 智能体范式,可并行处理多个事件并在需要时通过 ask_human 工具暂停以获取人工确认。
Reddit · r/LocalLLaMAAI 评分5252 FreeToken vs llama.cpp 在 RTX 3090 上的基准对比
在 RTX 3090 上对 1024 tokens in / 256 out、1-32 并发进行基准测试:当模型 fit VRAM 时(Gemma-4-26B-A4B)。
Reddit · r/LocalLLaMAAI 评分4646 Pi 扩展:用本地 Qwen 27B 跳过推理并立即回答
pi-llama-skip-reasoning 扩展发布,强制本地 llama.cpp 模型跳过推理阶段直接给出答案。使用 /skip-reasoning 命令或 Alt+T 快捷键即可触发,适用于 Qwen 27B 等本地模型,通过 llama.cpp 原生机制实现快速响应。安装命令为 pi install npm:pi-llama-skip-reasoning。
Reddit · r/LocalLLaMAAI 评分3939 Opus 5.5 在 eBay 8x V100 服务器上的性能实测
在 5400 美元的 eBay 8x V100 服务器上运行 Opus 5.5,仅用 4 GPU 达到 120k KV 缓存(开启图像)。27B 模型 TP=4 实测推理速度超过 200 tok/s,prefill 约 2.5-3.5k tok/s,使用 nvfp4 Nvidia checkpoints。发现可实时解包为 fp16 的优化方案。
Reddit · r/LocalLLaMA精选AI 评分8080 Jeff-Qwen3.5-0.8B v1.2 + 9 个 LoRA 适配器:置于 Qwen3.8-27B 前实现 38 倍加速和 +8.7 准确率,额外内存占用不足 2GB
作者发布 Jeff-Qwen3.5-0.8B,这是一款小型“System 1”模型,可在一轮前向传播中从给定选项中做出选择并返回校准概率。作者为其训练了 9 个 LoRA 适配器,分别处理 prompt 注入检测、工具选择、票据优先级排序、答案溯源等常见决策任务。
推荐理由:原文给出了具体的性能对比数据和开源资源,读者可以据此判断这种“小模型+LoRA适配器前置”的架构是否适合自己本地部署的场景。