#部署/工程
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#部署/工程
今日 5 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Hugging Face Blog精选AI 评分6161 AllenAI 发布 Olmo-core 3:面向大规模 MoE 的开源可扩展训练基础设施
AllenAI 发布 Olmo-core 3 训练框架,支持将专家池从 8 扩展到 128 而每 token 仅激活 4 个专家,总参数量从 4.6B 增至 47B,训练吞吐量仅下降不到 5%。在 8 个 NVIDIA B300 GPU 上,47B MoE 达 52,000 tokens/s/GPU,约为此前实现的 2.7 倍。系统已测试至 1.2 万亿参数规模。
推荐理由:原文给出了专家池扩展、吞吐量提升和参数规模的具体数字,读者可以据此判断这套训练基础设施对大模型研究的具体价值。
TechCrunch · AIAI 评分4242 Satlyt 融资 800 万美元,在卫星上运行 AI 软件
summary_ž: 前 Google 和 SpaceX 产品经理 Rama Afullo 创立 Satlyt,完成 800 万美元种子轮融资,旨在构建卫星间共享计算资源的软件平台。本周随 SpaceX 火箭发射,将与 Google Project Suncatcher 一起升空,年初部署的 Google DeepMind Gemma 模型已使传输数据量减少 60% 以上。
Hacker News · 首页AI 评分4040 如何在 2026 年 9 月加速 Rust 编译器
Rust 编译器在 2026 年 7 月 29 日至 9 月 28 日期间取得 4.57% 的平均编译时间缩减,629 个基准测试中 555 个改进。Clippy 启用 PGO 带来最多 18% 的提升,LLVM 升级至 LLVM 23 贡献 1.2% 缩减。
Reddit · r/LocalLLaMAAI 评分5858 llama.cpp 合并 Qwen Flash Next 的 MTP 支持 PR
llama.cpp 合并了 PR #29761,为 Qwen Flash Next 模型增加 MTP(Multi-Token Prediction)支持,开发耗时 17 小时。模型量化版本已上线 HuggingFace,用户可考虑是否从 Qwen 3.8 27B 切换。
Reddit · r/LocalLLaMAAI 评分6262 szmcp:ZIM HTML 转 Markdown 转换器及 ZIM MCP 服务器
用户发布了一个用 Rust 编写的 ZIM 文件 MCP 服务器项目,旨在让本地小模型能访问离线知识库。该工具可将 Kiwix Wikipedia ZIM 文件转换为 Markdown 格式,49 GB 的英文 Wikipedia ZIM 可转换为 19 GB Markdown。
Reddit · r/LocalLLaMAAI 评分4040 在 vLLM 上实现 6 卡张量并行:Qwen 3.8 27B 模型 padding 方案
用户通过 padding 模型参数使其可被 6 整除,成功在 6 张 7900 XTX GPU 上运行 vLLM 的张量并行。实际部署 Qwen 3.8 27B BF16 模型支持 256k 上下文窗口,单用户 token 生成速度约 50 t/s,8 并发 prompts 聚合达 200 t/s。
Product Hunt · AI 分类AI 评分3737 Buddy DevOps 平台支持 AI 智能体自动化部署与基础设施管理
Buddy 是一个集成托管应用、网站、沙盒环境、域名管理、测试、部署和管道自动化的 DevOps 平台,支持通过 UI、YAML 或代码配置。Claude Code、Cursor、Copilot 等 AI 智能体可通过 MCP 或 CLI 直接操作部署、基础设施和日志。目前来源未明确发布定价和可用性信息。
Reddit · r/LocalLLaMAAI 评分4141 4xTesla T4 64GB 本地大语言模型推理服务器搭建记录
用户使用4张Tesla T4 16GB GPU(总计64GB显存)搭建本地大语言模型推理服务器,配置768GB DDR4 ECC内存和4块1TB三星870 EVO固态硬盘,运行Ubuntu 26.04系统,通过llama.cpp与OpenWebui提供推理服务。相比旧主机更多核心的CPU配置,当前推理速度表现出色,计划扩展更多GPU。
Hacker News · 首页AI 评分3333 Groundrun 如何自动化 ESP32 Wi-Fi 设置测试
Groundrun 系统可自动化测试 ESP32-C6 的 5 种 Wi-Fi 配网方式,包括 Bluetooth、Soft AP、Wi-Fi captive portal、SmartConfig (ESPTouch v2) 和 WPS。
Product Hunt · AI 分类AI 评分1616 FastRouter.ai:面向 LLM 应用的统一 AI 网关与控制平面
FastRouter.ai 是一个面向 LLM 开发者与企业团队的统一 AI 网关与控制平面。它通过一个兼容 OpenAI 的 API,将每次请求路由到 200+ LLMs 中最合适的模型,从成本、延迟、质量和可靠性四个维度进行优化。其功能涵盖智能路由、故障转移、可观测性与治理,可在不绑定供应商或改动代码的前提下扩展 AI 应用。
Reddit · r/LocalLLaMAAI 评分6464 Strix Halo + R9700 混合推理方案更新:性能超越 DGX Spark
开源项目 llama-halo-hybrid 利用 R9700 GPU 与 Strix Halo APU 混合推理,实现 60+ tok/s decode 和 2000+ tok/s prefill,支持 256k 上下文。
Hacker News · 首页AI 评分2121 Show HN: Strata – 可对 LLM 说"不"的表达性语义层
Strata 是 Netflix 内部孵化的商业智能平台,定位为 AI 时代的高性能语义层,支持 15 分钟本地部署(Docker + 自有编码智能体),提供治理语义层、自助仪表板、实时数据智能体和联邦开放 OLAP 引擎。某全球娱乐公司客服部门使用 Strata 后,800 名非技术用户自助分析从每周 5 次增至 100+ 次,临时数据请求下降 90%,合作伙伴入职仅需 10 分钟。
Hacker News · 首页AI 评分6868 Netlify Edge Functions 迁移至 Firecracker MicroVMs,性能提升 5 倍
Netlify 宣布其 Edge Functions 底层架构从 V8 isolates 迁移至 Firecracker MicroVMs,中位数延迟从 25-40ms 降至 5-6ms,p99 延迟降低 47.4%,可用性达 99.998%。该架构已在生产环境上线,现有项目无需迁移,定价保持不变,同时开放了 npm 包支持并为未来扩展奠定基础。
Reddit · r/LocalLLaMAAI 评分5757 原生 Rust + Vulkan Transformer 训练后端更新:14 种架构通过验证,完整 PEFT 支持
作者在华硕 ROG Ally Z1 Extreme(AMD RDNA 3 GPU)上验证了 14 种架构的完整训练支持,包括 DeepSeek V4、Phi-4、Kimi 系列、Qwen 系列、Mistral 等,最大两阶段 AdamW 参数误差 1.19e-7。
Reddit · r/LocalLLaMAAI 评分2525 如何深入学习本地大模型微调:Qwen 27b 案例指南
用户在 Reddit r/LocalLLaMA 社区询问系统学习本地模型微调技术的途径,目标是用自定义语料库微调 Qwen 27b 构建法律通用聊天机器人。帖子提及 RL、RL LoRA、QLoRA、CPT LoRA 等新技术,但发现 YouTube 教程质量参差不平,知名频道 fireship、bycloud 也未覆盖这些新概念,希望能找到实践性强且避免浪费金钱和时间的学习资源。
Reddit · r/LocalLLaMAAI 评分1515 Yandex/AliceAI 80B-A3B 微调进展更新
独立开发者正在微调 Yandex/AliceAI 80B-A3B 模型,初始微调已完成约 40%。训练过程有直播可查看全部训练数据,开发者同时使用 gemini 3.8 flash 辅助微调。该数据集包含约 3.5k 样本,由 sftmill 生成,未来计划公开分享。
Reddit · r/LocalLLaMAAI 评分6767 在 Hugging Face 开源全球最快的本地 AI WebGPU 内核
在 Hugging Face 开源了全球最快的 WebGPU 内核集合,包含 200 多个常见 ML 操作的内核,全部可在浏览器中本地运行。正在将这些优化上游至 Transformers.js、ONNX Runtime Web、LiteRT.js 等项目。
Hacker News · 首页AI 评分2929 TLA+ 能检查什么和不能检查什么
Claude Code 发明者 Boris Cherny 提到 Opus 可用 TLA+ 查找代码竞态条件,引发对形式验证的热议。TLA+ 擅长检查安全属性(不变式、动作属性)和活性属性(<>P、[]<>P 等),但无法表达不可形式化的属性、多步属性、浮点数操作、真实时间,以及"存在某行为满足P"这类可达性属性和超属性。
Hacker News · 首页AI 评分6666 Magnitude(YC S25)发布自优化推理引擎,支持一键连接现有 Agent
Magnitude 是 YC S25 孵化的开源推理引擎,可在设备上编译和调优内核,针对实际硬件进行优化。相比 llama.cpp 提速最高 2 倍(Metal 92%,CUDA 19%),内存减少 27%,支持 Apple Silicon、NVIDIA、AMD 或纯 CPU。
Reddit · r/artificialAI 评分4343 IQRAX:面向前沿大语言模型的设备优先确定性架构层发布测试邀请
研究者发布 IQRAX 架构层,将大语言模型的概率性智能与确定性控制分离。该系统在基准测试中实现 11.5× 成本降低和 48.3× 速度提升,最长连续运行记录达 28 小时以上。系统非开源(专利申请中),现邀请用户下载 PDF 并用历史对话进行测试验证。
Hacker News · 首页AI 评分4444 AI 竞赛突然变得尴尬:西方公司悄然采用中国大模型优化技术
DeepSeek 发布了突破性的 KV cache 优化技术,将全局缓存降至 890 bytes per token,相较 DeepSeek-V1 减少约 437x,并首创 MLA 架构压缩约 15x。Claude Opus 5.5 缓存读取价格比 Opus 5 降低 60%,GPT-6.1 Sol 比 GPT-5.6 Sol 降低 80%,标志着西方公司已全面采用中国大模型的优化方案。
The DecoderAI 评分6868 DeepSeek 为华为 Ascend 芯片发布开源编程工具 TileLang
DeepSeek 与华为合作发布开源编程工具,包括 TileLang 语言和针对 128 块 Ascend 950 芯片的超级节点优化。TileLang 由北京大学研究者开发,DeepSeek 已使用约一年,旨在提供比 CUDA 更简单的编程模型。这是中国 AI 产业构建独立软件生态的努力,旨在减少对 Nvidia CUDA 生态的依赖。
Reddit · r/MachineLearningAI 评分4141 一个 LLM 无限循环如何在一夜间烧掉近 $1,200(以及如何硬性设上限)
一个使用 Anthropic/OpenAI API 的轻量级多智能体项目因边缘情况触发无限递归循环,险些在夜间烧掉约 $1,200。原生 API 仪表板仅在超阈值后才发警报,且计费更新延迟数小时,无法实时阻止损失。作者建议在预算超支前通过硬性代理上限(hard proxy ceiling)断开连接,防止请求触及提供商。
Reddit · r/MachineLearningAI 评分3232 教程玩具代码与实际生产 AI 系统的差距令人沮丧
开发者常将 AI 工程简化为高层 API 封装组合,但生产环境需处理并发流量下的异步事件循环阻塞、VRAM 碎片化、内存约束调优、连续批处理和分布式索引分片等技术挑战。作者花费数月撰写深度技术书籍,试图记录实际数学、系统工程和基础设施的真相,反映出教程与生产环境之间的巨大鸿沟。
Reddit · r/LocalLLaMAAI 评分1515 Pi + llama-server 随机卡住的故障排查
用户在使用 Pi 运行 llama-server 时,偶尔会遇到进程在 tool call 后停止响应的问题;日志显示任务已完成,但 Pi 端仍认为在等待响应,需手动停止并点击"Continue"恢复。该问题概率约 1%,运行 Qwen3.6 35B A3B IQ4_NL_XL 时出现,用户怀疑其他模型也可能存在此问题。
Reddit · r/LocalLLaMAAI 评分2020 vLLM 批量 API 调用共享前缀的最佳实践
用户在 agent workflow 中使用 asyncio.gather 并发 10 个 vLLM API 调用,这些调用共享相同 prompt 仅在最后查询/指令处不同,询问处理共享前缀批量请求的最佳实践。用户考虑先发送单个请求让 vLLM 完成 cache block 并开始解码,再发送剩余批量请求,通过 router 确保路由至同一 worker。
Reddit · r/LocalLLaMAAI 评分5959 Reddit 用户实测 5070ti 显存超频至 1248 GB/s,提升本地推理 token 生成速度
Reddit 用户分享其 5070ti 显卡通过 mlock 工具解锁显存超频,显存带宽从默认提升至 1248 GB/s(+40%)。用户指出 GDDR7 显存具有较大超频空间,这一优化对本地大语言模型推理,特别是 token 生成速度有显著帮助。
Product Hunt · AI 分类AI 评分4949 SelfJev 开源 4B 决策模型
SelfJev 是一个开源的 4B 参数决策模型,支持自托管。可针对任意文本提出类型化问题(yes/no、pick one、pick any、score),返回校准概率。通过两个环境变量将 TypeSafe SDK 指向服务器即可使用,也可在自有数据上进行微调。
Product Hunt · AI 分类AI 评分3131 Agent Identity:为 AI 智能体提供持久身份、凭证与权限控制
Agent Identity 为 AI 智能体提供持久身份、凭证、权限和审计追踪功能,解决现有身份基础设施无法适应智能体访问 API、数据库、SaaS 工具等场景的问题。开发者可借此控制智能体的访问范围和行为。该方案面向构建真实智能体系统的开发者。
Product Hunt · AI 分类AI 评分2828 JarvisCore:AI 智能体对等运行时发布
JarvisCore 是一个让 AI 智能体作为平等同行网络运行的运行时环境。智能体通过能力互相发现,从共享账本执行任务,并通过零信任代理对外部服务进行身份验证,而非使用自己的密钥。
Reddit · r/LocalLLaMAAI 评分4040 Qwen3.8 flash 配合 Strata 推理引擎在 12GB VRAM 笔记本上实现 51t/s 推理与 1500t/s 上下文读取
Strata 推理引擎在配备 5070ti 12GB VRAM、64GB RAM 的笔记本上运行 Qwen3.8 flash 模型,43k 上下文深度下达 51 t/s,较 stock llama.cpp 的 23 t/s 提升超过 2 倍。
Hacker News · 首页AI 评分7575 PSSA:从零编写的非 Transformer 语言模型
PSSA 是一种使用塑料状态空间架构的语言模型,不是 Transformer。它通过递归状态空间层逐 token 阅读文本,维护一个情景记忆库,并在运行中重写部分权重。
Reddit · r/LocalLLaMAAI 评分1010 r/LocalLLaMA 社区讨论:有什么适合学生使用的本地大模型工具?
Reddit r/LocalLLaMA 社区用户发帖征集适合学生使用的 FOSS、自托管及 AI 工具,涵盖学习、笔记、时间管理、研究等场景。帖中未列出具体工具名称或使用案例,仅为开放性提问,由社区其他用户跟帖分享实际使用经验。
Reddit · r/LocalLLaMAAI 评分4040 推理引擎走向定制化:专用引擎将取代通用方案
针对特定模型/硬件组合优化的“一次性”推理引擎正在快速涌现,如 ninfer、Splash、llamAmpere 等,因专注单一场景可深度优化内核和计算图,token 生成速度超越通用引擎 llama.cpp 和 vLLM。
AWS Machine Learning BlogAI 评分3434 Condé Nast 如何用 Amazon Bedrock 构建多模态视频发现系统
Condé Nast 联合 AWS Generative AI Innovation Center 基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型实现跨视频文字记录、视觉元素和音频的语义搜索。
Reddit · r/LocalLLaMAAI 评分5858 vLLM 新增专家 RAM offloading 功能
感谢开发者 tcclaviger,vLLM 新增了专家 RAM offloading 支持,使前沿模型在本地部署更易实现。作者在四块 R9700 GPU 上成功运行了 DeepSeek-V4-Flash-Vision-Exp,并提供了完整的 podman 运行命令和配置参数。
Hacker News · 首页AI 评分5656 ESP32S3 集群运行 1.58-bit BitNet 语言模型
开源项目 ESP32s3-LLM-Cluster 在 7 个 ESP32S3 开发板上分布式运行切片的 0.5B LLM,其中 1 个 master 节点负责 tokenizer 和 embedding,6 个计算节点通过高速 SPI Daisy-Chain 通信执行 attention 层和 MLP,模型采用 1.58-bit BitNet 量化技术。
Reddit · r/LocalLLaMAAI 评分1313 llama.cpp Cublas 错误:Linux Mint 下如何正确卸载重装
用户在 Linux Mint 上运行 llama.cpp 时遇到 Cublas 错误导致首次 prompt 崩溃,VRAM 使用为 3000MB/8GB,通过不选择 CUDA 设备临时解决。
Product Hunt · AI 分类精选AI 评分6767 Codex Remote:开源 Mac 菜单栏应用让用户在自己的云端运行 AI 智能体
Codex Remote 是一个开源的 Mac 菜单栏应用,可将 Codex 和 Claude Code 部署到用户自己控制的云机器上。用户选择提供商和服务器规格后,应用会使用 OpenTofu 置备服务器、安装智能体并连接到已有应用。
推荐理由:原文说明了如何把 AI 智能体部署到用户自己控制的云端,并给出了具体的功能组合方式,读者可以据此判断它是否适合自己的工作流。
Reddit · r/LocalLLaMAAI 评分4949 Forlinx 20-TOPS M.2 AI 加速器支持 PCIe 级联用于本地大语言模型推理
Forlinx Embedded 推出基于 Rockchip RK1820/RK1828 处理器的 M.2 AI 加速卡,提供 20 TOPS INT8 算力,集成最高 5GB DRAM。模块采用 M.2 2280 接口,支持 PCIe 级联,可运行本地大语言模型、视觉语言模型及计算机视觉工作负载,兼容嵌入式 Linux 和 Android 系统。