#端侧
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#端侧
今日 6 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分1818 Dwarfstar quants 量化技术使用体验讨论
用户在 M3 Ultra 96GB Studio 上运行 Qwen 3.8 next,使用 Dwarfstar 量化技术,反馈运行速度快且内存有盈余。询问其他用户的实际使用体验。
Reddit · r/LocalLLaMAAI 评分3434 本地 qwen3.8 驱动 Claude Code 电脑使用代理的尝试与云端模型对比
开发者用 qwen3.8 flash next nvfp4 通过 Claude Code 构建本地电脑使用代理,Prefill 速度约 1000 tps,生成速度约 50 tps,绘制简单图片耗时 12 分 1 秒(大部分时间花在解决 WebGL bug)。
Reddit · r/LocalLLaMAAI 评分4646 Pi 扩展:用本地 Qwen 27B 跳过推理并立即回答
pi-llama-skip-reasoning 扩展发布,强制本地 llama.cpp 模型跳过推理阶段直接给出答案。使用 /skip-reasoning 命令或 Alt+T 快捷键即可触发,适用于 Qwen 27B 等本地模型,通过 llama.cpp 原生机制实现快速响应。安装命令为 pi install npm:pi-llama-skip-reasoning。
Reddit · r/LocalLLaMAAI 评分3939 Opus 5.5 在 eBay 8x V100 服务器上的性能实测
在 5400 美元的 eBay 8x V100 服务器上运行 Opus 5.5,仅用 4 GPU 达到 120k KV 缓存(开启图像)。27B 模型 TP=4 实测推理速度超过 200 tok/s,prefill 约 2.5-3.5k tok/s,使用 nvfp4 Nvidia checkpoints。发现可实时解包为 fp16 的优化方案。
Reddit · r/LocalLLaMAAI 评分1414 寻找 Claude Cowork 的开源替代品
用户在 Reddit 询问 Claude Cowork 的开源替代品,需要项目/文档集成(Notion、Gmail 等)、网页搜索、PDF 创建等功能。通过自托管服务器运行 LLM,需支持连接 Ollama、Ninfer 等推理服务。目前发现 Eigent 工具但缺乏实际评测。
Product Hunt · AI 分类AI 评分3535 Twin:开源本地 AI 助手
Twin 是一款免费开源的 Mac 桌面浮窗 AI 助手,可查看短信、记住日程、语音回复,并在用户遗忘前发送提醒。数据完全本地存储在 DuckDB 文件中,支持用户自行接入 Claude、GPT、Gemini 或 Grok API 密钥,无云端、无需注册账户。
Reddit · r/LocalLLaMAAI 评分4040 在 vLLM 上实现 6 卡张量并行:Qwen 3.8 27B 模型 padding 方案
用户通过 padding 模型参数使其可被 6 整除,成功在 6 张 7900 XTX GPU 上运行 vLLM 的张量并行。实际部署 Qwen 3.8 27B BF16 模型支持 256k 上下文窗口,单用户 token 生成速度约 50 t/s,8 并发 prompts 聚合达 200 t/s。
Reddit · r/LocalLLaMAAI 评分3737 Strata 如何配置采样参数
用户可通过在 Strata 配置文件(如 strata-iq3_s.json)中添加 "sampling" 块来设置采样参数,支持 temperature: 1.0、top_p: 0.95、top_k: 20。请求自带的采样字段优先级高于配置文件默认值,完全未配置时默认使用 greedy 解码。该配置说明位于 docs/DETAILS.md。
Reddit · r/LocalLLaMAAI 评分4141 4xTesla T4 64GB 本地大语言模型推理服务器搭建记录
用户使用4张Tesla T4 16GB GPU(总计64GB显存)搭建本地大语言模型推理服务器,配置768GB DDR4 ECC内存和4块1TB三星870 EVO固态硬盘,运行Ubuntu 26.04系统,通过llama.cpp与OpenWebui提供推理服务。相比旧主机更多核心的CPU配置,当前推理速度表现出色,计划扩展更多GPU。
Reddit · r/LocalLLaMAAI 评分4343 ASTRABOX - 开源街机游戏生成器
ASTRABOX 是一款街机游戏生成器,用户描述游戏需求后 AI 自动构建,每个游戏拥有独立视觉和玩法,支持边玩边用语音要求修改。系统基于 Codex 构建共享运行时处理控制器、分数、玩家加入等通用功能,代码完全开源,可作为本地 Web 应用运行。项目仍处于实验阶段,欢迎开发者定制并探索适配本地编码模型和本地 STT/TTS。
Hacker News · 首页AI 评分3333 Groundrun 如何自动化 ESP32 Wi-Fi 设置测试
Groundrun 系统可自动化测试 ESP32-C6 的 5 种 Wi-Fi 配网方式,包括 Bluetooth、Soft AP、Wi-Fi captive portal、SmartConfig (ESPTouch v2) 和 WPS。
Reddit · r/LocalLLaMAAI 评分2222 本地模型评测:Dirk-Qwen 3.8-27B 对比 Swift-1.5 Qwen3.8-27B
在 M1 Max 32c 32GB 设备上对两个本地 Qwen3.8-27B 模型进行评测,Dirk-Qwen 在编码、数据分析、决策、RAG 和语音助手等任务上显著优于 Swift-1.5,Dirk 回答更准确、速度更快、token 消耗更少。
Reddit · r/LocalLLaMAAI 评分1010 48GB VRAM + 64GB RAM 配置有哪些本地大语言模型值得尝试?
用户在 RX 7800(16GB) 基础上新增 RX 9700(32GB) 组装 48GB VRAM + 64GB RAM 主机,已测试 Qwen3 8B 和 27B 参数模型。当前寻求其他可运行的大语言模型推荐,主要用于本地部署 Hermes Agent。
Reddit · r/LocalLLaMAAI 评分2222 本地运行 Qwen 27b 与前沿模型 API 成本对比:哪个更便宜?
Reddit 用户计算本地运行 Qwen 27b dense(使用 Qwen flash)的成本,发现每消耗 1kWh 电费需 0.25€(其居住地电费区间为 0.11€-0.35€),硬件配置为 7900xtx + 9800x3D。用户进而比较 DeepSeek flash 和 ChatGPT 的 API 成本,询问前沿模型是否比自己本地部署更经济。
Simon WillisonAI 评分3030 Photo Scrubber:本地面部模糊与元数据移除工具
Simon Willison 让 GPT-6 Astra 构建了一个实验性工具 Photo Scrubber,可识别照片中的人脸并自动模糊,同时移除 EXIF 等元数据。该工具使用 Google MediaPipe C++ 库(通过 @mediapipe/tasks-vision 编译为 WebAssembly)和 BlazeFace 人脸检测模型,完全在本地运行以保护隐私。
Product Hunt · AI 分类AI 评分4343 Clair 上线:支持从 Wear OS 手表或 Android 手机回答 Claude Code 提示
初创公司推出新应用 Clair,用户可通过 Wear OS 手表或 Android 手机回答 Claude Code 的权限提示、问题和计划审核。提示以端到端加密方式从电脑传输至手机。当前免费提供下载。
Reddit · r/LocalLLaMAAI 评分6464 Strix Halo + R9700 混合推理方案更新:性能超越 DGX Spark
开源项目 llama-halo-hybrid 利用 R9700 GPU 与 Strix Halo APU 混合推理,实现 60+ tok/s decode 和 2000+ tok/s prefill,支持 256k 上下文。
Reddit · r/LocalLLaMAAI 评分1919 AMD R9700 双卡推理:PCIe Gen4 与 Gen5 的性能差异
用户在双 AMD R9700 GPU 配置下(64GB VRAM pooling)使用 llama.cpp + ROCm 进行本地大语言模型推理,就 PCIe Gen4 相比 Gen5 带来的性能损失提出技术咨询,旨在寻找可节省成本的 DDR4/Gen4 方案。
Reddit · r/LocalLLaMAAI 评分2525 如何深入学习本地大模型微调:Qwen 27b 案例指南
用户在 Reddit r/LocalLLaMA 社区询问系统学习本地模型微调技术的途径,目标是用自定义语料库微调 Qwen 27b 构建法律通用聊天机器人。帖子提及 RL、RL LoRA、QLoRA、CPT LoRA 等新技术,但发现 YouTube 教程质量参差不平,知名频道 fireship、bycloud 也未覆盖这些新概念,希望能找到实践性强且避免浪费金钱和时间的学习资源。
Reddit · r/LocalLLaMAAI 评分2525 Qwen 3.8 Flash Next 的 IQ3 量化版本编程任务表现如何
用户拥有 28GB VRAM 和 32GB RAM,考虑加购 32GB RAM 以使用 Flash Next,想确认 IQ3 量化版本是否值得投入。主要用途是基于 Pi 或 OpenCode 等 harness 的 agentic coding 任务,想了解与 Qwen 3.8 27B Q4/Q5 版本的对比表现。
Reddit · r/artificialAI 评分4343 IQRAX:面向前沿大语言模型的设备优先确定性架构层发布测试邀请
研究者发布 IQRAX 架构层,将大语言模型的概率性智能与确定性控制分离。该系统在基准测试中实现 11.5× 成本降低和 48.3× 速度提升,最长连续运行记录达 28 小时以上。系统非开源(专利申请中),现邀请用户下载 PDF 并用历史对话进行测试验证。
Reddit · r/LocalLLaMAAI 评分4646 LokalBot 0.9.2 发布:5 个本地模型、6.8 GB 实现 Mac 会议全流程自动化
开源应用 LokalBot 发布 0.9.2 版本,整合 Qwen3-ASR 1.7B(转录)、Nemotron 3(说话人识别)、Qwen3.5 4B(笔记生成)、Harrier 0.6B(搜索嵌入)、LFM2.5 1.2B(全局自动补全)共 5 个本地模型,总权重 6.8 GB。
Reddit · r/LocalLLaMA精选AI 评分7676 Oído:可在 5 美元微控制器上运行的语音识别模型,击败 Whisper-tiny
Lokutor 团队发布 Oído 语音识别模型,基于 NVIDIA Conformer-CTC Small(1300 万参数,int8),可在 ESP32-S3(8 MB PSRAM)上运行,无需 GPU 或 NPU。
推荐理由:原文给出了在 ESP32-S3 微控制器上的 WER 对比数据,读者可以据此判断它是否能替代 Whisper-tiny 满足端侧需求。
Reddit · r/LocalLLaMAAI 评分1515 Pi + llama-server 随机卡住的故障排查
用户在使用 Pi 运行 llama-server 时,偶尔会遇到进程在 tool call 后停止响应的问题;日志显示任务已完成,但 Pi 端仍认为在等待响应,需手动停止并点击"Continue"恢复。该问题概率约 1%,运行 Qwen3.6 35B A3B IQ4_NL_XL 时出现,用户怀疑其他模型也可能存在此问题。
Product Hunt · AI 分类AI 评分4949 SelfJev 开源 4B 决策模型
SelfJev 是一个开源的 4B 参数决策模型,支持自托管。可针对任意文本提出类型化问题(yes/no、pick one、pick any、score),返回校准概率。通过两个环境变量将 TypeSafe SDK 指向服务器即可使用,也可在自有数据上进行微调。
Reddit · r/LocalLLaMAAI 评分4040 Qwen3.8 flash 配合 Strata 推理引擎在 12GB VRAM 笔记本上实现 51t/s 推理与 1500t/s 上下文读取
Strata 推理引擎在配备 5070ti 12GB VRAM、64GB RAM 的笔记本上运行 Qwen3.8 flash 模型,43k 上下文深度下达 51 t/s,较 stock llama.cpp 的 23 t/s 提升超过 2 倍。
Reddit · r/LocalLLaMAAI 评分6363 Sherry三进制3:4格式在WebGPU上运行:1.6 MB模型玩Connect Four,效果接近7.8 MB int8版本
Precisit团队实现了Sherry提出的3:4三进制量化格式在浏览器中运行。模型为740万参数的Connect Four评分器,权重仅1.375 bits per weight(5 bits存4个权重),在Chrome上用WebGPU运行延迟1.1ms/步。
Reddit · r/LocalLLaMAAI 评分1818 在 48GB Ampere GPU (A40) 上运行 QFN 的配置咨询
用户在 Reddit r/LocalLLaMA 询问 A40 GPU(48GB VRAM,128GB DDR3 系统内存)上运行 QFN 的良好配置。当前系统运行 27B 模型,希望通过 QFN 获得更好速度或更强智能。暂无具体配置方案提供。
Reddit · r/MachineLearningAI 评分4242 OpenTrainDNN:基于浏览器的实时神经网络可视化工具
OpenTrainDNN 是一款开源的客户端 Web 应用,可实时可视化深度神经网络的训练过程。该工具无需后端服务器、专业硬件驱动或本地安装,即可直接观察反向传播、激活流和权重更新的每一步动态。
Product Hunt · AI 分类AI 评分4343 FaveNest 发布:视觉化链接与笔记保存库,支持 Apple Intelligence 设备端 AI 标注
FaveNest 是一款视觉化保存库,支持链接、笔记、截图、PDF 和地点信息的集中管理,可从任意应用分享或通过 Safari 心形图标一键保存。Apple Intelligence 在设备端自动生成标题、摘要和标签,隐私不出本地,数据通过用户自有 iCloud 同步。
Reddit · r/LocalLLaMAAI 评分4242 Swift 1.5 对比 Qwen3.8 27B 基准测试:Apple M5 Max 上生成速度更快、运行时间更短
用户在 Apple M5 Max 64GB 上对比测试了 Swift 1.5(基于 Qwen3.8 27B)与基础版 Qwen3.8 27B,Swift 1.5 平均生成 51k tokens,显著低于 Qwen3.8 的 77k,完整基准测试运行时间 24 分钟对比 38 分钟。
Hacker News · 首页AI 评分3232 MicroLLM Lab:在浏览器中测试 7 个小模型
MicroLLM Lab 是一个浏览器端的开源基准测试工具,可运行 7 个 tiny LLM(135M 参数起)的推理速度和准确率测试。用户选择模型后即可运行,测试数据保留在本地设备上。工具支持用 JavaScript 编写自定义检查函数来验证模型输出。
Hacker News · 首页AI 评分5656 ESP32S3 集群运行 1.58-bit BitNet 语言模型
开源项目 ESP32s3-LLM-Cluster 在 7 个 ESP32S3 开发板上分布式运行切片的 0.5B LLM,其中 1 个 master 节点负责 tokenizer 和 embedding,6 个计算节点通过高速 SPI Daisy-Chain 通信执行 attention 层和 MLP,模型采用 1.58-bit BitNet 量化技术。
Reddit · r/LocalLLaMAAI 评分1313 llama.cpp Cublas 错误:Linux Mint 下如何正确卸载重装
用户在 Linux Mint 上运行 llama.cpp 时遇到 Cublas 错误导致首次 prompt 崩溃,VRAM 使用为 3000MB/8GB,通过不选择 CUDA 设备临时解决。
Product Hunt · AI 分类精选AI 评分6767 Codex Remote:开源 Mac 菜单栏应用让用户在自己的云端运行 AI 智能体
Codex Remote 是一个开源的 Mac 菜单栏应用,可将 Codex 和 Claude Code 部署到用户自己控制的云机器上。用户选择提供商和服务器规格后,应用会使用 OpenTofu 置备服务器、安装智能体并连接到已有应用。
推荐理由:原文说明了如何把 AI 智能体部署到用户自己控制的云端,并给出了具体的功能组合方式,读者可以据此判断它是否适合自己的工作流。
Reddit · r/LocalLLaMAAI 评分6969 我花15天微调了一个4B模型用于商业决策,在JevBench排名超越GPT-5.6 Luna
作者基于Qwen3.5-4B用LoRA微调了一个专注商业决策的模型ImaJev-4b,可处理文本和图片输入,在JevBench(91个模型)排名第一,得分67.37超越Jev(63.29),在DecisionBench(56个模型)排名第三,超越GPT-5.6 Luna和DeepSeek V4.1。
Reddit · r/LocalLLaMAAI 评分4949 Forlinx 20-TOPS M.2 AI 加速器支持 PCIe 级联用于本地大语言模型推理
Forlinx Embedded 推出基于 Rockchip RK1820/RK1828 处理器的 M.2 AI 加速卡,提供 20 TOPS INT8 算力,集成最高 5GB DRAM。模块采用 M.2 2280 接口,支持 PCIe 级联,可运行本地大语言模型、视觉语言模型及计算机视觉工作负载,兼容嵌入式 Linux 和 Android 系统。
Reddit · r/LocalLLaMAAI 评分2828 混合云/本地设置用于编程项目的使用体验如何?
用户探讨在编程项目中结合 Claude Code 或 Codex 与本地模型(如 Qwen 3.8 Flash Next),通过 MCP 或 API 让云端模型负责规划和验证、实际代码由本地模型完成的混合架构。该方案旨在降低云端 API 调用成本,但作者质疑其实际成本节约效果和复杂度是否值得。
Product HuntAI 评分4040 ImageFlow:一款完全在浏览器中运行的免费图像编辑器
ImageFlow 是一款完全在浏览器中运行的免费全功能图像编辑器,支持图层、蒙版、混合模式、调整图层、智能对象、文字与滤镜,并支持 PSD 导入导出和设备端 AI 选区;所有处理均在本地完成,文件不上传服务器。
Reddit · r/LocalLLaMAAI 评分6060 Qwen 3.8 27B Q4 如何在 16GB RX 7800 XT 上实现 100K 上下文
作者在 16GB AMD RX 7800 XT GPU 上成功运行 Qwen 3.8 27B Q4 XS 模型,达到约 30 t/s 解码速度,支持 100K 上下文。