#端侧
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#端侧
今日 6 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/MachineLearningAI 评分3939 开发者用 1.26M 参数模型将 htop、vim 等 TUI 实时转成 A2UI 组件
开发者训练了一个 1.26M 参数的轴向 Transformer 模型,对 TUI 屏幕的 15 类角色进行标注,再用确定性逻辑转为 Google A2UI 协议组件,使客户端无需运行终端模拟器即可接收真实 UI,按键作为 Button 动作回传。
TechCrunch · AIAI 评分6060 微软发布搭载 RTX Spark 芯片的 Surface AI PC 与新版 Windows 11
微软在旧金山 Tech Week 活动上公布搭载 Nvidia RTX Spark 芯片的 Surface Laptop Ultra,起价 2,600 美元、高配起价 3。
Reddit · r/LocalLLaMAAI 评分3737 Liquid AI 发布 Open d1:面向决策任务的开源权重多模态模型
Liquid AI 发布开源权重决策模型 Open d1,包含 3B 参数的 d1-3B(文本+视觉)和实验性的 600M 参数 d1-omni-600M(文本+图像/音频)。
Reddit · r/LocalLLaMAAI 评分2828 Liquid AI 发布 d1-omni-600M,作者用 WebGPU 在浏览器中运行
Liquid AI 发布 600M 参数的 d1-omni-600M 决策模型,作者将其移植到自研的 WebGPU 推理库 runntime,纯 TypeScript 实现并直接加载 HF safetensors 权重,无 WASM 中间层。
Reddit · r/LocalLLaMAAI 评分2828 GLM-Edge-1.5B-Chat 在 4GB Galaxy A04e 上完成真实亚马逊加购任务
一台搭载 4GB RAM 的 Samsung Galaxy A04e 手机在本地运行 Q4_K_M GGUF 量化、未做任何微调的 GLM-Edge-1.5B-Chat 模型,通过 llama.cpp 在桌面 Firefox 中完成了真实亚马逊购物车的加购任务,成功将一盒 24 节装 AA 碱性电池和黄色橡皮鸭加入购物车。
Hugging Face BlogAI 评分4747 Liquid AI 开源 d1 系列边缘决策模型:d1-3B 与多模态 d1-omni-600M
Liquid AI 开源 d1 系列两款边缘决策模型 d1-3B 与实验版 d1-omni-600M,分别支持文图与文图或文音输入,均已在 Hugging Face 开源下载。
TechCrunch · AIAI 评分2626 Tony Fadell 谈第一波 AI 硬件为何失败,以及下一阶段的方向
iPod 之父 Tony Fadell 在 MIT Future Fest 上指出,Rabbit R1、Humane Ai Pin、Limitless pendant 等初代 AI 硬件均因未解决真实痛点而停产,因为全球不足 0.01% 的人真正使用过人类助理,消费者尚不知该如何与 AI 助理建立信任。
Hacker News · 首页AI 评分3737 NanoMuse:跨手机与电脑的开源个人 AI 智能体
NanoMuse 是一款开源个人 AI 智能体,最新版本为 0.1.40 Clear,支持 Android、iOS、macOS、Windows 和 Linux,可在手机、电脑与自托管服务器上运行并共享同一账号。
Google DeepMindAI 评分5555 Google DeepMind 发布端侧多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 推出 EmbeddingGemma 2,基于 Gemma 4 架构,采用 Apache 2.0 协议开源,参数量为 740M,可将文本、图像、音频和视频映射到统一嵌入空间。
Reddit · r/LocalLLaMAAI 评分1515 Qwen3.8-Flash-Next 在 Strata 上获得 Strix Halo 机器的官方实验性支持
Strata 面向 Strix Halo 机器新增对 Qwen3.8-Flash-Next 的官方实验性支持,目前仅在 Linux 上可用。该实现基于 Unsloth 的 Q4 和 GSQ-RS 模型权重,在长上下文解码与 ppts 上表现最佳,上下文长度最高可达 1M 而速度损失不大,作者欢迎反馈和 pull request。
Reddit · r/LocalLLaMAAI 评分2828 基于 Qwen3.5 4B 的本地化书稿校对工具 Betty 跨五语言实测
一位数据科学家自研了名为 Betty 的离线书稿校对应用,底层使用 Qwen3.5 4B 模型,可对约 12 万词的完整小说进行本地化、免费的复制编辑。
Reddit · r/LocalLLaMAAI 评分2929 开发者发布 Chrome 扩展,用浏览器内本地小模型过滤 YouTube 信息流
开发者发布 Chrome 扩展 opendecider-focus 0.8.1,通过 ONNX Runtime Web 在浏览器内加载 opendecider-nano 模型,对 YouTube 视频标题分类并按用户规则隐藏特定类型内容,全程不上传数据、离线运行。
Reddit · r/LocalLLaMAAI 评分3232 Orange Pi 5 Plus(RK3588)本地大语言模型推理基准:大核绑定、NPU 卸载与散热实测
在 Orange Pi 5 Plus(RK3588,16GB LPDDR4x)上对 1B–8B 模型做 Ollama CPU 推理基准测试:将线程绑定到 4 个 Cortex-A76 大核比默认 8 线程最高快 +318%。
Reddit · r/LocalLLaMAAI 评分1818 社区为 96GB M5 Ultra Mac Studio 发布 Swift 1.5 Qwen3.8 Flash 的 MLX 量化版本
网友 DankpawsDev 针对搭载 M5 Ultra 的 96GB Mac Studio,发布了 UkisAI Swift 1.5(基于 Qwen3.8 Flash)的 MLX 校准量化版本,文件约 107GB,仅文本、实测 179,200 token 上下文。
Reddit · r/LocalLLaMAAI 评分4646 Cactus Whistle:16.9MB 超小体积 ASR 模型,文件大小仅为 Whisper base 的 1/9
Cactus Compute 发布 Whisper 同类自动语音识别模型 Whistle,权重开源,文件仅 16.9MB,约为 Whisper base(145.3MB)的 1/9。
Reddit · r/LocalLLaMAAI 评分3939 Qwen3.8-Flash-Next (125B) 在单台 Strix Halo 迷你 PC 上跑通:投机解码下 44-59 tok/s,开源推理引擎同步发布
团队在搭载 Ryzen AI Max+ 395、128 GB 内存的 Strix Halo 迷你 PC 上成功运行 Qwen3.8-Flash-Next(125B MoE,激活 6B),并同步开源其推理引擎 Kyojin(基于 ExLlamaV3 构建)。
Reddit · r/LocalLLaMAAI 评分4141 M3 Max 36 GB 上四款 MLX 推理引擎实测:Qwen3.6-35B-A3B 达 110 tok/s,Qwen3.8-27B 约 31.7 tok/s
用户在 14 寸 M3 Max(36 GB)上对比了 oMLX 0.7.0、Rapid-MLX 0.15.5、Splash 1.2.1 和 MTPLX 2.12.2 四款 MLX 推理引擎。
Reddit · r/MachineLearningAI 评分1717 开发者用合成数据训练仅 31,251 参数的 encoder-only Transformer 预测血糖(第二部分)
开发者 0xdeadf1sh 发布第二部分实验,基于其 1 型糖尿病患者模拟器合成数据训练了一款仅 31,251 参数的 encoder-only Transformer 模型,可预测未来 2 小时血糖并能以自回归方式扩展至 8 小时夜间预测,训练时长不足 60 分钟,使用 NVIDIA DGX Spark。
Reddit · r/LocalLLaMAAI 评分3434 Lokutor 团队发布 ItoTTS:面向 $5 ESP32-S3 的自然语音 TTS 引擎,单个声部权重仅 4.89 MB
Lokutor 团队发布面向 ESP32-S3 的流式 TTS 引擎 ItoTTS,提供两个 24 kHz 英语人声,单个声部权重仅 4.89 MB,目标是让本地大语言模型在 $5 芯片上获得语音输出。
Reddit · r/LocalLLaMAAI 评分4646 Agens Volundr 32B Preview 发布:Blockway 自研混合架构,72 层仅 18 层保留 KV cache
Blockway 团队发布 Agens Volundr 32B Preview,这是其首款基于自研混合架构的模型,72 层中仅 18 层保留 KV cache,上下文窗口 262K,采用 Apache-2.0 开源。
Reddit · r/LocalLLaMAAI 评分2222 DecisionTune 1.0:395M 离线决策编码器,MLX 短单决策约 10 ms(Apache-2.0)
DecisionTune 1.0 是一个 395M 参数的离线决策编码器,基于 ModernBERT-large 加 4 KB 评分头,输入状态、问题和选项列表后输出每个选项的概率或 P(yes),不生成文本。
Reddit · r/LocalLLaMAAI 评分2222 用户在 Mac Mini M5 64GB 上跑通千问 Qwen Flash Next Q4,结合 SSD 流式与外部盘并行读取优化推理速度
用户在 Mac Mini M5 64GB 上本地运行 Qwen Flash Next Q4 实测取得 17.5 tks decode 和 360 tks prompt processing 的速度。
Reddit · r/artificialAI 评分1414 如何用 AI 构建个人知识追踪与摘要系统?
一位从业者为高效追踪多位专家的YouTube视频、邮件、X推文和PDF等内容,求助AI辅助总结与知识管理方案。提出利用 yt-dlp 获取内容、Whisper 转录视频、SQLite+FTS5 存储与检索的流水线,作者具备 Codex/Claude Code 使用经验和本地硬件资源。
Reddit · r/LocalLLaMAAI 评分3535 预算友好型 Vulkan GPU 推荐列表
整理了一份支持 Vulkan 的旧款预算 GPU 推荐列表,筛选条件为内存带宽≥256 GB/s、VRAM≥8 GB,涵盖 NVIDIA GTX/Tesla/Quadro、AMD Radeon/Instinct 等多系列。最终推荐 AMD Instinct MI50 16GB,当前二手市场约 $150。
Reddit · r/LocalLLaMAAI 评分2828 升级双 R9700 显卡配置咨询:如何搭建以运行 Qwen3.8-Flash-Next
Reddit 用户从单张 AMD Radeon AI PRO R9700 升级到双卡配置,以加速运行 Qwen3.8-Flash-Next(Q4/higher quants 27B)。主板已确认支持 x8/x8 显卡拆分,总价约 $6307.84。
Reddit · r/LocalLLaMAAI 评分4444 SPOPI: 允许 Pi 自己修改的本地 AI 编程 UI 和编辑器
开发者推出 SPOPI,一个围绕 Pi(本地 AI 编程工具)构建的 UI 和编辑器,采用 Tauri 2 + Rust 开发,使用系统原生 Webview。该工具完全本地运行、离线可用、无遥测数据,其核心特点是 Pi 可以实时修改 UI 界面,如布局、颜色、按钮等,并自动支持新功能包。
Reddit · r/LocalLLaMAAI 评分3434 本地跑酷模拟器实现:GLM-4-Flash + 2x DGX Sparks + vllm TP2 推理
开发者在 2x DGX Sparks 服务器上运行 GLM-4-Flash 模型,实现完全本地化的跑酷模拟器。采用 vllm TP2 方案,Prefill 吞吐量约 1500token/s,Decode 约 40token/s,支持 100k 上下文。
Reddit · r/LocalLLaMAAI 评分2323 双 DGX Spark 用户:GLM 5.3 flash 获得 50%+ 性能提升
GLM 5.3 flash 最新版本在双 DGX Spark 环境下实现 50-90% decode 性能提升,prefill 仅轻微下降(-10% 至 -21%)。实测代码、聊天、SQL 插入等任务提升 7-13%,整体速度超越 DeepSeek v4.0 flash,智能水平接近 Claude Opus 4.8。
Reddit · r/LocalLLaMAAI 评分4545 LFM2.5 2.6b 对比 MiniCPM5 2b:M1 Air 上的小参数模型 Agent 任务评测
作者在 M1 Air 上对比测试了 LFM2.5 2.6b 与 MiniCPM5 2b 两个小参数模型在工具调用类 agentic 任务上的表现。LFM2.5 2.6b 达 200 t/s 推理速度、仅用 2.5GB RAM,MiniCPM5 2b 为 162 t/s、需 3.8GB RAM。LFM2.5 速度更快且更省内存,但在长对话场景容易产生幻觉;MiniCPM5 虽更智能但常以中文回复。
Reddit · r/LocalLLaMAAI 评分5858 Intel 混合 CPU 用户运行 Strata 调优:解码速度提升近 3 倍
用户在 Intel 14700KF 混合 CPU 上运行 Strata 推理引擎,通过 calibrate 工具调整三个设置,使 Qwen3.8-Flash-Next IQ3_S 在 262K 上下文下的解码速度从 17.2 tok/s 提升到 53.5 tok/s。
Reddit · r/LocalLLaMAAI 评分2323 从单张 3090 到 20 节点 DGX Spark:我的本地大模型推理集群升级之路
一位工程师分享了他从单张 RTX 3090 逐步搭建本地大模型推理集群的过程,历经 16x3090、4x/8x ASUS GB10,最终扩展到 20 节点 NVIDIA DGX Spark,可本地运行 Kimi K3(2.8T)等顶级开源模型。通过优化在 300k 上下文下达到 20 t/s,从未订阅商业 API。
Reddit · r/LocalLLaMAAI 评分7575 Qwen3.8 27B 在单张 AMD R9700 上的性能:262K 上下文、50 万 tokens 可重用缓存
作者发布了 Qwen3.8 27B 模型在单张 AMD Radeon AI PRO R9700(32GB)上的运行结果,使用 3-bit 权重(仅大投影矩阵)和 speculative decoding,可重用缓存达到 569,878 tokens,每个请求支持 262,144 tokens 上下文。
Reddit · r/LocalLLaMAAI 评分1515 如何提升 Qwen 本地模型的创意写作能力
一位用户询问如何提升本地 Qwen 模型的创意写作能力,目前使用 Qwen 3.8 flash next(q4 量化版本)通过 llama.cpp 运行。该用户指出 Qwen 模型在研究和 HTML 文件编写方面优于 Gemma 和 Muse,但后者在创意写作方面表现更强。
Reddit · r/LocalLLaMAAI 评分4747 Strata 0.1.38 本地大模型推理性能测试:RTX 4090 48GB + 128GB RAM
在 RTX 4090 48GB + 128GB RAM 上测试 Strata 0.1.38 推理引擎,发现 n-gram 表加载到 RAM 仅提升 1.2% 解码速度但占用 28.4 GiB。
Hacker News · 首页AI 评分6767 SCM:macOS 本地 AI 照片与视频逐帧搜索工具
SCM(Screen Memories)是一个 macOS 本地优先的 AI 搜索工具,可对照片和视频的每一帧进行语义搜索。支持四种搜索模式:文件语义搜索、视频场景定位、OCR 文字识别、Whisper 对话文字检索,还可开启本地 LLM 聊天功能。所有推理在本地 Mac 上运行,首次下载模型权重后完全离线,无账户、无云端、无上传。提供 Homebrew 安装方式。
Reddit · r/LocalLLaMAAI 评分3636 本地 TTS 工具 Breeze 体验:结合 Opus 5.5 实现低延迟语音对话
用户使用本地 TTS 工具 Breeze 结合 Opus 5.5 模型,实现语音对话功能。无思考模式延迟约 500ms,低思考模式延迟 1-1.5s,可通过 BLE 遥控器和无线麦克风坐在沙发上直接对话。系统能监控 Claude session 结束并用语音发送简短摘要,在超过 500k token 上下文后仍保持一致的 live session 记忆。
Reddit · r/LocalLLaMAAI 评分1414 LocalLLaMA 用户分享本地 AI 服务器设置体验
用户将设置好的 AI 服务器关机后移至地下室的服务器机架,重新启动后在客户端应用发送测试消息,得到满意的回复。帖子获得较多关注但无具体模型或技术细节。
Reddit · r/artificialAI 评分1616 从 100KB 到 2.5TB:Reddit 用户梳理 AI 模型规模谱系与硬件成本
Reddit 用户 abhishekkumar333 整理了从 100KB TinyML 到 2.5TB MoE 巨模型的 AI 模型规模谱系,对应不同硬件需求与运行成本。
Reddit · r/LocalLLaMAAI 评分3737 Strata Qwen 3.8 flash next 是自 Qwen 3.8 27b 发布以来最重要的更新
Strata Qwen 3.8 flash next 让低显存用户能以较高速度运行 Flash Next 作为主力模型。实测速度达到 80-110 tok/s(2500 pp),与 qwen 3.5-35-a3b 速度相当,但智能水平超过 Qwen 3.8 27b,可在双 RTX 3090(96GB DDR5)上运行。
Hacker News · 首页AI 评分2929 如何用 UWB 技术追踪垃圾桶是否被搬出
作者用超宽带(UWB)技术搭建了 BinRange 系统判断六个垃圾桶是否被搬出。该方案使用 Makerfabs ESP32-WROVER/DW3000 开发板作为 radio anchor 和标签,在 10 米距离测试中误差小于 2 厘米,户外可靠距离约 30 米。系统与 Home Assistant 集成,结合回收日程判断垃圾桶状态。