#端侧
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#端侧
今日 6 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/MachineLearningAI 评分4848 开源书籍《How to Make Your Model Fast》发布:从硬件到智能体的 ML 性能优化系统指南
作者发布了一本免费、开源的机器学习性能优化书籍《How to Make Your Model Fast: A Systems View of Efficient Machine Learning, from Silicon to Agents》。
Reddit · r/LocalLLaMAAI 评分3434 50B+ 总参数 MoE 模型:智能、Agent 速度与可负担微调的权衡探讨
用户正在构建波兰法律领域通用模型,工作流为工具密集型(问题→顺序工具调用→最终文档),关注 50B+ 总参数、活跃参数较少的 MoE 架构能否在保持低延迟的同时提升推理和工具调用可靠性。已使用 27B Qwen 3.8 dense 模型做法律文档摘要和分类,现寻求该规模/架构的实际配置经验,包括模型选择、量化、GPU 配置、服务引擎、实测延迟及 LoRA 微调可行性。
Product Hunt · AI 分类AI 评分5050 Sayonic:Mac 刘海 AI 助手
Sayonic 是一款运行在 Mac 刘海区域的 AI 助手,支持语音指令打开应用和标签页、查找文件、添加笔记和事件,或调用用户已有的编码 AI 智能体完成任务。基础版每 Mac 每月 $3.99(需自备 API 密钥),Pro 和 Max 版本包含云积分。
Reddit · r/LocalLLaMAAI 评分4040 qwen3.8-flash-next 在 4x R9700 上的初步测试
在4x R9700显卡上测试qwen3.8-flash-next模型用于AI智能体编码用例,单流推理速度达150+t/s,并发3-5流时保持约100t/s,预填充速度超过10k+t/s。用户表示速度和生成质量均超出预期。
Reddit · r/LocalLLaMAAI 评分1515 Qwen-Next 3.8 与 Claude Sonnet 5.5 对比:本地模型已达前沿
Reddit 用户对比 Qwen-Next 3.8 / 3.8 27b 与 Claude Sonnet 5.5 low / medium,发现本地模型已触及前沿水平,数月差距已被证实。作者日常使用 Qwen-Next 3.8 处理复杂任务,今日 GPT-Sol-6-High 出现错误时,Qwen-Next 成功修复问题。
Product Hunt · AI 分类AI 评分1818 NoteWorthy:本地运行的 AI 笔记应用
NoteWorthy 是一款在 iPhone、iPad 和 Mac 上本地运行的 AI 笔记应用,无需联网、无需账号且完全免费,所有笔记不会上传服务器。它能自动为笔记生成标题,并归类到 Tasks、Ideas、Info、Personal 等标签下,一键可将冗长的内容整理为清晰的标题与清单,也可将长笔记浓缩为一句话。
Product Hunt · AI 分类AI 评分4343 Speek:macOS 语音助手
Speek 是一款集成在 Mac notch 中的语音助手,按住按键即可口述内容到任何应用、编辑选中文本或在应用和账户中执行操作。设备支持圈选屏幕元素进行指向交互,快速请求在 notch 中处理,长时间任务在后台运行并完成后通知用户。还能口头回答、自然跟进对话,并记住用户要求保存的细节。
Product Hunt · AI 分类AI 评分5555 Translate Like Me:macOS 菜单栏翻译应用
一款 macOS 菜单栏翻译应用,选中任意应用中的文本并按快捷键即可替换为翻译结果。支持自动检测双向语言方向,每对语言可单独设置写作风格。免费开源,可选 Claude、ChatGPT 或 Grok 作为后端,支持使用已有订阅或自有 API Key。
Ars Technica · AIAI 评分4848 微软不再强调"Copilot+ PC"品牌要求
微软停止强制推广Copilot+ PC品牌,本周发布的新款Surface Pro 12英寸和Surface Laptop 13英寸虽满足原Copilot+ PC要求(16GB RAM、256GB存储、40 TOPS NPU),但未使用该标签。
Hugging Face BlogAI 评分5151 Liquid AI 发布 LFM2.5-VL-DSpark 加速视觉语言模型推理
Liquid AI 发布 LFM2.5-VL-3B 的 DSpark 草案模型,采用投机解码在设备端实现最高 3.13x、H100 GPU 实现 2.66x 的解码加速,end-to-end 提升分别达 2.62x 和 2.27x。草案模型仅增加 280M 参数(占原模型 8.9%),首批支持 llama.cpp、MLX-VLM 和 SGLang 三大推理框架。
Product Hunt · AI 分类AI 评分1313 Ari Helper 7 上线,新增 Photo Studio、Film Studio 与 OpenAI 兼容私有服务器
Ari Helper 7 是面向 iPhone、iPad、Mac 和 Apple Watch 的私有 AI 助手,本次更新新增 Photo Studio(修复、降噪、上色、4x 放大,支持端侧及相册内运行)、Film Studio(逐镜头影片与视频修复)、可提问的实时摄像头、端侧图像生成,以及用户自建的 OpenAI 兼容服务器。
Hugging Face Blog精选AI 评分6666 Hugging Face transformers 现在支持直接运行 llama.cpp 量化模型
Hugging Face 宣布 transformers 库新增 GGUF 格式支持,用户可通过 from_pretrained 直接加载 GGUF 模型在本地运行。
推荐理由:原文给出了 GGUF 支持的具体能力、加载方式和性能数据,读者可以据此判断它是否能满足自己的本地推理需求。
Product Hunt · AI 分类AI 评分4848 SCMD:Claude Code 记忆本地审查工具
SCMD 是 Claude Code 持久记忆的开源本地审查工具,支持保留、删除、跳过、撤销、重写及查看记忆保存原因。决策暂存确认后生效,删除内容进入可恢复垃圾箱。无遥测、无云服务、零 npm 依赖,通过 /scmd:run 或 npx 运行,MIT 许可证。
Product Hunt · AI 分类AI 评分3030 WhisperBrain:你的会议第二大脑
WhisperBrain 今日发布,是一款 MCP 会议工具,可在本地监听并将团队决策转化为 Obsidian 中的可搜索记忆。它将每次会议转变为可检索的知识库,帮助团队高效管理会议信息。
The Rundown AIAI 评分7474 Apple 发布首款 2nm M6 芯片 Mac mini,主打本地 AI 运行能力
Apple 推出近两年首款 Mac mini,搭载首款 2nm M6 芯片,定位为“常驻式 AI 智能体计算设备”。M6 机型 AI 负载速度提升最高 4 倍,统一内存最高 64GB,售价 $899 起。Apple 首次在休斯顿制造该设备。
Ben's BitesAI 评分2525 移动端 AI 智能体更新汇总:Claude Code 可手机启动新会话、Deepgram 推 80ms 延迟 TTS
Claude Code 远程控制功能更新,现在可从手机启动新会话,断线自动恢复,iOS 加载速度提升。Deepgram 发布 Flux TTS,延迟最低 80ms,支持多轮对话和原生中断处理。此外 GPT-5.6-Sol 在 API 中降价 20%,Grok Bot 向 SuperGrok Plus 和 Cursor Pro+ 用户开放。
Hugging Face Blog精选AI 评分7575 Meta 发布 Muse Glimmer:30B 参数本地代理多模态模型
Meta 发布 Muse Glimmer,这是一款 30B 参数的多模态模型,从 Muse 蒸馏而来,采用 Apache 2.0 许可证开源,专为本地代理场景设计,支持图像、视频和代码处理。
推荐理由:原文给出了模型架构细节、benchmark 对比和工具链支持,读者可以了解这个 30B 参数的多模态模型在本地代理场景下的能力定位。
Berkeley AI Research精选AI 评分6565 K-Search:如何将数十年CUDA内核优化经验迁移到Apple Silicon
Berkeley和IBM研究团队将K-Search进化内核优化框架扩展支持MLX后端,开发了结构化的CUDA到MLX翻译层,将NVIDIA生态积累的CUDA优化知识迁移到Apple Silicon。实验在M1 Max 64GB上,Attention核达到原生MLX的0.97倍性能,Mamba SSM核预填充吞吐量达6751 tok/s,比社区mlx-lm实现快约20倍。
推荐理由:原文展示了K-Search如何将NVIDIA生态积累的CUDA内核优化知识迁移到Apple Silicon,在Attention和Mamba SSM两个核上分别达到接近专家水平和20倍加速,为非NVIDIA硬件的核优化提供了可参考的方法论。
Google Research精选AI 评分6868 Google 通过冻结多Token预测加速 Pixel 设备上的 Gemini Nano 模型
Google 宣布将 Multi-Token Prediction (MTP) 架构应用于现有的冻结 Gemini Nano v3 模型,在 Pixel 9/10 系列上实现 50% 以上加速。
推荐理由:原文给出了具体的技术架构细节、性能数据(50%+加速、130MB内存节省)和在 Pixel 设备上的实测效果,读者可以据此了解移动端推理优化的具体方法。
Google DeepMind精选AI 评分7575 Google DeepMind 发布 Gemma 4 12B:统一 encoder-free 多模态模型
Google DeepMind 发布 Gemma 4 12B,采用无编码器架构将视觉和音频输入直接整合到 LLM 主干,支持原生音频输入。性能接近更大的 26B MoE 模型,可在 16GB VRAM 的笔记本电脑上本地运行,已获 150 万次下载,发布于 Apache 2.0 许可证。
推荐理由:原文给出了架构变化(encoder-free)、性能对比(接近 26B MoE)、内存要求(16GB VRAM)和原生音频输入等具体信息,读者可以据此评估它与其他 Gemma 模型的定位差异。
Google DeepMind精选AI 评分7878 Google DeepMind 发布 Gemma 4:字面意义上最强大的开源模型
Google DeepMind 正式发布 Gemma 4 系列开源模型,提供 E2B、E4B、26B MoE 和 31B Dense 四种规格。31B 版本在 Arena AI 文本排行榜位列第三,26B 排名第六,均超越参数量 20 倍于自身的模型。
推荐理由:原文给出了四个版本的具体定位和性能数据,读者可以据此判断 Gemma 4 是否适合自己的硬件条件和使用场景。
Replicate BlogAI 评分2424 Replicate Intelligence #9:本周开源AI模型动态
Black Forest Labs发布FLUX.1图像生成模型套件,采用"flow matching"技术,支持高达2百万像素分辨率,分为pro、dev、schnell三个版本。Meta推出SAM 2图像和视频分割模型,零样本能力扩展至视频领域,性能提升3倍。Google发布Gemma 2 2B紧凑语言模型,仅20亿参数但在LMSYS Chatbot Arena超越所有GPT-3.5模型。
Cursor BlogAI 评分3939 Cursor 列举当前需要解决的问题
Cursor 团队分享了正在攻克的技术难题,包括更好的上下文处理(从50万token筛选出8k相关token)、面向编辑的copilot、受约束的流内Agent、主动找Bug、更大规模编辑等。截至2023年10月,Cursor已索引14亿个向量和15万个代码库,并计划在年底前增长10倍。