#端侧
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#端侧
今日 1 条一手 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Hugging Face BlogAI 评分4747 Liquid AI 开源 d1 系列边缘决策模型:d1-3B 与多模态 d1-omni-600M
Liquid AI 开源 d1 系列两款边缘决策模型 d1-3B 与实验版 d1-omni-600M,分别支持文图与文图或文音输入,均已在 Hugging Face 开源下载。
Google DeepMindAI 评分5555 Google DeepMind 发布端侧多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 推出 EmbeddingGemma 2,基于 Gemma 4 架构,采用 Apache 2.0 协议开源,参数量为 740M,可将文本、图像、音频和视频映射到统一嵌入空间。
Hugging Face BlogAI 评分5151 Liquid AI 发布 LFM2.5-VL-DSpark 加速视觉语言模型推理
Liquid AI 发布 LFM2.5-VL-3B 的 DSpark 草案模型,采用投机解码在设备端实现最高 3.13x、H100 GPU 实现 2.66x 的解码加速,end-to-end 提升分别达 2.62x 和 2.27x。草案模型仅增加 280M 参数(占原模型 8.9%),首批支持 llama.cpp、MLX-VLM 和 SGLang 三大推理框架。
Hugging Face Blog精选AI 评分6666 Hugging Face transformers 现在支持直接运行 llama.cpp 量化模型
Hugging Face 宣布 transformers 库新增 GGUF 格式支持,用户可通过 from_pretrained 直接加载 GGUF 模型在本地运行。
推荐理由:原文给出了 GGUF 支持的具体能力、加载方式和性能数据,读者可以据此判断它是否能满足自己的本地推理需求。
Hugging Face Blog精选AI 评分7575 Meta 发布 Muse Glimmer:30B 参数本地代理多模态模型
Meta 发布 Muse Glimmer,这是一款 30B 参数的多模态模型,从 Muse 蒸馏而来,采用 Apache 2.0 许可证开源,专为本地代理场景设计,支持图像、视频和代码处理。
推荐理由:原文给出了模型架构细节、benchmark 对比和工具链支持,读者可以了解这个 30B 参数的多模态模型在本地代理场景下的能力定位。
Berkeley AI Research精选AI 评分6565 K-Search:如何将数十年CUDA内核优化经验迁移到Apple Silicon
Berkeley和IBM研究团队将K-Search进化内核优化框架扩展支持MLX后端,开发了结构化的CUDA到MLX翻译层,将NVIDIA生态积累的CUDA优化知识迁移到Apple Silicon。实验在M1 Max 64GB上,Attention核达到原生MLX的0.97倍性能,Mamba SSM核预填充吞吐量达6751 tok/s,比社区mlx-lm实现快约20倍。
推荐理由:原文展示了K-Search如何将NVIDIA生态积累的CUDA内核优化知识迁移到Apple Silicon,在Attention和Mamba SSM两个核上分别达到接近专家水平和20倍加速,为非NVIDIA硬件的核优化提供了可参考的方法论。
Google Research精选AI 评分6868 Google 通过冻结多Token预测加速 Pixel 设备上的 Gemini Nano 模型
Google 宣布将 Multi-Token Prediction (MTP) 架构应用于现有的冻结 Gemini Nano v3 模型,在 Pixel 9/10 系列上实现 50% 以上加速。
推荐理由:原文给出了具体的技术架构细节、性能数据(50%+加速、130MB内存节省)和在 Pixel 设备上的实测效果,读者可以据此了解移动端推理优化的具体方法。
Google DeepMind精选AI 评分7575 Google DeepMind 发布 Gemma 4 12B:统一 encoder-free 多模态模型
Google DeepMind 发布 Gemma 4 12B,采用无编码器架构将视觉和音频输入直接整合到 LLM 主干,支持原生音频输入。性能接近更大的 26B MoE 模型,可在 16GB VRAM 的笔记本电脑上本地运行,已获 150 万次下载,发布于 Apache 2.0 许可证。
推荐理由:原文给出了架构变化(encoder-free)、性能对比(接近 26B MoE)、内存要求(16GB VRAM)和原生音频输入等具体信息,读者可以据此评估它与其他 Gemma 模型的定位差异。
Google DeepMind精选AI 评分7878 Google DeepMind 发布 Gemma 4:字面意义上最强大的开源模型
Google DeepMind 正式发布 Gemma 4 系列开源模型,提供 E2B、E4B、26B MoE 和 31B Dense 四种规格。31B 版本在 Arena AI 文本排行榜位列第三,26B 排名第六,均超越参数量 20 倍于自身的模型。
推荐理由:原文给出了四个版本的具体定位和性能数据,读者可以据此判断 Gemma 4 是否适合自己的硬件条件和使用场景。
Replicate BlogAI 评分2424 Replicate Intelligence #9:本周开源AI模型动态
Black Forest Labs发布FLUX.1图像生成模型套件,采用"flow matching"技术,支持高达2百万像素分辨率,分为pro、dev、schnell三个版本。Meta推出SAM 2图像和视频分割模型,零样本能力扩展至视频领域,性能提升3倍。Google发布Gemma 2 2B紧凑语言模型,仅20亿参数但在LMSYS Chatbot Arena超越所有GPT-3.5模型。
Cursor BlogAI 评分3939 Cursor 列举当前需要解决的问题
Cursor 团队分享了正在攻克的技术难题,包括更好的上下文处理(从50万token筛选出8k相关token)、面向编辑的copilot、受约束的流内Agent、主动找Bug、更大规模编辑等。截至2023年10月,Cursor已索引14亿个向量和15万个代码库,并计划在年底前增长10倍。