跳到正文

#端侧

今日 6 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
9月29日周二
  1. Reddit · r/LocalLLaMA34

    50B+ 总参数 MoE 模型:智能、Agent 速度与可负担微调的权衡探讨

    用户正在构建波兰法律领域通用模型,工作流为工具密集型(问题→顺序工具调用→最终文档),关注 50B+ 总参数、活跃参数较少的 MoE 架构能否在保持低延迟的同时提升推理和工具调用可靠性。已使用 27B Qwen 3.8 dense 模型做法律文档摘要和分类,现寻求该规模/架构的实际配置经验,包括模型选择、量化、GPU 配置、服务引擎、实测延迟及 LoRA 微调可行性。

  2. Product Hunt · AI 分类50

    Sayonic:Mac 刘海 AI 助手

    Sayonic 是一款运行在 Mac 刘海区域的 AI 助手,支持语音指令打开应用和标签页、查找文件、添加笔记和事件,或调用用户已有的编码 AI 智能体完成任务。基础版每 Mac 每月 $3.99(需自备 API 密钥),Pro 和 Max 版本包含云积分。

  3. Product Hunt · AI 分类18

    NoteWorthy:本地运行的 AI 笔记应用

    NoteWorthy 是一款在 iPhone、iPad 和 Mac 上本地运行的 AI 笔记应用,无需联网、无需账号且完全免费,所有笔记不会上传服务器。它能自动为笔记生成标题,并归类到 Tasks、Ideas、Info、Personal 等标签下,一键可将冗长的内容整理为清晰的标题与清单,也可将长笔记浓缩为一句话。

9月27日周日
  1. Product Hunt · AI 分类43

    Speek:macOS 语音助手

    Speek 是一款集成在 Mac notch 中的语音助手,按住按键即可口述内容到任何应用、编辑选中文本或在应用和账户中执行操作。设备支持圈选屏幕元素进行指向交互,快速请求在 notch 中处理,长时间任务在后台运行并完成后通知用户。还能口头回答、自然跟进对话,并记住用户要求保存的细节。

  2. Product Hunt · AI 分类55

    Translate Like Me:macOS 菜单栏翻译应用

    一款 macOS 菜单栏翻译应用,选中任意应用中的文本并按快捷键即可替换为翻译结果。支持自动检测双向语言方向,每对语言可单独设置写作风格。免费开源,可选 Claude、ChatGPT 或 Grok 作为后端,支持使用已有订阅或自有 API Key。

9月26日周六
9月24日周四
9月23日周三
  1. Product Hunt · AI 分类13

    Ari Helper 7 上线,新增 Photo Studio、Film Studio 与 OpenAI 兼容私有服务器

    Ari Helper 7 是面向 iPhone、iPad、Mac 和 Apple Watch 的私有 AI 助手,本次更新新增 Photo Studio(修复、降噪、上色、4x 放大,支持端侧及相册内运行)、Film Studio(逐镜头影片与视频修复)、可提问的实时摄像头、端侧图像生成,以及用户自建的 OpenAI 兼容服务器。

9月22日周二
  1. Product Hunt · AI 分类48

    SCMD:Claude Code 记忆本地审查工具

    SCMD 是 Claude Code 持久记忆的开源本地审查工具,支持保留、删除、跳过、撤销、重写及查看记忆保存原因。决策暂存确认后生效,删除内容进入可恢复垃圾箱。无遥测、无云服务、零 npm 依赖,通过 /scmd:run 或 npx 运行,MIT 许可证。

9月10日周四
8月25日周二
8月10日周一
  1. Hugging Face Blog75

    Meta 发布 Muse Glimmer:30B 参数本地代理多模态模型

    Meta 发布 Muse Glimmer,这是一款 30B 参数的多模态模型,从 Muse 蒸馏而来,采用 Apache 2.0 许可证开源,专为本地代理场景设计,支持图像、视频和代码处理。

    推荐理由:原文给出了模型架构细节、benchmark 对比和工具链支持,读者可以了解这个 30B 参数的多模态模型在本地代理场景下的能力定位。

7月29日周三
  1. Berkeley AI Research65

    K-Search:如何将数十年CUDA内核优化经验迁移到Apple Silicon

    Berkeley和IBM研究团队将K-Search进化内核优化框架扩展支持MLX后端,开发了结构化的CUDA到MLX翻译层,将NVIDIA生态积累的CUDA优化知识迁移到Apple Silicon。实验在M1 Max 64GB上,Attention核达到原生MLX的0.97倍性能,Mamba SSM核预填充吞吐量达6751 tok/s,比社区mlx-lm实现快约20倍。

    推荐理由:原文展示了K-Search如何将NVIDIA生态积累的CUDA内核优化知识迁移到Apple Silicon,在Attention和Mamba SSM两个核上分别达到接近专家水平和20倍加速,为非NVIDIA硬件的核优化提供了可参考的方法论。

6月27日周六
  1. Google Research68

    Google 通过冻结多Token预测加速 Pixel 设备上的 Gemini Nano 模型

    Google 宣布将 Multi-Token Prediction (MTP) 架构应用于现有的冻结 Gemini Nano v3 模型,在 Pixel 9/10 系列上实现 50% 以上加速。

    推荐理由:原文给出了具体的技术架构细节、性能数据(50%+加速、130MB内存节省)和在 Pixel 设备上的实测效果,读者可以据此了解移动端推理优化的具体方法。

6月9日周二
  1. Google DeepMind75

    Google DeepMind 发布 Gemma 4 12B:统一 encoder-free 多模态模型

    Google DeepMind 发布 Gemma 4 12B,采用无编码器架构将视觉和音频输入直接整合到 LLM 主干,支持原生音频输入。性能接近更大的 26B MoE 模型,可在 16GB VRAM 的笔记本电脑上本地运行,已获 150 万次下载,发布于 Apache 2.0 许可证。

    推荐理由:原文给出了架构变化(encoder-free)、性能对比(接近 26B MoE)、内存要求(16GB VRAM)和原生音频输入等具体信息,读者可以据此评估它与其他 Gemma 模型的定位差异。

4月3日周五
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4:字面意义上最强大的开源模型

    Google DeepMind 正式发布 Gemma 4 系列开源模型,提供 E2B、E4B、26B MoE 和 31B Dense 四种规格。31B 版本在 Arena AI 文本排行榜位列第三,26B 排名第六,均超越参数量 20 倍于自身的模型。

    推荐理由:原文给出了四个版本的具体定位和性能数据,读者可以据此判断 Gemma 4 是否适合自己的硬件条件和使用场景。

8月2日周五
  1. Replicate Blog24

    Replicate Intelligence #9:本周开源AI模型动态

    Black Forest Labs发布FLUX.1图像生成模型套件,采用"flow matching"技术,支持高达2百万像素分辨率,分为pro、dev、schnell三个版本。Meta推出SAM 2图像和视频分割模型,零样本能力扩展至视频领域,性能提升3倍。Google发布Gemma 2 2B紧凑语言模型,仅20亿参数但在LMSYS Chatbot Arena超越所有GPT-3.5模型。

10月12日周四
  1. Cursor Blog39

    Cursor 列举当前需要解决的问题

    Cursor 团队分享了正在攻克的技术难题,包括更好的上下文处理(从50万token筛选出8k相关token)、面向编辑的copilot、受约束的流内Agent、主动找Bug、更大规模编辑等。截至2023年10月,Cursor已索引14亿个向量和15万个代码库,并计划在年底前增长10倍。