#端侧
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#端侧
今日 6 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/ChatGPTAI 评分3636 用5美元AliExpress时钟显示AI使用限额
海外开发者花费5美元购买AliExpress小闹钟,通过Wi-Fi将电脑屏幕内容传输至时钟,成功显示Codex和Claude的使用限额,保留了原始固件。项目代码已开源分享。
Reddit · r/LocalLLaMAAI 评分2121 用户用 3 张 RTX 3060 12GB 搭建 "Flash Next" 推理卡:速度达 38-40 t/s
Reddit 用户在 r/LocalLLaMA 分享使用 3 张 RTX 3060 12GB 显卡运行 Flash Next 框架的测试结果,在 IQ3 模型上达到 38-40 t/s 推理速度,同条件 llama.cpp 仅能实现 13.2 t/s。
Reddit · r/LocalLLaMAAI 评分4343 本地部署 Qwen3.8-Flash-Next Coder 编程能力测试:与 Claude Opus 4.6 持平
用户在三项Python编程任务上测试了本地部署的 Qwen3.8-Flash-Next Coder 与 Claude Opus 4.6,两者均获 92.7 分(满分100),隐藏测试得分 161/162 vs 162/162。Coder 模型使用 32GB VRAM 推理速度达 50-90 token/s,仅需消费级硬件即可运行。测试仅单次执行且任务规模较小,结果差异在统计意义上不具决定性。
Product HuntAI 评分2626 Thalia:一款面向 Meta Muse Code CLI 的免费原生 Mac 应用
Thalia 是一款面向 Meta Muse Code CLI 的免费原生 Mac 应用,提供计划模式、全命令预览、Review 快照审批、Checkpoints、MCP 连接器、语音模式以及内置终端等功能。应用使用用户自己的 Muse 权限,不上传遥测数据,目前仅支持搭载 Apple Silicon 的 macOS 27 设备。
Reddit · r/LocalLLaMAAI 评分6060 开源引擎 Kyojin 发布:在 128GB AMD Strix Halo 迷你 PC 上运行 300B MoE 模型
作者在 AMD Strix Halo(128GB)上基于 ExLlamaV3 构建了 Kyojin 引擎,成功运行两个约 300B 的 MoE 模型。
Reddit · r/LocalLLaMAAI 评分1111 谁在用本地 AI 会议记录方案替代 Fathom?
用户寻求将会议记录流程本地化,目前使用 Bluedot(无需会议机器人,会后获取转录、总结和待办事项),希望将转录和旧会议搜索存储也迁移至本地。询问社区日常可用的本地方案,提及 Whisper + Ollama 作为备选。
Reddit · r/LocalLLaMAAI 评分4949 <think>让我分析这篇原文:
1. **来源**:Reddit · r/LocalLLaMA 2. **原始标题**:gufo_windows pre-package for Strix Halo users 3. **正文内容**。
Product Hunt · AI 分类AI 评分4747 Yubi:macOS 本地语音控制工具
Yubi 是一个 6 MB 的 Mac 应用,按住右侧 Option 键说话即可将语音转为文字输入光标处,按住右侧 Command 键可获取屏幕内容的帮助。该应用完全在本地处理语音数据,不会上传至云端。免费使用,邮箱登录,无需绑定信用卡。
Reddit · r/LocalLLaMAAI 评分6060 Qwen3.8-Flash-Next 177B 在单张 RTX 5070 12GB 上达到 11-15 tok/s
用户在 Reddit 分享了在 Windows 上用 llama.cpp 优化 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS)推理的成果。
Reddit · r/LocalLLaMAAI 评分2121 如何在迷你 PC 上运行本地 LLM 语音助手——最佳小型 LLM 推荐
用户计划在无风扇迷你 PC(Celeron J6412 四核、16GB DDR4、Intel UHD 集成显卡)上构建离线语音助手,使用 Ubuntu 24.04 + llama.cpp + Python。寻求能在弱 CPU 上保持强人设且回复简洁的小型 LLM,以及可实时响应的语音转文字模型。
Reddit · r/LocalLLaMAAI 评分2828 Strata + Qwen3.8 Next 在中端 GPU 上的本地运行体验
用户在 DDR4 + 7900XTX 配置下运行 Strata + Qwen3.8 Next 的 IQ3_XXS 权重(约 80GB),推理速度稳定在 45-70 token/s,12GB 和 16GB 显卡用户也获得类似结果。对比同设备的 Llama CPP 调优版最高 22.5 token/s,Strata 速度提升约 2-3 倍,用户反馈质量更优但不推荐 Q2 权重。
Hacker News · 首页AI 评分5252 在 M4 Mac mini 上启动 Linux 的历程
作者记录了在 M4 Mac mini 上成功启动 Linux 的完整过程。M4 是首款强制启用 SPTM 的 Apple Silicon 芯片,作者依次解决了 GXF 功能锁定、MMU 初始化时的 MMIO 映射、CPU 寄存器访问权限、以及 WFI 指令导致寄存器状态丢失等问题。
Reddit · r/artificialAI 评分3333 小型语言模型为何被低估?是否是有意为之?
多数企业认为前沿大模型成本效益不佳,但仍不愿采用小型语言模型策略。作者用一年多前构建的机器测试 DeepSeek R1,发现其性能出色且工作稳定。金融科技行业客户对小而安全的本地模型仍持谨慎态度。
Reddit · r/LocalLLaMAAI 评分1616 爱尔兰社区大学 AI 实验室征求意见:应该教学生什么实用技能?
爱尔兰一所公共继续教育学院获 funding 建立小型 AI 实验室,硬件配置良好,旨在让学生掌握超越单纯使用 ChatGPT 的实用 AI 技能。发帖者向业界人士征集课程设计建议。
Reddit · r/artificialAI 评分1414 求:8GB VRAM 本地 AI 视频生成工具推荐
用户寻求在 8GB VRAM 限制下运行的本地 AI 视频生成工具,要求支持文本和图片生成最长 10 秒视频,优先 2D 动画兼顾 3D。这是用户首次使用本地大语言模型,希望找容易上手且免费的解决方案。
Hacker News · 首页AI 评分6969 Redis 创建者发布 ds4 本地推理引擎,支持 DeepSeek V4、GLM 5.x、Qwen3.8
Redis 创建者推出 ds4 本地前沿模型推理引擎,基于 C 语言开发,支持 DeepSeek V4/V4.1 Flash、GLM 5.x 和 Qwen3.8 Flash Next,采用非对称 2-bit 量化技术将 2840 亿参数的 MoE 模型压缩至 128GB 内存设备可运行,提供 CLI、HTTP API 和原生智能体三种接口。已开源并提供下载脚本。
Reddit · r/LocalLLaMAAI 评分2424 自托管AI不省钱,但我仍坚持这样做
作为自托管爱好者,我明知运行本地AI模型的成本高于云端API(如$200/月的Opus 5.5或Astra),仍然选择自托管。主要原因是隐私考量——我永远不会将200GB的邮件、消息和位置历史发送到任何外部API,无论其数据保留政策如何。
Reddit · r/LocalLLaMAAI 评分5151 在 Bonsai 2 27B 上应用 −2 logit bias:MATH-500 得分 44/50 → 43/50,tokens 增加 3%
作者测试了在 Bonsai 2 27B(PTQ1_0,5.53 GiB)模型上应用 −2 logit bias 对 "wait"、"maybe"、"perhaps" 等词的效果。
Reddit · r/LocalLLaMAAI 评分1212 Qwen3.8-Flash(IQ3_XXS 量化)vs Qwen3.8-27B(Q8 量化)哪个更好?
Reddit 用户在 IQ3_XXS 量化版 Qwen3.8-Flash 与 Q8 量化版 Qwen3.8-27B 之间犹豫,询问有实际使用经验的人哪款智能表现更好。该用户表示近期没有复杂任务需要处理,难以自行判断两者在 intelligence 方面的实际差距。
Reddit · r/LocalLLaMAAI 评分6666 我用 iPhone 给 MacBook 当第二 GPU:Qwen 3.8 27B 预填充提速 29–44%
作者用 USB-C 线将 iPhone 17 Pro Max 连接到 24 GB M4 Pro MacBook,让手机分担 Qwen 3.8 27B(IQ4_XS)模型的部分层计算和注意力计算。
Reddit · r/ChatGPTAI 评分2929 GPT-6.1 Sol 评测:改进超出预期
GPT-6.1 Sol 相比一周前发布的 GPT-6 有了显著改进,作者原本预期是小补丁,但几小时体验后认为对本地工作流已足够好。目前已支持 Work、Codex 和 API,Chat 模式即将推出。
Reddit · r/LocalLLaMAAI 评分5353 推理工程入门:本地大模型运行优化指南
前软件工程师转型为推理工程师,分享本地运行大模型的优化指南。内容涵盖运行时选择(Ollama 适合新手,llama.cpp 适合 CPU offload,VLLM 适合纯 GPU)。
Reddit · r/LocalLLaMAAI 评分7373 用户分享 Qwen3.8-27b 量化模型:24GB 显卡实测 36-41 tokens/s
用户使用 LexiPanel 将 Qwen3.8-27b 量化并 abliterate 到 24GB 显卡,支持约 262k 上下文和 MTP draft。在 RX 7900 XTX 上实测 110k-170k tokens 上下文时解码速度 36-41 tokens/s,MTP draft 接受率中位数 85%。
Reddit · r/LocalLLaMAAI 评分4141 CalDec v1 发布:完全开源的个人助手决策模型
个人开发者发布 CalDec v1,一款完全开源权重的决策模型,专注于本地化、隐私保护的个人助手场景。该模型通过小规模数据集微调开发,尽管作者无专业 ML 背景,但实验结果超出预期,已在特定任务中证明可用性。模型、数据集和训练配方均已开源发布。
Reddit · r/LocalLLaMAAI 评分5151 Qwen 3.8 Flash 量化版本发布
开发者在 LocalLLaMA 社区发布了 Qwen 3.8 Flash base 的低比特量化版本,保留 95% 的 b16 精度,不会在长上下文场景下退化,推理速度约 40tok/s,支持 256kl 和 RoPE,可从 HuggingFace 下载。
Reddit · r/LocalLLaMAAI 评分2424 Reddit 用户寻求 Qwen/Deepseek 的本地替代模型:编程与长文档问答
因工作场所限制无法使用 Qwen/Deepseek 等中国模型,Reddit 用户在 r/LocalLLaMA 寻求 40B 参数以下的本地大模型替代方案,重点关注编程能力和 120k tokens 长医学文档问答能力。候选模型包括 Gemma 31B、Muse Glimmer 30B 和 Nemotron,并询问这些模型的微调版本是否能超越 Qwen3.8 27B 的编程性能。
Reddit · r/artificialAI 评分2727 使用 AI 时如何保护研发知识产权
R&D 工作者在使用 AI 模型辅助研发时担忧知识产权泄露,询问企业如何防止 AI 公司获取自己的研究成果和创意。离线 LLM 被提及为可能的解决方案,但用户担心其性能较弱且需要强大硬件。当前尚无完美的长期保护方案。
Product Hunt · AI 分类精选AI 评分6060 Codync 发布:一款开源免费的本地 AI Agent 运行工具
Codync 是一个开源免费的 AI 工具,可让用户在本地电脑上运行 Claude Code、Codex、Cursor 或 40 多个 AI agent 作为命名机器人,并通过 iPhone、Mac、Linux 或终端进行远程回复和审批。采用 MIT 许可证,支持端到端加密。
推荐理由:原文给出了核心能力(开源免费、多 agent 支持、远程控制),读者可以据此判断它作为本地 AI agent 管理工具的使用方式和迁移成本。
Product Hunt · AI 分类AI 评分4949 Lloyal:内置推理的 TypeScript AI 应用框架
Lloyal 是一款 TypeScript AI 应用框架,内置推理引擎和多智能体运行时,支持智能体研究、读取本地文件、理解文档和组合专业模型。该框架可在离线环境下工作,用户无需 API 密钥或复杂配置即可使用,可快速定制部署至桌面、Web 或终端平台。
量子位 QbitAIAI 评分7575 openJiuwen X-Router 自演进模型路由技术首发,昇腾亲和,Agent越跑越省
openJiuwen 团队发布 X-Router 智能路由技术,通过任务复杂度动态选择最优模型,实现模型调用成本-效果综合最优。该技术基于 Qwen3-0.6B 本地分类器构建五级模型池,根据请求复杂度自动匹配 SIMPLE 到 REASONING 不同档位模型。
Reddit · r/LocalLLaMAAI 评分2020 本地大模型推理:6GB GPU + 24GB RAM 如何提升运行速度
用户在 RTX 4050 6GB GPU + 24GB RAM 环境下运行 Qwen2.5 27B 模型时速度过慢,咨询 weight inferencing 是否有助于提升推理速度,并寻求具体尝试方法。
Reddit · r/ChatGPTAI 评分77 今天你的 GPT 也变笨了吗?
用户在 Reddit 抱怨 ChatGPT 今日异常"愚蠢",14 小时内多次拒绝理解基本指令,导致代码任务全部搞砸,浪费大量使用额度。尝试新建对话、导出上下文、提供示例等方法均无效,目前问题仍未解决。
Reddit · r/LocalLLaMAAI 评分3737 6 块 BC-250 显卡集群运行 Qwen Next Flash IQ2_XS 与 3.6 35b Q4 模型
用户将 6 块 ex 挖矿显卡组成集群,4 块运行 Qwen Next Flash IQ2_XS 在 100k 上下文下达 28 tok/s,2 块运行 3.6 35b Q4 模型达 60 tok/s。采用 llama + vulkan 通过 1GbE 网络连接,支持超长上下文。这是用户首次尝试本地 AI 部署。
Latent SpaceAI 评分2626 专访 MIT Alex Zhang:RLM 与 GPU Mode 的探索之路
MIT 博士 Alex Zhang 探讨递归语言模型(RLM)与 GPU Mode 研究,提出 harness 设计可改进跨任务组合泛化能力。访谈涉及 OpenAI 10000 智能体实验、Kimi 与 OpenAI 多智能体系统对比、capability overhang 以及 Neuralese 等前沿议题。
Reddit · r/LocalLLaMAAI 评分1919 游戏反编译/重编译用什么本地AI模型好?Qwen 3.8 27B 能否胜任
本地大模型可用于游戏反编译和重编译任务,目前主要依赖 Claude 和 Codex 云端方案。Qwen 3.8 27B Abliterated 理论上可在消费级硬件(RTX 3060 12GB VRAM + 24GB RAM)上运行,该用户已能流畅加载 MoE 和 Qwen 3.8 27B IQ3_XXS dense 模型。
Reddit · r/LocalLLaMAAI 评分6161 Gufo vs Halogen 推理框架性能对比实测
作者实测了开源推理框架 Gufo 0.4.0,发现其官方宣称的 70 tok/s 是在重复性提示词下通过投机解码达成的极限性能,普通提示词下仅为 39.4 tok/s。与 Halogen 对比,日常生成任务中 Halogen 单用户快 13%,4 用户快 18%;但 Gufo 处理长提示词快 16%。作者使用的是 Qwen3.8 27B Q4 模型在 APU 上测试。
Reddit · r/LocalLLaMAAI 评分3838 Qwen3.8-27B Q4_K_M 在单张 RTX 3090 上的本地编码测试:吞吐量与四个编码任务表现
使用 RTX 3090 24GB 搭配 Qwen3.8-27B(Q4_K_M 量化,约 16.8GB)和 OpenCode 进行本地编码 AI 智能体测试,131K 上下文下吞吐量随输入长度下降(2K 输入 36.4 tok/s,120K 输入 20.9 tok/s)。
Reddit · r/MachineLearningAI 评分3535 Jev 与 Laya 置信度评分模型基准测试
作者对 TypeSafe AI 托管的 Jev 1.13.0 和开源的 Laya 两款小规模置信度评分分类模型进行了评估。Jev 的 ECE 为 0.013,Laya 为 0.486;通过将 AML 标签描述从意图改为交易特征,准确率从 65% 提升至 77%。结果表明校准质量决定阈值策略效果:Jev 在 90% 置信度阈值下准确率从 92.3% 提升至 97.6%,覆盖 82% 案例。
Reddit · r/LocalLLaMAAI 评分4343 Yandex AliceAI-80B-A3B 指令微调版本训练进展更新 #2
作者对 Yandex AliceAI-80B-A3B 基础模型进行指令微调,使用合成蒸馏数据集训练约 48 小时,平均损失稳步下降。计划发布 gguf quants 版本和 llama.cpp 本地运行补丁,并将开源蒸馏引擎 SFTMill,后续继续用强化学习扩展训练。
Reddit · r/LocalLLaMAAI 评分5252 FreeToken vs llama.cpp 在 RTX 3090 上的基准对比
在 RTX 3090 上对 1024 tokens in / 256 out、1-32 并发进行基准测试:当模型 fit VRAM 时(Gemma-4-26B-A4B)。