#开源生态
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#开源生态
今日 2 条洞察 · 工具·提示词·论文 三栏速览
每栏 3 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分1111 当前有哪些开源权重模型能处理反编译/重编译项目
用户在 r/LocalLLaMA 询问是否已有任何开源权重模型能处理反编译与重编译类项目。Opus5.5、Sol6.1、Fable、Astra 等闭源模型已证明可行,相关生态近一周爆发。
Reddit · r/LocalLLaMAAI 评分3636 中国 AI 实验室的开放策略分化:头部闭源、追赶者开源
在北京和上海走访中国 AI 实验室后,文章梳理了主要厂商的模型开放策略分化。ByteDance 旗下的豆包(Doubao)作为唯一保持旗舰模型闭源的大厂,凭借已拥有的 300 million 用户级 ChatGPT 式超级应用分发渠道而选择闭源。
Reddit · r/LocalLLaMAAI 评分2727 EmbeddingGemma 2 的图像-文本检索借助 ruNNtime WebGPU 推理库实现浏览器端运行
EmbeddingGemma 2 将图像和文本映射到同一个 768 维向量空间,支持以文字描述检索图片。开发者将其文本塔与视觉塔移植到 TypeScript 写的 WebGPU 推理库 ruNNtime,并在浏览器中用本地 GPU 完成完整检索流程,原始数据无需上传服务器。ruNNtime 同时兼容多种类视觉模型,可在交互式文档里直接体验。
Reddit · r/LocalLLaMAAI 评分1515 ik_llama.cpp 在多 GPU 层拆分混合推理中为何反而慢于主线 llama.cpp
用户在 4 张异构 GPU(3 张 P102-100 + 1 张 RTX 3060 12GB)混合卸载 Qwen 3.8 Flash-Next 177B(IQ3_XXS)并配合 AVX-512 CPU 跑 32k 上下文时。
The DecoderAI 评分5151 Google 发布开源多模态嵌入模型 EmbeddingGemma 2,主打端侧运行
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,参数量为 740M,可将文本、图像、视频、音频和代码转为向量。Google 称在多模态嵌入基准上它优于尺寸达其两倍的竞品,是同档中最紧凑的模型;在 Massive Text Embedding Benchmark (Code) 上得分 78.68,比前代提升近 10 分。
Reddit · r/LocalLLaMAAI 评分1515 Hugging Face 工程师分享 llama.cpp 本地 AI 生态技术演讲
Hugging Face 工程师 Merve 在一场开发者大会上分享了关于 llama.cpp 的演讲内容,涵盖 prefill 与 decode、内存类型、speculative decoding 等本地 LLM 推理基础概念,供社区参考使用并要求注明出处。
Reddit · r/LocalLLaMAAI 评分3131 21M 模型外挂 6.4B 参数查找表:性能追平 114M dense 模型,NVMe SSD 即可承载
作者在 21M 模型外挂一张 16.8M 行、6.4B 参数的查找表,在 500M Wikipedia token 训练下性能接近同条件下的 114M dense 模型。
Reddit · r/LocalLLaMAAI 评分1010 团队提出用 LoRA 适配器充当 LLM 可切换技能,想验证这是否值得做成产品
一个团队正在验证一个想法:把 LoRA 适配器当作 LLM 的持久化、可切换的专用技能,按需加载或卸载,以减少上下文占用、复用专项能力并可能降低推理成本。他们希望 LoRA 的创建与管理能像维护知识库一样简单,并询问用户是否会在实际场景中使用该方案,以及该思路在哪些场景下不适用。
Latent SpaceAI 评分4848 Reflection 发布 Beam:501B 总参 / 23B 激活的开源 MoE 编程模型
Reflection 发布 Beam,一款文本模型,总参数 501B、激活 23B 的 MoE,面向编程、智能体和科学场景,从零训练并计划于本月以 Apache 2.0 开源完整权重,团队称其在 SWE-bench Verified 上拿到 80.9,推理效率据称是 GLM 5.2 的 3–4 倍。
Reddit · r/LocalLLaMAAI 评分2424 PewDiePie 微调本地模型 Ajax 两次被 OpenAI 封号
PewDiePie 在自家电脑上微调一个 9B 本地模型 Ajax 时,因用 OpenAI API 输出来构建数据集,两次违反使用条款被封号、申诉解封后又立即再被封。他随后转向开源工具移除模型内置拒答与说教式回复,继续推进完全本地化的 9B agent 构建。该事件借 PewDiePie 的影响力,为开源模型带来了一次面向数百万观众的免费宣传。
Reddit · r/LocalLLaMAAI 评分1010 yandex/AliceAI-80B-A3B 后训练 Instruct 微调进展更新
开发者对 yandex/AliceAI-80B-A3B-Base 进行 Instruct 微调,目标为支持智能体任务与对话,并通过 qwen 3.8 27b 的浅层蒸馏注入链式推理能力。
TechCrunch · AIAI 评分1010 TechCrunch Disrupt 2026 议程前瞻:AI 创始人们如何选择开源、闭源与自建模型
TechCrunch Disrupt 2026 将于 10 月 13-15 日在旧金山 Moscone West 举办,议程聚焦 AI 创始人对模型路线的抉择。
Reddit · r/LocalLLaMAAI 评分1515 开发者实验本地 LLM 项目 Neco:让 AI 像"住"在机器上一样持续存在
开发者围绕 Ollama 和 Open WebUI 构建本地 AI 项目 Neco,通过只读系统层让模型感知主机 uptime、内存占用、负载、电量和温度等状态,并由后台守护进程在无对话时自主生成"闲思"。模型不获得 shell 权限或主机控制权,下一步计划实验情景式记忆与选择性检索,让行为在数周至数月间形成连续性。
Reddit · r/LocalLLaMAAI 评分55 Strata 跑 Qwen 模型速度惊艳,但社区呼吁展示实际本地运行成果
Reddit 用户对 Strata 项目只展示 Qwen 模型 token 速度而不公开实际运行成果表示失望,呼吁作者分享此前无法本地运行的具体任务示例及所用量化精度,强调"小而有效"的模型比参数规模更重要。
Reddit · r/LocalLLaMAAI 评分3232 Apex-2 训练复盘:单卡 H100 瓶颈、DiLoCo 多实例合并与 FineWeb-Edu 去重经验
开发者复盘了自训模型 Apex-2 的经验。原计划用约 1T tokens 训练,但单卡 H100 算力不足,最终只训了约 80B tokens;改用两台 GH200 实例按 DiLoCo 方式每 350 步合并模型,训练速度约为单卡的 1.9x,每张 GPU MFU 约 40%。
Reddit · r/artificialAI 评分1616 从 100KB 到 2.5TB:Reddit 用户梳理 AI 模型规模谱系与硬件成本
Reddit 用户 abhishekkumar333 整理了从 100KB TinyML 到 2.5TB MoE 巨模型的 AI 模型规模谱系,对应不同硬件需求与运行成本。