#RAG
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#RAG
今日 1 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条AWS Machine Learning BlogAI 评分2323 Amazon Quick 与 Amazon Bedrock 通过实时 ACL 强制执行重构 RAG 访问控制
Amazon Quick 和 Amazon Bedrock Knowledge Bases 通过实时 ACL 强制执行解决企业 RAG 场景下的权限难题。
Reddit · r/LocalLLaMAAI 评分1616 2026 年本地 RAG 个人知识库选型:embedder 与混合检索经验讨论
网友讨论如何用 SQLite + sqlite-vec + FTS5、Ollama 在 Apple Silicon Mac 上搭建完全本地化的个人 RAG 知识库。
Hacker News · 首页AI 评分3333 Google EmbeddingGemma 2 发布
Google 推出 EmbeddingGemma 2 嵌入向量模型。由于原文未提供具体细节,无法进一步展开参数规模、上下文长度或基准测试分数等信息。
The DecoderAI 评分5151 Google 发布开源多模态嵌入模型 EmbeddingGemma 2,主打端侧运行
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,参数量为 740M,可将文本、图像、视频、音频和代码转为向量。Google 称在多模态嵌入基准上它优于尺寸达其两倍的竞品,是同档中最紧凑的模型;在 Massive Text Embedding Benchmark (Code) 上得分 78.68,比前代提升近 10 分。
Reddit · r/LocalLLaMAAI 评分5050 EmbeddingGemma 2:Google DeepMind 开源多模态嵌入模型
Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,总参数量 740M,可将文本(含代码)、图像、视频和音频统一映射到 768 维向量空间,支持 RAG、检索、分类与聚类等本地应用。
Reddit · r/LocalLLaMAAI 评分4040 Memoria 1.0.0:面向本地大语言模型的模型无关记忆系统发布
开发者发布 Memoria 1.0.0,一个本地优先、模型无关的大语言模型记忆系统,可在无 LLM、无云服务、无 API key 的环境下运行。
AWS Machine Learning BlogAI 评分2727 在 LangChain 与 Amazon Bedrock Knowledge Bases 中实现智能体检索
AWS 在 Amazon Bedrock Managed Knowledge Base 中提供智能体检索(AgenticRetrieveStream)能力,可将多部分问题拆解为子查询、评估证据并按需二次搜索,优于单次 Retrieve API 的相似性检索。
MIT Technology Review · AIAI 评分1313 知识匮乏成 AI 智能体落地最大瓶颈,MIT Technology Review 调研称仅 34% 企业项目进入生产
MIT Technology Review 对 300 位数据与 AI 高管的调研显示,知识匮乏是企业 AI 智能体难以投产的关键瓶颈,约 34% 的智能体项目最终进入生产环节,即便高科技企业也面临同样困境。
Reddit · r/artificialAI 评分99 RAG 系统的提示词语言选择:当目标语言与训练语料不同时
用户在 Reddit 提问:当 RAG 系统的目标语言与 LLM 主要训练语料(英语)不同时,提示词应该直接用目标语言撰写,还是用英语撰写并在提示中要求翻译为目标语言?提问者推测英语提示词可能因训练数据更丰富而获得更好的遵循度,认为语言的常见程度和训练数据量是关键因素,文档内容本身则使用目标语言。
Reddit · r/MachineLearningAI 评分4141 Yandex Music 用单一 Transformer Sona 替代整套推荐系统,A/B 测试取得显著提升
Yandex Music 在生产推荐系统中上线单一 Transformer 模型 Sona,通过 A/B 测试替代了原本由 15+ 候选生成器、预排序和排序模型组成的整套流程。
Reddit · r/artificialAI 评分1414 如何用 AI 构建个人知识追踪与摘要系统?
一位从业者为高效追踪多位专家的YouTube视频、邮件、X推文和PDF等内容,求助AI辅助总结与知识管理方案。提出利用 yt-dlp 获取内容、Whisper 转录视频、SQLite+FTS5 存储与检索的流水线,作者具备 Codex/Claude Code 使用经验和本地硬件资源。
Reddit · r/LocalLLaMAAI 评分5454 将 LLM 蒸馏为文档提取模型:GLiNER 多编码器方案实践
作者将 LLM 蒸馏为两个 287M 参数编码器,用于从 500 万份法院判决书中提取结构化信息。方案使用 GLiNER2.5-multi-v1 标记实体/动作/值,再用 GLiNER2.5-multi-Decide 做多选消歧。
Reddit · r/LocalLLaMAAI 评分2727 JEV 与普通嵌入模型有何不同?
JEV 是一个基于嵌入的意图路由器(embedding-based intent router),通过计算用户输入与预设示例意图之间的余弦相似度来路由任务。它使用 Ollama 运行 nomic-embed-text 模型生成嵌入向量,而非直接输出答案。
Hacker News · 首页AI 评分5454 智能体不需要记忆,需要文档
作者指出当前 AI 智能体的记忆插件都是基于 RAG 向量检索,存在检索不准确、缺乏上下文、无法审计等问题。真正的解决方案是文档式记忆:创建一个结构化的工作空间,让智能体主动写入和更新指令、规范、决策和研究,而不是依赖向量相似度搜索。作者已基于这一理念开发了 Operator Memory 插件并开源,已在实际项目中使用了超过一年。
Hacker News · 首页AI 评分6969 Jeffy:可在 CPU 上运行的本地预训练文本分类器
某项目发布了可在 CPU 上运行的本地预训练文本分类器工具,包含 13 个预训练分类器,支持自定义训练,提供 Python API 和 HTTP 服务。首次推理需下载约 1.2 GB 的编码器模型,推理延迟约 50-80 ms。
Hacker News · 首页精选AI 评分8282 Aleph Alpha 发布开放权重模型 Kolibri,支持德语和英语
德国 AI 公司 Aleph Alpha 发布开放权重大语言模型 Kolibri,总参数 78B、激活参数约 3.5B,采用混合专家架构,基于 Apache 2.0 许可证开源。
推荐理由:提供了模型的技术架构、性能数据、对比基准和可用入口,读者可以据此判断这个模型在德语场景和本地部署需求下的适用性。
Product Hunt · AI 分类AI 评分4242 DocsAlot MCP Connector
DocsAlot 将分散的帮助中心文章、知识库和开发者文档整合为面向人类和 AI 智能体的统一真实来源。该产品包含托管 MCP、llms.txt 和 skill.md,使文档能够直接出现在 AI 答案中,加速用户入职流程,并防止智能体读取过时的上下文内容。
Hugging Face BlogAI 评分5959 ProvenanceGuard:针对 MCP 智能体的源感知事实验证
ProvenanceGuard 是一个后生成验证层,用于检测 MCP 智能体答案中的跨源混淆问题。当一个声明的事实存在于某个证据中,但被错误地归因到另一个来源时,源盲目验证器会通过,但源感知验证器不会。
Unbug 一分钟读论文AI 评分2929 微软红雷蒙德团队提出 RAFT 框架:把历史案例检索粒度从整篇文档细化到时间线条目链
微软(Microsoft)红雷蒙德团队论文《RAFT: A Stateful Retrieval-Augmented Framework for Troubleshooting Agents》提出。
GitHub Blog · AI & MLAI 评分4343 代码要读吗?RAG死了吗?Skills取代MCP了吗?——GitHub Podcast深度解析五大AI热点观点
GitHub Podcast最新一期对五个常见AI热点观点进行深度解析,探讨是否需要阅读AI生成的代码、公司招聘是否强制AI技能、Skills是否取代MCP、RAG是否已过时、以及是否需要为代码库微调模型。主持人认为热点观点的价值不在于对错,而在于引发深入思考和问题,从而找到真正有用的 ideas。
Google ResearchAI 评分5454 绕过推理瓶颈:用 Retrieve-for-Train 加速复杂 AI 搜索
Google Research 提出 Retrieve-for-Train 框架,通过离线 RL 将搜索推理行为蒸馏到 53.9M 参数的扩散模型中。在时尚和音乐数据集上,该方法实现了 12-20 倍的推理加速,同时保持搜索结果的多样性和相关性。
Mistral AI精选AI 评分7171 Mistral 发布 Agentic Search,提供更准确高效的 AI 搜索结果
Mistral 发布 Agentic Search,在 FinanceBench 和 OfficeQA Pro 基准测试中实现了更准确的搜索结果,同时减少了对话轮次、token 使用和延迟。
推荐理由:原文给出了具体性能数据:金融文件正确率从 26.7% 提升到 86%(3x),p90 延迟降低 39.6%,token 消耗减少最多 1/3,读者可据此判断该技术对自己场景的实际价值。
Replicate BlogAI 评分6666 Datalab Marker 和 OCR 模型在 Replicate 上线,支持文档转 Markdown/JSON 及多语言文本识别
Datalab 的文档解析模型 Marker 和 OCR 文本识别模型现已在 Replicate 平台上线。Marker 可将 PDF、DOCX、PPTX、图片等转换为 markdown 或 JSON,支持表格、数学公式、代码格式化,并支持通过 JSON Schema 提取指定字段;OCR 支持九十种语言的文本检测、阅读顺序和表格网格识别。
Replicate BlogAI 评分7272 IBM Granite 4.0 模型现已登陆 Replicate
IBM 发布 Granite 4.0 开源小语言模型系列,专为速度和低成本打造。该系列采用混合架构结合 Mamba-2 线性扩展效率与 Transformer 精度,部分模型使用 MoE 路由策略,可在普通消费级 GPU 上运行。主要适用于文档摘要、RAG 系统和 AI 智能体场景,已在 Apache 2.0 许可证下开源。