#研究
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#研究
今日 0 条一手 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条AWS Machine Learning Blog精选AI 评分7272 Amazon SageMaker AI 多轮强化学习微调搜索智能体实战
本文介绍如何使用 Amazon SageMaker AI 的多轮强化学习(MTRL)功能微调 Qwen3.6-27B 搜索智能体。作者在四个基准测试上验证了微调效果:WixQA 提升 18.4%、Wands 提升 6%、BrowseComp-Plus 提升 23.7%,同时失败率从 22.89% 降至 0.68%。
推荐理由:给出了用 MTRL 训练搜索智能体的完整流程和实测数据,读者可以据此判断该方法对自己场景的适用性。
AWS Machine Learning BlogAI 评分4646 如何用 Amazon Quick 与 Adjudicated Query 模式审查数万份租约合规性
AWS 推出 Adjudicated Query 设计模式,在 Amazon Quick 聊天界面与确定性规则引擎之间建立边界,由 AI 负责翻译自然语言问题并叙述结果,决策权完全保留在非 AI 的规则引擎中。
Hugging Face Blog精选AI 评分6262 Allen AI 开源 AstaBrief 8B 科学报告生成模型
Allen AI 发布并开源了 AstaBrief 8B 模型,该模型可将研究问题和检索到的文献片段转化为带引用的科学报告。作为 Asta 平台 Generate a report 功能的 Fast 模式,平均生成时间为 51.1 秒,相比 Claude 驱动的 Thinking 模式(178.5 秒)提速约 3.5 倍。
推荐理由:提供了完整的训练数据构建、偏好数据过滤、评估指标设计过程,可供研究科学报告生成模型的开发者参考。
AWS Machine Learning BlogAI 评分4040 使用 NVIDIA NeMo Agent Toolkit 和 Amazon S3 Vectors 构建智能体记忆系统
NVIDIA NeMo Agent Toolkit (NAT) 1.6 版开源框架支持构建、分析和优化 AI 智能体,提供智能体编排、性能分析、评估和自动超参数调优功能。
AWS Machine Learning Blog精选AI 评分6363 使用 Amazon Bedrock Knowledge Bases 用自然语言查询保险理赔
本文是 AWS 官方技术教程,介绍如何使用 Amazon Bedrock Knowledge Bases 构建保险理赔助手。核心方案是通过 AgenticRetrieveStream API 实现智能检索,支持多轮对话、元数据过滤和引用标注。
推荐理由:提供了构建保险理赔 RAG 助手的完整方案,含代码示例、配置步骤和评估数据,方法可迁移到其他文档检索场景。
AWS Machine Learning BlogAI 评分3434 Condé Nast 如何用 Amazon Bedrock 构建多模态视频发现系统
Condé Nast 联合 AWS Generative AI Innovation Center 基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型实现跨视频文字记录、视觉元素和音频的语义搜索。
AWS Machine Learning BlogAI 评分5555 使用 Amazon Quick 和 Amazon Bedrock AgentCore 构建 AI 驱动的合同智能平台
本文介绍了一种解决合同管理中聚合查询问题的架构方案。当需要跨数百份合同查询总价值或到期合同等汇总信息时,传统 RAG 方式因只返回 top-k 文本块而失效。
Hugging Face Blog精选AI 评分7676 NVIDIA 发布 Kumo Tabular 表格预测基础模型
NVIDIA 发布 Kumo Tabular,这是一个开源的表格预测基础模型,可对标注过的表格数据进行分类和回归预测,无需训练、调优或特征工程。
推荐理由:该模型在四个表格预测基准测试中排名第一,性能优于调优后的梯度提升树和最新的表格基础模型,并提供三种参数规模供选择,可供读者判断其对现有机器学习工作流的潜在影响。
Microsoft Research精选AI 评分6666 微软发布 Quine:面向生物学复杂性的 AI 研究系统
微软研究院发布 Quine,这是一款旨在连接科学工具、文献、实验室和研究人员的 AI 研究系统。与 Broad Institute 合作,该系统用于预测和优先排序能够驱动肿瘤状态转变的化合物。在胰腺导管腺癌(PDAC)的湿实验证中,Quine 最高排名的化合物产生了最大的预期转录变化,整个过程仅用一个周末就完成了候选化合物的筛选和验证。
推荐理由:原文给出了 Quine 的具体能力(世界模型+交互式 harness)、应用场景(胰腺癌药物预测)和初步验证结果,读者可以据此了解这个 AI 系统如何辅助生物研究以及实际效果。
AWS Machine Learning BlogAI 评分3636 NarrateAI:在 Amazon Bedrock 上实现生产级 LLM 质量保证
NarrateAI 是面向超过 4000 名 AWS 高管的对话式 AI 助手,基于 Amazon Bedrock AgentCore 构建。该系统采用五项质量保证技术协同工作,实现约 99% 的数值准确率并支持实时流式响应。
AWS Machine Learning BlogAI 评分3333 Datacor 如何用 Amazon QuickSight 为气体分销商构建自助式租赁分析
Datacor 将 Amazon QuickSight 集成到其 TrackAbout 解决方案中,为气体和焊接分销商提供自助式租赁分析,业务用户可通过自然语言提问实时获取数据洞察。TrackAbout 客户共管理 2750 万个资产,每月处理 72.5 万张账单。该方案采用跨云数据管道定期刷新 QuickSight SPICE 数据集,确保仪表板反映最新运营数据。
Hugging Face Blog精选AI 评分6363 NeoMME:高效的多模态原生多语言编码器
Hugging Face发布NeoMME,一个包含260M和800M参数的多语言多模态编码器系列。该模型不使用独立的预训练视觉塔或因果语言模型,而是用单一双向Transformer处理文本token和原始图像patch,通过masked discrete-diffusion目标从头训练。
推荐理由:该模型展示了单一Transformer处理多模态的架构创新,在ViDoRe v3基准测试中以更小参数达到接近最优的nDCG@10,读者可了解新的多模态编码器设计思路。
Hugging Face Blog精选AI 评分7777 如何使用 GRPO 微调 LFM2.5-350M 提升结构化输出能力
本教程展示如何使用 TRL 库的 GRPO 方法微调 LFM2.5-350M 以提升结构化输出能力。实验使用约 500 个样本训练 100 步,在 IFStruct 基准上的准确率从 22.6% 提升至 29.7%(JSON 格式提升 13.9 个百分点),所需资源仅需免费层 Colab 或 Kaggle GPU。
推荐理由:原文给出了具体的方法论(GRPO + 奖励函数设计)和可量化的性能提升,读者可以据此判断轻量微调是否适合自己的结构化输出场景。
Google ResearchAI 评分4343 Google Earth AI 的 Planetary Prediction Engine 如何实现全球地理空间预测自动化
Google 推出 Planetary Prediction Engine(PPE),作为 Google Earth AI 的实验性研究能力,可自主完成从数据发现到模型训练的完整地理空间预测工作流,将复杂建模周期从数周缩短至数分钟。
Hugging Face Blog精选AI 评分7070 使用 Sentence Transformers 训练和微调多向量嵌入模型
Sentence Transformers v6.0 引入 MultiVectorEncoder 以支持 ColBERT 风格的延迟交互检索,并提供完整训练流程。作者用 100 万条医学问答对在单张 RTX 3090 上训练 14.5 小时后,微调模型在医学检索任务上 NDCG@10 达到 0.9139,比最强的零样本模型高出 0.062,验证了领域微调对多向量模型的显著提升效果。
推荐理由:原文给出了完整的训练脚本和消融实验数据,读者可以直接复用这个recipe来训练自己的多向量检索模型。
Hugging Face BlogAI 评分5353 Hugging Face 如何用 Inference Endpoints、Jobs 和 Buckets 打造 Papers with Code 搜索
Papers with Code 搜索系统采用混合搜索架构,结合 PostgreSQL 全文检索和 pgvector 向量检索,通过加权倒数排名融合(RRF)算法合并结果。
Hugging Face Blog精选AI 评分6969 IBM Research 研究:AI 智能体需要多少记忆才合适
IBM Research 的 ALTK-Evolve 技术让智能体能从自身轨迹中提取可复用指导方针,在推理时注入。
推荐理由:原文通过8个模型的对比实验给出了明确的剂量-能力对应关系,读者可以据此为自己的智能体选择合适的记忆策略。
Hugging Face Blog精选AI 评分7575 Sentence Transformers v6.0 新增多向量编码器,支持 ColBERT 风格延迟交互检索
Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,支持 ColBERT 风格的延迟交互检索。该模型保留每个 token 的嵌入向量而非压缩为单一向量,使用 MaxSim 算子进行查询与文档的评分,能够在保持双编码器索引效率的同时实现更强的检索质量。
推荐理由:文章给出了完整的 Late Interaction 方案和使用路径,读者可以直接据此评估是否需要切换检索方式。
Mistral AI精选AI 评分7878 Mistral 推出 OCR 4:支持 170 种语言的文档解析模型
Mistral 发布 OCR 4,这是一款文档解析产品,支持 170 种语言,提供边界框、块分类和内联置信度分数等结构化输出。该模型在人类评估和基准测试中均优于现有 OCR 系统,可通过 API、Document AI 或自托管部署使用。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google Research精选AI 评分6767 Google 发布 Gemini Enterprise Agent Platform 的 Agentic RAG 功能
Google 推出 Gemini Enterprise Agent Platform 的 Agentic RAG 功能,采用多智能体架构(Orchestrator、Planner、Query Rewriter、Search Fanout)处理复杂多源查询。
推荐理由:原文给出了具体准确率提升数据(最高34%)和新的 Sufficient Context Agent 机制,读者可以据此判断这个新产品在企业知识管理场景中的实际价值。
Mistral AI精选AI 评分7777 Mistral AI 推出 Search Toolkit 公开预览版
Mistral AI 发布了 Search Toolkit 公开预览版,这是一个用于构建 AI 应用生产搜索管道的可组合框架。该工具将数据摄入、检索和评估整合到单一框架中,支持 BM25 稀疏检索、密集向量检索和混合检索配置,内置 recall、precision、MRR、NDCG 等评估指标,开源且可在云端、本地或边缘运行。
推荐理由:它将数据摄入、检索和评估整合到一个框架中,帮助团队把时间从集成维护转向搜索质量提升。
Google DeepMindAI 评分5252 Co-Scientist 辅助基因筛选助力逆转细胞衰老
Google DeepMind 官方博客介绍了生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 使用 Co-Scientist 进行衰老研究的案例。
Google DeepMindAI 评分3939 Calico Life Sciences 如何用 Co-Scientist 开辟衰老研究新路径
Calico Life Sciences 的 AI/ML 负责人 Matt Onsum 和首席科学家 Katherine Labbé使用 Co-Scientist 连接分散的衰老生物学发现,将其转化为可检验的假设。Co-Scientist 帮助生成了关于整合应激反应(ISR)如何被代谢调控的假设,实验产生了对 ISR 在健康与疾病中作用具有重要意义的新发现,团队计划发表结果。
Google DeepMindAI 评分4848 Co-Scientist 如何加速发现 MASH 肝病机制
Google DeepMind 的 Co-Scientist 工具帮助 Edinburgh 大学 Filippo Menolascina 团队研究代谢相关脂肪性肝炎(MASH)。该系统生成假设,识别出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,解释了为何获批药物 resmetirom 仅对部分患者有效。该假设已被后续实验验证,有望推动双靶点疗法开发。
Google DeepMindAI 评分2828 Google DeepMind 的 Co-Scientist 如何帮助跨学科团队联合生物工具研究 ALS
Co-Scientist 在数月内压缩了原本需要跨领域文献综述的工作,帮助 MIT 机械工程师 Ritu Raman 将想法转化为可测试的假设,并确定了以细胞表面分子互作为重点的研究方向。
Google ResearchAI 评分4040 ConvApparel:衡量并缩小用户模拟器中的真实感差距
Google Research推出ConvApparel数据集,包含超4000段人类-AI多轮对话(共近15000轮),在服装购物领域采用双智能体协议收集数据。该数据集通过人口级统计对齐、人类相似度评分、反事实验证三种评估维度,衡量当前LLM用户模拟器与真实人类行为的显著差距,为构建更可信的AI测试工具提供路径。
Mistral AI精选AI 评分6060 Mistral 发布基于 LLM as a Judge 的 RAG 评估方法
本文介绍了使用 LLM 作为评判者来评估 RAG 系统的完整方法,重点讲解了 RAG Triad 框架的三个核心指标:上下文相关性(Context Relevance)、事实一致性(Groundedness)和答案相关性(Answer Relevance),并提供了使用 Mistral 结构化输出实现评估的代码示例。
推荐理由:原文给出了 RAG 评估的完整方法论和代码实现,读者可以据此构建自己的 RAG 系统评估流程。
Mistral AI精选AI 评分7575 Mistral 推出 OCR API,基准测试超越 Google、Azure 和 GPT-4o
Mistral 发布新的 OCR API Mistral OCR,可处理图像和 PDF 并提取交错文本和图像,在基准测试中超越 Google Document AI、Azure OCR、Gemini 和 GPT-4o。定价为每美元 1000 页,单节点处理速度最高达每分钟 2000 页,支持多语言文档理解,现已在 Le Chat 免费试用,API 已上线 la Plateforme。
推荐理由:原文给出了具体定价、基准测试对比和可用入口,读者可以据此评估它与现有 OCR 方案的差异。