#研究
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#研究
今日 0 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条MIT Technology Review · AIAI 评分3636 企业智能的重新定义:自主AI
2026年全球AI投资预计达2.5万亿美元,同比增长44%,但大多数企业的AI投资导致碎片化问题,各部门数据孤岛阻碍整体决策。报告指出从“AI作为工具”到“AI作为运营模式”的转型,需要重建可访问的数据基础设施、采用可组合架构、解决AI主权问题。流程优先的企业正通过先重新设计流程再选择模型的方式取得领先。
AWS Machine Learning Blog精选AI 评分7272 Amazon SageMaker AI 多轮强化学习微调搜索智能体实战
本文介绍如何使用 Amazon SageMaker AI 的多轮强化学习(MTRL)功能微调 Qwen3.6-27B 搜索智能体。作者在四个基准测试上验证了微调效果:WixQA 提升 18.4%、Wands 提升 6%、BrowseComp-Plus 提升 23.7%,同时失败率从 22.89% 降至 0.68%。
推荐理由:给出了用 MTRL 训练搜索智能体的完整流程和实测数据,读者可以据此判断该方法对自己场景的适用性。
AWS Machine Learning BlogAI 评分4646 如何用 Amazon Quick 与 Adjudicated Query 模式审查数万份租约合规性
AWS 推出 Adjudicated Query 设计模式,在 Amazon Quick 聊天界面与确定性规则引擎之间建立边界,由 AI 负责翻译自然语言问题并叙述结果,决策权完全保留在非 AI 的规则引擎中。
Hugging Face Blog精选AI 评分6262 Allen AI 开源 AstaBrief 8B 科学报告生成模型
Allen AI 发布并开源了 AstaBrief 8B 模型,该模型可将研究问题和检索到的文献片段转化为带引用的科学报告。作为 Asta 平台 Generate a report 功能的 Fast 模式,平均生成时间为 51.1 秒,相比 Claude 驱动的 Thinking 模式(178.5 秒)提速约 3.5 倍。
推荐理由:提供了完整的训练数据构建、偏好数据过滤、评估指标设计过程,可供研究科学报告生成模型的开发者参考。
Reddit · r/ChatGPTAI 评分1414 如何在 iPhone 上为 ChatGPT 建立个人知识库?
Reddit 用户在 iPhone 上询问如何为 ChatGPT 配置个人知识库,使模型能够保存结论或设计方案并用作记忆。用户希望了解使用的工具、架构方案(云端存储或第三方应用),以及如何增强 ChatGPT 的记忆与召回功能。
Product Hunt · AI 分类AI 评分5151 Communicate 发布:从帮助文档构建 AI 客服智能体
Communicate 是一款 AI 支持智能体产品,可从帮助文档、文件和过去的回复中构建智能体,自动回答问题并执行经人工批准的任务,支持共享收件箱人工接管、网站聊天、对话跟踪以及 API 或只读 MCP 连接。计划起价 $19/月,使用促销码 PRODUCTHUNT50 可在 10 月 9 日前享受首月 5 折优惠。
Hacker News · 首页AI 评分5252 我用 Opus 5.5 发现了一条新的渡渡鸟目击记录
作者使用 Claude Opus 5.5 在荷兰东印度公司档案中搜索,发现了 1615 年一艘荷兰船只的日志,其中记录了在毛里求斯“捕获许多乌龟、渡渡鸟和一些鹅和鹦鹉”,这是此前未知的 1611-16 年间渡渡鸟记录空白期的补充。作者还发现了另一只已灭绝鸟类红秧鸡的可能新参考文献,以及关于莫卧儿皇帝贾汉吉尔可能拥有活渡渡鸟的溯源理论。
AWS Machine Learning BlogAI 评分4040 使用 NVIDIA NeMo Agent Toolkit 和 Amazon S3 Vectors 构建智能体记忆系统
NVIDIA NeMo Agent Toolkit (NAT) 1.6 版开源框架支持构建、分析和优化 AI 智能体,提供智能体编排、性能分析、评估和自动超参数调优功能。
Hacker News · 首页AI 评分5757 上下文语言模型
本文提出上下文语言模型(CLM),一种原生管理自身上下文的语言模型实现方式。通过将上下文视为文件并允许模型进行无限制更新,模型能够学习保留最重要的上下文内容。该方法天然支持多智能体系统中多个智能体上下文以文件形式共存。
Reddit · r/LocalLLaMAAI 评分6060 18 种 RAG 管道与智能体循环在 Google FRAMES 上的基准测试对比
在 Google FRAMES 数据集的 824 个多跳问题测试中,18 种 RAG 管道变体的最佳准确率为 78.9%,而带检索工具的智能体循环达到 92.7%。
Reddit · r/LocalLLaMAAI 评分6262 szmcp:ZIM HTML 转 Markdown 转换器及 ZIM MCP 服务器
用户发布了一个用 Rust 编写的 ZIM 文件 MCP 服务器项目,旨在让本地小模型能访问离线知识库。该工具可将 Kiwix Wikipedia ZIM 文件转换为 Markdown 格式,49 GB 的英文 Wikipedia ZIM 可转换为 19 GB Markdown。
Product Hunt · AI 分类AI 评分4848 chat.sh:自托管 AI 帮助中心搜索工具发布终身方案
chat.sh 推出一款自托管 AI 帮助中心搜索工具,AI 搜索可直接生成答案并引用页面来源,每个页面提供 markdown 格式供 ChatGPT、Claude 等大语言模型使用。终身方案限时特价 $199(原价 $399),无月度订阅费,下一阶段将推出聊天工具和支持收件箱。
Reddit · r/artificialAI 评分4242 如何用 Reddit 测试 AI 回答是否真正遵守了关键约束
提出一种利用 Reddit 公开帖子测试大语言模型答案质量的实用方法:选取三条关于同一实际任务的 Reddit 帖子,记录其中埋藏的约束条件(如"仅离线可用""无法安装软件"等),让模型根据帖子内容给出方案,然后将模型答案与预设的约束清单对照,将任何未满足的约束视为失败,无论表述多么有说服力。该方法可用于诊断不同提示词或模型版本的表现差异。
AWS Machine Learning Blog精选AI 评分6363 使用 Amazon Bedrock Knowledge Bases 用自然语言查询保险理赔
本文是 AWS 官方技术教程,介绍如何使用 Amazon Bedrock Knowledge Bases 构建保险理赔助手。核心方案是通过 AgenticRetrieveStream API 实现智能检索,支持多轮对话、元数据过滤和引用标注。
推荐理由:提供了构建保险理赔 RAG 助手的完整方案,含代码示例、配置步骤和评估数据,方法可迁移到其他文档检索场景。
The Verge · AIAI 评分6666 Google测试向出版商付费以换取AI搜索结果
Google推出试点项目,向约100家出版商付费,将其内容用于AI Overviews和AI Mode等AI搜索功能以及Gemini聊天机器人。早期参与的出版商一年收入超过100万美元,近期加入的出版商已获得5万至6万美元。
Reddit · r/MachineLearningAI 评分5454 开发者用 Jev 降低游戏搜索引警成本和延迟
indiex.gg 是一款游戏发现引警,原先用 DeepSeek 将用户的自然语言查询提取为结构化意图(参考游戏、过滤器、标签等),成本高且延迟大。作者将其替换为 OpenRouter Decisions API 的 TypeSafe Jev 模型:Jev 不生成自由形式答案,而是并行回答一组封闭的是/否问题和选择题,再通过正则表达式组合成相同的提取结果。
AWS Machine Learning BlogAI 评分3434 Condé Nast 如何用 Amazon Bedrock 构建多模态视频发现系统
Condé Nast 联合 AWS Generative AI Innovation Center 基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型实现跨视频文字记录、视觉元素和音频的语义搜索。
AWS Machine Learning BlogAI 评分5555 使用 Amazon Quick 和 Amazon Bedrock AgentCore 构建 AI 驱动的合同智能平台
本文介绍了一种解决合同管理中聚合查询问题的架构方案。当需要跨数百份合同查询总价值或到期合同等汇总信息时,传统 RAG 方式因只返回 top-k 文本块而失效。
Hacker News · 首页精选AI 评分7979 Jevstiller:带 Disagreement Bound 的本地模型蒸馏工具
Jevstiller 是一个将 Jev 模型蒸馏为本地小模型的系统,使用 bge-small 编码器加逻辑回归头,约几百 KB,CPU 上 15ms 响应。核心创新是提供 95% 置信度的协议保证:设置如 98% 的目标Agreement,系统保证本地模型与 Jev 的不一致率不超过预算。
推荐理由:给出了一个带数学保证的蒸馏系统实现,读者可以学习其如何用统计方法保证协议达成。
Hugging Face Blog精选AI 评分7676 NVIDIA 发布 Kumo Tabular 表格预测基础模型
NVIDIA 发布 Kumo Tabular,这是一个开源的表格预测基础模型,可对标注过的表格数据进行分类和回归预测,无需训练、调优或特征工程。
推荐理由:该模型在四个表格预测基准测试中排名第一,性能优于调优后的梯度提升树和最新的表格基础模型,并提供三种参数规模供选择,可供读者判断其对现有机器学习工作流的潜在影响。
Microsoft Research精选AI 评分6666 微软发布 Quine:面向生物学复杂性的 AI 研究系统
微软研究院发布 Quine,这是一款旨在连接科学工具、文献、实验室和研究人员的 AI 研究系统。与 Broad Institute 合作,该系统用于预测和优先排序能够驱动肿瘤状态转变的化合物。在胰腺导管腺癌(PDAC)的湿实验证中,Quine 最高排名的化合物产生了最大的预期转录变化,整个过程仅用一个周末就完成了候选化合物的筛选和验证。
推荐理由:原文给出了 Quine 的具体能力(世界模型+交互式 harness)、应用场景(胰腺癌药物预测)和初步验证结果,读者可以据此了解这个 AI 系统如何辅助生物研究以及实际效果。
AWS Machine Learning BlogAI 评分3636 NarrateAI:在 Amazon Bedrock 上实现生产级 LLM 质量保证
NarrateAI 是面向超过 4000 名 AWS 高管的对话式 AI 助手,基于 Amazon Bedrock AgentCore 构建。该系统采用五项质量保证技术协同工作,实现约 99% 的数值准确率并支持实时流式响应。
AWS Machine Learning BlogAI 评分3333 Datacor 如何用 Amazon QuickSight 为气体分销商构建自助式租赁分析
Datacor 将 Amazon QuickSight 集成到其 TrackAbout 解决方案中,为气体和焊接分销商提供自助式租赁分析,业务用户可通过自然语言提问实时获取数据洞察。TrackAbout 客户共管理 2750 万个资产,每月处理 72.5 万张账单。该方案采用跨云数据管道定期刷新 QuickSight SPICE 数据集,确保仪表板反映最新运营数据。
Product Hunt · AI 分类AI 评分3333 Veltrix AI for E-commerce
Veltrix AI for E-commerce 是一款电商AI平台,可秒级连接 QuickBooks、HubSpot 等工具,支持用自然语言提问以了解收入变化原因并获取业务建议,帮助商家即时掌握整体经营状况。
Product Hunt · AI 分类AI 评分4949 Curie:面向科研的 AI 研究助手
Curie 并行搜索 PubMed、arXiv、Europe PMC、OpenAlex 和 Semantic Scholar,验证每个结论的来源,标注哪些有据可查、哪些缺乏支持。文档可提取结构化数据,每个值附带原始引用;支持完整的系统综述、筛选和 PRISMA 流程图,每步需用户审批。内置项目管理和文献库功能保持研究有序。
Hugging Face Blog精选AI 评分6363 NeoMME:高效的多模态原生多语言编码器
Hugging Face发布NeoMME,一个包含260M和800M参数的多语言多模态编码器系列。该模型不使用独立的预训练视觉塔或因果语言模型,而是用单一双向Transformer处理文本token和原始图像patch,通过masked discrete-diffusion目标从头训练。
推荐理由:该模型展示了单一Transformer处理多模态的架构创新,在ViDoRe v3基准测试中以更小参数达到接近最优的nDCG@10,读者可了解新的多模态编码器设计思路。
Hugging Face Blog精选AI 评分7777 如何使用 GRPO 微调 LFM2.5-350M 提升结构化输出能力
本教程展示如何使用 TRL 库的 GRPO 方法微调 LFM2.5-350M 以提升结构化输出能力。实验使用约 500 个样本训练 100 步,在 IFStruct 基准上的准确率从 22.6% 提升至 29.7%(JSON 格式提升 13.9 个百分点),所需资源仅需免费层 Colab 或 Kaggle GPU。
推荐理由:原文给出了具体的方法论(GRPO + 奖励函数设计)和可量化的性能提升,读者可以据此判断轻量微调是否适合自己的结构化输出场景。
Google ResearchAI 评分4343 Google Earth AI 的 Planetary Prediction Engine 如何实现全球地理空间预测自动化
Google 推出 Planetary Prediction Engine(PPE),作为 Google Earth AI 的实验性研究能力,可自主完成从数据发现到模型训练的完整地理空间预测工作流,将复杂建模周期从数周缩短至数分钟。
Hugging Face Blog精选AI 评分7070 使用 Sentence Transformers 训练和微调多向量嵌入模型
Sentence Transformers v6.0 引入 MultiVectorEncoder 以支持 ColBERT 风格的延迟交互检索,并提供完整训练流程。作者用 100 万条医学问答对在单张 RTX 3090 上训练 14.5 小时后,微调模型在医学检索任务上 NDCG@10 达到 0.9139,比最强的零样本模型高出 0.062,验证了领域微调对多向量模型的显著提升效果。
推荐理由:原文给出了完整的训练脚本和消融实验数据,读者可以直接复用这个recipe来训练自己的多向量检索模型。
Hugging Face BlogAI 评分5353 Hugging Face 如何用 Inference Endpoints、Jobs 和 Buckets 打造 Papers with Code 搜索
Papers with Code 搜索系统采用混合搜索架构,结合 PostgreSQL 全文检索和 pgvector 向量检索,通过加权倒数排名融合(RRF)算法合并结果。
Hugging Face Blog精选AI 评分6969 IBM Research 研究:AI 智能体需要多少记忆才合适
IBM Research 的 ALTK-Evolve 技术让智能体能从自身轨迹中提取可复用指导方针,在推理时注入。
推荐理由:原文通过8个模型的对比实验给出了明确的剂量-能力对应关系,读者可以据此为自己的智能体选择合适的记忆策略。
Hugging Face Blog精选AI 评分7575 Sentence Transformers v6.0 新增多向量编码器,支持 ColBERT 风格延迟交互检索
Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,支持 ColBERT 风格的延迟交互检索。该模型保留每个 token 的嵌入向量而非压缩为单一向量,使用 MaxSim 算子进行查询与文档的评分,能够在保持双编码器索引效率的同时实现更强的检索质量。
推荐理由:文章给出了完整的 Late Interaction 方案和使用路径,读者可以直接据此评估是否需要切换检索方式。
Mistral AI精选AI 评分7878 Mistral 推出 OCR 4:支持 170 种语言的文档解析模型
Mistral 发布 OCR 4,这是一款文档解析产品,支持 170 种语言,提供边界框、块分类和内联置信度分数等结构化输出。该模型在人类评估和基准测试中均优于现有 OCR 系统,可通过 API、Document AI 或自托管部署使用。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google Research精选AI 评分6767 Google 发布 Gemini Enterprise Agent Platform 的 Agentic RAG 功能
Google 推出 Gemini Enterprise Agent Platform 的 Agentic RAG 功能,采用多智能体架构(Orchestrator、Planner、Query Rewriter、Search Fanout)处理复杂多源查询。
推荐理由:原文给出了具体准确率提升数据(最高34%)和新的 Sufficient Context Agent 机制,读者可以据此判断这个新产品在企业知识管理场景中的实际价值。
Mistral AI精选AI 评分7777 Mistral AI 推出 Search Toolkit 公开预览版
Mistral AI 发布了 Search Toolkit 公开预览版,这是一个用于构建 AI 应用生产搜索管道的可组合框架。该工具将数据摄入、检索和评估整合到单一框架中,支持 BM25 稀疏检索、密集向量检索和混合检索配置,内置 recall、precision、MRR、NDCG 等评估指标,开源且可在云端、本地或边缘运行。
推荐理由:它将数据摄入、检索和评估整合到一个框架中,帮助团队把时间从集成维护转向搜索质量提升。
Google DeepMindAI 评分5252 Co-Scientist 辅助基因筛选助力逆转细胞衰老
Google DeepMind 官方博客介绍了生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 使用 Co-Scientist 进行衰老研究的案例。
Google DeepMindAI 评分3939 Calico Life Sciences 如何用 Co-Scientist 开辟衰老研究新路径
Calico Life Sciences 的 AI/ML 负责人 Matt Onsum 和首席科学家 Katherine Labbé使用 Co-Scientist 连接分散的衰老生物学发现,将其转化为可检验的假设。Co-Scientist 帮助生成了关于整合应激反应(ISR)如何被代谢调控的假设,实验产生了对 ISR 在健康与疾病中作用具有重要意义的新发现,团队计划发表结果。
Google DeepMindAI 评分4848 Co-Scientist 如何加速发现 MASH 肝病机制
Google DeepMind 的 Co-Scientist 工具帮助 Edinburgh 大学 Filippo Menolascina 团队研究代谢相关脂肪性肝炎(MASH)。该系统生成假设,识别出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,解释了为何获批药物 resmetirom 仅对部分患者有效。该假设已被后续实验验证,有望推动双靶点疗法开发。
Google DeepMindAI 评分2828 Google DeepMind 的 Co-Scientist 如何帮助跨学科团队联合生物工具研究 ALS
Co-Scientist 在数月内压缩了原本需要跨领域文献综述的工作,帮助 MIT 机械工程师 Ritu Raman 将想法转化为可测试的假设,并确定了以细胞表面分子互作为重点的研究方向。
Google ResearchAI 评分4040 ConvApparel:衡量并缩小用户模拟器中的真实感差距
Google Research推出ConvApparel数据集,包含超4000段人类-AI多轮对话(共近15000轮),在服装购物领域采用双智能体协议收集数据。该数据集通过人口级统计对齐、人类相似度评分、反事实验证三种评估维度,衡量当前LLM用户模拟器与真实人类行为的显著差距,为构建更可信的AI测试工具提供路径。