跳到正文

#研究

今日 0 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月3日周六
  1. MIT Technology Review · AI36

    企业智能的重新定义:自主AI

    2026年全球AI投资预计达2.5万亿美元,同比增长44%,但大多数企业的AI投资导致碎片化问题,各部门数据孤岛阻碍整体决策。报告指出从“AI作为工具”到“AI作为运营模式”的转型,需要重建可访问的数据基础设施、采用可组合架构、解决AI主权问题。流程优先的企业正通过先重新设计流程再选择模型的方式取得领先。

  2. AWS Machine Learning Blog72

    Amazon SageMaker AI 多轮强化学习微调搜索智能体实战

    本文介绍如何使用 Amazon SageMaker AI 的多轮强化学习(MTRL)功能微调 Qwen3.6-27B 搜索智能体。作者在四个基准测试上验证了微调效果:WixQA 提升 18.4%、Wands 提升 6%、BrowseComp-Plus 提升 23.7%,同时失败率从 22.89% 降至 0.68%。

    推荐理由:给出了用 MTRL 训练搜索智能体的完整流程和实测数据,读者可以据此判断该方法对自己场景的适用性。

10月2日周五
  1. Hugging Face Blog62

    Allen AI 开源 AstaBrief 8B 科学报告生成模型

    Allen AI 发布并开源了 AstaBrief 8B 模型,该模型可将研究问题和检索到的文献片段转化为带引用的科学报告。作为 Asta 平台 Generate a report 功能的 Fast 模式,平均生成时间为 51.1 秒,相比 Claude 驱动的 Thinking 模式(178.5 秒)提速约 3.5 倍。

    推荐理由:提供了完整的训练数据构建、偏好数据过滤、评估指标设计过程,可供研究科学报告生成模型的开发者参考。

  2. Product Hunt · AI 分类51

    Communicate 发布:从帮助文档构建 AI 客服智能体

    Communicate 是一款 AI 支持智能体产品,可从帮助文档、文件和过去的回复中构建智能体,自动回答问题并执行经人工批准的任务,支持共享收件箱人工接管、网站聊天、对话跟踪以及 API 或只读 MCP 连接。计划起价 $19/月,使用促销码 PRODUCTHUNT50 可在 10 月 9 日前享受首月 5 折优惠。

  3. Hacker News · 首页52

    我用 Opus 5.5 发现了一条新的渡渡鸟目击记录

    作者使用 Claude Opus 5.5 在荷兰东印度公司档案中搜索,发现了 1615 年一艘荷兰船只的日志,其中记录了在毛里求斯“捕获许多乌龟、渡渡鸟和一些鹅和鹦鹉”,这是此前未知的 1611-16 年间渡渡鸟记录空白期的补充。作者还发现了另一只已灭绝鸟类红秧鸡的可能新参考文献,以及关于莫卧儿皇帝贾汉吉尔可能拥有活渡渡鸟的溯源理论。

  4. Hacker News · 首页57

    上下文语言模型

    本文提出上下文语言模型(CLM),一种原生管理自身上下文的语言模型实现方式。通过将上下文视为文件并允许模型进行无限制更新,模型能够学习保留最重要的上下文内容。该方法天然支持多智能体系统中多个智能体上下文以文件形式共存。

10月1日周四
  1. Product Hunt · AI 分类48

    chat.sh:自托管 AI 帮助中心搜索工具发布终身方案

    chat.sh 推出一款自托管 AI 帮助中心搜索工具,AI 搜索可直接生成答案并引用页面来源,每个页面提供 markdown 格式供 ChatGPT、Claude 等大语言模型使用。终身方案限时特价 $199(原价 $399),无月度订阅费,下一阶段将推出聊天工具和支持收件箱。

  2. Reddit · r/artificial42

    如何用 Reddit 测试 AI 回答是否真正遵守了关键约束

    提出一种利用 Reddit 公开帖子测试大语言模型答案质量的实用方法:选取三条关于同一实际任务的 Reddit 帖子,记录其中埋藏的约束条件(如"仅离线可用""无法安装软件"等),让模型根据帖子内容给出方案,然后将模型答案与预设的约束清单对照,将任何未满足的约束视为失败,无论表述多么有说服力。该方法可用于诊断不同提示词或模型版本的表现差异。

  3. AWS Machine Learning Blog63

    使用 Amazon Bedrock Knowledge Bases 用自然语言查询保险理赔

    本文是 AWS 官方技术教程,介绍如何使用 Amazon Bedrock Knowledge Bases 构建保险理赔助手。核心方案是通过 AgenticRetrieveStream API 实现智能检索,支持多轮对话、元数据过滤和引用标注。

    推荐理由:提供了构建保险理赔 RAG 助手的完整方案,含代码示例、配置步骤和评估数据,方法可迁移到其他文档检索场景。

9月30日周三
  1. Reddit · r/MachineLearning54

    开发者用 Jev 降低游戏搜索引警成本和延迟

    indiex.gg 是一款游戏发现引警,原先用 DeepSeek 将用户的自然语言查询提取为结构化意图(参考游戏、过滤器、标签等),成本高且延迟大。作者将其替换为 OpenRouter Decisions API 的 TypeSafe Jev 模型:Jev 不生成自由形式答案,而是并行回答一组封闭的是/否问题和选择题,再通过正则表达式组合成相同的提取结果。

9月29日周二
  1. Hacker News · 首页79

    Jevstiller:带 Disagreement Bound 的本地模型蒸馏工具

    Jevstiller 是一个将 Jev 模型蒸馏为本地小模型的系统,使用 bge-small 编码器加逻辑回归头,约几百 KB,CPU 上 15ms 响应。核心创新是提供 95% 置信度的协议保证:设置如 98% 的目标Agreement,系统保证本地模型与 Jev 的不一致率不超过预算。

    推荐理由:给出了一个带数学保证的蒸馏系统实现,读者可以学习其如何用统计方法保证协议达成。

  2. Hugging Face Blog76

    NVIDIA 发布 Kumo Tabular 表格预测基础模型

    NVIDIA 发布 Kumo Tabular,这是一个开源的表格预测基础模型,可对标注过的表格数据进行分类和回归预测,无需训练、调优或特征工程。

    推荐理由:该模型在四个表格预测基准测试中排名第一,性能优于调优后的梯度提升树和最新的表格基础模型,并提供三种参数规模供选择,可供读者判断其对现有机器学习工作流的潜在影响。

  3. Microsoft Research66

    微软发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,这是一款旨在连接科学工具、文献、实验室和研究人员的 AI 研究系统。与 Broad Institute 合作,该系统用于预测和优先排序能够驱动肿瘤状态转变的化合物。在胰腺导管腺癌(PDAC)的湿实验证中,Quine 最高排名的化合物产生了最大的预期转录变化,整个过程仅用一个周末就完成了候选化合物的筛选和验证。

    推荐理由:原文给出了 Quine 的具体能力(世界模型+交互式 harness)、应用场景(胰腺癌药物预测)和初步验证结果,读者可以据此了解这个 AI 系统如何辅助生物研究以及实际效果。

9月26日周六
9月25日周五
  1. AWS Machine Learning Blog33

    Datacor 如何用 Amazon QuickSight 为气体分销商构建自助式租赁分析

    Datacor 将 Amazon QuickSight 集成到其 TrackAbout 解决方案中,为气体和焊接分销商提供自助式租赁分析,业务用户可通过自然语言提问实时获取数据洞察。TrackAbout 客户共管理 2750 万个资产,每月处理 72.5 万张账单。该方案采用跨云数据管道定期刷新 QuickSight SPICE 数据集,确保仪表板反映最新运营数据。

9月17日周四
  1. Product Hunt · AI 分类33

    Veltrix AI for E-commerce

    Veltrix AI for E-commerce 是一款电商AI平台,可秒级连接 QuickBooks、HubSpot 等工具,支持用自然语言提问以了解收入变化原因并获取业务建议,帮助商家即时掌握整体经营状况。

9月10日周四
  1. Product Hunt · AI 分类49

    Curie:面向科研的 AI 研究助手

    Curie 并行搜索 PubMed、arXiv、Europe PMC、OpenAlex 和 Semantic Scholar,验证每个结论的来源,标注哪些有据可查、哪些缺乏支持。文档可提取结构化数据,每个值附带原始引用;支持完整的系统综述、筛选和 PRISMA 流程图,每步需用户审批。内置项目管理和文献库功能保持研究有序。

9月3日周四
  1. Hugging Face Blog63

    NeoMME:高效的多模态原生多语言编码器

    Hugging Face发布NeoMME,一个包含260M和800M参数的多语言多模态编码器系列。该模型不使用独立的预训练视觉塔或因果语言模型,而是用单一双向Transformer处理文本token和原始图像patch,通过masked discrete-diffusion目标从头训练。

    推荐理由:该模型展示了单一Transformer处理多模态的架构创新,在ViDoRe v3基准测试中以更小参数达到接近最优的nDCG@10,读者可了解新的多模态编码器设计思路。

  2. Hugging Face Blog77

    如何使用 GRPO 微调 LFM2.5-350M 提升结构化输出能力

    本教程展示如何使用 TRL 库的 GRPO 方法微调 LFM2.5-350M 以提升结构化输出能力。实验使用约 500 个样本训练 100 步,在 IFStruct 基准上的准确率从 22.6% 提升至 29.7%(JSON 格式提升 13.9 个百分点),所需资源仅需免费层 Colab 或 Kaggle GPU。

    推荐理由:原文给出了具体的方法论(GRPO + 奖励函数设计)和可量化的性能提升,读者可以据此判断轻量微调是否适合自己的结构化输出场景。

8月28日周五
8月26日周三
  1. Hugging Face Blog70

    使用 Sentence Transformers 训练和微调多向量嵌入模型

    Sentence Transformers v6.0 引入 MultiVectorEncoder 以支持 ColBERT 风格的延迟交互检索,并提供完整训练流程。作者用 100 万条医学问答对在单张 RTX 3090 上训练 14.5 小时后,微调模型在医学检索任务上 NDCG@10 达到 0.9139,比最强的零样本模型高出 0.062,验证了领域微调对多向量模型的显著提升效果。

    推荐理由:原文给出了完整的训练脚本和消融实验数据,读者可以直接复用这个recipe来训练自己的多向量检索模型。

8月21日周五
8月19日周三
8月18日周二
  1. Hugging Face Blog75

    Sentence Transformers v6.0 新增多向量编码器,支持 ColBERT 风格延迟交互检索

    Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,支持 ColBERT 风格的延迟交互检索。该模型保留每个 token 的嵌入向量而非压缩为单一向量,使用 MaxSim 算子进行查询与文档的评分,能够在保持双编码器索引效率的同时实现更强的检索质量。

    推荐理由:文章给出了完整的 Late Interaction 方案和使用路径,读者可以直接据此评估是否需要切换检索方式。

6月23日周二
  1. Mistral AI78

    Mistral 推出 OCR 4:支持 170 种语言的文档解析模型

    Mistral 发布 OCR 4,这是一款文档解析产品,支持 170 种语言,提供边界框、块分类和内联置信度分数等结构化输出。该模型在人类评估和基准测试中均优于现有 OCR 系统,可通过 API、Document AI 或自托管部署使用。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

6月5日周五
  1. Google Research67

    Google 发布 Gemini Enterprise Agent Platform 的 Agentic RAG 功能

    Google 推出 Gemini Enterprise Agent Platform 的 Agentic RAG 功能,采用多智能体架构(Orchestrator、Planner、Query Rewriter、Search Fanout)处理复杂多源查询。

    推荐理由:原文给出了具体准确率提升数据(最高34%)和新的 Sufficient Context Agent 机制,读者可以据此判断这个新产品在企业知识管理场景中的实际价值。

5月28日周四
  1. Mistral AI77

    Mistral AI 推出 Search Toolkit 公开预览版

    Mistral AI 发布了 Search Toolkit 公开预览版,这是一个用于构建 AI 应用生产搜索管道的可组合框架。该工具将数据摄入、检索和评估整合到单一框架中,支持 BM25 稀疏检索、密集向量检索和混合检索配置,内置 recall、precision、MRR、NDCG 等评估指标,开源且可在云端、本地或边缘运行。

    推荐理由:它将数据摄入、检索和评估整合到一个框架中,帮助团队把时间从集成维护转向搜索质量提升。

5月19日周二
5月16日周六
  1. Google DeepMind39

    Calico Life Sciences 如何用 Co-Scientist 开辟衰老研究新路径

    Calico Life Sciences 的 AI/ML 负责人 Matt Onsum 和首席科学家 Katherine Labbé使用 Co-Scientist 连接分散的衰老生物学发现,将其转化为可检验的假设。Co-Scientist 帮助生成了关于整合应激反应(ISR)如何被代谢调控的假设,实验产生了对 ISR 在健康与疾病中作用具有重要意义的新发现,团队计划发表结果。

  2. Google DeepMind48

    Co-Scientist 如何加速发现 MASH 肝病机制

    Google DeepMind 的 Co-Scientist 工具帮助 Edinburgh 大学 Filippo Menolascina 团队研究代谢相关脂肪性肝炎(MASH)。该系统生成假设,识别出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,解释了为何获批药物 resmetirom 仅对部分患者有效。该假设已被后续实验验证,有望推动双靶点疗法开发。

4月9日周四
  1. Google Research40

    ConvApparel:衡量并缩小用户模拟器中的真实感差距

    Google Research推出ConvApparel数据集,包含超4000段人类-AI多轮对话(共近15000轮),在服装购物领域采用双智能体协议收集数据。该数据集通过人口级统计对齐、人类相似度评分、反事实验证三种评估维度,衡量当前LLM用户模拟器与真实人类行为的显著差距,为构建更可信的AI测试工具提供路径。