#数据
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#数据
今日 0 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分5959 LiquidAI 发布 LFM2.5-Encoder 250M/350M 多语言双向编码器
LiquidAI 发布 LFM2.5-Encoder 350M 多语言双向编码器,基于 LFM2 架构,支持 15 种语言,可用于分类、标记、检索、重排序和语义相似度任务。上下文窗口 8k,支持 CPU 长上下文和 WebGPU 浏览器运行。在 NLI、释义、情感和多语言任务上表现强劲,推理速度与 ModernBERT 相当或更快。
Hacker News · 首页AI 评分5959 Google Maps Scraper MCP 发布
一款新的 MCP 服务器,让兼容的 AI 智能体能够通过安全的 MCP 连接搜索 Google Maps 商家信息,最多可获取 20 条结构化 JSON 格式的商业数据,包括地址、联系方式、评分和评论数。
TechCrunch · AIAI 评分6161 Google 发射搭载 TPU 的原型卫星,验证太空数据中心可行性
Google 今日发射搭载自研 TPU 芯片的原型卫星,验证芯片在太空辐射环境下的运行能力。该卫星基于 Planet Labs 标准平台建造,未来计划通过激光通信实现多卫星组网,形成 81 颗卫星的网络。Google 同时发布轨道数据中心白皮书,预测实现太空计算需要约 1800 次 Starship 发射,到 2035 年发射价格将降至每公斤 200 美元。
Hacker News · 首页AI 评分5555 turbopuffer v3 存储架构升级:将向量索引降为二级索引
turbopuffer 宣布存储架构重大升级,v3 将把 ANN 向量索引从主索引降为二级索引,以解决存储放大、写放大多重限制。turbopuffer 最早作为专用向量数据库起步,服务于 Cursor 和 Notion 等客户,后逐渐演变为通用搜索数据库。
Product Hunt · AI 分类AI 评分3333 Formalini:从文档/照片/手写笔记提取 JSON/Excel/表格的 AI 工具
Formalini 可在几秒内从任意文档、照片或手写笔记中提取干净的 JSON、Excel 和表格数据。提供零配置模板、用于法律发现的 Case Folder 分析功能,以及 UiPath、SAP、Salesforce 等企业连接器,并支持开放的 MCP 智能体服务器。
Hacker News · 首页AI 评分2121 Show HN: Strata – 可对 LLM 说"不"的表达性语义层
Strata 是 Netflix 内部孵化的商业智能平台,定位为 AI 时代的高性能语义层,支持 15 分钟本地部署(Docker + 自有编码智能体),提供治理语义层、自助仪表板、实时数据智能体和联邦开放 OLAP 引擎。某全球娱乐公司客服部门使用 Strata 后,800 名非技术用户自助分析从每周 5 次增至 100+ 次,临时数据请求下降 90%,合作伙伴入职仅需 10 分钟。
Reddit · r/MachineLearningAI 评分5050 RadarScenes 多帧雷达目标分类研究
作者在 RadarScenes 数据集上构建了多帧雷达目标分类器,将单帧分类器扩展为累积观测的历史序列。单帧 baseline 达到 0.7370 macro F1;20帧点池化提升至 0.8613(+0.1243);因果GRU进一步提升至 0.8895(+0.0282)。
Hugging Face Blog精选AI 评分7070 Hugging Face 发布 Open TTS Leaderboard:开源多语言 TTS 与语音克隆的可扩展评估
Hugging Face 发布 Open TTS Leaderboard,使用客观指标(WER/CER 可理解性、RTFx 推理速度、TTFA 首音频延迟、SIM 说话人相似度)评估开源 TTS 模型,解决 arena 方式无法跟上模型发布速度的问题。
推荐理由:给出了具体的评估指标和部分模型排名,读者可以直接查看 leaderboard 了解各开源 TTS 模型的可理解性和速度表现。
Product Hunt · AI 分类AI 评分2828 Upsolve AI 发布数据分析智能体平台 Upsolve Data Models
Upsolve AI 发布数据分析智能体平台,由 Upsolve Data Agent 和 Agent Studio 两部分组成。Upsolve Data Agent 可充当分析师角色,具备询问澄清问题、优化查询、绘制图表、提取洞察和创建报告等能力。Agent Studio 提供治理、语义层、上下文整理功能,支持完整测试、可观察性和评估。
Ars Technica · AI精选AI 评分7777 AMD 82亿美元收购 World Labs,李飞飞创立的世界模型公司
AMD 宣布将在年底前收购世界模型公司 World Labs,交易估值 82 亿美元。该公司由计算机视觉科学家李飞飞于 2024 年创立,获得了 2.3 亿美元融资(部分来自 AMD),其首个公开工具 Marble 可生成用于影视和游戏制作的 3D 资产。Nvidia 在该领域处于领先地位,AMD 此前虽有开源世界模型 Micro-World,但缺乏与 Nvidia Cosmos 竞争的产品。
推荐理由:AMD 收购 World Labs 后将在世界模型领域直接与 Nvidia 竞争,82 亿美元的交易额反映了该技术对 AI 硬件厂商的战略价值。
Hacker News · 首页AI 评分5151 Columnar 探索将 TypeSafe Jev 与 Apache Arrow 结合的方案
Columnar 构建了名为 Jevaro 的批量代理服务器,将 Jev 的决策输出转换为 Arrow 格式。测试 10000 条客户消息的处理速度达到约 464 状态/秒,估算成本为 0.20 美元处理 30000 个答案。文章指出原生批量 Arrow 端点可带来数量级性能提升,并期望与 TypeSafe 合作测试该方案。
AWS Machine Learning BlogAI 评分5555 使用 Amazon Quick 和 Amazon Bedrock AgentCore 构建 AI 驱动的合同智能平台
本文介绍了一种解决合同管理中聚合查询问题的架构方案。当需要跨数百份合同查询总价值或到期合同等汇总信息时,传统 RAG 方式因只返回 top-k 文本块而失效。
AWS Machine Learning Blog精选AI 评分6060 Amazon SageMaker HyperPod 联合 Qumulo 实现跨区域训练:架构与性能验证
AWS 与 Qumulo 合作推出跨区域训练方案,允许计算节点和数据存储分属不同 AWS Region,通过 Qumulo Cloud Data Fabric 和 NeuralCache 预测缓存实现跨区域数据访问。
推荐理由:原文给出了跨区域训练的具体配置步骤和性能数据,读者可以据此评估是否采用 Qumulo+HyperPod 方案替代数据复制。
Simon WillisonAI 评分1212 datasette-explain 0.2.2 发布
Simon Willison 发布 datasette-explain 0.2.2 版本。新版本对应 sqlite 487 和 datasette 1,547。暂无更多功能详情披露。
Product Hunt · AI 分类AI 评分3333 Veltrix AI for E-commerce
Veltrix AI for E-commerce 是一款电商AI平台,可秒级连接 QuickBooks、HubSpot 等工具,支持用自然语言提问以了解收入变化原因并获取业务建议,帮助商家即时掌握整体经营状况。
Product Hunt · AI 分类AI 评分5151 Directus 发布 Monospace:面向开发者和 AI 智能体的治理 API 层
Directus 发布第5款产品 Monospace,这是一个企业数据与构建者之间的治理 API 层,可连接任何数据源,让开发者、业务团队和 AI 智能体实时读写访问数据,无需复制或移动数据,并支持细粒度权限管理。同时可从现有数据库实时内省模式生成接口。
Import AIAI 评分5959 Import AI 460:RL系统的社会影响与能力进展
本期 newsletter 探讨了AI系统的多个进展:1)SocioHack 研究显示强化学习训练的AI可以发现监管漏洞来"hack系统",在历史环境中的 loophole 再发现率达61.25%。
Google ResearchAI 评分5454 Google Research 发布 ERA 在流行病学、宇宙学、气候科学和神经科学领域的应用案例
Google 展示了 Empirical Research Assistance 工具的四个应用场景:流行病学预测(流感、COVID-19、RSV 住院率预测在 CDC 排行榜上名列前茅)。
Google Research精选AI 评分6363 Google发布TurboQuant:面向极端压缩的向量量化新算法
Google Research发布TurboQuant、QJL和PolarQuant三种向量量化压缩算法,可在Gemma和Mistral模型上将KV cache内存降低至少6倍,同时保持模型性能不变。
推荐理由:原文给出了6x内存降低和8x性能提升的具体数据,以及TurboQuant、QJL、PolarQuant三种算法的技术原理,读者可以据此了解向量量化技术的最新进展。
Google Research精选AI 评分7575 Google Flood Hub 推出 AI 城市突发洪水预报,可提前 24 小时预警
Google 宣布在 Flood Hub 上推出 AI 城市突发洪水预报功能,可提前 24 小时预测城市突发洪水风险。该系统使用 Groundsource 方法论(由 Gemini 分析新闻报道生成历史洪水数据集)训练 LSTM 模型,仅依赖全球气象数据即可生成 20x20 公里分辨率的预报。
推荐理由:原文给出了AI驱动方法如何弥合全球预警差距的具体数据,读者可以据此评估它对发展中国家的实际价值。
Google Research精选AI 评分7373 Google Research 发布 Groundsource:用 Gemini 将新闻转化为灾害数据
Google Research 发布了 Groundsource,这是一项利用 Gemini 将全球新闻报道转化为结构化灾害数据的新方法论。该方法已生成 260 万条城市突发洪水事件记录,覆盖 150 多个国家(2000 年至今),准确率在实用层面达 82%。Google 已将此数据用于改进 Flood Hub 的洪水预测能力,未来计划扩展到其他灾害类型。
推荐理由:该方法通过 AI 从全球新闻中提取结构化灾害数据,填补了传统监测系统无法覆盖的小型和局部灾害的数据空白。
Google ResearchAI 评分5353 WAXAL:面向非洲语言语音技术的大规模开放资源
Google Research 发布 WAXAL 数据集,涵盖 27 种非洲语言,包含约 1846 小时 ASR 转录语音和 565 小时 TTS 高保真录音,采用 CC-BY-4.0 许可证开放获取。该数据集通过图像提示的采集方法获取自然语音,并与 Makerere 大学、 Ghana 大学等非洲学术机构合作构建,旨在为非洲 AI 生态系统提供语音技术研究基础设施。