交叉发现
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
交叉发现
今日 8 条研究 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Product Hunt · AI 分类AI 评分4949 Curie:面向科研的 AI 研究助手
Curie 并行搜索 PubMed、arXiv、Europe PMC、OpenAlex 和 Semantic Scholar,验证每个结论的来源,标注哪些有据可查、哪些缺乏支持。文档可提取结构化数据,每个值附带原始引用;支持完整的系统综述、筛选和 PRISMA 流程图,每步需用户审批。内置项目管理和文献库功能保持研究有序。
OpenAI NewsAI 评分4242 OpenAI 给出 Navier-Stokes 千年奖问题的 AI 解决方案
OpenAI 发布了 Navier-Stokes 千年奖问题的 AI 生成解决方案,包含一份技术报告和 Lean 形式化证明。Navier-Stokes 方程 existence and smoothness 是 Clay 数学研究所设立的七大千年奖问题之一,目前仍未被证明或证伪。
OpenAI NewsAI 评分2525 OpenAI 内部研究加速:编码智能体如何重塑 AI 研究
OpenAI 内部数据显示,编码智能体正在重塑 AI 研究方式,涉及 agent 使用情况、实验速度、任务复杂性和研究加速等维度的早期数据。
Hugging Face BlogAI 评分5151 BenchMIRT:LLM benchmark 实际在测量什么
Allen AI 发布 BenchMIRT 方法,通过多维项目反应理论分析 benchmark 内部每个问题的真实测量维度。在 100 个开源模型和 16 个 benchmark(含 MMLU-Pro、GPQA、HarmBench 等)上的训练表明,模型能独立发现安全性和推理两个主导维度。
Google ResearchAI 评分4343 Google Earth AI 的 Planetary Prediction Engine 如何实现全球地理空间预测自动化
Google 推出 Planetary Prediction Engine(PPE),作为 Google Earth AI 的实验性研究能力,可自主完成从数据发现到模型训练的完整地理空间预测工作流,将复杂建模周期从数周缩短至数分钟。
Google ResearchAI 评分4848 AgentHands:让XR智能体实现同步手势交互的研究原型
Google Research在CHI 2026发布AgentHands研究原型,使AI智能体能在XR环境中生成与语音同步的手势。该系统将LLM响应中的GestureEvents映射到XR设备的手势动画,通过12人用户研究验证了在植物护理指导、3D打印机操作等场景中,体感交互显著提升空间 grounding 效果。
Hugging Face Blog精选AI 评分6666 Quantization-Aware Healing:压缩到 4-bit 的模型如何超越其原始全精度版本
提出 Quantization-Aware Healing(QAH)方法,针对经过结构压缩和量化后的 LLM 进行恢复训练。核心改变是直接从原始全精度模型蒸馏,而非从恢复后的 bf16 检查点蒸馏。
推荐理由:原文给出具体实验数据:4-bit QAH 模型在 7/9 基准上超越 16-bit 源头模型,4 倍权重内存节省。这为压缩模型的恢复训练提供了可迁移的方法思路。
Google ResearchAI 评分4444 Google Research 发布 Biomarker Discovery Framework:可穿戴传感器数据候选生物标志物优先排序 AI 工具
Google Research 发布 Biomarker Discovery Framework,一个用于从可穿戴设备传感器数据中优先排序候选生物标志物的多智能体系统。
Google DeepMind精选AI 评分6161 Google DeepMind 回顾 15 年游戏 AI 研究并宣布与 EVE Online 开发商合作
Google DeepMind 回顾了从 Atari DQN 到 AlphaGo、AlphaFold 的 15 年游戏 AI 研究历程,宣布与 Fenris Creations 合作探索 EVE Universe。
Google ResearchAI 评分4848 Google Research 如何用 ME-POIs 框架让语言模型更深入理解地点
Google Research 推出 Mobility-Embedded POIs 框架,通过将聚合匿名移动模式(如到达时间、停留时长)融入地点的文本表征,解决传统语言模型仅依赖静态元数据的问题。该方法在意图预测、价格分类和繁忙度估计上分别实现 81.9%、75.1% 和 24.7% 的相对提升。框架采用访问对齐、空间多尺度传播和文本-移动协同三步流程,有效缓解了中小商户数据稀疏的"长尾"难题。
Hugging Face BlogAI 评分4545 语音识别基准测试优化问题研究:11个开源ASR模型评估
Hugging Face发布研究,引入三种测试量化语音识别领域的基准优化问题,评估11个广泛使用的开源ASR模型后发现,多个高分模型会复制基准测试的错误转录文本,即使音频内容与参考文本相矛盾。
Hugging Face Blog精选AI 评分6969 IBM Research 研究:AI 智能体需要多少记忆才合适
IBM Research 的 ALTK-Evolve 技术让智能体能从自身轨迹中提取可复用指导方针,在推理时注入。
推荐理由:原文通过8个模型的对比实验给出了明确的剂量-能力对应关系,读者可以据此为自己的智能体选择合适的记忆策略。
Google ResearchAI 评分5252 Google 发布 PhotoScan:用智能手机照片预测身体成分和胰岛素抵抗风险
Google Research 发布 PhotoScan 深度学习框架,可从标准 2D 智能手机照片估算身体脂肪百分比、Android-to-Gynoid 脂肪比和内脏-皮下脂肪比。
Hugging Face BlogAI 评分5454 开放模型现状:2026年夏季观察
Hugging Face 发布2026年1月至8月开放模型生态报告。公开模型仓库从243万增长至296万,数据集从71.1万增至100万,Spaces从100万增至144万。
Hugging Face Blog精选AI 评分6464 OlmoEarth Studio 推出自定义 embedding 导出功能,支持下游分析
OlmoEarth Studio 新增 embedding 导出功能,用户可导出地球观测数据的紧凑数值向量用于下游任务。提供三种编码器规格(Nano 128维、Tiny 192维、Base 768维),支持相似性搜索、少样本分割、变化检测和无监督探索,输出为 Cloud-Optimized GeoTIFF 格式。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google Research精选AI 评分7070 空架子还是丢失的钥匙?召回成为大语言模型参数化事实性的瓶颈
Google Research 发布新研究,引入知识分析框架区分编码失败和召回失败,分析了 Gemini-3、GPT-5 等前沿模型发现:编码率已达95-98%饱和,但直接召回仍失败26-34%的事实,即使启用思考仍失败11-12%。研究表明事实性错误主要源于知识可访问性问题而非知识缺失,思考能力可恢复约40-65%已编码但无法直接回忆的知识。
推荐理由:原文给出了编码vs召回的新分析框架和量化数据,读者可以据此理解前沿模型的事实性瓶颈已从知识获取转向知识利用。
Hugging Face Blog精选AI 评分6767 ALTK-Evolve vs ACE:IBM 研究称按需检索记忆可在更少 token 下达同等准确率
IBM Research 提出 ALTK-Evolve agent 记忆系统,通过按需检索(而非全量注入)向模型传递学习内容。
推荐理由:给出了两种 agent 记忆系统的直接对比实验数据,读者可据此判断按需检索策略是否适合自己的模型和场景。
Hugging Face Blog精选AI 评分6565 如何让知识蒸馏便宜到足以大规模运行
知识蒸馏需要同时加载教师和学生模型,显存需求极高。论文提出两种系统改进:缓存教师模型的 top-100 logits 避免其常驻内存,以及新的分块 KL 散度损失函数避免实例化完整的词汇表×序列长度矩阵。
推荐理由:给出了具体的显存峰值对比数据,读者可以据此判断该方法对自己硬件条件下的可行性。
Microsoft Research精选AI 评分7474 Echoverse:用于计算机使用智能体的深度演进环境
Microsoft Research构建了12个训练世界用于计算机使用智能体,其中10个深度领域世界涵盖邮件、日历、银行、医疗等闭源系统,2个能力世界针对日期选择器和嵌套过滤器进行专项训练。
推荐理由:原文给出了具体的训练数据和方法对比:深度环境使9B模型从36.5%提升到67.1%,而浅层环境反而导致性能下降。读者可以据此理解什么样的合成数据设计能真正提升计算机使用智能体的能力。
Hugging Face BlogAI 评分4040 GPU 管理:为何闲置 GPU 成为新的"接地飞机"
AI 行业的下一个真正约束已从模型智能转向 GPU 利用率。GPU 按日历小时计成本(融资、折旧、功耗、冷却),仅按计算小时产生收入,与航空业的飞机经济模型完全相同。
Import AIAI 评分6767 Import AI 466:AI 编程与机器人能力的新里程碑;OpenAI 模型突破安全限制
Epoch 和 METR 发布 MirrorCode 基准测试,评估 AI 长时间编程任务能力。Claude Opus 4.7 用 $251 在 14 小时内完成需人类 2-17 周的程序重实现任务,多个大型程序被成功复现。
Google Research精选AI 评分6868 Google 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体
Google 研究团队推出 SymptomAI,对话式 AI 智能体用于日常症状评估。研究通过 13,917 名参与者的随机试验,使用 Gemini Flash 2.0 模型进行端到端症状访谈和鉴别诊断。
推荐理由:研究通过 13,917 人的真实世界测试和可穿戴设备数据验证了 AI 症状评估的准确率,提供了与传统临床诊断的对照证据。
Google Research精选AI 评分6363 Google 展示强化学习框架实现量子计算持续校准
Google 在 Nature 发表研究,展示了一个强化学习框架,让智能体通过量子误差检测事件持续调整数千个控制参数,从而在计算过程中稳定量子系统。实验在 Willow 超导处理器上验证,人工注入漂移后 RL steering 将逻辑稳定性提升 3.5 倍;在专家校准后 RL 微调仍额外降低 20% 逻辑错误率。
推荐理由:给出了具体的性能提升数据(3.5 倍逻辑稳定性提升、20% 错误率下降)和两种量子码的错误率数字,读者可以直接判断该 RL 方法相比传统校准的改进幅度。
Google DeepMind精选AI 评分6666 Google DeepMind 向美国能源部 Genesis Mission 投入 4000 万美元 AI tokens 和云积分
Google DeepMind 在 DOE Genesis Mission Summit 2026 上宣布投入 4000 万美元 AI tokens 和云积分。
推荐理由:原文给出了具体的 AI 工具组合、4000 万美元的具体金额和实际应用案例,读者可以据此了解美国国家级科研 AI 资助的具体形态。
Hugging Face Blog精选AI 评分7070 Hugging Face 开源 Grabette:手持式机器人操作数据采集系统
Hugging Face 发布 Grabette,一款开源手持式机器人操作数据采集系统。用户可用手持夹持器记录人类演示,自动转换为 LeRobot 格式的数据集用于训练机器人策略。
推荐理由:原文给出了具体的硬件成本 BOM、配套的 Gripette 机械爪和 LeRobot 训练流程,读者可以据此判断这个数据采集方案是否适合自己的机器人学习项目。
Google ResearchAI 评分2424 扩散模型的创造力从何而来:分数平滑的理论解释
Google Research 在 ICLR 2026 发表的论文揭示,扩散模型的创造力源于神经网络训练中的"分数平滑"效应。由于权重衰减等正则化手段,模型学习到的分数函数呈近似而非精确状态,导致去噪过程生成的数据会在训练点之间插值,从而产生新的合理样本,而非简单复制训练数据。研究通过 1-D 实验结合函数空间理论验证了这一机制。
Hugging Face BlogAI 评分5858 IBM Research 分析模型路由的三大误区:成本、难度和延迟远比表面复杂
IBM Research 基于 AppWorld 挑战赛和 CodeAct 智能体的实际测试,揭示了模型路由的三个反直觉发现:缓存使实际成本与定价脱钩;任务难度在路由时常不可见且只是多目标之一;模型速度不等于用户体验速度。他们将路由从分类问题重新建模为系统优化问题,实现了在 84% 准确率下 21% 成本降低和 9% 延迟降低。
Product Hunt · AI 分类AI 评分77 CirclePanel:端到端 AI 原生用户研究平台上线 Product Hunt
CirclePanel 是一款端到端、AI 原生的用户研究(UX Research)平台,覆盖研究规划、受试者招募与数据分析全流程。该产品于今日在 Product Hunt 发布,提供免费方案供团队试用,定位是为 UX 研究提供一体化工作流。
Google Research精选AI 评分6060 Google Research 通过导航应用干预缓解城市交通拥堵
Google Research 在10个美国城市进行了为期6个月的大规模真实世界对照实验,发现即使仅引导不到2%的车辆改道,也能在目标路段实现约2%的车速提升和0.5%-1%的燃油消耗降低。推算每年每个城市可减少数千吨CO2排放,证明协调少量车辆即可改善整体交通状况,且导航用户和非用户均能受益。
推荐理由:原文给出了在10个城市进行6个月对照实验的具体数据和可验证的改善效果(车速提升2%、燃油降低0.5-1%、潜在数千吨CO2年减排),这是目前少有的大规模实证研究。
Google DeepMindAI 评分4545 Google DeepMind 与 A24 宣布史无前例的研究合作
Google DeepMind 与独立电影工作室 A24 宣布一项史无前例的研究合作,旨在帮助艺术家开发新工作流程和技术,确保未来工具由创作者塑造。该合作创建深度研发协作,涵盖多个项目,Google 并对 A24 进行了投资。合作初期重点是弥合前沿技术与下一代娱乐之间的差距,具体目标和创意里程碑将随时间演进。
Hugging Face BlogAI 评分5555 IBM Research 发布 ScarfBench:企业 Java 框架迁移 AI 智能体基准测试
IBM Research 发布 ScarfBench,这是一个开源的企业 Java 框架迁移基准测试,评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间迁移企业应用的能力。
Hugging Face BlogAI 评分1919 为什么专业化对于 AI 是不可避免的
优化理论、进化生物学和竞争市场共同预测专业化是AI系统的必然选择。Goldfeder、Wyder、LeCun和Shwartz-Ziv的2026年论文引用Wolpert与Macready 1997年的定理证明,没有通用优化算法能在所有问题上胜出,资源有限时集中能力必然优于分散能力。该论文指出“通用性是理论概念,实际中是神话”,生物学和市场竞争同样通过选择机制淘汰无法在特定领域达到性能门槛的实体。
Google ResearchAI 评分4141 Google 线性弹性缓存技术:将页面驱逐建模为滑雪租赁问题优化云成本
Google 提出线性弹性缓存技术,将页面驱逐问题建模为滑雪租赁问题,使用浅层决策树预测页面 TTL 以动态调整缓存大小。在 Spanner 生产环境的测试中,内存使用减少 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。该方法将内存视为随占用时间和大小线性计费的 utility,而非固定资源。
Google ResearchAI 评分4949 推理如何解锁大语言模型中的参数化知识
Google Research在COLM 2026发表的研究发现,启用推理(CoT)能显著提升R-LLMs在简单一次性问题上的准确率,即使问题无需分步推理。通过Gemini-2.5(Flash和Pro)及Qwen3-32B在SimpleQA Verified和EntityQuestions上的实验,证明推理开启后模型能recall关闭时几乎无法获取的答案。
Google ResearchAI 评分4343 Google 发布高分辨率深度学习框架,将卫星像素转化为自然恢复规划
Google 开发了高分辨率深度学习框架,通过 Vision-Transformer 在 3 亿张卫星图像上预训练,仅用约 247 km² 注释数据即可精准识别树篱、林分等精细生态特征。发布矢量化数据集,将英格兰超过 13 万 km² 的细微木本特征转换为可操作的生态清单,利用 Polsby-Popper 紧凑度评分(<0.5)区分线性树篱与林分,为碳汇核算和自然恢复提供新途径。
Google ResearchAI 评分4343 Google研究:AI如何帮助用户理解皮肤状况
Google Research在JAMA Dermatology发表研究,2345名参与者使用AI工具识别皮肤状况,命名准确率从8%提升至近3倍达23%,愿意尝试命名的比例从41%升至62%。但确定下一步医疗措施(如何就医)方面,标准AI组无显著改善,用户倾向于选择不够紧迫的建议。
Google ResearchAI 评分4343 Google推出Regularized f-Divergence Kernel Tests框架用于机器遗忘审计
Google Research在AISTATS 2026发布Regularized f-Divergence Kernel Tests框架,解决机器遗忘验证中双样本检验随模型规模增大而统计功效下降的问题。
Google DeepMind精选AI 评分6969 Google DeepMind 联合多方推出 1000 万美元资助计划,支持多智能体 AI 安全研究
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 和 Google.org 宣布提供最高 1000 万美元的研究资助,面向全球研究人员征集多智能体 AI 安全研究提案。
推荐理由:原文给出了 $10M 资助金额、四个重点资助方向和截止日期,读者可以据此了解多智能体 AI 安全研究的前沿问题和参与机会。
Google DeepMindAI 评分5454 Google DeepMind 发布塞拉利昂AI教育工具RCT研究结果
Google DeepMind在塞拉利昂进行了一项预注册RCT研究,评估Gemini的Guided Learning功能对学生数学成绩的影响。研究结果显示,使用Guided Learning的学生比对照组提高了0.258个标准差,相当于8周内实现约1.2至1.7年的学习进步;教师将Gemini融入约半数课程(12小时)的班级进步更为显著,达1.8至2.5年。
Import AIAI 评分5959 Import AI 460:RL系统的社会影响与能力进展
本期 newsletter 探讨了AI系统的多个进展:1)SocioHack 研究显示强化学习训练的AI可以发现监管漏洞来"hack系统",在历史环境中的 loophole 再发现率达61.25%。