跳到正文

交叉发现

今日 8 条

研究 · 工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

research6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
9月10日周四
  1. Product Hunt · AI 分类49

    Curie:面向科研的 AI 研究助手

    Curie 并行搜索 PubMed、arXiv、Europe PMC、OpenAlex 和 Semantic Scholar,验证每个结论的来源,标注哪些有据可查、哪些缺乏支持。文档可提取结构化数据,每个值附带原始引用;支持完整的系统综述、筛选和 PRISMA 流程图,每步需用户审批。内置项目管理和文献库功能保持研究有序。

9月8日周二
9月6日周日
9月2日周三
  1. Hugging Face Blog51

    BenchMIRT:LLM benchmark 实际在测量什么

    Allen AI 发布 BenchMIRT 方法,通过多维项目反应理论分析 benchmark 内部每个问题的真实测量维度。在 100 个开源模型和 16 个 benchmark(含 MMLU-Pro、GPQA、HarmBench 等)上的训练表明,模型能独立发现安全性和推理两个主导维度。

8月28日周五
8月26日周三
8月25日周二
  1. Hugging Face Blog66

    Quantization-Aware Healing:压缩到 4-bit 的模型如何超越其原始全精度版本

    提出 Quantization-Aware Healing(QAH)方法,针对经过结构压缩和量化后的 LLM 进行恢复训练。核心改变是直接从原始全精度模型蒸馏,而非从恢复后的 bf16 检查点蒸馏。

    推荐理由:原文给出具体实验数据:4-bit QAH 模型在 7/9 基准上超越 16-bit 源头模型,4 倍权重内存节省。这为压缩模型的恢复训练提供了可迁移的方法思路。

8月22日周六
8月21日周五
  1. Google Research48

    Google Research 如何用 ME-POIs 框架让语言模型更深入理解地点

    Google Research 推出 Mobility-Embedded POIs 框架,通过将聚合匿名移动模式(如到达时间、停留时长)融入地点的文本表征,解决传统语言模型仅依赖静态元数据的问题。该方法在意图预测、价格分类和繁忙度估计上分别实现 81.9%、75.1% 和 24.7% 的相对提升。框架采用访问对齐、空间多尺度传播和文本-移动协同三步流程,有效缓解了中小商户数据稀疏的"长尾"难题。

8月19日周三
8月17日周一
8月14日周五
8月13日周四
  1. Hugging Face Blog64

    OlmoEarth Studio 推出自定义 embedding 导出功能,支持下游分析

    OlmoEarth Studio 新增 embedding 导出功能,用户可导出地球观测数据的紧凑数值向量用于下游任务。提供三种编码器规格(Nano 128维、Tiny 192维、Base 768维),支持相似性搜索、少样本分割、变化检测和无监督探索,输出为 Cloud-Optimized GeoTIFF 格式。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

8月12日周三
  1. Google Research70

    空架子还是丢失的钥匙?召回成为大语言模型参数化事实性的瓶颈

    Google Research 发布新研究,引入知识分析框架区分编码失败和召回失败,分析了 Gemini-3、GPT-5 等前沿模型发现:编码率已达95-98%饱和,但直接召回仍失败26-34%的事实,即使启用思考仍失败11-12%。研究表明事实性错误主要源于知识可访问性问题而非知识缺失,思考能力可恢复约40-65%已编码但无法直接回忆的知识。

    推荐理由:原文给出了编码vs召回的新分析框架和量化数据,读者可以据此理解前沿模型的事实性瓶颈已从知识获取转向知识利用。

8月11日周二
8月10日周一
  1. Hugging Face Blog65

    如何让知识蒸馏便宜到足以大规模运行

    知识蒸馏需要同时加载教师和学生模型,显存需求极高。论文提出两种系统改进:缓存教师模型的 top-100 logits 避免其常驻内存,以及新的分块 KL 散度损失函数避免实例化完整的词汇表×序列长度矩阵。

    推荐理由:给出了具体的显存峰值对比数据,读者可以据此判断该方法对自己硬件条件下的可行性。

7月31日周五
  1. Microsoft Research74

    Echoverse:用于计算机使用智能体的深度演进环境

    Microsoft Research构建了12个训练世界用于计算机使用智能体,其中10个深度领域世界涵盖邮件、日历、银行、医疗等闭源系统,2个能力世界针对日期选择器和嵌套过滤器进行专项训练。

    推荐理由:原文给出了具体的训练数据和方法对比:深度环境使9B模型从36.5%提升到67.1%,而浅层环境反而导致性能下降。读者可以据此理解什么样的合成数据设计能真正提升计算机使用智能体的能力。

7月30日周四
7月27日周一
7月23日周四
  1. Google Research68

    Google 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体

    Google 研究团队推出 SymptomAI,对话式 AI 智能体用于日常症状评估。研究通过 13,917 名参与者的随机试验,使用 Gemini Flash 2.0 模型进行端到端症状访谈和鉴别诊断。

    推荐理由:研究通过 13,917 人的真实世界测试和可穿戴设备数据验证了 AI 症状评估的准确率,提供了与传统临床诊断的对照证据。

  2. Google Research63

    Google 展示强化学习框架实现量子计算持续校准

    Google 在 Nature 发表研究,展示了一个强化学习框架,让智能体通过量子误差检测事件持续调整数千个控制参数,从而在计算过程中稳定量子系统。实验在 Willow 超导处理器上验证,人工注入漂移后 RL steering 将逻辑稳定性提升 3.5 倍;在专家校准后 RL 微调仍额外降低 20% 逻辑错误率。

    推荐理由:给出了具体的性能提升数据(3.5 倍逻辑稳定性提升、20% 错误率下降)和两种量子码的错误率数字,读者可以直接判断该 RL 方法相比传统校准的改进幅度。

7月22日周三
7月21日周二
  1. Hugging Face Blog70

    Hugging Face 开源 Grabette:手持式机器人操作数据采集系统

    Hugging Face 发布 Grabette,一款开源手持式机器人操作数据采集系统。用户可用手持夹持器记录人类演示,自动转换为 LeRobot 格式的数据集用于训练机器人策略。

    推荐理由:原文给出了具体的硬件成本 BOM、配套的 Gripette 机械爪和 LeRobot 训练流程,读者可以据此判断这个数据采集方案是否适合自己的机器人学习项目。

7月16日周四
  1. Google Research24

    扩散模型的创造力从何而来:分数平滑的理论解释

    Google Research 在 ICLR 2026 发表的论文揭示,扩散模型的创造力源于神经网络训练中的"分数平滑"效应。由于权重衰减等正则化手段,模型学习到的分数函数呈近似而非精确状态,导致去噪过程生成的数据会在训练点之间插值,从而产生新的合理样本,而非简单复制训练数据。研究通过 1-D 实验结合函数空间理论验证了这一机制。

  2. Hugging Face Blog58

    IBM Research 分析模型路由的三大误区:成本、难度和延迟远比表面复杂

    IBM Research 基于 AppWorld 挑战赛和 CodeAct 智能体的实际测试,揭示了模型路由的三个反直觉发现:缓存使实际成本与定价脱钩;任务难度在路由时常不可见且只是多目标之一;模型速度不等于用户体验速度。他们将路由从分类问题重新建模为系统优化问题,实现了在 84% 准确率下 21% 成本降低和 9% 延迟降低。

7月14日周二
7月8日周三
  1. Google Research60

    Google Research 通过导航应用干预缓解城市交通拥堵

    Google Research 在10个美国城市进行了为期6个月的大规模真实世界对照实验,发现即使仅引导不到2%的车辆改道,也能在目标路段实现约2%的车速提升和0.5%-1%的燃油消耗降低。推算每年每个城市可减少数千吨CO2排放,证明协调少量车辆即可改善整体交通状况,且导航用户和非用户均能受益。

    推荐理由:原文给出了在10个城市进行6个月对照实验的具体数据和可验证的改善效果(车速提升2%、燃油降低0.5-1%、潜在数千吨CO2年减排),这是目前少有的大规模实证研究。

7月3日周五
  1. Google DeepMind45

    Google DeepMind 与 A24 宣布史无前例的研究合作

    Google DeepMind 与独立电影工作室 A24 宣布一项史无前例的研究合作,旨在帮助艺术家开发新工作流程和技术,确保未来工具由创作者塑造。该合作创建深度研发协作,涵盖多个项目,Google 并对 A24 进行了投资。合作初期重点是弥合前沿技术与下一代娱乐之间的差距,具体目标和创意里程碑将随时间演进。

7月1日周三
6月30日周二
  1. Hugging Face Blog19

    为什么专业化对于 AI 是不可避免的

    优化理论、进化生物学和竞争市场共同预测专业化是AI系统的必然选择。Goldfeder、Wyder、LeCun和Shwartz-Ziv的2026年论文引用Wolpert与Macready 1997年的定理证明,没有通用优化算法能在所有问题上胜出,资源有限时集中能力必然优于分散能力。该论文指出“通用性是理论概念,实际中是神话”,生物学和市场竞争同样通过选择机制淘汰无法在特定领域达到性能门槛的实体。

6月25日周四
  1. Google Research41

    Google 线性弹性缓存技术:将页面驱逐建模为滑雪租赁问题优化云成本

    Google 提出线性弹性缓存技术,将页面驱逐问题建模为滑雪租赁问题,使用浅层决策树预测页面 TTL 以动态调整缓存大小。在 Spanner 生产环境的测试中,内存使用减少 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。该方法将内存视为随占用时间和大小线性计费的 utility,而非固定资源。

  2. Google Research49

    推理如何解锁大语言模型中的参数化知识

    Google Research在COLM 2026发表的研究发现,启用推理(CoT)能显著提升R-LLMs在简单一次性问题上的准确率,即使问题无需分步推理。通过Gemini-2.5(Flash和Pro)及Qwen3-32B在SimpleQA Verified和EntityQuestions上的实验,证明推理开启后模型能recall关闭时几乎无法获取的答案。

6月17日周三
  1. Google Research43

    Google 发布高分辨率深度学习框架,将卫星像素转化为自然恢复规划

    Google 开发了高分辨率深度学习框架,通过 Vision-Transformer 在 3 亿张卫星图像上预训练,仅用约 247 km² 注释数据即可精准识别树篱、林分等精细生态特征。发布矢量化数据集,将英格兰超过 13 万 km² 的细微木本特征转换为可操作的生态清单,利用 Polsby-Popper 紧凑度评分(<0.5)区分线性树篱与林分,为碳汇核算和自然恢复提供新途径。

6月13日周六
6月11日周四
6月10日周三
  1. Google DeepMind69

    Google DeepMind 联合多方推出 1000 万美元资助计划,支持多智能体 AI 安全研究

    Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 和 Google.org 宣布提供最高 1000 万美元的研究资助,面向全球研究人员征集多智能体 AI 安全研究提案。

    推荐理由:原文给出了 $10M 资助金额、四个重点资助方向和截止日期,读者可以据此了解多智能体 AI 安全研究的前沿问题和参与机会。

6月8日周一
  1. Google DeepMind54

    Google DeepMind 发布塞拉利昂AI教育工具RCT研究结果

    Google DeepMind在塞拉利昂进行了一项预注册RCT研究,评估Gemini的Guided Learning功能对学生数学成绩的影响。研究结果显示,使用Guided Learning的学生比对照组提高了0.258个标准差,相当于8周内实现约1.2至1.7年的学习进步;教师将Gemini融入约半数课程(12小时)的班级进步更为显著,达1.8至2.5年。