跳到正文

#论文/研究

今日 1 条

一手 · 工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
8月12日周三
  1. Google Research68

    Google Research发布AMIE Video:迈向专家级视听临床咨询的AI系统

    Google Research发布AMIE (Video),基于Gemini和Project Astra构建,采用异步多智能体架构(Talker、Planner、Perception),能在实时视频咨询中感知非言语临床线索、指导虚拟体检并进行诊断推理。

    推荐理由:这是首个AI系统在实时视频临床咨询中达到专家级水平的演示,读者可以据此了解AI医疗助手的能力边界和当前局限。

  2. Microsoft Research67

    微软 CARE-X:结合辅助监督、对齐强化学习和工具增强测量的临床可用胸部 X 光视觉语言模型

    微软研究院发布 CARE-X,一个统一胸部 X 光 VLM,结合生成和判别能力,使用 DAPO 强化学习进行临床对齐优化,并配备辅助分类头和接地头提供校准概率和空间定位。

    推荐理由:强化学习与辅助监督的结合在医学影像 VLM 中展现了临床价值,工具增强测量在需要定量诊断的条件上提升了平均 F1 达 43.6 个百分点。

8月11日周二
8月10日周一
  1. Hugging Face Blog65

    如何让知识蒸馏便宜到足以大规模运行

    知识蒸馏需要同时加载教师和学生模型,显存需求极高。论文提出两种系统改进:缓存教师模型的 top-100 logits 避免其常驻内存,以及新的分块 KL 散度损失函数避免实例化完整的词汇表×序列长度矩阵。

    推荐理由:给出了具体的显存峰值对比数据,读者可以据此判断该方法对自己硬件条件下的可行性。

8月6日周四
  1. Google DeepMind68

    Google DeepMind 发布 WeatherNext:AI 模型实现气旋预报突破

    Google DeepMind 发布 WeatherNext AI 天气预测模型,在 Nature 期刊发表的论文显示该模型在预测气旋路径、强度和风结构方面达到最高精度,平均可提供额外一天的预警时间,相当于十年气象进步。

    推荐理由:原文给出了具体性能提升数据(一天额外预警时间)和实际应用案例(2025年飓风Melissa预报),读者可以据此判断该模型在天气预报领域的能力边界。

7月31日周五
  1. Google Research67

    Google Research 发布 Science One Framework:通过 Chain-of-Evidence 实现可验证的自主研究

    Google Research 发布 Science One Framework 及其 Chain-of-Evidence 框架,旨在解决 AI 生成的科研论文缺乏可验证性的问题。

    推荐理由:该研究提出了一个可验证的 AI 科研框架,针对当前自主研究系统的引用幻觉和代码-文本不对齐问题给出了系统性的解决方案,并已在多个基准上验证有效。

  2. Microsoft Research74

    Echoverse:用于计算机使用智能体的深度演进环境

    Microsoft Research构建了12个训练世界用于计算机使用智能体,其中10个深度领域世界涵盖邮件、日历、银行、医疗等闭源系统,2个能力世界针对日期选择器和嵌套过滤器进行专项训练。

    推荐理由:原文给出了具体的训练数据和方法对比:深度环境使9B模型从36.5%提升到67.1%,而浅层环境反而导致性能下降。读者可以据此理解什么样的合成数据设计能真正提升计算机使用智能体的能力。

7月30日周四
7月29日周三
  1. Berkeley AI Research65

    K-Search:如何将数十年CUDA内核优化经验迁移到Apple Silicon

    Berkeley和IBM研究团队将K-Search进化内核优化框架扩展支持MLX后端,开发了结构化的CUDA到MLX翻译层,将NVIDIA生态积累的CUDA优化知识迁移到Apple Silicon。实验在M1 Max 64GB上,Attention核达到原生MLX的0.97倍性能,Mamba SSM核预填充吞吐量达6751 tok/s,比社区mlx-lm实现快约20倍。

    推荐理由:原文展示了K-Search如何将NVIDIA生态积累的CUDA内核优化知识迁移到Apple Silicon,在Attention和Mamba SSM两个核上分别达到接近专家水平和20倍加速,为非NVIDIA硬件的核优化提供了可参考的方法论。

7月28日周二
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能控制

    Google DeepMind 发布 Gemini Robotics 2,推出了三个模型:高级 VLA 模型可控制完整人形机器人从脚到指尖的运动,实现灵巧操作如系扣子;ER 2 推理模型可处理多步骤任务并协调多机器人协作;On-Device 2 模型可在几小时内适应全新机器人形态。

    推荐理由:原文给出了三个模型的具体能力描述和可用入口,读者可以据此判断 Gemini Robotics 2 与前代及竞品的具体差异。

7月26日周日
  1. Berkeley AI Research60

    ABBEL:通过信念状态实现高效长程交互

    本文提出 ABBEL 框架,通过将交互历史压缩为自然语言信念状态来替代完整上下文,从而降低长程任务的计算成本。在协同编码任务 CollabBench 中,使用基于重建的信念评分(belief grading)可将性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 减少 57%。该方法在组合锁游戏和多目标问答任务中也展现了学习效率优势。

    推荐理由:给出了具体性能数据(性能差距缩小50%、训练步数减半、峰值token大幅降低),读者可以直接评估这个方法对长程交互任务的实际价值。

7月23日周四
  1. Google Research68

    Google 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体

    Google 研究团队推出 SymptomAI,对话式 AI 智能体用于日常症状评估。研究通过 13,917 名参与者的随机试验,使用 Gemini Flash 2.0 模型进行端到端症状访谈和鉴别诊断。

    推荐理由:研究通过 13,917 人的真实世界测试和可穿戴设备数据验证了 AI 症状评估的准确率,提供了与传统临床诊断的对照证据。

  2. Google Research63

    Google 展示强化学习框架实现量子计算持续校准

    Google 在 Nature 发表研究,展示了一个强化学习框架,让智能体通过量子误差检测事件持续调整数千个控制参数,从而在计算过程中稳定量子系统。实验在 Willow 超导处理器上验证,人工注入漂移后 RL steering 将逻辑稳定性提升 3.5 倍;在专家校准后 RL 微调仍额外降低 20% 逻辑错误率。

    推荐理由:给出了具体的性能提升数据(3.5 倍逻辑稳定性提升、20% 错误率下降)和两种量子码的错误率数字,读者可以直接判断该 RL 方法相比传统校准的改进幅度。

7月22日周三
7月16日周四
  1. Google Research24

    扩散模型的创造力从何而来:分数平滑的理论解释

    Google Research 在 ICLR 2026 发表的论文揭示,扩散模型的创造力源于神经网络训练中的"分数平滑"效应。由于权重衰减等正则化手段,模型学习到的分数函数呈近似而非精确状态,导致去噪过程生成的数据会在训练点之间插值,从而产生新的合理样本,而非简单复制训练数据。研究通过 1-D 实验结合函数空间理论验证了这一机制。

  2. Hugging Face Blog58

    IBM Research 分析模型路由的三大误区:成本、难度和延迟远比表面复杂

    IBM Research 基于 AppWorld 挑战赛和 CodeAct 智能体的实际测试,揭示了模型路由的三个反直觉发现:缓存使实际成本与定价脱钩;任务难度在路由时常不可见且只是多目标之一;模型速度不等于用户体验速度。他们将路由从分类问题重新建模为系统优化问题,实现了在 84% 准确率下 21% 成本降低和 9% 延迟降低。

7月15日周三
  1. Hugging Face Blog72

    Hugging Face 发布 Real World VoiceEQ:评估语音 AI 人类质量的新基准

    Hugging Face 发布 Real World VoiceEQ 基准,评估语音 AI 的人类交互质量。该基准基于超过 100 万个人类评分,涵盖 785,000 个 TTS 评分和 48,000 个 STS 评分,评估了 40+ 领先语音模型在 15+ 关键维度和 60+ 指标上的表现。

    推荐理由:原文给出了 40+ 模型在 15+ 维度和 60+ 指标上的具体评测发现,读者可据此了解当前语音 AI 的真实能力边界与主要短板。

7月9日周四
  1. Google Research62

    Google 发布 SensorFM:面向可穿戴健康数据的大型传感器基础模型

    Google Research 发布 SensorFM,一个在 5 百万人、超过 1 万亿分钟多模态传感器数据上预训练的大型基础模型。该模型通过自监督重建学习通用生理表征,在 35 项健康任务中 33 项超越监督基线,且无需任何任务特定架构。最大版本相比最小版本重构损失降低 31%,分类任务平均 AUC 提升 9%,回归任务 Pearson 系数提升 21%。

    推荐理由:原文给出了从2M到2B传感器小时、100K到100M参数的 Scaling 实验数据,读者可以据此判断规模对模型能力的实际影响。

7月8日周三
  1. Google Research60

    Google Research 通过导航应用干预缓解城市交通拥堵

    Google Research 在10个美国城市进行了为期6个月的大规模真实世界对照实验,发现即使仅引导不到2%的车辆改道,也能在目标路段实现约2%的车速提升和0.5%-1%的燃油消耗降低。推算每年每个城市可减少数千吨CO2排放,证明协调少量车辆即可改善整体交通状况,且导航用户和非用户均能受益。

    推荐理由:原文给出了在10个城市进行6个月对照实验的具体数据和可验证的改善效果(车速提升2%、燃油降低0.5-1%、潜在数千吨CO2年减排),这是目前少有的大规模实证研究。

7月3日周五
  1. Google DeepMind45

    Google DeepMind 与 A24 宣布史无前例的研究合作

    Google DeepMind 与独立电影工作室 A24 宣布一项史无前例的研究合作,旨在帮助艺术家开发新工作流程和技术,确保未来工具由创作者塑造。该合作创建深度研发协作,涵盖多个项目,Google 并对 A24 进行了投资。合作初期重点是弥合前沿技术与下一代娱乐之间的差距,具体目标和创意里程碑将随时间演进。

7月1日周三
6月30日周二
  1. Hugging Face Blog19

    为什么专业化对于 AI 是不可避免的

    优化理论、进化生物学和竞争市场共同预测专业化是AI系统的必然选择。Goldfeder、Wyder、LeCun和Shwartz-Ziv的2026年论文引用Wolpert与Macready 1997年的定理证明,没有通用优化算法能在所有问题上胜出,资源有限时集中能力必然优于分散能力。该论文指出“通用性是理论概念,实际中是神话”,生物学和市场竞争同样通过选择机制淘汰无法在特定领域达到性能门槛的实体。

  2. Google Research78

    Google 发布 TabFM:面向表格数据的零样本基础模型

    Google 发布 TabFM,一个面向表格数据分类和回归任务的基础模型。该模型将表格预测重新定义为上下文学习问题,通过混合注意力架构(交替行列注意力、行列压缩)在数百万人工合成数据集上训练,实现了真正的零样本预测——无需针对新数据集进行模型训练、超参数调优或特征工程。

    推荐理由:读者可通过本文了解 Google 如何将大语言模型的零样本能力迁移到结构化表格数据,理解其架构创新和实际可用性。

6月27日周六
  1. Google Research68

    Google 通过冻结多Token预测加速 Pixel 设备上的 Gemini Nano 模型

    Google 宣布将 Multi-Token Prediction (MTP) 架构应用于现有的冻结 Gemini Nano v3 模型,在 Pixel 9/10 系列上实现 50% 以上加速。

    推荐理由:原文给出了具体的技术架构细节、性能数据(50%+加速、130MB内存节省)和在 Pixel 设备上的实测效果,读者可以据此了解移动端推理优化的具体方法。

6月25日周四
  1. Google Research41

    Google 线性弹性缓存技术:将页面驱逐建模为滑雪租赁问题优化云成本

    Google 提出线性弹性缓存技术,将页面驱逐问题建模为滑雪租赁问题,使用浅层决策树预测页面 TTL 以动态调整缓存大小。在 Spanner 生产环境的测试中,内存使用减少 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。该方法将内存视为随占用时间和大小线性计费的 utility,而非固定资源。

  2. Google Research49

    推理如何解锁大语言模型中的参数化知识

    Google Research在COLM 2026发表的研究发现,启用推理(CoT)能显著提升R-LLMs在简单一次性问题上的准确率,即使问题无需分步推理。通过Gemini-2.5(Flash和Pro)及Qwen3-32B在SimpleQA Verified和EntityQuestions上的实验,证明推理开启后模型能recall关闭时几乎无法获取的答案。

6月17日周三
  1. Google Research43

    Google 发布高分辨率深度学习框架,将卫星像素转化为自然恢复规划

    Google 开发了高分辨率深度学习框架,通过 Vision-Transformer 在 3 亿张卫星图像上预训练,仅用约 247 km² 注释数据即可精准识别树篱、林分等精细生态特征。发布矢量化数据集,将英格兰超过 13 万 km² 的细微木本特征转换为可操作的生态清单,利用 Polsby-Popper 紧凑度评分(<0.5)区分线性树篱与林分,为碳汇核算和自然恢复提供新途径。

6月16日周二
  1. Google DeepMind64

    Google DeepMind 发布 AI Control Roadmap 应对 AI 智能体安全挑战

    Google DeepMind 发布 AI Control Roadmap 框架,为内部 AI 智能体提供传统模型对齐之外的额外安全层。该框架将不受信任的 AI 智能体视为潜在“内部威胁”,通过检测、预防和响应三层机制应对风险。研究团队已分析超过 100 万个编码智能体任务来验证框架,并同步发布面向政策制定者的《Three Layers of Agent Security》技术框架。

    推荐理由:原文给出了 AI 智能体安全的具体技术路径和实践数据,读者可据此理解如何为 AI 智能体构建超越传统对齐的系统级安全层。

6月13日周六
6月11日周四
6月8日周一
  1. Google DeepMind54

    Google DeepMind 发布塞拉利昂AI教育工具RCT研究结果

    Google DeepMind在塞拉利昂进行了一项预注册RCT研究,评估Gemini的Guided Learning功能对学生数学成绩的影响。研究结果显示,使用Guided Learning的学生比对照组提高了0.258个标准差,相当于8周内实现约1.2至1.7年的学习进步;教师将Gemini融入约半数课程(12小时)的班级进步更为显著,达1.8至2.5年。

6月5日周五
  1. Google Research67

    Google 发布 Gemini Enterprise Agent Platform 的 Agentic RAG 功能

    Google 推出 Gemini Enterprise Agent Platform 的 Agentic RAG 功能,采用多智能体架构(Orchestrator、Planner、Query Rewriter、Search Fanout)处理复杂多源查询。

    推荐理由:原文给出了具体准确率提升数据(最高34%)和新的 Sufficient Context Agent 机制,读者可以据此判断这个新产品在企业知识管理场景中的实际价值。

  2. Google Research71

    Google 发布 PHRM 系统:利用智能手机前置摄像头被动监测心率

    Google 在 Nature 发表研究,推出 PHRM 系统,利用前置摄像头在面部解锁后捕捉视频,通过深度学习估计心率,在 35 万视频片段、700 名参与者训练下,心率 MAPE<10%(所有肤色),静息心率 MAE<5bpm(对比 Fitbit),为首个在日常智能手机使用中实现被动心率监测的大规模研究。

    推荐理由:首次大规模验证了智能手机在日常使用中被动监测心率和静息心率的可行性,为无创心血管健康监测提供了可穿戴设备之外的普惠选择。

6月4日周四
  1. Google Research65

    Google 开源水文建模框架,助力各国气象水文部门提升洪水预报能力

    Google Research 开源了其水文建模框架,基于 LSTM 神经网络架构,使用气候、土壤、地形等地理特征和降雨、气温等气象预报数据来预测全球河流日流量。

    推荐理由:开源了完整的水文建模框架和预训练模型,研究人员和预报机构可直接下载使用或基于此进行本地化微调。

5月29日周五
  1. Google Research70

    Google Research 在 I/O 2026 展示多项研究进展:科学工具、医疗健康、边缘计算、天气预测等

    Google Research 在 I/O 2026 展示了多个研究进展。Gemini for Science 套件整合了 ERA(研究编码系统)和 Co-Scientist(多智能体系统),可辅助科学假设生成和计算实验。

    推荐理由:原文系统展示了Google在I/O 2026的多个研究进展,涵盖科学工具、医疗健康、边缘计算、天气预测等方向,读者可从中了解AI在科研和产业应用的前沿进展。

5月28日周四
  1. Google Research49

    Google 零信任聚合的私有分析技术

    Google推出新的私有分析服务,结合新型加密聚合协议与可信执行环境(TEE),实现单次消息安全提交,无需设备长时间在线多轮交互。该方案通过加密层确保原始数据在任何服务器内存中都不被暴露或重建,仅在聚合匿名化后才处理明文数据,并利用TEE提供可验证的完整性证明。目前已应用于Pixel Recorder和Gboard等场景。

5月27日周三