跳到正文

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

最新精选

第 21–40 条 · 共 55 条
8月12日周三
  1. Google Research70

    空架子还是丢失的钥匙?召回成为大语言模型参数化事实性的瓶颈

    Google Research 发布新研究,引入知识分析框架区分编码失败和召回失败,分析了 Gemini-3、GPT-5 等前沿模型发现:编码率已达95-98%饱和,但直接召回仍失败26-34%的事实,即使启用思考仍失败11-12%。研究表明事实性错误主要源于知识可访问性问题而非知识缺失,思考能力可恢复约40-65%已编码但无法直接回忆的知识。

    推荐理由:原文给出了编码vs召回的新分析框架和量化数据,读者可以据此理解前沿模型的事实性瓶颈已从知识获取转向知识利用。

  2. Google Research68

    Google Research发布AMIE Video:迈向专家级视听临床咨询的AI系统

    Google Research发布AMIE (Video),基于Gemini和Project Astra构建,采用异步多智能体架构(Talker、Planner、Perception),能在实时视频咨询中感知非言语临床线索、指导虚拟体检并进行诊断推理。

    推荐理由:这是首个AI系统在实时视频临床咨询中达到专家级水平的演示,读者可以据此了解AI医疗助手的能力边界和当前局限。

  3. Microsoft Research67

    微软 CARE-X:结合辅助监督、对齐强化学习和工具增强测量的临床可用胸部 X 光视觉语言模型

    微软研究院发布 CARE-X,一个统一胸部 X 光 VLM,结合生成和判别能力,使用 DAPO 强化学习进行临床对齐优化,并配备辅助分类头和接地头提供校准概率和空间定位。

    推荐理由:强化学习与辅助监督的结合在医学影像 VLM 中展现了临床价值,工具增强测量在需要定量诊断的条件上提升了平均 F1 达 43.6 个百分点。

8月11日周二
8月10日周一
  1. Hugging Face Blog65

    如何让知识蒸馏便宜到足以大规模运行

    知识蒸馏需要同时加载教师和学生模型,显存需求极高。论文提出两种系统改进:缓存教师模型的 top-100 logits 避免其常驻内存,以及新的分块 KL 散度损失函数避免实例化完整的词汇表×序列长度矩阵。

    推荐理由:给出了具体的显存峰值对比数据,读者可以据此判断该方法对自己硬件条件下的可行性。

8月6日周四
  1. Google DeepMind68

    Google DeepMind 发布 WeatherNext:AI 模型实现气旋预报突破

    Google DeepMind 发布 WeatherNext AI 天气预测模型,在 Nature 期刊发表的论文显示该模型在预测气旋路径、强度和风结构方面达到最高精度,平均可提供额外一天的预警时间,相当于十年气象进步。

    推荐理由:原文给出了具体性能提升数据(一天额外预警时间)和实际应用案例(2025年飓风Melissa预报),读者可以据此判断该模型在天气预报领域的能力边界。

7月31日周五
  1. Google Research67

    Google Research 发布 Science One Framework:通过 Chain-of-Evidence 实现可验证的自主研究

    Google Research 发布 Science One Framework 及其 Chain-of-Evidence 框架,旨在解决 AI 生成的科研论文缺乏可验证性的问题。

    推荐理由:该研究提出了一个可验证的 AI 科研框架,针对当前自主研究系统的引用幻觉和代码-文本不对齐问题给出了系统性的解决方案,并已在多个基准上验证有效。

  2. Microsoft Research74

    Echoverse:用于计算机使用智能体的深度演进环境

    Microsoft Research构建了12个训练世界用于计算机使用智能体,其中10个深度领域世界涵盖邮件、日历、银行、医疗等闭源系统,2个能力世界针对日期选择器和嵌套过滤器进行专项训练。

    推荐理由:原文给出了具体的训练数据和方法对比:深度环境使9B模型从36.5%提升到67.1%,而浅层环境反而导致性能下降。读者可以据此理解什么样的合成数据设计能真正提升计算机使用智能体的能力。

7月29日周三
  1. Berkeley AI Research65

    K-Search:如何将数十年CUDA内核优化经验迁移到Apple Silicon

    Berkeley和IBM研究团队将K-Search进化内核优化框架扩展支持MLX后端,开发了结构化的CUDA到MLX翻译层,将NVIDIA生态积累的CUDA优化知识迁移到Apple Silicon。实验在M1 Max 64GB上,Attention核达到原生MLX的0.97倍性能,Mamba SSM核预填充吞吐量达6751 tok/s,比社区mlx-lm实现快约20倍。

    推荐理由:原文展示了K-Search如何将NVIDIA生态积累的CUDA内核优化知识迁移到Apple Silicon,在Attention和Mamba SSM两个核上分别达到接近专家水平和20倍加速,为非NVIDIA硬件的核优化提供了可参考的方法论。

7月28日周二
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能控制

    Google DeepMind 发布 Gemini Robotics 2,推出了三个模型:高级 VLA 模型可控制完整人形机器人从脚到指尖的运动,实现灵巧操作如系扣子;ER 2 推理模型可处理多步骤任务并协调多机器人协作;On-Device 2 模型可在几小时内适应全新机器人形态。

    推荐理由:原文给出了三个模型的具体能力描述和可用入口,读者可以据此判断 Gemini Robotics 2 与前代及竞品的具体差异。

7月26日周日
  1. Berkeley AI Research60

    ABBEL:通过信念状态实现高效长程交互

    本文提出 ABBEL 框架,通过将交互历史压缩为自然语言信念状态来替代完整上下文,从而降低长程任务的计算成本。在协同编码任务 CollabBench 中,使用基于重建的信念评分(belief grading)可将性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 减少 57%。该方法在组合锁游戏和多目标问答任务中也展现了学习效率优势。

    推荐理由:给出了具体性能数据(性能差距缩小50%、训练步数减半、峰值token大幅降低),读者可以直接评估这个方法对长程交互任务的实际价值。

7月23日周四
  1. Google Research68

    Google 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体

    Google 研究团队推出 SymptomAI,对话式 AI 智能体用于日常症状评估。研究通过 13,917 名参与者的随机试验,使用 Gemini Flash 2.0 模型进行端到端症状访谈和鉴别诊断。

    推荐理由:研究通过 13,917 人的真实世界测试和可穿戴设备数据验证了 AI 症状评估的准确率,提供了与传统临床诊断的对照证据。

  2. Google Research63

    Google 展示强化学习框架实现量子计算持续校准

    Google 在 Nature 发表研究,展示了一个强化学习框架,让智能体通过量子误差检测事件持续调整数千个控制参数,从而在计算过程中稳定量子系统。实验在 Willow 超导处理器上验证,人工注入漂移后 RL steering 将逻辑稳定性提升 3.5 倍;在专家校准后 RL 微调仍额外降低 20% 逻辑错误率。

    推荐理由:给出了具体的性能提升数据(3.5 倍逻辑稳定性提升、20% 错误率下降)和两种量子码的错误率数字,读者可以直接判断该 RL 方法相比传统校准的改进幅度。

7月22日周三
7月15日周三
  1. Hugging Face Blog72

    Hugging Face 发布 Real World VoiceEQ:评估语音 AI 人类质量的新基准

    Hugging Face 发布 Real World VoiceEQ 基准,评估语音 AI 的人类交互质量。该基准基于超过 100 万个人类评分,涵盖 785,000 个 TTS 评分和 48,000 个 STS 评分,评估了 40+ 领先语音模型在 15+ 关键维度和 60+ 指标上的表现。

    推荐理由:原文给出了 40+ 模型在 15+ 维度和 60+ 指标上的具体评测发现,读者可据此了解当前语音 AI 的真实能力边界与主要短板。

7月9日周四
  1. Google Research62

    Google 发布 SensorFM:面向可穿戴健康数据的大型传感器基础模型

    Google Research 发布 SensorFM,一个在 5 百万人、超过 1 万亿分钟多模态传感器数据上预训练的大型基础模型。该模型通过自监督重建学习通用生理表征,在 35 项健康任务中 33 项超越监督基线,且无需任何任务特定架构。最大版本相比最小版本重构损失降低 31%,分类任务平均 AUC 提升 9%,回归任务 Pearson 系数提升 21%。

    推荐理由:原文给出了从2M到2B传感器小时、100K到100M参数的 Scaling 实验数据,读者可以据此判断规模对模型能力的实际影响。

7月8日周三
  1. Google Research60

    Google Research 通过导航应用干预缓解城市交通拥堵

    Google Research 在10个美国城市进行了为期6个月的大规模真实世界对照实验,发现即使仅引导不到2%的车辆改道,也能在目标路段实现约2%的车速提升和0.5%-1%的燃油消耗降低。推算每年每个城市可减少数千吨CO2排放,证明协调少量车辆即可改善整体交通状况,且导航用户和非用户均能受益。

    推荐理由:原文给出了在10个城市进行6个月对照实验的具体数据和可验证的改善效果(车速提升2%、燃油降低0.5-1%、潜在数千吨CO2年减排),这是目前少有的大规模实证研究。

6月30日周二
  1. Google Research78

    Google 发布 TabFM:面向表格数据的零样本基础模型

    Google 发布 TabFM,一个面向表格数据分类和回归任务的基础模型。该模型将表格预测重新定义为上下文学习问题,通过混合注意力架构(交替行列注意力、行列压缩)在数百万人工合成数据集上训练,实现了真正的零样本预测——无需针对新数据集进行模型训练、超参数调优或特征工程。

    推荐理由:读者可通过本文了解 Google 如何将大语言模型的零样本能力迁移到结构化表格数据,理解其架构创新和实际可用性。

6月27日周六
  1. Google Research68

    Google 通过冻结多Token预测加速 Pixel 设备上的 Gemini Nano 模型

    Google 宣布将 Multi-Token Prediction (MTP) 架构应用于现有的冻结 Gemini Nano v3 模型,在 Pixel 9/10 系列上实现 50% 以上加速。

    推荐理由:原文给出了具体的技术架构细节、性能数据(50%+加速、130MB内存节省)和在 Pixel 设备上的实测效果,读者可以据此了解移动端推理优化的具体方法。

6月16日周二
  1. Google DeepMind64

    Google DeepMind 发布 AI Control Roadmap 应对 AI 智能体安全挑战

    Google DeepMind 发布 AI Control Roadmap 框架,为内部 AI 智能体提供传统模型对齐之外的额外安全层。该框架将不受信任的 AI 智能体视为潜在“内部威胁”,通过检测、预防和响应三层机制应对风险。研究团队已分析超过 100 万个编码智能体任务来验证框架,并同步发布面向政策制定者的《Three Layers of Agent Security》技术框架。

    推荐理由:原文给出了 AI 智能体安全的具体技术路径和实践数据,读者可据此理解如何为 AI 智能体构建超越传统对齐的系统级安全层。