跳到正文
原文
Berkeley AI Research·· 2025-11-01AI 评分49

强化学习新范式:分而治之算法如何突破长程任务扩展性难题

RL without TD learning

AI 导读

本文提出一种基于“分而治之”的强化学习新算法,突破传统时序差分(TD)学习的扩展性瓶颈。该方法将轨迹划分为等长段落并组合其值来更新完整轨迹值,理论上可将Bellman递归次数从线性降至对数级别,且无需手动调优n步超参数。研究团队首次成功将分而治之值学习扩展至目标条件强化学习等复杂任务。

来源:Berkeley AI Research · bair.berkeley.edu