Reddit · r/MachineLearning· /u/Helpful_Minimum_2214·· 6 天前AI 评分57
FLEET:在奖励最大化任务中将记忆加入搜索而非采样
Adding memory to search instead of sampling in reward maximization tasks [R]
AI 导读
FLEET 算法通过将外部奖励归因于特定 token 并使用 MCTS 调整下一轮 logits,将记忆加入搜索而非盲目采样。在 GSM8K 和 LiveCodeBench v6 easy split 上用 Llama 3.2 3B 测试,GSM8K 用一半迭代达到采样基线,LiveCodeBench 从 0.59 提升到 0.69 仅需 9 次迭代对比原来的 32 次。
来源:Reddit · r/MachineLearning · reddit.com