Reddit · r/MachineLearning· /u/Potential-Barber8658·· 10 天前AI 评分41
Browser demo: 5.6k 参数 REINFORCE 策略在 Clash Royale 防守布局中学习对抗暴力最优解
Browser demo of our Clash Royale RL environment: a 5.6k-parameter REINFORCE policy learns defensive placement against a brute-force optimum [P]
AI 导读
开源 Clash Royale 模拟器推出浏览器交互演示,REINFORCE 策略仅用 5,629 个参数学习单次决策的防守布局。策略在 C++ 编译为 WebAssembly 的引擎中训练,对比 brute force 最优解可验证学习效果:Giant vs Cannon 存在强局部最优解,线性熵退火可减少陷入概率。
来源:Reddit · r/MachineLearning · reddit.com