今天,读了IN-CONTEXT REINFORCEMENT LEARNING WITH ALGORITHM DISTILLATION。其将强化学习建模成了顺序预测问题,通过历史预测下一个动作,同时历史可以看成context。算法步骤就是通过source RL算法生成数据,然后在给定先前learning history作为context,通过自回归与预测action,来训练causal Trasnformer(这个过程就是文中说地算法蒸馏)。然后,又看了离线强化学习经典论文CQL。
2024-03-20
在牛客打卡4天,今天也很努力鸭!
全部评论

相关推荐

11-15 19:28
已编辑
蚌埠坦克学院 硬件开发
点赞 评论 收藏
分享
hso_:哈哈哈哈哈哈我没offer一样在同一道题开喷了
投递深圳同为数码等公司10个岗位
点赞 评论 收藏
分享
评论
点赞
收藏
分享
牛客网
牛客企业服务