赞
踩
在上一篇博客最后,我们说到了θ和θ^k是不能差太多的,不然结果会不好,那么怎么避免它们差太多呢? 这就是这一篇要介绍的PPO所在做的事情。
1:PPO1算法:
2:TRPO算法 3:PPO2算法