arXiv Systems & Control#tech
Policy Gradient for Continuous-Time Robust Markov Decision Processestranslating…
Factuality: 78/100UnknownarXiv Press Ltd
arXiv:2606.04335v1 Announce Type: cross
Abstract: The framework of robust Markov decision processes (RMDPs) allows the design of reinforcement learning agents that satisfy performance guarantees under worst-case transition dynamics. Traditional RMDPs consider discrete-time dynamics and recently, sample-efficient policy gradient algorithms have been considered in this context. This paper investigates policy gradient algorithms within a continuous-time RMDP framework. Policy gradients and adversa