When a Correct Reward Is Not Enough: Diagnosing and Guiding PPO in an Analytically Solved Broker–Trader Game

By Siu Tung Wong, Carlo Campajola

Rating

1909
Battle Count: 50

Relevance

9/10
Highly relevant for practitioners using RL for optimal execution. It highlights critical failure modes of standard PPO in financial markets (critic inaccuracy under noise) and offers a practical hybrid approach (analytical initialization + residual RL) that is more robust than pure RL.

Implementation Complexity

7/10
Requires implementing a complex continuous-time stochastic control environment, deriving finite-step rewards from continuous payoffs, and integrating analytical Riccati equation solutions with PPO training loops.

Reproducibility

4/5
The paper provides detailed environment parameters, network architectures, training settings, and mathematical derivations for the reward function. Code and configurations are stated to be released after peer review.

About this paper

Methodology: Residual Reinforcement Learning with Analytical Policy Initialization. Problem types: Reinforcement Learning, Algorithmic Execution, Optimization, Partial Observability.

The interactive Everscope explorer (charts, battles, favorites) loads below.