3 problems
- 0 votes0 replies0 views
Adaptive optimality conjecture for VI-LCB in offline Markov decision processes
VI-LCB optimality conjecture. VI-LCB is optimal for all ranges of .
- 0 votes0 replies0 views
Adaptive optimality conjecture for LCB in offline Markov decision processes
Adaptive optimality conjecture. The LCB approach, together with value iteration, is adaptively optimal for solving offline MDPs for all ranges of .
- 0 votes0 replies0 views
The conjecture that Gittins's success is due to exceptionally tight confidence intervals
The Gittins index strategy is compared with OCUCB, Thompson sampling, and UCB in Gaussian-noise bandit experiments. The Gittins strategy is a Bayesian strategy whose performance is…