3 problems
- 0 votes0 replies0 views
Thompson-sampling conjecture for contextual dueling bandits
Thompson-sampling conjecture. A Thompson-sampling-based algorithm may also work for the contextual dueling bandit setting because its stochastic nature encourages the agent to expl…
- 0 votes0 replies0 views
Thompson sampling's optimal-regret conjecture for multidimensional linear quadratic control
Consider stabilizable multidimensional linear quadratic regulator systems, and let Thompson Sampling (TS) denote an adaptive control strategy that samples a model from a posterior…
- 0 votes0 replies0 views
The logistic-bandit information-ratio conjecture
In a logistic bandit, the link function is … where is fixed and known. For each , let and satisfy the conditions…