Multi-Armed Bandits for Strategy Allocation
Multiarmed bandits formalize the explorevsexploit problem: you have K strategies (arms), each with unknown reward distributions, and you must allocate capital over time to maximize cumulative reward. Unlike a static [portfolio optimizer](/post.php?slug=portfoliooptimizationmarkowitz) that assumes known means and covariances, bandits learn…
Read →