Improving Portfolio Optimization Results with Bandit Networks
摘要
In Reinforcement Learning, Multi-Armed Bandit (MAB) problems are essential for balancing exploration and exploitation in decision-making. Standard MAB algorithms typically assume constant rewards, a drawback in volatile financial markets. We introduce the Bandit Network architecture, which serves as a foundation for incorporating our new Adaptive Discounted Thompson Sampling (ADTS) and Combinatorial Adaptive Discounted Thompson Sampling (CADTS), along with other stationary and non-stationary bandit variants into a two-stage process, filtering and weighting, for Portfolio Optimization. Backtests with cryptocurrency and S&P data show that the Bandit Network approach outperforms traditional portfolio selection models in Cumulative Returns and Sharpe Ratio. Tests on standard datasets such as FF48 and FF100 indicate Bandit Networks surpass benchmark policies from previous work in cumulative returns while maintaining similar correlation patterns to the full datasets. These findings confirm that employing Bandit Networks enhances adaptability and performance in changing financial environments.