以论文学习如何在推荐场景应用强化学习
作者:吴海波 蘑菇街 整理:Hoh Xil 来源:误入机器学习的码农@知乎专栏 导读: 近期,业界开始流传 YouTube 成功将 RL 应用在了推荐场景,并且是 YouTube 近几年来取得的最显著的线上收益。 放出了两篇论文: [1] Top-K Off-Policy Correction for a REINFORCE Recommender System https://arxiv.org/pdf/1812.02353.pdf [2] Reinforcement Learning for Slate-based Recommender Systems: A Tractable Decomposition and Practical Methodology https://arxiv.org/pdf/1905.12767.pdf 个人建议两篇论文都仔细读读,TopK 的篇幅较短,重点突出,……