<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>强化学习 on 知识铺的博客</title>
    <link>https://index.zshipu.com/geek/tags/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/</link>
    <description>Recent content in 强化学习 on 知识铺的博客</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>zh-CN</language>
    <lastBuildDate>Tue, 15 Mar 2022 11:25:13 +0800</lastBuildDate>
    <atom:link href="https://index.zshipu.com/geek/tags/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>推荐系统遇上深度学习十五强化学习在京东推荐中的探索</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%8E%A8%E8%8D%90%E7%B3%BB%E7%BB%9F%E9%81%87%E4%B8%8A%E6%B7%B1%E5%BA%A6%E5%AD%A6%E4%B9%A0%E5%8D%81%E4%BA%94%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%9C%A8%E4%BA%AC%E4%B8%9C%E6%8E%A8%E8%8D%90%E4%B8%AD%E7%9A%84%E6%8E%A2%E7%B4%A2/</link>
      <pubDate>Tue, 15 Mar 2022 11:25:13 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%8E%A8%E8%8D%90%E7%B3%BB%E7%BB%9F%E9%81%87%E4%B8%8A%E6%B7%B1%E5%BA%A6%E5%AD%A6%E4%B9%A0%E5%8D%81%E4%BA%94%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%9C%A8%E4%BA%AC%E4%B8%9C%E6%8E%A8%E8%8D%90%E4%B8%AD%E7%9A%84%E6%8E%A2%E7%B4%A2/</guid>
      <description>原文地址： https://www.jianshu.com/p/b9113332e33e 强化学习在各个公司的推荐系统中已经有过探索，包括阿里、京东等。之前在美团做过的一个引导语推荐项目，背后也是基于强化学习算法。本文，我们先来看一下强化学习是如何在京东推荐中进行探索的。 本文来自于paper：《Deep Reinforcement Learning for List-wise Recommendations》 1、引言 传统的</description>
    </item>
    <item>
      <title>以论文学习如何在推荐场景应用强化学习</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E4%BB%A5%E8%AE%BA%E6%96%87%E5%AD%A6%E4%B9%A0%E5%A6%82%E4%BD%95%E5%9C%A8%E6%8E%A8%E8%8D%90%E5%9C%BA%E6%99%AF%E5%BA%94%E7%94%A8%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/</link>
      <pubDate>Tue, 15 Mar 2022 10:18:29 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E4%BB%A5%E8%AE%BA%E6%96%87%E5%AD%A6%E4%B9%A0%E5%A6%82%E4%BD%95%E5%9C%A8%E6%8E%A8%E8%8D%90%E5%9C%BA%E6%99%AF%E5%BA%94%E7%94%A8%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/</guid>
      <description>作者：吴海波 蘑菇街 整理：Hoh Xil 来源：误入机器学习的码农@知乎专栏 导读： 近期，业界开始流传 YouTube 成功将 RL 应用在了推荐场景，并且是 YouTube 近几年来取得的最显著的线上收益。 放出了两篇论文： [1] Top-K Off-Policy Correction for a REINFORCE Recommender System https://arxiv.org/pdf/1812.02353.pdf [2] Reinforcement Learning for Slate-based Recommender Systems: A Tractable Decomposition and Practical Methodology https://arxiv.org/pdf/1905.12767.pdf 个人建议两篇论文都仔细读读，TopK 的篇幅较短，重点突出，</description>
    </item>
    <item>
      <title>美团搜索中查询改写技术的探索与实践</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E7%BE%8E%E5%9B%A2%E6%90%9C%E7%B4%A2%E4%B8%AD%E6%9F%A5%E8%AF%A2%E6%94%B9%E5%86%99%E6%8A%80%E6%9C%AF%E7%9A%84%E6%8E%A2%E7%B4%A2%E4%B8%8E%E5%AE%9E%E8%B7%B5/</link>
      <pubDate>Tue, 15 Mar 2022 10:06:10 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E7%BE%8E%E5%9B%A2%E6%90%9C%E7%B4%A2%E4%B8%AD%E6%9F%A5%E8%AF%A2%E6%94%B9%E5%86%99%E6%8A%80%E6%9C%AF%E7%9A%84%E6%8E%A2%E7%B4%A2%E4%B8%8E%E5%AE%9E%E8%B7%B5/</guid>
      <description>杨俭 宗宇 谢睿等 美团技术团队 稿 1. 引言 在搜索场景中，由于用户搜索词Query和检索文本Document之间存在大量表述不一的情况，在文本检索框架下，此类文本不匹配导致的漏召回问题严重影响着用户的体验。对这类问题业界一般有两种方案：用户端拓展用户的查询词——即查询改写，或Documen</description>
    </item>
    <item>
      <title>深度强化学习在滴滴路径规划中的探索实践</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%B7%B1%E5%BA%A6%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%9C%A8%E6%BB%B4%E6%BB%B4%E8%B7%AF%E5%BE%84%E8%A7%84%E5%88%92%E4%B8%AD%E7%9A%84%E6%8E%A2%E7%B4%A2%E5%AE%9E%E8%B7%B5/</link>
      <pubDate>Tue, 15 Mar 2022 09:31:50 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%B7%B1%E5%BA%A6%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%9C%A8%E6%BB%B4%E6%BB%B4%E8%B7%AF%E5%BE%84%E8%A7%84%E5%88%92%E4%B8%AD%E7%9A%84%E6%8E%A2%E7%B4%A2%E5%AE%9E%E8%B7%B5/</guid>
      <description>桔妹导读： 滴滴的路线引擎每天要处理超过400亿次的路线规划请求，路径规划是滴滴地图输出的核心服务之一。不同于传统的路径规划算法，本文主要介绍的是一次深度强化学习在路径规划业务场景下的探索，目标是为用户规划出最符合司乘双方习惯的路线，降低偏航率。 当我们打开滴滴使用网约车服务时，出发</description>
    </item>
    <item>
      <title>要提升微信看一看推荐混排的长期收益试试深度强化学习</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E8%A6%81%E6%8F%90%E5%8D%87%E5%BE%AE%E4%BF%A1%E7%9C%8B%E4%B8%80%E7%9C%8B%E6%8E%A8%E8%8D%90%E6%B7%B7%E6%8E%92%E7%9A%84%E9%95%BF%E6%9C%9F%E6%94%B6%E7%9B%8A%E8%AF%95%E8%AF%95%E6%B7%B1%E5%BA%A6%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/</link>
      <pubDate>Tue, 15 Mar 2022 09:06:24 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E8%A6%81%E6%8F%90%E5%8D%87%E5%BE%AE%E4%BF%A1%E7%9C%8B%E4%B8%80%E7%9C%8B%E6%8E%A8%E8%8D%90%E6%B7%B7%E6%8E%92%E7%9A%84%E9%95%BF%E6%9C%9F%E6%94%B6%E7%9B%8A%E8%AF%95%E8%AF%95%E6%B7%B1%E5%BA%A6%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/</guid>
      <description>第一篇：微信「看一看」 推荐排序技术揭秘 第二篇：详文解读微信「看一看」多模型内容策略与召回 微信 &amp;ldquo;看一看&amp;rdquo; 内容理解与推荐 导语 相比于传统的监督学习方法，强化学习能够最大化长期收益，正是推荐系统更加需要的。做好当下做好固然重要，但放眼未来才能看得更远。 本文主要是在</description>
    </item>
    <item>
      <title>回顾强化学习在自然语言处理中的应用</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9B%9E%E9%A1%BE%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%9C%A8%E8%87%AA%E7%84%B6%E8%AF%AD%E8%A8%80%E5%A4%84%E7%90%86%E4%B8%AD%E7%9A%84%E5%BA%94%E7%94%A8/</link>
      <pubDate>Tue, 15 Mar 2022 01:35:22 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9B%9E%E9%A1%BE%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%9C%A8%E8%87%AA%E7%84%B6%E8%AF%AD%E8%A8%80%E5%A4%84%E7%90%86%E4%B8%AD%E7%9A%84%E5%BA%94%E7%94%A8/</guid>
      <description>分享嘉宾： 黄民烈** ** 清华大学计算机系副教授，博士生导师 编辑整理： 邓力 内容来源： 《Reinforcement Learning in Natural Language Processing》 出品社区： DataFun 注：欢迎转载，转载请注明出处。 本文首先介绍了强化学习的概念和相关知识，以及与监督学习的区别，然后就强化学习在自然语言处理应用中的挑</description>
    </item>
    <item>
      <title>回顾强化学习原理与应用</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9B%9E%E9%A1%BE%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%8E%9F%E7%90%86%E4%B8%8E%E5%BA%94%E7%94%A8/</link>
      <pubDate>Tue, 15 Mar 2022 01:23:16 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9B%9E%E9%A1%BE%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%8E%9F%E7%90%86%E4%B8%8E%E5%BA%94%E7%94%A8/</guid>
      <description>分享嘉宾： 王凡 百度 资深研发工程师 编辑整理： 王成林 内容来源：百度大脑&amp;amp;DataFun AI Talk《 强化学习：原理与应用》 今天分享话题主要是跟强化学习有关，因为强化学习最近在工业界是非常火热。从加入百度开始，我主要就是做这一块。强化学习是一个比较大的话题，分享的内容大概是三个部</description>
    </item>
    <item>
      <title>强化学习系列二应用思路优化搜索排序</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E7%B3%BB%E5%88%97%E4%BA%8C%E5%BA%94%E7%94%A8%E6%80%9D%E8%B7%AF%E4%BC%98%E5%8C%96%E6%90%9C%E7%B4%A2%E6%8E%92%E5%BA%8F/</link>
      <pubDate>Tue, 15 Mar 2022 01:14:03 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E7%B3%BB%E5%88%97%E4%BA%8C%E5%BA%94%E7%94%A8%E6%80%9D%E8%B7%AF%E4%BC%98%E5%8C%96%E6%90%9C%E7%B4%A2%E6%8E%92%E5%BA%8F/</guid>
      <description>文章作者：杨镒铭 滴滴出行 高级算法工程师 内容来源：记录广告、推荐等方面的模型积累@知乎专栏 在深度学习大潮之后，搜索推荐等领域模型该如何升级迭代呢？强化学习在游戏等领域大放异彩，那是否可将强化学习应用到搜索推荐领域呢？推荐搜索问题往往也可看作是序列决策的问题，引入强化学习的思想来实现</description>
    </item>
    <item>
      <title>赵鑫强化学习在京东广告序列推荐中的应用</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E8%B5%B5%E9%91%AB%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%9C%A8%E4%BA%AC%E4%B8%9C%E5%B9%BF%E5%91%8A%E5%BA%8F%E5%88%97%E6%8E%A8%E8%8D%90%E4%B8%AD%E7%9A%84%E5%BA%94%E7%94%A8/</link>
      <pubDate>Tue, 15 Mar 2022 00:50:58 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E8%B5%B5%E9%91%AB%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%9C%A8%E4%BA%AC%E4%B8%9C%E5%B9%BF%E5%91%8A%E5%BA%8F%E5%88%97%E6%8E%A8%E8%8D%90%E4%B8%AD%E7%9A%84%E5%BA%94%E7%94%A8/</guid>
      <description>分享嘉宾：赵鑫博士 京东 算法工程师 编辑整理：娄学政 小米 出品平台：DataFunTalk 导读： 互联网推荐广告的排序，关键在于对流量价值的预估，其中最重要的一部分是对点击率的预估。为了提高广告的变现效率，核心的问题是如何提高广告的预估精度。同一个广告，在上下文不一样的情况下，点击率是不</description>
    </item>
    <item>
      <title>电商搜索场景中的强化排序学习形式化理论分析以及应用</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E7%94%B5%E5%95%86%E6%90%9C%E7%B4%A2%E5%9C%BA%E6%99%AF%E4%B8%AD%E7%9A%84%E5%BC%BA%E5%8C%96%E6%8E%92%E5%BA%8F%E5%AD%A6%E4%B9%A0%E5%BD%A2%E5%BC%8F%E5%8C%96%E7%90%86%E8%AE%BA%E5%88%86%E6%9E%90%E4%BB%A5%E5%8F%8A%E5%BA%94%E7%94%A8/</link>
      <pubDate>Mon, 14 Mar 2022 18:32:56 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E7%94%B5%E5%95%86%E6%90%9C%E7%B4%A2%E5%9C%BA%E6%99%AF%E4%B8%AD%E7%9A%84%E5%BC%BA%E5%8C%96%E6%8E%92%E5%BA%8F%E5%AD%A6%E4%B9%A0%E5%BD%A2%E5%BC%8F%E5%8C%96%E7%90%86%E8%AE%BA%E5%88%86%E6%9E%90%E4%BB%A5%E5%8F%8A%E5%BA%94%E7%94%A8/</guid>
      <description>在淘宝的商品搜索场景中，给商品进行打分排序是一个典型的多步决策问题。尽管 Learning to Rank（LTR）被广泛用于排序问题，但现有的方法并没有考虑同一个搜索会话中不同决策步骤之间的关联性，因而无法直接用于电商搜索场景中的商品排序。本文提出用强化学习来解决对商品多步排序决策问题，它在模拟实验</description>
    </item>
    <item>
      <title>基于滴滴论文基于强化学习技术的智能派单模型再演绎</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9F%BA%E4%BA%8E%E6%BB%B4%E6%BB%B4%E8%AE%BA%E6%96%87%E5%9F%BA%E4%BA%8E%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E6%8A%80%E6%9C%AF%E7%9A%84%E6%99%BA%E8%83%BD%E6%B4%BE%E5%8D%95%E6%A8%A1%E5%9E%8B%E5%86%8D%E6%BC%94%E7%BB%8E/</link>
      <pubDate>Mon, 14 Mar 2022 18:30:40 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9F%BA%E4%BA%8E%E6%BB%B4%E6%BB%B4%E8%AE%BA%E6%96%87%E5%9F%BA%E4%BA%8E%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E6%8A%80%E6%9C%AF%E7%9A%84%E6%99%BA%E8%83%BD%E6%B4%BE%E5%8D%95%E6%A8%A1%E5%9E%8B%E5%86%8D%E6%BC%94%E7%BB%8E/</guid>
      <description>文章作者：洪九 滴滴 高级算法工程师 内容来源：作者授权 出品社区：DataFun 注：欢迎转载，转载请注明出处 最近拜读了滴滴2018年在 KDD 发表的一篇论文《 Large-Scale Order Dispatch in On-Demand Ride-Hailing Platforms: A Learning and Planning Approach 》。意犹未尽， 假如让我来设计这样一个调度系统该如何做呢？ 司乘匹配一般来说，分为两步完成，第一步是为乘客找到合适</description>
    </item>
    <item>
      <title>沈冰阳强化学习在推荐冷启动优化中的实践探索</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%B2%88%E5%86%B0%E9%98%B3%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%9C%A8%E6%8E%A8%E8%8D%90%E5%86%B7%E5%90%AF%E5%8A%A8%E4%BC%98%E5%8C%96%E4%B8%AD%E7%9A%84%E5%AE%9E%E8%B7%B5%E6%8E%A2%E7%B4%A2/</link>
      <pubDate>Mon, 14 Mar 2022 18:12:39 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%B2%88%E5%86%B0%E9%98%B3%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%9C%A8%E6%8E%A8%E8%8D%90%E5%86%B7%E5%90%AF%E5%8A%A8%E4%BC%98%E5%8C%96%E4%B8%AD%E7%9A%84%E5%AE%9E%E8%B7%B5%E6%8E%A2%E7%B4%A2/</guid>
      <description>分享嘉宾：沈冰阳 58集团 算法高级工程师 编辑整理：吴祺尧 加州大学圣地亚哥分校 出品平台：DataFunTalk 导读： 58招聘是国内最大的蓝领招聘平台，是58集团的四大核心业务之一，每天有着上千万的职位在平台上发布，同时也有百万量级的求职者在平台上进行简历投递，达成海量连接并促进大量的</description>
    </item>
    <item>
      <title>强化学习在新闻推荐中的应用</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%9C%A8%E6%96%B0%E9%97%BB%E6%8E%A8%E8%8D%90%E4%B8%AD%E7%9A%84%E5%BA%94%E7%94%A8/</link>
      <pubDate>Mon, 14 Mar 2022 17:55:54 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%9C%A8%E6%96%B0%E9%97%BB%E6%8E%A8%E8%8D%90%E4%B8%AD%E7%9A%84%E5%BA%94%E7%94%A8/</guid>
      <description>作者 | mokong 搜狐技术产品 导读 随着AlphaGO在围棋界接连战胜世界冠军，其背后的技术-强化学习逐渐获得学术界、工业界的青睐。在新闻推荐任务中，传统的推荐算法无法考虑单个请求内新闻之间的关联，也无法考虑多个请求之间的关系，而强化学习，通过学习推荐策略给解决上述问题带来了可能。 1.强化学</description>
    </item>
    <item>
      <title>基于强化学习的算法在推荐场景中的应用</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9F%BA%E4%BA%8E%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E7%9A%84%E7%AE%97%E6%B3%95%E5%9C%A8%E6%8E%A8%E8%8D%90%E5%9C%BA%E6%99%AF%E4%B8%AD%E7%9A%84%E5%BA%94%E7%94%A8/</link>
      <pubDate>Mon, 14 Mar 2022 17:50:59 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9F%BA%E4%BA%8E%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E7%9A%84%E7%AE%97%E6%B3%95%E5%9C%A8%E6%8E%A8%E8%8D%90%E5%9C%BA%E6%99%AF%E4%B8%AD%E7%9A%84%E5%BA%94%E7%94%A8/</guid>
      <description>文章作者：杨梦月、张露露 导读： 本文是对滴滴 AI Labs 和中科院大学联合提出的 WWW 2020 Research Track 的 Oral 长文 &amp;ldquo;Hierarchical Adaptive Contextual Bandits for Resource Constraint based Recommendation&amp;rdquo; 的详细解读。 在这篇文章中，滴滴 AI Labs 提出了一种基于强化学习的层次自适应的多臂老虎机的资源限制下的个性化推荐方法 ( HATCH )。该方法将资源限制下的用户推荐问题建模成一个资源限制下的上下文老</description>
    </item>
  </channel>
</rss>
