2022年3月15日
在网上看见有一个笑话是这样的: 程序员写出自认为没有 Bug 的代码。 软件测试,发现了 20 个 Bug。 程序员修改了 10 个 Bug,并告诉测试组另外 10 个不是 Bug。 测试组发现其中 5 个改动根本无法工作,同时又发现了 15 个新 Bug。 重复 3 次步骤 3 和步骤 4。 鉴于市场方面的压力,为了配合当初制定的过分乐观的发……
阅读全文
2022年3月15日
袁一@工商银行 摘要: 本文整理自中国工商银行大数据平台负责人袁一在 Flink Forward Asia 2021 的分享 一、工行实时大数据平台建设历程 工商银行从 2002 年开始建设数据集市,当时主要使用 Oracle 类单机版的关系型数据库。随着数据量不断增加,开始引入 TD、ED 等国外高端一体机。2014 年工行正式基于 Hadoop 技术建设了大数据平台,……
阅读全文
2022年3月15日
我的个人 微信公众号: Microstrong 微信公众号 ID:MicrostrongAI 目录: GBDT 分类算法简介 GBDT 二分类算法 2.1 逻辑回归的对数损失函数 2.2 GBDT 二分类原理 GBDT 二分类算法实例 手撕 GBDT 二分类算法 4.1 用 Python3 实现 GBDT 二分类算法 4.2 用 sklearn 实现 GBDT 二分类算法 GBDT 分类任务常见的损失函数 总结 Reference 本文的主要内容概览: 1. GBDT 分类算法简介 GBDT 无……
阅读全文
2022年3月15日
作者介绍 井显生,2019年加入去哪儿,现负责国内机票出票、退款、改签核心业务。在领域驱动设计(DDD)、高并发有大量实践经验。 一、前言 去哪儿网国内机票售后是为用户提供退票、改签、航班变动、行程服务、疫情政策等服务的业务。业务场景中有复杂的基于订单、客票、 PNR 、行程、航司等各种维度的……
阅读全文
2022年3月15日
作者:Amit Chaudhary 编译:ronghuaiyang 导读: 如果人工智能是一块蛋糕,那么蛋糕的大部分是自监督学习,蛋糕上的糖衣是监督学习,蛋糕上的樱桃是强化学习。 Yann Lecun 在他的演讲中引入了“蛋糕类比”来说明自监督学习的重要性。虽然这个类比是有争论的,但我们也已经看到了自监督学习的影响,在自然……
阅读全文
2022年3月15日
李夏昕 ElasticSearch 是基于 Lucene 实现的分布式搜索引擎,提供了海量数据实时检索和分析能力。滴滴从 2016 年 4 月开始组建团队,解决 ElasticSearch 在使用过程中遇到的性能问题。并且,随着业务体量的发展,滴滴构建了基于 ElasticSearch 的一站式搜索平台。InfoQ 邀请到了滴滴出行高级专家工程师、 QCon 全球软件开发大会(广州站) 讲师张亮,请他聊……
阅读全文
2022年3月15日
文章作者:随刻基础推荐团队 内容来源:爱奇艺技术产品团队 导读:推荐系统的本质是信息过滤,多个信息漏斗将用户最感兴趣的内容逐步呈现在用户面前,如图1所示(《 爱奇艺短视频推荐:粗排篇》)。召回阶段作为首个漏斗从多个维度将海量视频中用户可能感兴趣的内容滤出交给后续排序技术处理,它直接决定……
阅读全文
2022年3月15日
注:本文经授权转载自 mangodata YangYichao 转载请关注作者公众号联系原作者 ❝本系列每篇文章都是从一些实际生产实践需求出发,解决一些生产实践中的问题,抛砖引玉,以帮助小伙伴们解决一些实际生产问题。相信大家或多或少都观看过直播,那大家有没有想过,如果自己负责建设公司内整体直播实时数据,会怎样去建设呢?本……
阅读全文
2022年3月15日
》分享嘉宾:苏永浩 58同城 资深算法工程师 编辑整理:吴祺尧 出品平台:DataFunTalk 导读: 从C端视角来看,58商业将Embedding作为广告的一种理解方式,使我们精确理解C端用户意图,同时理解B端推广提供的能力,使得目标推广以合适的形式触达C端用户。Embedding对文本……
阅读全文
2022年3月15日
丁香园大数据 NLP。发表日期: 2019-05-05 前言 短语挖掘( Phrase Mining)的目的在于从大量的文本语料中提取出高质量的短语,是 NLP 领域中基础任务之一。短语挖掘主要解决专业领域的专业词典不足的问题,减少人工整理成本,如图所示 Phrase Mining 在以下几个任务中非常重要。 jieba 分词是中文分词领域比较好的工具[1,2],……
阅读全文