2022年3月15日
分享嘉宾:张庭 菜鸟 数据工程师 文章整理:comn 出品平台:DataFunTalk 导读: 供应链物流场景下的业务复杂度高,业务链路长,节点多,实体多,实时数仓建设难度高。菜鸟跨境进口业务场景更是如此,更复杂的场景带来更复杂的实体数据模型,对接的业务系统多导致ETL流程特别复杂,还有海量……
阅读全文
2022年3月15日
网上铺天盖地的都是面试官面试候选人的面试问题,而针对面试过程面试官的最后一问:“最后还有什么想问的么?”,没有问题,略显尴尬。发现github上有位叫 viraptor 的小哥反向思维,整理了一份求职反问手册,从岗位职责、基础设施、团队情况、公司技术发展、公司变现途径、是否坐班、办公室情况等角度,……
阅读全文
2022年3月15日
文章作者:王松林、唐国瑜 京东算法工程师 编辑整理:Hoh 内容来源:作者授权 出品平台:DataFunTalk 导读: 本文将介绍京东搜索场景中的两块技术, 语义检索与商品排序。在业界检索算法基础上,我们提出一系列更适用于电商场景的检索排序算法,在业务上取得了显著收益。其中的多篇论文已被 KDD/SIGIR 等……
阅读全文
2022年3月15日
作者:Samuele Mazzanti 编译:ronghuaiyang 导读: 如何让复杂的模型具备可解释性,SHAP 值是一个很好的工具,但是 SHAP 值不是很好理解,如果能将 SHAP 值转化为对概率的影响,看起来就很舒服了。 在可解释性和高性能之间的永恒的争斗 从事数据科学工作的人更了解这一点:关于机器学习的一个老生常……
阅读全文
2022年3月15日
添加微信:julyedufu77,回复 “ 7 ”,领取最新升级版《名企AI面试100题》电子书!! 11、当参数量 » 样本量时候, 神经网络是如何预防过拟合? 正则化 2. Early Stopping 3. Dropout 4. 数据增强 过拟合即在训练误差很小,而泛化误差很大,神经网络时避免过拟合的方法: 正则化 正则化的思想十分简单明了。由于模……
阅读全文
2022年3月15日
分享嘉宾:赵哲博士 腾讯 高级研究员 编辑整理:张书源 爱丁堡大学 出品平台:DataFunTalk 导读: 预训练已经成为自然语言处理任务的重要组成部分,为大量自然语言处理任务带来了显著提升。本文将围绕预训练模型,介绍相关技术在文本内容理解方面的应用。更具体的,本文会首先对已有的经典预训练工……
阅读全文
2022年3月15日
姜国强 腾讯云加社区 导语 | 在百花齐放的交互式分析领域,ClickHouse 绝对是后起之秀,它虽然年轻,却有非常大的发展空间。本文将分享 PB 级分析型数据库 ClickHouse 的应用场景、整体架构、众多核心特性等,帮助理解 ClickHouse 如何实现极致性能的存储引擎,希望与大家一起交流。文章作者:姜国强,腾讯实时检索研发……
阅读全文
2022年3月15日
文章作者:冯维 清华大学博士 责任编辑:钱蕊 本篇文章来自 微信公众号智慧的流动: 十张图帮你理解供应链IT名词!(上篇) 欢迎原链接转发,转载请前往 @留德华叫兽 的主页获取信息,盗版必究。 敬请关注和扩散本专栏及同名公众号,会邀请 全球知名学者 陆续发布运筹学、人工智能中优化理论等相关干货、 知乎L……
阅读全文
2022年3月15日
原文: https://www.amazingkoala.com.cn/Lucene/Index/2019/0222/36.html 本篇文章介绍如何生成倒排表,通过一个简单的例子来讲解倒排表的底层存储结构。文章中不会给出详细的源码介绍,只有一些必要的对象,感兴趣的朋友可以看我的 GitHub,对构建倒排表的源码给出了详细的注释: https://github.com/luxugang/Lucene-7.5.0/blob/master/solr-7.5.0/lucene/core/src/java/org/apache/lucene/index/DefaultIndexingChain.java ,此类中的该方法是开始构建倒排表的入口。 另外如果某些域使用了词向量(Ter……
阅读全文
2022年3月15日
作者 | 灵笼、怀迩 高德技术 稿 一 背景 POI 是 Point of Interest 的缩写。在电子地图上,POI 代表餐厅、超市、政府机关、旅游景点、交通设施等等 。POI是电子地图的核心数据。对普通用户而言,POI 数据包含的名称和位置信息,能够满足其使用电子地图“查找目的地”,进而唤起导航服务的基本需求;对电子地图而言,通……
阅读全文