2022年3月15日
日志收集系统应该说是到达一定规模的公司的标配了,一个能满足业务需求、运维成本低、稳定的日志收集系统对于运维的同学和日志使用方的同学都是非常nice的。然而这时理想中的日志收集系统,现实往往不是这样的…本篇的主要内容是:首先吐槽一下公司以前的日志收集和上传;介绍新的实……
阅读全文
2022年3月15日
_怎样赢得机器学习比赛:你拿别人的结果和你自己的结果与做集成。 _ —— Vitaly Kuznetsov NIPS2014。 集成模型是一种能在各种的机器学习任务上提高准确率的强有力技术。在这篇文章中,我会分享我在Kaggle比赛中的集成方法。 在第一部分中,我们会讨论从提交文件中建立集成。主要包括: 投票集成 平均 排名……
阅读全文
2022年3月15日
张俊林 导读: 推荐或者 CTR 预估任务有一个很突出的特点:存在海量稀疏特征。海量意味着数量巨大,稀疏意味着即使在很大的训练数据里,大量特征出现频次也非常低,这往往是由于引入了大量 ID 类特征带来的。对于 DNN 排序系统,是否能够找到好的特征 Embedding 表达方式,对于系统效果是至关重要的。 虽然说,如何更好地表……
阅读全文
2022年3月15日
Bert最近很火,应该是最近最火爆的AI进展,网上的评价很高,那么Bert值得这么高的评价吗?我个人判断是值得。那为什么会有这么高的评价呢?是因为它有重大的理论或者模型创新吗?其实并没有,从模型创新角度看一般,创新不算大。但是架不住效果太好了,基本刷新了很多NLP的任务的最好性能……
阅读全文
2022年3月15日
写在前面 本篇文章我们学习Linux IO中的零拷贝技术,最后的参考链接中介绍的非常好,大家都可以看一下 传统IO过程 考虑这样一个过程:我们从磁盘中读取一个文件数据,然后将数据通过网络传输到另一个机器。对用户来说可能就是简单的理解为两步操作。 File.read(fileDesc, buf, len); Socket.send(socket, buf, len); 但是,如果我们看传输中涉及的内核……
阅读全文
2022年3月15日
作者: Kunlun Bai 机器之心编译 参与:熊猫 我们都知道卷积的重要性,但你知道深度学习领域的卷积究竟是什么,又有多少种类吗?研究学者 Kunlun Bai 近日发布一篇介绍深度学习的卷积文章,用浅显易懂的方式介绍了深度学习领域的各种卷积及其优势。鉴于原文过长,机器之心选择其中部分内容进行介绍,2、4、5、9、11……
阅读全文
2022年3月15日
公司的数据平台已迭代三个版本,从头开始遇到很多常见的难题,终于有时间整理一些完善的文档,在此分享以供所需的朋友。 在此篇幅中偏重于 ES 的优化,关于 HBase,Hadoop 的设计优化有很多文章可以参考,不再赘述。 需求说明 项目背景: 在一业务系统中,部分表每天的数据量过亿,已按天分表,但业……
阅读全文
2022年3月15日
作者: 陈易生 原文: https://tech.ipalfish.com/blog/2021/08/24/palfish-prediction-service-design/ 前言 在伴鱼,我们在多个在线场景使用机器学习提升用户的使用体验。例如,在伴鱼绘本中,我们根据用户的帖子浏览记录,为用户推荐他们感兴趣的帖子。 在线预测是机器学习模型发挥作用的临门一脚,重要性不言而喻。在伴鱼,我们搭建了机器学习预测服务(以下简称预测服务),统一地处……
阅读全文
2022年3月15日
ROC/AUC作为机器学习的评估指标非常重要,也是面试中经常出现的问题(80%都会问到)。其实,理解它并不是非常难,但是好多朋友都遇到了一个相同的问题,那就是: 每次看书的时候都很明白,但回过头就忘了,经常容易将概念弄混。 还有的朋友面试之前背下来了,但是一紧张大脑一片空白全忘了,导……
阅读全文
2022年3月15日
作者:黄海安 编辑:田 旭 前 言 论文地址: https://arxiv.org/abs/1801.07372 开源地址: https://github.com/anibali/dsntnn 01 创新点 这篇文章我本人非常喜欢,因为这个问题困扰我很久了,后面会细说。当看到这篇文章的时候我确实蛮激动的,后面发现还有几篇同样思路的论文,看来还是论文看的太少了。 目前的数值坐标回归任务存在于大量的实际需求中,例如人体关键点检测、人……
阅读全文