2022年3月15日
本文禁止转载 word_delimiter_graph 使用非字母字符切分 tokens,并可以根据规则执行一些可选的 token 正则化。默认情况下, word_delimiter_graph 会使用以下规则: 使用非字母字符作为切分点。 比如 Super-Duper → Super, Duper 移除每个 token 前置和后置分隔符。比如 XL---42+'Autocoder' → XL, 42, Autocoder 在单词大小写过度位置做切分。 比如 PowerShot → Power, Shot 在单词字母和数字过度位置切分。 比如 XL500 → XL, 500 移除……
阅读全文
2022年3月15日
分享嘉宾:李凤麟 阿里巴巴 算法专家 文章整理:付一韬 内容来源:2019知识图谱前沿技术论坛 出品社区:DataFun 导读: 阿里小蜜是阿里巴巴服务领域的重要人工智能产品,是服务于阿里巴巴经济体、商家、企业和政府的对话机器人家族,包括阿里小蜜、店小蜜、云小蜜。小蜜机器人是基于大数据和人工智……
阅读全文
2022年3月15日
以下文章来源于Flink 中文社区 ,作者余东@去哪儿 2021年加入Qunar,主要负责数据平台Flink的运维与平台开发。 本文导读 背景及特点 1. 背景 在使用 Flink 做实时数仓以及数据传输过程中,遇到了一些问题:比如 Kafka 数据丢失,Flink 结合 Hive 的近实时数仓性能等。Iceberg 0.11 的新特性解决了……
阅读全文
2022年3月15日
▌2.1数据层面 ▏2.1.1「稀疏性」:稳定的流量与稳定的交互比例(pv/uv) 稳定的 「流量」 与稳定的 「交互」「比例」 保证了数据的 「稠密性」 ,单用户和单商品有 「足够的数据」 可以完成机器学习,并且保证一定的 「置信度」 。当有 「新用户(新商品)」 加入系统时,由于系统中缺乏用户(商品)历……
阅读全文
2022年3月15日
作者:美丽联合集团 算法工程师 琦琦 , 公众号关注:诗品算法 0、引言 这篇文章仍是在蘑菇街 增量学习背景下的实践,增量学习的理论很简单,但实践起来,还是有很多细节和trick的。比如,针对不同的模型结构,我们可以设计不同的优化器承接,其对应的动态正则设计方案也会有所差异。 这篇文章是已受理的……
阅读全文
2022年3月15日
在阅读本文前,请读者统计一下,你近期参与及主持会议的时长,并计算出会议在你工作总时长中的比重。 会议本身并不产生价值,而执行会后达成的结论并成功拿到结果,则会创造价值。本文的目的不是帮读者消灭会议,而是希望通过探究会议的目的及合理的组织形式,试图把你从冗长低效的会议中解放出来,让会……
阅读全文
2022年3月15日
作者:vivo互联网服务器团队-Yu Quan 一、推送平台特点 vivo推送平台是vivo公司向开发者提供的消息推送服务,通过在云端与客户端之间建立一条稳定、可靠的长连接,为开发者提供向客户端应用实时推送消息的服务,支持百亿级的通知/消息推送,秒级触达移动用户。 推送平台的特点是并发高、消息……
阅读全文
2022年3月15日
朱敏 紫顺 乐钦等 美团技术团队 1. 背景 搜索优化问题,是个典型的AI应用问题,而AI应用问题首先是个系统问题。经历近10年的技术积累和沉淀,美团搜索系统架构从传统检索引擎升级转变为AI搜索引擎。当前,美团搜索整体架构主要由搜索数据平台、在线检索框架及云搜平台、在线AI服务及实验平台三大体……
阅读全文
2022年3月15日
深度学习可以对物理世界的人/物/场景所产生各种非结构化数据(如语音、图片、视频,语言文字、行为等)进行抽象,变成多维的表示向量。 物理世界的关系可以通过表示向量的距离数学运算得到。 一.向量检索的意义 深度学习最重要的作用就是“表示学习”【1】,简单来说,就是把对象通过深度模型表示成一……
阅读全文
2022年3月15日
仰宗强@贝壳找房 本文根据贝壳找房资深工程师仰宗强老师在2020年"面向AI技术的工程架构实践"大会上的演讲速记整理而成。 1 开场 大家下午好,很荣幸来到这跟大家一起分享贝壳一站式大数据开发平台的落地实践。今天的分享主要分为以下四个部分: 贝壳的数据业务背景。 数据开发……
阅读全文