<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Spark on 知识铺的博客</title>
    <link>https://index.zshipu.com/geek/tags/spark/</link>
    <description>Recent content in Spark on 知识铺的博客</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>zh-CN</language>
    <lastBuildDate>Tue, 15 Mar 2022 11:14:58 +0800</lastBuildDate>
    <atom:link href="https://index.zshipu.com/geek/tags/spark/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>阿里是如何应对超大规模集群资源管理挑战的</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E9%98%BF%E9%87%8C%E6%98%AF%E5%A6%82%E4%BD%95%E5%BA%94%E5%AF%B9%E8%B6%85%E5%A4%A7%E8%A7%84%E6%A8%A1%E9%9B%86%E7%BE%A4%E8%B5%84%E6%BA%90%E7%AE%A1%E7%90%86%E6%8C%91%E6%88%98%E7%9A%84/</link>
      <pubDate>Tue, 15 Mar 2022 11:14:58 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E9%98%BF%E9%87%8C%E6%98%AF%E5%A6%82%E4%BD%95%E5%BA%94%E5%AF%B9%E8%B6%85%E5%A4%A7%E8%A7%84%E6%A8%A1%E9%9B%86%E7%BE%A4%E8%B5%84%E6%BA%90%E7%AE%A1%E7%90%86%E6%8C%91%E6%88%98%E7%9A%84/</guid>
      <description>文章作者：丁海洋（临石） 本篇文章来自 微信公众号阿里系统软件技术： 独家解密：阿里是如何应对超大规模集群资源管理挑战的？ 欢迎原链接转发，转载请前往 @留德华叫兽 的主页获取信息，盗版必究。 敬请关注和扩散本专栏及同名公众号，会邀请 全球知名学者 陆续发布运筹学、人工智能中优化理论等相关干货、 知</description>
    </item>
    <item>
      <title>流式数据处理在百度数据工厂的应用与实践</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%B5%81%E5%BC%8F%E6%95%B0%E6%8D%AE%E5%A4%84%E7%90%86%E5%9C%A8%E7%99%BE%E5%BA%A6%E6%95%B0%E6%8D%AE%E5%B7%A5%E5%8E%82%E7%9A%84%E5%BA%94%E7%94%A8%E4%B8%8E%E5%AE%9E%E8%B7%B5/</link>
      <pubDate>Tue, 15 Mar 2022 10:32:21 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%B5%81%E5%BC%8F%E6%95%B0%E6%8D%AE%E5%A4%84%E7%90%86%E5%9C%A8%E7%99%BE%E5%BA%A6%E6%95%B0%E6%8D%AE%E5%B7%A5%E5%8E%82%E7%9A%84%E5%BA%94%E7%94%A8%E4%B8%8E%E5%AE%9E%E8%B7%B5/</guid>
      <description>本文整理自百度李俊卿在 QCon 上的演讲：《流式数据处理在百度数据工厂的应用与实践》。 百度数据工厂最原先用 Hive 引擎，进行离线批量数据分析和 PB 级别的查询，处理一些核心报表数据。但是在我们推广过程中发现，用户其实还是有复杂分析、实时处理、数据挖掘的请求，我们在 Spark1.0 推出的时候，就开始跟进 Spark</description>
    </item>
    <item>
      <title>在有赞实时计算的实践</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9C%A8%E6%9C%89%E8%B5%9E%E5%AE%9E%E6%97%B6%E8%AE%A1%E7%AE%97%E7%9A%84%E5%AE%9E%E8%B7%B5/</link>
      <pubDate>Tue, 15 Mar 2022 09:17:38 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9C%A8%E6%9C%89%E8%B5%9E%E5%AE%9E%E6%97%B6%E8%AE%A1%E7%AE%97%E7%9A%84%E5%AE%9E%E8%B7%B5/</guid>
      <description>转载自： 有赞技术团队博客 一、前言 这篇主要由五个部分来组成： 首先是有赞的实时平台架构。 其次是在调研阶段我们为什么选择了 Flink。在这个部分，主要是 Flink 与 Spark 的 structured streaming 的一些对比和选择 Flink 的原因。 第三个就是比较重点的内容，Flink 在有赞的实践。这其中包括了我们在使用 Flink 的过程中碰到的一些坑，</description>
    </item>
    <item>
      <title>大数据凉了流式计算浪潮才刚刚开始</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%A4%A7%E6%95%B0%E6%8D%AE%E5%87%89%E4%BA%86%E6%B5%81%E5%BC%8F%E8%AE%A1%E7%AE%97%E6%B5%AA%E6%BD%AE%E6%89%8D%E5%88%9A%E5%88%9A%E5%BC%80%E5%A7%8B/</link>
      <pubDate>Tue, 15 Mar 2022 09:13:55 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%A4%A7%E6%95%B0%E6%8D%AE%E5%87%89%E4%BA%86%E6%B5%81%E5%BC%8F%E8%AE%A1%E7%AE%97%E6%B5%AA%E6%BD%AE%E6%89%8D%E5%88%9A%E5%88%9A%E5%BC%80%E5%A7%8B/</guid>
      <description>大数据凉了？No，流式计算浪潮才刚刚开始！ 原创： AI前线小组 译 AI前线 1周前 策划编辑 | Natalie 翻译｜巴真 编辑｜Debra **AI 前线导读：**本文重点讨论了大数据系统发展的历史轨迹，行文轻松活泼，内容通俗易懂，是一篇茶余饭后用来作为大数据谈资的不严肃说明文。本文翻译自《Streaming Sy</description>
    </item>
    <item>
      <title>海量日志实时收集系统架构设计与语言实现</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%B5%B7%E9%87%8F%E6%97%A5%E5%BF%97%E5%AE%9E%E6%97%B6%E6%94%B6%E9%9B%86%E7%B3%BB%E7%BB%9F%E6%9E%B6%E6%9E%84%E8%AE%BE%E8%AE%A1%E4%B8%8E%E8%AF%AD%E8%A8%80%E5%AE%9E%E7%8E%B0/</link>
      <pubDate>Tue, 15 Mar 2022 09:08:41 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%B5%B7%E9%87%8F%E6%97%A5%E5%BF%97%E5%AE%9E%E6%97%B6%E6%94%B6%E9%9B%86%E7%B3%BB%E7%BB%9F%E6%9E%B6%E6%9E%84%E8%AE%BE%E8%AE%A1%E4%B8%8E%E8%AF%AD%E8%A8%80%E5%AE%9E%E7%8E%B0/</guid>
      <description>日志收集系统应该说是到达一定规模的公司的标配了，一个能满足业务需求、运维成本低、稳定的日志收集系统对于运维的同学和日志使用方的同学都是非常nice的。然而这时理想中的日志收集系统，现实往往不是这样的&amp;hellip;本篇的主要内容是：首先吐槽一下公司以前的日志收集和上传；介绍新的实</description>
    </item>
    <item>
      <title>干货之性能优化</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%B9%B2%E8%B4%A7%E4%B9%8B%E6%80%A7%E8%83%BD%E4%BC%98%E5%8C%96/</link>
      <pubDate>Tue, 15 Mar 2022 09:06:33 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%B9%B2%E8%B4%A7%E4%B9%8B%E6%80%A7%E8%83%BD%E4%BC%98%E5%8C%96/</guid>
      <description>1、诊断Spark程序内存的消耗 A、 Spark程序 中 内存 都花费在哪里？ Ø每个Java对象，都有一个对象头，会占用16个字节，主要是包括了一些对象的元信息，比如指向它的类的指针。如果一个对象本身很小，比如就包括了一个int类型的field，那么它的对象头实际上占用的内存比对象自己还</description>
    </item>
    <item>
      <title>基于的严选实时数仓实践</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9F%BA%E4%BA%8E%E7%9A%84%E4%B8%A5%E9%80%89%E5%AE%9E%E6%97%B6%E6%95%B0%E4%BB%93%E5%AE%9E%E8%B7%B5/</link>
      <pubDate>Tue, 15 Mar 2022 09:06:27 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9F%BA%E4%BA%8E%E7%9A%84%E4%B8%A5%E9%80%89%E5%AE%9E%E6%97%B6%E6%95%B0%E4%BB%93%E5%AE%9E%E8%B7%B5/</guid>
      <description>分享嘉宾： 杨雄 网易严选 资深研发工程师 内容来源： DataFun Talk《基于Flink的严选实时数仓实践》 出品社区： DataFun 今天分享的内容主要分为四个部分，首先会介绍下严选实时数仓的背景、产生的一些问题。然后是针对这些背景和问题对实时数仓的整体设计和具体的实施方案，接着会介绍下在实时数仓的数据质量方</description>
    </item>
    <item>
      <title>真实生产案例消息中间件如何处理消费失败的消息</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E7%9C%9F%E5%AE%9E%E7%94%9F%E4%BA%A7%E6%A1%88%E4%BE%8B%E6%B6%88%E6%81%AF%E4%B8%AD%E9%97%B4%E4%BB%B6%E5%A6%82%E4%BD%95%E5%A4%84%E7%90%86%E6%B6%88%E8%B4%B9%E5%A4%B1%E8%B4%A5%E7%9A%84%E6%B6%88%E6%81%AF/</link>
      <pubDate>Tue, 15 Mar 2022 09:05:42 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E7%9C%9F%E5%AE%9E%E7%94%9F%E4%BA%A7%E6%A1%88%E4%BE%8B%E6%B6%88%E6%81%AF%E4%B8%AD%E9%97%B4%E4%BB%B6%E5%A6%82%E4%BD%95%E5%A4%84%E7%90%86%E6%B6%88%E8%B4%B9%E5%A4%B1%E8%B4%A5%E7%9A%84%E6%B6%88%E6%81%AF/</guid>
      <description>爱钓鱼的桌子哥，资深架构师 先后工作于滴滴、百度、字节跳动等国内一线互联网大厂，从事基础架构相关工作。带领团队设计与构建了大规模的分布式存储系统、分布式消息中间件、分布式数据库，对分布式架构设计、系统高可用体系构建、基础中间件架构都有丰富的经验。 1、消息中间件在生产系统中的使用 下图</description>
    </item>
    <item>
      <title>每日生产万亿消息数据入库腾讯如何突破大数据分析架构瓶颈</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%AF%8F%E6%97%A5%E7%94%9F%E4%BA%A7%E4%B8%87%E4%BA%BF%E6%B6%88%E6%81%AF%E6%95%B0%E6%8D%AE%E5%85%A5%E5%BA%93%E8%85%BE%E8%AE%AF%E5%A6%82%E4%BD%95%E7%AA%81%E7%A0%B4%E5%A4%A7%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90%E6%9E%B6%E6%9E%84%E7%93%B6%E9%A2%88/</link>
      <pubDate>Tue, 15 Mar 2022 08:59:02 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%AF%8F%E6%97%A5%E7%94%9F%E4%BA%A7%E4%B8%87%E4%BA%BF%E6%B6%88%E6%81%AF%E6%95%B0%E6%8D%AE%E5%85%A5%E5%BA%93%E8%85%BE%E8%AE%AF%E5%A6%82%E4%BD%95%E7%AA%81%E7%A0%B4%E5%A4%A7%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90%E6%9E%B6%E6%9E%84%E7%93%B6%E9%A2%88/</guid>
      <description>作者： 彭渊 2018 年 11 月 20 日 背景介绍 对于腾讯庞大的大数据分析业务，几千台的 Hadoop 集群，近百 P 级的存储总量，每日产生万亿的消息数据入库，需要针对几十亿 IMEI 手机设备去重，并关联数千亿的历史全表，进行曝光、点击、PV、UV、日活、新增、留存等统计指标分析，当前所有业务的 ETL 清洗、统计计算、用户画像都</description>
    </item>
    <item>
      <title>携程金融大数据风控算法实践</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%90%BA%E7%A8%8B%E9%87%91%E8%9E%8D%E5%A4%A7%E6%95%B0%E6%8D%AE%E9%A3%8E%E6%8E%A7%E7%AE%97%E6%B3%95%E5%AE%9E%E8%B7%B5/</link>
      <pubDate>Tue, 15 Mar 2022 08:58:54 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%90%BA%E7%A8%8B%E9%87%91%E8%9E%8D%E5%A4%A7%E6%95%B0%E6%8D%AE%E9%A3%8E%E6%8E%A7%E7%AE%97%E6%B3%95%E5%AE%9E%E8%B7%B5/</guid>
      <description>导读：本次报告曾老师主要分享了携程金融风控算法从0-1的发展进程，以时间为主线，经历了数据样本由少到多，特征由粗到细，模型由简单到复杂，效果由坏到好的全过程，重点以申请评分模型和反欺诈模型进行阐述，是一次很好的风控模型实践报告。 「业务介绍」 模型一定是基于业务的，所以首先介绍一下携</description>
    </item>
    <item>
      <title>一文解说所有用法</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E4%B8%80%E6%96%87%E8%A7%A3%E8%AF%B4%E6%89%80%E6%9C%89%E7%94%A8%E6%B3%95/</link>
      <pubDate>Tue, 15 Mar 2022 06:18:25 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E4%B8%80%E6%96%87%E8%A7%A3%E8%AF%B4%E6%89%80%E6%9C%89%E7%94%A8%E6%B3%95/</guid>
      <description>Trait基础 在Scala中，Trait是一种特殊概念。首先，Trait可以被作为接口来使用，此时Trait与Java的接口非常类似。同时在Trait可以定义抽象方法，其与抽象类中的抽象方法一样，不给出方法的具体实现。 _注意：_类使用extends继承Trait，与Java不同，</description>
    </item>
    <item>
      <title>团队开源新作全流程机器学习平台</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9B%A2%E9%98%9F%E5%BC%80%E6%BA%90%E6%96%B0%E4%BD%9C%E5%85%A8%E6%B5%81%E7%A8%8B%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0%E5%B9%B3%E5%8F%B0/</link>
      <pubDate>Tue, 15 Mar 2022 03:20:36 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9B%A2%E9%98%9F%E5%BC%80%E6%BA%90%E6%96%B0%E4%BD%9C%E5%85%A8%E6%B5%81%E7%A8%8B%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0%E5%B9%B3%E5%8F%B0/</guid>
      <description>策划编辑 | Natalie 作者 | Matei Zaharia 译者 | 无明 编辑 | Vincent **AI 前线导读：**在昨天开幕的 Spark+AI Summit 大会上，Spark 和 Mesos 的核心作者兼 Databrick 首席技术专家 Matei Zaharia 宣布推出开源机器学习平台 MLflow，这是一个能够覆盖机器学习全流程（从数据准备到模型训练到最终部署）的新平台，旨在为数据科学家构建、测试和部署机器学习模型</description>
    </item>
    <item>
      <title>面向对象编程之类和对象</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E9%9D%A2%E5%90%91%E5%AF%B9%E8%B1%A1%E7%BC%96%E7%A8%8B%E4%B9%8B%E7%B1%BB%E5%92%8C%E5%AF%B9%E8%B1%A1/</link>
      <pubDate>Tue, 15 Mar 2022 03:10:39 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E9%9D%A2%E5%90%91%E5%AF%B9%E8%B1%A1%E7%BC%96%E7%A8%8B%E4%B9%8B%E7%B1%BB%E5%92%8C%E5%AF%B9%E8%B1%A1/</guid>
      <description>定义一个类 1 // 定义类，包含field及方法 2 scala&amp;gt; :paste 3 // Entering paste mode (ctrl-D to finish) 4 class HelloWorld { 5 private var name = &amp;#34;leo&amp;#34; 6 def sayHello() {print(&amp;#34;Hello, &amp;#34; + name)} 7 def getName = name 8 } 9 // Exiting paste mode, now interpreting. 10 defined class HelloWorld 11 // 创建类的对象，并调用其方法 12 scala&amp;gt; val helloWorld = new HelloWorld 13 helloWorld: HelloWorld = HelloWorld@380e4452 14 // 如果方法无参，可以不加括号，如果定义方法时不带括号，则调用方法时也不能带括号 15 scala&amp;gt; helloWorld.sayHello() 16 Hello, leo</description>
    </item>
    <item>
      <title>宽依赖窄依赖总结</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%AE%BD%E4%BE%9D%E8%B5%96%E7%AA%84%E4%BE%9D%E8%B5%96%E6%80%BB%E7%BB%93/</link>
      <pubDate>Tue, 15 Mar 2022 03:10:35 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%AE%BD%E4%BE%9D%E8%B5%96%E7%AA%84%E4%BE%9D%E8%B5%96%E6%80%BB%E7%BB%93/</guid>
      <description>宽依赖与窄依赖 窄依赖（narrow dependency）和宽依赖（wide dependency, 也称 shuffle dependency）. 窄依赖是指父RDD的每个分区只被子RDD的一个分区所使用， 子RDD分区通常对应常数个父RDD分区(O(1)，与数据规模无关), map/filter和union 相应的，宽依赖是</description>
    </item>
    <item>
      <title>用取代知乎实时数仓架构演进</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E7%94%A8%E5%8F%96%E4%BB%A3%E7%9F%A5%E4%B9%8E%E5%AE%9E%E6%97%B6%E6%95%B0%E4%BB%93%E6%9E%B6%E6%9E%84%E6%BC%94%E8%BF%9B/</link>
      <pubDate>Tue, 15 Mar 2022 03:10:20 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E7%94%A8%E5%8F%96%E4%BB%A3%E7%9F%A5%E4%B9%8E%E5%AE%9E%E6%97%B6%E6%95%B0%E4%BB%93%E6%9E%B6%E6%9E%84%E6%BC%94%E8%BF%9B/</guid>
      <description>“数据智能” (Data Intelligence) 有一个必须且基础的环节，就是数据仓库的建设，同时，数据仓库也是公司数据发展到一定规模后必然会提供的一种基础服务。从智能商业的角度来讲，数据的结果代表了用户的反馈，获取结果的及时性就显得尤为重要，快速的获取数据反馈能够帮助公司更快的做出决策，更好的进行产品迭代，实时</description>
    </item>
    <item>
      <title>面试官如果让你设计一个消息中间件如何将其网络通信性能优化倍以上石杉的架构笔记</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E9%9D%A2%E8%AF%95%E5%AE%98%E5%A6%82%E6%9E%9C%E8%AE%A9%E4%BD%A0%E8%AE%BE%E8%AE%A1%E4%B8%80%E4%B8%AA%E6%B6%88%E6%81%AF%E4%B8%AD%E9%97%B4%E4%BB%B6%E5%A6%82%E4%BD%95%E5%B0%86%E5%85%B6%E7%BD%91%E7%BB%9C%E9%80%9A%E4%BF%A1%E6%80%A7%E8%83%BD%E4%BC%98%E5%8C%96%E5%80%8D%E4%BB%A5%E4%B8%8A%E7%9F%B3%E6%9D%89%E7%9A%84%E6%9E%B6%E6%9E%84%E7%AC%94%E8%AE%B0/</link>
      <pubDate>Tue, 15 Mar 2022 03:09:56 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E9%9D%A2%E8%AF%95%E5%AE%98%E5%A6%82%E6%9E%9C%E8%AE%A9%E4%BD%A0%E8%AE%BE%E8%AE%A1%E4%B8%80%E4%B8%AA%E6%B6%88%E6%81%AF%E4%B8%AD%E9%97%B4%E4%BB%B6%E5%A6%82%E4%BD%95%E5%B0%86%E5%85%B6%E7%BD%91%E7%BB%9C%E9%80%9A%E4%BF%A1%E6%80%A7%E8%83%BD%E4%BC%98%E5%8C%96%E5%80%8D%E4%BB%A5%E4%B8%8A%E7%9F%B3%E6%9D%89%E7%9A%84%E6%9E%B6%E6%9E%84%E7%AC%94%E8%AE%B0/</guid>
      <description>目录 1、客户端与服务端的交互 2、频繁网络通信带来的性能低下问题 3、batch机制：多条消息打包成一个batch 4、request机制：多个batch打包成一个request “这篇文章，给大家聊一个消息中间件相关的技术话题，对于一个优秀的消息中间件而言，客户端与服务端通信的时候，对</description>
    </item>
    <item>
      <title>有赞百亿级日志系统架构设计</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%9C%89%E8%B5%9E%E7%99%BE%E4%BA%BF%E7%BA%A7%E6%97%A5%E5%BF%97%E7%B3%BB%E7%BB%9F%E6%9E%B6%E6%9E%84%E8%AE%BE%E8%AE%A1/</link>
      <pubDate>Tue, 15 Mar 2022 03:08:37 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%9C%89%E8%B5%9E%E7%99%BE%E4%BA%BF%E7%BA%A7%E6%97%A5%E5%BF%97%E7%B3%BB%E7%BB%9F%E6%9E%B6%E6%9E%84%E8%AE%BE%E8%AE%A1/</guid>
      <description>一、概述 日志是记录系统中各种问题信息的关键，也是一种常见的海量数据。日志平台为集团所有业务系统提供日志采集、消费、分析、存储、索引和查询的一站式日志服务。主要为了解决日志分散不方便查看、日志搜索操作复杂且效率低、业务异常无法及时发现等等问题。 随着有赞业务的发展与增长，每天都会产生</description>
    </item>
    <item>
      <title>一个轻量级查询框架</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E4%B8%80%E4%B8%AA%E8%BD%BB%E9%87%8F%E7%BA%A7%E6%9F%A5%E8%AF%A2%E6%A1%86%E6%9E%B6/</link>
      <pubDate>Tue, 15 Mar 2022 03:08:10 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E4%B8%80%E4%B8%AA%E8%BD%BB%E9%87%8F%E7%BA%A7%E6%9F%A5%E8%AF%A2%E6%A1%86%E6%9E%B6/</guid>
      <description>Walrus Introduction walrus是一个轻量级olap查询框架。它支持多源异构数据源(hdfs,mysql,clickhouse,kylin,druid&amp;hellip;)，采用 apache spark 作为聚合计算引擎，在雪花模型 上通过json提供ETL建模和ad hoc数据查询服务。 Background 数据分析、ETL开发人员的日常工作</description>
    </item>
    <item>
      <title>网易迁移在网易传媒的实践</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E7%BD%91%E6%98%93%E8%BF%81%E7%A7%BB%E5%9C%A8%E7%BD%91%E6%98%93%E4%BC%A0%E5%AA%92%E7%9A%84%E5%AE%9E%E8%B7%B5/</link>
      <pubDate>Tue, 15 Mar 2022 03:08:05 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E7%BD%91%E6%98%93%E8%BF%81%E7%A7%BB%E5%9C%A8%E7%BD%91%E6%98%93%E4%BC%A0%E5%AA%92%E7%9A%84%E5%AE%9E%E8%B7%B5/</guid>
      <description>作者： 易同学 引言：把基于mapreduce的离线hiveSQL任务迁移到sparkSQL，不但能大幅缩短任务运行时间，还能节省不少计算资源。最近我们也把组内2000左右的hivesql任务迁移到了sparkSQL，这里做个简单的记录和分享，本文偏重于具体条件下的方案选择。 迁移背景</description>
    </item>
    <item>
      <title>百分点大数据技术团队基于多任务的数据同步方案实践</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E7%99%BE%E5%88%86%E7%82%B9%E5%A4%A7%E6%95%B0%E6%8D%AE%E6%8A%80%E6%9C%AF%E5%9B%A2%E9%98%9F%E5%9F%BA%E4%BA%8E%E5%A4%9A%E4%BB%BB%E5%8A%A1%E7%9A%84%E6%95%B0%E6%8D%AE%E5%90%8C%E6%AD%A5%E6%96%B9%E6%A1%88%E5%AE%9E%E8%B7%B5/</link>
      <pubDate>Tue, 15 Mar 2022 03:06:29 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E7%99%BE%E5%88%86%E7%82%B9%E5%A4%A7%E6%95%B0%E6%8D%AE%E6%8A%80%E6%9C%AF%E5%9B%A2%E9%98%9F%E5%9F%BA%E4%BA%8E%E5%A4%9A%E4%BB%BB%E5%8A%A1%E7%9A%84%E6%95%B0%E6%8D%AE%E5%90%8C%E6%AD%A5%E6%96%B9%E6%A1%88%E5%AE%9E%E8%B7%B5/</guid>
      <description>编者按 在数据大爆发的时代里，数据分析和应用领域对数据即查即得的需求越来越迫切，ClickHouse凭借无与伦比的查询速度脱颖而出，被广泛应用于众多领域和方案中，是优秀的OLAP代表者。但是实践应用中，尤其是需要代码操作时会遇到一定的性能问题，尤其在数据量大的情况下表现更为突出。 本</description>
    </item>
    <item>
      <title>回顾蚂蚁数据分析平台的演进及数据分析方法的应用</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9B%9E%E9%A1%BE%E8%9A%82%E8%9A%81%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90%E5%B9%B3%E5%8F%B0%E7%9A%84%E6%BC%94%E8%BF%9B%E5%8F%8A%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90%E6%96%B9%E6%B3%95%E7%9A%84%E5%BA%94%E7%94%A8/</link>
      <pubDate>Tue, 15 Mar 2022 01:27:16 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9B%9E%E9%A1%BE%E8%9A%82%E8%9A%81%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90%E5%B9%B3%E5%8F%B0%E7%9A%84%E6%BC%94%E8%BF%9B%E5%8F%8A%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90%E6%96%B9%E6%B3%95%E7%9A%84%E5%BA%94%E7%94%A8/</guid>
      <description>分享嘉宾： 杨军 蚂蚁金服 高级技术专家 编辑整理： 兴金朝 内容来源：DataFun Talk《数据分析平台：平台演进及数据分析方法应用》 出品社区： DataFun 注：文末附有蚂蚁金服的内推信息，感兴趣的小伙伴可以关注下。 大家好，今天主要分享数据分析平台的平台演进以及我们在上面沉淀的一些数据分析方法是如何</description>
    </item>
    <item>
      <title>大数据实战以及三种大揭秘</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%A4%A7%E6%95%B0%E6%8D%AE%E5%AE%9E%E6%88%98%E4%BB%A5%E5%8F%8A%E4%B8%89%E7%A7%8D%E5%A4%A7%E6%8F%AD%E7%A7%98/</link>
      <pubDate>Mon, 14 Mar 2022 18:38:49 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%A4%A7%E6%95%B0%E6%8D%AE%E5%AE%9E%E6%88%98%E4%BB%A5%E5%8F%8A%E4%B8%89%E7%A7%8D%E5%A4%A7%E6%8F%AD%E7%A7%98/</guid>
      <description>易小云： Join操作是数据库和大数据计算中的高级特性，大多数场景都需要进行复杂的Join操作，本文从原理层面介绍了SparkSQL支持的常见Join算法及其适用场景。 本文2383字 建议阅读时长6分钟 Join背景介绍 Join是数据库查询永远绕不开的话题，传统查询SQL技术总体可以分</description>
    </item>
    <item>
      <title>及核心原理及实践</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%8F%8A%E6%A0%B8%E5%BF%83%E5%8E%9F%E7%90%86%E5%8F%8A%E5%AE%9E%E8%B7%B5/</link>
      <pubDate>Mon, 14 Mar 2022 18:17:08 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%8F%8A%E6%A0%B8%E5%BF%83%E5%8E%9F%E7%90%86%E5%8F%8A%E5%AE%9E%E8%B7%B5/</guid>
      <description>Spark 已经成为广告、报表以及推荐系统等大数据计算场景中首选系统，因效率高，易用以及通用性越来越得到大家的青睐，我自己最近半年在接触 spark 以及 spark streaming 之后，对 spark 技术的使用有一些自己的经验积累以及心得体会，在此分享给大家。本文依次从 spark 生态，原理，基本概念，spark streaming 原理及实践，还有 spark 调优以及环</description>
    </item>
    <item>
      <title>快手万亿级别集群应用实践与技术演进之路</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%BF%AB%E6%89%8B%E4%B8%87%E4%BA%BF%E7%BA%A7%E5%88%AB%E9%9B%86%E7%BE%A4%E5%BA%94%E7%94%A8%E5%AE%9E%E8%B7%B5%E4%B8%8E%E6%8A%80%E6%9C%AF%E6%BC%94%E8%BF%9B%E4%B9%8B%E8%B7%AF/</link>
      <pubDate>Mon, 14 Mar 2022 17:32:53 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%BF%AB%E6%89%8B%E4%B8%87%E4%BA%BF%E7%BA%A7%E5%88%AB%E9%9B%86%E7%BE%A4%E5%BA%94%E7%94%A8%E5%AE%9E%E8%B7%B5%E4%B8%8E%E6%8A%80%E6%9C%AF%E6%BC%94%E8%BF%9B%E4%B9%8B%E8%B7%AF/</guid>
      <description>赵健博 Kafka 系统在快手有着很广泛的应用，随着其业务的高速发展， Kafka 集群的规模也成指数增长，目前快手 Kafka 集群日消息处理总量达数万亿级别，峰值超过 1 亿 /s。与此同时，快手也面临了很多新问题与技术挑战。本文整理自快手高级架构师、大数据架构团队负责人赵健博在 QCon 全球软件开发大会（北京）2019 上的</description>
    </item>
    <item>
      <title>性能调优总结</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%80%A7%E8%83%BD%E8%B0%83%E4%BC%98%E6%80%BB%E7%BB%93/</link>
      <pubDate>Mon, 14 Mar 2022 17:24:56 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%80%A7%E8%83%BD%E8%B0%83%E4%BC%98%E6%80%BB%E7%BB%93/</guid>
      <description>使用正确的 transformations操作 虽然开发者达到某一目标，可以通过不同的transformations操作，但是有时候不同的姿势，性能差异非常明显。优化姿势的总体目标是尽可能少的产生 shuffle， 和待被 shuffled data。因为shffule过程存在写盘和节点间网络IO的开销 repartition</description>
    </item>
  </channel>
</rss>
