<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Hadoop on 知识铺的博客</title>
    <link>https://index.zshipu.com/geek/tags/hadoop/</link>
    <description>Recent content in Hadoop on 知识铺的博客</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>zh-CN</language>
    <lastBuildDate>Tue, 15 Mar 2022 11:14:58 +0800</lastBuildDate>
    <atom:link href="https://index.zshipu.com/geek/tags/hadoop/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>阿里是如何应对超大规模集群资源管理挑战的</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E9%98%BF%E9%87%8C%E6%98%AF%E5%A6%82%E4%BD%95%E5%BA%94%E5%AF%B9%E8%B6%85%E5%A4%A7%E8%A7%84%E6%A8%A1%E9%9B%86%E7%BE%A4%E8%B5%84%E6%BA%90%E7%AE%A1%E7%90%86%E6%8C%91%E6%88%98%E7%9A%84/</link>
      <pubDate>Tue, 15 Mar 2022 11:14:58 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E9%98%BF%E9%87%8C%E6%98%AF%E5%A6%82%E4%BD%95%E5%BA%94%E5%AF%B9%E8%B6%85%E5%A4%A7%E8%A7%84%E6%A8%A1%E9%9B%86%E7%BE%A4%E8%B5%84%E6%BA%90%E7%AE%A1%E7%90%86%E6%8C%91%E6%88%98%E7%9A%84/</guid>
      <description>文章作者：丁海洋（临石） 本篇文章来自 微信公众号阿里系统软件技术： 独家解密：阿里是如何应对超大规模集群资源管理挑战的？ 欢迎原链接转发，转载请前往 @留德华叫兽 的主页获取信息，盗版必究。 敬请关注和扩散本专栏及同名公众号，会邀请 全球知名学者 陆续发布运筹学、人工智能中优化理论等相关干货、 知</description>
    </item>
    <item>
      <title>大数据凉了流式计算浪潮才刚刚开始</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%A4%A7%E6%95%B0%E6%8D%AE%E5%87%89%E4%BA%86%E6%B5%81%E5%BC%8F%E8%AE%A1%E7%AE%97%E6%B5%AA%E6%BD%AE%E6%89%8D%E5%88%9A%E5%88%9A%E5%BC%80%E5%A7%8B/</link>
      <pubDate>Tue, 15 Mar 2022 09:13:55 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%A4%A7%E6%95%B0%E6%8D%AE%E5%87%89%E4%BA%86%E6%B5%81%E5%BC%8F%E8%AE%A1%E7%AE%97%E6%B5%AA%E6%BD%AE%E6%89%8D%E5%88%9A%E5%88%9A%E5%BC%80%E5%A7%8B/</guid>
      <description>大数据凉了？No，流式计算浪潮才刚刚开始！ 原创： AI前线小组 译 AI前线 1周前 策划编辑 | Natalie 翻译｜巴真 编辑｜Debra **AI 前线导读：**本文重点讨论了大数据系统发展的历史轨迹，行文轻松活泼，内容通俗易懂，是一篇茶余饭后用来作为大数据谈资的不严肃说明文。本文翻译自《Streaming Sy</description>
    </item>
    <item>
      <title>海量日志实时收集系统架构设计与语言实现</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%B5%B7%E9%87%8F%E6%97%A5%E5%BF%97%E5%AE%9E%E6%97%B6%E6%94%B6%E9%9B%86%E7%B3%BB%E7%BB%9F%E6%9E%B6%E6%9E%84%E8%AE%BE%E8%AE%A1%E4%B8%8E%E8%AF%AD%E8%A8%80%E5%AE%9E%E7%8E%B0/</link>
      <pubDate>Tue, 15 Mar 2022 09:08:41 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%B5%B7%E9%87%8F%E6%97%A5%E5%BF%97%E5%AE%9E%E6%97%B6%E6%94%B6%E9%9B%86%E7%B3%BB%E7%BB%9F%E6%9E%B6%E6%9E%84%E8%AE%BE%E8%AE%A1%E4%B8%8E%E8%AF%AD%E8%A8%80%E5%AE%9E%E7%8E%B0/</guid>
      <description>日志收集系统应该说是到达一定规模的公司的标配了，一个能满足业务需求、运维成本低、稳定的日志收集系统对于运维的同学和日志使用方的同学都是非常nice的。然而这时理想中的日志收集系统，现实往往不是这样的&amp;hellip;本篇的主要内容是：首先吐槽一下公司以前的日志收集和上传；介绍新的实</description>
    </item>
    <item>
      <title>写吞吐场景资源消耗量化分析及优化</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%86%99%E5%90%9E%E5%90%90%E5%9C%BA%E6%99%AF%E8%B5%84%E6%BA%90%E6%B6%88%E8%80%97%E9%87%8F%E5%8C%96%E5%88%86%E6%9E%90%E5%8F%8A%E4%BC%98%E5%8C%96/</link>
      <pubDate>Tue, 15 Mar 2022 09:06:48 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%86%99%E5%90%9E%E5%90%90%E5%9C%BA%E6%99%AF%E8%B5%84%E6%BA%90%E6%B6%88%E8%80%97%E9%87%8F%E5%8C%96%E5%88%86%E6%9E%90%E5%8F%8A%E4%BC%98%E5%8C%96/</guid>
      <description>一. 概述 HBase 是一个基于 Google BigTable 论文设计的高可靠性、高性能、可伸缩的分布式存储系统。 网上关于 HBase 的文章很多，官方文档介绍的也比较详细，本篇文章不介绍HBase基本的细节。 本文从 HBase 写链路开始分析，然后针对少量随机读和海量随机写入场景入手，全方面量化分析各种资源的开销, 从而做到以下两点： 在给定</description>
    </item>
    <item>
      <title>干货之性能优化</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%B9%B2%E8%B4%A7%E4%B9%8B%E6%80%A7%E8%83%BD%E4%BC%98%E5%8C%96/</link>
      <pubDate>Tue, 15 Mar 2022 09:06:33 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%B9%B2%E8%B4%A7%E4%B9%8B%E6%80%A7%E8%83%BD%E4%BC%98%E5%8C%96/</guid>
      <description>1、诊断Spark程序内存的消耗 A、 Spark程序 中 内存 都花费在哪里？ Ø每个Java对象，都有一个对象头，会占用16个字节，主要是包括了一些对象的元信息，比如指向它的类的指针。如果一个对象本身很小，比如就包括了一个int类型的field，那么它的对象头实际上占用的内存比对象自己还</description>
    </item>
    <item>
      <title>基于的严选实时数仓实践</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9F%BA%E4%BA%8E%E7%9A%84%E4%B8%A5%E9%80%89%E5%AE%9E%E6%97%B6%E6%95%B0%E4%BB%93%E5%AE%9E%E8%B7%B5/</link>
      <pubDate>Tue, 15 Mar 2022 09:06:27 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9F%BA%E4%BA%8E%E7%9A%84%E4%B8%A5%E9%80%89%E5%AE%9E%E6%97%B6%E6%95%B0%E4%BB%93%E5%AE%9E%E8%B7%B5/</guid>
      <description>分享嘉宾： 杨雄 网易严选 资深研发工程师 内容来源： DataFun Talk《基于Flink的严选实时数仓实践》 出品社区： DataFun 今天分享的内容主要分为四个部分，首先会介绍下严选实时数仓的背景、产生的一些问题。然后是针对这些背景和问题对实时数仓的整体设计和具体的实施方案，接着会介绍下在实时数仓的数据质量方</description>
    </item>
    <item>
      <title>苏宁苏宁大数据离线任务开发调度平台实践</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E8%8B%8F%E5%AE%81%E8%8B%8F%E5%AE%81%E5%A4%A7%E6%95%B0%E6%8D%AE%E7%A6%BB%E7%BA%BF%E4%BB%BB%E5%8A%A1%E5%BC%80%E5%8F%91%E8%B0%83%E5%BA%A6%E5%B9%B3%E5%8F%B0%E5%AE%9E%E8%B7%B5/</link>
      <pubDate>Tue, 15 Mar 2022 09:02:35 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E8%8B%8F%E5%AE%81%E8%8B%8F%E5%AE%81%E5%A4%A7%E6%95%B0%E6%8D%AE%E7%A6%BB%E7%BA%BF%E4%BB%BB%E5%8A%A1%E5%BC%80%E5%8F%91%E8%B0%83%E5%BA%A6%E5%B9%B3%E5%8F%B0%E5%AE%9E%E8%B7%B5/</guid>
      <description>桑强 2018 年 11 月 5 日 目录 背景 2 设计目标 2 2.1 用户交互的产品功能 2 2.2 后台调度功能 3 2.3 任务执行器功能 4 2.4 任务运维功能 5 2.5 平台对外功能 6 平台价值 7 平台建设 7 4.1 用户功能实现说明 8 4.2 调度周期设计说明 12 4.3 调度策略设计说明 13 4.4 调度流控设计说明 15 4.5 系统高可用设计说明 16 4.6 任务失败策略 17 4.7 任务运行分析设计</description>
    </item>
    <item>
      <title>每日生产万亿消息数据入库腾讯如何突破大数据分析架构瓶颈</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%AF%8F%E6%97%A5%E7%94%9F%E4%BA%A7%E4%B8%87%E4%BA%BF%E6%B6%88%E6%81%AF%E6%95%B0%E6%8D%AE%E5%85%A5%E5%BA%93%E8%85%BE%E8%AE%AF%E5%A6%82%E4%BD%95%E7%AA%81%E7%A0%B4%E5%A4%A7%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90%E6%9E%B6%E6%9E%84%E7%93%B6%E9%A2%88/</link>
      <pubDate>Tue, 15 Mar 2022 08:59:02 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%AF%8F%E6%97%A5%E7%94%9F%E4%BA%A7%E4%B8%87%E4%BA%BF%E6%B6%88%E6%81%AF%E6%95%B0%E6%8D%AE%E5%85%A5%E5%BA%93%E8%85%BE%E8%AE%AF%E5%A6%82%E4%BD%95%E7%AA%81%E7%A0%B4%E5%A4%A7%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90%E6%9E%B6%E6%9E%84%E7%93%B6%E9%A2%88/</guid>
      <description>作者： 彭渊 2018 年 11 月 20 日 背景介绍 对于腾讯庞大的大数据分析业务，几千台的 Hadoop 集群，近百 P 级的存储总量，每日产生万亿的消息数据入库，需要针对几十亿 IMEI 手机设备去重，并关联数千亿的历史全表，进行曝光、点击、PV、UV、日活、新增、留存等统计指标分析，当前所有业务的 ETL 清洗、统计计算、用户画像都</description>
    </item>
    <item>
      <title>有赞数据资产赞之治理</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%9C%89%E8%B5%9E%E6%95%B0%E6%8D%AE%E8%B5%84%E4%BA%A7%E8%B5%9E%E4%B9%8B%E6%B2%BB%E7%90%86/</link>
      <pubDate>Tue, 15 Mar 2022 08:58:38 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%9C%89%E8%B5%9E%E6%95%B0%E6%8D%AE%E8%B5%84%E4%BA%A7%E8%B5%9E%E4%B9%8B%E6%B2%BB%E7%90%86/</guid>
      <description>作者：见风 团队：有赞大数据团队 一、背景介绍 大数据概念的提出已十年有余，这期间风靡全球，与其相关的理论、技术和实践遍地开花，整个领域都在飞速发展。野蛮生长之下，“数据治理”的呼声水涨船高。工信部19年提出：将加强数据治理，扎实推进国家大数据发展战略，将数据治理重要性上升到新的高度。</description>
    </item>
    <item>
      <title>一条数据的之旅简明入门教程全流程</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E4%B8%80%E6%9D%A1%E6%95%B0%E6%8D%AE%E7%9A%84%E4%B9%8B%E6%97%85%E7%AE%80%E6%98%8E%E5%85%A5%E9%97%A8%E6%95%99%E7%A8%8B%E5%85%A8%E6%B5%81%E7%A8%8B/</link>
      <pubDate>Tue, 15 Mar 2022 06:59:00 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E4%B8%80%E6%9D%A1%E6%95%B0%E6%8D%AE%E7%9A%84%E4%B9%8B%E6%97%85%E7%AE%80%E6%98%8E%E5%85%A5%E9%97%A8%E6%95%99%E7%A8%8B%E5%85%A8%E6%B5%81%E7%A8%8B/</guid>
      <description>如果将上篇内容理解为一个冗长的&amp;quot;铺垫&amp;quot;，那么，从本文开始，&amp;ldquo;剧情&amp;quot;才开始正式展开。本文基于所给出的样例数据，介绍了将数据从Client写到RegionServer的全流程。 本文整体思路： 1. 前文内容回顾 2. 示例数据 3. HBase可选接口介绍 4. 表</description>
    </item>
    <item>
      <title>大数据实战以及三种大揭秘</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%A4%A7%E6%95%B0%E6%8D%AE%E5%AE%9E%E6%88%98%E4%BB%A5%E5%8F%8A%E4%B8%89%E7%A7%8D%E5%A4%A7%E6%8F%AD%E7%A7%98/</link>
      <pubDate>Mon, 14 Mar 2022 18:38:49 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%A4%A7%E6%95%B0%E6%8D%AE%E5%AE%9E%E6%88%98%E4%BB%A5%E5%8F%8A%E4%B8%89%E7%A7%8D%E5%A4%A7%E6%8F%AD%E7%A7%98/</guid>
      <description>易小云： Join操作是数据库和大数据计算中的高级特性，大多数场景都需要进行复杂的Join操作，本文从原理层面介绍了SparkSQL支持的常见Join算法及其适用场景。 本文2383字 建议阅读时长6分钟 Join背景介绍 Join是数据库查询永远绕不开的话题，传统查询SQL技术总体可以分</description>
    </item>
    <item>
      <title>回顾云上冷热分离实践</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9B%9E%E9%A1%BE%E4%BA%91%E4%B8%8A%E5%86%B7%E7%83%AD%E5%88%86%E7%A6%BB%E5%AE%9E%E8%B7%B5/</link>
      <pubDate>Mon, 14 Mar 2022 18:02:18 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%9B%9E%E9%A1%BE%E4%BA%91%E4%B8%8A%E5%86%B7%E7%83%AD%E5%88%86%E7%A6%BB%E5%AE%9E%E8%B7%B5/</guid>
      <description>本文根据阿里云技术专家郭泽晖在中国HBase技术社区第3届MeetUp杭州站中分享的《云上HBase冷热分离实践》编辑整理而成。 今天分享的内容分为两个方面，首先会介绍下冷数据的经典场景，以及如果使用开源的HBase应该如何实现，最后介绍下HBase在云端的实现方案。 冷数据定义就是</description>
    </item>
    <item>
      <title>快手万亿级别集群应用实践与技术演进之路</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%BF%AB%E6%89%8B%E4%B8%87%E4%BA%BF%E7%BA%A7%E5%88%AB%E9%9B%86%E7%BE%A4%E5%BA%94%E7%94%A8%E5%AE%9E%E8%B7%B5%E4%B8%8E%E6%8A%80%E6%9C%AF%E6%BC%94%E8%BF%9B%E4%B9%8B%E8%B7%AF/</link>
      <pubDate>Mon, 14 Mar 2022 17:32:53 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E5%BF%AB%E6%89%8B%E4%B8%87%E4%BA%BF%E7%BA%A7%E5%88%AB%E9%9B%86%E7%BE%A4%E5%BA%94%E7%94%A8%E5%AE%9E%E8%B7%B5%E4%B8%8E%E6%8A%80%E6%9C%AF%E6%BC%94%E8%BF%9B%E4%B9%8B%E8%B7%AF/</guid>
      <description>赵健博 Kafka 系统在快手有着很广泛的应用，随着其业务的高速发展， Kafka 集群的规模也成指数增长，目前快手 Kafka 集群日消息处理总量达数万亿级别，峰值超过 1 亿 /s。与此同时，快手也面临了很多新问题与技术挑战。本文整理自快手高级架构师、大数据架构团队负责人赵健博在 QCon 全球软件开发大会（北京）2019 上的</description>
    </item>
    <item>
      <title>性能调优总结</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%80%A7%E8%83%BD%E8%B0%83%E4%BC%98%E6%80%BB%E7%BB%93/</link>
      <pubDate>Mon, 14 Mar 2022 17:24:56 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E6%80%A7%E8%83%BD%E8%B0%83%E4%BC%98%E6%80%BB%E7%BB%93/</guid>
      <description>使用正确的 transformations操作 虽然开发者达到某一目标，可以通过不同的transformations操作，但是有时候不同的姿势，性能差异非常明显。优化姿势的总体目标是尽可能少的产生 shuffle， 和待被 shuffled data。因为shffule过程存在写盘和节点间网络IO的开销 repartition</description>
    </item>
    <item>
      <title>一条数据的之旅简明入门教程与</title>
      <link>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E4%B8%80%E6%9D%A1%E6%95%B0%E6%8D%AE%E7%9A%84%E4%B9%8B%E6%97%85%E7%AE%80%E6%98%8E%E5%85%A5%E9%97%A8%E6%95%99%E7%A8%8B%E4%B8%8E/</link>
      <pubDate>Mon, 14 Mar 2022 16:40:33 +0800</pubDate>
      <guid>https://index.zshipu.com/geek/post/%E4%BA%92%E8%81%94%E7%BD%91/%E4%B8%80%E6%9D%A1%E6%95%B0%E6%8D%AE%E7%9A%84%E4%B9%8B%E6%97%85%E7%AE%80%E6%98%8E%E5%85%A5%E9%97%A8%E6%95%99%E7%A8%8B%E4%B8%8E/</guid>
      <description>Flush与Compaction其实属于Write流程的继续，所以本文应该称之为&amp;quot; Write后传&amp;quot;。在2.0版本中，最主要的变化就是新增了In-memory Flush/Compaction，而DateTieredCompaction并不算2.0新加入的特性，2</description>
    </item>
  </channel>
</rss>
