3-4 字节跳动全域数据集成演进历程.pdf
1、字节跳动全域数据集成演进历程李畅 字节跳动大数据工程师|l 16年加入字节跳动开发套件团队,从0到1设计、研发了面向字节各业务线的数据集成服务l 专注大规模数据的分布式计算和传输领域,提供高效、可靠的全域数据集成解决方案个人简介|目录01数据集成背景02数据集成演进历程03通用能力改造04未来展望数据集成背景01|数据集成背景介绍数据集成是数据中台建设的基础,主要解决异构数据源间数据传输、加工和处理Dataleap是字节跳动自研的一站式数据中台套件,并服务字节内部各业务线数据建设场景外部数据源 数据库 消息队列 其它存储数据研发平台Dataleap 开发 集成 治理外部系统 数据分析 在线数据
2、服务 机器学习全域数据集成演进历程02|2022-now:通用能力输出 降低数据建设成本|全域数据集成演进历程2018之前:每个通道各自实现 MR/Spark/etc.,M*N套系统2018-2019:统一架构,覆盖批式场景 基于Flink 引擎,完成批式场景统一2020-2021:覆盖流式场景,批流一体 覆盖流式场景,完成批流统一2021-2022:覆盖CDC场景,湖仓一体 一套系统,覆盖所有数据同步场景初始期成熟期成长期|基于Flink的异构数据源传输架构初始架构基于Flink 1.5 DataSet API,只覆盖批式场景提供抽象的BaseInput和BaseOutput,实现数据源种类
3、线性扩展框架层提供统一基础服务,包括类型系统、自动并发度、脏数据检测、流控等支持Yarn部署,资源管理比较弹性|Flink Batch任务进度查询原始改进|Flink Batch任务进度查询Source进度SourceProgress=CompletedSplits/TotalSplitsOperator进度CurrentProgress=Min(ParentProgress,Current-Read-Records/Parent-Write-Records)Flink Task执行过程Flink是以任务驱动,JM构建好Split,Task常驻,不断向JM请求新的Split所有Split处理完





点击查看更多