【05 计算平台 蓉荣】Flink 批处理及其应⽤## Flink 批处理及其应用 ## What is Apache Flink $ ^{*} $ Apache Flink 是一个分布式大数据处理引擎 $ ^{*} $ 可对有限数据流和无限数据流进行有状态计算 * 可部署在各种集群环境 * 对各种大小的数据规模进行快速计算 ## 为什么Flink能做批处理  低延时 #### Hive vs. Spark vs. Flink Batch ||Hive/Hadoop|Spark|Flink| |---|---|---|---| |模型|MR|MR(Memory/Disk)|Pipeline| |吞吐|TB-PB|TB-PB|未经大规模生产验证| | |易用性|一般|易用|一般| |工具/生态|一般|丰富|一般| ## Flink Batch应用 - 数据湖 ### Data Lake vs. Data Warehouse  ## Flink Batch应用 – 数据湖  阿里巴巴高级技术专家 ## 过去 ## 一 切从2014年开始  StratoSphere Above the Clouds  2009 - 2014 2014 • 柏林工业大学博士生项目 - 基于流式 runtime 的批处理引擎 • 2014 年 8 月份 发布 Flink 0.6.0 ## 阿里云 2019阿里云峰会·上海开发者大会 Flink 0.7 ## 2014 年 12 月份 发布 – 开始正式支持 DataStream DataStream API Stream 8d2791cad3421/p4_1.jpg) DataSet API Batch Processing Runtime Distributed Streaming Dataflow Flink 0.9 ## 2015 年 6 月份 发布 – 开始内置支持 State  Practices of integrating RocketMQ with Flink  The trend of RocketMQ ## Apache RocketMQ streaming ecosystem projects • RocketMQ-Flink: https://github.com/apache/rocketmq-externals/tree/master/rocketmq-flink • RocketMQ-Spark: https://github.com/apache/rocketmq-extern0 码力 | 30 页 | 24.22 MB | 2 年前3
Flink如何实时分析Iceberg数据湖的CDC数据## Flink如何实时分析Iceberg数据湖的CDC数据 阿里巴巴 李劲松/胡争 FLINK FORWARD #ASIA 2020 #1 #2 #3 #4 常见的CDC 为何选择 Flink 如何实时写 未来规划 分析方案 + Iceberg 入读取 FLINK FORWARD #ASIA 2020 ## #1 常见的CDC分析方案 ## 离线 HBase 集群分析 CDC 2、HBase集群维护成本较高。 3、通过RegionServer定位HFile,Server的优化和缓存完全用不上。 4、数据格式绑定HFile,不方便拓展到Parquet、Avro、Orc等。 FLINK FORWARD #ASIA 2020 ## Apache Kudu 维护 CDC 数据集 ## MySQL ## 方案评估 优点 1、支持实时更新数据,时效性佳。 2、列存加速,适合OLAP分析。 4、不支持增量拉取。 FLINK FORWARD #ASIA 2020 ## MySQL → GQOOP → HVE ## 方案评估 优点 1、流程能工作 2、Hive存量数据不受增量数据影响。 ## 缺点 1、数据不是实时写入; 2、每次数据导致都要 MERGE 存量数据。T+1 方式更新,时效性差。 3、不支持实时upsert。 FLINK FORWARD #ASIA 20200 码力 | 36 页 | 781.69 KB | 2 年前3
Introduction to Apache Flink and Apache Kafka - CS 591 K1: Data Stream Processing and Analytics Springand Analytics Spring 2020 ## 1 /30: Introduction to Apache Flink and Apache Kafka Vasiliki (Vasia) Kalavri vkalavri@bu.edu ## Apache Flink • An open-source, distributed data analysis framework • True Data Set Operator Data Set Sink Source Data Stream Operator Data Stream Sink Writing a Flink Program 1. Bootstrap Sources 2. Apply Operators 3. Output to Sinks ## Streaming word count textStream keyBy(0) .sum(1) .print() (live,1) (and,1) (let,1) (live,2) ## Distributed architecture TaskManager Flink program web dashboard TaskManager client JobManager TaskManager ## DataStream API Basics ##0 码力 | 26 页 | 3.33 MB | 2 年前3
Exactly-once fault-tolerance in Apache Flink - CS 591 K1: Data Stream Processing and Analytics SpringData Stream Processing and Analytics Spring 2020 ## 3 /24: Exactly-once fault-tolerance in Apache Flink Vasiliki (Vasia) Kalavri vkalavri@bu.edu Go read his PhD thesis: http://kth.diva-portal.org/sm nts/0/a/a/4/0aa43070543cf30310bdd99235d1d629/p59_1.jpg) ## Asynchronous checkpoints in Apache Flink  • A source of increasing consistency (in Apache Flink) can be achieved only if all streaming sources are re-settable  - Flink checkpoints are initiated0 码力 | 81 页 | 13.18 MB | 2 年前3
vLLM v0.6.0 Documentation0 码力 | 201 页 | 1.26 MB | 5 月前3
Hadoop 迁移到阿里云MaxCompute 技术方案HDFS、对象存储服务等。 批处理:由于大数据场景必须处理大规模的数据集,批处理往往需要从数据存储中读取大量数据进行长时间处理分析,并将处理后的数据写入新的数据对象供后续使用。如 Hive、MapReduce、Spark 等。 实时消息采集:用于实时数据采集,可扩展、高吞吐、可靠的消息服务。如 Kafka。 · 流处理:对实时数据进行低延迟流式计算的服务。如 Flink、Spark Streaming、Storm rowspan="2">对象存储OSS 对象存储 EMR HDFS 批处理 Hadoop MapReduce MaxCompute 批处理 (MaxCompute MapReduce/SQL/Spark) Hive EMR MaxCompute 及 Dataworks 的云原生大数据平台解决方案。 |工作负载|Hadoop 开源生态|MaxCompute 产品组件/MaxCompute 生态工具| |---|---|---| |批处理|Hive|MaxCompute SQL|













