官网
http://flume.apache.org/
介绍
Flume是一个分布式、可靠、和高可用的海量日志采集、聚合和传输的系统。
Flume可以采集文件,socket数据包等各种形式源数据,又可以将采集到的数据输出到HDFS、hbase、hive、kafka等众多外部存储系统中。
一般的采集需求,通过对flume的简单配置即可实现。
Flume针对特殊场景也具备良好的自定义扩展能力,因此,flume可以适用于大部分的日常数据采集场景。
运行机制
1、 Flume分布式系统中最核心的角色是agent,flume采集系统就是由一个个agent所连接起来形成。2、 每一个agent相当于一个数据传递员,内部有三个组件:
a) Source:采集源,用于跟数据源对接,以获取数据
b) Sink:下沉地,采集数据的传送目的,用于往下一级agent传递数据或者往最终存储系统传递数据
c) Channel:angent内部的数据传输通道,用于从source将数据传递到sink
理解它:
source是对接要采集的数据源头的,比如数据源头是hdfs,则配置成hdfs的。如果是文件的,则配置成文件的。
sink是输出的,如果目的地是hdfs,则配置成hdfs的,如果是文件的,则配置成文件的。
当source的源头是上一个sink,sink的目的地是下一个source的时候,则形成了多级串联(如下图)。
source是对接要采集的数据源头的,比如数据源头是hdfs,则配置成hdfs的。如果是文件的,则配置成文件的。
sink是输出的,如果目的地是hdfs,则配置成hdfs的,如果是文件的,则配置成文件的。
当source的源头是上一个sink,sink的目的地是下一个source的时候,则形成了多级串联(如下图)。
下载
http://flume.apache.org/download.html
官方学习文档
http://flume.apache.org/documentation.html
文档内容很具体详细,包含了source,sink,channel的各种场景配置
-------------
更多的Java,Angular,Android,大数据,J2EE,Python,数据库,Linux,Java架构师,:
http://www.cnblogs.com/zengmiaogen/p/7083694.html