168大数据

标题: Kafka概念和架构 [打印本页]

作者: 168主编    时间: 2018-12-21 10:53
标题: Kafka概念和架构
1 Kafka概念和架构
第一讲:概念、ZK的存储结构、Producer、Consumers流程、Kafka Broker的启动(额外)
从客户端使用角度来讲。
第二讲:从设计原理角度来讲。
Kafka属于Apache组织,是一个高性能跨语言分布式发布订阅消息队列系统[7]。它的主要特点有:
1 Broker
Kafka是一个高吞吐量分布式消息系统,采用Scala和Java语言编写,它提供了快速、可扩展的、分布式、分区的和可复制的日志订阅服务。它由Producer、Broker、Consumer三部分构成,如图所示。
2 Topic
在Kafka中,消息是按Topic组织的.
2.1 topic中partition存储分布
在Kafka文件存储中,同一个topic下有多个不同partition,每个partition为一个目录,partiton命名规则为topic名称+有序序号,第一个partiton序号从0开始,序号最大值为partitions数量减1。
├── data0│   ├── cleaner-offset-checkpoint│   ├── client_mblogduration-35│   │   ├── 00000000000004909731.index│   │   ├── 00000000000004909731.log // 1G文件--Segment│   │   ├── 00000000000005048975.index // 数字是Offset│   │   ├── 00000000000005048975.log│   ├── client_mblogduration-37│   │   ├── 00000000000004955629.index│   │   ├── 00000000000004955629.log│   │   ├── 00000000000005098290.index│   │   ├── 00000000000005098290.log│   ├── __consumer_offsets-33│   │   ├── 00000000000000105157.index│   │   └── 00000000000000105157.log│   ├── meta.properties│   ├── recovery-point-offset-checkpoint│   └── replication-offset-checkpoint

这些都是归于LogManager使用。
[AppleScript] 纯文本查看 复制代码
[huangqiang@yz4098 data1]$ cat cleaner-offset-checkpoint
0
0
[huangqiang@yz4098 data1]$ cat recovery-point-offset-checkpoint
0
2
__consumer_offsets 23 148062
client_mblogduration 1 6244035
[huangqiang@yz4098 data1]$ cat replication-offset-checkpoint
0
2
__consumer_offsets 23 148062
client_mblogduration 1 6244092
2.2 partiton中文件存储方式
[AppleScript] 纯文本查看 复制代码
[huangqiang@yz4098 kafka]$ ll -ah data9/client_mblogduration-18/
-rw-rw-r-- 1 kafka kafka  607K Nov 21 22:33 00000000000005046268.index
-rw-rw-r-- 1 kafka kafka  1.0G Nov 21 22:33 00000000000005046268.log
-rw-rw-r-- 1 kafka kafka  590K Nov 22 12:26 00000000000005188203.index
-rw-rw-r-- 1 kafka kafka  1.0G Nov 22 12:26 00000000000005188203.log

2.3 partiton中segment文件存储结构
partion中segment file组成和物理结构。
以一对segment file文件为例,说明segment中index<—->data file对应关系物理结构如下


其中以Index文件中元数据3,497为例,依次在数据文件中表示第3个message(在全局partiton表示第368772个message)、以及该消息的物理偏移地址为497。
下面看看segment data file的内部
segment data file由许多message组成,下面详细说明message物理结构如下:
关键字解释说明
8 byte offset该message在partition的offset
4 byte message sizemessage大小
4 byte CRC32用crc32校验message
1 byte "magic"表示本次发布Kafka服务程序协议版本号
1 byte "attributes"表示为独立版本、或标识压缩类型、或编码类型。
4 byte key length表示key的长度,当key为-1时,K byte key字段不填
K byte key可选
value bytes payload表示实际消息数据。2.4 在partition中如何通过offset查找message
例如读取offset=368776的message,需要通过下面2个步骤查找。
从上述图2.3节可知这样做的优点,segment index file采取稀疏索引存储方式,它减少索引文件大小,通过map可以直接内存操作,稀疏索引为数据文件的每个对应message设置一个元数据指针,它比稠密索引节省了更多的存储空间,但查找起来需要消耗更多的时间。
2.5 读写message总结写message读messageKafka高效文件存储设计特点
3 Producer4 Consumer








欢迎光临 168大数据 (http://www.bi168.cn/) Powered by Discuz! X3.2