文章 2022-09-29 来自:开发者社区

大数据面试题:介绍下Kafka,Kafka的作用?Kafka的组件?适用场景?

Kafka是一种分布式、高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模的网站中的所有动作流数据,主要应用于大数据实时处理领域。简单地说,Kafka就相比是一个邮箱,生产者是发送邮件的人,消费者是接收邮件的人,Kafka就是用来存东西的,只不过它提供了一些处理邮件的机制。1、作用1)发布和订阅消息流2)以容错的方式记录消息流,kafka以文件的方式来存储消息流3)可以在消息发布的时候进行处....

大数据面试题:介绍下Kafka,Kafka的作用?Kafka的组件?适用场景?
文章 2022-09-11 来自:开发者社区

大数据面试需要掌握的知识点

1、kafka的message包括哪些信息一个Kafka的Message由一个固定长度的header和一个变长的消息体body组成header部分由一个字节的magic(文件格式)和四个字节的CRC32(用于判断body消息体是否正常)构成。当magic的值为1的时候,会在magic和crc32之间多一个字节的数据:attributes(保存一些相关属性,比如是否压缩、压缩格式等等);如果mag....

文章 2022-07-15 来自:开发者社区

大数据面试--HDFS

一、HDFS读写流程①HDFS写流程1)client 客户端发送上传请求,通过 RPC 与 namenode 建立通信,namenode 检查该用户是否有上传权限,以及上传的文件是否在 hdfs 对应的目录下重名,如果这两者有任意一个不满足,则直接报错,如果两者都满足,则返回给客户端一个可以上传的信息。2)client 根据文件的大小进行切分,默认 128M 一块,切分完成之后给namenode....

文章 2022-07-15 来自:开发者社区

大数据面试--KAFKA

一、为什么使用KAFKA?缓冲和削峰:上游数据时有突发流量,下游可能扛不住,或者下游没有足够多的机器来保证冗余,kafka 在中间可以起到一个缓冲的作用,把消息暂存在 kafka 中,下游服务就可以按照自己的节奏进行慢慢处理。解耦和扩展性:项目开始的时候,并不能确定具体需求。消息队列可以作为一个接口层,解耦重要的业务流程。只需要遵守约定,针对数据编程即可获取扩展能力。冗余:可以采用一对多的方式,....

文章 2022-07-14 来自:开发者社区

大数据面试--flume

一、Flume使用场景线上数据一般主要是落地(存储到磁盘)或者通过 socket 传输给另外一个系统,这种情况下,你很难推动线上应用或服务去修改接口,实现直接向 kafka里写数据,这时候你可能就需要 flume 这样的系统帮你去做传输。二、Flume丢包问题单机 upd 的 flume source 的配置,100+M/s 数据量,10w qps flume 就开始大量丢包,因此很多公司在搭建....

文章 2022-07-13 来自:开发者社区

大数据面试--flink

一、flink checkpoint 与spark Flink 有什么区别或者优势?spark streaming 的 checkpoint 仅仅是针对 driver 的故障恢复做了数据和元数据的checkpoint。而 flink 的 checkpoint 机制 要复杂了很多,它采用的是轻量级的分布式快照,实现了每个算子的快照,及流动中的数据的快照。二、Flink中的Time有哪几种?在 fl....

文章 2022-07-12 来自:开发者社区

大数据面试spark

一、spark如何保证宕机迅速恢复?适当增加 spark standby master编写 shell 脚本,定期检测 master 状态,出现宕机后对 master 进行重启操作。二、spark streaming以及基本工作原理?Spark streaming 是 spark core API 的一种扩展,可以用于进行大规模、高吞吐量、容错的实时数据流的处理。它支持从多种数据源读取数据,比如....

文章 2022-07-08 来自:开发者社区

大数据面试-hive

一、hive表关联查询,如何解决数据倾斜问题?1)倾斜原因:map 输出数据按 key Hash 的分配到 reduce 中,由于 key 分布不均匀、业务数据本身的特、建表时考虑不周、等原因造成的 reduce 上的数据量差异过大。(1)key 分布不均匀;(2)业务数据本身的特性;(3)建表时考虑不周;(4)某些 SQL 语句本身就有数据倾斜;如何避免:对于 key 为空产生的数据倾斜,可以....

文章 2022-07-07 来自:开发者社区

大数据面试--HBASE

一、HBASE的特点是什么?1)大:一个表可以有数十亿行,上百万列;2)无模式:每行都有一个可排序的主键和任意多的列,列可以根据需要动态的增加,同一张表中不同的行可以有截然不同的列;3)面向列:面向列(族)的存储和权限控制,列(族)独立检索;4)稀疏:空(null)列并不占用存储空间,表可以设计的非常稀疏;5)数据多版本:每个单元中的数据可以有多个版本,默认情况下版本号自动分配,是单元格插入时的....

文章 2022-06-10 来自:开发者社区

【大数据面试题】(七)Kafka 相关面试题总结2

二十一、consumer水平扩展如何实现kafka支持consumer水平扩展,可以让多个consumer加入一个consumer group,在一个consumer group中,每个分区只能分配给一个consumer,当kafka服务端增加分区数量进行水平扩展后,可以向consumer group中增加新的consumer来提高整个consumer group的消费能力,当consumer ....

本页面内关键词为智能算法引擎基于机器学习所生成,如有任何问题,可在页面下方点击"联系我们"与我们沟通。

Java面试那些事儿

手把手带您学习Java,开启编程之路。

+关注