Kafka Consumer
position()- 만약 offset 을 포함한 레코드가 존재한다면, 가져올 다음 레코드의 오프셋을 반환한다.
committed()- 주어진 partition 에 대해서 마지막으로 committed 된 offset 을 반환한다. 이 offset 은 event 실패시 consumer 에 대한 position 값으로 사용된다.
1 min read
Consumer Kafka Consumer 는 Topic(kafka) 에 저장된 message 를 읽어서 처리하는 client 다. 처리 결과를 DB 에 적재하거나, feature 를 계산하거나, 다른 topic 으로 다시 publish 할 수 있다. B) Consumer Group Consumer 는 보통 consumer group 단위로 동작한다. 같은 group 안의 consumer 들...
Consumer Kafka Consumer 는 Topic(kafka) 에 저장된 message 를 읽어서 처리하는 client 다. 처리 결과를 DB 에 적재하거나, feature 를 계산하거나, 다른 topic 으로 다시 publish 할 수 있다.
Consumer Group consumer group 은 여러 Consumer 들이 포함된 그룹이다. consumer group 안의 Consumer 수만큼 파티션의 데이터를 분산처리하게 된다.
Kafka 대용량 실시간 메시지 처리를 위한 프레임워크 B) Producer & Consumer Kafka 는 Producer 와 Consumer 가 데이터를 주고 받기 위한 중간 다리 역할을 한다.
Kafka Topic Kafka Topic 은 같은 종류의 event/message 를 모아두는 logical stream 이다. Producer 는 topic 으로 message 를 쓰고, Consumer 는 topic 에서 message 를 읽는다.
Producer Kafka 에서 Producer 는 event/message 를 생성해서 Topic(kafka) 으로 보내는 client 다.
Kafka Replication Related References www.confluent.io/blog/hands-free-kafka-replication-a-lesson-in-operational-simplicity/ .
Apache Flink Apache Flink는 계속 들어오는 데이터를 읽어서, 그때그때 계산 결과를 갱신하는 분산 처리 엔진이다. 예를 들어 쇼핑몰에서 사용자가 상품을 클릭할 때마다 Kafka에 click event가 쌓인다고 해 보자.
Spark Partition partition 은 RDDs 나 Dataset 를 구성하고 있는 최소 단위 객체이며, 스파크의 성능과 리소스 점유량을 크게 좌우할 수 있는 RDD 의 가장 기본적인 개념이다.
Kafka Cluster 는 여러 대의 카프카 서버가 모여 구성된 클러스터입니다. 이 이미지는 카프카 전체 프로세스의 구조를 보여줍니다.
Data Engineering Interview Questions github.com/OBenner/data-engineering-interview-questions/blob/master/content/full.md Related References.