Data Engineering
Interview Questions
https://github.com/OBenner/data-engineering-interview-questions/blob/master/content/full.md
1 min read
https://github.com/OBenner/data-engineering-interview-questions/blob/master/content/full.md
Data Warehouse Related References.
Kafka Replication Related References www.confluent.io/blog/hands-free-kafka-replication-a-lesson-in-operational-simplicity/ .
Kafka Topic Kafka Topic 은 같은 종류의 event/message 를 모아두는 logical stream 이다. Producer 는 topic 으로 message 를 쓰고, Consumer 는 topic 에서 message 를 읽는다.
Presto 정의 Distributed SQL Query Engine for Big Data (Trino 와 유사) Presto is an open source distributed SQL query engine for running interactive analytic queries against data...
Producer Kafka 에서 Producer 는 event/message 를 생성해서 Topic(kafka) 으로 보내는 client 다.
TFRecord TFRecord 의 단점 엄격한 포맷 tf.train.Feature(float list=tf.train.FloatList(value=[value])) 와 같이 TFRecord 에 저장할 모든 데이터는 TensorFlow 에서 제공하는 데이터 타입으로 변환해야 한다.
Kafka Consumer position() 만약 offset 을 포함한 레코드가 존재한다면, 가져올 다음 레코드의 오프셋을 반환한다. committed() 주어진 partition 에 대해서 마지막으로 committed 된 offset 을 반환한다.
Consumer Kafka Consumer 는 Topic(kafka) 에 저장된 message 를 읽어서 처리하는 client 다. 처리 결과를 DB 에 적재하거나, feature 를 계산하거나, 다른 topic 으로 다시 publish 할 수 있다.
MapReduce B) Related C) References.
Spark Apache Spark 는 메모리 내 처리를 지원하여 빅 데이터를 분석하는 애플리케이션의 성능을 향상시키는 오픈 소스 병렬 처리 프레임워크입니다. Spark 는 메모리에서 대량의 데이터를 처리하므로 디스크 기반 대체 방법보다 훨씬 빠릅니다.