Zzong's Notes

Home

❯

data_engineering

❯

data engineering

data engineering

2026년 6월 14일1 min read

Data Engineering

Interview Questions

https://github.com/OBenner/data-engineering-interview-questions/blob/master/content/full.md

Related

References


함께 보면 좋은 글

data warehouse

Data Warehouse Related References.

Kafka Replication

Kafka Replication Related References www.confluent.io/blog/hands-free-kafka-replication-a-lesson-in-operational-simplicity/ .

Topic(kafka)

Kafka Topic Kafka Topic 은 같은 종류의 event/message 를 모아두는 logical stream 이다. Producer 는 topic 으로 message 를 쓰고, Consumer 는 topic 에서 message 를 읽는다.

Presto

Presto 정의 Distributed SQL Query Engine for Big Data (Trino 와 유사) Presto is an open source distributed SQL query engine for running interactive analytic queries against data...

Producer

Producer Kafka 에서 Producer 는 event/message 를 생성해서 Topic(kafka) 으로 보내는 client 다.

TFRecord

TFRecord TFRecord 의 단점 엄격한 포맷 tf.train.Feature(float list=tf.train.FloatList(value=[value])) 와 같이 TFRecord 에 저장할 모든 데이터는 TensorFlow 에서 제공하는 데이터 타입으로 변환해야 한다.

consumer(Kafka)

Kafka Consumer position() 만약 offset 을 포함한 레코드가 존재한다면, 가져올 다음 레코드의 오프셋을 반환한다. committed() 주어진 partition 에 대해서 마지막으로 committed 된 offset 을 반환한다.

Consumer

Consumer Kafka Consumer 는 Topic(kafka) 에 저장된 message 를 읽어서 처리하는 client 다. 처리 결과를 DB 에 적재하거나, feature 를 계산하거나, 다른 topic 으로 다시 publish 할 수 있다.

MapReduce

MapReduce B) Related C) References.

Apache Spark

Spark Apache Spark 는 메모리 내 처리를 지원하여 빅 데이터를 분석하는 애플리케이션의 성능을 향상시키는 오픈 소스 병렬 처리 프레임워크입니다. Spark 는 메모리에서 대량의 데이터를 처리하므로 디스크 기반 대체 방법보다 훨씬 빠릅니다.

  • Data Engineering
  • Interview Questions
  • Related
  • References