Topics
Interview Questions
https://github.com/OBenner/data-engineering-interview-questions/blob/master/content/full.md
1 min read
https://github.com/OBenner/data-engineering-interview-questions/blob/master/content/full.md
Apache Iceberg는 대용량 분석 테이블을 파일 위에서 안전하게 관리하기 위한 open table format이다. 여기서 중요한 말은 “테이블 포맷”이다.
Kafka Topic Kafka Topic 은 같은 종류의 event/message 를 모아두는 logical stream 이다. Producer 는 topic 으로 message 를 쓰고, Consumer 는 topic 에서 message 를 읽는다.
분석과 리포팅을 위해 여러 시스템의 데이터를 한곳에 모아 정리해 둔 저장소다. 서비스를 돌리는 운영 데이터베이스와는 목적도 설계도 다르다. 운영 데이터베이스는 주문 하나를 넣고 빼는 일을 빠르고 정확하게 처리해야 한다(OLTP).
References www.confluent.io/blog/hands-free-kafka-replication-a-lesson-in-operational-simplicity/ .
Spark Apache Spark 는 메모리 내 처리를 지원하여 빅 데이터를 분석하는 애플리케이션의 성능을 향상시키는 오픈 소스 병렬 처리 프레임워크입니다. Spark 는 메모리에서 대량의 데이터를 처리하므로 디스크 기반 대체 방법보다 훨씬 빠릅니다.
Apache Flink는 계속 들어오는 데이터를 읽어서, 그때그때 계산 결과를 갱신하는 분산 처리 엔진이다. 예를 들어 쇼핑몰에서 사용자가 상품을 클릭할 때마다 Kafka에 click event가 쌓인다고 해 보자.
TFRecord 의 단점 엄격한 포맷 tf.train.Feature(float list=tf.train.FloatList(value=[value])) 와 같이 TFRecord 에 저장할 모든 데이터는 TensorFlow 에서 제공하는 데이터 타입으로 변환해야 한다.
정의 Distributed SQL Query Engine for Big Data (Trino 와 유사) Presto is an open source distributed SQL query engine for running interactive analytic queries against data sources...
Kafka 에서 Producer 는 event/message 를 생성해서 Topic(kafka) 으로 보내는 client 다.
Spark 의 Python wrapper Functions withColumn 스파크 데이터프레임에서 column 을 추가하거나, 한 column 의 값을 다른 값으로 변경 할 때는 withColumn 함수를 이용합니다.