1 min read
MapReduce B) Related C) References.
Data Engineering Interview Questions github.com/OBenner/data-engineering-interview-questions/blob/master/content/full.md Related References.
Presto 정의 Distributed SQL Query Engine for Big Data (Trino 와 유사) Presto is an open source distributed SQL query engine for running interactive analytic queries against data...
Row Based Storage row based storage 는 일반적인 관계형 데이터베이스 테이블의 저장 방식으로, 각 행 (row) 마다 단일 레코드의 필드값이 저장된다.
Columnar Storage columnar storage row based storage 의 단점을 극복하기 위한 방법으로 많이 사용된다.
Kafka Replication Related References www.confluent.io/blog/hands-free-kafka-replication-a-lesson-in-operational-simplicity/ .
postgreSQL B) Related C) References.
Data Mining Applying ML techniques to dig into large amounts of data can help discover patterns that were not immediately apparent.
pySpark Spark 의 Python wrapper Functions withColumn 스파크 데이터프레임에서 column 을 추가하거나, 한 column 의 값을 다른 값으로 변경 할 때는 withColumn 함수를 이용합니다.
MongoDB Compass B) Related C) References.