1 min read
Apache Parquet 과의 상호 변환 문제
Parquet 데이터를 저장하는 방식 중 하나로, hadoop ecosystem 에서 많이 사용되는 파일 포맷이다. 파켓은 컬럼 단위 저장 포맷 (columnar storage) 을 사용하는 방식이다.
TFRecord TFRecord 의 단점 엄격한 포맷 tf.train.Feature(float list=tf.train.FloatList(value=[value])) 와 같이 TFRecord 에 저장할 모든 데이터는 TensorFlow 에서 제공하는 데이터 타입으로 변환해야 한다.
Viewfs 란 ViewFS 는 여러 하둡 파일 시스템에 속하는 네임스페이스를 관리하는 방법을 제공한다. 특히 클러스터가 여러개의 네임노드들을 가지고 있다면 당연히 여러 네임스페이스를 가지고 있는데, 이런 경우 유용하다.
DistCp 하둡은 클러스터내의 대규모 데이터 이동을 위한 DistCp(Distribute Copy) 기능을 제공합니다.
Columnar Storage columnar storage row based storage 의 단점을 극복하기 위한 방법으로 많이 사용된다.
Spark Apache Spark 는 메모리 내 처리를 지원하여 빅 데이터를 분석하는 애플리케이션의 성능을 향상시키는 오픈 소스 병렬 처리 프레임워크입니다. Spark 는 메모리에서 대량의 데이터를 처리하므로 디스크 기반 대체 방법보다 훨씬 빠릅니다.
blog link Related B) References.
Hive Hive 는 하둡에서 정형화된 데이터를 처리하기 위한 데이터 웨어하우스 인프라.
MapReduce B) Related C) References.
Impala Apache Impala 는 아파치 하둡을 사용하는 컴퓨터 클러스터에 저장된 데이터를 처리하기 위한 오픈 소스 대규모 병렬 처리 (MPP) SQL 쿼리 엔진입니다. 이 엔진은 C++ 로 작성되었습니다.