Zzong's Notes

Home

❯

hadoop

❯

Apache Parquet

Apache Parquet

2026년 6월 14일1 min read

Apache Parquet

  • Apache Parquet 는 Hadoop 에코시스템에서 사용하는 columnar storage 이다.

B) Related

C) References


링크된 언급

1
TFRecord

Apache Parquet 과의 상호 변환 문제

함께 보면 좋은 글

parquet

Parquet 데이터를 저장하는 방식 중 하나로, hadoop ecosystem 에서 많이 사용되는 파일 포맷이다. 파켓은 컬럼 단위 저장 포맷 (columnar storage) 을 사용하는 방식이다.

TFRecord

TFRecord TFRecord 의 단점 엄격한 포맷 tf.train.Feature(float list=tf.train.FloatList(value=[value])) 와 같이 TFRecord 에 저장할 모든 데이터는 TensorFlow 에서 제공하는 데이터 타입으로 변환해야 한다.

ViewFS

Viewfs 란 ViewFS 는 여러 하둡 파일 시스템에 속하는 네임스페이스를 관리하는 방법을 제공한다. 특히 클러스터가 여러개의 네임노드들을 가지고 있다면 당연히 여러 네임스페이스를 가지고 있는데, 이런 경우 유용하다.

distcp

DistCp 하둡은 클러스터내의 대규모 데이터 이동을 위한 DistCp(Distribute Copy) 기능을 제공합니다.

columnar storage

Columnar Storage columnar storage row based storage 의 단점을 극복하기 위한 방법으로 많이 사용된다.

Apache Spark

Spark Apache Spark 는 메모리 내 처리를 지원하여 빅 데이터를 분석하는 애플리케이션의 성능을 향상시키는 오픈 소스 병렬 처리 프레임워크입니다. Spark 는 메모리에서 대량의 데이터를 처리하므로 디스크 기반 대체 방법보다 훨씬 빠릅니다.

large parquet dataset을 위한 PyTorch dataset 및 dataloader 튜닝 일기

blog link Related B) References.

Hive

Hive Hive 는 하둡에서 정형화된 데이터를 처리하기 위한 데이터 웨어하우스 인프라.

MapReduce

MapReduce B) Related C) References.

impala

Impala Apache Impala 는 아파치 하둡을 사용하는 컴퓨터 클러스터에 저장된 데이터를 처리하기 위한 오픈 소스 대규모 병렬 처리 (MPP) SQL 쿼리 엔진입니다. 이 엔진은 C++ 로 작성되었습니다.

  • Apache Parquet
  • B) Related
  • C) References