1 min read
아파치 하이브는 아파치 HDFS 이나 아파치 HBase 와 같은 데이터 저장 시스템에 저장되어 있는 대용량 데이터 집합들을 분석 HiveQL 이라고 불리는 SQL 같은 언어를 제공하며 맵리듀스의 모든 기능을 지원 쿼리를 빠르게 하기위해 비트맵 인덱스를 포함한 index 기능을 제공 하둡에서 동작하는 데이터 웨어하우스 (Data Warehouse) 인프라 구조로서 데이터 요약, 질의 ...
Data Warehouse Related References.
Hive Hive 는 하둡에서 정형화된 데이터를 처리하기 위한 데이터 웨어하우스 인프라.
DistCp 하둡은 클러스터내의 대규모 데이터 이동을 위한 DistCp(Distribute Copy) 기능을 제공합니다.
Viewfs 란 ViewFS 는 여러 하둡 파일 시스템에 속하는 네임스페이스를 관리하는 방법을 제공한다. 특히 클러스터가 여러개의 네임노드들을 가지고 있다면 당연히 여러 네임스페이스를 가지고 있는데, 이런 경우 유용하다.
Kafka Replication Related References www.confluent.io/blog/hands-free-kafka-replication-a-lesson-in-operational-simplicity/ .
NLP B) Related C) References.
Spark Partition partition 은 RDDs 나 Dataset 를 구성하고 있는 최소 단위 객체이며, 스파크의 성능과 리소스 점유량을 크게 좌우할 수 있는 RDD 의 가장 기본적인 개념이다.
N-gram B) Related C) References.
Hive에서 조인 명령을 실행할때, 크기가 작은 테이블은 메모리에 캐시하고 크기가 큰 테이블은 맵퍼로 흘려 보낼 수 있다. 하이브는 메모리에 캐시한 작은 테이블로 부터 일치하는 모든 것을 찾아 낼 수 있기 때문에 맵에서 모든 조인을 할 수 있다.
Spark Apache Spark 는 메모리 내 처리를 지원하여 빅 데이터를 분석하는 애플리케이션의 성능을 향상시키는 오픈 소스 병렬 처리 프레임워크입니다. Spark 는 메모리에서 대량의 데이터를 처리하므로 디스크 기반 대체 방법보다 훨씬 빠릅니다.