빅데이터 전문가의 하둡 관리 스터디 노트
-
PART I 하둡 소개: 아키텍처와 하둡 클러스터
- Chapter 1 하둡 소개 및 하둡의 주변 환경
- Chapter 2 하둡 아키텍처 개요
- Chapter 3 간단한 하둡 클러스터 생성 및 환경 설정
- Chapter 4 하둡 클러스터 계획하기
-
PART II 하둡 애플리케이션 프레임워크
- Chapter 5 클러스터에서 애플리케이션 실행하기 - 맵리듀스 프레임워크
- Chapter 6 클러스터에서 애플리케이션 실행하기 - 스파크 프레임워크
- Chapter 7 스파크 애플리케이션 실행하기
-
PART III 하둡 데이터 관리 및 보호 그리고 고가용성
- Chapter 8 네임노드의 역할과 HDFS의 동작 방식
- Chapter 9 HDFS 명령, 퍼미션, 그리고 스토리지
- Chapter 10 데이터 보호, 파일 포맷, 그리고 HDFS 접속
- Chapter 11 네임노드 오퍼레이션, 고가용성 그리고 페더레이션
-
PART IV 데이터 이동, 리소스 할당, 잡 스케줄링 그리고 보안
- Chapter 12 하둡에서 데이터 넣고 빼기
- Chapter 13 하둡 클러스터의 리소스 할당
- Chapter 14 우지(Oozie)로 잡 워크플로 관리하기
- Chapter 15 하둡의 보안
-
PART V 모니터링, 최적화, 그리고 문제 해결
- Chapter 16 잡 관리하기, 휴 사용하기 그리고 반복 작업 수행하기
- Chapter 17 모니터링, 지표, 그리고 하둡 로깅
- Chapter 18 클러스터 리소스 튜닝, 맵리듀스 최적화 그리고 벤치마킹
- Chapter 19 아파치 스파크 설치 및 튜닝
- Chapter 20 스파크 애플리케이션 최적화하기
- Chapter 21 하둡 문제 해결
-
부록 A 버추얼박스 및 리눅스 설치 그리고 가상 머신 복사하기