아래 작업에 대한 설명으로 옳지 않은 것은?
보기
하둡 클러스터에서 텍스트 로그의 단어 출현 빈도를 세는 맵리듀스 작업을 실행하려 한다. 입력 파일의 크기는 512MB이고, HDFS의 블록 크기는 128MB이며, 블록 하나당 Map 태스크 하나가 배정된다. Reduce 태스크는 2개로 설정하였다.
- 1입력이 128MB 단위로 나뉘므로 Map 태스크는 4개가 생성되며, 각 태스크는 서로 다른 노드에서 병렬로 실행될 수 있다.
- 2Map 단계의 출력은 (단어, 1) 형태의 중간 결과이며, 같은 단어는 셔플 과정을 거쳐 동일한 Reduce 태스크로 모인다.
- 3Reduce 태스크가 2개이므로 최종 출력 파일도 일반적으로 2개로 생성되며, 전체 단어 빈도를 보려면 두 파일을 함께 확인해야 한다.
- 4Map 태스크 수를 4개에서 8개로 늘리면 전체 처리 시간은 항상 정확히 절반으로 줄어들며, 노드를 추가하는 만큼 성능도 무한히 선형으로 향상된다.
꿈라CBT