Hadoop Ecosystem Simulation
Từ lưu trữ (HDFS) đến Lựa chọn Job & Thực thi (MapReduce)
Nodes: 3
Replication: 3
Bước 1
Input & HDFS Split
Hadoop xử lý dữ liệu. Máy tính chạy rất nhanh. Lập trình viên viết code. Con mèo đang ngủ.
Cắt & Lưu vào HDFS
DATA NODES (Storage)
Trống
Dữ liệu sẽ được chia nhỏ thành các Block tại đây...
Bước 2
MapReduce Library (Chọn Job)
Standard.jar
Word Count
Đếm toàn bộ
Logic: Đếm MỌI từ
(Không lọc)
NLP_Lib.jar
Lọc Động Từ
NLP (Cố định)
Logic: Giữ lại Verb
(Theo từ điển mẫu)
NLP_Lib.jar
Lọc Danh Từ
NLP (Cố định)
Logic: Giữ lại Noun
(Theo từ điển mẫu)
User_Defined.jar
Đếm Chỉ Định
Có Tham Số
Map: if(inList)
Reduce: sum()
Cấu hình Job (Job Configuration)
Hệ thống sẽ truyền danh sách này vào Mapper dưới dạng tham số "target.words".
Chọn Job ở trên để chạy
*Lưu ý: Job Lọc chỉ nhận diện được các từ trong
từ điển mẫu
. Các từ khác sẽ bị lọc bỏ.
Bước 3
Execution View
Map Phase (Parallel Execution)
Các từ bị gạch ngang là do Logic Mapper lọc bỏ
Reduce Phase (Aggregation)