Giới thiệu dự án

Trong kỷ nguyên chuyển đổi số và công nghiệp 4.0, khối lượng dữ liệu toàn cầu tăng trưởng theo cấp số nhân (dự báo đạt 175 Zettabytes vào năm 2025 theo IDC). Các tập đoàn bán lẻ quy mô lớn như Walmart ghi nhận hơn 20 triệu giao dịch mỗi ngày, tạo ra hàng terabyte dữ liệu giao dịch cần xử lý liên tục. Các hệ thống cơ sở dữ liệu quan hệ truyền thống (RDBMS) hoạt động theo mô hình OLTP (Online Transaction Processing) nhanh chóng đối mặt với tình trạng "nghẽn cổ chai" phần cứng, biến các tập dữ liệu khổng lồ thành "mồ dữ liệu" (data tombs) — nơi dữ liệu được thu thập ồ ạt nhưng doanh nghiệp lại thiếu hụt thông tin chi phối quyết định kinh doanh.

Vấn đề cốt lõi đặt ra là sự thiếu hụt một hạ tầng dữ liệu đồng nhất có khả năng tích hợp đa nguồn, lưu trữ phân tán chịu lỗi cao, xử lý tính toán song song với chi phí tối ưu mà không bị phụ thuộc vào các giải pháp phần mềm độc quyền đắt đỏ (vendor lock-in). Đồ án tốt nghiệp "Xây dựng Data Platform dựa trên kiến trúc mã nguồn mở" của nhóm sinh viên ngành Kỹ thuật Dữ liệu, Trường Đại học Sư phạm Kỹ thuật TP.HCM (HCMUTE) giải quyết bài toán trên bằng cách xây dựng một hệ thống nền tảng dữ liệu toàn diện (End-to-End Data Platform) dựa trên hệ sinh thái mã nguồn mở Apache và hạ tầng đám mây Amazon Web Services (AWS).

graph TD
    DS[Đa nguồn dữ liệu: RDBMS, CSV, JSON, Logs] -->|Apache Sqoop / Ingestion| HDFS[Hadoop Distributed File System - HDFS]
    HDFS -->|MapReduce / Tez Engine| HIVE[Apache Hive - Data Warehouse & OLAP]
    MYSQL[(MySQL - Hive Metastore)] <-->|Metadata Management| HIVE
    HIVE -->|SQL Queries & Monitoring| HUE[Apache Hue - Web Management GUI]
    HIVE -->|PyHive / SQLAlchemy| SUPERSET[Apache Superset - BI & Visualizations]
    HIVE -->|RESTful API Services| CLIENTS[End Users / External Applications]

Mục tiêu cụ thể của dự án:

  1. Nghiên cứu kiến trúc kho dữ liệu: Khảo sát các mô hình dữ liệu đa chiều (Dimensional Modeling), lược đồ hình sao (Star Schema), lược đồ bông tuyết (Snowflake Schema) và công nghệ xử lý phân tích trực tuyến (OLAP - Online Analytical Processing).
  2. Triển khai cụm tính toán và lưu trữ phân tán: Cấu hình và tối ưu hóa hệ sinh thái Apache Hadoop (HDFS, YARN, MapReduce) cùng Apache Hive để quản lý dữ liệu quy mô lớn trên hệ điều hành Ubuntu Server.
  3. Xây dựng đường ống tích hợp dữ liệu (ETL Pipeline): Ứng dụng Apache Sqoop để trích xuất, chuyển đổi và nạp dữ liệu hai chiều giữa hệ thống RDBMS và HDFS/Hive qua giao thức JDBC.
  4. Phát triển giao diện điều khiển và quản trị tập trung: Triển khai Apache Hue làm trung tâm truy vấn dữ liệu (SQL Assistant), quản trị tập tin HDFS và giám sát tiến trình MapReduce.
  5. Thiết lập hệ thống Business Intelligence (BI): Kết nối Apache Superset với kho dữ liệu Hive để xây dựng dashboard trực quan hóa dữ liệu trực tuyến.
  6. Xây dựng dịch vụ API: Cung cấp các endpoint RESTful cho phép ứng dụng bên thứ ba truy xuất dữ liệu từ Data Platform an toàn và linh hoạt.

Phạm vi và giới hạn:

  • Phạm vi: Triển khai trên môi trường ảo hóa đám mây AWS EC2 (Ubuntu 20.04 LTS), xử lý dữ liệu có cấu trúc và bán cấu trúc (CSV, JSON, RDBMS Tables), hỗ trợ phân tích xử lý theo lô (Batch Processing).
  • Giới hạn: Tập trung vào xử lý theo lô, chưa tích hợp module xử lý dòng thời gian thực (Real-time Streaming với Apache Kafka/Spark Streaming); quy mô thử nghiệm giới hạn trong ngân sách AWS Academy Learner Lab ($100).

Phân tích và thiết kế giải pháp

Phân tích hiện trạng

Sự phân hóa giữa cơ sở dữ liệu tác nghiệp (OLTP) và kho dữ liệu phân tích (OLAP) là yếu tố quyết định khi thiết kế hệ thống dữ liệu lớn:

Tiêu chí Cơ sở dữ liệu truyền thống (RDBMS / OLTP) Kho dữ liệu phân tán (Data Warehouse / OLAP)
Mục đích Xử lý giao dịch trực tuyến hàng ngày, CRUD nhanh Phân tích xu hướng, lập báo cáo, hỗ trợ ra quyết định
Mô hình dữ liệu Chuẩn hóa cao (3NF), nhiều bảng quan hệ phức tạp Phi chuẩn hóa (Star/Snowflake Schema), bảng Fact & Dimension
Khối lượng dữ liệu Gigabyte (GB), giới hạn trên single-node Terabyte (TB) đến Petabyte (PB), mở rộng theo cụm (Cluster)
Hiệu năng truy vấn Nhanh với truy vấn đơn lẻ; rất chậm khi quét bảng lớn Tối ưu hóa cho các phép quét khối lượng lớn và tổng hợp đa chiều
Chi phí bản quyền Rất cao với các phiên bản Enterprise độc quyền Bằng 0 về bản quyền phần mềm (Open-source)

Ma trận so sánh giải pháp nền tảng dữ liệu:

Giải pháp Khả năng mở rộng Chi phí phần mềm Yêu cầu hạ tầng Tính linh hoạt / Tùy biến
Databricks (Azure/AWS) Rất cao (Tự động scale) Rất cao (Trả theo DBU + Cloud) Cloud-only Trung bình (Bị ràng buộc platform)
MS SQL Server Enterprise Trung bình (Scale-up là chính) Cực kỳ đắt đỏ ($13,000+/core) On-premise / IaaS Thấp (Đóng gói độc quyền)
Hệ thống đề xuất (Open-source) Rất cao (Scale-out HDFS) 0 VNĐ (Apache 2.0 License) Linh hoạt (Cloud, On-premise, VM) Rất cao (Toàn quyền kiểm soát mã)

Phân loại yêu cầu người dùng (Mô hình MoSCoW):

  • Must-have: Lưu trữ phân tán chịu lỗi trên HDFS; Truy vấn dữ liệu lớn bằng SQL (HiveQL); Giao diện Web quản trị tập tin và truy vấn (Hue); Kết nối BI Dashboard (Superset).
  • Should-have: Đường ống ETL tự động trích xuất dữ liệu từ RDBMS (Sqoop); Quản lý metadata tập trung (MySQL Metastore).
  • Could-have: API Gateway trích xuất dữ liệu theo định dạng JSON/CSV cho ứng dụng ngoài; Phân quyền người dùng theo nhóm (User/Role Access Control).
  • Won't-have (giai đoạn này): Pipeline xử lý dòng real-time độ trễ dưới 1 giây; Tự động co giãn cụm (Auto-scaling cluster).

Thiết kế hệ thống

Kiến trúc phân tầng của nền tảng gồm 5 lớp chức năng:

[Ingestion Layer: Apache Sqoop 1.4.7, REST API Upload]
                        │
[Storage Layer: Apache Hadoop HDFS 3.3.1 (NameNode, DataNodes)]
                        │
[Processing & Metastore: MapReduce Engine / YARN + MySQL 8.0 Metastore]
                        │
[Data Warehouse & Query Layer: Apache Hive 3.1.2 (HiveServer2, Beeline)]
                        │
[Serving & Visualization Layer: Apache Hue 4.10, Apache Superset 1.5.0]

Technology Stack và phiên bản cụ thể:

  • Hệ điều hành nền tảng: Ubuntu Server 20.04 LTS 64-bit trên AWS EC2.
  • Storage & Compute Framework: Apache Hadoop v3.3.1 (HDFS Block size: 128MB, Replication factor: 2-3).
  • Resource Management: Hadoop YARN (NodeManager, ResourceManager).
  • Data Warehouse Engine: Apache Hive v3.1.2 (Hive Metastore Service, HiveServer2).
  • Metastore Database: MySQL Community Server v8.0.28.
  • ETL & Data Ingestion Tool: Apache Sqoop v1.4.7 (kết nối JDBC MySQL Connector/J v8.0.28).
  • SQL Workspace & Admin GUI: Apache Hue v4.10.0.
  • Business Intelligence Engine: Apache Superset v1.5.0 (Python 3.8, SQLAlchemy, PyHive driver).

Thiết kế lược đồ dữ liệu đa chiều (Dimensional Schema trong Hive):

Lược đồ hình sao (Star Schema) cho module phân tích bán lẻ gồm:

  • Fact Table (fact_sales): sale_id (PK), product_id (FK), customer_id (FK), time_id (FK), store_id (FK), quantity_sold, total_amount, discount_rate.
  • Dimension Tables:
    • dim_product: product_id, product_name, category, industry, unit_price.
    • dim_location: store_id, city, region, country.
    • dim_time: time_id, full_date, day_of_week, month, quarter, year.
-- DDL tạo bảng Fact trong Apache Hive hỗ trợ nén Snappy và định dạng ORC
CREATE TABLE IF NOT EXISTS fact_sales (
    sale_id BIGINT,
    product_id INT,
    customer_id INT,
    time_id INT,
    store_id INT,
    quantity_sold INT,
    total_amount DECIMAL(15, 2),
    discount_rate DOUBLE
)
PARTITIONED BY (sale_year INT, sale_month INT)
STORED AS ORC
TBLPROPERTIES ("orc.compress"="SNAPPY");

Thiết kế REST API truy xuất dữ liệu:

  • POST /api/v1/query/execute: Nhận truy vấn HiveQL, submit MapReduce job và trả về job_id.
  • GET /api/v1/query/status/{job_id}: Trả về trạng thái thực thi (PENDING, RUNNING, SUCCESS, FAILED).
  • GET /api/v1/data/export/{table_name}?format=csv: Trả về link tải tập dữ liệu kết quả phân tích.

Methodology

Dự án áp dụng phương pháp luận Agile Kanban với chu kỳ 2 tuần/iteration, kết hợp phương pháp nghiên cứu thực nghiệm trên môi trường Cloud.

[Milestone 1: Khảo sát & Thiết kế] (01/03 - 28/03) ──> Đề cương & Kiến trúc Data Platform
[Milestone 2: Cài đặt Hạ tầng]     (29/03 - 01/05) ──> Cụm Hadoop/HDFS, YARN, Hive trên AWS
[Milestone 3: Phát triển Module]    (02/05 - 11/06) ──> Tích hợp Sqoop ETL, Hue GUI, Superset BI
[Milestone 4: Pilot Test]          (12/06 - 30/06) ──> Benchmark hiệu năng, kiểm thử tải dữ liệu
[Milestone 5: Go-live & Báo cáo]   (01/07 - 15/07) ──> Triển khai chính thức, nghiệm thu đồ án

Quản trị rủi ro (Risk Mitigation):

  • Rủi ro tràn ngân sách AWS: Cấu hình tự động tắt EC2 instances ngoài giờ làm việc; sử dụng spot instances hoặc cấu hình kích thước vừa phải (t2.xlarge/t3.xlarge).
  • Rủi ro xung đột port/service: Lập bảng phân bổ port chi tiết (HDFS NameNode: 9870, YARN Resource Manager: 8088, HiveServer2: 10000, Hue: 8888, Superset: 8088/8080).
  • Rủi ro mất dữ liệu Metastore: Thực hiện script tự động backup MySQL dump định kỳ hàng ngày.

Implementation và kết quả

Development process

Quá trình xây dựng đường ống ETL và tích hợp các công cụ cốt lõi được thực hiện tuần tự qua các dòng lệnh chuẩn hóa.

1. Trích xuất và Nạp dữ liệu tự động với Apache Sqoop:

Lệnh trích xuất bảng dữ liệu tác nghiệp từ MySQL sang hệ thống tệp phân tán HDFS, tự động tạo cấu trúc bảng trong Hive:

sqoop import \
  --connect jdbc:mysql://172.31.25.10:3306/sales_oltp_db \
  --username sqoop_user \
  --password "SecurePassword123@" \
  --table transactions \
  --hive-import \
  --hive-table default.raw_transactions \
  --target-dir /user/hadoop/data/raw_transactions \
  --as-textfile \
  --m 4 \
  --split-by transaction_id

Độ phức tạp thuật toán chia tách dữ liệu: Sqoop sử dụng 4 Mapper (-m 4) song song, chia dải giá trị khóa chính transaction_id theo thuật toán chia khoảng đều $\Delta = \frac{\max(id) - \min(id)}{N}$, đạt tốc độ truyền tải tối đa trên băng thông mạng I/O.

2. Cấu hình kết nối Apache Superset tới Hive Metastore (SQLAlchemy URI):

Để trực quan hóa dữ liệu, Apache Superset kết nối trực tiếp đến HiveServer2 qua giao thức Thrift:

# Cấu hình chuỗi kết nối SQLAlchemy trong Superset Dashboard
hive_sqlalchemy_uri = "hive://hadoop_user:HivePass2022@172.31.25.10:10000/default?auth=CUSTOM"

# Ví dụ câu lệnh truy vấn phân tích tổng hợp (Cube Roll-up)
SELECT 
    t.sale_year,
    p.category,
    l.region,
    SUM(f.quantity_sold) AS total_volume,
    SUM(f.total_amount) AS gross_revenue
FROM fact_sales f
JOIN dim_product p ON f.product_id = p.product_id
JOIN dim_location l ON f.store_id = l.store_id
JOIN dim_time t ON f.time_id = t.time_id
GROUP BY t.sale_year, p.category, l.region;

3. Cấu hình phân bổ tài nguyên YARN (yarn-site.xml):

<configuration>
    <property>
        <name>yarn.nodemanager.resource.memory-mb</name>
        <value>12288</value>
        <description>Cấp phát 12GB RAM cho các container thực thi MapReduce</description>
    </property>
    <property>
        <name>yarn.scheduler.maximum-allocation-mb</name>
        <value>4096</value>
    </property>
</configuration>

Testing và validation

Cấu hình môi trường máy chủ thử nghiệm (AWS EC2 Instance):

  • OS: Ubuntu 20.04 LTS (HVM)
  • Instance Type: AWS EC2 t3.2xlarge
  • vCPU: 8 vCPU (Intel Xeon Platinum 8000 series)
  • Memory (RAM): 32 GiB
  • Storage: 150 GiB General Purpose SSD (gp3 - 3000 IOPS, 125 MB/s throughput)

Kịch bản kiểm thử hiệu năng truy vấn (Query Benchmarking):

Thực hiện truy vấn tổng hợp phức tạp (Aggregations & 3-way Joins) trên các tập dữ liệu có dung lượng tăng dần từ 100MB, 1GB, 5GB đến 20GB giữa hệ thống MySQL đơn lẻ và Cụm Hive MapReduce trên nền HDFS.

Dung lượng Dataset Số dòng (Records) MySQL 8.0 InnoDB (Giây) Apache Hive trên HDFS (Giây) Tỷ lệ cải thiện hiệu năng
100 MB ~1,000,000 2.8s 14.2s (độ trễ khởi tạo YARN) MySQL nhanh hơn (overhead thấp)
1 GB ~10,000,000 48.5s 22.6s Hive nhanh hơn 53.4%
5 GB ~50,000,000 412.3s (Nghẽn RAM) 68.4s Hive nhanh hơn 83.4%
20 GB ~200,000,000 Out of Memory / Timeout 194.2s Hệ thống phân tán xử lý ổn định
Query Latency Benchmark (Tốc độ xử lý tập dữ liệu 5GB):
[MySQL 8.0 Engine]       ████████████████████████████████████████ 412.3s
[Hive on MapReduce/HDFS] ███████ 68.4s (-83.4% thời gian)

Kết quả đạt được

  1. Khả năng tiếp nhận dữ liệu: Nạp thành công các tập dữ liệu thô dạng file CSV, JSON dung lượng lên tới 20GB vào HDFS với cơ chế nhân bản (Replication Factor = 2), đảm bảo an toàn dữ liệu 100% khi một tiến trình DataNode gặp sự cố.
  2. Quản trị trực quan qua Web: Tích hợp thành công Hue 4.10, cho phép người dùng viết truy vấn HiveQL có gợi ý cú pháp, xem cây thư mục HDFS trực quan và quản lý quyền người dùng mà không cần thao tác CLI phức tạp.
  3. Báo cáo BI tương tác: Xây dựng thành công 5 dashboard đa chiều trên Apache Superset với các biểu đồ: Biểu đồ đường (doanh thu theo thời gian), biểu đồ cột chồng (thị phần sản phẩm), bản đồ nhiệt (phân bố địa lý của đơn hàng).
  4. Tự động hóa ETL: Thiết lập thành công pipeline đồng bộ dữ liệu tự động giữa MySQL và Hive với độ trễ chuyển giao dữ liệu trung bình dưới 3 phút cho mỗi batch 1GB.

Đổi mới và đóng góp

  • Kiến trúc tích hợp mã nguồn mở toàn diện (100% Free Open-Source): Loại bỏ hoàn toàn chi phí bản quyền thương mại bằng cách kết hợp chặt chẽ Hadoop, Hive, Sqoop, Hue và Superset thành một khối thống nhất, giúp tiết kiệm hàng chục nghìn USD phí license hàng năm so với việc sử dụng Databricks hoặc Snowflake.
  • Cơ chế xử lý phân tán chịu lỗi cao: Tận dụng tối đa sức mạnh của hệ thống tệp phân tán HDFS và công nghệ MapReduce, cho phép xử lý dữ liệu quy mô hàng chục triệu bản ghi với thời gian thực thi giảm 83.4% trên tập dữ liệu 5GB so với các hệ thống RDBMS truyền thống.
  • Đơn giản hóa trải nghiệm người dùng cuối: Xóa bỏ rào cản kỹ thuật của hệ thống Big Data dòng lệnh (CLI). Người dùng nghiệp vụ (Business Analysts) có thể dễ dàng khai thác kho dữ liệu thông qua giao diện Web thân thiện của Hue và Superset.
  • Khả năng tương thích và mở rộng linh hoạt: Mô hình thiết kế cho phép dễ dàng tích hợp thêm các công cụ xử lý hiện đại như Apache Spark, Apache Flink hay chuyển đổi lưu trữ sang Apache Iceberg/Delta Lake mà không cần tái cấu trúc toàn bộ hệ thống.

Ứng dụng thực tế và triển khai

Tình huống ứng dụng thực tế

  1. Chuỗi siêu thị bán lẻ: Tập hợp dữ liệu bán hàng từ hàng trăm chi nhánh POS, phân tích mẫu hành vi mua hàng (Market Basket Analysis), dự báo mặt hàng tồn kho và tối ưu hóa chuỗi cung ứng theo vùng miền.
  2. Tổ chức tài chính - Ngân hàng: Quản lý lịch sử giao dịch nhiều năm, phát hiện các giao dịch gian lận bất thường dựa trên quy tắc phân tích hàng loạt, và tổng hợp báo cáo rủi ro tín dụng định kỳ.
  3. Y tế và Chăm sóc sức khỏe: Lưu trữ tập trung bệnh án điện tử, dữ liệu xét nghiệm và phác đồ điều trị từ nhiều bệnh viện vệ tinh để phục vụ thống kê dịch tễ học.

Hướng dẫn triển khai và Cấu hình hệ thống (Deployment Guide)

1. Yêu cầu hệ thống tối thiểu:

  • Master Node: 4 vCPU, 16 GB RAM, 100 GB SSD (Chạy NameNode, ResourceManager, HiveServer2, MySQL, Hue).
  • Worker Node (x2): 2 vCPU, 8 GB RAM, 100 GB SSD (Chạy DataNode, NodeManager).
  • Network: Mở các port nội bộ: 9000 (HDFS RPC), 9870 (HDFS UI), 8088 (YARN UI), 10000 (HiveServer2 Thrift), 8888 (Hue), 8080 (Superset).

2. Quy trình khởi động dịch vụ theo thứ tự chuẩn:

# 1. Khởi động MySQL Metastore
sudo systemctl start mysql

# 2. Khởi động cụm HDFS và YARN
$HADOOP_HOME/sbin/start-dfs.sh
$HADOOP_HOME/sbin/start-yarn.sh

# 3. Khởi động Hive Metastore và HiveServer2 dưới dạng tiến trình chạy ngầm
nohup hive --service metastore > /var/log/hive/metastore.log 2>&1 &
nohup hive --service hiveserver2 > /var/log/hive/hiveserver2.log 2>&1 &

# 4. Khởi động Apache Hue Web Service
sudo supervisorctl start hue

# 5. Khởi động Apache Superset (Gunicorn Web Server)
gunicorn -w 4 -k gevent --timeout 120 -b 0.0.0.0:8080 --limit-request-line 0 --limit-request-field_size 0 "superset.app:create_app()"

3. Hướng dẫn khắc phục sự cố thường gặp (Troubleshooting Guide):

  • Lỗi NameNode ở chế độ Safe Mode (SafeModeException):
    • Nguyên nhân: Dung lượng ổ đĩa khả dụng dưới ngưỡng an toàn hoặc thiếu DataNode heartbeat.
    • Xử lý: Chạy lệnh hdfs dfsadmin -safemode leave để buộc thoát Safe Mode sau khi giải phóng tài nguyên.
  • Lỗi OutOfMemoryError: Java heap space trong Hive/MapReduce:
    • Xử lý: Tăng giới hạn bộ nhớ trong file cấu hình mapred-site.xml: gán mapreduce.map.memory.mb thành 2048mapreduce.reduce.memory.mb thành 4096.

Hạn chế và hướng phát triển

Hạn chế kỹ thuật hiện tại:

  • Chưa hỗ trợ Streaming thời gian thực: Hệ thống hiện tại chỉ xử lý dữ liệu theo lô (Batch Processing) thông qua MapReduce, có độ trễ khởi tạo tác vụ cao (khoảng 10-15 giây overhead).
  • Quy mô cụm thực nghiệm đơn node (Pseudo-distributed cluster): Do giới hạn kinh phí $100 trên AWS Academy, hệ thống chưa được đánh giá trên cụm vật lý đa máy chủ (Multi-node physical cluster) với quy mô hàng trăm terabyte.
  • Cơ chế bảo mật nâng cao: Chưa tích hợp Kerberos Authentication và Apache Ranger để kiểm soát an ninh chi tiết đến từng cột/hàng (Fine-grained access control).

Hướng phát triển tiếp theo:

  1. Nâng cấp Execution Engine: Chuyển đổi công cụ thực thi của Apache Hive từ MapReduce sang Apache Tez hoặc tích hợp Apache Spark (Spark SQL) để tăng tốc độ truy vấn lên gấp 5 - 10 lần nhờ cơ chế xử lý In-memory.
  2. Hiện đại hóa kiến trúc Lakehouse: Ứng dụng các định dạng bảng mở như Apache Iceberg hoặc Delta Lake nhằm hỗ trợ các tính năng ACID transaction, Time Travel (truy vấn dữ liệu lịch sử) và Schema Evolution.
  3. Mở rộng Real-time Pipeline: Bổ sung Apache Kafka và Apache Flink để tiếp nhận và phân tích dữ liệu dòng (Streaming Data) từ các thiết bị IoT và Web Clickstream.

Đối tượng hưởng lợi

  • Sinh viên & Giảng viên ngành Kỹ thuật Dữ liệu/CNTT: Cung cấp tài liệu tham khảo thực nghiệm chuẩn mực về quy trình triển khai End-to-End Data Platform từ tầng hạ tầng cơ sở đến tầng ứng dụng BI với chi phí 0 đồng.
  • Kỹ sư dữ liệu (Data Engineers / Developers): Cung cấp các mẫu cấu hình tham chiếu (Hadoop, Hive, Sqoop, Superset), kỹ thuật tối ưu hóa schema đa chiều và các script xử lý lỗi thực tế.
  • Doanh nghiệp vừa và nhỏ (SMEs / Startups): Bản thiết kế kiến trúc khả thi giúp doanh nghiệp nhanh chóng làm chủ hạ tầng dữ liệu nội bộ, phá bỏ rào cản chi phí bản quyền đắt đỏ từ các nhà cung cấp phần mềm thương mại lớn.
  • Nhà nghiên cứu (Data Scientists / Researchers): Sở hữu môi trường lưu trữ và truy vấn SQL mạnh mẽ trên tập dữ liệu thô quy mô lớn, rút ngắn thời gian chuẩn bị dữ liệu (Data Preparation) cho các mô hình Machine Learning.

Câu hỏi thường gặp

1. Cần cấu hình phần cứng tối thiểu như thế nào để triển khai hệ thống này trong doanh nghiệp?

Đối với môi trường sản xuất (Production) quy mô vừa, khuyến nghị tối thiểu 3 máy chủ (1 Master, 2 Workers): Master Node cần tối thiểu 8 vCPU, 32GB RAM; mỗi Worker Node cần 4 vCPU, 16GB RAM, kết nối mạng LAN 10Gbps và ổ đĩa cấu hình RAID 1/0 để đảm bảo tốc độ I/O cho HDFS.

2. Làm thế nào để mở rộng hệ thống khi khối lượng dữ liệu tăng đột biến từ hàng trăm GB lên hàng chục TB?

Hệ thống sử dụng kiến trúc mở rộng theo chiều ngang (Scale-out). Khi dữ liệu tăng, quản trị viên chỉ cần lắp đặt thêm các máy chủ Worker (DataNode/NodeManager) mới vào mạng nội bộ và khai báo địa chỉ IP trong file slaves/workers của Hadoop mà không cần dừng hoạt động của hệ thống (Zero-downtime scaling).

3. Hệ thống có thể tích hợp với các nguồn dữ liệu phi cấu trúc như hình ảnh, video, log files không?

HDFS được thiết kế để lưu trữ mọi định dạng tệp (Flat files, Images, Audio, Logs, JSON). Đối với dữ liệu phi cấu trúc, tệp có thể được lưu trữ trực tiếp trên HDFS, sau đó sử dụng các framework như Apache Spark, Apache Tika hoặc Python script để trích xuất thuộc tính trước khi nạp vào các bảng phân tích của Hive.

4. Chi phí vận hành và bảo trì Data Platform mã nguồn mở này so với các dịch vụ Cloud Native (như AWS EMR/Redshift) chênh lệch ra sao?

Về phần mềm, hệ thống hoàn toàn miễn phí bản quyền (tiết kiệm 100% chi phí license). Về chi phí hạ tầng, việc tự triển khai trên máy chủ vật lý hoặc IaaS (EC2) giúp tiết kiệm từ 40% đến 60% tổng chi phí sở hữu (TCO) so với việc sử dụng các dịch vụ PaaS được quản lý hoàn toàn (Managed Services) như Databricks hoặc AWS Redshift ở quy mô dữ liệu lớn và chạy liên tục 24/7.

5. Tại sao đồ án lựa chọn Apache Superset thay vì các công cụ BI phổ biến như PowerBI hay Tableau?

Apache Superset là công cụ BI mã nguồn mở hoàn toàn, hỗ trợ kết nối trực tiếp với Apache Hive qua giao thức SQLAlchemy mà không phát sinh phí bản quyền người dùng (User/Seat License). Superset chạy hoàn toàn trên nền tảng Web, dễ dàng nhúng (embed) vào các ứng dụng nội bộ và có khả năng tùy biến cao.


Kết luận

Đồ án tốt nghiệp "Xây dựng Data Platform dựa trên kiến trúc mã nguồn mở" đã nghiên cứu và triển khai thành công một nền tảng dữ liệu lớn toàn diện, kết nối hoàn hảo các công nghệ cốt lõi trong hệ sinh thái Apache (Hadoop, HDFS, YARN, Hive, Sqoop, Hue) cùng công cụ trực quan hóa Apache Superset trên nền tảng điện toán đám mây AWS.

Dự án chứng minh tính khả thi vượt trội của việc ứng dụng 100% công nghệ mã nguồn mở để giải quyết bài toán "mồ dữ liệu", mang lại hiệu năng truy vấn ấn tượng (rút ngắn 83.4% thời gian xử lý trên tập dữ liệu 5GB) với chi phí bản quyền tối ưu. Đây là nền tảng vững chắc giúp các tổ chức, doanh nghiệp tự chủ công nghệ, chuyển đổi dữ liệu thô thành tri thức giá trị phục vụ công tác quản trị và hoạch định chiến lược kinh doanh.

Khám phá và Đóng góp cho Dự án: Quý độc giả, kỹ sư dữ liệu và sinh viên quan tâm có thể tham khảo chi tiết mã nguồn triển khai, tài liệu kiến trúc và hướng dẫn cài đặt hệ thống tại kho lưu trữ của đồ án để cùng phát triển các module mở rộng cho nền tảng.