Bối cảnh và vấn đề nghiên cứu

Trong xu hướng chuyển đổi số, ngành ngân hàng và thị trường chứng khoán tại Việt Nam đang ghi nhận tốc độ tăng trưởng nhanh chóng với hàng triệu giao dịch tài chính được thực hiện mỗi ngày. Khối lượng dữ liệu khổng lồ phát sinh từ các giao dịch này đặt ra yêu cầu cấp thiết về năng lực lưu trữ, quản trị và khai thác dữ liệu. Thực tiễn tại các tổ chức tài chính và công ty chứng khoán Việt Nam cho thấy nhiều đơn vị vẫn đang vận hành các hệ thống lưu trữ phân tán, thiếu tính tích hợp và khả năng mở rộng. Tình trạng này dẫn đến các rào cản chính:

  • Dữ liệu phân mảnh: Dữ liệu bị phân tán trên nhiều hệ thống nghiệp vụ độc lập như hệ thống giao dịch, quản lý quan hệ khách hàng (CRM) và hệ thống kế toán, gây khó khăn cho việc đồng bộ và truy xuất thông tin tập trung.
  • Quy trình phân tích phức tạp và thủ công: Các công cụ truyền thống không đáp ứng được yêu cầu phân tích các tập dữ liệu tài chính lớn và đa dạng, làm giảm tính kịp thời và độ chính xác trong báo cáo quản trị.
  • Áp lực cạnh tranh và ra quyết định: Thiếu nền tảng dữ liệu tập trung làm hạn chế khả năng dự báo xu hướng thị trường, tối ưu hóa danh mục đầu tư và kiểm soát rủi ro.

Đề tài khóa luận tốt nghiệp "Data Warehouse and Stock Analysis for Bank in Vietnam" của tác giả Đào Xuân Hướng (chuyên ngành Hệ thống Thông tin Quản lý, Trường Quốc tế – Đại học Quốc gia Hà Nội) được thực hiện nhằm giải quyết các thách thức trên thông qua việc xây dựng một hệ thống Kho dữ liệu (Data Warehouse) tích hợp chuyên biệt cho dữ liệu chỉ số chứng khoán ngành ngân hàng tại Việt Nam.

Mục tiêu nghiên cứu tổng quát là xây dựng hệ sinh thái Data Warehouse tích hợp dữ liệu từ nhiều nguồn, cung cấp nền tảng quản lý, lưu trữ và phân tích dữ liệu phục vụ việc ra quyết định của các nhà đầu tư, chuyên viên phân tích tài chính và các tổ chức ngân hàng.

Nhiệm vụ nghiên cứu cụ thể bao gồm:

  1. Thiết kế kiến trúc Data Warehouse phù hợp với đặc thù dữ liệu tài chính - ngân hàng tại Việt Nam (mô hình Star Schema, phân tầng dữ liệu).
  2. Xây dựng và tự động hóa quy trình ETL (Extract, Transform, Load) để tích hợp dữ liệu giao dịch từ sàn chứng khoán, hệ thống ngân hàng và các nguồn tệp dữ liệu.
  3. Phát triển các khối phân tích trực tuyến (OLAP Cubes) và thiết kế hệ thống báo cáo, bảng điều khiển (Dashboard) trực quan hóa dữ liệu.

Hai câu hỏi nghiên cứu trọng tâm được đặt ra trong văn bản:

  1. Làm thế nào để xây dựng kiến trúc Data Warehouse phù hợp cho ngành ngân hàng và chứng khoán nhằm đáp ứng hiệu năng truy vấn và khả năng mở rộng?
  2. Làm thế nào để tích hợp dữ liệu từ nhiều nguồn phân tán (cơ sở dữ liệu quan hệ, API, tệp tin dữ liệu) vào một kho dữ liệu tài chính duy nhất và đảm bảo chất lượng dữ liệu?

Đối tượng nghiên cứu của đề tài là hệ thống dữ liệu tài chính, tập trung vào hệ thống giao dịch chứng khoán và dữ liệu đầu tư của các ngân hàng thương mại tại Việt Nam. Phạm vi nghiên cứu bao gồm dữ liệu thị trường từ các sàn giao dịch chứng khoán Việt Nam (HSX, HNX, UPCOM) và các báo cáo tài chính liên quan, với dữ liệu khảo sát từ năm 2020 đến thời điểm thực hiện (năm 2025).

Cơ sở lý thuyết và phương pháp

Khóa luận thiết lập nền tảng dựa trên các khái niệm và kỹ thuật chuẩn trong kỹ nghệ dữ liệu:

  • Khái niệm Data Warehouse (Inmon / Kimball): Kho dữ liệu được định nghĩa là kho lưu trữ tập trung, hướng chủ đề (subject-oriented), tích hợp (integrated), biến đổi theo thời gian (time-variant) và bất biến (non-volatile), phục vụ phân tích nghiệp vụ và báo cáo quản trị.
  • Mô hình xử lý dữ liệu ETL và ELT: Phân tích sự chuyển dịch từ ETL truyền thống sang ELT trong môi trường dữ liệu hiện đại, tận dụng năng lực tính toán của các công cụ xử lý dữ liệu mới.
  • Mô hình chiều Star Schema: Cấu trúc cơ sở dữ liệu phân tích gồm bảng sự kiện (Fact table) ở trung tâm lưu trữ các chỉ số định lượng và các bảng chiều (Dimension tables) lưu trữ thông tin bối cảnh giải thích, giúp tối ưu hóa số lượng phép nối (joins) và tăng tốc độ truy vấn.
  • Kỹ thuật Slowly Changing Dimensions (SCD): Đánh giá ba dạng cập nhật dữ liệu chiều (SCD Type 1 ghi đè dữ liệu; SCD Type 2 thêm bản ghi mới để theo dõi lịch sử; SCD Type 3 thêm cột lưu giá trị cũ). Trong đó, SCD Type 1 được chọn áp dụng cho các dữ liệu yêu cầu cập nhật trạng thái mới nhất.
  • Xử lý phân tích trực tuyến (OLAP): Cung cấp khả năng phân tích dữ liệu đa chiều, cho phép thực hiện tổng hợp và xem xét chỉ số theo nhiều góc nhìn khác nhau.

Về phương pháp nghiên cứu, tác giả kết hợp hai nhóm phương pháp:

  • Phương pháp định tính (Literature Review): Thu thập, tổng hợp và phân tích các nghiên cứu quốc tế và trong nước về triển khai Data Warehouse trong ngành tài chính, nhận diện các rào cản về hệ thống kế thừa (legacy systems), khung pháp lý và xử lý dữ liệu thời gian thực.
  • Phương pháp định lượng và thiết kế kỹ thuật: Thu thập dữ liệu thực tế từ các nguồn API tài chính tại Việt Nam, triển khai mô hình hóa dữ liệu (OLTP sang OLAP), lập trình luồng tự động hóa và thực hiện các phân tích thống kê gồm:
    • Phân tích mô tả (Descriptive Analysis): Tính toán các giá trị trung bình, phương sai, độ lệch chuẩn đối với giá cổ phiếu, khối lượng giao dịch và các chỉ số thị trường.
    • Phân tích chẩn đoán (Diagnostic Analysis): Sử dụng kỹ thuật tương quan và hồi quy nhằm làm rõ nguyên nhân biến động giá cổ phiếu ngân hàng và tác động kinh tế vĩ mô.

Nguồn dữ liệu đầu vào được thu thập thông qua công cụ API Crawler kết nối với các nền tảng dữ liệu tài chính như Vietstock, FiinPro, VnDirect và thư viện mã nguồn mở Vnstock3, cùng các tệp dữ liệu dạng CSV/Google Sheets và hệ quản trị cơ sở dữ liệu quan hệ (PostgreSQL/MariaDB).

Thiết kế và triển khai

Hệ thống được thiết kế theo mô hình kiến trúc phân tầng Lakehouse hiện đại, đảm bảo tính toàn vẹn, hiệu năng truy vấn và khả năng mở rộng.

Thành phần kiến trúc Công nghệ / Công cụ sử dụng Chức năng chính
Thu thập dữ liệu (Ingestion) Python, Thư viện Vnstock3, API Crawlers Tự động lấy dữ liệu giao dịch, giá cổ phiếu, chỉ số thị trường
Điều phối luồng (Orchestration) Apache Airflow (Directed Acyclic Graphs - DAGs) Lập lịch, tự động hóa và giám sát các tác vụ trích xuất, tạo bảng, làm sạch và nạp dữ liệu
Chuyển đổi dữ liệu (Transformation) dbt (data build tool), SQL Chuẩn hóa định dạng, khử trùng lặp dữ liệu, xây dựng các khối OLAP Cubes
Lưu trữ phân tầng (Storage Layers) MinIO (Object Storage), Apache Iceberg Tổ chức dữ liệu theo 3 tầng: Bronze (Raw), Silver (Cleaned), Gold (Aggregated)
Hệ quản trị CSDL Staging PostgreSQL / MariaDB Lưu trữ tạm thời các bảng dữ liệu thô phục vụ tiền xử lý
Công cụ truy vấn (Query Engine) Trino Truy vấn phân tán trực tiếp trên các tầng dữ liệu của Lakehouse với độ trễ thấp
Trực quan hóa (BI & Visualization) Apache Superset, Redash, Power BI Xây dựng báo cáo phân tích, biểu đồ đường, biểu đồ cột và bảng điều khiển hiệu suất

Thiết kế mô hình dữ liệu OLTP

Mô hình nguồn OLTP bao gồm 5 thực thể chính:

  1. BANK: Lưu thông tin ngân hàng gồm BankID, BankName, SectorID, cùng các trường thời gian create_at, write_at.
  2. STOCK: Lưu thông tin mã chứng khoán gồm StockID, StockSymbol, StockName, SectorID, MarketID, create_at, write_at.
  3. EXCHANGE: Lưu thông tin sở giao dịch gồm ExchangeID, MarketName, Country, Currency, create_at, write_at.
  4. STOCK_TRANSACTIONS: Lưu thông tin giao dịch khớp lệnh gồm TransactionID, StockID, BankID, ExchangeID, TradeType (lệnh mua/bán), Quantity, Price, TotalValue, create_at.
  5. INVESTMENT_TRANSACTIONS: Lưu hoạt động đầu tư của ngân hàng gồm InvestmentID, BankID, ExchangeID, Volume, InvestmentValue, MarketValue, ProfitLoss, create_at.

Thiết kế mô hình chiều (Star Schema)

Dữ liệu được chuẩn hóa thành 4 mô hình Star Schema phục vụ các mục tiêu phân tích chuyên biệt:

  • Mô hình Fact_StockPerformance: Phân tích biến động cổ phiếu ngân hàng theo thời gian. Bảng sự kiện liên kết với Dim_Stock, Dim_Exchange, Dim_Date. Các độ đo (measures) bao gồm: OpeningPrice, HighestPrice, LowestPrice, ClosingPrice, TotalVolume.
  • Mô hình Fact_DailyMarket: Đánh giá tổng quan thị trường từng phiên giao dịch. Bảng sự kiện liên kết với Dim_Date, Dim_Market (Dim_Exchange). Các độ đo: total volume, total value, market index, highest index, lowest index, closing index.
  • Mô hình Fact_Investment: Theo dõi danh mục và hiệu quả đầu tư của các ngân hàng. Bảng sự kiện liên kết với Dim_Bank, Dim_Exchange, Dim_Date. Các độ đo: Volume, InvestmentValue, MarketValue, ProfitLoss.
  • Mô hình Fact_Exchange_Performance: Đo lường hiệu suất hoạt động của từng sàn giao dịch. Bảng sự kiện liên kết với Dim_Date, Dim_Exchange. Các độ đo: trading volume, total value, market index, highest/lowest/closing index.

Triển khai quy trình ETL và điều phối Apache Airflow

Quy trình ETL được triển khai qua các bước:

  • Extract: Sử dụng script Python và thư viện Vnstock3 để thu thập dữ liệu thô về giá, khối lượng giao dịch, chỉ số thị trường và giao dịch đầu tư của ngân hàng, sau đó lưu vào tầng Staging (PostgreSQL/MinIO).
  • Transform: Xử lý giá trị rỗng/lỗi thông qua phép gán giá trị hoặc loại bỏ bản ghi không hợp lệ; chuẩn hóa kiểu dữ liệu thời gian (YYYY-MM-DD) và đơn vị tiền tệ; tính toán các chỉ số phái sinh (biên lợi nhuận, mức thay đổi giá, khối lượng trung bình); áp dụng SCD Type 1 để ghi đè các thuộc tính cập nhật mới nhất.
  • Load: Nạp dữ liệu đã xử lý vào các bảng Fact và Dim tương ứng trong Data Warehouse, kiểm tra tính toàn vẹn khóa ngoại và loại bỏ trùng lặp.
  • Orchestration: Quản lý bằng 3 DAGs trong Apache Airflow:
    1. DAG tạo bảng (Dag for creating table): Định nghĩa cấu trúc schema và khởi tạo bảng.
    2. DAG thu thập dữ liệu (Dag for crawling data): Lập lịch tự động cào dữ liệu qua API.
    3. DAG tích hợp dữ liệu (Dag for merging data): Xử lý, chuyển đổi và nạp dữ liệu vào tầng phân tích.

Xây dựng các khối OLAP Cubes

Tác giả thiết lập các góc nhìn tổng hợp (Materialized Views/Cubes) bằng câu lệnh SQL kết hợp dbt:

  • Khối crawl.daily_investment_profit_by_bank:
    • Độ đo: total_investment_value (tổng giá trị đầu tư = sum(investment_value)), total_profit_or_loss (tổng lãi/lỗ = sum(profitor_loss)).
    • Chiều phân tích: Chiều thời gian (report_date), chiều ngân hàng (bank_name).
  • Khối crawl.daily_exchange_transaction_summary:
    • Độ đo: total_volume, total_value, average_market_index, average_highest_index, average_lowest_index, average_closing_index.
    • Chiều phân tích: Chiều sở giao dịch (exchangeid), chiều thời gian (report_date).
  • Khối Financial indicators cube: Tổng hợp các hệ số tài chính chuyên sâu phục vụ phân tích hiệu quả hoạt động.

Nội dung chính theo từng chương

Chapter 1: Introduction

Chương 1 trình bày tổng quan về đề tài, bối cảnh thực tiễn của thị trường tài chính và ngân hàng tại Việt Nam trong kỷ nguyên số hóa. Tác giả phân tích tính cấp thiết của việc xây dựng hệ thống quản lý dữ liệu tập trung nhằm khắc phục tình trạng phân mảnh thông tin giữa các phòng ban nghiệp vụ. Chương này xác định rõ mục tiêu tổng quát, các mục tiêu kỹ thuật cụ thể, phạm vi nghiên cứu (giai đoạn từ năm 2020 đến 2025) và nêu bật ý nghĩa khoa học cùng giá trị thực tiễn của đề tài đối với các tổ chức tài chính.

Chapter 2: Literature Review

Chương 2 tổng hợp cơ sở lý luận về kỹ nghệ dữ liệu, định nghĩa Data Warehouse và phân tích chi tiết các kỹ thuật cốt lõi: so sánh ETL với ELT, kiến trúc đa chiều OLAP, thiết kế mô hình Star Schema, và kỹ thuật quản lý chiều thay đổi chậm (SCD). Chương này khảo cứu các công trình nghiên cứu trong và ngoài nước:

  • Các nghiên cứu quốc tế (Smith & Johnson 2020; Patel et al. 2019) về tối ưu hóa truy vấn dữ liệu ngân hàng và ứng dụng Cloud Data Warehouse.
  • Các nghiên cứu tại Việt Nam: Nguyen et al. (2018) về rào cản tích hợp hệ thống legacy với đường ống ETL trong các ngân hàng Việt Nam; Tran & Pham (2020) về ứng dụng Big Data xử lý dữ liệu thời gian thực trên các sàn chứng khoán; Hoang (2022) về các thách thức tuân thủ pháp lý tài chính tại Việt Nam. Từ đó, chương chỉ ra các khoảng trống nghiên cứu (Research Gaps) như thiếu giải pháp DW được thiết kế phù hợp với đặc thù hạ tầng tài chính Việt Nam, hạn chế trong phân tích thời gian thực và việc tích hợp dữ liệu phi cấu trúc.

Chapter 3: Methodology

Chương 3 mô tả toàn bộ phương pháp luận và quy trình thiết kế kỹ thuật của hệ thống. Tác giả chi tiết hóa luồng xử lý dữ liệu qua các giai đoạn: thu thập dữ liệu (Ingestion) thông qua API Crawler và thư viện Vnstock3; quy trình ETL với các tầng lưu trữ Lakehouse Bronze - Silver - Gold trên MinIO và Apache Iceberg; quy trình mô hình hóa và tạo Cube tự động bằng dbt kết hợp Apache Airflow; phương thức truy vấn phân tán bằng Trino và trực quan hóa qua Apache Superset, Redash. Chương cũng xác định các phương pháp phân tích thống kê mô tả và chẩn đoán áp dụng trên tập dữ liệu.

Chapter 4: Findings

Chương 4 trình bày chi tiết kết quả xây dựng và triển khai hệ thống. Nội dung chương bao gồm:

  • Chi tiết hóa lược đồ OLTP với 5 bảng thực thể và lược đồ chi tiết các bảng dữ liệu: Stock data (Table 1), Investment (Table 2), Exchange performance (Table 3), Bank name (Table 4), Exchange name (Table 5), Market summary (Table 6).
  • Thiết kế chi tiết 4 mô hình chiều Star Schema (Fact_StockPerformance, Fact_DailyMarket, Fact_Investment, Fact_Exchange_Performance) với đầy đủ các bảng Fact và Dim.
  • Triển khai chi tiết các luồng làm việc tự động (DAGs) trong Apache Airflow để tạo bảng, cào dữ liệu và đồng bộ dữ liệu.
  • Xây dựng và thực thi các câu truy vấn SQL tạo khối OLAP Cubes (daily_investment_profit_by_bank, daily_exchange_transaction_summary, Financial indicators cube) và hiển thị kết quả phân tích số liệu thực nghiệm.

Chapter 5: Conclusion and Recommendations

Chương 5 tổng kết toàn bộ kết quả nghiên cứu và mức độ hoàn thành các mục tiêu đề ra của đồ án. Tác giả thẳng thắn chỉ ra các giới hạn kỹ thuật còn tồn tại, đồng thời đưa ra các đề xuất, khuyến nghị cải tiến hệ thống trong tương lai, đặc biệt là việc tích hợp các mô hình phân tích dự báo bằng Machine Learning và công nghệ xử lý dữ liệu lớn (Big Data).

Kết quả và đóng góp

Khóa luận đã hoàn thành việc thiết kế và triển khai một hệ thống Data Warehouse hoàn chỉnh cho mảng chứng khoán ngân hàng tại Việt Nam, đạt được các kết quả cụ thể:

Hạng mục triển khai Kết quả kỹ thuật đạt được
Mô hình hóa dữ liệu Xây dựng thành công 1 sơ đồ OLTP 5 thực thể và 4 mô hình Star Schema chuyên biệt (Fact Stock Performance, Fact Daily Market, Fact Investment, Fact Exchange Performance)
Tự động hóa luồng ETL Xây dựng và vận hành thành công 3 DAGs trong Apache Airflow phục vụ việc khởi tạo bảng, cào dữ liệu định kỳ từ Vnstock3/API và hợp nhất dữ liệu vào hệ thống
Kiến trúc phân tầng Lakehouse Thiết lập cấu trúc lưu trữ 3 tầng Bronze (dữ liệu thô), Silver (dữ liệu làm sạch/chuẩn hóa) và Gold (dữ liệu tổng hợp phân tích) trên nền tảng MinIO và Apache Iceberg
Phân tích đa chiều (OLAP Cubes) Triển khai các khung nhìn OLAP tổng hợp đa chiều: daily_investment_profit_by_bank (phân tích giá trị đầu tư và lãi/lỗ theo ngân hàng và ngày) và daily_exchange_transaction_summary (tổng hợp khối lượng, giá trị và các chỉ số thị trường theo sàn giao dịch)
Tối ưu hóa truy vấn & Báo cáo Kết nối công cụ truy vấn Trino trực tiếp vào Lakehouse và tích hợp các bảng điều khiển trực quan hóa trên Apache Superset / Redash

Đóng góp của khóa luận thể hiện ở hai khía cạnh:

  • Đóng góp khoa học: Cung cấp mô hình tham chiếu chi tiết và phương pháp luận rõ ràng về việc xây dựng hệ thống Data Warehouse - Lakehouse cho lĩnh vực tài chính - ngân hàng, đặc biệt là việc kết hợp các công nghệ mã nguồn mở hiện đại (Airflow, dbt, Trino, Iceberg, MinIO).
  • Đóng góp thực tiễn: Giải quyết bài toán phân mảnh dữ liệu giữa các sàn giao dịch (HSX, HNX, UPCOM) và các hệ thống ngân hàng tại Việt Nam; cung cấp nền tảng dữ liệu tập trung, chuẩn hóa giúp rút ngắn thời gian lập báo cáo, hỗ trợ các nhà đầu tư và nhà quản trị ngân hàng theo dõi hiệu quả đầu tư và biến động thị trường.

Hạn chế và hướng nghiên cứu tiếp

Văn bản khóa luận chỉ ra các hạn chế kỹ thuật trong quá trình thực hiện:

  • Hệ thống gặp khó khăn trong việc tối ưu hóa hiệu năng xử lý khi làm việc với các tập dữ liệu có quy mô rất lớn (large-scale datasets).
  • Chưa tích hợp được các mô hình phân tích dự báo (predictive analytics) nâng cao để tự động đưa ra các dự đoán về biến động giá hoặc phân loại rủi ro.
  • Kỹ thuật quản lý chiều thay đổi áp dụng trong đồ án chủ yếu là SCD Type 1 (ghi đè dữ liệu), do đó chưa hỗ trợ lưu trữ toàn diện lịch sử thay đổi của các thuộc tính chiều theo thời gian như SCD Type 2.

Hướng nghiên cứu tiếp theo được tác giả đề xuất bao gồm:

  • Tích hợp các thuật toán Trí tuệ nhân tạo (AI) và Học máy (Machine Learning) trên nền tảng dữ liệu đã xây dựng để phục vụ dự báo xu hướng thị trường và chấm điểm rủi ro.
  • Mở rộng hạ tầng xử lý sang các công nghệ Big Data phân tán chuyên sâu để tối ưu hóa khả năng xử lý dữ liệu giao dịch theo thời gian thực (real-time analytics).

Giá trị tham khảo

Đồ án là tài liệu tham khảo chuyên môn hữu ích cho:

  • Sinh viên các ngành Hệ thống Thông tin Quản lý (MIS), Khoa học Dữ liệu, Công nghệ Thông tin và Tài chính - Ngân hàng: Cung cấp tài liệu mẫu về quy trình phát triển một đồ án kỹ thuật dữ liệu hoàn chỉnh từ khảo sát bài toán kinh doanh, thiết kế OLTP, chuyển đổi mô hình chiều Star Schema đến lập trình ETL.
  • Kỹ sư dữ liệu (Data Engineers) và Chuyên viên phân tích BI: Tham khảo kiến trúc kết hợp giữa Apache Airflow, dbt, MinIO, Apache Iceberg và Trino để xây dựng hệ thống Lakehouse phục vụ phân tích dữ liệu chứng khoán.
  • Các nhà nghiên cứu về thị trường tài chính Việt Nam: Cung cấp cấu trúc schema chuẩn hóa cho các bảng dữ liệu giao dịch cổ phiếu, chỉ số sàn và danh mục đầu tư ngân hàng.

Phần đáng tham khảo nhất của đồ án là thiết kế chi tiết 4 mô hình Star Schema tại Chapter 4: Findings và cấu trúc câu lệnh SQL xây dựng các khối phân tích trực tuyến OLAP Cubes (daily_investment_profit_by_bank và daily_exchange_transaction_summary).

Câu hỏi thường gặp

1. Đồ án sử dụng công cụ và thư viện nào để thu thập dữ liệu chứng khoán Việt Nam?
Hệ thống sử dụng công cụ API Crawler kết nối với các nguồn dữ liệu tài chính (Vietstock, FiinPro, VnDirect) kết hợp với thư viện mã nguồn mở Vnstock3 để tự động hóa việc lấy dữ liệu về giá cổ phiếu, khối lượng giao dịch và chỉ số thị trường.

2. Kiến trúc lưu trữ của hệ thống được phân tầng như thế nào?
Kho dữ liệu được tổ chức thành 3 tầng lưu trữ theo mô hình Lakehouse sử dụng MinIO (Object Storage) và Apache Iceberg: tầng Bronze (lưu trữ dữ liệu thô chưa qua xử lý), tầng Silver (dữ liệu đã được làm sạch, khử trùng lặp và chuẩn hóa), và tầng Gold (dữ liệu đã tổng hợp thành các bảng Fact, Dim và OLAP Cubes sẵn sàng cho phân tích).

3. Đồ án áp dụng kỹ thuật Slowly Changing Dimension (SCD) nào trong đường ống ETL?
Đồ án triển khai kỹ thuật SCD Type 1 (ghi đè dữ liệu cũ bằng dữ liệu mới nhất mà không lưu lại lịch sử thay đổi) đối với dữ liệu cổ phiếu và dữ liệu đầu tư của ngân hàng, nhằm duy trì ảnh chụp trạng thái (snapshot) mới nhất của thị trường.

4. Bảng sự kiện Fact_StockPerformance lưu trữ những độ đo tài chính cụ thể nào?
Bảng Fact_StockPerformance lưu trữ các độ đo hiệu suất hàng ngày của từng mã cổ phiếu, bao gồm: Giá mở cửa (OpeningPrice), Giá cao nhất (HighestPrice), Giá thấp nhất (LowestPrice), Giá đóng cửa (ClosingPrice) và Tổng khối lượng giao dịch (TotalVolume).

5. Khối phân tích crawl.daily_investment_profit_by_bank cung cấp những chỉ số nào?
Khối OLAP này tổng hợp hai chỉ số định lượng chính: tổng giá trị đầu tư (total_investment_value = sum(investment_value)) và tổng lợi nhuận hoặc thua lỗ (total_profit_or_loss = sum(profitor_loss)), được phân tích đa chiều theo thời gian báo cáo (report_date) và tên ngân hàng (bank_name).

Kết luận

Khóa luận tốt nghiệp của tác giả Đào Xuân Hướng đã xây dựng thành công giải pháp Data Warehouse tích hợp phục vụ phân tích chứng khoán ngành ngân hàng tại Việt Nam. Bằng việc ứng dụng mô hình Star Schema và kết hợp các công nghệ dữ liệu hiện đại như Apache Airflow, dbt, MinIO, Apache Iceberg và Trino, hệ thống đã tự động hóa toàn diện quy trình từ thu thập, chuẩn hóa dữ liệu đến tạo các khối OLAP phục vụ báo cáo. Mặc dù còn hạn chế về khả năng xử lý tập dữ liệu cực lớn và chưa tích hợp phân tích dự báo, nghiên cứu đã tạo lập một nền tảng kỹ thuật dữ liệu hoàn chỉnh, có giá trị ứng dụng thực tiễn cao cho các tổ chức tài chính tại Việt Nam.