Bối cảnh và vấn đề nghiên cứu

Ô nhiễm không khí là một trong những thách thức môi trường nghiêm trọng nhất trên phạm vi toàn cầu, tác động trực tiếp đến sức khỏe con người và sự phát triển kinh tế. Các hoạt động đô thị hóa, công nghiệp hóa, khí thải phương tiện giao thông cùng các hiện tượng tự nhiên đã làm gia tăng đáng kể nồng độ các chất ô nhiễm trong khí quyển như $\text{SO}2$, $\text{NO}2$, $\text{CO}2$, $\text{NO}$, $\text{CO}$, $\text{NO}x$, và đặc biệt là bụi mịn ($\text{PM}{2.5}$, $\text{PM}{10}$). Theo báo cáo của Tổ chức Y tế Thế giới (WHO), khoảng 4,2 triệu người tử vong mỗi năm do phơi nhiễm với ô nhiễm không khí ngoài trời, trong đó Việt Nam ghi nhận khoảng 60.000 ca tử vong trong báo cáo năm 2016. Báo cáo chất lượng không khí năm 2020 của IQAir xếp Việt Nam vào nhóm 25 quốc gia ô nhiễm nhất thế giới, với nồng độ $\text{PM}{2.5}$ trung bình năm vượt gần 4 lần mức khuyến nghị hàng năm của WHO (đạt trên $55,4,\mu\text{g/m}^3$, tương đương chỉ số chất lượng không khí AQI ở mức 110). Bụi mịn $\text{PM}{2.5}$ có kích thước hạt dưới $2,5,\mu\text{m}$, có khả năng thâm nhập sâu vào phổi và hệ tuần hoàn, gây ra nhiều bệnh lý nguy hiểm về hô hấp và tim mạch.

Trong bối cảnh đó, việc dự báo chất lượng không khí đóng vai trò thiết yếu nhằm cảnh báo sớm cho cộng đồng và hỗ trợ các cơ quan quản lý đưa ra giải pháp giảm thiểu tác động tiêu cực. Lịch sử nghiên cứu dự báo ô nhiễm không khí trên thế giới được chia thành hai hướng tiếp cận chính:

  1. Mô hình số trị (Numerical models): Dựa trên các lý thuyết vật lý và hóa học cổ điển để mô phỏng sự phát tán, chuyển hóa của các hợp chất hóa học trong khí quyển. Tuy nhiên, nhóm mô hình này gặp nhiều trở ngại do dữ liệu đầu vào phức tạp, khó thu thập đầy đủ và khó kiểm soát chất lượng dữ liệu.
  2. Mô hình dựa trên dữ liệu (Data-driven models): Ứng dụng các thuật toán học máy và học sâu (như Mạng nơ-ron truyền thẳng đa tầng MLP, Mạng hàm cơ sở xuyên tâm RBF, Mạng nơ-ron hồi quy RNN/LSTM) để học các quy luật từ dữ liệu chuỗi thời gian.

Tại Việt Nam, việc nghiên cứu dự báo chỉ số chất lượng không khí theo chuỗi thời gian còn mới mẻ và đối mặt với thách thức lớn về sự khan hiếm dữ liệu quan trắc mặt đất (thiếu cả về độ dài chuỗi thời gian lẫn số lượng trạm đo hoạt động liên tục). Để giải quyết bài toán này, khóa luận tốt nghiệp kỹ sư ngành Hệ thống Thông tin (Chương trình Tiên tiến) tại Trường Đại học Công nghệ Thông tin - ĐHQG-HCM, do sinh viên Phan Hoàng Nam và Lê Thị Phụng thực hiện dưới sự hướng dẫn của PGS. TS. Nguyễn Đình Thuân (năm 2021), đã đặt ra các nhiệm vụ nghiên cứu cụ thể:

  • Mục tiêu 1: Thu thập, xử lý và xây dựng bộ dữ liệu chất lượng không khí chuẩn hóa từ trạm quan trắc mặt đất tại TP. Hồ Chí Minh.
  • Mục tiêu 2: Nghiên cứu, thiết kế và huấn luyện mô hình học sâu Bidirectional LSTM kết hợp các kỹ thuật phân tích chuỗi thời gian để dự báo chỉ số AQI cho 5 giờ tiếp theo.
  • Mục tiêu 3: Triển khai mô hình hoàn chỉnh lên nền tảng điện toán đám mây Google Cloud Platform (GCP) với kiến trúc API và giao diện Web trực quan phục vụ người dùng.

Đối tượng và phạm vi nghiên cứu: Khóa luận tập trung vào dữ liệu nồng độ bụi mịn $\text{PM}_{2.5}$ và chỉ số AQI theo giờ tại trạm quan trắc đặt tại Lãnh sự quán Hoa Kỳ (số 4 đường Lê Duẩn, Quận 1, TP. Hồ Chí Minh), thu thập từ nguồn dữ liệu của Cơ quan Bảo vệ Môi trường Hoa Kỳ (EPA/AirNow) trong giai đoạn hơn 4 năm rưỡi (từ đầu năm 2016 đến tháng 7/2021), với tổng số 46.052 điểm dữ liệu theo giờ.


Cơ sở lý thuyết và phương pháp

1. Quy chuẩn tính toán chỉ số chất lượng không khí (AQI) và thuật toán NowCast

Khóa luận tuân thủ phương pháp tính toán chỉ số AQI theo quy chuẩn hướng dẫn kỹ thuật chính thức của Việt Nam. Chỉ số AQI được chia thành các thang mức cảnh báo sức khỏe và gán mã màu trực quan tương ứng (Tốt, Trung bình, Kém, Xấu, Rất xấu, Nguy hại). Đối với các chất ô nhiễm dạng hạt như $\text{PM}{2.5}$ và $\text{PM}{10}$, nồng độ tức thời tại một thời điểm không phản ánh đầy đủ tác động phơi nhiễm, do đó thuật toán NowCast được áp dụng trên khung thời gian 12 giờ gần nhất ($c_1, c_2, \dots, c_{12}$, với $c_1$ là giờ hiện tại và $c_{12}$ là giờ thứ 12 trong quá khứ):

  • Tính tỷ số trọng số: $$w^* = \frac{C_{\min}}{C_{\max}}$$ Trong đó $C_{\min}$ và $C_{\max}$ lần lượt là nồng độ nhỏ nhất và lớn nhất trong 12 giờ qua.
  • Xác định trọng số $w$:
    • Nếu $w^* \le \frac{1}{2}$ thì gán $w = \frac{1}{2}$.
    • Nếu $w^* > \frac{1}{2}$ thì gán $w = w^*$.
  • Tính nồng độ NowCast:
    • Trường hợp $w > \frac{1}{2}$: $$\text{NowCast} = \frac{\sum_{i=1}^{12} c_i \cdot w^{i-1}}{\sum_{i=1}^{12} w^{i-1}}$$
    • Trường hợp $w = \frac{1}{2}$: $$\text{NowCast} = \frac{1}{2} c_1 + \left(\frac{1}{2}\right)^2 c_2 + \dots + \left(\frac{1}{2}\right)^{12} c_{12}$$
  • Giá trị $\text{AQI}x$ theo giờ của thông số $x$ ($\text{PM}{2.5}$) được tính bằng công thức nội suy tuyến tính: $$\text{AQI}x = \frac{I{i+1} - I_i}{BP_{i+1} - BP_i} \cdot (\text{NowCast}x - BP_i) + I_i$$ Trong đó $BP_i, BP{i+1}$ là nồng độ giới hạn dưới và giới hạn trên tại mức $I$, còn $I_i, I_{i+1}$ là giá trị AQI tương ứng quy định trong bảng quy chuẩn môi trường Việt Nam.

2. Phân tích chuỗi thời gian (Time Series Analysis)

Chuỗi thời gian được phân rã thành 4 thành phần cơ bản: Xu hướng (Trend), Mùa vụ (Seasonal), Chu kỳ (Cyclical) và Yếu tố ngẫu nhiên/nhiễu (Irregular/Random). Nhóm tác giả thực hiện các kiểm định thống kê chuyên sâu:

  • Kiểm định tính dừng Dickey-Fuller (ADF Test): Đánh giá tính dừng của chuỗi dữ liệu $\text{PM}_{2.5}$ để xác định xem phương sai và giá trị trung bình có biến đổi phụ thuộc vào thời gian hay không.
  • Hàm tự tương quan (ACF) và Tự tương quan riêng phần (PACF): Xác định mức độ ảnh hưởng của các bước trễ thời gian trong quá khứ đối với giá trị ở thời điểm hiện tại.
  • Phân rã chuỗi thời gian (Seasonal Decomposition): Sử dụng thư viện statsmodels để bóc tách thành phần chu kỳ và sai số ngẫu nhiên.
  • Kỹ thuật cửa sổ trượt (Rolling Window): Trích xuất các chuỗi con liên tiếp với kích thước cửa sổ $m$ (số quan sát quá khứ) và khoảng dự báo $h$ (horizon) để chuyển đổi bài toán chuỗi thời gian thành bài toán học có giám sát.

3. Kiến trúc mạng nơ-ron học sâu (Deep Learning)

Để khắc phục hiện tượng triệt tiêu hoặc bùng nổ đạo hàm (vanishing/exploding gradient) và khả năng lưu giữ phụ thuộc xa kém của mạng RNN truyền thống, nghiên cứu áp dụng cấu trúc LSTM (Long Short-Term Memory) và Bidirectional LSTM (Bi-LSTM):

  • Cấu trúc LSTM: Sử dụng 3 cổng tương tác gồm Cổng quên (Forget Gate $f$), Cổng vào (Input Gate $i$), Cổng ra (Output Gate $o$) cùng Trạng thái ô (Cell State $C$) và hàm kích hoạt Hyperbolic Tangent ($\tanh$) để kiểm soát lượng thông tin được giữ lại hoặc loại bỏ qua từng bước thời gian.
  • Mạng Bidirectional LSTM: Tích hợp hai tầng LSTM độc lập xử lý chuỗi dữ liệu theo hai chiều thời gian (chiều xuôi - forward và chiều ngược - backward), giúp trạng thái ẩn lưu giữ được ngữ cảnh toàn diện. Khóa luận thiết lập kích thước vector trạng thái ẩn $h = 64$.
  • Kỹ thuật tối ưu hóa:
    • Batch Normalization: Chuẩn hóa phân phối đầu vào của từng mini-batch nhằm ổn định và tăng tốc độ hội tụ trong quá trình huấn luyện hai chiều.
    • Dropout: Ngắt ngẫu nhiên các liên kết nơ-ron để ngăn ngừa hiện tượng quá khớp (overfitting) trên tập dữ liệu quan trắc.

4. Thước đo đánh giá mô hình

Hiệu năng của mô hình hồi quy được định lượng bằng 3 chỉ số tiêu chuẩn:

  • Sai số tuyệt đối trung bình (MAE): $$\text{MAE} = \frac{1}{N} \sum_{i=1}^N |y_i - \hat{y}_i|$$
  • Sai số phần trăm tuyệt đối trung bình (MAPE): $$\text{MAPE} = \frac{1}{N} \sum_{i=1}^N \left|\frac{y_i - \hat{y}_i}{y_i}\right| \times 100%$$
  • Căn bậc hai sai số bình phương trung bình (RMSE): $$\text{RMSE} = \sqrt{\frac{1}{N} \sum_{i=1}^N (y_i - \hat{y}_i)^2}$$

Thiết kế và triển khai hệ thống

Hệ thống được thiết kế theo quy trình khép kín từ tiền xử lý dữ liệu, huấn luyện mô hình đến triển khai trên nền tảng đám mây.

Giai đoạn Nhiệm vụ chính Công nghệ / Phương pháp sử dụng
Xử lý dữ liệu khuyết Xử lý dữ liệu theo nhãn QC Name (Valid, Invalid, Missing) - Đoạn khuyết $\le 2$ giờ: điền giá trị hợp lệ gần nhất (Front fill/Back fill)
- Đoạn khuyết $> 2$ giờ: loại bỏ và đánh dấu độ dài chuỗi liên tục (Continuous length)
Kỹ thuật đặc trưng (Feature Engineering) Tạo 34 đặc trưng đầu vào từ 2 biến gốc; chuẩn hóa tỷ lệ về $[-1, 1]$ phù hợp hàm $\tanh$ - Mã hóa chu kỳ ($\sin, \cos$) cho giờ, ngày trong tuần, ngày trong tháng, tháng
- Biến One-hot cho năm (2017–2021) và phân nhóm AQI (cat_2.0)
- Biến nhị phân đánh dấu ngày cuối tuần (weekend) và ngày lễ (holidays)
- Trung bình trượt theo các độ trễ: Lag 1 đến 12 và Lag 24
Phân chia dữ liệu & Rolling Window Chia tập dữ liệu theo trật tự thời gian (80% Train, 10% Validation, 10% Test) Kỹ thuật Rolling Window với kích thước cửa sổ $m = 5$ (lựa chọn tối ưu sau khi thử nghiệm các cửa sổ từ 1 đến 12)
Xây dựng mô hình Dự báo độc lập chỉ số AQI cho từng giờ ($t+1, t+2, t+3, t+4, t+5$) TensorFlow, Keras, Bidirectional LSTM ($h=64$), Batch Normalization, Dropout
Triển khai Backend Tự động lấy dữ liệu mới, tính toán tiền xử lý và gọi suy luận Google Cloud Storage, Google Cloud AI Platform, Cronjob, Flask RESTful API
Giao diện Frontend Hiển thị biểu đồ và kết quả dự báo 5 giờ tới trên Internet Streamlit, Docker Container trên nền tảng Google Cloud Platform

Hệ thống đảm bảo khả năng cung cấp kết quả dự báo chất lượng không khí cho TP. Hồ Chí Minh trong 5 giờ tiếp theo với độ trễ xử lý cập nhật tối thiểu 30 phút.


Nội dung chính theo từng chương

Chapter 1: PROBLEM STATEMENT

Chương 1 thiết lập cơ sở thực tiễn của đề tài thông qua các số liệu thống kê về ô nhiễm không khí tại Việt Nam và TP. Hồ Chí Minh từ các tổ chức quốc tế (WHO, IQAir). Tác giả tổng quan các nghiên cứu dự báo chuỗi thời gian trên thế giới (như nghiên cứu của Kukkonen và cộng sự tại Helsinki, Phần Lan; nghiên cứu mạng nơ-ron của Kurt và cộng sự tại Istanbul, Thổ Nhĩ Kỳ). Chương này xác định rõ 3 mục tiêu cốt lõi của khóa luận, phân tích tầm quan trọng của việc lựa chọn mô hình học sâu hai chiều và bài toán đưa mô hình vào môi trường vận hành thực tế (production).

Chapter 2: RELATED RESOURCES

Chương 2 trình bày chi tiết khung lý thuyết và các công nghệ nền tảng:

  • Cơ chế tính toán chỉ số chất lượng không khí AQI theo chuẩn Việt Nam và công thức NowCast 12 giờ cho bụi $\text{PM}{2.5}/\text{PM}{10}$.
  • Cơ sở lý thuyết chuỗi thời gian: phân loại thành phần, định nghĩa tính dừng, các kỹ thuật mô hình hóa (ARIMA, Holt-Winters, Rolling Window).
  • Lý thuyết mạng nơ-ron: hạn chế của RNN cổ điển, nguyên lý hoạt động của các cổng trong tế bào LSTM, cơ chế hai chiều của Bidirectional RNN/LSTM, vai trò của Batch Normalization và Dropout.
  • Giới thiệu nền tảng TensorFlow và các dịch vụ trên Google Cloud Platform (Compute Engine, App Engine, Cloud Storage, AI Platform, Container Engine).
  • Định nghĩa toán học của các thang đo đánh giá sai số (MAE, MAPE, RMSE).

Chapter 3: Deep learning model design and evaluation

Chương 3 là phần thực nghiệm trọng tâm của khóa luận, gồm 3 nội dung lớn:

  1. Xử lý và phân tích khám phá dữ liệu (EDA): Dữ liệu thu thập từ trạm quan trắc mặt đất tại Quận 1 (46.052 bản ghi). Kiểm định Dickey-Fuller cho thấy chuỗi dữ liệu đạt tính dừng (không cần lấy sai phân làm mịn). Biểu đồ ACF và PACF chỉ ra rằng 4 giờ đầu tiên có tương quan mạnh nhất và mức độ ảnh hưởng giảm dần sau 12 giờ. Biểu đồ phân rã chu kỳ và phân tích biến ngày lễ/cuối tuần cho thấy nồng độ ô nhiễm giảm khoảng 15% vào các ngày nghỉ.
  2. Kỹ thuật trích xuất đặc trưng và chuẩn bị tập dữ liệu: Xây dựng 34 đặc trưng (mã hóa $\sin/\cos$, trễ trung bình trượt 1–12 và 24 giờ, one-hot năm, phân loại AQI). Thử nghiệm 12 kích thước cửa sổ trượt (từ 1 đến 12), qua 10 lượt huấn luyện cho mỗi cấu hình, xác định kích thước cửa sổ $m = 5$ mang lại hiệu năng cao nhất.
  3. Triển khai hệ thống: Đóng gói mô hình lên Google Cloud AI Platform, thiết lập Cronjob định kỳ kích hoạt Flask API xử lý dữ liệu và dựng ứng dụng web Streamlit chạy trên môi trường Docker.

Chapter 4: CONCLUSION AND FUTURE WORKS

Chương 4 tổng kết các kết quả đạt được đối với 3 mục tiêu đã đề ra, đánh giá mức độ hoàn thành của hệ thống dự báo AQI 5 giờ tại TP. Hồ Chí Minh và định hướng các nghiên cứu tiếp theo nhằm cải tiến mô hình.


Kết quả và đóng góp

1. Kết quả định lượng chính

  • Xây dựng thành công bộ dữ liệu chuỗi thời gian liên tục gồm 46.052 điểm dữ liệu nồng độ $\text{PM}_{2.5}$ theo giờ tại TP. Hồ Chí Minh (2016 – 07/2021).
  • Kiểm định thống kê Dickey-Fuller xác nhận dữ liệu chuỗi thời gian có tính dừng (Series is Stationary), cho phép áp dụng trực tiếp các kỹ thuật trích xuất đặc trưng trễ mà không làm mất thông tin gốc.
  • Phân tích tương quan chuỗi xác định khoảng ảnh hưởng hiệu quả của dữ liệu quá khứ là 12 giờ, trong đó 4 giờ liền kề có trọng số tác động cao nhất.
  • Xác định tác động của yếu tố hành vi con người: Nồng độ ô nhiễm trong các ngày nghỉ lễ và cuối tuần giảm trung bình 15% so với ngày thường.
  • Tối ưu hóa tham số: Kích thước cửa sổ trượt $m = 5$ được chứng minh thực nghiệm là cấu hình tối ưu nhất trong 12 mức thử nghiệm.
  • Sai số dự báo: Mô hình Bidirectional LSTM đạt sai số căn bậc hai trung bình bình phương (RMSE) xấp xỉ 15 khi dự báo chỉ số AQI cho 5 giờ tiếp theo với độ trễ hệ thống tối thiểu 30 phút.

2. Đóng góp của khóa luận

  • Là một trong những công trình nghiên cứu tiên phong tại Việt Nam ứng dụng mô hình học sâu hai chiều (Bidirectional LSTM) vào bài toán dự báo chất lượng không khí theo chuỗi thời gian tại trạm quan trắc mặt đất ở TP. Hồ Chí Minh.
  • Xây dựng hoàn chỉnh quy trình tiền xử lý kết hợp thuật toán NowCast và bảng quy chuẩn môi trường Việt Nam, giải quyết bài toán thiếu hụt và gián đoạn dữ liệu quan trắc.
  • Hiện thực hóa mô hình từ lý thuyết sang ứng dụng thực tiễn (End-to-End deployment) trên nền tảng Google Cloud Platform, kết hợp Flask API và giao diện Streamlit hoạt động tự động.

Hạn chế và hướng nghiên cứu tiếp

  • Hạn chế về phạm vi không gian dữ liệu: Nghiên cứu chỉ sử dụng dữ liệu từ 01 trạm quan trắc mặt đất duy nhất (Lãnh sự quán Hoa Kỳ, Quận 1), do đó kết quả dự báo mang tính cục bộ cho khu vực trung tâm, chưa phản ánh đầy đủ biến động không gian của toàn bộ các quận, huyện trên địa bàn TP. Hồ Chí Minh.
  • Thiếu hụt các biến khí tượng bổ trợ: Mô hình hiện tại mới chỉ khai thác các đặc trưng nội sinh từ nồng độ $\text{PM}_{2.5}$ và thời gian, chưa kết hợp các thông số khí tượng quan trọng (như nhiệt độ, độ ẩm, tốc độ gió, hướng gió, lượng mưa).
  • Hướng mở rộng nghiên cứu:
    • Tích hợp thêm dữ liệu ảnh viễn thám/vệ tinh từ không gian (NASA) để bổ sung thông tin diện rộng.
    • Mở rộng mô hình theo hướng nội suy không - thời gian kết hợp (như mô hình IDW-BLSTM) khi có thêm dữ liệu từ nhiều trạm quan trắc mặt đất khác tại Việt Nam.
    • Cải thiện hạ tầng thu thập nhằm giảm độ trễ (latency) cập nhật dữ liệu đầu vào.

Giá trị tham khảo

Khóa luận là tài liệu tham khảo hữu ích cho sinh viên, học viên cao học và các kỹ sư thuộc các chuyên ngành Hệ thống Thông tin, Khoa học Dữ liệu, Công nghệ Thông tin và Kỹ thuật Môi trường. Các nội dung mang giá trị ứng dụng cao gồm:

  • Quy trình chuẩn hóa và công thức tính toán chỉ số AQI/NowCast theo quy định của Việt Nam.
  • Các bước thực hành phân tích khám phá chuỗi thời gian (kiểm định tính dừng Dickey-Fuller, phân tích ACF/PACF, phân rã mùa vụ).
  • Kỹ thuật xử lý đặc trưng chuỗi thời gian: mã hóa dữ liệu chu kỳ dạng hình học ($\sin/\cos$) và kỹ thuật tạo tập dữ liệu Rolling Window cho bài toán hồi quy nhiều bước (multi-step forecasting).
  • Kiến trúc triển khai hệ thống học máy (MLOps cơ bản): lưu trữ và gọi mô hình trên Google Cloud AI Platform, tự động hóa luồng lấy dữ liệu bằng Cronjob kết hợp Flask API và xây dựng giao diện tương tác bằng Streamlit.

Câu hỏi thường gặp

1. Khóa luận sử dụng nguồn dữ liệu nào và thu thập tại địa điểm cụ thể nào?
Dữ liệu được thu thập từ nguồn dữ liệu của Cơ quan Bảo vệ Môi trường Hoa Kỳ (EPA/AirNow), đặt tại trạm quan trắc Lãnh sự quán Hoa Kỳ, số 4 đường Lê Duẩn, Quận 1, TP. Hồ Chí Minh, với quy mô 46.052 bản ghi theo giờ từ đầu năm 2016 đến tháng 7/2021.

2. Thuật toán NowCast cho bụi mịn $\text{PM}_{2.5}$ được tính toán dựa trên khung thời gian nào?
NowCast được tính toán dựa trên chuỗi nồng độ của 12 giờ gần nhất, sử dụng tỷ số giữa nồng độ nhỏ nhất và lớn nhất ($C_{\min} / C_{\max}$) để xác định trọng số $w$, giúp phản ánh sát thực tế mức độ ô nhiễm mà không bị ảnh hưởng quá mức bởi các biến động tức thời.

3. Tại sao các đặc trưng thời gian (giờ, ngày, tháng) lại được mã hóa bằng hàm $\sin$ và $\cos$?
Do thời gian mang tính chu kỳ lặp lại (ví dụ: giờ thứ 23 và giờ 00 liền kề nhau), việc mã hóa thông thường bằng số nguyên sẽ làm mất tính liên tục này. Phép biến đổi 2 chiều bằng $\sin$ và $\cos$ giúp mô hình học sâu nắm bắt chính xác tính chất tuần hoàn khép kín của chu kỳ thời gian.

4. Kích thước cửa sổ trượt (Rolling Window) tối ưu được chọn trong mô hình là bao nhiêu?
Qua thực nghiệm huấn luyện và đánh giá trên 12 kích thước cửa sổ khác nhau (từ 1 đến 12), kích thước cửa sổ $m = 5$ (sử dụng 5 bước thời gian quá khứ) cho kết quả hiệu năng tốt nhất.

5. Sai số dự báo của mô hình Bidirectional LSTM cho 5 giờ tiếp theo đạt mức bao nhiêu?
Mô hình đạt sai số căn bậc hai trung bình bình phương (RMSE) xấp xỉ 15 đối với dự báo chỉ số chất lượng không khí cho 5 giờ kế tiếp.


Kết luận

Khóa luận của nhóm tác giả Phan Hoàng Nam và Lê Thị Phụng đã giải quyết bài toán dự báo chất lượng không khí theo giờ tại TP. Hồ Chí Minh trong điều kiện dữ liệu quan trắc mặt đất còn hạn chế. Bằng việc kết hợp quy chuẩn tính toán AQI của Việt Nam, các kỹ thuật phân tích chuỗi thời gian chuyên sâu và mạng học sâu Bidirectional LSTM, nghiên cứu đã xây dựng thành công mô hình dự báo 5 giờ tiếp theo với độ chính xác tin cậy (RMSE ~15). Công trình không chỉ hoàn thiện về mặt thuật toán mà còn hoàn thành việc triển khai hệ thống dịch vụ đầu cuối trên nền tảng Google Cloud Platform phục vụ người dùng thực tế.