Tổng quan luận án

Bệnh bụi phổi silic nghề nghiệp (Occupational Silicosis - BPSi) là một trong những bệnh nghề nghiệp phổ biến và nghiêm trọng nhất tại Việt Nam cũng như trên thế giới. Bệnh hình thành do người lao động hít phải bụi chứa tinh thể silic dioxit ($SiO_2$) tự do trong môi trường lao động kéo dài, dẫn đến tổn thương nhu mô phổi, phản ứng viêm mạn tính và xơ hóa mô phổi không hồi phục. Theo thống kê của Tổng Liên đoàn Lao động Việt Nam, tính đến cuối năm 2023, cả nước có khoảng 33.000 người lao động mắc bệnh nghề nghiệp, với trung bình mỗi năm ghi nhận khoảng 7.000 trường hợp chẩn đoán mới và 500 trường hợp được giám định hưởng bảo hiểm xã hội. Trong danh mục 35 bệnh nghề nghiệp được bảo hiểm chi trả theo Thông tư 15/2016/TT-BYT, bệnh bụi phổi silic chiếm tỷ lệ cao và gây suy giảm chức năng hô hấp nghiêm trọng. Một nghiên cứu hồi cứu trên dữ liệu 63 tỉnh, thành phố giai đoạn 2016–2020 chỉ ra bệnh bụi phổi silic chiếm khoảng 11,9% tổng số ca bệnh nghề nghiệp được ghi nhận.

Hiện nay, chụp X-quang ngực (Chest X-ray - CXR) thẳng là phương pháp sàng lọc và chẩn đoán chủ đạo theo tiêu chuẩn của Tổ chức Lao động Quốc tế (ILO 2011). Tuy nhiên, phương pháp này bộc lộ nhiều hạn chế: độ nhạy ở giai đoạn sớm còn thấp, dễ bỏ sót tổn thương dạng nốt mờ nhỏ; hình ảnh tổn thương dễ nhầm lẫn với các bệnh lý hô hấp khác như viêm phổi, lao phổi, bệnh phổi tắc nghẽn mạn tính; kết quả chẩn đoán phụ thuộc lớn vào trình độ và kinh nghiệm chủ quan của bác sĩ. Mặc dù các kỹ thuật trí tuệ nhân tạo (AI) và học sâu (Deep Learning) đã được ứng dụng trong chẩn đoán hình ảnh lồng ngực tại Việt Nam (tiêu biểu như hệ thống VinDr của VinBigdata năm 2018, đề tài ứng dụng AI tại Bệnh viện Đa khoa thành phố Vinh năm 2024, đề tài cấp Nhà nước KC4.0 do Bệnh viện Phổi Trung ương chủ trì), nhưng chưa có nghiên cứu chuyên biệt nào tập trung vào bệnh bụi phổi silic nghề nghiệp. Thực trạng khan hiếm dữ liệu gán nhãn, mất cân bằng giữa các lớp bệnh và tính phức tạp của tổn thương dạng hạt lan tỏa đặt ra yêu cầu phải phát triển các mô hình học sâu chuyên biệt. Nghiên cứu này phù hợp với định hướng của Nghị quyết số 57-NQ/TW ngày 22/12/2024 của Bộ Chính trị về thúc đẩy ứng dụng trí tuệ nhân tạo trong y tế và chăm sóc sức khỏe cộng đồng.

Mục tiêu nghiên cứu của luận án được xác định rõ ràng:

  • Mục tiêu tổng quát: Nghiên cứu phát triển các mô hình học sâu nhằm hỗ trợ chẩn đoán bệnh bụi phổi silic nghề nghiệp từ ảnh X-quang ngực, dựa trên bộ dữ liệu đa lớp được xây dựng và chuẩn hóa, kết hợp hai hướng tiếp cận học ít mẫu (Few-Shot Learning) và học sâu trên đồ thị (Graph Neural Networks) nhằm nâng cao độ chính xác và khả năng tổng quát của mô hình.
  • Mục tiêu cụ thể:
    1. Nghiên cứu và đánh giá tổng quan: Phân tích, hệ thống hóa các phương pháp chẩn đoán bệnh bụi phổi silic từ ảnh X-quang ngực, khảo sát các kỹ thuật học máy và học sâu; xác định hướng nghiên cứu làm cơ sở đề xuất mô hình.
    2. Xây dựng tập dữ liệu: Đề xuất, tăng cường và hệ thống hóa bộ dữ liệu ảnh X-quang ngực có gán nhãn gồm bốn nhóm: bụi phổi silic nghề nghiệp, viêm phổi do virus, viêm phổi do vi khuẩn và đối tượng bình thường, đảm bảo chuẩn hóa dữ liệu đầu vào.
    3. Phát triển mô hình: Đề xuất mô hình học sâu cải tiến theo hai hướng tiếp cận: (i) Ứng dụng phương pháp học ít mẫu (Few-Shot Learning - FSL) kết hợp phân đoạn và phân loại tổn thương trong điều kiện dữ liệu hạn chế; (ii) Phát triển kiến trúc Graph Transformer Post-hoc (GTP) kết hợp hàm mất mát cân bằng (Balanced Loss) và kỹ thuật học tổng hợp (Ensemble Learning) để khai thác quan hệ không gian đặc trưng.
    4. Đánh giá và ứng dụng: Đánh giá mô hình theo các chỉ số y sinh (độ chính xác, độ nhạy, độ đặc hiệu, Macro-F1, AUC-ROC, 0/1 ER, mIoU), trực quan hóa vùng chú ý bằng Grad-CAM, biểu diễn đặc trưng bằng t-SNE và đối chiếu với chẩn đoán của chuyên gia y tế.

Đối tượng và phạm vi nghiên cứu:

  • Đối tượng nghiên cứu:
    1. Tập dữ liệu ảnh X-quang ngực có gán nhãn thuộc bốn nhóm: bệnh bụi phổi silic nghề nghiệp, viêm phổi do vi khuẩn, viêm phổi do virus và người bình thường.
    2. Các mô hình học sâu trong chẩn đoán hình ảnh y tế: mạng nơ-ron tích chập (DenseNet201, MobileNetV3-Small), mạng biến đổi Swin Transformer, mạng nơ-ron đồ thị (GNN, GCN, GAT, GraphSAGE, GIN), mô hình Graph Transformer Post-hoc (GTP), mô hình học ít mẫu tích hợp phân đoạn và phân loại (IG-FSL / FS-CS), hàm mất mát cân bằng BalCE và kỹ thuật Ensemble Learning.
  • Phạm vi nghiên cứu: Luận án giới hạn trên dữ liệu ảnh X-quang ngực dạng 2D (định dạng DICOM và ảnh tiền xử lý), không mở rộng sang ảnh cắt lớp vi tính (CT) hay dữ liệu đa phương thức khác; tập trung vào bài toán học có giám sát và học ít mẫu, không nghiên cứu học không giám sát hay học tăng cường; đánh giá thực nghiệm bằng các chỉ số kỹ thuật và trực quan hóa, không bao gồm thử nghiệm lâm sàng thực tế tại bệnh viện.

Tổng quan tài liệu và vị trí của luận án

Luận án đã tổng hợp và phân tích có hệ thống các công trình nghiên cứu trong nước và quốc tế liên quan đến chẩn đoán bệnh bụi phổi silic và xử lý ảnh X-quang lồng ngực qua các giai đoạn phát triển công nghệ:

  1. Phương pháp chẩn đoán lâm sàng và cận lâm sàng truyền thống: Chẩn đoán bệnh bụi phổi silic dựa trên Thông tư 15/2016/TT-BYT và tiêu chuẩn ILO (2011) kết hợp tiền sử phơi nhiễm nghề nghiệp (nồng độ bụi silic $> 0,1\text{ mg/m}^3$, làm việc $\ge 8\text{ giờ/ngày}$, tiếp xúc $\ge 3\text{ tháng}$ với thể cấp hoặc $\ge 5\text{ năm}$ với thể mạn tính). Các kỹ thuật cận lâm sàng bao gồm X-quang ngực thẳng (quan sát nốt mờ nhỏ $p, q, r, s, t, u$ và nốt mờ lớn $A, B, C$), chụp cắt lớp vi tính độ phân giải cao (HRCT), thăm dò chức năng hô hấp và nghiên cứu dấu ấn sinh học phân tử biến đổi gen TNF-$\alpha$ [30]. Hạn chế lớn nhất là tính chủ quan và sự phụ thuộc vào kinh nghiệm chuyên gia đọc phim.

  2. Các phương pháp học máy truyền thống (Machine Learning): Trước kỷ nguyên học sâu, các kỹ thuật trích xuất đặc trưng kết cấu như ma trận đồng xuất hiện mức xám (GLCM), biểu đồ cường độ kết hợp bộ phân loại MLP, Decision Tree (DT), Random Forest (RF), SVM đã được áp dụng để phân loại bệnh bụi phổi và viêm phổi [36, 37]. Tiêu biểu như Chandra và cộng sự (2020) [38] sử dụng đặc trưng thống kê và MLP đạt độ chính xác 95,39% trên 412 ảnh; Kuo và cộng sự (2019) [39] kết hợp 11 đặc trưng lâm sàng với ảnh X-quang qua cây quyết định đạt độ chính xác 94,5%; Yue và đồng sự (2020) [40] dùng 6 đặc trưng radiomics bậc hai từ ảnh CT dự đoán thời gian nằm viện của bệnh nhân COVID-19 với AUC đạt 0,97. Nhược điểm của học máy truyền thống là phụ thuộc vào đặc trưng trích xuất thủ công, tốn công sức và dễ bỏ sót các tín hiệu bệnh học vi mô.

  3. Mạng nơ-ron tích chập (CNN) trên ảnh X-quang ngực: Kể từ công trình của Rajpurkar và cộng sự (2017) [45] phát triển mô hình CheXNet dựa trên DenseNet-121 đạt AUC 0,768 trên tập ChestX-ray14, học sâu đã trở thành công cụ chủ đạo. Các nghiên cứu tiếp theo đã mở rộng ứng dụng CNN trong phân loại bệnh phổi: Stephen và cộng sự (2019) [46] đạt độ chính xác 93,73%; Al Mamlook và cộng sự (2020) [47] so sánh các bộ phân loại CNN; Zhang và cộng sự (2020) [48] phát hiện bất thường viêm phổi; Rahman và cộng sự (2020) [49] áp dụng Transfer Learning đạt độ chính xác 98,0%; Liang & Zheng (2020) [50] dùng ResNet cho bệnh nhi đạt độ chính xác 96,8%; Ozturk và cộng sự (2020) [51] phát triển DarkCovidNet đạt độ chính xác 98,08%; Tuncer và cộng sự (2021) [53] kết hợp CNN với biến đổi F-transform đạt độ chính xác 98,14%; Sharma và cộng sự (2024) [54] áp dụng học chuyển giao mở rộng trên ảnh X-quang bệnh bụi phổi silic. Tuy nhiên, DeGrave và cộng sự (2021) [52] cảnh báo nguy cơ CNN học các "đường tắt" (shortcuts) thay vì dấu hiệu bệnh lý, đồng thời CNN gặp hạn chế về tính minh bạch giải thích và yêu cầu lượng dữ liệu gán nhãn rất lớn.

  4. Học sâu trên đồ thị (Graph Neural Networks - GNN): Để mô hình hóa quan hệ không gian giải phẫu và nâng cao tính giải thích, các nghiên cứu đã chuyển đổi biểu diễn ảnh sang cấu trúc đồ thị. Ahmedt-Aristizabal và cộng sự (2021b) [55] cùng Zhang và cộng sự (2023) [57] đã tổng quan toàn diện về GNN trong y tế. Sekuboyina và cộng sự (2021) [56] đề xuất Relational Graph Network trên tập ChestX-ray14. Raghu và cộng sự (2024) [58] kết hợp kiến trúc lai CNN-GCN đạt độ chính xác 98,5%. Wang và cộng sự (2024) [59] giới thiệu GazeGNN tích hợp dữ liệu ánh nhìn bác sĩ; Sultana và cộng sự (2024) [60] phát triển mô hình GNN đa phương thức kết hợp ảnh X-quang, dữ liệu ánh nhìn và báo cáo giọng nói.

  5. Học sâu ít mẫu (Few-Shot Learning - FSL): Nhằm giải quyết tình trạng khan hiếm dữ liệu y tế gán nhãn, các hướng tiếp cận FSL đã được triển khai: Paul và cộng sự (2021) [61] sử dụng Ensemble Learning cho FSL; Chen và cộng sự áp dụng Meta-Learning phân loại viêm phổi từ ít mẫu; Atukunda (2024) [63] ứng dụng Siamese Network kết hợp Transfer Learning; Kim và cộng sự (2024) [64] nghiên cứu Unsupervised FSL; Atukunda & Mwangi (2025) [66] kết hợp Ensemble, Self-Supervised Learning và Meta-Learning.

Nhóm phương pháp Tác giả tiêu biểu Kỹ thuật / Mô hình chính Kết quả / Đặc điểm chính
Học máy truyền thống Chandra et al. (2020) [38]
Kuo et al. (2019) [39]
Yue et al. (2020) [40]
GLCM, đặc trưng kết cấu, MLP, Decision Tree, Radiomics Độ chính xác 94,5% - 95,39%; AUC 0,97; phụ thuộc đặc trưng thủ công
Mạng nơ-ron tích chập (CNN) Rajpurkar et al. (2017) [45]
Rahman et al. (2020) [49]
Ozturk et al. (2020) [51]
Sharma et al. (2024) [54]
CheXNet (DenseNet-121), ResNet, DarkCovidNet, Transfer Learning Độ chính xác 96,8% - 98,08%; tự động trích xuất đặc trưng; tồn tại tính chất "hộp đen"
Học sâu trên đồ thị (GNN) Sekuboyina et al. (2021) [56]
Raghu et al. (2024) [58]
Wang et al. (2024) [59]
Sultana et al. (2024) [60]
Relational Graph Network, CNN-GCN, GazeGNN, Multimodal GNN Độ chính xác đạt 98,5%; mô hình hóa tường minh quan hệ không gian giải phẫu
Học sâu ít mẫu (FSL) Paul et al. (2021) [61]
Atukunda (2024) [63]
Kim et al. (2024) [64]
Atukunda & Mwangi (2025) [66]
Meta-Learning, Siamese Networks, Unsupervised FSL, Ensemble FSL Học phân loại hiệu quả trong điều kiện mẫu hiếm; kiểm soát mức độ suy giảm hiệu năng

Khoảng trống nghiên cứu được lựa chọn giải quyết: Luận án tập trung giải quyết bài toán thiếu hụt công cụ AI chuyên biệt cho bệnh bụi phổi silic nghề nghiệp tại Việt Nam; xử lý triệt để hai nút thắt kỹ thuật lớn gồm: (1) Khả năng chẩn đoán trong điều kiện dữ liệu huấn luyện cực kỳ hạn chế thông qua mô hình FSL tích hợp phân đoạn và phân loại; (2) Khai thác mối quan hệ tương quan không gian đặc trưng giữa các vùng tổn thương và liên ảnh thông qua kiến trúc Graph Transformer Post-hoc kết hợp hàm mất mát cân bằng BalCE để giải quyết hiện tượng mất cân bằng lớp dữ liệu.

Cơ sở lý thuyết và phương pháp nghiên cứu

Luận án xây dựng khung nghiên cứu dựa trên các nền tảng lý thuyết học sâu, lý thuyết đồ thị và xử lý ảnh y tế:

  1. Mô hình mạng nơ-ron tích chập và Transformer:

    • MobileNetV3-Small: Mạng CNN gọn nhẹ, sử dụng các khối tích chập tách biệt theo chiều sâu (depthwise separable convolution) kết hợp cơ chế Squeeze-and-Excitation, tối ưu hóa tài nguyên tính toán.
    • DenseNet201: Mạng tích chập kết nối dày đặc gồm 4 khối Dense Block với số lớp lần lượt là 6, 12, 48 và 32. Các khối chuyển tiếp (Transition Layer) sử dụng tích chập $1 \times 1$ và Average Pooling ($2 \times 2$, stride 2) để giảm chiều không gian và hạn chế hiện tượng quá khớp (overfitting). Sau khối cuối cùng, lớp Global Average Pooling kết nối với lớp phân loại Softmax. Mô hình có khoảng 20 triệu tham số.
    • Swin Transformer: Mô hình Transformer phân cấp xử lý ảnh dựa trên cơ chế tự chú ý cục bộ theo cửa sổ (Window-based Multi-head Self-Attention - W-MSA) và cửa sổ dịch chuyển (Shifted Window-based Multi-head Self-Attention - SW-MSA). Độ phức tạp tính toán giảm từ $O(n^2)$ xuống $O(n)$. Quy trình biến đổi tensor gồm 14 bước: từ ảnh đầu vào $(32, 3, 224, 224)$ qua các tầng Patch Merging và Swin Block liên tiếp, tạo ra kích thước đặc trưng biến thiên từ $(32, 128, 56, 56)$ tại Stage 1 đến $(32, 1024, 7, 7)$ tại Stage 4, cuối cùng qua AdaptiveAvgPool2d về $(32, 1024, 1, 1)$ và lớp tuyến tính Dense ra dự đoán xác suất hai lớp $(32, 2)$.
  2. Lý thuyết đồ thị và mạng nơ-ron đồ thị (GNN):

    • Đồ thị được định nghĩa là $G = (V, E)$, với $V$ là tập các đỉnh và $E$ là tập các cạnh. Cấu trúc liên kết được mô tả qua ma trận kề $A \in \mathbb{R}^{|V| \times |V|}$.
    • Cơ chế truyền thông điệp (Message Passing) bao gồm hai pha: Tổng hợp (Aggregation) và Cập nhật (Update). Vector đặc trưng $h_u^{(l)}$ của nút $u$ được cập nhật tại lớp $l+1$ qua công thức tích chập đồ thị (GCN): $$h_u^{(l+1)} = \sigma \left( \sum_{v \in \mathcal{N}(u) \cup {u}} \frac{\tilde{A}{uv}}{\sqrt{\tilde{D}{uu} \tilde{D}_{vv}}} h_v^{(l)} W^{(l)} \right)$$ trong đó $\tilde{A} = A + I$, $\tilde{D}$ là ma trận bậc của $\tilde{A}$, $W^{(l)}$ là ma trận trọng số học được, và $\sigma(\cdot)$ là hàm kích hoạt phi tuyến (ReLU).
    • Cơ chế chú ý trong Graph Transformer: Áp dụng Scaled Dot-Product Attention: $$\text{Attention}(Q, K, V) = \text{softmax}\left( \frac{QK^T}{\sqrt{d_k}} \right) V$$ và Multi-Head Attention song song qua $h$ đầu chú ý: $$\text{MultiHead}(Q, K, V) = \text{Concat}(\text{head}1, \dots, \text{head}h) W^O$$ với các ma trận chiếu tham số $W_i^Q, W_i^K \in \mathbb{R}^{d{model} \times d_k}$, $W_i^V \in \mathbb{R}^{d{model} \times d_v}$ và $W^O \in \mathbb{R}^{h d_v \times d_{model}}$.
  3. Mô hình học ít mẫu tích hợp (IG-FSL / FS-CS): Khung Few-Shot Learning được thiết kế đồng thời thực hiện hai nhiệm vụ: phân đoạn (segmentation) khoanh vùng tổn thương và phân loại (classification) nhãn bệnh trong điều kiện số lượng mẫu hỗ trợ (support set) cực nhỏ.

  4. Hàm mất mát và kỹ thuật học kết hợp:

    • Sử dụng hàm mất mát entropy chéo tiêu chuẩn (Cross-Entropy - CE) và hàm mất mát entropy chéo cân bằng (Balanced Cross-Entropy - BalCE) để điều chỉnh trọng số lỗi cho các lớp thiểu số.
    • Kết hợp các mô hình thông qua kỹ thuật học tổng hợp (Ensemble Learning) nhằm tăng cường độ ổn định.

Phương pháp nghiên cứu thực tế được triển khai theo 4 trục:

  • Phương pháp nghiên cứu lý thuyết: Khảo cứu tài liệu, hệ thống hóa tiêu chuẩn y khoa ILO và các kiến trúc học sâu.
  • Phương pháp thực nghiệm kỹ thuật: Thu thập dữ liệu DICOM, thực hiện tiền xử lý, gán nhãn, phân chia tập dữ liệu huấn luyện/kiểm thử theo kiểm chứng chéo 5 lần (5-fold cross-validation).
  • Phương pháp đánh giá và kiểm chứng: Sử dụng các chỉ số định lượng gồm độ chính xác (Accuracy), độ nhạy (Sensitivity), độ đặc hiệu (Specificity), Macro-F1, AUC-ROC, tỷ lệ chính xác tuyệt đối (0/1 Exact Ratio - ER) và trung bình giao cắt trên hợp (mIoU); trực quan hóa vùng nhận diện bằng Grad-CAM và biểu diễn phân bố đặc trưng bằng t-SNE.
  • Phương pháp tham vấn chuyên gia: Phối hợp cùng các bác sĩ chuyên khoa tại Hội Y học Lao động Thái Nguyên và Trường Đại học Y - Dược, Đại học Thái Nguyên trong việc thẩm định nhãn dữ liệu và đối chiếu ma trận nhầm lẫn lâm sàng.

Nguồn tư liệu và dữ liệu: Dữ liệu ảnh X-quang ngực thực tế thu thập từ đề tài “Nghiên cứu đặc điểm dịch tễ học phân tử, yếu tố nguy cơ và ứng dụng kỹ thuật tiên tiến trong chẩn đoán sớm bệnh bụi phổi Silic tại Việt Nam” do GS. Lê Thị Hương làm Chủ nhiệm, phối hợp cùng Hội Y học Lao động Thái Nguyên, xây dựng thành hai bộ dữ liệu thực nghiệm: tập dữ liệu DNNBPSi và bộ dữ liệu 4 lớp SVBCX (Silicosis, Viral Pneumonia, Bacterial Pneumonia, Normal).

Nội dung chính theo từng chương

Chương 1: Tổng quan

Chương 1 hệ thống hóa cơ sở bệnh học, tiêu chuẩn chẩn đoán lâm sàng và tổng quan các hướng tiếp cận học máy, học sâu trên ảnh X-quang ngực. Nội dung trọng tâm bao gồm:

  • Phân tích triệu chứng lâm sàng và tiêu chuẩn chẩn đoán theo Thông tư 15/2016/TT-BYT và tiêu chuẩn ILO 2011. Thang phân loại ILO chia mức độ tập trung nốt mờ nhỏ (profusion) thành 4 cấp độ (0 đến 3) với 12 phân cấp: $0/-$, $0/0$, $0/1$, $1/0$, $1/1$, $1/2$, $2/1$, $2/2$, $2/3$, $3/2$, $3/3$, $3/+$. Phân loại hình dạng nốt nhỏ gồm nốt tròn ($p \le 1,5\text{ mm}$, $q$ từ $1,5 - 3\text{ mm}$, $r$ từ $3 - 10\text{ mm}$) và nốt không tròn ($s \le 1,5\text{ mm}$, $t$ từ $1,5 - 3\text{ mm}$, $u$ từ $3 - 10\text{ mm}$) trên 6 vùng phổi. Nốt lớn được phân thành ba nhóm diện tích: Nhóm A ($0 - 50\text{ mm}^2$), Nhóm B ($50 - 125\text{ mm}^2$) và Nhóm C ($> 125\text{ mm}^2$).
  • Khảo sát các nghiên cứu liên quan về chẩn đoán lâm sàng, học máy truyền thống (MLP, Decision Tree, Random Forest), mạng nơ-ron tích chập (CNN như CheXNet, ResNet, DarkCovidNet), học sâu trên đồ thị (GNN, GCN, GAT, GazeGNN) và học sâu ít mẫu (FSL, Siamese Networks, Meta-Learning).
  • Giới thiệu chi tiết lý thuyết các kiến trúc học sâu được lựa chọn: MobileNetV3-Small, DenseNet201 (cấu trúc 4 Dense Blocks, hàm kích hoạt ReLU, Batch Normalization), Swin Transformer (cơ chế W-MSA/SW-MSA và bảng kích thước tensor 14 bước), Mạng nơ-ron đồ thị (GCN, GAT, GraphSAGE, GIN) và Graph Transformer.
  • Phân tích những hạn chế của các nghiên cứu hiện có và xác định các hướng nghiên cứu chính của luận án.

Chương 2: Xây dựng tập dữ liệu

Chương 2 mô tả chi tiết quy trình xây dựng, chuẩn hóa và xử lý tập dữ liệu ảnh X-quang ngực phục vụ huấn luyện và kiểm thử mô hình:

  • Khảo sát dữ liệu: Đánh giá các bộ dữ liệu quốc tế công khai và thực trạng dữ liệu ảnh X-quang bệnh nghề nghiệp trong nước.
  • Nguồn gốc và thu thập dữ liệu: Dữ liệu bệnh bụi phổi silic nghề nghiệp được thu thập từ Hội Y học Lao động Thái Nguyên và đề tài nghiên cứu dịch tễ học do GS. Lê Thị Hương chủ nhiệm.
  • Thách thức dữ liệu: Xử lý định dạng ảnh y tế chuẩn DICOM, loại bỏ nhiễu, khắc phục hiện tượng mất cân bằng số lượng mẫu giữa các nhóm bệnh lý và biến thiên chất lượng ảnh chụp giữa các cơ sở y tế.
  • Tiêu chuẩn lựa chọn và loại trừ: Lựa chọn các phim chụp X-quang ngực thẳng đạt tiêu chuẩn kỹ thuật, có chẩn đoán xác định từ hội đồng chuyên gia; loại trừ các ảnh có dị vật kỹ thuật nặng, mất góc sườn hoành hoặc thiếu thông tin lâm sàng đối chứng.
  • Quy trình tiền xử lý: Chuyển đổi định dạng DICOM sang ảnh số tiêu chuẩn, căn chỉnh kích thước ($224 \times 224$ pixels), chuẩn hóa cường độ điểm ảnh và tăng cường dữ liệu (data augmentation).
  • Cấu trúc tập dữ liệu: Xây dựng tập dữ liệu DNNBPSi và bộ dữ liệu SVBCX phân bổ thành 4 lớp bệnh lý rõ rệt: Bụi phổi silic nghề nghiệp (BPSi), Viêm phổi do virus, Viêm phổi do vi khuẩn và Nhóm đối tượng bình thường. Thống kê đặc điểm ca bệnh theo giới tính và số năm kinh nghiệm phơi nhiễm nghề nghiệp.

Chương 3: Đề xuất mô hình học sâu ít mẫu hỗ trợ phát hiện và khoanh vùng bệnh bụi phổi silic nghề nghiệp

Chương 3 trình bày giải pháp học sâu trong điều kiện dữ liệu y tế gán nhãn cực kỳ hạn chế:

  • Mô hình hóa bài toán Few-Shot Learning (FSL): Phát biểu bài toán phân loại và khoanh vùng tổn thương dưới dạng cấu hình $N$-way $K$-shot.
  • Kiến trúc mô hình đề xuất (IG-FSL / FS-CS): Đề xuất mô hình học ít mẫu tích hợp đồng thời hai nhiệm vụ: phân đoạn (segmentation) vùng tổn thương và phân loại (classification) bệnh lý.
  • Thiết lập thực nghiệm và cấu hình huấn luyện: Thiết lập siêu tham số, cấu hình bộ tối ưu hóa, tốc độ học và các hàm suy hao liên quan.
  • Kết quả thực nghiệm:
    • So sánh hiệu năng giữa mô hình đề xuất và các phương pháp nền tảng dựa trên chỉ số phân loại (0/1 ER - Exact Ratio) và chỉ số phân đoạn (mIoU - Mean Intersection over Union).
    • Đánh giá hiệu suất mô hình theo số lượng lớp phân loại ($N$-way) và số lượng mẫu hỗ trợ ($K$-shot).
    • Phân tích ma trận nhầm lẫn kết quả phân loại.
    • Trực quan hóa kết quả: Bản đồ nhiệt Grad-CAM minh họa vùng chú ý của mô hình IG-FSL và kết quả phân đoạn nhị phân hiển thị rõ vùng xương (màu xanh lá cây) và vùng tổn thương nhu mô phổi (màu đỏ).

Chương 4: Đề xuất mô hình học sâu hỗ trợ phân loại bệnh bụi phổi silic nghề nghiệp

Chương 4 tập trung phát triển kiến trúc học sâu nâng cao cho bài toán phân loại 4 lớp bệnh lý trên toàn bộ tập dữ liệu:

  • Thực nghiệm các mô hình nền tảng: Đánh giá hiệu năng phân loại của các mạng trích xuất đặc trưng tiêu chuẩn: DenseNet201, MobileNetV3-Small và Swin Transformer. Theo dõi diễn biến độ chính xác (Accuracy) và hàm mất mát (Loss) qua từng Epoch.
  • Đề xuất kiến trúc Graph Transformer Post-hoc (GTP): Xây dựng mô đun Graph Transformer gắn vào phía sau (post-hoc) của mạng trích xuất đặc trưng backbone (DenseNet201/Swin Transformer). Đồ thị được xây dựng với các nút đại diện cho vector đặc trưng của ảnh hoặc vùng ảnh, các cạnh phản ánh mối quan hệ tương đồng ngữ cảnh không gian.
  • Tối ưu hóa với hàm mất mát cân bằng (BalCE): So sánh tác động giữa hàm mất mát entropy chéo tiêu chuẩn (CE) và hàm mất mát cân bằng (BalCE), chứng minh BalCE giúp cải thiện đáng kể hiệu năng trên các lớp bệnh có số lượng mẫu ít.
  • Kỹ thuật học tổng hợp (Ensemble Learning): Tích hợp dự đoán từ nhiều mô hình thành phần nhằm nâng cao độ ổn định và giảm phương sai dự báo.
  • Kết quả và đánh giá toàn diện:
    • Đánh giá qua kiểm chứng chéo 5 lần (5-fold cross-validation) với các chỉ số: Độ chính xác phân loại tổng thể (%), Macro-F1, AUC-ROC, Độ nhạy (Sensitivity) và Độ đặc hiệu (Specificity) theo từng lớp bệnh trong bộ dữ liệu DNNBPSi/SVBCX.
    • Trực quan hóa bản đồ nhiệt Grad-CAM của mô hình kết hợp DenseNet201-GTP trên cả 4 lớp phân loại.
    • Phân tích biểu diễn không gian đặc trưng bằng kỹ thuật t-SNE: đối chiếu giữa không gian đặc trưng của mô hình DenseNet201 đơn thuần và mô hình DenseNet201-GTP.
    • Đối chiếu ma trận nhầm lẫn của mô hình với kết quả chẩn đoán độc lập từ các bác sĩ chuyên gia.

Kết quả và những đóng góp mới

Luận án đạt được những kết quả và đóng góp khoa học chính như sau:

  1. Đóng góp về dữ liệu y tế chuyên biệt:

    • Hệ thống hóa, xử lý và chuẩn hóa bộ dữ liệu ảnh X-quang ngực phục vụ nghiên cứu chẩn đoán bệnh bụi phổi silic nghề nghiệp tại Việt Nam.
    • Xây dựng bộ dữ liệu đa lớp chuẩn hóa gồm 4 nhóm: Bụi phổi silic nghề nghiệp (BPSi), Viêm phổi do virus, Viêm phổi do vi khuẩn và Người bình thường, giải quyết tình trạng thiếu hụt dữ liệu gán nhãn chuẩn trong nghiên cứu AI y tế nghề nghiệp.
  2. Đóng góp về phương pháp học ít mẫu (Few-Shot Learning):

    • Đề xuất mô hình học ít mẫu tích hợp (IG-FSL / FS-CS) có khả năng đồng thời thực hiện hai tác vụ: phân đoạn khoanh vùng tổn thương (đánh giá bằng mIoU) và phân loại nhãn bệnh (đánh giá bằng 0/1 ER).
    • Mô hình duy trì hiệu suất nhận diện ổn định ngay cả khi số lượng mẫu huấn luyện bị hạn chế nghiêm trọng.
  3. Đóng góp về mô hình học sâu trên đồ thị và Graph Transformer Post-hoc (GTP):

    • Phát triển kiến trúc Graph Transformer Post-hoc (GTP) tích hợp sau các mạng backbone (DenseNet201, Swin Transformer), cho phép khai thác tường minh mối quan hệ tương quan không gian giữa các vùng tổn thương và liên ảnh dưới dạng cấu trúc đồ thị.
    • Kết hợp thành công hàm mất mát cân bằng (Balanced Cross-Entropy - BalCE) và kỹ thuật học tổng hợp (Ensemble Learning), giúp nâng cao rõ rệt các chỉ số Macro-F1, AUC-ROC, độ nhạy và độ đặc hiệu trên các nhóm bệnh thiểu số.
    • Ứng dụng hiệu quả các kỹ thuật giải thích mô hình (XAI) gồm Grad-CAM và t-SNE, giúp trực quan hóa vùng tổn thương thực tế và cấu trúc phân cụm đặc trưng, tăng cường tính minh bạch và độ tin cậy trong hỗ trợ quyết định y khoa.
  4. Kiến nghị và giải pháp đề xuất:

    • Đề xuất tích hợp các mô hình học sâu đã tối ưu vào các hệ thống hỗ trợ quyết định lâm sàng (CDSS) và hệ thống chẩn đoán hỗ trợ bằng máy tính (CAD) tại các cơ sở y tế lao động và trạm y tế tuyến cơ sở.
    • Khuyến nghị áp dụng quy trình tiền xử lý và chuẩn hóa ảnh DICOM đa lớp kết hợp kỹ thuật giải thích mô hình để hỗ trợ bác sĩ sàng lọc sớm bệnh bụi phổi silic trong các kỳ khám sức khỏe định kỳ cho người lao động.

Hạn chế và hướng nghiên cứu tiếp

Dựa trên nội dung và phạm vi nghiên cứu được công bố trong văn bản luận án, các hạn chế và định hướng phát triển được xác định:

  • Hạn chế của luận án:

    1. Phạm vi dữ liệu hình ảnh: Nghiên cứu mới chỉ tập trung xử lý trên dữ liệu ảnh X-quang ngực thẳng dạng 2D; chưa mở rộng tích hợp ảnh chụp cắt lớp vi tính độ phân giải cao (HRCT) - vốn là công cụ có độ chi tiết cao hơn đối với các tổn thương kẽ phức tạp.
    2. Phương thức dữ liệu: Nghiên cứu tập trung thuần túy vào dữ liệu hình ảnh, chưa kết hợp các nguồn dữ liệu đa phương thức khác như hồ sơ thăm dò chức năng thông khí phổi, tiền sử bệnh án số hóa chi tiết, hay các chỉ số xét nghiệm sinh học phân tử (như biến đổi gen TNF-$\alpha$).
    3. Không gian mô hình: Luận án tập trung vào các mô hình học sâu có giám sát và học ít mẫu; chưa khảo sát các phương pháp học tự giám sát (Self-Supervised Learning) trên quy mô lớn không gán nhãn hoặc học tăng cường.
    4. Mức độ ứng dụng thực tế: Toàn bộ các kết quả đánh giá được thực hiện thông qua thực nghiệm kỹ thuật, kiểm chứng chéo và đối chiếu dữ liệu chuyên gia; chưa tiến hành thử nghiệm triển khai lâm sàng trực tiếp trên hệ thống PACS/CAD thời gian thực tại các bệnh viện.
  • Hướng nghiên cứu tiếp theo:

    1. Mở rộng tập dữ liệu đa trung tâm với quy mô lớn hơn, đa dạng hóa nguồn thu thập từ nhiều vùng công nghiệp có nguy cơ cao.
    2. Phát triển các mô hình học sâu đa phương thức (Multimodal Learning), kết hợp ảnh X-quang ngực với dữ liệu lâm sàng, kết quả đo chức năng hô hấp và dữ liệu ánh nhìn chuyên gia (Gaze-guided).
    3. Mở rộng kiến trúc mô hình sang xử lý ảnh chụp cắt lớp vi tính 3D (CT scanner) và thử nghiệm tích hợp trên hệ thống hỗ trợ chẩn đoán tại các cơ sở y tế thực tế.

Giá trị tham khảo

Luận án mang lại giá trị tham khảo thiết thực cho nhiều nhóm đối tượng học thuật và thực tiễn:

  • Đối với nghiên cứu sinh, học viên cao học và nhà nghiên cứu:

    • Cung cấp tài liệu tham khảo chi tiết về cách thức triển khai các kiến trúc học sâu hiện đại (DenseNet201, Swin Transformer, Graph Neural Networks, Graph Transformer) vào bài toán phân tích ảnh y tế phức tạp.
    • Cung cấp phương pháp luận hoàn chỉnh về thiết kế mô hình học ít mẫu tích hợp (IG-FSL) để giải quyết bài toán dữ liệu hạn chế, cùng phương pháp thiết lập hàm mất mát cân bằng (BalCE) và kỹ thuật hậu xử lý trên đồ thị (GTP).
  • Đối với giảng viên và cơ sở đào tạo:

    • Là tài liệu nghiên cứu chuyên đề trong các môn học về Trí tuệ nhân tạo trong y tế, Thị giác máy tính và Khoa học dữ liệu ứng dụng.
  • Đối với bác sĩ, chuyên gia y tế và cán bộ quản lý chính sách y tế nghề nghiệp:

    • Đóng vai trò là tài liệu kỹ thuật minh chứng cho khả năng ứng dụng AI trong sàng lọc bệnh nghề nghiệp, hỗ trợ nâng cao năng lực chẩn đoán hình ảnh tại các cơ sở y tế cơ sở thiếu chuyên gia chẩn đoán hình ảnh giàu kinh nghiệm.
    • Phần quy trình chuẩn hóa dữ liệu X-quang theo chuẩn ILO 2011 (Chương 1, Chương 2) và phân tích trực quan hóa Grad-CAM (Chương 3, Chương 4) là nguồn tham khảo trực quan phục vụ công tác đối chiếu lâm sàng.

Câu hỏi thường gặp

1. Bệnh bụi phổi silic nghề nghiệp được phân loại như thế nào trên ảnh X-quang ngực theo tiêu chuẩn ILO 2011?
Trả lời: Theo hướng dẫn ILO 2011, bất thường trên X-quang được phân thành tổn thương nhu mô và tổn thương màng phổi. Tổn thương nhu mô gồm nốt mờ nhỏ ($< 1\text{ cm}$) và nốt mờ lớn ($> 10\text{ mm}$). Nốt mờ nhỏ được đánh giá theo mức độ tập trung (profusion) gồm 4 cấp độ chính (0 đến 3) với 12 phân cấp ($0/-, 0/0, 0/1, 1/0, 1/1, 1/2, 2/1, 2/2, 2/3, 3/2, 3/3, 3/+$) trên 6 vùng phổi; phân loại hình thái gồm nốt tròn ($p \le 1,5\text{ mm}; q: 1,5 - 3\text{ mm}; r: 3 - 10\text{ mm}$) và nốt không tròn ($s \le 1,5\text{ mm}; t: 1,5 - 3\text{ mm}; u: 3 - 10\text{ mm}$). Nốt mờ lớn được chia theo diện tích bề mặt thành ba nhóm: Nhóm A ($0 - 50\text{ mm}^2$), Nhóm B ($50 - 125\text{ mm}^2$) và Nhóm C ($> 125\text{ mm}^2$).

2. Kiến trúc Graph Transformer Post-hoc (GTP) trong luận án có nguyên lý hoạt động gì?
Trả lời: GTP là kiến trúc học sâu trên đồ thị được thiết kế để tích hợp vào giai đoạn hậu xử lý (post-hoc) sau mạng trích xuất đặc trưng backbone (như DenseNet201 hoặc Swin Transformer). Mô đun này mô hình hóa các vector đặc trưng dưới dạng các nút trong đồ thị và học các mối quan hệ tương quan không gian, ngữ cảnh thông qua cơ chế Multi-Head Attention được điều chỉnh theo cấu trúc đồ thị, giúp tăng cường khả năng phân biệt tổn thương ở các lớp bệnh mất cân bằng.

3. Mô hình học ít mẫu tích hợp (IG-FSL / FS-CS) giải quyết đồng thời các tác vụ nào và dùng chỉ số gì để đo lường?
Trả lời: Mô hình IG-FSL được thiết kế nhằm đồng thời giải quyết hai tác vụ: phân đoạn (segmentation) khoanh vùng tổn thương phổi và phân loại (classification) nhãn bệnh trong điều kiện số lượng ảnh huấn luyện rất nhỏ ($N$-way $K$-shot). Hiệu năng của mô hình được đo lường thông qua chỉ số trung bình giao cắt trên hợp (mIoU) cho phân đoạn và tỷ lệ chính xác tuyệt đối (0/1 Exact Ratio - ER) cho phân loại.

4. Tập dữ liệu ảnh X-quang ngực trong luận án gồm những nhóm bệnh lý nào và có nguồn gốc từ đâu?
Trả lời: Tập dữ liệu được xây dựng gồm 4 nhóm lớp bệnh lý: (1) Bệnh bụi phổi silic nghề nghiệp (BPSi), (2) Viêm phổi do virus, (3) Viêm phổi do vi khuẩn, và (4) Nhóm đối tượng bình thường. Dữ liệu bệnh bụi phổi silic được thu thập tại Việt Nam thông qua Hội Y học Lao động Thái Nguyên và đề tài nghiên cứu dịch tễ học do GS. Lê Thị Hương làm Chủ nhiệm.

5. Hàm mất mát Balanced Cross-Entropy (BalCE) đóng vai trò gì trong quá trình huấn luyện mô hình?
Trả lời: Hàm mất mát BalCE được áp dụng nhằm điều chỉnh trọng số tính toán suy hao giữa các lớp bệnh, khắc phục hiện tượng mô hình bị thiên lệch về các lớp chiếm đa số (như bình thường hoặc viêm phổi thông thường) và cải thiện độ nhạy, độ đặc hiệu cũng như chỉ số Macro-F1 trên lớp bệnh bụi phổi silic vốn có số lượng mẫu ít hơn.

Kết luận

Luận án tiến sĩ của nghiên cứu sinh Nguyễn Thị Tân Tiến đã giải quyết bài toán hỗ trợ chẩn đoán bệnh bụi phổi silic nghề nghiệp từ ảnh X-quang ngực thông qua việc phát triển các mô hình học sâu cải tiến. Bằng cách kết hợp mô hình học ít mẫu tích hợp phân đoạn - phân loại (IG-FSL) và kiến trúc Graph Transformer Post-hoc (GTP) tối ưu hóa với hàm mất mát cân bằng BalCE, nghiên cứu đã khắc phục hiệu quả thách thức về sự khan hiếm dữ liệu và mất cân bằng lớp bệnh. Các kết quả thực nghiệm kiểm chứng chéo, phân tích Grad-CAM, t-SNE và đối chiếu chuyên gia khẳng định tính đúng đắn khoa học và tiềm năng ứng dụng thực tiễn của các mô hình trong công tác chăm sóc sức khỏe lao động.