Tổng quan nghiên cứu

Theo thống kê của các tổ chức y tế quốc tế, bệnh ung thư máu (bạch cầu cấp) là một trong những bệnh lý ác tính có tỷ lệ tử vong cao và tiến triển nhanh nhất trong các bệnh lý ung thư hiện nay. Trong đó, việc chẩn đoán phân biệt chính xác giữa hai phân nhóm chính gồm Bạch cầu dòng lympho cấp tính (ALL) và Bạch cầu dòng tủy cấp tính (AML) giữ vai trò sống còn đối với phác đồ điều trị của bệnh nhân. Bộ gen người chứa hơn 3 tỷ cặp base, khoảng 20.000 gen chức năng phân bố trên 23 cặp nhiễm sắc thể. Mỗi tế bào ung thư mang những biến đổi phân tử đặc trưng mà các phương pháp chẩn đoán lâm sàng truyền thống thường gặp nhiều khó khăn để phát hiện sớm.

Các phương pháp chẩn đoán truyền thống như xét nghiệm công thức máu, kiểm tra thể chất, sinh thiết tủy xương và chẩn đoán hình ảnh thường mất từ 24 đến 72 giờ để hoàn thành. Đồng thời, các quy trình này có nguy cơ sai số do phụ thuộc vào kỹ năng và kinh nghiệm chủ quan của bác sĩ mô bệnh học. Việc phân loại nhầm giữa ALL và AML có thể dẫn đến chỉ định sai phác đồ hóa trị, làm giảm nghiêm trọng cơ hội sống của người bệnh.

Luận văn thạc sĩ chuyên ngành Hệ thống Thông tin tại Trường Đại học Công nghệ Thông tin - Đại học Quốc gia Thành phố Hồ Chí Minh (thực hiện năm 2024) tập trung nghiên cứu giải pháp tự động hóa quá trình phân loại ung thư máu dựa trên dữ liệu biểu hiện gen (Gene Expression Microarray Data). Mục tiêu cốt lõi của nghiên cứu là xây dựng quy trình tiền xử lý dữ liệu chuẩn mực, giảm chiều không gian từ hơn 7.000 chỉ số gen và so sánh thực nghiệm hiệu năng của 9 thuật toán học máy hiện đại. Nghiên cứu hướng đến việc nâng cao độ chính xác phân loại lên mức trên 95%, đồng thời rút ngắn thời gian xử lý thuật toán xuống dưới 0,1 giây cho mỗi ca bệnh, cung cấp công cụ hỗ trợ ra quyết định lâm sàng đáng tin cậy.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng dựa trên sự giao thoa giữa sinh học phân tử hiện đại và khoa học dữ liệu:

  • Thuyết di truyền phân tử và biểu hiện gen: Quá trình biểu hiện gen phản ánh dòng thông tin di truyền từ DNA qua phiên mã tạo mRNA và dịch mã tạo protein. Sự biến đổi bệnh lý ở cấp độ phiên mã tạo ra các lát cắt phân tử đặc trưng giữa tế bào tủy xương lành mạnh và tế bào ung thư bạch cầu. Đột biến chuyển vị nhiễm sắc thể t(9;22) tạo ra gen dung hợp BCR-ABL1 xuất hiện ở khoảng 25% bệnh nhân ALL trưởng thành là một minh chứng phân tử điển hình.
  • Lý thuyết học máy có giám sát và không giám sát (Supervised and Unsupervised Learning Theory): Khung lý thuyết này cung cấp nền tảng toán học để phân tách các điểm dữ liệu trong không gian nhiều chiều. Các mô hình phân loại có giám sát sử dụng nhãn bệnh lý (ALL hoặc AML) để tối ưu hàm mục tiêu, trong khi thuật toán phân cụm không giám sát phân nhóm các mẫu bệnh phẩm dựa trên độ tương đồng khoảng cách Euclid.
  • Lý thuyết học kết hợp (Ensemble Learning Theory): Bao gồm kỹ thuật Bagging (kết hợp lấy mẫu ngẫu nhiên như Random Forest) và Boosting (tối ưu hóa phần dư tuần tự như AdaBoost và XGBoost), giúp giảm thiểu hiện tượng quá khớp (overfitting) và tăng cường khả năng tổng quát hóa trên tập dữ liệu nhỏ.

Các khái niệm trọng tâm xuyên suốt nghiên cứu gồm: Hồ sơ biểu hiện gen (Gene Expression Profile), Kỹ thuật phân tích thành phần chính (Principal Component Analysis - PCA), Chuẩn hóa dữ liệu (Data Scaling), Ma trận nhầm lẫn (Confusion Matrix), Độ lợi thông tin (Information Gain) và Chỉ số bất định Gini (Gini Impurity).

Phương pháp nghiên cứu

  • Nguồn dữ liệu và đặc điểm mẫu: Nghiên cứu sử dụng tập dữ liệu chuẩn hóa vi mảng gen kinh điển của Golub et al. gồm 72 mẫu bệnh phẩm lâm sàng (47 mẫu ALL và 25 mẫu AML). Mỗi mẫu bệnh phẩm được đo lường mức độ biểu hiện trên 7.129 vị trí gen (gene accession features). Dữ liệu được phân chia thành tập huấn luyện (training set) gồm 38 mẫu và tập kiểm thử độc lập (testing set) gồm 34 mẫu.
  • Phương pháp chọn mẫu và lý do lựa chọn: Nghiên cứu sử dụng toàn bộ 72 mẫu bệnh phẩm được công bố chuẩn hóa quốc tế để đảm bảo tính khách quan và khả năng so chuẩn với các công trình khoa học toàn cầu. Do số chiều đặc trưng (7.129 gen) lớn gấp gần 100 lần số lượng quan sát (72 mẫu), hiện tượng "lời nguyền số chiều" (curse of dimensionality) là thách thức lớn nhất. Vì vậy, phương pháp giảm chiều dữ liệu PCA kết hợp kỹ thuật chuẩn hóa thang đo (StandardScaler / Min-Max Scaler) được chọn lựa để cô đọng thông tin, loại bỏ nhiễu kỹ thuật và giữ lại các thành phần giải thích trên 90% phương sai dữ liệu.
  • Quy trình phân tích và công cụ: Nghiên cứu triển khai thực nghiệm so sánh đồng thời 9 mô hình: Naive Bayes, Logistic Regression, Support Vector Machine (SVM), Decision Tree, Random Forest, XGBoost, AdaBoost, Mạng nơ-ron nhân tạo (Neural Network) và K-Means Clustering. Quy trình kiểm định chéo (Cross-Validation) kết hợp dò tìm lưới siêu tham số (Grid Search) được áp dụng trên ngôn ngữ Python với các thư viện chuyên sâu Scikit-learn, XGBoost và Pandas trong suốt thời gian thực hiện năm 2024.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

  • Phát hiện 1 (Hiệu năng tuyệt đối của SVM và Random Forest): Sau khi áp dụng chuẩn hóa dữ liệu và trích xuất đặc trưng bằng PCA, mô hình Support Vector Machine (SVM) và Random Forest đều đạt độ chính xác (Accuracy) tuyệt đối 100% trên tập kiểm thử 34 mẫu. Tất cả các chỉ số Precision, Recall và F1-Score cho cả hai phân lớp ALL và AML đều đạt giá trị 1,00, không ghi nhận bất kỳ ca phân loại nhầm nào.
  • Phát hiện 2 (Tác động của tiền xử lý dữ liệu): Việc chuẩn hóa dữ liệu (Data Scaling) giúp cải thiện rõ rệt hiệu năng của các thuật toán phân loại tuyến tính và xác suất. Mô hình Logistic Regression tăng độ chính xác từ mức 91,2% trên dữ liệu gốc lên 97,1% khi có chuẩn hóa và đạt 100% khi kết hợp PCA. Tương tự, Naive Bayes nâng độ chính xác từ 88,2% lên 94,1% sau khi loại bỏ sai lệch biên độ thang đo của các vi mảng gen.
  • Phát hiện 3 (Sức mạnh của kỹ thuật Boosting và tối ưu siêu tham số): Mô hình XGBoost khi kết hợp PCA và Grid Search đạt độ chính xác 97,1%, cao hơn 5,9% so với phiên bản XGBoost không qua tinh chỉnh tham số (đạt 91,2%). Thuật toán AdaBoost cũng duy trì độ chính xác ổn định ở mức 94,1% trên tập kiểm thử.
  • Phát hiện 4 (Khả năng phân cụm tự nhiên của K-Means): Trong bài toán học không giám sát, mô hình K-Means Clustering sau khi chuẩn hóa dữ liệu và áp dụng PCA đã phân tách chính xác các cụm bệnh nhân với tỷ lệ khớp mẫu đạt 88,2%, chứng minh các đặc trưng biểu hiện gen tự thân chứa đựng cấu trúc phân tách rõ nét giữa hai dòng tế bào bạch cầu.

Thảo luận kết quả

Hiệu năng vượt trội của SVM được giải thích bởi khả năng tìm kiếm siêu phẳng tối ưu có biên phân cách cực đại trong không gian nhiều chiều, đặc biệt phù hợp với các tập dữ liệu sinh học có số lượng đặc trưng vượt trội so với số lượng mẫu quan sát. Đối với Random Forest, cơ chế biểu quyết đa số từ hàng trăm cây quyết định độc lập giúp triệt tiêu phương sai và chống quá khớp hiệu quả.

Khi so sánh với các công trình nghiên cứu trước đây trong cùng lĩnh vực, kết quả thực nghiệm của luận văn khẳng định rằng việc giảm số lượng đặc trưng từ 7.129 gen xuống một số ít thành phần chính qua PCA không làm mất đi thông tin phân loại cốt lõi mà còn giúp giảm hơn 90% thời gian tính toán của mô hình.

Các dữ liệu thực nghiệm được trình bày trực quan thông qua bảng Classification Report chi tiết và biểu đồ Ma trận nhầm lẫn (Confusion Matrix Heatmap) cho từng mô hình ở 3 trạng thái dữ liệu: dữ liệu gốc, dữ liệu sau chuẩn hóa và dữ liệu sau giảm chiều PCA. Đồ thị so sánh tương quan giữa độ chính xác và thời gian thực thi (Execution Time) minh chứng rõ nét rằng mô hình SVM và Logistic Regression có thời gian phản hồi cực nhanh (dưới 0,02 giây), tạo điều kiện lý tưởng để tích hợp vào các hệ thống phần mềm hỗ trợ chẩn đoán thời gian thực.

Đề xuất và khuyến nghị

  • Tích hợp mô hình học máy vào hệ thống chẩn đoán lâm sàng: Đơn vị công nghệ y tế và các bệnh viện chuyên khoa huyết học cần tích hợp thuật toán SVM và Random Forest tối ưu vào hệ thống phần mềm hỗ trợ ra quyết định lâm sàng (Clinical Decision Support Systems - CDSS). Giải pháp này đặt mục tiêu rút ngắn 50% thời gian hội chẩn ban đầu và nâng độ chính xác chẩn đoán ca bệnh phức tạp lên trên 98%, triển khai thí điểm trong giai đoạn 2025 - 2026.
  • Chuẩn hóa quy trình tiền xử lý dữ liệu biểu hiện gen: Các phòng xét nghiệm sinh học phân tử phối hợp cùng cơ quan quản lý y tế ban hành quy chuẩn kỹ thuật về xử lý dữ liệu vi mảng và giải trình tự RNA-Seq, áp dụng thống nhất các bước Data Scaling và trích xuất đặc trưng PCA. Mục tiêu hoàn thành bộ tiêu chuẩn trong vòng 12 tháng nhằm loại bỏ hoàn toàn các sai số kỹ thuật giữa các dòng máy xét nghiệm.
  • Mở rộng cơ sở dữ liệu và nghiên cứu đa trung tâm: Các viện nghiên cứu y sinh học cần mở rộng quy mô thu thập mẫu từ 72 ca bệnh hiện tại lên quy mô hơn 1.000 mẫu bệnh nhân tại nhiều bệnh viện khác nhau. Quá trình này cần bổ sung các phân nhóm đột biến gen hiếm và thông tin lâm sàng mở rộng, thực hiện theo lộ trình từ năm 2025 đến năm 2027.
  • Đào tạo nhân lực liên ngành Tin sinh học và AI Y tế: Các trường đại học khối khoa học sức khỏe và công nghệ thông tin cần đẩy mạnh xây dựng chương trình đào tạo liên ngành về Khoa học dữ liệu y sinh, đào tạo khoảng 500 chuyên gia và kỹ sư dữ liệu y tế mỗi năm, bắt đầu triển khai từ quý 1 năm 2025.

Đối tượng nên tham khảo luận văn

  • Bác sĩ chuyên khoa Huyết học và Ung bướu: Tài liệu cung cấp cơ sở phân loại sinh học phân tử chuyên sâu, giúp bác sĩ nắm bắt cách thức các công cụ trí tuệ nhân tạo diễn giải dữ liệu biểu hiện gen, từ đó phối hợp tự tin với kết quả xét nghiệm tủy đồ để cá thể hóa phác đồ điều trị cho bệnh nhân ALL và AML.
  • Nhà nghiên cứu Tin sinh học và Dữ liệu Y sinh: Cung cấp toàn bộ khung phương pháp luận xử lý dữ liệu chiều cao (High-Dimensional Data), kỹ thuật lựa chọn đặc trưng và quy trình kiểm định mô hình thực nghiệm, làm tài liệu tham khảo trực tiếp cho các đề tài phân tích biểu hiện gen trong ung thư phổi, ung thư vú và ung thư hạch.
  • Kỹ sư Trí tuệ Nhân tạo và Khoa học Dữ liệu: Hữu ích trong việc nghiên cứu các kỹ thuật tối ưu hóa thuật toán học máy cổ điển, xử lý bài toán mất cân bằng dữ liệu mẫu nhỏ và áp dụng Grid Search để tinh chỉnh siêu tham số trên các tập dữ liệu phức tạp.
  • Học viên cao học và Sinh viên ngành Hệ thống Thông tin / Khoa học Máy tính: Là tài liệu tham khảo chuẩn mực về cấu trúc một công trình nghiên cứu ứng dụng AI trong y tế, từ cách đặt vấn đề, thiết kế thực nghiệm, trực quan hóa ma trận nhầm lẫn đến đánh giá đa chiều các chỉ số Precision, Recall và F1-Score.

Câu hỏi thường gặp

Phân tích biểu hiện gen có ưu điểm gì vượt trội so với xét nghiệm máu thông thường?

Phân tích biểu hiện gen khảo sát trực tiếp mức độ phiên mã của hơn 7.000 chỉ số phân tử, giúp phát hiện biến đổi ác tính ở cấp độ tế bào gốc trước khi biểu hiện thành triệu chứng lâm sàng. Trong khi xét nghiệm máu chỉ phản ánh số lượng tế bào ngoại vi, phân tích gen cho phép phân biệt chính xác thể ALL và AML với độ tin cậy đạt trên 98%.

Tại sao mô hình SVM lại đạt hiệu năng phân loại cao nhất trên dữ liệu biểu hiện gen?

Dữ liệu biểu hiện gen có số lượng đặc trưng (7.129 gen) lớn hơn rất nhiều so với số lượng mẫu bệnh nhân (72 mẫu). Thuật toán SVM hoạt động cực kỳ hiệu quả trong không gian đa chiều nhờ nguyên lý tìm kiếm siêu phẳng có khoảng cách cực đại giữa hai lớp dữ liệu, giúp tối ưu hóa ranh giới phân loại và hạn chế tối đa nguy cơ quá khớp.

Vai trò của kỹ thuật PCA trong quy trình phân loại ung thư máu là gì?

Kỹ thuật PCA giúp cô đọng hơn 7.000 biến số gen ban đầu về các thành phần chính mang phương sai lớn nhất mà không làm mất đi thông tin phân loại quan trọng. Quá trình này giúp loại bỏ các chiều dữ liệu dư thừa, giảm hơn 90% chi phí tính toán và rút ngắn thời gian thực thi thuật toán xuống dưới 0,05 giây.

Đột biến nhiễm sắc thể Philadelphia t(9;22) ảnh hưởng như thế nào đến bệnh lý ALL?

Chuyển vị nhiễm sắc thể t(9;22) tạo ra gen dung hợp BCR-ABL1, sản sinh protein tyrosine kinase kích thích tế bào bạch cầu phân chia mất kiểm soát. Đột biến này xuất hiện ở khoảng 25% bệnh nhân ALL trưởng thành, là chỉ dấu sinh học phân tử then chốt để phân tầng nguy cơ và chỉ định phác đồ điều trị đích bằng thuốc ức chế tyrosine kinase.

Khung nghiên cứu của luận văn có thể áp dụng cho các loại ung thư khác không?

Quy trình tiền xử lý dữ liệu chuẩn hóa thang đo, giảm chiều đặc trưng bằng PCA và so sánh thực nghiệm 9 thuật toán hoàn toàn có thể áp dụng cho các dạng ung thư khác như ung thư hạch (Lymphoma với tỷ lệ sống 5 năm khoảng 73% - 87%) hoặc Đa u tủy xương (Myeloma với tỷ lệ sống khoảng 52%) khi có dữ liệu giải trình tự tương ứng.

Kết luận

  • Luận văn đã thực hiện đánh giá toàn diện và có hệ thống hiệu năng của 9 thuật toán học máy hiện đại trên dữ liệu biểu hiện gen phục vụ phân loại ung thư bạch cầu cấp.
  • Nghiên cứu chứng minh quy trình tiền xử lý kết hợp Data Scaling và giảm chiều dữ liệu bằng PCA giúp nâng cao độ chính xác phân loại của các mô hình từ 5% đến 15%.
  • Xác định SVM và Random Forest là hai mô hình tối ưu nhất với độ chính xác đạt 100% trên tập kiểm thử độc lập, cùng thời gian thực thi dưới 0,05 giây.
  • Khẳng định tính khả thi của việc ứng dụng học máy vào phân loại phân tử ALL và AML, hỗ trợ xây dựng phác đồ điều trị cá thể hóa chính xác.
  • Đóng góp một khung phương pháp luận chuẩn mực cho bài toán phân loại dữ liệu y sinh học có số chiều đặc trưng lớn và số lượng mẫu giới hạn.

Đóng góp quan trọng nhất của công trình là giải quyết triệt để bài toán "lời nguyền số chiều" trong phân tích dữ liệu vi mảng gen lâm sàng, mang lại giải pháp phân loại ung thư máu tự động với độ chính xác tuyệt đối. Trong giai đoạn 2025 - 2026, hướng nghiên cứu tiếp theo sẽ tập trung mở rộng mô hình trên tập dữ liệu giải trình tự RNA-Seq đa trung tâm và thử nghiệm tích hợp vào phần mềm chẩn đoán bệnh viện. Các cơ sở y tế và viện nghiên cứu chuyên khoa hãy chủ động ứng dụng khung thuật toán này nhằm nâng cao chất lượng chẩn đoán sớm và tối ưu hóa hiệu quả điều trị cho bệnh nhân ung thư máu.