CHƯƠNG 1. GIỚI THIỆU Trong chương này, chúng tôi trình bày sự cần thiết của mô hình xử lý hiệu quả dữ liệu biểu hiện gen trong phân lớp bệnh ung thư. Tiếp theo là mục tiêu, đối tượng, phạm vi, phương pháp nghiên cứu và các đóng góp của luận án. Cuối cùng là bố cục của luận án.
Tính cấp thiết của luận án Nguyên nhân gây ra bệnh ung thư liên quan đến sự thay đổi trong bộ gen và sự kết hợp các đột biến gen xảy ra trong quá trình di truyền. Theo tổ chức y tế thế giới (WHO), ung thư là một trong những nguyên nhân gây chết người hàng đầu [2]. Gần đây, nghiên cứu điều trị bệnh ung thư trở thành vấn đề quan trọng trong lĩnh vực y tế trên toàn thế giới do tỷ lệ bệnh và tử vong cao [3]. Trong năm 2018, theo thống kê của WHO đã có thêm 18,1 triệu bệnh nhân ung thư và 9,6 triệu người đã tử vong bởi căn bệnh này.
Ngoài ra, Rahib và các cộng sự đã nghiên cứu dự báo số lượng người bệnh ung thư sẽ tăng 20% đến 40% từ năm 2020 và 2030 so với năm 2010 [4]. Mặc dù đã có nhiều nghiên cứu điều trị bệnh ung thư. Tuy nhiên các phương pháp hiện nay chưa thực sự mang lại hiệu quả tốt nhất cho người bệnh do sự liên quan phức tạp giữa các yếu tố di truyền, tế bào và đột biến gen trong quá trình phát triển của con người [5]. Phác đồ điều trị chung cho các nhóm bệnh ung thư có thể mang lại hiệu quả khác nhau đối với từng bệnh nhân [6].
Những năm gần đây, phương pháp điều trị cá nhân hóa còn được gọi là y học hóa cá thể (personalized medicine) là một hướng điều trị có hiệu quả đối với bệnh ung thư [7]. Phương pháp này tốt hơn hơn khi đánh giá được hiệu quả điều trị dựa trên chính hồ sơ di truyền của bệnh nhân [8]. Gần đây, các nghiên cứu trên toàn bộ hệ gen người giúp khám phá ra vai trò của các tác nhân di truyền trong quá trình gây bệnh. Trong đó, các nghiên cứu phân tích dữ liệu biểu hiện gen đã cung cấp các thông tin quan trọng để hỗ trợ xây dựng phác đồ điều trị phù hợp cho từng bệnh nhân dựa vào các thông tin gen học của từng cá thể [7].
1 luan an Sự phát triển công nghệ phân tích biểu hiện gen được sử dụng rộng rãi trong các nghiên cứu y sinh đã tạo ra lượng dữ liệu khổng lồ được công bố trên các kho dữ liệu trực tuyến. Biểu hiện gen (gene expression) là quá trình mà qua đó thông tin mã hóa trong một gen được truyền vào cấu trúc đang có trong tế bào và điều khiển tế bào [9]. Dữ liệu biểu hiện gen được các mô hình học máy xử lý và phân tích nhằm cung cấp thông tin hữu ích để chẩn đoán và điều trị bệnh ung thư. Tuy nhiên, đặc điểm dữ liệu biểu hiện gen có số chiều rất lớn được phân tích từ các mức độ biểu hiện của hàng chục nghìn gen của các tế bào qua các thí nghiệm và số mẫu nhỏ do chi phí cao của các công nghệ [10] nên phân lớp dữ liệu biểu hiện gen là bài toán phức tạp.
Các mô hình học máy được ứng dụng xử lý dữ liệu biểu hiện gen gồm phân lớp (classification), chọn gen (feature selection) và phân cụm (clustering) [11]. Các nghiên cứu này đã mang lại nhiều tri thức quan trọng để nâng cao chất lượng và hiệu quả điều trị và chẩn đoán bệnh ung thư [7, 12, 13, 14]. Trong đó, chọn gen và phân cụm gen là hai lĩnh vực nghiên cứu y sinh liên quan nhiều đến nghiên cứu dược học và đánh giá vai trò chức năng gen trong y học [15, 16]. Phân lớp dữ liệu biểu hiện gen là bài toán quan trọng để chẩn đoán một bệnh phẩm mới chưa được gán nhãn [17, 18, 19, 20, 21, 22].
Đây là hướng nghiên cứu được quan tâm nhiều nhất trong lĩnh vực phân tích dữ liệu biểu hiện gen [11] khi tận dụng sức mạnh của các mô hình phân lớp để chẩn đoán tự động một mẫu bệnh phẩm mới mà không cần nhiều đến kiến thức y sinh liên quan đến dữ liệu [23]. Phân lớp dữ liệu có số chiều lớn là một trong 10 vấn đề khó của cộng đồng khai phá dữ liệu [24]. Các mô hình phân lớp dữ liệu có số chiều lớn thường cho kết quả tốt trên tập huấn luyện nhưng lại có kết quả thấp trên tập kiểm tra. Thách thức chính của phân lớp biểu hiện gen là dữ liệu phân tích có số chiều rất lớn lên đến hàng chục nghìn chiều và tách rời nhau trong không gian có số chiều cao nên tìm mô hình phân lớp tốt là khó khăn do có nhiều khả năng lựa chọn mô hình tốt.
Vì vậy để tìm kiếm một mô hình phân lớp hiệu quả (phân lớp dữ liệu tốt trên tập kiểm thử) trong không gian giả thuyết lớn là vấn đề phức tạp. Xây dựng mô hình phân lớp tốt trên các tập dữ liệu có số chiều lớn và số mẫu nhỏ là bài toán khó trong lĩnh vực học máy. Mặc dù đã có nhiều mô hình phân lớp dữ liệu biểu hiện gen được đề xuất nhưng độ chính xác của mô hình vẫn còn bị giới hạn do sự phức tạp của dữ 2 luan an liệu [25]. Trong lĩnh vực học máy, khi số chiều dữ liệu tăng thì số dữ liệu phân tích cũng tăng lên theo cấp số nhân.
Bellman gọi hiện tượng này là "curse of dimensionality" khi xem xét các vấn đề về tối ưu hóa [26]. Đặc biệt đối với dữ liệu biểu hiện gen do dữ liệu không phủ hết trên tất cả các không gian nên kết quả phân lớp trên tập học và tập kiểm tra rất khác nhau làm cho mô hình phân lớp dễ bị quá khớp (overfiting). Nâng cao độ chính xác các mô hình phân lớp dữ liệu biểu hiện gen có đặc điểm "large p, small n" là một thách thức quan trọng [25]. Chính những thách thức này thúc đẩy chúng tôi thực hiện nghiên cứu quan trọng này.
Mục tiêu, đối tượng, phạm vi và phương pháp nghiên cứu Xử lý dữ liệu biểu hiện gen là chủ đề nghiên cứu quan trọng trong tin sinh học [27]. Trong đó, phân lớp dữ liệu biểu hiện gen là bài toán quan trọng [27] vì các mô hình phân lớp có thể chẩn đoán tự động một mẫu bệnh phẩm ung thư mới mà không cần nhiều đến kiến thức y sinh liên quan đến dữ liệu [23]. Các mô hình phân lớp có thể hỗ trợ các nghiên cứu y khoa chẩn đoán bệnh chính xác hơn góp phần cải thiện hiệu quả điều trị ung thư [28, 29]. Mục tiêu chính của luận án là đề xuất các phương pháp tiếp cận mới cho "bài toán phân lớp dữ liệu biểu hiện gen" để nâng cao độ chính xác phân lớp với các mục tiêu cụ thể sau: • Nghiên cứu xây dựng mô hình rút trích đặc trưng hiệu quả cho dữ liệu biểu hiện gen để nâng cao độ chính xác phân lớp.
• Nghiên cứu xây dựng mô hình tăng cường dữ liệu cho dữ liệu biểu hiện gen để nâng cao độ chính xác phân lớp. • Nghiên cứu xây dựng mô hình phân lớp hiệu quả dữ liệu biểu hiện gen. Đối tượng nghiên cứu là các mô hình rút trích đặc trưng, mô hình sinh mẫu dữ liệu và mô hình phân lớp dữ liệu biểu hiện gen của bệnh ung thư ở người. Phạm vi nghiên cứu tập trung vào bài toán phân lớp dữ liệu biểu hiện gen của các thí nghiệm nghiên cứu bệnh ung thư trên người.
Để thực hiện nghiên cứu chúng tôi phân tích, tổng hợp các nghiên cứu có liên quan đến nội dung nghiên cứu từ tài liệu tham khảo: sách, bài báo công 3 luan an bố trên tạp chí và kỷ yếu hội thảo để đề xuất các mô hình rút trích đặc trưng, sinh mẫu dữ liệu và phân lớp mới cho dữ liệu biểu hiện gen. Phương pháp thực nghiệm được sử dụng để đề xuất các tiếp cận mới nhằm nâng cao độ chính xác của mô hình phân lớp dữ liệu biểu hiện gen. Tính hiệu quả của các mô hình phân lớp được chứng minh bằng kết quả thực nghiệm trên dữ liệu thực được lấy từ các kho dữ liệu Kent Right [30], Array Expression [31] và TCGA [32]. Để đánh giá tính tổng quát của các mô hình đề xuất chúng tôi đã thực nghiệm trên các bộ dữ liệu có số lượng tập dữ liệu khá lớn (50 tập dữ liệu) so với các nghiên cứu khác và đa dạng về đặc tính tập dữ liệu như loại thí nghiệm, loại bệnh, số lớp, số chiều, số mẫu.
Để thực hiện chúng tôi tiến hành thu thập, xử lý dữ liệu, xây dựng, huấn luyện và đánh giá mô hình. Các mô hình đề xuất được đánh giá bằng cách so sánh kết quả độ chính xác phân lớp với các mô hình cơ bản khác. Ngoài ra, chúng tôi cũng đo thêm thời gian thực hiện của các mô hình để phân tích đánh đổi giữa tính chính xác và thời gian huấn luyện chấp nhận được do đặc thù quan trọng của dữ liệu biểu hiện gen có số mẫu ít với chi phí rất cao trong bối cảnh các thiết bị xử lý có xu hướng ngày càng rẻ. Nhiệm vụ và hướng tiếp cận của luận án Mặc dù đã có nhiều nghiên cứu thực hiện phân lớp dữ liệu biểu hiện gen.
Tuy nhiên, đặc điểm số chiều lớn và số mẫu ít làm hạn chế độ chính xác phân lớp. Vì vậy, hiện nay nhiều nghiên cứu vẫn tiếp tục thực hiện [25] để tìm ra các mô hình phân lớp hiệu quả hơn. Nhiệm vụ chính của hệ thống phân lớp bệnh ung thư dựa vào dữ liệu biểu hiện gen là phân lớp càng chính xác càng tốt để dự đoán chính xác bệnh phẩm mới. Đối với đặc thù của loại dữ liệu này, các nghiên cứu thường được tiếp cận theo 3 (ba) hướng sau.
Nghiên cứu xây dựng mô hình rút trích đặc trưng cho dữ liệu biểu hiện gen Đây là hướng tiếp cận truyền thống để xây dựng mô hình phân lớp gồm 4 giai đoạn cơ bản (Hình 1. Trong đó, sau khi xử lý dữ liệu là giai đoạn rút trích đặc trưng. Mục đích của giai đoạn này nhằm giảm chiều dữ liệu để nâng cao độ chính xác của giải thuật phân lớp và hạn chế hiện tượng "overfiting". 4 luan an Dữ liệu biểu Rút trích Giải thuật Đánh giá hiện gen đặc trưng phân lớp mô hình Hình 1.