Chương 1: Tổng quan về NC liên quan đến dé tài LV, bao gồm cả NC trong va ngoài nước. Ngoài ra, chương nay đưa ra mục đích và phạm vi NC của LV. Chương 2: Trình bày kiến thức lý thuyết về bệnh COVID-19, các PP lây truyền và cơ sở lý thuyết để phân loại bệnh. Ngoài ra, quá trình thực hiện việc trích xuất ra các đặc trưng từ dữ liệu hình ảnh được giải thích trong chương này.
Chương này cũng giới thiệu một hướng tiếp cận dựa trên CNN. Chương 3: Các Dataset mà chúng tôi đã sử dụng trong LV được giới thiệu và HT điểm số được sử dụng dé đánh giá mức độ tổn thương ở phổi do nhiễm COVID-19 đã được trình bày. Ngoài ra, chương này đưa ra Dataset mới dé đánh giá khả năng ton thương ở phôi do nhiễm COVID-19. Chương 4: Giải quyết van dé phân loại mức độ tôn thương phối do COVID-19 và xây dựng Model dự đoán.
Chương 5: Thử nghiệm được tiến hành, cùng với đó là phân tích các kết quả của Model dựa trên các dữ liệu hình ảnh đã thu thập và đáng tin cậy được đề xuất trong chương này. Chương 6: Nói về ưu và nhược điểm của vấn đề hiện tại và đưa ra các đề xuất và cải tiễn cho tương lai của lĩnh vực NC trong LV này. Bệnh Covid-19 Virus corona chủng mới (SARS-CoV-2) gây ra bệnh COVID-19. Căn bệnh được phát hiện lần đầu ở Trung Quốc vào tháng 12 của năm 2019.
Vì virus lây lan nhanh chóng nên việc kiêm soát và ngăn chặn sự lây lan trở nên vô cùng khó khăn. WHO phải tuyên bố COVID-19 trở thành dai dịch của toàn cầu vào năm 2020 khi nó gia tăng nhanh chóng. Điều này đã đánh dấu một sự thay đổi to lớn trong công tác quản lý sức khỏe, buộc các quốc gia phải thiết lập các quy định mới dé ứng phó với tình huống, chang hạn như thiết lập các HT kiểm soát nhiễm trùng [1], [2]. Theo dữ liệu mới nhất từ WHO [3], vào tháng 9 năm 2023, có khoảng 760 triệu trường hợp COVID-19 được xác nhận trên toàn cầu, với hơn 6 triệu 800 ngàn ca tử vong.
COVID-19 có nhiều triệu chứng, từ những triệu chứng thông thường như sốt, ho khan va khó thở đến những triệu chứng ít phô biến hơn như mat khứu giác và vị giác. Tuy nhiên, nhiễm trùng phối là triệu chứng phổ biến nhất và quan trọng nhất của loại virus này. Bài toán phân loại da lớp Trong lĩnh vực học máy, bài toán phân lớp là bước đầu tiên trong quá trình giải quyết nhiều van dé phân loại dựa trên dữ liệu. Mục tiêu cua bai toán là chia các điểm dữ liệu thành các lớp hoặc nhãn khác nhau dựa trên các đặc điểm của chúng.
Vì Model phải xem xét nhiều khả năng và xác định lớp phù hợp nhất cho từng trường hợp, nên bài toán phân loại đa lớp thường gặp khó khăn hơn so với phân loại nhị phân. Chúng bao gồm phân loại các văn bản theo nhiều chủ đề, phân loại hình ảnh theo nhiều loại đối tượng và phân loại bệnh lý theo lĩnh vực y tế. Xây dựng Model phân loại đa lớp thường bao gồm đánh giá hiệu suất của Model, thu thập dữ liệu đào tạo và tối ưu hóa nó dé dam bảo kha năng phân loại tốt nhất cho nhiều lớp. Trong bài toán phân loại đa lớp, cụ thé là phân loại ton thương của phổi thành 4 mức độ trong LV này, khó khăn chủ yêu chủ yếu xuất phát từ sự đa dạng và phức tạp của ton thương phổi, cũng như sự chênh lệch giữa các hình ảnh của những mức độ nghiêm 12 trọng khác nhau.
Dưới đây là một số khía cạnh khó khăn mà chúng tôi đã phải đối mặt trong quá trình giải quyết bài toán này: - Da dang của tốn thương phối: Tén thương phổi có thé bao gồm nhiều loại, từ viêm phổi nhẹ đến các van đề nghiêm trọng như viêm phổi nặng, tôn thương do bệnh phổi tắc nghẽn mạn tính (COPD), hay thậm chí là sự hiện diện của các khối u. Điều này tạo ra sự đa dạng lớn trong dữ liệu, đặt ra thách thức trong việc đặc trưng và phân loại chúng. - _ Chênh lệch về số lượng mẫu giữa các lớp: Trong thực tế, có thé xuất hiện sự mắt cân bang về số lượng mẫu giữa các mức độ ton thương khác nhau. Một số mức độ có thé có số lượng hình anh ít hơn, điều này có thé làm tăng nguy cơ mô hình tập trung vào phân loại các mức độ có số lượng mẫu lớn hơn.
- _ Hiệu suất tùy theo phương tiện hình ảnh: Hiệu suất của mô hình có thé phụ thuộc lớn vào chất lượng và đặc tính kỹ thuật của phương tiện hình ảnh. Nếu hình ảnh không đủ độ phân giải hoặc không chuẩn, có thể ảnh hưởng đến khả năng của mô hình trong việc phân loại chính xác. Dé giải quyết các van đề trên, LV này làm rõ các PP áp dụng dé tinh chỉnh dữ liệu cũng như giải quyết van đề về mat cần bằng các lớp (chương 3) và cải thiện hiệu suất cho các Model (chương 4). Trích chọn đặc trưng Trong lĩnh vực y tế, một phần quan trọng của quá trình xây dựng Model học máy là lựa chọn đặc trưng dé tiến hành phân loại ra các mức độ có thé tổn thương ở phôi do COVID-19.
Mục tiêu là xác định các đặc điểm từ chụp CXR của phối có thé giúp đánh giá mức độ ton thương của bệnh. Trong quá trình này, các PP trích chọn đặc trưng trở nên quan trọng dé hỗ trợ chan đoán va cải thiện về hiệu suất trong phân loại. Đơn giản là lay các đặc điểm cơ bản, chăng hạn như kích thước của các khu vực tôn thương, tỷ lệ so với diện tích toàn bộ phối hoặc mật độ pixel trong khu vực quan tâm. Sử dụng các Model học sâu như CNN để tự động trích chọn đặc trưng từ hình ảnh là một PP hiện đại hơn.
Dựa trên tập dữ liệu lớn của hình ảnh CXR đã được gán nhãn, 13 CNN tự động tìm ra các đặc điểm quan trọng trong quá trình đào tạo. Model có thê tự động xác định các đặc điểm quan trọng như hình dang, kích thước, cấu trúc tổn thương và nhiều đặc điểm khác. Các PP trích chọn các đặc trưng của hình ảnh tự động như CNN đã có tiễn bộ đáng ké trong việc phân loại mức độ tổn thương phổi do COVID-19. Hướng tiếp cận dựa trên CNN Các thuật toán học máy truyền thống, mạng nơ-ron sâu (DNN), hoặc CNN là một trong nhiều cách dé giải quyết bài toán phân loại đa lớp về mức độ tổn thương của phổi do COVID-19.
Nhưng việc sử dụng CNN có nhiều lý do hợp lý: CNN có thê tự động xác định các đặc trưng quan trọng đến từ các hình ảnh, giúp giảm thời gian trích chọn đặc trưng thủ công và tối ưu hóa việc xử lý dữ liệu hình ảnh phức tạp. CNN được thiết kế đề hiểu biểu đồ và cấu trúc hình ảnh và xử lý các dữ liệu hình ảnh. Điều này là cần thiết cho phân loại tôn thương phôi dựa trên hình ảnh CXR. CNN có thê hoàn thành tốt nhiều nhiệm vụ phân loại ảnh.
CNN có thê giúp phân loại ton thương phôi một cách chính xác hơn. Quá trình phân loại có thê được tự động hóa băng ƠNN, giảm sự phụ thuộc vào kiến thức chuyên gia và nguồn nhân lực. Điều này đặc biệt quan trọng khi tài nguyên y tế có hạn và dịch bệnh COVID-19 đang diễn ra. CNN thích ứng với dữ liệu mới và có thê nhiều tài nguyên và HT sẽ được sử dụng.
Điều này giúp Model có thể được áp dụng một cách rộng rãi trong nhiều BV và cơ sở chăm sóc sức khỏe khác nhau. Với CNN, NC và phát triển các Model cải tiến dé phân loại tốn thương phối có thé diễn ra. Điều này thúc đây việc phát triển và xây dựng các công cụ dé hỗ trợ quyết định mạnh mẽ và hiệu quả dé chân đoán và theo đõi COVID-19. Bài toán phân loại mức độ tôn thương của phổi do COVID-19 dựa trên CNN trong LV này bao gôm các bước quan trọng sau: 14 = Chuẩn bị dữ liệu: Thu thập tập hình ảnh CXR phổi, với các nhãn cho mức độ tôn thương, chang hạn như bình thường, nhẹ, trung bình hoặc nặng.
Dam bao rằng dữ liệu cân bằng và đủ lớn dé đào tao Model. = _ Trích xuất đặc trưng: sử dụng CNN để tự động học các đặc trưng quan trọng từ các bức ảnh, có thé được đào tạo từ đầu hoặc Model đã được đảo tạo trước dé thực hiện một nhiệm vụ liên quan, chăng hạn như phân loại ảnh. = Lap Model: Thiết kế một kiến trúc Model CNN phù hợp với bài toán phân loại mức độ ton thương. Kiến trúc này bao gồm các lớp tích chập, gdp và kết nói đầy đủ, cuối cùng dẫn đến lớp đầu ra có số lượng phân lớp tương ứng.
= Đào tao: Dao tao Model CNN dé hoc cách phân loại hình anh theo các mức độ tôn thương khác nhau bằng cách sử dụng tập dữ liệu đã chuẩn bị. = Kiểm định và tinh chỉnh: Sử dụng tập dit liệu kiểm định riêng biệt, đánh giá hiệu suất của Model và thay đối các tham số Model nêu cần thiết. Điều này có thé bao gồm điều chỉnh số lớp, tỷ lệ học tập hoặc thiết lập siêu tham só. = Kiểm tra và triển khai: Cuối cùng, dé đảm bảo tính toàn diện, đánh giá hiệu suất của Model trên tập dữ liệu kiểm tra độc lập.
Sau đó, Model có thể được triển khai dé hỗ trợ chân đoán và phân loại tổn thương phối do COVID-19. PP này đã được chứng minh là hiệu quả trong nhiều ứng dụng phân loại hình ảnh vì nó sử dụng sức mạnh của CNN dé tự động học cách trích xuất đặc trưng từ hình ảnh. Đề đảm bảo kết quả đáng tin cậy, dữ liệu phải được chuẩn bi đúng cách và Model phải được kiêm tra kỹ lưỡng. BO DU LIEU VA HỆ THONG DIEM SO Trong quá trình tìm kiếm các Dataset phù hợp dé phân loại mức độ tổn thương phổi do COVID-19 bằng cách sử dụng hình ảnh CXR, công việc thu thập cũng như áp dụng các nguồn di liệu phù hợp với mục tiêu của các thí nghiệm có thé gặp khó khăn do sự biến đôi về tính san có va khả năng tiếp cận.
Hai bộ dit liệu chính là Brixia và COVIDGR được sử dụng đề thực hiện phân loại mức độ tổn thương phổi do COVID-19 thành các cấp độ khác nhau bằng cách sử dụng hình ảnh CXR. Một công cu quan trọng dé chan đoán và theo đõi các bệnh hô hấp, bao gồm ca COVID-19, là HT điểm số được sử dụng dé đánh giá mức độ của các tôn thương cho phổi.