Tổng quan nghiên cứu

Ung thư đường tiêu hóa trên, đặc biệt là ung thư thực quản và ung thư dạ dày, hiện nằm trong nhóm bệnh lý ác tính có tỷ lệ mắc mới và tỷ lệ tử vong hàng đầu trên toàn thế giới. Theo một nghiên cứu của Menon và các cộng sự, tỷ lệ bỏ sót tổn thương ác tính trong quá trình nội soi thực quản - dạ dày - tá tràng (EGD) lên tới khoảng 11,3%. Đáng báo động hơn, báo cáo từ một cơ sở y tế tại Nhật Bản do Shimodate và cộng sự công bố chỉ ra rằng tỷ lệ bỏ sót đối với các tổn thương tân sinh nông ở dạ dày (GSN) có thể chạm mức 75%. Nguyên nhân chủ yếu xuất phát từ chất lượng không đồng đều của các hệ thống thiết bị, sự khác biệt về kinh nghiệm chuyên môn giữa các bác sĩ nội soi, cùng với áp lực thời gian trong ca thăm khám lâm sàng.

Nhằm giải quyết bài toán này, các hệ thống chẩn đoán hỗ trợ bằng máy tính (CAD) ứng dụng học sâu (Deep Learning) đã ra đời. Tuy nhiên, phần lớn giải pháp hiện nay xử lý các nhiệm vụ nội soi một cách độc lập thông qua nhiều mô hình chuyên biệt, dẫn đến tiêu tốn tài nguyên tính toán, đòi hỏi dung lượng bộ nhớ lớn và khó triển khai trên các thiết bị y tế cấu hình giới hạn. Luận văn Thạc sĩ Khoa học Dữ liệu của tác giả Nguyễn Duy Mạnh tại Đại học Bách khoa Hà Nội dưới sự hướng dẫn của TS. Trần Vinh Đức đã tập trung nghiên cứu, xây dựng các kiến trúc mạng nơ-ron tích hợp nhằm giải quyết đồng thời 4 bài toán lâm sàng: phân loại 10 vị trí giải phẫu, phân loại 6 dạng tổn thương, phát hiện vi khuẩn Helicobacter pylori (HP) và phân đoạn chính xác vùng tổn thương.

Nghiên cứu được triển khai thực nghiệm trên tập dữ liệu gồm 11.469 hình ảnh nội soi tiêu hóa tại Việt Nam. Việc phát triển thành công mô hình học đa nhiệm (Multi-Task Learning) giúp tối ưu hóa khả năng biểu diễn đặc trưng chung từ các nguồn dữ liệu phân mảnh, cắt giảm hơn 60% chi phí tính toán phần cứng và cung cấp công cụ hỗ trợ trực quan, tin cậy cho bác sĩ trong thời gian thực.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu dựa trên nền tảng của phương pháp Học đa nhiệm (Multi-Task Learning - MTL), Mạng nơ-ron tích chập (CNN) và kiến trúc Transformer thị giác (Vision Transformer).

Học đa nhiệm là mô hình học máy tối ưu hóa khả năng khái quát hóa bằng cách chia sẻ các tầng tham số chung giữa nhiều nhiệm vụ liên quan. Thay vì đào tạo 4 mô hình độc lập, hệ thống sử dụng một khối trích xuất đặc trưng chung (Shared Encoder) để biểu diễn các thuộc tính thị giác cốt lõi từ mức thấp như đường viền, góc cạnh đến mức cao như cấu trúc mô bệnh học. Các đặc trưng này sau đó được phân nhánh tới các bộ phân loại và bộ giải mã chuyên biệt.

Luận văn tiếp cận hai hướng kiến trúc chính:

  1. Mạng EndoUNet: Kiến trúc kết hợp giữa mạng mã hóa CNN truyền thống (đánh giá trên các nền tảng VGG-19, ResNet-50, DenseNet-121 được tiền huấn luyện từ tập dữ liệu hơn 1 triệu ảnh ImageNet) và bộ giải mã mở rộng theo cấu trúc UNet với 5 khối giải chập (transposed convolution) để phân đoạn tổn thương.
  2. Mạng SFMNet: Kiến trúc hiện đại dựa trên Mix Transformer (với 2 cấu hình MiT-B2 và MiT-B3) từ SegFormer. Khối mã hóa MiT khắc phục nhược điểm của Vision Transformer truyền thống bằng kỹ thuật gộp patch chồng lấn (Overlapped Patch Merging) và tầng Feed-Forward tích hợp tích chập (Mix-FFN) với bộ lọc kích thước 3x3 để giữ nguyên thông tin vị trí không gian mà không phụ thuộc vào độ phân giải cố định.

Để tăng cường chất lượng không gian, mô hình tích hợp khối Compact Generalized Non-Local (CGNL) giúp mô hình hóa mối tương quan toàn cục giữa các kênh và khối Squeeze-and-Excitation (SE) với cơ chế tự chú ý kênh. Ở phần giải mã, mạng sử dụng Cấu trúc Kim tự tháp Đặc trưng Căn chỉnh (Feature-aligned Pyramid Network - FaPN) gồm 2 mô-đun then chốt: Mô-đun Căn chỉnh Đặc trưng (FAM) ứng dụng tích chập biến dạng (deformable convolution) để triệt tiêu hiện tượng lệch pha không gian, và Mô-đun Lựa chọn Đặc trưng (FSM) nhằm tái định lượng trọng số đặc trưng đa tỉ lệ.

Phương pháp nghiên cứu

Nghiên cứu sử dụng nguồn dữ liệu thực tế gồm 11.469 ảnh nội soi tiêu hóa thu thập từ các hệ thống nội soi tại Việt Nam, bao gồm nhiều chế độ chiếu sáng và góc chụp khác nhau.

Phương pháp chọn mẫu và phân chia dữ liệu áp dụng kỹ thuật kiểm chứng chéo k-fold phân tầng (stratified 5-fold cross-validation). Cách tiếp cận này chia toàn bộ 11.469 mẫu ảnh thành 5 phần bằng nhau, đảm bảo mỗi tập con đều duy trì đúng tỷ lệ phân bố của 10 vị trí giải phẫu (thực quản, tâm vị, thân vị, hang vị, môn vị, hành tá tràng, tá tràng hạ lưu, v.v.), 6 nhóm tổn thương bệnh lý (loét, viêm, polyp, ung thư, dị sản và bình thường) và tình trạng nhiễm vi khuẩn HP. Kỹ thuật này giúp loại bỏ triệt để hiện tượng sai lệch chọn mẫu (selection bias) và đánh giá khách quan độ ổn định của thuật toán trên dữ liệu chưa từng thấy.

Lý do lựa chọn phương pháp phân tích học đa nhiệm kết hợp hàm mất mát tùy biến là do dữ liệu y tế thực tế thường không được gán nhãn đầy đủ cho tất cả các nhiệm vụ trên cùng một bức ảnh. Tác giả thiết lập chỉ thị kiểu mẫu nhị phân để điều khiển quá trình lan truyền ngược: chỉ những nhánh có nhãn thực tế mới tham gia cập nhật trọng số tại từng lượt lặp. Hàm mất mát phân loại sử dụng hàm Cross-Entropy, trong khi nhánh phân đoạn kết hợp Cross-Entropy cấp độ điểm ảnh và Dice Loss để tối ưu hóa trực tiếp chỉ số trùng lặp vùng tổn thương. Quá trình tiền xử lý tích hợp các kỹ thuật tăng cường dữ liệu (Data Augmentation) như xoay ảnh, lật không gian và điều chỉnh độ sáng ngẫu nhiên nhằm triệt tiêu hiện tượng quá khớp (overfitting).

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình đánh giá thực nghiệm trên 11.469 hình ảnh nội soi đã mang lại những phát hiện có giá trị học thuật và ứng dụng lâm sàng sâu sắc:

Thứ nhất, mô hình hợp nhất đạt hiệu năng phân loại vượt trội trên 3 tác vụ chẩn đoán. Ở bài toán nhận diện 10 vị trí giải phẫu đường tiêu hóa trên, mô hình đạt độ chính xác trên 90%, giúp xác định chuẩn xác các khu vực khó như góc bờ cong nhỏ hay hành tá tràng. Đối với bài toán phân loại 6 nhóm tổn thương và nhận diện vi khuẩn HP, các nhánh phân loại sử dụng mạng perceptron đa tầng (MLP) với 512 nơ-ron ẩn kết hợp lớp đầu ra Softmax và Sigmoid đã mang lại kết quả tương đương, thậm chí nhỉnh hơn từ 1,5% đến 3,2% so với việc huấn luyện các mô hình đơn nhiệm riêng lẻ.

Thứ hai, kiến trúc SFMNet chứng minh tính ưu việt rõ rệt trong nhiệm vụ phân đoạn tổn thương. Nhờ sự kết hợp giữa bộ mã hóa MiT-B3 và mạng kim tự tháp FaPN, chỉ số tương đồng Dice (Dice Score) đạt mức cải thiện từ 4,5% đến 6,8% so với mô hình đường cơ sở EndoUNet sử dụng kiến trúc VGG-19 và ResNet-50. Khả năng phát hiện và bao quanh ranh giới các tổn thương có kích thước nhỏ, bờ không đều hoặc độ tương phản thấp được nâng cao đáng kể.

Thứ ba, việc tối ưu hóa kiến trúc đa nhiệm giúp giảm thiểu khoảng 60% đến 70% tổng số lượng tham số so với việc vận hành 4 mạng nơ-ron riêng biệt. Thời gian xử lý đạt mức dưới 33 mili-giây cho mỗi khung hình, tương đương tốc độ trên 30 khung hình/giây (FPS). Đây là chỉ số then chốt khẳng định tính khả thi trong việc tích hợp mô hình vào các thiết bị nội soi video thời gian thực mà không gây trễ hình.

Thảo luận kết quả

Nguyên nhân chính giúp các mô hình đa nhiệm như EndoUNet và SFMNet đạt kết quả ấn tượng nằm ở cơ chế chia sẻ biểu diễn đặc trưng. Khi một mẫu ảnh chỉ có nhãn giải phẫu đi qua mạng, các tầng trích xuất dùng chung vẫn học được cấu trúc niêm mạc, mạch máu và hình thái mô, từ đó gián tiếp hỗ trợ cho nhánh phân loại bệnh lý và phát hiện vi khuẩn HP – những tác vụ vốn có số lượng mẫu gán nhãn ít hơn trong thực tế.

Hiệu quả phân đoạn vượt trội của SFMNet được giải thích bởi cơ chế chú ý tự thân hiệu quả (Efficient Self-Attention) với tỷ lệ giảm chuỗi R từ 8 xuống 1 qua 4 giai đoạn, giúp bao quát ngữ cảnh toàn hình ảnh. Bên cạnh đó, mô-đun căn chỉnh FAM trong FaPN đã giải quyết triệt để sự sai lệch tọa độ không gian vốn xuất hiện trong phép cộng gộp đặc trưng truyền thống của mạng FPN kinh điển.

Về phương thức biểu diễn kết quả, các dữ liệu phân loại được minh họa trực quan thông qua ma trận nhầm lẫn kích thước 10x10 đối với vị trí giải phẫu và 6x6 đối với phân loại bệnh lý, làm nổi bật tỷ lệ dương tính thật trên đường chéo chính. Đồng thời, kết quả phân đoạn tổn thương được trình bày qua bảng so sánh chỉ số Dice giữa các cấu hình mạng mã hóa (VGG-19, ResNet-50, DenseNet-121, MiT-B2, MiT-B3) cùng hình ảnh mặt nạ phân đoạn thực tế đối chiếu với nhãn chuẩn của chuyên gia y tế.

Đề xuất và khuyến nghị

Nhằm chuyển hóa các kết quả nghiên cứu thành giải pháp y tế thông minh trong thực tiễn, luận văn đưa ra 4 khuyến nghị hành động cụ thể:

  1. Tích hợp mô hình SFMNet vào phần cứng hệ thống nội soi thời gian thực: Các doanh nghiệp sản xuất thiết bị y tế và kỹ sư phần mềm cần tiến hành tối ưu hóa mô hình bằng công cụ TensorRT hoặc ONNX Runtime. Mục tiêu hướng tới là duy trì tốc độ xử lý trên 30 FPS với độ trễ xử lý dưới 30 mili-giây, thực hiện trong khung thời gian từ 6 đến 12 tháng tại các phòng khám nội soi tiêu chuẩn.
  2. Chuẩn hóa quy trình làm sạch và mở rộng bộ dữ liệu nội soi đa trung tâm: Đội ngũ nghiên cứu y khoa cần phối hợp cùng các bệnh viện tuyến trung ương để mở rộng quy mô dữ liệu từ 11.469 ảnh lên hơn 50.000 ảnh nội soi có chú giải chi tiết. Lộ trình thực hiện trong 12 đến 18 tháng nhằm nâng cao tính đa dạng về chủng loại thiết bị và sắc tộc bệnh nhân.
  3. Tối ưu hóa nén mạng cho thiết bị biên (Edge AI): Các kỹ sư trí tuệ nhân tạo cần áp dụng kỹ thuật lượng hóa trọng số (Quantization 8-bit) và cắt tỉa mô hình (Model Pruning) nhằm giảm thêm 40% dung lượng VRAM tiêu thụ. Mục tiêu này cần hoàn thành trong 3 đến 6 tháng để hệ thống có thể chạy trực tiếp trên các máy trạm y tế mini không trang bị card đồ họa cao cấp.
  4. Triển khai thử nghiệm lâm sàng độc lập và thẩm định y đức: Các hội đồng chuyên môn về tiêu hóa cùng các đơn vị quản lý y tế cần thiết lập quy trình thử nghiệm lâm sàng mù đôi (double-blind trial) trong 12 tháng. Mục tiêu cụ thể là kiểm chứng khả năng giảm tỷ lệ bỏ sót tổn thương tiền ung thư xuống dưới 5% trong điều kiện can thiệp trực tiếp tại phòng mổ.

Đối tượng nên tham khảo luận văn

Nội dung và phương pháp tiếp cận trong luận văn mang lại giá trị chuyên môn thiết thực cho 4 nhóm đối tượng:

  1. Bác sĩ nội soi tiêu hóa và chuyên gia y tế: Cung cấp góc nhìn toàn diện về cơ chế vận hành của hệ thống CAD, hỗ trợ bác sĩ hiểu rõ cách trí tuệ nhân tạo phân tích 10 vùng giải phẫu và nhận diện ranh giới tổn thương ác tính, từ đó gia tăng độ tin cậy khi phối hợp cùng AI trong chẩn đoán.
  2. Kỹ sư Trí tuệ nhân tạo và Khoa học dữ liệu y tế: Là tài liệu kỹ thuật chuyên sâu về phương pháp xây dựng mạng học đa nhiệm, cách thiết lập hàm mất mát hỗn hợp xử lý dữ liệu thiếu nhãn và kỹ thuật tích hợp cơ chế tự chú ý (Self-Attention) với mạng kim tự tháp đặc trưng FaPN.
  3. Đơn vị phát triển phần mềm và thiết bị công nghệ y tế (MedTech): Cung cấp giải pháp kiến trúc tối ưu tài nguyên tính toán, hỗ trợ các kỹ sư hệ thống nhúng xây dựng module phần mềm phân tích hình ảnh nội soi thời gian thực với chi phí phần cứng thấp.
  4. Học viên cao học và sinh viên chuyên ngành Khoa học máy tính, Kỹ thuật Y sinh: Đóng vai trò là tài liệu tham khảo chuẩn mực về phương pháp nghiên cứu thực nghiệm, kỹ thuật xử lý dữ liệu hình ảnh y khoa quy mô hơn 11.000 mẫu và quy trình đánh giá mô hình bằng kiểm chứng chéo k-fold.

Câu hỏi thường gặp

Tại sao Học đa nhiệm (MTL) lại hiệu quả hơn các mô hình đơn nhiệm trong phân tích nội soi tiêu hóa?
Trong nội soi tiêu hóa, các dấu hiệu giải phẫu, loại tổn thương và tình trạng nhiễm khuẩn HP có sự liên kết chặt chẽ về mặt thị giác. Kiến trúc MTL tận dụng 11.469 hình ảnh để đào tạo một khối trích xuất đặc trưng chung, giúp các tác vụ có ít dữ liệu được hưởng lợi từ tri thức không gian của các tác vụ phong phú dữ liệu, đồng thời giảm hơn 60% gánh nặng bộ nhớ.

Khối FaPN trong mô hình SFMNet giải quyết vấn đề gì trong phân đoạn tổn thương?
Mạng FPN truyền thống thường bị mất mát ranh giới do hiện tượng lệch pha không gian khi kết hợp các tầng đặc trưng ngược từ dưới lên. FaPN bổ sung mô-đun FAM với các phép tích chập biến dạng để tự động căn chỉnh điểm ảnh và mô-đun FSM để chọn lọc kênh thông tin, giúp nâng cao chỉ số Dice từ 4,5% đến 6,8% trên các vùng tổn thương phức tạp.

Tập dữ liệu 11.469 ảnh có đảm bảo độ tin cậy cho môi trường lâm sàng thực tế?
Bộ dữ liệu được thu thập trực tiếp tại các cơ sở y tế Việt Nam với đa dạng chế độ ánh sáng và được gán nhãn bởi các bác sĩ chuyên khoa tiêu hóa. Phương pháp kiểm chứng chéo 5-fold phân tầng giúp kiểm tra toàn diện mô hình trên từng tập dữ liệu kiểm thử độc lập, đảm bảo kết quả không bị sai lệch cục bộ.

Mô hình xử lý như thế nào khi một bức ảnh chỉ có nhãn giải phẫu mà không có nhãn tổn thương?
Hệ thống sử dụng các biến chỉ thị nhị phân $\mu_i^t \in {0, 1}$ tích hợp trực tiếp trong cấu trúc hàm mất mát đa nhiệm. Khi một mẫu thiếu nhãn của tác vụ nào, gradient của nhánh đó sẽ tự động bằng 0, chỉ các nhánh có nhãn hợp lệ mới tham gia cập nhật trọng số, cho phép tận dụng triệt để mọi nguồn dữ liệu phân mảnh.

Ý nghĩa thực tiễn của việc nhận diện đồng thời 10 vị trí giải phẫu trong ca nội soi là gì?
Phân loại 10 vị trí giải phẫu giúp hệ thống theo dõi toàn diện hành trình thăm khám của ống soi, đảm bảo bác sĩ không bỏ sót bất kỳ góc khuất nào như hang vị hay bờ cong lớn. Điều này giúp giảm tỷ lệ bỏ sót tổn thương tiền ung thư (vốn có thể lên tới 75% trong các ca khám thông thường) và chuẩn hóa biên bản nội soi tự động.

Kết luận

  1. Luận văn đã thiết kế thành công 2 kiến trúc học sâu hợp nhất (EndoUNet và SFMNet) xử lý đồng thời 4 nhiệm vụ nội soi đường tiêu hóa trên trong một mô hình duy nhất.
  2. Khai thác hiệu quả tập dữ liệu 11.469 hình ảnh nội soi tại Việt Nam thông qua cơ chế học đa nhiệm, giải quyết bài toán thiếu hụt nhãn toàn diện trong y tế.
  3. Kiến trúc SFMNet tích hợp biến thể Transformer (MiT-B3) cùng mạng FaPN và CGNL đạt hiệu năng phân loại trên 90% và nâng cao đáng kể chỉ số Dice phân đoạn tổn thương.
  4. Giảm thiểu hơn 60% tài nguyên tính toán, duy trì tốc độ xử lý trên 30 khung hình/giây, đáp ứng tiêu chuẩn khắt khe của hệ thống hỗ trợ chẩn đoán thời gian thực.
  5. Định hình lộ trình phát triển rõ ràng trong 12 đến 24 tháng tới nhằm mở rộng dữ liệu đa trung tâm và triển khai thử nghiệm lâm sàng thực tế.

Nghiên cứu của tác giả Nguyễn Duy Mạnh tại Đại học Bách khoa Hà Nội là một bước tiến quan trọng trong việc ứng dụng trí tuệ nhân tạo vào y tế nước nhà. Để tìm hiểu chi tiết về các thông số kỹ thuật, cấu hình siêu tham số và phương pháp tối ưu hóa mạng nơ-ron tích hợp, quý độc giả và các nhà nghiên cứu có thể tham khảo toàn văn luận văn thạc sĩ khoa học dữ liệu này tại thư viện số của nhà trường hoặc liên hệ nhóm nghiên cứu để thúc đẩy các cơ hội hợp tác chuyển giao công nghệ.