Đặt vấn đề “Covid-19” là từ khóa nóng nhất trong vòng hai năm trở lại đây không chỉ ở Việt Nam mà còn trên toàn thế giới. Khi cả nước buộc phải“sống chung với dịch” như hiện nay thì nhu cầu tiếp nhận, cập nhật thông tin về diễn biến dịch bệnh và bảo vệ sức khỏe là rất cấp thiết đối với mỗi người. Cùng với sự phát triển của công nghệ thông tin và phương tiện truyền thông, các website báo điện tử tại Việt Nam trở thành điểm truy cập sôi động hơn bao giờ hết, bởi sự tuy tín, thuận tiện và tính kip thoi. Moi người dân có thé dé dàng tiếp cận với nguồn thông tin chính thống về chính sách và chỉ đạo của cơ quan nhà nước về diễn biến dịch bệnh một cách nhanh nhất đồng thời cũng tránh được rủi ro người dân tiếp cận với những nguồn thông tin sai lệch, gây mất trật tự, an toàn xã hội và đặc biệt hơn còn ảnh hưởng không tốt đến nhận thức của cộng đông.
Góp một phần không nhỏ vào công cuộc phòng, chống Covid-19 và khôi phục nền kinh tế không thé không kể đến các ứng dụng trí tuệ nhân tạo. Day được xem như một công cụ hỗ trợ đắc lực dé không chỉ kiểm soát diễn biến lây lan dịch bệnh, đưa ra dự đoán cho các nhà hoạch định, mà còn giúp các nhân viên y tế chân đoán tình hình sức khỏe của bệnh nhân thông qua tiếng ho, dự đoán Covid-19 qua ảnh chụp CT phdi,.rut ngăn thời gian điều trị và mang lại hiệu quả cao trong công tác y tế. Nhận thức được tầm quan trọng của việc được tiếp cận các nguồn thông tin chính xác liên quan đến tình hình dịch bệnh và những tiện ích mà trí tuệ nhân tạo mang lại cho con người, chúng tôi đã nghiên cứu và xây dựng hệ thống đọc hiéu tự động (Machine Reading Comprehension - MRC) tiếng Việt dé người dùng có thé dé dàng tiếp cận, tra cứu và thu thập cho mình những kiến thức, kỹ năng cũng như giải đáp thắc mắc xoay quanh các bài báo về chủ đề Covid-19. Bài toán đọc hiểu tự động suy luận số liệu và tính ứng dụng 1.
Bai toán đọc hiểu tự động suy luận số liệu Suy luận trong bai toán đọc hiểu tự động là một trong những xu hướng nghiên cứu về bài toán này những năm trở lại đây. Ngoài đưa ra những câu trả lời được trích xuất trong đoạn văn thì mô hình còn có thé trả lời những loại suy luận khác như logic [1], đồng tham chiếu [2],. va trong đó suy luận số liệu là một loại suy luận rất thú vị. Với bài toán đọc hiểu tự động kết hợp với suy luận số liệu này thì ngoài việc chỉ có thé đưa ra câu trả lời có sẵn trong đoạn văn thì những mô hình giải quyết bài toán này còn có khả năng tính toán các phép tính cơ bản trong số liệu để trả lời cho câu hỏi, việc này có tính ứng dụng rất cao trong những văn bản cập nhật diễn biến dịch bệnh Covid-19 như hiện nay khi các số liệu về dịch bệnh liên tục được đưa ra và yêu cầu người đọc phải tự suy luận thì bây giờ với những mô hình đọc hiểu tự động này có thê giúp con người trả lời những thông tin đó, giúp tiết kiệm được thời gian cho người doc, chi tiệt vê bài toán sẽ được chúng tôi mô tả ở dưới.
Đầu vào: Một bài báo tiếng Việt C và một câu hỏi Q về nội dung liên quan trong bài báo. Đầu ra: Câu trả lời A cho câu hỏi Q được rút trích từ bài báo hoặc được tính toán dựa theo những con sô có trong bài báo và câu hỏi.1 Ví dụ bai toán đọc hiểu tự động suy luận số liệu Sáng nay 5.8, Bộ Y tế thông báo 3.941 ca mặc Covid-19 ghi nhận trong nước (giảm 326 ca so với sáng hôm qua); TP.Theo thông báo của Bộ Y tế từ 18 giờ 30 ngày 4.8 đến 6 giờ sáng nay, trên Hệ thống Quốc gia quản lý ca bệnh Covid-19 ghi nhận 3.943 ca nhiễm mới, trong đó 2 ca nhập cảnh và 3.941 ca ghi nhận trong nước (giảm 326 ca so với sang hôm qua) tại 24 tỉnh, thành.943 ca Covid-19, riêng TP.349 bệnh nhân Trong số các trường hợp mắc mới do lây nhiễm trong nước, tại TP.349 ca, Bình Dương 497 ca, Tây Ninh 235 ca, Long An 189 ca, Tiền Giang 169 ca, Đồng Nai 110 ca, Đà Nẵng 92 ca, Bà Rịa - Vũng Tàu 66 ca, Vĩnh Long 58 ca, Bình Dinh 35 ca, Đồng 14 Tháp 32 ca, An Giang 21 ca, Sóc Trăng 20 ca, Phú Yên 17 ca, Kiên Giang 12 ca. Các tỉnh: Đắk Lắk, Quảng Bình và Trà Vinh mỗi nơi có 9 ca; Bạc Liêu 6 ca, Lạng Sơn 2 ca. Các tỉnh: Thanh Hóa, Lâm Đồng, Quảng Trị và Hà Tĩnh mỗi địa phương có 1 ca.941 ca ghi nhận trong cộng đồng.
Theo Bộ Y tế từ đầu dịch đến nay, Việt Nam có 181.756 ca mắc Covid-19 (2.331 ca nhập cảnh va 179.425 ca mắc trong nước); 54.332 ca đã được điều trị khỏi. Số trường hợp nhiễm mới ghi nhận trong nước của đợt dịch thứ 4 (từ 27.4) đến nay là 177.558 bệnh nhân đã khỏi bệnh. 470 bệnh nhân nặng đang điều trị hồi sức tích cực và 21 bệnh nhân nguy kịch đang điều trị ECMO. Câu hoi 1: tinh nào có sô ca mặc nhiêu nhât cả nước ? Đáp án: TP.HCM Câu hỏi 2: Long An, Tiền Giang, Đồng Nai tỉnh nào có 189 ca nhiễm ? Dap an: Long An Câu hỏi 3: Tổng số ca nhiém Covid-19 tại TP.HCM va Binh Dương là bao nhiêu ? Dap án: 2846 Câu hỏi 4: Ti lệ bệnh nhân đã khỏi bệnh tinh từ 27/4 là bao nhiêu ? Đáp án: 28.
Tinh ứng dung của đề tài Bài toán đọc hiểu tự động thường được sử dụng nhiều nhất trong các hệ thống chatbot, trợ lý ảo nồi tiếng như Cortana, Alexa, Siri,. có thé trả lời bất kì câu hỏi nào của người dùng một cách nhanh chóng và tiết kiệm thời gian hơn so với khi người dùng phải tự tìm nguồn tài liệu dé đọc, hiểu và tự trả lời. Ngoài ra, bài toán này còn được ứng dụng vào những hệ thống tìm kiếm thông tin nổi tiếng trên toàn thế giới như Google, Bing, Yahoo,. xếp hạng kết quả tìm kiếm giúp người dùng dé dang tìm thây nội dung liên quan tạo ra trải nghiệm thoải mái và tiện lợi.
Bên cạnh đó, chủ đê 15 về Covid-19 hiện đang là chủ dé rất “nóng”, do đó việc xây dựng một ứng dung đọc hiểu tự động có thể hỗ trợ người dùng tìm kiếm, cập nhật thông tin về diễn biến dịch bệnh và giải đáp thắc mắc của người dùng từ những nguồn nội dung chính thống và tin cậy, đặc biệt với bài toán đọc hiểu tự động suy luận số liệu thì còn có thé giải đáp cho người dùng những câu hỏi đòi hỏi sự tính toán số liệu trong những văn bản cập nhật thông tin diễn biến dịch bệnh chang chit số liệu. Nhìn chung, đề tài nghiên cứu này có ứng dụng rất thiết thực trong thời điểm hiện tại, giúp ích cho hàng triệu người Việt Nam bảo vệ được sức khỏe của mình trong mùa dịch. Mục tiêu: Mục tiêu nghiên cứu của chúng tôi là xây dựng hệ thống đọc hiểu tự động kết hợp suy luận số liệu cho văn bản chủ đề Covid-19 cho tiếng Việt. Dé hoàn thành được mục tiêu này, chúng tôi phải thực hiện 3 công việc: e Nghiên cứu và xây dựng bộ dữ liệu đọc hiệu tự động kết hợp suy luận số liệu chủ đề Covid-19 dé phục vụ cho bai toán đọc hiểu tự động kết hợp suy luận.
e Nghiên cứu các mô hình doc hiểu tự động kết hợp suy luận hiện có trên thế gidi. e Áp dụng những mô hình đọc hiểu tự động này vào bộ dữ liệu đã xây dựng được dé phân tích và so sánh kết quả. Kết luận và nêu ra hướng phát triển cho đề tài. Đối tượng và phạm vi nghiên cứu: Đối tượng: Bài toán đọc hiểu tự động kết hợp suy luận số liệu tiếng Việt.
Pham vi nghiên cứu: Với nghiên cứu này, phạm vi nghiên cứu của chúng tôi tập trung vào các bài báo chủ đề Covid-19 tiếng Việt, về giới hạn trong nghiên cứu thì chúng tôi chỉ tập trung khác thác những vấn đề sau: e Xây dựng bộ dữ liệu đọc hiểu tự động có sự kết hợp của các loại suy luận sé liệu vào câu hoi va câu tra lời. 16 e Đánh giá hai mô hình suy luận số liệu nổi tiếng là NumNet và NAQANet trên bộ dữ liệu đã xây dựng và bộ dữ liệu ViQuAD [3] và so sánh kết quả. e Phân tích kết quả và ảnh hưởng của các khía cạnh khác nhau của bộ dữ liệu lên hiệu suât của hai mô hình này. Kết quả nghiên cứu: Thông qua nghiên cứu này, chúng tôi đã đạt được một số kết quả như sau: e Xây dựng thành công ViCOVIDQA, bộ dữ liệu đọc hiểu tự động kết hợp suy luận số liệu chủ đề Covid-19 tiếng Việt bao gồm 6594 cặp câu hỏi và câu trả lời được xây dựng từ 841 bài báo chủ đề Covid-19.
Đây là bộ dữ liệu đọc hiểu tự động kết hợp suy luận số liệu đầu tiên trên tiếng Việt để làm bước đệm đầu tiên cho những nghiên cứu về bài toán này sau này. e Đánh giá hai mô hình đọc hiểu tự động suy luận số liệu là NumNet và NAQANet trên bộ dữ liệu ViCOVIDQA và so sánh với kết quả của hai mô hình này trên bộ dữ liệu ViQuAD [3], kết quả tốt nhất đạt được trên bộ dữ liệu ViCOVIDQA là khi sử dụng mô hình NAQANet kết hợp với mô hình nhúng PhoW2V với 22. e Phân tích được các khía cạnh khác nhau của bộ dữ liệu VICOVIDQA và anh hưởng của mô hình lên hai khía cạnh là kích thước của đoạn văn và loại câu hỏi suy luận. Cấu trúc của luận văn Phần còn lại của luận văn sẽ được tô chức như sau: Chương 2: Các công trình liên quan Ở chương này, chúng tôi sẽ khái quát về các công trình nghiên cứu về những bộ dữ liệu đọc hiểu tự động đang có hiện nay mà chúng tôi tìm hiểu được cũng như là những mô hình giải quyết bài toán đọc hiểu tự động suy luận số liệu và các phương pháp đánh giá cho bài toán này.
17 Chương 3: Xây dựng bộ dữ liệu Trong chương nay, chúng tôi mô ta chi tiết quy trình xây dựng bộ dữ liệu đọc hiểu tự động từ xây dung guidelines, tuyển dụng, thu thập dit liệu, xây dựng câu hỏi và câu trả lời, kiểm tra dữ liệu và thu thập thêm câu trả lời.