Chương 1. Giới thiệu hệ thống hỏi đáp dựa trên đọc hiểu tự động miền mở. Tổng quan về truy xuất tài liệu và đọc hiểu. Truy xuất tài liệu.--- + 22+ SE EEEEE121212112121121 111111 cte.
Bài toán đọc hiểu tự động. Tính ứng dụng của đề tài.---:- Set 1E 1 1E E12151111111111111 1111111 1xx, 8 Chương 2. CÁC CONG VIỆC LIEN QUAN. << att Uni, VO 10 2.
Các bộ dit liệu nước NOI occ ecccessceseseesesessssessescsesecsesecsesessessseeeecees 10 2. Các bộ dữ liệu cho tiếng VIiỆt. Bộ dữ liệu chính. Caéc m6 himh 00000 aầaẢầẢ.
Phân tích đặc điểm của tiếng ViỆt. XÂY DỰNG HE THNG. Rules QUu€SfIOI.--- - GG SH nh 25 E “Ni A6 (dAHAđŒHAđgŒgœŒ-Bs 25 3. Mô đun trích xuất câu.
Mô đun Re-ranker.LLLQQQQ HT TT TK EU 33 3. Mô hình dựa trên XLM-R. Mô đun filter. SE St E2 2121212121211 11112111 re.
Kết hợp toàn hệ thống. Xây dựng giao diện cho hệ thống. Giao diện trang truy XUẤT. Giao diện trang đọc hiỂU.
Trang toàn bộ hệ thống.------ ¿+ +52 +E+E+E£EEEE+EEEEEEEEEEEEEEEEErrkrkrrrree 49 Chương 4. THU NGHIỆM VA PHAN TÍCH. -- - ch nh nh 52 4. Cai đặt thử nghiệm co.
Phân tích phương phấp. Phan tich ca cố Ẳ 7. Lỗi truy xuf. Lỗi đọc hiểu.ẶĂccSc tren 56 Chương 5.
_ KÉT LUẬN VA HƯỚNG PHAT TRIEÉN. Hướng phat triỂn. 61 DANH MỤC CÔNG TRINH TÁC GIẢ.--- ¿2 ¿5252 2+2S22E£E+2EtEx+EExerrxerrrrerees 63 TÀI LIEU THAM KHẢO. - 2-5: S552 SE9S22EEEE2EE21232121212121211 21112111212.
69 DANH MỤC HÌNH VE Hình 1.1 Google truy xuất đoạn văn và in đậm câu trả lời.1 Mô dun Retriever của Đỗ và các cộng sự.2 Mô hình IDr(QA.3 Mô hình ViR€ader.1 Minh hoa mô dun SCOTITE.-- - - -- 5 1111133311111 9 11 ng re 28 Hình 3.2 Minh họa mô đun RetrIeVer.1 Tổng quan mô dun Reader.2 Minh họa huấn luyện mô hình cho bài toán đọc hiểu tự động.3 Mô đun Reader.- c1 1219 TH ng kg 37 Hình 3.4 Minh hoa mô đun FIÏ€r. + SE SE kE v35 38 Hình 3.1 Mô hình tong quan hệ thống.---2- ¿5c + 5225+2S+2E£x+zx+zzz+zxezxez 42 Hình 3.1 Mô hình tổng quan giao diỆn.---- - + 2 + +E£E+E+E££E+EeEeEzE+Eersrxez 44 Hình 3.2 Minh họa giao diện truy xuấtt.----+- + 2 + +EEE+E+EEEEzEEEeErkrrerrreee 44 Hình 3.3 Minh họa kết quả câu hỏi.4 Tổng quan hệ thống và giao diện mô hình đọc hiểu.5 Giao diện chức năng đọc hiỂU. St v11 E1 EEEEEEEEEkrkrkrkekrkes 47 Hình 3.6 Giao diện kết quả đọc hiỀu.7 Giao diện không có câu trả lời đọc hiều.8 Tổng quan hệ thống đọc hiểu tự động.9 Minh hoa giao diện trả lời câu hỏi.10 Giao diện kết quả hệ thống hỏi đáp.----- - 252 +ceczzxz£z£zsxez 51 DANH MỤC BANG Bảng 2.1 Minh họa dữ liệu SQuAD.- cv ng ng ke 11 Bang 2.2 Minh họa bộ dữ liệu SQUAD 2.3 Minh họa bộ dữ liệu UIT-VINewsQA. Ă che re 14 Bang 2.4 Minh họa dữ liệu ViQuATD T.5 Minh hoa bộ dữ liệu UIT-VIWIkIQA.6 Số liệu tổng quát UIT-ViQuAD 2.-5255-522cccs+EszzEerxzrerxeree 18 Bang 2.7 Minh họa bộ dữ liệu UIT-VIQuAD 2.1 Ví dụ mô đun RuÌes.-- 5 1139 1k vn ng ngư 25 Bảng 3.1 Ví dụ câu hỏi phụ thuộc ngữ cảnh.2 Phương pháp đánh giá giữa các câu.-- --- 55s ss++scessseereses 30 Bang 3.1 Minh hoa câu trả lời được chọn sau khi qua mô dun filter.1 Kết qua thử nghiệm mô hình Retriever.2 Kết qua thử nghiệm mô hình Reader.-- 2-2-5 252 +£z£zz£+£z£z+xz2 54 Bang 4.3 Kết quả thử nghiệm hệ thống hỏi dap.1 So sánh kết quả các phương pháp.1 Lỗi không có câu trả lời.-- -¿-¿- 2552 5+2E+Sv£2E+EeEzvexexerxrrererervee 57 Bảng 4.2 Lỗi không nhận ra câu trả lời.----¿- - 5 5 S22 £££££E+E+EzE+xexeeers 58 Bảng 4.3 Lỗi câu trả lời Sai.
59 DANH MỤC TU VIET TAT CL Computational Linguistics MRC Machine Reading Comprehension NLP Natural Language Prosessing QA Question Answering STR Sentence Transformer VLSP Vietnam language and Speech Processing XLM-R XLM-RoBerta TÓM TÁT KHÓA LUẬN Hỏi đáp và Machine Reading Comprehension (MRC) là hai trong những bài toán đang nổi lên trong những năm gan đây nhằm giải quyết kha năng đọc hiểu văn bản tự động. Vấn đề đọc hiểu của máy đối với tiếng Việt có độ khó cao hơn so với tiếng Anh. Vì tiếng Việt là ngôn ngữ có dấu, nên mô hình phải học từ nhiều ký tự hơn. Hơn nữa, nhiều từ khác nhau có nghĩa giống nhau hoặc những từ giống nhau nhưng trong các ngữ cảnh khác nhau có nghĩa khác nhau rat dé làm cho mô hình dự đoán sai.
Đặc biệt là đối với các câu hỏi sử dụng từ đồng âm hoặc từ đồng nghĩa. Sự phức tạp của bài toán này không chỉ là tìm câu trả lời cho câu hỏi mà còn phải xác định câu hỏi đó có câu trả lời hay không. Trọng tâm luận văn là tìm câu trả lời đúng cho câu hỏi, vì đa số câu hỏi đều có câu trả lời. Tuy nhiên, vẫn có một số trường hợp câu hỏi không có câu trả lời thì mô hình cần dự đoán được các trường hợp như vậy.
Cũng như con người, sẽ có trường hợp có những câu hỏi gây khó khăn khiến hệ thống không thể trả lời được. Câu hỏi không có câu trả lời năm trong những trường hợp sau đây: e Trường hop 1: Khi hệ thống không truy xuất đến được đoạn văn có câu trả lời (không tìm được đoạn văn có câu trả lời hoặc đoạn văn có câu trả lời không ton tại trong dữ liệu được truy xuất). e Trường hợp 2: Khi câu hỏi sai (không thể có câu trả lời chính xác), ví dụ như "Lý do [+1 =3". e Trường hợp 3: Khi con người chưa trả lời được câu hỏi đó, ví dụ như "Có bao nhiêu chủng loại người ngoài hành tinh?".
Đối với câu hỏi có thê trả lời: hệ thống sẽ đưa ra đáp án phù hợp nhất. Còn đối với câu hỏi không trả lời được: dé trống câu trả lời thay vì đưa ra câu trả lời sai cho câu hỏi đó. Nhiệm vụ của chúng tôi đặt ra ở khóa luận là xây dựng một hệ thống hỏi đáp dựa trên đọc hiểu tiếng Việt với sự kết hợp giữa mô hình Retriever và mô hình MRC dành cho tiếng Việt nhằm giải quyết những vấn đề trên. Chúng tôi đã đạt được một số kết quả nhất định như kế thừa và cải tiễn thành công mô hình Retriever từ Đỗ và các cộng sự [2].
Bên cạnh đó chúng tôi cũng đã kết hợp mô hình mà chúng tôi xây dựng từ cuộc thi VLSP 2021 với mô hình trên đề tạo thành một hệ thống hỏi đáp tiếng Việt hoàn chỉnh. Cuối cùng, chúng tôi phát triển một giao diện dé người dùng có thé tương tác và có trải nghiệm tốt hơn cũng như làm cho hệ thống có tính ứng dụng thực tiễn. MỞ ĐẦU Cuộc sông của mỗi người luôn gắn liền với các câu hỏi và câu trả lời. Việc trả lời câu hỏi diễn ra hàng ngày, hàng giờ trong đầu mỗi người dù họ có ý thức được việc đó hay không.
Trả lời câu hỏi đôi khi chỉ để giải tỏa sự thắc mắc của mỗi người như là: “Tại sao con chim lại biết bay?”, “Hôm nay ăn gì?”. Nhưng trả lời câu hỏi đôi khi cũng có thể quyết định số phận của một người: “Tôi nên thi vào trường đại học A hay B?”. Có những câu hỏi có thể được giải đáp dé dàng chỉ với việc tra Google, hỏi bạn bè, thầy cô, nhưng cũng có những câu hỏi mãi vẫn chưa thé giải đáp được như là: “Có tồn tại người ngoài hành tinh hay không?”. Google hiện nay là một công cụ truy xuất những văn bản, tài liệu có khả năng chứa câu trả lời chứ không truy xuất câu trả lời.
Xuất phát từ nhu cầu đơn giản nhưng quan trọng là giải đáp thắc mắc của mỗi chúng ta, cộng thêm sự ra đời của bộ dữ liệu UIT-VIQuAD 2.0 [3], chúng tôi thật sự mong muốn có thé xây dựng một hệ thống hỏi đáp có thé trả lời được các câu hỏi đặt ra, đặc biệt hơn nữa là với tiếng Việt. Thực tế, không phải câu hỏi nào cũng có câu trả lời, và khi đó câu trả lời tốt nhất nên là “không biết”, ở đó mô hình đưa ra dự đoán là chuỗi rỗng: “”’. Bộ dữ liệu UIT-ViQuAD 2.000 câu hỏi có đáp án và 12.000 câu không thé trả lời sẽ giúp chúng tôi làm việc đó. Đầu vào của bài toán là một câu hỏi.
Hệ thống tiến hành truy xuất các tài liệu liên quan. Đầu ra là câu trả lời do mô hình dự đoán từ các tài liệu truy xuất được. Mục tiêu khóa luận của chúng tôi là xây dựng được một hệ thống hỏi đáp hoàn chỉnh bao gồm mô hình truy xuất tài liệu và mô hình đọc hiểu tài liệu đạt được độ chính xác cao. Bên cạnh đó là xây dựng giao diện tương tác cho người dùng để ứng dụng mang tính thực tiễn hơn.
Đối tượng nghiên cứu và phạm vi: Chúng tôi thực hiện xây dựng, đánh giá trước hết là trên bộ dit liệu UIT-ViQuAD 2.0 và sẽ mở rộng thêm các bộ dữ liệu khác trong tương lai. Đối tượng hướng đến là toàn bộ mọi người, những ai có nhu cầu giải đáp những thắc mắc về kiến thức nhờ vào trí tuệ nhân tạo trên tiếng Việt. Qua luận văn chúng tôi đã đạt được một số kết quả nhất định như phát triển được hệ thống Retriever có độ chính xác cao, xây dựng mô hình doc hiểu tự động đạt độ chính xác cao và tổng hợp thành một hệ thống hỏi dap hoàn chỉnh. Ngoài ra, chúng tôi cũng xây dựng thành công giao diện cho từng mô hình và trên toàn hệ thống.
Cuối cùng, chúng tôi đạt hạng 4 chung cuộc trong cuộc thi VLSP-MRC 2021 và có một bài báo được chấp nhận tại tap chi VNU Journal. Bài báo cáo luận văn của chúng tôi gồm có 5 chương. > Chương 1 là chương tông quan nhằm giới thiệu và giúp người đọc có cái nhìn khái quát về đề tài. > Chương 2 là các công việc, bộ dữ liệu, mô hình liên quan trong quá trình chúng tôi thực hiện khóa luận.
> Chương 3 là chương mô tả chỉ tiết về hệ thông hỏi đáp của chúng tôi. Vv Chương 4 nhằm phan tích, dua ra kết qua thử nghiệm và lỗi. > Chương 5 là kết luận và hướng phát triển trong tương lai. Giới thiệu hệ thống hỏi đáp dựa trên đọc hiểu tự động miền mở Hệ thống hỏi đáp được xây dựng nhằm mục đích tìm kiếm câu trả lời cho người dùng.
Hệ thống hỏi đáp là sự kết hợp của hai bài toán lớn trong lĩnh vực NLP là truy xuât và đọc hiéu tự động. Đối với bài toán truy xuất, hệ thống nổi tiếng nhất có thé ké đến là Google. Chỉ với thanh công cụ truy xuất đơn giản nhưng mạnh mẽ, Google truy xuất đến tất cả các trang web chứa thông tin liên quan trong thời gian ngăn. Điều đó giúp Google trở thành trang web được truy cập nhiều nhất trong năm 2021 và có thể còn thống trị trong nhiều năm tới vì nhu cầu tìm kiếm câu trả lời của con người diễn ra hàng ngày.