Chương 1.--22- 52 SE EEEE2E12E1521271711211211211 111121211 cxe 8 In Dinh nghia bal toa oo. Tinh ứng dụng của bài toán. nh nghi 10 Chương 2. CÁC CÔNG TRÌNH NGHIÊN CỨU LIÊN QUAN.
Cac bộ dữ liệu liên quan. _ Công trình trên thé giới. Cong trình trong ƯỚC.- Gv TH ng nh nành 14 2. Các mô hình liên quañ.
Phương pháp dựa vào xếp hạng câu. Phuong pháp dựa vào phân loại. Phương pháp đọc hiểu tự động.- ¿2 s+cs+E++EzEeExeExerxrrerree 17 XI NN(G). QUÁ TRÌNH CHUYEN DOI VA TONG QUAN VỀ BỘ DU LIEU UIT-ViWikiQa.
Quá trình chuyển đối bộ dữ LGU. Thuật toán chuyên đôi bộ dit liệu .-----2-252+cx+zx+zxczEzrsrred 19 3. Kiếm tra chất lượng bộ dữ liệu. Phân tích bộ dữ liệu UIT-ViWikiQA.
Tổng quan về bộ dit liệu UIT-ViWikiQA. Phan tích UIT-ViWikiQA theo loại câu hỏi. Phân tích UIT-ViWikiQA theo loại suy luận. St St TT 111111 15111111111111111151211111111E1EEEEEttke 32 Chương 4.
CÁC HƯỚNG TIẾP CAN VÀ MÔ HÌNH GIẢI QUYÉT BÀI TOÁN 33 4. Hướng tiếp cận dựa trên phương pháp xếp hạng. Hướng tiếp cận dựa trên phương pháp phân loại. M6 hình Manhattan LSTM (MaLSTM).
Hướng tiếp cận dựa trên phương pháp đọc hiểu tự động.--<2EESEE2EkSEEEE2E121127117111211211 11x ctxee 40 4. 41 AA, Kết luận. CAI ĐẶT, THU NGHIEM VÀ ĐÁNH GIÁ. Cài đặt thử nghiệm.
St SS SH ST TH HH nh hkp 45 5. Phương pháp đánh giá.- -- 6 Ăn TH ng nh nưệt 46 5. Kết quả thử nghiệm. Phân tích kết quả.
Tac động của tính chat ngữ cảnh. Tac động của các yếu tố dựa trên loại câu hỏi. Tac động của các yếu tố dựa trên loại suy luận. cu nh nghe 56 Chương 6.
KẾT LUẬN VÀ HUONG PHAT TRIÊN.----2-5s+cz+cz+xzez 58 6. Hạn ché voeeccccccccccceccececscsesecscsesecsesessucsesvsucecsceveucacsvseacacavsucacevsvsusacavseaceesvees 59 6. Hướng phát triển DANH MỤC HÌNH VẾ Hình 3.1: Phân bố các loại câu trên tập phát triển của UIT-ViWikiQA.2: Phân bố của các loại câu hỏi trên tập kiểm tra của UIT-VIWIKIQA.3: Phân bố các loại câu hỏi và từ dé hỏi trong tập phát triển và kiểm tra của UIT-VIWIKIQA 01.4: Phân bố các loại suy luận có trong tập phát triển của UIT-VïWikiQA.5: Phân bố các loại suy luận có trong tập kiêm tra của UIT-ViWikiQA.1: Kiến trúc mô hình theo hướng tiếp cận xếp hạng.2: Kiến trúc mô hình theo hướng tiếp cận phân loại.3: Kiến trúc mô hình LSTM .4: Kiến trúc mô hình MaLSTM.--- 5: 55cc22tvtiertrirrrrrrrsrrrrrrrrree 39 Hình 4.5: Kiến trúc mô hình theo hướng tiếp cận đọc hiểu tự động .6: Kiến trúc mô hình XLM-Roberta.1: Biểu diễn trùng lặp token giữa câu tra lời đúng và câu trả lời được dự đoán.2: Hiệu suất của các mô hình đối với các loại câu hỏi khác nhau của tập phát triển và được đánh giá trên EM và F Ï~§COF€.-- 2-2 2S +E+EE£EE2EE2EZEerEerxersrree 53 Hình 5.3: Hiệu suất của các mô hình đối với các loại suy luận khác nhau trên tập phát triển và được đánh giá trên Fl-score và EM.----¿--s¿©-++2+z+2x2zxerxesrxrsrsees 55 DANH MỤC BANG Bảng 1.1: Ví dụ về bai toán đọc hiểu dựa trên trích xuất câu cho tiếng Việt.1: Thống kê tổng quan về bộ dữ liệu UIT-ViWikiQA.2: Các loại câu hỏi trong bộ dữ liệu ULT-VIWIkIQA.3: Các loại suy luận có trong bộ dit liệu UIT-VIWIkIQA.1: Hiệu suất của các mô hình được đánh giá trên tập phát triển và tập kiếm CA.2: Hiệu suất của các mô hình MRC trên UIT-ViWikiQA và phiên bản xáo Ò900ì8:LIÍNƯHIađaiaadiẳ. 52 DANH MỤC TỪ VIET TAT STT Từ viết tắt Ý nghĩa 1 NLP Natural Language Processing 2 MRC Machine Reading Comprehension 3 QA Question Answering 4 BERT Bidirectional Encoder Representations from Transformers 5 LSTM Long Short Term Memory 6 BiLSTM Bidirectional Long Short Term Memory 7 MaLSTM Manhattan Long Short Term Memory 8 EM Exact Match TÓM TÁT KHÓA LUẬN Nhận thấy được sự đa dạng của các tài nguyên liên quan đến đọc hiểu tự động cũng như sự phát triển của các bài toán đọc hiểu tự động trên các ngôn ngữ như tiếng Anh, tiếng Trung.Cùng với đó là sự thiếu hut tài nguyên về dữ liệu cũng như các phương pháp đề đánh giá bài toán đọc hiểu tự động dựa trên trích xuất câu trên tiếng Việt.
Vì thế, trong khoá luận này chúng tôi đã đề xuất một bộ đữ liệu đọc hiểu dưa trên cấp độ câu trên ngôn ngữ tiếng Việt (UIT-ViWikiQA) được lấy từ các các bài báo trên trang Wikipedia! thông qua bộ dữ liệu UIT-ViQuAD 1.0 và thuật toán chuyển déi do chúng tôi đề xuất. Chúng tôi mong muốn bộ dữ liệu của mình sẽ góp phần làm phong phú và đa dang hơn cho tài nguyên của bài toán đọc hiểu tự động trên tiếng Việt. Ngoài ra, dé hiểu rõ hơn về bài toán đọc hiểu tự động dựa trên cấp độ câu trên tiếng Việt cũng như bộ dữ liệu UIT-ViWikiQA, chúng tôi cũng thống kê một vài số liệu về kích thước của bộ dữ liệu về số lượng bài báo, đoạn văn, câu hỏi vả từ vựng cũng như phân tích về loại câu hỏi cùng với sự đa dạng về từ dé hỏi, các loại suy luận của tập câu hỏi có trong bộ dit liệu UIT-ViWikiQA. Chúng tôi đề xuất ba hướng tiếp cận để đánh giá bài toán đọc hiểu tự động dựa trên cấp độ câu trên tiếng Việt: hướng tiếp cận dựa trên trích xuất câu, hướng tiếp cận dựa trên phương pháp phân loại và hướng tiếp cận dựa trên phương pháp đọc hiểu tự động.
Sau một loạt các thử nghiệm của chúng tôi, chúng tôi rút ra được mô hình XLM-Riarge+BiLSTM ở phương pháp tiếp cận dựa trên đọc hiệu tự động cho kết quả cao nhất với F1-score là 93.95% và EM la 91.79% trên tập phát triển và F1-score là 93.88% và EM là 91.86% trên tập kiểm tra. Bên cạnh đó chúng tôi cũng phân tích và nhận thấy răng các mô hình theo hướng tiếp cận đọc hiểu tự động chịu ảnh hưởng của ngữ cảnh và đối với các loại câu hỏi khác nhau thì các mô hình có các hiệu suất trung bình khác nhau và các mô hình có hiệu suất thấp hơn ở các loại câu hỏi khó Why , How và các loại câu hỏi có từ dé hỏi đa dạng như What, Where. Ngoài ra, chúng tôi phân tích trên loại suy luận của câu hỏi thì các mô hình có hiệu suât giảm dân khi các câu hỏi có tính suy luận khó dân lên 1 https://vi.org/ như các mô hình đạt hiệu suất cao ở loại suy luận Word Matching và hiệu suất thấp nhất ở loại suy luận Multi-sentence Matching. Cuối cùng, chúng tôi đề xuất một vài hướng phát triển ở tương lai cho bài toán đọc hiểu tự động dựa trên trích xuất câu trên tiếng Việt.
MO DAU Dat van dé Hiện nay, với sự phát triển mạnh mẽ của trí tuệ nhân tạo cũng như khoa học công nghệ kỹ thuật kéo theo số lượng người truy cập vào các trang mạng xã hội cũng như các nén tảng trực tuyến ngày càng nhiều và gia tăng đáng ké theo từng ngày. Việc người dùng tra cứu thông tin thông qua các nền tảng trực tuyến có lẽ không còn xa lạ với chúng ta nhất là trong thời đại trí tuệ nhân tạo nói chung và các mô hình máy học nói riêng dang được áp dung rất nhiều xung quanh cuộc sống hiện nay. Để có thé cung cấp thông tin một các chính xác cho người dùng thì các nền tảng trực tuyến đòi hỏi phải có đữ liệu liên quan đến rất nhiều chủ đề, từ đó áp dụng vào vài bài toán đọc hiểu tự động. Bài toán đọc hiểu tự động là nhiệm vụ đang thu hút rất nhiều sự chú ý và được ứng dụng trên nhiều lĩnh vực như: kinh doanh, sức khỏe, giáo dục,.
Chúng tôi nhận thấy rằng trên thé giới hiện nay có nhiều bộ đữ liệu kích thước lớn và chất lượng tốt cho các nghiên cứu về lĩnh vực xử lý ngôn ngữ tự nhiên và cụ thể là nhiệm vụ MRC, nhưng thực trạng là các bộ dữ liệu đó được tập trung chủ yếu phát triển trên các loại ngôn ngữ như tiếng Anh, tiếng Trung. Trong khi đó, trên tiếng Việt thì quá ít tài nguyên về các bộ dữ liệu để phục vụ các bài toán MRC. Vì thế, trong khóa luận này, chúng tôi đề xuất một bộ dữ liệu dựa trên cấp độ câu cho tiếng Việt (UIT-ViWikiQA ) dé có thể áp dụng cho bài toán đọc hiểu tự động dựa trên cấp độ câu cho tiếng Việt.1 là một số ví dụ cho bài toán đọc hiểu tự động dựa trên cáp độ câu do chúng tôi đề xuất. Với đầu vào của bài toán là một đoạn văn và câu hỏi tương ứng, đầu ra là một câu chứa câu trả lời cho câu hỏi đó được trích xuất từ đoạn văn.
Với đầu ra như vậy, chúng tôi muốn hướng đến một câu trả lời cung cấp đầy đủ thông tin xung quanh câu hỏi của người dùng thay vi chỉ tập trung đúng vao câu trả lời cho câu hỏi đó. Mục tiêu khoá luận tốt nghiệp Mục tiêu của khoá luận tốt nghiệp này là nghiên cứu bài toán đọc hiểu tự động dựa trên cấp độ câu cho tiếng Việt. Dé làm được điều này chúng tôi tập trung vào các mục tiêu chính sau đây: e Xây dựng một bộ di liệu UIT-ViWikiQA phục vụ cho bai toán đọc hiểu tự động trên cấp độ câu. Ngoài ra, chúng tôi cũng phân tích tong quan về bộ dit liệu và phân tích chi tiết dé có cái nhìn toàn cảnh và sâu sắc về bộ đữ liệu trên nhiều khía cạnh ngôn ngữ khác nhau.
e Giới thiệu ba hướng tiếp cận cho bai toán đọc hiểu tự động dựa trên cấp độ câu cho tiếng Việt: hướng tiếp cận dựa trên xếp hạng, hướng tiếp cận dựa trên phân loại, hướng tiếp cận dựa trên đọc hiểu tự động. e_ Triển khai các mô hình theo ba hướng tiếp cận bên trên với bộ dữ liệu của chúng tôi. e Tiến hành phân tích đánh giá làm rõ ngữ cảnh, các loại câu hỏi, cũng như những câu hỏi đòi hỏi sự suy luận đều có tác động đến hiệu suất các mô hình trong hướng tiếp cận đọc hiéu tự động. Đôi tượng và phạm vỉ nghiên cứu e Đối tượng: Bài toán đọc hiểu văn bản tự động trên cấp độ câu dành cho tiếng Việt.
e Pham vi: Pham vi nghiên cứu cua dé tài nay là tập trung vào các bai báo tiêng Việt trên trang Wikipeida và các câu hỏi được tập trung là các câu hỏi có nội dung câu trả lời nam trên một câu của đoạn văn. Vệ giới hạn nghiên cứu, chúng tôi chủ yêu tập trung vào các vân dé sau: o Xây dụng bộ dir liệu đọc hiéu tự động trên cap độ câu dành cho tiêng Việt với nguôn gôc lây từ các bài báo của Wikipedia. o Giới thiệu ba hướng tiêp cận khác nhau phục vụ cho việc giải quyết bai toán đọc hiệu tự động trên cap độ câu. o_ Triển khai các mô hình tiên tiến trên ba hướng tiếp cận khác nhau và được triển khai trên bộ đữ liệu của chúng tôi.