Chương 1. TONG QUAN 4 luận này, có hai mục tiêu chính tôi sé thực hiện. Đầu tiên tôi sẽ xây dựng bộ ngữ liệu về thành ngữ, tục ngữ tiếng Việt. Sau đó, tôi sẽ tìm hiểu các phương pháp để huấn luyện mô hình đọc hiểu thành ngữ, tục ngữ tiếng Việt cũng như kiểm tra tính khả thi của bộ ngữ liệu đã tạo.4 Pham vi nghiên cứu Tuy đề tài hiện đang ở mức sơ khởi nhưng phạm vi áp dụng là vô cùng lớn.
Cụ thé, nghiên cứu về đọc hiểu tự động trên thành ngữ, tục ngữ tiếng Việt với nguồn thu thập chính là các văn bản trên không gian mạng. Công trình nghiên cứu này là một bước đệm giúp cho các hệ thống đọc hiéu trích xuất văn bản tiếng Việt xử lý thông tin mượt mà hơn, tránh tình trạng nhập nhang khi xử lý những văn bản chứa thành ngữ, tục ngữ.5 Cấu trúc khóa luận: Khoá luận được chia thành 5 chương với các nội dung chính như sau: ° Chương 1: Tổng quan Giới thiệu bài toán nhận diện chuỗi xúc phạm, phản cảm có trong bình luận mạng xã hội tiếng Việt. Tầm quan trọng và tính ứng dụng của khoá luận vào thực tế đời sống trong bối cảnh phát triển mạnh mẽ của nền tảng trực tuyến hiện tại. ° Chương 2: Các nghiên cứu liên quan và cơ sở lý thuyết Giới thiệu một vài các công trình nghiên cứu liên quan dén bài toán đọc Chương 1.
TONG QUAN 5 hiểu máy nói chung cũng một số công trình về thành ngữ tiếng Trung va cơ sở lý thuyết. ° Chương 3: Xây dựng bộ dữ liệu Giới thiệu bộ dữ liệu Vietnamese Idiom Dataset (VIID). Tôi sẽ trình bày quy trình xây dựng bộ dữ liệu cu thé theo từng bước kèm theo phân tích về các đặc điểm ngôn ngữ đặc thù kèm phương pháp tiếp cận giải quyết, đưa ra những thống kê cơ bản cho bộ dữ liệu ViID. ° Chương 4: Thực nghiệm và đánh giá Thí nghiệm các mô hình học sâu, học chuyền tiếp đa ngôn ngữ và đơn ngôn ngữ dành riêng cho tiếng Việt trên bộ dữ liệu ViID.
Phân tích kết quả của từng mô hình, sau đó tiễn hành so sánh, đánh giá và kết luận về hiệu suất của từng loại mô hình. ° Chương 5: Kết luận, hạn chế và hướng phát triển Tổng kết các kết quả đạt được của khoá luận, nêu lên những hạn chế còn tồn tại và định hướng phát triển của khoá luận trong tương lai. CÁC NGHIÊN CUU LIÊN QUAN VÀ CƠ SỞ LÝ THUYET 6 Chương 2 CÁC NGHIÊN CỨU LIÊN QUAN VÀ CƠ SỞ LY THUYET Trong chương này, tôi sẽ trình bày một số công trình nghiên cứu liên quan về xây dựng bộ ngữ liệu về thành ngữ và những bộ ngữ liệu liên quan đến bài toán đọc hiểu tự động trước đó, cũng như những nghiên cứu liên quan về bài toán đọc hiểu tự động, sau đó là tông quan về các cơ sở lý thuyết làm nền tảng trong khóa luận này.1 trình bày về một vài bộ dữ liệu đã có và những công trình nghiên cứu về bài toán đọc hiểu tự động.2 sẽ giới thiệu các kiến trúc cơ sở cần thiết dé xây dựng bộ dữ liệu cũng như giải quyết bài toán liên quan đến bộ dữ liệu.1 Các công trình nghiên cứu liên quan Liên quan đến nghiên cứu của khóa luận tốt nghiệp, tôi tập trung trình bài những bộ dữ liệu liên quan đến thành ngữ đã giới thiệu trước đó (Mục 2.1) và những bộ dữ liệu liên quan đến bài toán MRC (Mục 2. Ngoài ra, bảng 2.1 so sánh chỉ tiết các bộ dit liệu tôi đã đề cập với bộ dit liệu ViID tôi đã xây dựng.1 Các bộ dữ liệu thành ngữ, tục ngữ đã có Chương 2.
CÁC NGHIÊN CUU LIÊN QUAN VÀ CƠ SỞ LÝ THUYET 7 Thành ngữ luôn là chủ đề gây ra nhiều khó khăn trong lĩnh vực NLP, tuy nhiên trong những năm gần đây, có nhiều nghiên cứu về thành ngữ đã được công bó, có thé kê đến một vài bộ dit liệu nổi bật như IMIL hay ChID, cụ thé: ° IMIL [3]: Bộ dữ liệu IMIL là bộ dữ liệu song song đa ngôn ngữ ảnh xa 2208 thành ngữ thường được sử dụng bằng tiếng Anh sang bản dịch của chúng bang bảy ngôn ngữ Ấn Độ: Hindi, Urdu, Bengali, Tamil, Gujarati, Malayalam va Telugu. Các thành ngữ cũng được chú thích bang những cảm xúc thích hop mà chúng truyền tải và ý nghĩa của chúng trong các ngôn ngữ tương ứng. Tập dữ liệu kết quả có kích thước 47. Các thành ngữ được thu thập trên các website kết hợp với những thành ngữ được tông hợp từ kho ngữ liệu tiếng Anh Mỹ nổi tiếng khác, bao gồm American National Corpus (ANC) (Ide và Suderman, 2004); Tập hợp tiếng Anh học thuật Michigan (MICASE) (Simpson va cộng su, 2002), và Brown Corpus (Francis và Kucera, 1979).5%), thành ngữ được thu thập từ tập thành ngữ tiếng Trung Daquan, các văn bản được thu thập từ các tiểu thuyết và tiêu luận Internet cũng như các bài báo do Sun và các cộng sự của ông cung cấp (2016) [5].2 Các bộ dữ liệu liên quan đến bai toán MRC: Do lĩnh vực MRC có nhiều nghiên cứu, trong khóa luận tốt nghiệp này tôi chỉ tập trung vào các bộ dữ liệu liên quan trực tiếp như CNN/DailyMail, Children”s Chương 2.
CÁC NGHIÊN CUU LIÊN QUAN VÀ CƠ SỞ LÝ THUYET 8 Book Test, The 1st Evaluation on Chinese Machine Reading Comprehension, New Vietnamese Corpus for Machine Reading Comprehension of Health News Articles, Vietnamese Question Answering Dataset. ° CNN/DailyMail [6]: Bộ dữ liệu CNN/Daily Mail là bộ dữ liệu bao gồm hơn 300,000 bài báo được viết bởi các nhà báo ở hai tòa soạn CNN và Daily Mail, bộ dữ liệu được chia thành 287,113 mẫu đữ liệu để huấn luyện, 13,368 dé xác thực va 11,490 dé kiểm tra. Trung bình, có khoảng 28 câu trong mỗi tài liệu trong bộ huấn luyện. Bộ dữ liệu này bao gồm phiên bản an danh và phiên bản không ân danh.
Phiên bản đầu tiên là tất cả các tên thực thé của dữ liệu được thay thé bằng các từ thẻ đặc biệt, trong khi phiên bản thứ hai là dữ liệu gốc. Dữ liệu CNN/Daily Mail bao gồm nhiều cặp tài liệu-tóm tắt, mỗi cặp tương ứng với một vải câu được đánh dấu trong tài liệu được chú thích thủ công. ° Children’s Book Test [7]: Children’s Book Test được thiết kế để kiểm tra vai trò của trí nhớ và ngữ cảnh trong việc xử lý và hiểu ngôn ngữ. Bài kiểm tra yêu cầu dự đoán về các loại từ còn thiếu khác nhau trong sách dành cho trẻ em, dựa trên cả những từ gần đó và bối cảnh rộng hơn từ cuốn sách.
Bộ đữ liệu được thu thập từ những cuốn sách được cung cấp miễn phí nhờ dự án Gutenberg [8]. Việc sử dụng sách dành cho trẻ em đảm bảo cau trúc tường thuật rõ ràng, điều này có thé làm cho vai trò của bối cảnh trở nên nồi bật hon. ° The Ist Evaluation on Chinese Machine Reading Comprehension (CMRC-2017) [9]: Bộ dữ liệu dang cloze-style reading comprehension của Trung Quốc được tạo tự động quy mô lớn, được thu thập từ tài liệu đọc của trẻ em. Mặc dù tao dữ liệu dao tạo tự động, các bộ dữ liệu đánh giá của CMRC-2017 (xác thực và kiểm tra) được chú thích thủ công.
Dé tăng thêm sự đa dạng và điều tra sâu hon Chương 2. CÁC NGHIÊN CUU LIÊN QUAN VÀ CƠ SỞ LÝ THUYET 9 về transfer learning, nhóm tác giả cũng cung cấp một bộ đữ liệu đánh giá khác cũng được con người chú thích, nhưng truy vấn tự nhiên hơn loại cloze. ° New Vietnamese Corpus for Machine Reading Comprehension of Health News Articles (UIT-ViNewsQA) [10]: ViNewsQA bao gom hon 22.000 cặp câu hỏi-câu trả lời do con người tạo ra dựa trên hon 4.400 bai báo trực tuyến trong lĩnh vực y tế. Kho ngữ liệu này được cung cấp công khai cho nghiên cứu xử lý ngôn ngữ tiếng Việt và cả cho các nghiên cứu đa ngôn ngữ cùng với các kho tài liệu tương tự khác như NewsQA [11] (cho tiếng Anh), CMRC (cho tiếng Trung) [12], FQuAD (cho tiếng Pháp) [13] và KorQuAD [14] (cho tiếng Hàn).
Bộ ngữ liệu được phân tích theo các khía cạnh ngôn ngữ khác nhau, bao gồm dựa trên từ vựng, ba loại độ dài (câu hỏi, câu trả lời và mạo từ), ba loại dựa trên nội dung (câu hỏi, câu trả lời và lý luận) và mối tương quan giữa dựa trên loại và độ dài câu trả lời, từ đó cung cấp những hiểu biết toàn điện về bộ dữ liệu. ° Vietnamese Question Answering Dataset (UIT-ViQuAD): [15] ViQuAD bao gồm 23.074 cặp câu hỏi-câu trả lời do con người tạo ra dựa trên 5.109 đoạn của 174 bài viết Wikipedia tiếng Việt. Tập dữ liệu được phân tích theo các khía cạnh ngôn ngữ khác nhau bao gồm phân tích theo độ dài (độ dài câu hỏi, độ dài câu trả lời và độ dài đoạn văn) và phân tích dựa trên loại (loại câu hỏi, loại câu trả lời và loại lý luận). UIT-ViQuAD có thể dùng làm nguồn tài nguyên cho nghiên cứu đa ngôn ngữ cùng với các bộ dữ liệu tương tự khác như SQuAD, CMRC và KorQuA.
Dữ liệu Giải quyết | Ngôn ngữ Kích thước Nguồn thu bài toán thập Chương 2. CÁC NGHIÊN CUU LIÊN QUAN VÀ CƠ SỞ LÝ THUYET 10 IMIL MT vaSA |7ngônngữÁn | 47.382 câu (Tập | Website kết Độ gồm: Hindi, | huấn luyện - hợp với những Urdu, Bengali, | 46200, tập phát | thành ngữ Tamil, Gujarati, | triển - 1432,tập | được tổng hợp Malayalam và | thử nghiệm — từ kho ngữ liệu Telugu. tiếng Anh Mỹ. ChID Cloze-style | Tiéng Trung 581K đoạn văn | Tin tức, tiểu MRC Quốc và 729K thuyết và tiểu luận CNN/Daily | Cloze-style | Tiếng Anh 287,113 mẫu đữ | CNN và Daily Mai MRC liệu đểhuẩn | Mail luyện, 13,368 để xác thực và 11,490 đề kiểm tra Children’s | Cloze-style | Tiếng Anh 669,343 mau dữ | Sách dành cho Book Test | MRO liệu huấn luyện, | trẻ em 8,000 mẫu xác thực và 10,000 mẫu kiểm tra CMRC- Cloze-style | Tiéng Trung 354,295 mẫu dữ | Mã nguồn mở 2017 MRC Quéc liệu dé huấn luyện, 2,000 dé xac thuc va Chương 2.
CÁC NGHIÊN CUU LIÊN QUAN VÀ CƠ SỞ LÝ THUYET 11 2,000 dé kiém tra UIT- Span- Tiéng Viét 22K cau hoi Y tế va tin tức ViNewsQA | extraction MRC UIT- Span- Tiéng Viét 5109 doan van va | Wikipedia(Ma ViQuAD extraction ae x. MRC 23074 câu hỏi nguôn mở) VIID Cloze-style | Tiếng Việt 3639 mẫu đữ liệu | Internet MRC dé huấn luyện, 363 mẫu xác thực và 363 mẫu kiêm tra Bảng 2.1: Khảo sát sơ bộ về bộ đữ liệu ViID và các bộ dữ liệu liên quan 2.1 Bidirectional Transformers for Language Understanding: BERT [16] là một kiến trúc mới cho lớp bài toán Language Representation được Google công bố vào năm 2019.