Cải Thiện Mô Hình Đọc Hiểu Trắc Nghiệm Tiếng Việt Với Hướng Tiếp Cận Attention Đa Bước

Khóa luận trình bày cải tiến mô hình đọc hiểu trắc nghiệm tiếng Việt bằng cách áp dụng attention đa bước và suy luận ngôn ngữ tự nhiên.

Chuyên ngành

Khoa học dữ liệu

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2023

67
3
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: GIỚI THIỆU BÀI TOÁN. CÁC CÔNG TRÌNH LIÊN QUAN

1.1. Các bộ dữ liệu MRC. Mô hình kiến trúc họ BERT và phương pháp MMM. Thách thức của bài toán

1.2. Lý do thực hiện đề tài

2. CHƯƠNG 2: BỘ DỮ LIỆU

2.1. Bộ dữ liệu ViMMRC

2.2. Bộ dữ liệu ViNLI. Phân tích tổng quan đặc trưng bộ dữ liệu ViMMRC. Thống kê tổng quát. Thống kê về độ dài đoạn đọc hiểu, câu hỏi, câu trả lời. Thống kê, phân tích về câu hỏi trắc nghiệm

3. CHƯƠNG 3: HƯỚNG TIẾP CẬN CHO BÀI TOÁN

3.1. Kiến trúc mô hình đề xuất

3.2. Phương pháp học chuyển tiếp trong xử lý ngôn ngữ tự nhiên

3.3. Kiến trúc BERT

3.4. Mô hình mBERT

3.5. Mô hình ViBERT

3.6. Mô hình Bert4News

3.7. Mô hình XLM-R

3.8. Kỹ thuật huấn luyện bổ sung với tác vụ NLI

3.9. Cơ chế multi-step attention

4. CHƯƠNG 4: THỰC NGHIỆM, KẾT QUẢ VÀ ĐÁNH GIÁ

4.1. Thiết lập tham số thí nghiệm

4.2. Kết quả thử nghiệm

4.3. Phân tích kết quả

4.4. Thách thức về mức độ đọc hiểu với các cấp bậc lớp học cao hơn

4.5. Ảnh hưởng của loại câu hỏi đối với hiệu suất mô hình

4.6. Tính hiệu quả của các phương pháp đề xuất

4.7. Phân tích lỗi

5. CHƯƠNG 5: CHƯƠNG TRÌNH MINH HOẠ

6. CHƯƠNG 6: ĐÓNG GÓP, HẠN CHẾ VÀ HƯỚNG PHÁT TRIỂN

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng Quan Về Cải Thiện Mô Hình Đọc Hiểu Trắc Nghiệm Tiếng Việt

Bài toán đọc hiểu trắc nghiệm tiếng Việt đang trở thành một lĩnh vực nghiên cứu quan trọng trong Xử lý ngôn ngữ tự nhiên (NLP). Mô hình đọc hiểu trắc nghiệm (MMRC) cho phép máy tính hiểu và trả lời câu hỏi dựa trên văn bản ngữ nghĩa. Việc cải thiện mô hình này không chỉ giúp nâng cao hiệu suất mà còn mở ra nhiều ứng dụng thực tiễn trong giáo dục và công nghệ thông tin.

1.1. Định Nghĩa Mô Hình Đọc Hiểu Trắc Nghiệm

Mô hình đọc hiểu trắc nghiệm (MMRC) là một tác vụ trong NLP, nơi máy tính cần chọn câu trả lời đúng từ một tập hợp các lựa chọn dựa trên văn bản ngữ nghĩa. Tác vụ này có thể được phân loại thành nhiều loại khác nhau như trích xuất, trắc nghiệm và sinh văn bản.

1.2. Tầm Quan Trọng Của Mô Hình Đọc Hiểu

Mô hình đọc hiểu trắc nghiệm không chỉ giúp cải thiện khả năng hiểu ngôn ngữ của máy tính mà còn có thể ứng dụng trong nhiều lĩnh vực như giáo dục, tìm kiếm thông tin và phát triển chatbot.

II. Thách Thức Trong Việc Cải Thiện Mô Hình Đọc Hiểu Trắc Nghiệm

Mặc dù có nhiều tiến bộ trong lĩnh vực đọc hiểu trắc nghiệm, nhưng vẫn tồn tại nhiều thách thức cần giải quyết. Các vấn đề như độ chính xác của mô hình, khả năng hiểu ngữ cảnh và sự đa dạng của câu hỏi vẫn là những yếu tố quan trọng ảnh hưởng đến hiệu suất của mô hình.

2.1. Độ Chính Xác Của Mô Hình

Độ chính xác của mô hình đọc hiểu trắc nghiệm phụ thuộc vào khả năng của nó trong việc phân tích và hiểu ngữ cảnh. Các mô hình hiện tại vẫn gặp khó khăn trong việc xử lý các câu hỏi phức tạp và đa dạng.

2.2. Khả Năng Hiểu Ngữ Cảnh

Khả năng hiểu ngữ cảnh là yếu tố quyết định trong việc đưa ra câu trả lời chính xác. Mô hình cần phải có khả năng liên kết thông tin giữa văn bản và câu hỏi để đạt được hiệu suất tốt nhất.

III. Phương Pháp Attention Đa Bước Trong Cải Thiện Mô Hình

Phương pháp Attention đa bước là một trong những giải pháp hiệu quả để cải thiện mô hình đọc hiểu trắc nghiệm. Phương pháp này cho phép mô hình tập trung vào các phần quan trọng của văn bản, từ đó nâng cao khả năng hiểu và phân tích thông tin.

3.1. Cơ Chế Attention Đa Bước

Cơ chế Attention đa bước giúp mô hình xác định các phần quan trọng trong văn bản, từ đó cải thiện khả năng đưa ra câu trả lời chính xác. Phương pháp này đã được chứng minh là hiệu quả trong nhiều nghiên cứu trước đây.

3.2. Kết Hợp Với Các Mô Hình Tiền Huấn Luyện

Kết hợp phương pháp Attention với các mô hình tiền huấn luyện như BERT giúp nâng cao hiệu suất của mô hình đọc hiểu trắc nghiệm. Các nghiên cứu cho thấy rằng việc sử dụng BERT có thể cải thiện đáng kể độ chính xác của mô hình.

IV. Ứng Dụng Thực Tiễn Của Mô Hình Đọc Hiểu Trắc Nghiệm

Mô hình đọc hiểu trắc nghiệm có nhiều ứng dụng thực tiễn trong giáo dục và công nghệ thông tin. Việc áp dụng mô hình này không chỉ giúp nâng cao chất lượng giáo dục mà còn cải thiện trải nghiệm người dùng trong các hệ thống tìm kiếm thông tin.

4.1. Ứng Dụng Trong Giáo Dục

Mô hình đọc hiểu trắc nghiệm có thể được sử dụng để phát triển các hệ thống kiểm tra tự động, giúp giáo viên đánh giá năng lực học sinh một cách hiệu quả hơn.

4.2. Ứng Dụng Trong Công Nghệ Thông Tin

Trong lĩnh vực công nghệ thông tin, mô hình này có thể được áp dụng trong các hệ thống tìm kiếm thông tin và chatbot, giúp cải thiện khả năng tương tác và phục vụ người dùng.

V. Kết Luận Về Tương Lai Của Mô Hình Đọc Hiểu Trắc Nghiệm

Tương lai của mô hình đọc hiểu trắc nghiệm hứa hẹn sẽ có nhiều tiến bộ với sự phát triển của công nghệ và nghiên cứu. Việc cải thiện mô hình này không chỉ giúp nâng cao hiệu suất mà còn mở ra nhiều cơ hội mới trong lĩnh vực NLP.

5.1. Xu Hướng Nghiên Cứu Mới

Các xu hướng nghiên cứu mới trong lĩnh vực đọc hiểu trắc nghiệm sẽ tập trung vào việc cải thiện độ chính xác và khả năng hiểu ngữ cảnh của mô hình.

5.2. Tương Lai Của Công Nghệ NLP

Công nghệ NLP sẽ tiếp tục phát triển, mở ra nhiều cơ hội mới cho việc ứng dụng mô hình đọc hiểu trắc nghiệm trong các lĩnh vực khác nhau.

10/07/2025
Khóa luận tốt nghiệp khoa học dữ liệu cải thiện mô hình đọc hiểu trắc nghiệm trên tiếng việt với hướng tiếp cận attention đa bước và suy luận ngôn ngữ tự nhiên

Trích đoạn nội dung tài liệu

Chương 1: Tổng quan Giới thiệu tổng quan về lĩnh vực Đọc hiểu tự động, tầm quan trọng của Bài toán đọc hiểu tự động đặc biệt là Đọc hiểu trắc nghiệm tự động và những thách thức hiện có, đồng thời đề cập đến các nghiên cứu liên quan trong và ngoài nước. Chương 2: Bộ dữ liệu Giới thiệu tổng quan về các bộ dữ liệu tiếng Việt sử dụng trong nghiên cứu này. Thực hiện các thống kê, phân tích các đặc trưng của bộ dữ liệu, từ đó rút ra các nhận xét khách quan đề chọn lựa các hướng tiếp cận phù hợp. Chương 3: Hướng tiếp cận cho bài toán Trình bày các hướng tiếp cận sẽ sử dụng, các phương pháp học sâu đã nghiên cứu để xử lý bài toán MMRC và các lý thuyết nền tản xung quanh.

Những phương pháp đã áp dụng trong bài bao gồm việc sử dụng các biến thể mô hình đa ngôn ngữ và đơn ngôn ngữ tiền huấn luyện của BERT, phương pháp đào tạo bổ sung với tác vụ trung gian NLI và cơ chế mạng Attention đa bước. Chương 4: Thử nghiệm, kết quả và đánh giá Trong chương này, chúng tôi sẽ giải thích độ đo đánh giá và các thiết lập tham số cho các thử nghiệm, trình bày các kết quả thực nghiệm đạt được, đưa ra đánh giá và so sánh kết quả các phương pháp khác nhau đồng thời thực hiện các phân tích lỗi cho kết quả dự đoán của các mô hình. Chương 5: Chương trình minh hoạ Trinh bày chương trình demo được xây dựng dé minh hoạ hệ thống đọc hiểu trắc nghiệm tự động sử dụng một số mô hình thực nghiệm trong báo cáo. Chương 6: Đóng góp, hạn chế và hướng phát triển Tổng kết những kết quả đã đạt được của đề tài, từ đó rút ra kết luận, phân tích các hạn chế, tự nhận xét, và đề xuất phương hướng phát triển sau này.

TONG QUAN Dé có cái nhìn tổng quan về để tài, sau đây, chúng tôi sẽ trình bày các khái niệm liên quan về bài toán Đọc hiểu trắc nghiệm tự động, bàn về tính ứng dụng của bài toán trong các giải pháp thực tế, cũng như đề cập đến những thách thức cần phải giải quyết của bài toán. Giới thiệu bài toán Đọc hiểu tự động (MRC) là một dé tài thú vị và thách thức trong lĩnh vực Xử lý ngôn ngữ tự nhiên (natural language processing - NLP) với nhiều ứng dụng rộng rãi trên toàn thế giới. Thế nhưng, đây không phải là một lĩnh vực mới phát triển. Phân loại nhóm tác vụ MRC dựa vào loại câu hỏi và câu trả lời, có thể kể đến một số tác vụ điển hình như điền vào chỗ trong (cloze style), trac nghiệm (multiple-choice), trích xuất văn bản (span prediction/extraction), câu hỏi tự do (free-form answer).

Dựa vào ngữ cảnh đọc hiểu, ngoài các tác vụ sử dụng ngữ cảnh từ văn bản thông thường, MRC còn bao gồm bài toán da tác vụ đọc hiểu (multi-modal MRC) kết hợp giữa lĩnh vực NLP với lĩnh vực Xử lý ảnh (computer vision - CV) như VQA, khi ngữ cảnh chứa đồng thời văn bản và hình ảnh minh hoạ. Machine Reading Comprehension Tasks | ! i i I Multiple Span Free-form Cloze Style Choice Prediction Answer Hình 1.1: Các phân loại tác vụ Doc hiểu tự động hiện có! ' A Survey on Machine Reading Comprehension—Tasks, Evaluation Metrics and Benchmark Datasets [25] Để hiểu rõ về tác vụ Đọc hiểu trắc nghiệm tự động, Hình 1.1 ở trên mô tả những tác vụ con thường được phân loại cho nhóm tác vụ Đọc hiểu tự động hiện nay. Cụ thé, dưới đây sẽ là các định nghĩa phân loại tác vụ này, biết rằng một bộ dữ liệu có thé thoả mãn nhiều phân loại khác nhau: -_ Cloze style: Trong tác vụ này, câu hỏi sẽ chứa các chỗ trồng. Hệ thong MRC có nhiệm vụ tìm những từ hay cụm từ phù hợp nhất dựa vào nội dung ngữ cảnh để điền vào chỗ trồng này.

- Multiple-choice: Trong tác vụ trắc nghiệm, hệ thống MRC cần phải dựa vào ngữ cảnh được cung cấp, chọn ra được câu trả lời chính xác từ một tập các lựa chọn đáp án. - Span prediction: Trong tác vụ trích xuất văn bản, câu trả lời là một đoạn/cụm từ có sẵn nằm trong văn bản ngữ cảnh. Hệ thống MRC có nhiệm vụ dự đoán vị trí bat đầu và kết thúc của câu trả lời cụ thể trong đoạn ngữ cảnh này. -_ Free-form answer: Loại tác vụ này cho phép câu trả lời thuộc bất kỳ dạng nào.

Do đó, câu trả lời không bị phụ thuộc vào bất cứ đoạn văn hay cụm từ nao từ đoạn ngữ cảnh. Bộ dữ liệu ViMMRC 2.0 sử dụng trong đề tài này là một bộ dữ liệu đọc hiểu trắc nghiệm dựa trên văn bản ngữ cảnh. Các đáp án cho câu hỏi phần lớn có dạng free- form answer. Trong để tài này, bài toán Đọc hiểu trắc nghiệm tự động (multiple- choice machine reading comprehension) trên bộ dữ liệu Tiếng Việt — VIMMRC 2.0 sẽ được khái quát như sau: - Đầu vào: Câu hỏi trắc nghiệm kèm theo tập các lựa chọn cho câu trả lời và đoạn văn bản cung cấp ngữ cảnh.

- Đầu ra: Một phương án trả lời duy nhất trong bộ các lựa chọn đáp án. Passage Contex: Question | —axery Option 3 fe) Hình 1.2: Tác vụ Đọc hiểu trắc nghiệm tự động 1. Các công trình liên quan 1. Các bộ dữ liệu MRC Đọc hiểu tự động không phải là một lĩnh vực mới được phát triển.

Theo như một nghiên cứu khảo sát [25], tác giả Lehnert đã có những nghiên cứu về chương trình đọc hiểu vấn đáp từ năm 1977, hay Hirschman và các cộng sự cũng đã xây dựng hệ thống đọc hiểu từ năm 1999. Tuy nhiên, hầu hết các hệ thông MRC này đều là các mô hình thống kê (statistical models) hay các hệ thông sử dụng quy tắc (rule-based). Đến tận 2013, Richardson và các cộng sự [2] đã cho ra đời bộ dữ liệu MCTest (một bộ dữ liệu trắc nghiệm), kéo theo các nghiên cứu về việc áp dụng mô hình máy học vào bài toán đọc hiểu văn bản bắt đầu nở rộ. Để giải quyết sự thiếu hụt các bộ dữ liệu chất lượng, Hermann và các cộng sự [26] đã phát triển một phương pháp xây dựng dữ liệu để tạo ra các bộ dữ liệu đọc hiểu có giám sát quy mô lớn vào năm 2015.

Kể từ đó, lĩnh vực MRC bước vào thời kỳ phát triển nhanh chóng với sự xuất hiện của nhiều bộ dữ liệu quy mô lớn và các mô hình mạng thần kinh (neural network) tiên tiến. Một số bộ đữ liệu MRC nổi tiếng cần được kể đến là: CNN/Daily Mail [26], WikiQA [23], SQuADI. Mặt khác, tuy là một ngôn ngữ ít tài nguyên trên thế giới, tiếng Việt đã va dang nhận được nhiều sự quan tâm đến từ các nhà nghiên cứu với nhiều công trình trong và ngoài nước được xuất bản. Có không ít bộ dữ liệu chất lượng phục vụ cho tác vụ MRC trên tiếng Việt được ra mắt trong những năm trở lại đây.

Trong đó, có thể kể đến ViMMRC [13] và ViQuAD [8] là hai bộ dữ liệu đầu tiên phục vụ cho tác vụ này. Với ViQuAD chứa hơn 23.000 bộ câu hỏi từ 5.109 đoạn đọc hiểu cho tác vụ đọc hiểu trích xuất văn bản. Bộ dữ liệu UIT-ViQuAD 2.0 [30] ra mắt sau đó tại VLSP 2021-ViMRC Challenge”, với sự bổ sung thêm 9.217 câu hỏi không thé trả lời, đã khắc phục điểm yếu của bộ dữ liệu đầu tiên đối với những câu hỏi “bẫy”, không rõ ràng trong đoạn đọc hiểu. Mặt khác, ViMMRC [13] hiện là bộ dữ liệu hiếm hoi phục vụ tác vụ MMRC trên tiếng Việt, chỉ có kích thước giới hạn gồm 2,783 bộ câu hỏi cho 417 đoạn đọc hiéu được trích từ sách giáo khoa Tiếng Việt cấp Tiểu học (từ lớp 1 đến lớp 5).

Day cũng là lý do bộ dữ liệu VIMMRC 2.0 (một công trình gần đây đang trong quá trình công bó của chúng tôi, chỉ tiết bộ dữ liệu sẽ được trình bày tại Mục 2.1) được xây dựng, với sự mở rộng về kích thước cũng như nâng cấp mức độ đọc hiểu. Một số bộ dữ liệu khác trên tiếng Việt cho tác vụ MRC có thể ké đến gồm Bộ dữ liệu đọc hiểu hội thoại về đề tài sức khoẻ thu thập từ các bài báo điện tử tiếng Việt ViCoQA [9], Bộ dữ liệu các hỏi đáp cộng đồng về các thông tin chủ đề COVID-19 ViHealthQA [11] hoặc Bộ dữ liệu hỏi đáp tự động dựa trên hình ảnh UIT-EVJVQA [12]. Dé có cái nhìn tổng quan về các bộ dữ liệu tiếng Việt hiện tại phục vụ tác vụ MRC, khảo sát ở Bảng 1.1 sau đây liệt kê, trình bày những thông tin cơ bản về các bộ dữ liệu hiện có sử dụng cho tiếng Việt cho nhóm tác vụ Đọc hiểu tự động. vn/competitions/35 Bang 1.1: Các bộ dữ liệu MRC trên tiếng Việt Bộ dữ liệu Phân loại Quy mô Nguồn dữ liệu ViMMRC [13] Multple 417 doan doc hiéu va SGK Tiếng Việt cấp choice 2.783 câu hỏi tiêu học UIT-ViQuAD [8] Extractive 5.109 đoạn đọc hiéu và Wikipedia 23.074 câu hỏi ViCoQA [9] Conversa- 2.000 đoạn hội thoại và Các bài báo chủ đề tional MRC 10.000 câu hỏi sức khoẻ UIT-ViQuAD2.173 đoạn đọc hiểu và Wikipedia [30] 35.217 câu hỏi không thê trả lời) ViHealthQA [11] Retrieval 10.015 bộ câu hỏi Các bài báo điện tử về đê tài sức khoẻ UIT-ViWikiQA — Extractive 5.109 doan doc hiéu va Wikipedia [31] 3.074 câu hỏi UIT-ViNewsQA _ Extractive 4.057 Các bài báo chủ dé [32] câu hỏi sức khoẻ UIT-ViCov19QA Query 4.500 bộ câu hỏi FAQ từ các trang [10] web về sức khoẻ VIMQA [33] Bool and 10.047 bộ câu hỏi Wikipedia Extractive (Multi-hop) Legal text QA [34] Retrieval 5.922 bộ câu hỏi Văn bản pháp lý MLQA [35] Extractive 12.738 câu hỏi tiếng Anh Wikipedia và 5.029 câu hỏi ngôn ngữ khác gôm tiêng Việt ViMMRC 2.0 [14] Multiple 599 doan doc hiéu va SGK Tiếng Việt và choice 5.273 câu hỏi Ngữ Văn các cap 1.

Mô hình kiến trúc họ BERT và phương pháp MMM Trong những năm gần đây, các mô hình ngôn ngữ lớn (Large LM) mạnh mẽ đang trên đà phát triển, ví dụ như BERT [15] đã đạt được kết quả SOTA trên hàng loạt các tác vụ phổ biến. Theo như nghiên cứu của Zaib và các cộng sự [36], các mô hình ngôn ngữ tiền huấn luyện (pre-trained language models) mang lại nhiều lợi thé tiềm năng hơn các phương pháp học sâu thông thường, do việc được huấn luyện trước trên một lượng lớn dữ liệu, từ đó có thể học được các đặc trưng có tính tổng quát hơn. Các đặc trưng này sau đó có thé được sử dụng dé giải quyết cho các tác vụ cụ thể, như đọc hiểu văn bản, phân tích cảm xúc, tóm tắt văn bản, .

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ