Luận án tiến sĩ: Xây dựng mô hình đọc hiểu tự động cho văn bản tiếng Việt

Luận án tiến sĩ khoa học máy tính tập trung nghiên cứu xây dựng mô hình đọc hiểu tự động cho văn bản tiếng Việt, ứng dụng AI tiên tiến.

Chuyên ngành

Khoa học Máy tính

Người đăng

Ẩn danh

Thể loại

luận án tiến sĩ

2024

183
3
0

Phí lưu trữ

45 Point

Mục lục chi tiết

LỜI CẢM ƠN

LỜI CAM ĐOAN

1. CHƯƠNG 1: TỔNG QUAN

1.1. Động lực nghiên cứu

1.2. Các đóng góp chính

1.3. Mục tiêu, đối tượng và phạm vi nghiên cứu

1.4. Ý nghĩa khoa học và thực tiễn

2. CHƯƠNG 2: CƠ SỞ LÝ THUYẾT VÀ CÁC CÔNG TRÌNH NGHIÊN CỨU LIÊN QUAN

2.1. Lịch sử đọc hiểu tự động

2.2. Định nghĩa đọc hiểu tự động

2.3. Phương pháp đọc hiểu tự động

2.4. Ngữ liệu đọc hiểu tự động

2.5. Thông số đánh giá

2.6. Hỏi đáp dựa trên đọc hiểu tự động

2.7. Thách thức trong đọc hiểu và hỏi đáp tự động tiếng Việt

3. CHƯƠNG 3: XÂY DỰNG NGỮ LIỆU VÀ ĐÁNH GIÁ ĐỌC HIẾU TỰ ĐỘNG TRÊN VĂN BẢN TIẾNG VIỆT

3.1. Giới thiệu và động lực xây dựng các bộ ngữ liệu

3.2. Bộ ngữ liệu đọc hiểu tự động cho văn bản Wikipedia tiếng Việt

3.3. Quy trình xây dựng ngữ liệu

3.4. Phân tích bộ ngữ liệu

3.5. Bộ ngữ liệu đọc hiểu tự động cho văn bản tin tức sức khỏe tiếng Việt

3.6. Bộ ngữ liệu đọc hiểu tự động cấp độ câu cho văn bản tiếng Việt

3.7. Mở rộng bộ ngữ liệu đọc hiểu tự động tiếng Việt với câu hỏi không trả lời được

3.8. Những đánh giá đầu tiên trên các mô hình đọc hiểu tự động tiếng Việt

3.9. Kết luận

4. CHƯƠNG 4: MÔ HÌNH ĐỌC HIẾU TỰ ĐỘNG TÍCH HỢP TRUY XUẤT MINH CHỨNG TRÊN VĂN BẢN TIẾNG VIỆT

4.1. Giới thiệu và động lực nghiên cứu

4.2. Mô hình đọc hiểu tự động trong văn bản tiếng Việt

4.3. Thử nghiệm và kết quả

4.4. Bộ ngữ liệu thử nghiệm

4.5. Chuẩn bị ngữ liệu

4.6. Các mô hình cơ sở

4.7. Các thông số mô hình

4.8. Các kết quả thử nghiệm

4.9. Phân tích kết quả thử nghiệm và thảo luận

4.10. Kết luận chương

5. CHƯƠNG 5: MÔ HÌNH HỎI ĐÁP TỰ ĐỘNG CHO VĂN BẢN TIẾNG VIỆT

5.1. Giới thiệu và động lực nghiên cứu

5.2. Mô hình hỏi đáp tiếng Việt đề xuất dựa trên đọc hiểu tự động

5.3. Các quy tắc tiền xử lý

5.4. Mô hình truy xuất văn bản

5.5. Mô hình đọc hiểu văn bản

5.6. Xếp hạng các câu trả lời ứng cử (Answer Re-ranker)

5.7. Thử nghiệm và kết quả

5.8. Các bộ ngữ liệu thử nghiệm

5.9. Các thông số đánh giá

5.10. Thiết kế các thử nghiệm

5.11. Môi trường thử nghiệm

5.12. Các kết quả thử nghiệm

5.13. Phân tích kết quả thử nghiệm và thảo luận

5.14. Các thành phần đóng góp vào mô hình hỏi đáp tiếng Việt đề xuất

5.15. Các thông số của truy vấn văn bản và đọc hiểu văn bản ảnh hưởng đến mô hình hỏi đáp

5.16. Ảnh hưởng của các từ tiếng nước ngoài đến các mô hình ngôn ngữ trong mô hình đọc hiểu tự động tiếng Việt

5.17. Độ dài văn bản tác động đến hiệu suất mô hình

5.18. Những dạng câu hỏi thách thức đối với mô hình hỏi đáp đề xuất

6. CHƯƠNG 6: KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

6.1. Đóng góp thứ nhất: Xây dựng ngữ liệu và đánh giá các mô hình đọc hiểu cho văn bản tiếng Việt

6.2. Đóng góp thứ hai: Đề xuất mô hình đọc hiểu tự động tích hợp truy xuất minh chứng cho văn bản tiếng Việt

6.3. Đóng góp thứ ba: Đề xuất mô hình hỏi đáp tích hợp đọc hiểu tự động cho văn bản tiếng Việt

6.4. Các hạn chế và các hướng phát triển

6.5. Ngữ liệu cho đánh giá các mô hình đọc hiểu tự động

6.6. Mô hình đọc hiểu và hỏi đáp tự động

6.7. Mở rộng ứng dụng của các mô hình đọc hiểu tự động

HỌC BỔNG ĐÀO TẠO TIẾN SĨ

CÔNG BỐ KHOA HỌC

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Mô hình đọc hiểu tự động

Mô hình đọc hiểu tự động là trọng tâm của nghiên cứu này, tập trung vào việc phát triển các giải pháp để máy tính có thể hiểu và trả lời các câu hỏi từ văn bản tiếng Việt. Nghiên cứu đề xuất các mô hình dựa trên kiến trúc Transformer và tích hợp truy xuất minh chứng, mang lại hiệu quả cao trong việc xử lý ngôn ngữ tự nhiên. Các mô hình này được đánh giá trên các bộ dữ liệu tiếng Việt như UIT-ViQuAD, UIT-ViNewsQA, và UIT-ViWikiQA, đóng góp vào việc cải thiện khả năng đọc hiểu tự động cho ngôn ngữ ít tài nguyên.

1.1. Kiến trúc Transformer

Kiến trúc Transformer được sử dụng làm nền tảng cho các mô hình đọc hiểu tự động. Nó cho phép xử lý song song các từ trong câu, tối ưu hóa thời gian huấn luyện và cải thiện độ chính xác. Các mô hình như BERTXLM-R được tích hợp để tăng cường khả năng hiểu ngữ nghĩa của văn bản tiếng Việt.

1.2. Truy xuất minh chứng

Truy xuất minh chứng là một thành phần quan trọng trong mô hình đọc hiểu tự động. Nó giúp xác định các đoạn văn bản liên quan đến câu hỏi, từ đó cải thiện độ chính xác của câu trả lời. Phương pháp này đặc biệt hữu ích khi xử lý các văn bản dài và phức tạp.

II. Văn bản tiếng Việt

Nghiên cứu tập trung vào văn bản tiếng Việt, một ngôn ngữ có đặc thù riêng về cấu trúc ngữ pháp và từ vựng. Các bộ dữ liệu được xây dựng bao gồm UIT-ViQuAD, UIT-ViNewsQA, và UIT-ViWikiQA, nhằm đánh giá và phát triển các mô hình đọc hiểu tự động. Những bộ dữ liệu này đóng vai trò quan trọng trong việc thúc đẩy nghiên cứu về xử lý ngôn ngữ tự nhiên cho tiếng Việt.

2.1. Xây dựng bộ dữ liệu

Quy trình xây dựng bộ dữ liệu bao gồm thu thập, làm sạch và chú thích văn bản. Các bộ dữ liệu được thiết kế để phản ánh đa dạng các loại văn bản, từ Wikipedia đến tin tức sức khỏe, giúp mô hình có thể xử lý nhiều ngữ cảnh khác nhau.

2.2. Đánh giá bộ dữ liệu

Các bộ dữ liệu được đánh giá dựa trên độ chính xác (EM) và độ đo F1. Kết quả cho thấy các mô hình đọc hiểu tự động đạt hiệu suất cao trên các bộ dữ liệu này, chứng minh tính khả thi của việc áp dụng công nghệ AI trong xử lý tiếng Việt.

III. Khoa học máy tính

Nghiên cứu này nằm trong lĩnh vực khoa học máy tính, cụ thể là xử lý ngôn ngữ tự nhiêntrí tuệ nhân tạo. Các mô hình đọc hiểu tự động được phát triển dựa trên các kỹ thuật học máyhọc sâu, mang lại những đóng góp quan trọng cho việc tự động hóa quá trình đọc hiểu văn bản.

3.1. Học máy và học sâu

Các kỹ thuật học máyhọc sâu được áp dụng để huấn luyện các mô hình đọc hiểu tự động. Các mô hình như BERTXLM-R được sử dụng để tối ưu hóa quá trình xử lý ngôn ngữ tự nhiên, đặc biệt là cho tiếng Việt.

3.2. Ứng dụng thực tiễn

Nghiên cứu này có nhiều ứng dụng thực tiễn, từ việc phát triển các hệ thống hỏi đáp tự động đến việc cải thiện khả năng hiểu ngôn ngữ của các trợ lý ảo. Những đóng góp này giúp thúc đẩy sự phát triển của công nghệ ngôn ngữAI tại Việt Nam.

21/02/2025

Trích đoạn nội dung tài liệu

Chương 1. Đầu tiên, NCS trình bày động lực nghiên cứu của luận án trong Mục 1. Các đóng góp chính trong luận án được NCS mô tả trong Mục 1. Tiếp theo, NCS giới thiệu mục đích, đối tượng va phạm vi nghiên cứu trong Mục 1.3 và ý nghĩa khoa học và thực tiễn của luận án trong Mục 1.

Cuối cùng, NCS giới thiệu tổng quan về bố cục của luận án trong Mục 1. Động lực nghiên cứu Hiểu ngôn ngữ tự nhiên (NLU) đóng vai trò quan trọng trong sự phát triển của trí tuệ nhân tao (AJ), bao gồm nhiều bài toán như suy luận ngôn ngữ tự nhiên, đọc hiểu tự động, hỏi đáp tự động và tóm tắt văn bản. Trong những năm gan đây, một bài toán quan trọng và đầy thách thức là đọc hiéu tự động (MRC) [1], thu hút được sự quan tâm lớn của cộng đồng nghiên cứu xử lý ngôn ngữ tự nhiên (NLP). Luận án này giải quyết bài toán trọng tâm hiểu ngôn ngữ tự nhiên là đọc hiéu tự động trong văn bản tiếng Việt (Hình 1.

Cụ thể, NCS tập trung vào các văn bản tiếng Việt (một ngôn ngữ có ít tài nguyên cho phát triển và đánh giá các mô hình trong xử lý ngôn ngữ tự nhiên [2, 3]), là nhiệm vụ huấn luyện cho máy tính có thé đọc hiểu một văn bản và sau đó trả lời các câu hỏi liên quan hoàn toàn bằng ngôn ngữ tự nhiên. Bài toán đọc hiểu tự động tiếng Việt quan trọng vì một số lý do chính: (1) đọc hiểu tự động giúp cộng đồng nghiên cứu đánh giá được quá trình phát triển của hiểu ngôn ngữ tự nhiên (NLU) trong tiếng Việt; (2) phát triển và ứng dụng các mô hình đọc hiểu tự động vào các ứng dụng thực tế như hỏi đáp tự động (Question Answering), công cụ tìm kiếm (Search Engine) và trợ lý ảo (Virtual Assistant) trong tiếng Việt; và (3) đặc biệt, tiếng Việt là ngôn ngữ ít tài nguyên (ngôn ngữ có ít các bộ dữ liệu có kích thước lớn và chất lượng được công bé rộng rãi và phục vụ cho nghiên cứu) cần được khám phá và nghiên cứu trong NLP nhiều hơn. Đọc hiểu tự động trong trí tuệ nhân tạo. Trong hơn một thập kỷ qua, đọc hiểu tự động đã có nhiều bước tiễn trong việc xây dựng các bộ ngữ liệu có kích thước lớn, chất lượng cao và cũng như các nghiên cứu về các mô hình dựa trên các thuật toán học sâu và các MHNN.

Trọng tâm của luận án này là nghiên cứu đọc hiểu tự động tiếng Việt. Cụ thể, NCS tập trung đề xuất các bộ ngữ liệu và các mô hình MRC tiếng Việt. Về phát triển các bộ ngữ liệu, NCS đề xuất các bộ ngữ liệu đọc hiểu tự động tiếng Việt: miền mở (các văn bản trên Wikipedia) và miền đóng (các văn bản tin tức về sức khỏe). Về nghiên cứu các mô hình, NCS đề xuất và thử nghiệm các phương pháp đọc hiểu tự động và hỏi đáp tự động tiếng Việt.

Đọc hiểu tự động [4], hay khả năng đọc văn bản và sau đó hiểu dé tra lời các câu hỏi liên quan đến văn bản, là một nhiệm vụ day thách thức đối với máy tính, yêu cầu cả hiểu ngôn ngữ tự nhiên và tri thức về thế giới. Đọc hiểu tự động có quá trình phát triển lâu dài từ đầu những năm 1970. Cụ thể, Charniak và cộng sự (1972) [5] đã đề xuất một mô hình cơ ban dé trả lời các câu hỏi liên quan về các mau chuyện dành cho trẻ. Lehnert và cộng sự (1977) [6] đánh giá việc hiểu ngôn ngữ tự nhiên thông qua việc trả lời các câu hỏi liên quan đến các văn bản.

Tuy nhiên, do tính chất phức tạp và đầy thách thức, các nghiên cứu về đọc hiểu tự động bị hạn chế và chủ yếu dựa trên các quy tắc được xây dựng một cách thủ công [5, 7]. Cho đến năm 2013, Richardson và cộng sự (2013) [8] đã định nghĩa bài toán đọc hiểu tự động dưới dạng nhiệm vụ học máy giám sát đầu tiên thay vì dựa trên các quy tắc thủ công, mở ra một hướng tiếp cận mới và ảnh hưởng đến các nghiên cứu đọc hiểu tự động cho đến nay. Đặc biệt, đọc hiểu tự động đã phát triển rất nhanh chóng trên các bộ ngữ liệu và các mô hình học máy từ sau khi bộ ngữ liệu nỗi tiếng SQUAD có kích thước lớn và chất lượng được đề xuất bởi Rajpurkar và cộng sự (2016) [4]. Bộ ngữ liệu SQuAD đã tạo cảm hứng cho NCS trong việc phát triển và xây dựng ngữ liệu đọc hiểu tự 2 động tiếng Việt cho các nghiên cứu trong đề tài luận án.

Những thành công của các mô hình MRC trong hơn một thập kỷ qua là do sự phát triển rất nhanh của nhiều bộ ngữ liệu kích thước lớn, chất lượng cao và cũng như sự phát triển nhanh của các phương pháp học máy dựa trên các kiến trúc học sâu và kiến trúc Transformer. Thêm vào đó, đọc hiểu tự động là thành phần cốt lõi của các mô hình hỏi đáp hiện đại, mở ra hướng tiếp cận mới của hỏi đáp tự động trong hơn một thập kỷ qua. Cụ thể, Chen và cộng sự (2017) [9] đã đề xuất DrQA, mô hình QA gồm hai thành phan chính: mô hình truy xuất văn bản (Retriever) và mô hình đọc hiểu (Reader) (xem Hình 1. Từ đó, nhiều CTNC hỏi đáp dựa trên các mô hình của đọc hiểu tự động được khám phá và phát triển như BERTserini [10] và ORQA [11].

ZG—— _ Câu hỏi: Tha tướng đầu tiên Mô hình QA Câu trả lời: của Việt Nam là ai? Nguồn tri thức Retriever-Reader Pham Văn Đồng Hình 1. Hệ thống hỏi đáp dựa trên mô hình đọc hiểu. Trong luận án này, NCS tập trung (1) nghiên cứu và xây dựng các bộ ngữ liệu phục vụ cho nghiên cứu đọc hiểu và hỏi đáp tự động cho ngữ liệu tiếng Việt; (2) các mô hình MRC dựa trên các MHNN, cụ thê nghiên cứu xây dựng các thành phần chính của các mô hình đọc hiểu tự động tiếng Việt; (3) áp dụng mô hình đọc hiểu có độ chính xác cao như một công nghệ nền tảng cốt lõi vào các ứng dụng hỗ trợ tìm kiếm thông tin như mô hình hỏi dap tự động. Đọc hiểu tự động đã được áp dụng trong nhiều ứng dụng thực tế.

Ví dụ, ngày nay chúng ra có thê nhập vào một câu truy vấn trên Google “Có bao nhiêu sinh viên tại Đại học Quốc gia TP.3), Google không những trả về danh sách các siêu văn bản có thê chứa câu trả lời mà còn trả về những câu trả lời chính xác được In đậm và hiển thị lên đầu của danh sách các kết quả tìm kiếm. Đọc hiểu tự động có thể hỗ trợ các mô hình tìm kiếm thông tin ngày càng thông minh hon bằng cách làm nổi bật kết quả cụ thé. Đặc biệt, các mô hình MRC có thé thúc đây sự phát triển khả năng đọc hiểu văn bản của các trợ lý ảo như Alexa của Amazon, Siri của Apple, Google Assistant của Google va Cortana của Microsoft. Luận án này thực hiện theo hai định hướng nghiên cứu chính: (1) 3 xây dựng ngữ liệu dé đánh giá các mô hình đọc hiểu và hỏi đáp tự động tiếng Việt và (2) đề xuất các mô hình đọc hiểu và hỏi đáp tự động tiếng Việt.

Có bao nhiêu sinh viên tại ĐHQG TP.CM? xẻ m ea OTấtcả ƒ8Tintức (g]Hinhảnh [Video [Sách : Thêm Công cụ Khoảng 11.000 kết quả (O,43 giây) Hiện nay, quy mô đào tạo chính quy (bao gồm các chương trình đại học và sau đại học) của Đại học Quốc gia Thành phố Hồ Chí Minh là hơn 76.000 sinh viên chính quy (trong đó có hơn 8.000 học viên cao học và nghiên cứu sinh) với: 1ó5 ngành đào tạo bậc đại học. Wikipedia Ww https://vi.org › wiki» Đại học Quốc gia Thà. ‡ Đại học Quốc gia Thành phố Hồ Chí Minh — Wikipedia tiếng Việt Hình 1. Một kết quả tim kiếm trên công cu tim kiếm Google (thời gian truy cập: ngày 28/11/2023).

Cac đóng góp chính Đề giải quyết các thách thức trong nghiên cứu đọc hiéu tự động cho văn bản tiếng Việt, luận án có ba nội dung đóng góp chính: «_ Nội dung thứ nhất - Xây dựng ngữ liệu và đánh giá các mô hình đọc hiểu cho văn bản tiếng Việt: Trong Nội dung thứ nhất, luận án tập trung vào xây dựng các bộ ngữ liệu cho tiếng Việt (Tiếng Việt là một ngôn ngữ có ít các ngữ liệu cho việc phát triển và đánh giá các thuật toán học máy trong AI và NLP). Cụ thể, NCS đã nghiên cứu và xây dựng các bộ ngữ liệu tiếng Việt: UIT-ViQuAD (phiên bản 1.0 và phiên bản 2.0), UIT- ViNewsQA và UIT-ViWikiQA nhằm thúc đây phát triển và đánh giá các mô hình MRC dựa trên các kiến trúc học sâu và các MHNN. Các bộ ngữ liệu này đã được trình bày trong Chương 3 và được công bố tai các tạp chí và hội nghị với các công trình: [CT1], [CT4]. «Nội dung thứ hai - Đề xuất mô hình đọc hiểu tiếng Việt tích hợp MHNN với truy xuất minh chứng: Trong Nội dung thứ hai, kế thừa từ các kết quả thử nghiệm đầu tiên đã đạt được trên các bộ ngữ liệu trong Nội dung thứ nhất, luận án xây dựng, thiết kế và triển khai các phương pháp đọc hiểu tự động sử dụng các MHNN dựa trên kiến trúc Transformer và truy xuất minh chứng, với mô hình được đề xuất là ViReader.

Thêm vào đó, NCS nghiên cứu và mở rộng đánh giá, so sánh với các mô hình đọc hiểu tiên tiến khác dé hiểu hơn về mô hình đọc hiểu ViReader trên nhiều bộ ngữ liệu khác nhau. Mô hình đọc hiểu đề xuất ViReader hiệu quả không những trong tiếng Việt mà còn trên cả văn bản tiếng Anh và tiếng Trung. Bên cạnh đó, mô hình ViReader+ được đánh giá mở rộng với truy xuất minh chứng học có giám sát. Các khám phá này đã được trình bày trong Chương 4 và một phần trong Chương 5.

Các đóng góp nghiên cứu về ViReader và ViReader+ được công bố tại các tạp chí với các công trình: [CT2] và [CT3]. « Nôi dung thứ ba - Xây dựng phương pháp hỏi đáp tiếng Việt tích hợp đọc hiểu tự động: Trong Nội dung thứ ba, kế thừa từ các kết quả thử nghiệm đầu tiên đã đạt được trên các bộ ngữ liệu trong Nội dung thứ nhất, luận án xây dựng, thiết kế và triển khai mô hình hỏi đáp dựa trên những đóng góp nghiên cứu của mô hình đọc hiểu ViReader (trong Nội dung thứ hai) dé đề xuất các mô hình QA tiếng Việt: XLMRQA và ViQAS. Các khám phá này đã được trình bày trong Chương 5. Các đóng góp nghiên cứu về XLMRQA và VIQAS được công bồ tại các tạp chí và hội nghị với các công trình: [CT3] và [CT7].

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Nghiên cứu xây dựng mô hình đọc hiểu tự động cho văn bản tiếng Việt trong khoa học máy tính là một tài liệu chuyên sâu tập trung vào việc phát triển các mô hình AI có khả năng đọc và hiểu văn bản tiếng Việt, đặc biệt trong lĩnh vực khoa học máy tính. Nghiên cứu này không chỉ giúp cải thiện khả năng xử lý ngôn ngữ tự nhiên (NLP) mà còn mở ra nhiều ứng dụng thực tiễn như phân tích văn bản, trích xuất thông tin, và hỗ trợ các hệ thống chatbot thông minh. Đây là bước tiến quan trọng trong việc áp dụng AI vào các bài toán liên quan đến ngôn ngữ tiếng Việt, mang lại lợi ích lớn cho cả nghiên cứu và ứng dụng thực tế.

Để hiểu rõ hơn về các phương pháp học sâu trong xử lý ngôn ngữ tiếng Việt, bạn có thể tham khảo Luận văn thạc sĩ khoa học máy tính ứng dụng học sâu vào xây dựng mô hình rút trích thông tin. Ngoài ra, nghiên cứu về trích xuất thông tin thực thể và quan hệ trong văn bản tiếng Việt bằng mô hình đồ thị động cũng cung cấp những góc nhìn sâu sắc về cách thức xử lý văn bản phức tạp. Cuối cùng, phát triển chatbot trên nền tảng transformers là một ứng dụng thực tế khác giúp bạn hiểu rõ hơn về tiềm năng của các mô hình đọc hiểu tự động.