Luận văn Thạc sĩ: Nghiên cứu và phát triển hệ thống hỏi đáp tiếng Việt

Tải luận văn thạc sĩ nghiên cứu hệ thống hỏi đáp tiếng Việt. Ứng dụng mô hình đọc hiểu MRC, BERT để xây dựng và cải thiện độ chính xác cho NLP.

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

Luận văn thạc sĩ

2022

75
0
0

Phí lưu trữ

30 Point

Tóm tắt

I. Tổng Quan Về Hệ Thống Hỏi Đáp Tiếng Việt

Hệ thống hỏi đáp tiếng Việt là một ứng dụng quan trọng của xử lý ngôn ngữ tự nhiên, được phát triển nhằm cung cấp câu trả lời chính xác cho người dùng. Luận văn này tập trung vào nghiên cứu và phát triển một hệ thống hỏi đáp hiện đại sử dụng công nghệ học sâu và dữ liệu lớn. Trong những năm gần đây, các phương pháp tiếp cận sử dụng học sâu (deep learning) đã giúp hệ thống trở nên linh hoạt và dễ dàng triển khai hơn. Một trong những hướng tiếp cận hiện đại nhất là áp dụng các mô hình đọc hiểu đoạn văn bản (Machine Reading Comprehension - MRC), cho phép hệ thống trả lời các câu hỏi đa dạng và phức tạp hơn. Tuy nhiên, việc ứng dụng với tiếng Việt vẫn còn gặp thách thức do sự thiếu hụt về dữ liệu và công nghệ.

1.1. Định Nghĩa Và Tầm Quan Trọng

Hệ thống hỏi đáp là công nghệ cho phép máy tính hiểu và trả lời các câu hỏi của người dùng một cách tự động. Đây là một lĩnh vực quan trọng trong xử lý ngôn ngữ tự nhiên với nhiều ứng dụng thực tế như trợ lý ảo, chatbot, và công cụ tìm kiếm thông tin. Tầm quan trọng của hệ thống hỏi đáp tiếng Việt nằm ở khả năng giải quyết các bài toán tiếng Việt phức tạp, từ đó nâng cao chất lượng dịch vụ công nghệ cho người dùng Việt Nam.

1.2. Thách Thức Với Tiếng Việt

Khi ứng dụng hệ thống hỏi đáp với tiếng Việt, các nhà nghiên cứu gặp phải nhiều thách thức. Thứ nhất là thiếu bộ dữ liệu chất lượng cao cho tiếng Việt, so với tiếng Anh có sẵn các bộ dữ liệu lớn như SQuAD. Thứ hai, mô hình đọc hiểu đoạn văn (MRC) cần được tối ưu hóa riêng cho đặc thù ngữ pháp và ngữ nghĩa của tiếng Việt. Luận văn hệ thống hỏi đáp tiếng Việt này nhằm khắc phục những vấn đề trên.

II. Phương Pháp Xây Dựng Bộ Dữ Liệu MRC Tiếng Việt

Để giải quyết vấn đề thiếu dữ liệu, luận văn đề xuất xây dựng bộ dữ liệu đọc hiểu đoạn văn bản (MRC dataset) cho tiếng Việt. Bộ dữ liệu ViQuAD-Open được xây dựng thông qua ba bước chính: mở rộng số lượng đoạn văn ngữ cảnh, tách biệt dữ liệu huấn luyện và kiểm thử, và lưu trữ trong cơ sở dữ liệu tập trung. Kết quả cuối cùng cho bộ dữ liệu huấn luyện là 4.957 đoạn văn, và bộ kiểm thử đánh giá có 5.109 đoạn văn. Phương pháp này cho phép mô hình học được từ một lượng dữ liệu đủ lớn, cải thiện độ chính xác của hệ thống hỏi đáp tiếng Việt. Việc xây dựng bộ dữ liệu là nền tảng quan trọng để phát triển các mô hình hiệu quả.

2.1. Quá Trình Xây Dựng ViQuAD Open

ViQuAD-Open được xây dựng bằng cách mở rộng từ một đoạn văn ngữ cảnh lên 15 đoạn văn cho mỗi câu hỏi trong quá trình huấn luyện. Điều này cho phép mô hình học được cách tìm kiếm đoạn văn chứa câu trả lời từ một tập hợp lớn. Tất cả đoạn văn trong tập đánh giá và kiểm thử được tách riêng để đảm bảo tính độc lập của dữ liệu. Bộ dữ liệu này là công cụ quan trọng cho hệ thống hỏi đáp tiếng Việt hiện đại.

2.2. Kích Thước Và Cấu Trúc Dữ Liệu

Bộ dữ liệu MRC gồm hai phần chính: tập huấn luyện với 4.957 đoạn văn và tập kiểm thử với 5.109 đoạn văn. Mỗi đoạn văn được liên kết với các câu hỏi và câu trả lời tương ứng. Cấu trúc này giúp hệ thống hỏi đáp có thể học được cách ánh xạ các câu hỏi đến đoạn văn phù hợp, nâng cao hiệu suất nhận dạng và trả lời câu hỏi.

III. Kỹ Thuật Cải Tiến UHITran Cho Tiếng Việt

Luận văn đề xuất kỹ thuật cải tiến UHITran bao gồm ba bước chính để nâng cao chất lượng mô hình đọc hiểu (MRC model) cho tiếng Việt. Bước đầu tiên là chuyển đổi dữ liệu từ các bộ dữ liệu MRC tiếng Anh chất lượng cao sang tiếng Việt. Bước thứ hai là thực hiện tiền huấn luyện (pre-training) mô hình với các dữ liệu đã chuyển đổi. Bước cuối cùng là tinh chỉnh (fine-tuning) mô hình với bộ dữ liệu MRC tiếng Việt nhỏ hơn. Kết quả đạt được là bộ dữ liệu với khoảng 40 nghìn cặp câu hỏi-câu trả lời dành cho tiếng Việt. Phương pháp UHITran này đã chứng minh tính hiệu quả trong việc cải thiện hiệu suất hệ thống hỏi đáp tiếng Việt.

3.1. Chuyển Đổi Dữ Liệu Và Tiền Huấn Luyện

Chuyển đổi dữ liệu từ tiếng Anh sang tiếng Việt là bước quan trọng của phương pháp UHITran. Kỹ thuật này sử dụng dịch máy để chuyển đổi các bộ dữ liệu SQuAD tiếng Anh sang tiếng Việt. Tiếp theo, tiền huấn luyện mô hình với dữ liệu đã chuyển đổi giúp mô hình học được các đặc trưng ngôn ngữ chung. Phương pháp này cho phép hệ thống hỏi đáp tận dụng kiến thức từ dữ liệu tiếng Anh phong phú.

3.2. Giảm Độ Dài Ngữ Cảnh Dựa Trên Vị Trí

Một đóng góp quan trọng của UHITran là kỹ thuật giảm độ dài ngữ cảnh dựa trên vị trí câu trả lời. Điều này giúp mô hình tập trung vào những phần đoạn văn liên quan nhất. Kết hợp với kiến trúc BERT cải tiến, kỹ thuật này giúp tăng độ chính xác và giảm thời gian xử lý của hệ thống hỏi đáp tiếng Việt, đặc biệt khi xử lý các đoạn văn dài.

IV. Ứng Dụng Thực Tiễn Của Hệ Thống Hỏi Đáp Tiếng Việt

Hệ thống hỏi đáp tiếng Việt được xây dựng từ những nghiên cứu nêu trên có nhiều ứng dụng thực tiễn quan trọng. Hệ thống có thể được tích hợp vào các nền tảng tìm kiếm thông tin, trợ lý ảo, chatbot dịch vụ khách hàng, và các công cụ hỗ trợ giáo dục. Độ chính xác cao của mô hình MRC cho phép hệ thống trả lời các câu hỏi phức tạp từ người dùng một cách nhanh chóng. Bộ dữ liệu ViQuAD-Openkỹ thuật UHITran mở ra cơ hội phát triển các ứng dụng tiếng Việt tiên tiến. Luận văn hệ thống hỏi đáp tiếng Việt này đóng góp đáng kể vào sự phát triển của công nghệ xử lý ngôn ngữ tự nhiên cho tiếng Việt, giúp thu hẹp khoảng cách về công nghệ giữa tiếng Việt và các ngôn ngữ lớn khác.

4.1. Các Lĩnh Vực Ứng Dụng Chính

Hệ thống hỏi đáp tiếng Việt có thể áp dụng trong nhiều lĩnh vực: công cụ tìm kiếm (search engine), trợ lý ảo (virtual assistant), chatbot chăm sóc khách hàng, hệ thống e-learning, và các ứng dụng trí tuệ nhân tạo khác. Mỗi lĩnh vực có nhu cầu cụ thể, nhưng chúng đều hưởng lợi từ khả năng hiểu và trả lời câu hỏi chính xác của hệ thống. Luận văn này cung cấp nền tảng vững chắc để phát triển những ứng dụng này.

4.2. Hướng Phát Triển Tương Lai

Trong tương lai, hệ thống hỏi đáp tiếng Việt có thể được cải thiện thêm bằng cách mở rộng bộ dữ liệu, áp dụng các kiến trúc mô hình tiên tiến hơn như Transformer mới nhất, và tích hợp các kỹ thuật xử lý ngôn ngữ nâng cao. Luận văn này là bước đệm quan trọng cho các nghiên cứu và phát triển tiếp theo, giúp nâng cao khả năng của công nghệ tiếng Việt trên toàn cầu.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI. Nếu bạn thấy nội dung không chính xác hoặc có vấn đề, vui lòng Báo lỗi nội dung.

28/12/2025
Luận văn nghiên cứu và phát triển hệ thống hỏi đáp tiếng việt

Trích đoạn nội dung tài liệu

'TRƯỜNG ĐẠI HỌC BÁCTI KHIOA HÀ NỘI LUẬN VAN TỎT NGHIỆP Nghiên cứu và phát triển hệ thống hỏi đáp tiếng Việt NGUYEN HOANG TIEN BACH bach.vn Ngành: Công nghệ thông tin Giảng viên hướng dẫn: TS. Nguyễn Thị Thu Trang Chữ ký GVHD Trường: Công nghệ thông tin và Truyền thông THA NỘI, 09/2022 CÔNG HÓA XÃ HỘI CHỦ NGHĨA VIỆT NAM Đặc lập — Tự do — Hạnh phúc BẢN XÁC NHẬN CHỈNH SỬA LUẬN VĂN THẠC SĨ Ho va tên tắc giã luận văn : Xguyễn Hoàng Tiên Bach Dé tai luận văn: Nghiễn cửu và phát triển hệ thông hỏi đáp tiếng Việt Chuyên ngành: Công nghệ thông tin Ma sé $V; 20202149M 'Tác giả, Người hướng dẫn khoa học và liệi đồng châm luận văn xác nhận. tác giả đã sứa chữa, bổ sung luận vẫn theo biên bán hợp Hội dồng ngày 29/10/2022 với các nội dụng sau str 'Yêu cầu chỉnh sửa Giải trình ‘trang 1 | Phân tổng quanva lý thuyết hệ thông | Dã bỗ sung làm rõ lý thuyết | 1-2 thối đắp cân làm rõ nội dụng của luận | của hệ thông hỏi đáp và nội văn tránh nhầm lấn cho người đọc — | dưng của luận văn 2 | Gadi thichrõ về mô hình BERT, thay | Đã thay thể từ và bô sung chỉ | 21-36 thể từ “giải pháp” thành “câi tiến kỹ | tiết về mô hinh mang BERT. Thuật” 3 | Chỉ rõ mục tiêu, chất lượng và quy | Đã bỗ sưng thông tin dánh | 49-50 mô của bộ dữ liệu ViQuAD-Open | giá bộ dữ liệu được xây dựng được xây dựng 4 | Chỉnh sửa tài liệu và đường dẫn tam | Đã chính sửa đường đẩn và | 1-65 khảo đúng định dạng tài liệu tham khảo.

Ngày tháng l1 năm2022 lên hướng dẫn Tác giả luận văn CHỦ TỊCH HỌI ĐỒNG LOI CAM DOAN Tôi xin cam đoan các nội dung trong luận văn với để tài “Nghiên cứu và phát triển hệ thông hôi đúp tiếng ViệP' là công trình nghiền cửu độc lập của bản thân dưới sự hưởng dẫn cúa TS. Nguyễn Thị Thu Trang. Cúc số liệu, hình ảnh, trích din có nguồn gốc rõ ràng và tuân thú nguyên tắc. Luận văn không có sự sao chép từ cáo công trình, nghiên cửu của người kháo mả không ghủ rõ trong mnụe tải liệu tham kháo.

Mợi sao chép không hợp lệ, vi phạm quy chế hay gian trả tôi xin hoàn toàn chịu trách nhiệm. Hà Nội, ngay 29 thảng 10 năm 2022 Học Viên Nguyễn Hoàng Tiên Bách TÓM TAT NOI DUN Hệ thông hỏi đáp là một trong những ứng dụng quan trọng của Xử lý ngôn ng? tự nhiên, được sử dựng với mục đích đưa ra câu trả lời clủnh xác cho người dùng. Nhiing nam gan đây, việc sử dụng cáo phương pháp tiếp cân sử dung học sâu bộ đữ liệu lớn đã giúp hệ thông hỏi đáp trở nên lĩnh hoạt và để đảng niển khai hơn Trong đỏ, một trong những hướng tiếp cần hiện đại lá áp dụng các mô hình đọc Hiểu đoạn văn bản (Machine Rosđing Comprchonsiơn ~ MRC), giúp hệ thông có thể trả lời các cầu hỏi đa đạng và phức tạp hơn. Việc áp dụng này đã đem lại những, kết quả lốt, n cận hiện năng cửa cơn người trên c bộ đữ Hận tiếng Anh Tuy nhiên, khi ứng dụng với những ngôn ngữ ít phố buển như tiếng Việt, việc áp dụng xô hình đọc hiểu nhiều đoạn văn để xây đựng hệ thông hỏi đáp còn chưa phái triển do sự thiểu hụt về mặt dữ liệu.

Để khắc phục các vẫn đẻ trên, luận văn để xuất phương pháp gồm ba phan: (i) xây đựng mở rộng bộ đữ liệu cho bài toän đọ hiểu nhiều đoạn văn bản Hồng Việt, Gi) để xuất kỹ thuật cái tiền chuyển đổi đứ liệu và học tỉnh chính để cải thiên đo chính xác chờ mô hình đọc hiểu với tiếng Việt, G7) cuỗi cùng là xây đựng hệ thông hỏi đắp đựa trên đọc hiển kết hợp hai đề xmắt trên. Bộ đữ Hêu đọc hiểu nhiều đoạn văn bản được xây dựng nhằm mục địch huấn luyện mô hình tìm ra được đoạn văn chửa cầu trả lời trong một cơ sở đữ liệu gồm nhiền đoạn văn có sẵn. Việc xây đmg bộ đữ liên bao gồm việc mở rộng sö lượng. các đoạn văn ngữ cảnh cho một câu hỏi từ một doan vẫn lên thành 15 đoạn văn.

ngữữ cảnh trong quá trinh huân luyện, vá tách toan bộ các đoạn văn trong tập đánh giá và kiểm thử ra khỏi các câu hối và lưu vào muội cơ sở đữ liệu chung. Kết quả thu được số lượng đoạn văn khi huấn luyện của bộ đũ liệu mới là 4.957 đoạn văn và số lượng doạn vẫn bản duợc lưu trữ trong cơ sở dữ liệu khi kiểm thử đánh giá là 5,109 đoạn van. Với để xuất thứ hai là một kỹ thuật cải tiễn chuyển đổi đữ liệu sang tiếng Việt từ các tập dữ liên MRC tiếng Anh, sau đó huấn luyện trnh chính đề cái thiện đỏ chỉnh xác của Tỉnh. Kỹ th để xuất được gợi là UHÍTran bao gồm bá bude: (i) chuyển đổi các tập dữ liệu chát lượng cao của bài loán MRC tiếng Anh sang tiếng Việt, đ) tiễn huần luyện (pre-train) mộ hình MRC với các tập đũ liêu MRC đã chuyển đối, Gi) luắn luyện tỉnh chỉnh (ñnetune) mỏ hình MRC véi tập đữ liệu MIšC nhỏ của tiếng Việt.

Kắt quá thu được là bổn tập ngũ liên khác nhau với kích. thước unỗi tập khoáng 40 nghìn cập cầu hỏi - cảu trả lời dành cho tiếng Việt. Kết quá thử nghiệm trần tập đữ liệu LIIT-ViQuAD, việc sử dụng cái tiễn UtiTran có kỹ thuật giảm độ đái trung bình ngữ cảnh dựa hên vị trí cầu trả lời khi thực hiện chuyển đổi dữ liêu kết hợp cùng việc sử dụng mnỏ hình học sâu với kiến trúc dựa iv LỜI CẮM ƠN Lời đầu tiên em xin chân thành được gửi lời cảm ơn sâu sắc nhất tới cô'TS. ‘Thi Thu Trang, cô giáo đã hướng dẫn em trong toàn bộ quá trình hoàn thành luận văn thạc sĩ.

Trong quá trình nghiên cứu, đã rất nhiều lần em cảm thấy bể tắc khi kết quả không như mong đợi, cảm ơn cô đã giúp em nhún rộng vẫn đẻ hơn th đó tim 1a hướng giải quyết, Cám ơn cô đã giúp em tiếp cận được với những kiến thức giúp ích rắt nhiều vào định hướng cửa cin lrơng tương lai. Với cũn, cô luôn lò một hinh mẫn đễ em học tập trong cả sư nghiệp lần cuộc sống. Em xim cảm ơn cô đã tún tưởng dễ cúi có thể hoàn thiện được hướng nghiên cứu rong luận vẫn này. Em xin cảm ơn các thây cò của Trường Công nghệ thông tin và Truyền thông, dai học Bach khoa lIa Nội.

Cảm on cdc thay cô đã dạy em các kiến thức bố ích và chia. sẻ kinh nghiệm từ đó grủp em nấm vững hơn về mặt chuyên môn vả có các kiến thức để phát triển bản thân trong tương lai “Tiếp thao, xin cảm ơn đến em Nguyễn Mạnh Dứng và em Nguyễn Thị Mừng, đã đẳng hành củng nghiên cứu với anh trong suốt gân 2 nằm qua. Các em như là những người bạn đảng tin cậy và vất tài giỏi đối giúp đỡ anh hoàn thành luận thạc sĩ này. Chúc các era hoàn thành các mục tiêu sắp tới của bản thân và thành cong trong tương lai Và lởi cảm ơn thân thiết nhảt cm xin đành đến bà ngoại, bỗ và mẹ cán, côn cảm ơn cả nhà vẫn luôn khỏe mạnh và lả chỗ đựa vững chắc để con có thể hoàn thành các ae liêu trong sự nghiệp.

Cudi cing, xin gửi lời cảm em nhiền cảm xúc nhát tới người bạn suốt đời của anh, cám ơn em đã luôn ở bên anh chia sẻ và cỗ vũ đã anh có thêm động lực để vượi qua các thử thách trong cuộc sống, DANH MỤC HiNH VE Hình 1.1 Thắng kê số lượng các bài báo về hỏi đáp tại ACL 2 Tink 1.2 Vi du vé bai toan héi dap dum trên đọc hiểu 3 Hình 1 3 Một số ứng dụng của bái toán hỏi đáp dựa trên đọc hiểu [12].1 Mồ tả nơ-ron cúa con người. seo TÔ Linh 2 2 Vi du vé mang no-ron.3 Mô là mạng nơ-rơn hồi quy RNN: 12 Hinh 2.4 Kiến trúc cúa bộ mã hẻa - giải m.5 Mô tả cơ chễ chủý cơ bản 13 Trình 2.6 Mô là khối tự chủy (SeH-attention) 14 Hình 2.7 Mồ tả lớp Muli-head atenlien.csseeesersosee TẾ Hình 2.8 Kiển trúc cửa mô hinh CBOW va Skip-gram.9 Cầu túc mô hình E1.10 Mé hinh Transformer.sscseeseseiseeesesncnsnciesienenecmsies 2 1lình2 11 Mô hình mạng BEIFT-base 2 Hình 3.1 Mô tả đâu vào cho mô lủnh XI.2 Các bước xây dựng mô hình cơ sở cho bải toán MRC. 24 Hình 3 3 Kỹ thuật cải tiên LTran đề xuất 28 Tình 3.4 Các bute chuyén doi dit Hu.5 Định đạng đữ liệu SQuAD 1L1.6 Giái pháp sứ dụng hai token xác định vị trí câu trả lời sau dich.1 Mô hình để xuất cho bài toán Hỏi đáp dựa trên MRC 40 Hình 4.2 Kiến trúc tổng quan của hệ thông hỏi đáp 41 Hình 4.3 Ma trận TE-IDF cúa tập dữ hiệu cltung.4 Quả trinh xử lý câu hởi để xấp hạng đoạn văn ban az Tinh 4.5 Cầu trúc đí hiệu cho thành phần chợn Tựa đoạn văn bản 44 Hình 4.6 Trực quan hóa cóc câu được mã hóa bởi SữnCSE-BERT.7 Quá trình xây dựng đữ liều nhiễu vàn bản. 46 Hình 48 Dạng bài loán gốc đọc hiểu nhiều vẫn bản trong bởi bio BERT-RNN AT vill Hinh 4.9 Kién tric mang BERT-RNN o.10 Mé phéng thuat tofn BeamSearch.11 Giao diện máy tính của hệ thông thử nghiệm.12 Giao diện điện thoại cúa hệ thông.13 Giao điện hỏi đáp ngắn gọn.14 Chức năng tiện tr toàn bộ thong tin Hình 4.15 Mứt vài vỉ dụ hối đáp trên hệ thông,.

seo ix theo mé hinh da ngén ngit XLM-R sé dem lại kết quả tốt nhất với B1=88.8% tran tap dit ligu UIT-ViQuaD, cao hon 1% dén 3% khi so sánh với kết quả của các mô hình hiển đại khác. Kết quả này cúa luận văn đã được chấp nhận. và công hỗ tại hội nghị quốc tế TEA/AIE 2022 (Tnternational Conference an Industrial, Enginccring & Other AppRicationsof Applicd Intctligent Systems). Đc biệt khí xây dựng hệ thông hỏi đáp và đảnh giá trên tập đữ liệu vừa được xây dựng UIT-ViQuAD-Open, thí kỹ thuật UtETran cũng đã cái thiền độ chính xác của hệ thông hỏi đáp với kết qua £1 = 65.4%, F1 cao hơn 9,04% so voi kin không sứ dụng kỹ thuật UWTran.

HỌC VIÊN "Ký và ghỉ rõ họ tên Nguyễn LIoàng Tiên Bach TÓM TAT NOI DUN Hệ thông hỏi đáp là một trong những ứng dụng quan trọng của Xử lý ngôn ng? tự nhiên, được sử dựng với mục đích đưa ra câu trả lời clủnh xác cho người dùng.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ