Đặt vấn đề Trong bối cảnh nền công nghiệp 4.0 phát triển mạnh mẽ, việc ứng dụng Trí tuệ nhân tạo đã và đang có mặt tại hầu hết các lĩnh vực kinh tế và đời sống. Một trong những nhiệm vụ đã và đang được cộng đồng Xử lý ngôn ngữ tự nhiên quan tâm đến trong những năm gần đây là các bài toán hỏi — đáp. Việc nghiên cứu, phát triển bài toán hỏi — đáp có vai trò, ý nghĩa rat lớn trong cuộc sống hàng ngày của con người. Khi hỏi — đáp được áp dụng trên các văn bản, việc hỏi — đáp còn giúp cho người đọc tóm tat được thông tin, trích xuất được các thông tin chính của văn bản mà không cần phải đọc quá kỹ về các thông tin bên lề xuất hiện trong văn bản.
Hiểu được ý nghĩa to lớn đó, nhiều công trình nghiên cứu việc tự động hỏi — đáp dựa trên văn bản cho máy tính đã được cộng đồng công bố. Trong những năm qua, nhiều công trình nghiên cứu cho bài toán hỏi — đáp đã được công bó trên nhiều ngôn ngữ khác nhau, từ những ngôn ngữ nhiều tài nguyên như tiếng Anh đến ngôn ngữ kém tài nguyên hơn như tiếng Việt. Hỏi — đáp luôn mang nhiều ý nghĩa quan trọng, nhưng con người thường quan tâm đến quá trình đáp nhiều hơn so với việc hỏi. Con người có thói quen hỏi về một vấn đề họ quan tâm đến, điều đó giúp họ tập trung hơn vào một vấn đề cụ thể từ việc đáp.
Ngoài ra, việc hỏi còn giúp con người hình dung rõ hơn về một van đề. Khi chưa đọc và tiếp nhận một thông tin mới, việc nhìn vào những câu hỏi được đặt ra xoay quanh vấn đề giúp con người tóm tắt được vấn đề đang được nhắc đến là gì, bối cảnh của thông tin họ đang muốn tiếp nhận ra sao. Hiểu được ý nghĩa của việc này, chúng tôi quyết định đi đến nghiên cứu và xây dựng một bài toán “Tạo sinh tự động câu hỏi tiêng Việt”. Bài toán “Tạo sinh tự động câu hỏi tiếng Việt” thuộc về lĩnh vực Tao sinh ngôn ngữ tu nhiên (Natural Language Generation — NLG), một lĩnh vực rất được cộng đồng NLG quan tâm trong những năm gần đây.
Đã có nhiều công trình nghiên cứu liên quan đến bài toán của chúng tôi được công bồ trên thế giới, tuy nhiên theo sự tìm hiéu của chúng tôi, các nghiên cứu liên quan trên ngôn ngữ kém tài nguyên như tiêng Việt chưa nhận được nhiêu sự quan tâm và có bât kỳ công bô nào cho bài toán này. Vi vậy, chúng tôi tiên phong thực hiện nghiên cứu bài toán “Tao sinh tự động câu hỏi tiêng Việt”, với mục dich mang lại nhiêu tính ứng dụng hơn va phục vụ nhiêu nhu câu trong cuộc sông hiện đại. Bài toán “Tạo sinh tự động câu hỏi tiêng Việt” được tông quát như sau: e Đầu vào: Một đoạn văn ban đi kèm với một câu trả lời liên quan đên nội dung của đoạn văn bản. e Đâu ra: Câu hỏi tương ứng với câu trả lời (dựa trên ngữ cảnh của câu / đoạn văn).
Bên dưới là mau dữ liệu được trích từ bộ dữ liệu UIT-ViNewsQA [5] đã được xây dựng trước đó: Đoạn văn: Trước khi phẫu thuật hôm 10/10, bé đã được các bác sĩ tại Trung tâm Y tế huyện Anh Sơn tiến hành các xét nghiệm cần thiết, nội soi tai mũi họng phát hiện hai đường rò luân nhĩ. Câu hỏi: Phát hiện điều gì khi nội soi tai mũi họng của bệnh nhân? Câu trả lời: Hai đường rò luân nhĩ. Mục tiêu khóa luận Mục tiêu của khóa luận tôt nghiệp là nghiên cứu về bài toán tạo sinh tự động câu hỏi tiêng Việt. Tông quan gôm các mục tiêu chính sau đây: e Dau tiên, chúng tôi nghiên cứu, tiên hành thử nghiệm và đánh giá hiệu quả của các mô hình học sâu Sequence-to-Sequence [1] va mô hình học chuyển tiếp như PhoBERT [3], mT5 [2] trên bộ dữ liệu đã được xây dung từ trước: UIT- ViNewsQA [5] và UIT-ViQuAD [6].
Thứ hai, chúng tôi tién hành thử nghiệm kết hợp, đánh giá các mô hình đã được xây dựng với phương pháp học tăng cường. Cuối cùng, chúng tôi xây dựng, mở rộng ứng dụng của bài toán khi kết hợp với các bài toán hiện đại đã được xây dựng trước đó như Named-Entity Recognition, giúp máy tự xác định thành phần trong văn bản và đặt câu hỏi dựa trên thành phan đã được xác định và ngữ cảnh của thành phan đó. Đôi tượng và phạm vỉ nghiên cứu > Đối tượng: Bài toán tạo sinh tự động câu hỏi tiêng Việt dựa trên văn bản và câu trả lời, sử dụng bộ dữ liệu đã được xây dựng từ trước. > Pham vi: Pham vi nghiên cứu của đề tài tập trung chủ yếu vào việc giúp máy hoc khả năng tao sinh tự động câu hỏi cho văn bản tiêng Việt, được dựa trên hai bộ dữ liệu vê văn bản được xây dựng từ nghiên cứu trước đó trên tiếng Việt là UIT-ViNewsQA và UIT- ViQuAD.
Dé tài của chúng tôi tập trung chủ yêu vào các van đề sau: Nghiên cứu, thực nghiệm và đánh giá các phương pháp học sâu Sequence-to- Sequence và phương pháp học chuyên tiếp mT5, PhoBERT. Nghiên cứu, thực nghiệm và đánh giá việc kết hợp các phương pháp đã xây dựng từ nhiệm vụ trên với phương pháp học tăng cường. Liệu việc kết hợp với phương pháp học tăng cường có giúp cải thiện được hiệu quả của các phương pháp trên độ đo đánh giá hay không? Kết hợp ứng dụng bài toán của chúng tôi với bài toán phổ biến trước đó là Named-Entity Reconnition. Việc kết hợp ứng dụng này giúp chúng tôi trả lời câu hỏi “Liệu mô hình của chúng tôi có khả năng đặt câu hỏi dựa trên thành phần câu do chính máy tính xác định hay không?”.
> Kết quả nghiên cứu Sau khi hoàn thành, nghiên cứu của chúng tôi đạt được các kết quả sau: e Ching tôi tién hanh những nghiên cứu thử nghiệm ban đầu và đạt được kết quả cao nhất trên mô hình PhoBERT trên độ đo đánh giá BLEU [4], sử dụng BLEU-4 là độ đo đánh giá chính, lần lượt là 19.32% trên bộ di liệu UIT- ViNewsQA và 20.21% trên bộ dữ liệu UTT-VIQuAD. Ngoài ra, chúng tôi còn thử nghiệm trên mô hình học sâu Sequence-to-Sequence và mô hình học chuyên tiếp đa ngôn ngữ mT5. Việc thử nghiệm nhiều mô hình khác nhau giúp chúng tôi có cái nhìn và đánh giá khách quan về hiệu suất của các mô hình trên bài toán tạo sinh tự động câu hỏi trên bộ dữ liệu sẵn có. Những kết quả này cũng chính là tiền dé dé các nghiên cứu trong tương lai sử dụng dé so sánh hiệu suất của các mô hình trên nhiệm vụ tương đương.
e Chúng tôi thử nghiệm thành công việc kết hợp các mô hình đã được xây dựng với phương pháp học tăng cường. Việc kết hợp học tăng cường giúp tăng hiệu suất của các phương pháp đã được xây dựng, đạt hiệu suất cao nhất khi kết hợp với mô hình PhoBERT trên độ đo đánh giá BLEU, lần lượt là 19.77% trên bộ dữ liệu UIT-VINewsQA (cao hơn 0.45% so với thử nghiệm trước đó), và 20.43% trên bộ dữ liệu UIT-ViQuAD (cao hơn 0.22% so với thử nghiệm trước đó). Tuy rang hiệu suất khi kết hợp có cao hơn nhưng không quá vượt trội. Việc kết hợp thành công các phương pháp vẫn sẽ là một tiền đề cho những nghiên cứu về sau.
e Ứng dụng thành công API BERT-VN-NER! - nghiên cứu bài toán Named- Entity Recognition sử dụng BERT trên tiếng Việt được xây dựng trước đó. Việc ứng dụng thành công API cho đầu vào của bài toán giúp cho máy tự xác định thành phần sẽ được dùng dé đặt câu hỏi dựa trên ngữ cảnh mà văn bản mang đên, và mô hình đạt hiệu suât cao nhât của chúng tôi đã đặt được câu 1 https://github.com/dat821168/bert_vn_ner hỏi mà không cần đưa câu trả lời liên quan đến văn bản làm đầu vào. Tuy nhiên, ứng dụng chưa đạt được hiệu suất mà chúng tôi mong muốn. e Viết và gửi 01 bài báo khoa học đến hội nghị uy tín trên thế giới - ACIIDS 2022 va đang trong quá trình xét duyệt.
Ngoài ra, bai toán đã được thông qua cho đề tài nghiên cứu khoa học sinh viên 2021 do trường Đại học Công nghệ Thông tin, Đại học Quốc gia thành phó Hồ Chí Minh tô chức. Cấu trúc khóa luận Khóa luận gồm 5 chương với các các nội dung chính sau: > Chương 1: Tổng quan Trong chương này, chúng tôi sẽ trình bày tổng quan về bài toán “Tạo sinh tự động câu hỏi tiếng Việt” trên hai bộ dữ liệu hỏi — đáp về văn bản đã được xây dựng trước đó. > Chương 2: Các công trình nghiên cứu liên quan Chúng tôi giới thiệu các công trình nghiên cứu trên thế giới và trong nước có liên quan đến bài toán tạo sinh tự động câu hỏi tiếng Việt trong chương 2 bao gồm các bộ dữ liệu được sử dụng và các phương pháp thực nghiệm bài toán tạo sinh tự động câu hỏi. > Chương 3: Bộ dữ liệu và các phương pháp thử nghiệm Trong chương 3, chúng tôi trình bày về bộ dữ liệu được sử dụng, phục vụ cho nghiên cứu tạo sinh tự động câu hỏi và khách quan về các phương pháp thử nghiệm, bao gồm phương pháp học sâu và phương pháp học chuyền tiếp.
Ngoài ra, chúng tôi trình bày về việc xây dựng phương pháp học tăng cường, được sử dụng trong việc kết hợp với các phương pháp thử nghiệm đã xây dựng trước đó. > Chương 4: So sánh các phương pháp thử nghiệm Trong chương này, chúng tôi đi đến so sánh, đánh giá các phương pháp thử nghiệm trên độ đo đánh giá nhất định. Chúng tôi đi đến phân tích nguyên nhân dẫn đến các kết quả, sai số. Ngoài ra, chúng tôi đi đến phân tích khả năng tạo câu hỏi của các phương pháp thử nghiệm.
Chương 5: Kết luận va hướng phát triển Trong chương cuối, chúng tôi trình bày các kết quả đã thực hiện và đạt được trong khóa luận tốt nghiệp này, các mặt hạn chế cũng như là các hướng phát triển và mở rộng đề tài trong tương lai. Giới thiệu đề tài Tao sinh văn ban (Text Generation) là một bài toán được cộng đồng Trí tuệ nhân tạo nói chung và cộng đồng Xử lý ngôn ngữ tự nhiên nói riêng quan tâm đến trong những năm gần đây. Một số bài toán điển hình trong lĩnh vực tạo sinh văn bản có thé kế đến bài toán tạo sinh tiếp nối văn bản từ văn bản cho trước, hay đối với bài toán được chúng tôi đi đến nghiên cứu trong khóa luận này là bài toán tạo sinh tự động câu hỏi cho văn bản.