CHƯƠNG 1 - TỔNG QUAN VẤN ĐỀ NGHIÊN CỨU 1. Tổng quan về Cổng hỏi đáp trực tuyến Hệ thống hỏi đáp trực tuyến là hệ thống thông tin điện tử để người dân, tổ chức và doanh nghiệp phản ánh thông tin và đặt ra những câu hỏi liên quan đến các vấn đề cần quan tâm. Hệ thống dựa vào thông tin đầu vào là câu hỏi dưới dạng ngôn ngữ tự nhiên của người dùng, trả lại các đoạn văn bản ngắn chứa câu trả lời trực tiếp cho câu hỏi hoặc chứa những thông tin sát với mong muốn của người dùng. Hệ thống Tự động hóa quy trình tiếp nhận câu hỏi dựa vào một số kỹ thuật và các tiêu chí khác nhau, có thể được phân loại như sau: - Phân loại theo miền ứng dụng: Các câu hỏi được phân loại dựa trên miền ứng dụng cụ thể mà hệ thống đang xử lý như: miền như luật pháp, y tế, giáo dục, giao thông.
giúp hệ thống hiểu rõ ngữ cảnh và áp dụng kiến thức chuyên môn liên quan đến miền đó. - Phân loại theo khả năng trả lời mẫu hỏi: dựa trên khả năng có sẵn của hệ thống để trả lời mẫu hỏi. Có thể có các danh sách câu trả lời mẫu hoặc cơ sở dữ liệu kiến thức để hệ thống trả lời những câu hỏi phổ biến một cách tự động. - Phân loại theo mức độ dài, ngắn của đoạn đối thoại giữa người dùng và hệ thống thành các loại ngắn gọn, trung bình hoặc dài để xử lý hiệu quả.
- Phân loại theo hướng tiếp cận: hướng tiếp cận dựa trên quy tắc, hướng tiếp cận thống kê, hướng tiếp cận dựa trên máy học hoặc hướng tiếp cận dựa trên trích xuất thông tin. Những phân loại này giúp xác định và tự động hóa quy trình tiếp nhận câu hỏi một cách hiệu quả, đồng thời cung cấp cho hệ thống khả năng xử lý đa dạng các loại câu hỏi và cung cấp câu trả lời phù hợp cho người dùng. Tỉnh Tây Ninh đã xây dựng hệ thống hỏi đáp trực tuyến từ năm 2016 nhằm giải đáp nhanh chóng, minh bạch các vấn đề mà dư luận quan tâm. Hệ thống này hiện đang hoạt động ở mức hỏi đáp của công dân và chính quyền trả lời, chưa xây dựng 8 được hệ thống tổng hợp, khai thác và sử dụng dữ liệu kiến nghị của công dân phục vụ công tác quản lý nhà nước.1: Hệ thống hỏi đáp trực tuyến của tỉnh Tây Ninh Hệ thống hỏi đáp trực tuyến tỉnh Tây Ninh là kênh thông tin kết nối giữa cơ quan nhà nước với người dân, tổ chức, doanh nghiệp thông qua Internet.
Hệ thống này có các chức năng và nhiệm vụ sau: - Là kênh thông tin để người dân, tổ chức, doanh nghiệp phản ánh thông tin, đặt câu hỏi đến các cơ quan nhà nước. - Là kho dữ liệu thông tin giúp người dân, tổ chức, doanh nghiệp tra cứu những thông tin liên quan đến chủ đề cần quan tâm. - Tiếp nhận thông tin, câu hỏi 24/24 giờ vào tất cả các ngày trong tuần. - Trả lời các câu hỏi của người dân, tổ chức, doanh nghiệp một cách chính xác, kịp thời, đáp ứng nhu cầu của người dân.2: Sơ đồ tổng quát trình tự vận hành của hệ thống hỏi đáp Trình tự vận hành của hệ thống hỏi đáp trực tuyến tỉnh Tây Ninh như sau: 1.
Người dân, tổ chức, doanh nghiệp truy cập vào hệ thống hỏi đáp trực tuyến tỉnh Tây Ninh để phản ánh thông tin, đặt câu hỏi.3: Biểu mẫu nhập câu hỏi của người dân, doanh nghiệp 2. Đơn vị điều phối tiếp nhận thông tin, câu hỏi và chuyển cho đơn vị trả lời.4: Đơn vị điều phối đọc, chọn đơn vị chuyển câu hỏi để trả lời 3. Đơn vị trả lời đánh giá nội dung thông tin, câu hỏi. - Nếu thuộc thẩm quyền, chức năng của đơn vị trả lời thì đơn vị trả lời thực hiện giao bộ phận, phòng, ban, đơn vị thuộc hoặc trực thuộc liên quan xử lý.
- Nếu không thuộc thẩm quyền, chức năng của đơn vị trả lời thì đơn vị trả lời nêu lý do và chuyển trả lại đơn vị điều phối. Bộ phận, phòng, ban, đơn vị thuộc hoặc trực thuộc đơn vị trả lời xem xét nội dung thông tin, câu hỏi để thực hiện việc trả lời. - Nếu chưa đủ dữ kiện thì liên hệ người phản ánh thông tin, đặt câu hỏi để thu thập thêm dữ kiện. - Nếu đã đủ dữ kiện thì thực hiện trả lời trực tiếp trên hệ thống hỏi đáp.
Hệ thống hỏi đáp trực tuyến gửi thông báo kết quả xử lý thông tin, câu hỏi cho người phản ánh thông tin, đặt câu hỏi. Thời gian xử lý thông tin, câu hỏi - Thời gian để đơn vị điều phối xử lý thông tin, câu hỏi là không quá 24 giờ. - Thời gian để đơn vị trả lời đánh giá nội dung thông tin, câu hỏi là không quá 24 giờ. 12 - Thời gian để đơn vị trả lời xử lý thông tin, trả lời câu hỏi là không quá 7 ngày làm việc.
Các công trình nghiên cứu trên thế giới 1. “XLNet: Generalized Autoregressive Pretraining for Language Understanding” - Yang, Z. và đồng nghiên cứu (2019). Bài báo này giới thiệu mô hình XLNet, một mô hình học sâu sử dụng phương pháp huấn luyện tự động.
Mô hình này có khả năng hiểu ngữ nghĩa và mối quan hệ giữa các từ trong câu, từ đó tạo ra câu trả lời chính xác. “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding” - Devlin, J. và đồng nghiên cứu (2018). Tài liệu này giới thiệu mô hình BERT, một mô hình học sâu đã đạt được nhiều thành công trong Hỏi và Đáp.
Nó trình bày cách BERT được huấn luyện trước và áp dụng cho nhiều tác vụ ngôn ngữ tự nhiên, bao gồm cả Hỏi và Đáp. “Attention Is All You Need” - Vaswani, A. và đồng nghiên cứu (2017). Tài liệu này giới thiệu mô hình Transformer, một kiến trúc quan trọng trong Hỏi và Đáp.
Mô hình này sử dụng cơ chế attention để xử lý thông tin từ ngữ cảnh và tạo ra câu trả lời chính xác.0: 100,000+ Questions for Machine Comprehension of Text” - Rajpurkar, P. và đồng nghiên cứu (2018). Tài liệu này là phiên bản mở rộng của tập dữ liệu SQuAD.0 bao gồm cả các câu hỏi mà câu trả lời không có sẵn trong văn bản. Điều này tạo ra thách thức lớn hơn cho các hệ thống trả lời câu hỏi và yêu cầu khả năng suy luận và hiểu biết rộng hơn từ mô hình AI.
“Neural Approaches to Question Answering” - Rajpurkar, P. và đồng nghiên cứu (2016). Bài báo này tập trung vào các phương pháp sử dụng mô hình học sâu trong Hỏi và Đáp. Nó giới thiệu các kiến trúc mạng như LSTM, CNN và các kiến trúc đa nhiệm để xây dựng hệ thống trả lời câu hỏi.
“Deep Learning for Answer Sentence Selection: A Review” - Zhou, M. và 13 đồng nghiên cứu (2018). Tài liệu này tập trung vào bài toán chọn câu trả lời phù hợp trong Hỏi và Đáp. Nó giới thiệu các phương pháp sử dụng học sâu như Convolutional Neural Networks (CNN) và Recurrent Neural Networks (RNN) để giải quyết bài toán này.
“Question Answering Systems: A Survey” - Li, S. và đồng nghiên cứu (2017). Bài báo này tổng hợp các phương pháp và tiến bộ trong lĩnh vực Hỏi và Đáp, từ các kiến trúc truyền thống đến sử dụng học sâu. Nó cung cấp một cái nhìn tổng quan về các công trình nghiên cứu và thách thức trong lĩnh vực này.
“Language Models are Unsupervised Multitask Learners” - Radford, A. và đồng nghiên cứu (2019). Tài liệu này giới thiệu mô hình ngôn ngữ GPT (Generative Pre-trained Transformer). GPT là một mô hình học sâu tự động cải thiện khả năng hiểu ngữ nghĩa và tạo ra câu trả lời tự nhiên thông qua huấn luyện không giám sát trên một lượng lớn dữ liệu.
“The Stanford Question Answering Dataset” - Rajpurkar, P. và đồng nghiên cứu (2016). Tài liệu này giới thiệu tập dữ liệu SQuAD, một tập dữ liệu quan trọng trong lĩnh vực Hỏi và Đáp. SQuAD chứa các cặp câu hỏi và câu trả lời đúng, được thu thập từ các nguồn tin trực tuyến, và được sử dụng rộng rãi trong việc đánh giá và huấn luyện các mô hình trả lời câu hỏi tự động.
“MS MARCO: A Human-Generated MAchine Reading COmprehension Dataset” - Nguyen, T. và đồng nghiên cứu (2016). Tài liệu này giới thiệu tập dữ liệu MS MARCO, một tập dữ liệu được tạo ra bởi con người cho bài toán đọc hiểu máy tính. Nó chứa các cặp câu hỏi và văn bản liên quan, được sử dụng để đào tạo và đánh giá các mô hình trả lời câu hỏi tự động.
Những tài liệu trên cung cấp cái nhìn sâu hơn về các mô hình học sâu, tập dữ liệu và thách thức trong lĩnh vực Hỏi và Đáp từ các kiến trúc truyền thống đến các mô hình học sâu tiên tiến như Transformer, BERT và XLNet… 14 1. Các công trình nghiên cứu trong nước 1. “Xây dựng hệ thống trả lời tự động tiếng Việt dựa trên mô hình BERT” - Trần Văn Hiến, Nguyễn Thị Minh Huyền, Phạm Quỳnh Ngân (2020): Công trình này tập trung xây dựng hệ thống trả lời tự động tiếng Việt sử dụng mô hình BERT. Trình bày cách huấn luyện mô hình và áp dụng cho việc trả lời câu hỏi tiếng Việt.
“Phát triển hệ thống hỏi đáp y tế tự động tiếng Việt” - Đặng Văn Bảo, Lê Thanh Hòa, Nguyễn Quốc Bảo (2018): Công trình này tập trung vào xây dựng hệ thống hỏi đáp y tế tự động sử dụng tiếng Việt. Giới thiệu các phương pháp xử lý ngôn ngữ tự nhiên và mô hình học máy để đưa ra câu trả lời cho các câu hỏi y tế. “Dự đoán trả lời chính xác câu hỏi tự nhiên tiếng Việt bằng phương pháp SVM” - Trần Minh Tâm, Trần Thị Thanh Thảo (2017): Công trình này tập trung vào dự đoán trả lời chính xác cho câu hỏi tự nhiên tiếng Việt bằng cách sử dụng phương pháp máy vector hỗ trợ (SVM). Nó giới thiệu cách tiền xử lý dữ liệu và xây dựng mô hình SVM để phân loại câu hỏi và tìm ra câu trả lời phù hợp.
“Phát triển hệ thống trả lời câu hỏi tự động tiếng Việt dựa trên phương pháp tìm kiếm trích dẫn” - Nguyễn Minh Thành, Nguyễn Huy Hùng, Lê Hồng Phong (2016): Công trình này tập trung vào phát triển hệ thống trả lời câu hỏi tự động tiếng Việt bằng cách sử dụng phương pháp tìm kiếm trích dẫn. Nó giới thiệu cách xây dựng một công cụ tìm kiếm và trích dẫn thông tin từ tài liệu để đưa ra câu trả lời cho các câu hỏi tiếng Việt. “Hệ thống trả lời câu hỏi tự động về lịch sử Việt Nam” - Lê Thị Kim Oanh, Trần Văn Thoại (2015): Công trình này tập trung vào xây dựng hệ thống trả lời câu hỏi tự động về lịch sử Việt Nam.