Tổng quan nghiên cứu

Trong kỷ nguyên bùng nổ dữ liệu số, việc truy xuất thông tin chính xác từ các kho tri thức quy mô lớn trở thành thách thức hàng đầu của ngành khoa học máy tính. Mặc dù web ngữ nghĩa toàn cầu đã phát triển mạnh mẽ với hàng tỷ bộ ba dữ liệu (triples) trên hơn 140 ngôn ngữ, phần lớn tài nguyên học thuật và hệ thống hỏi đáp thông minh vẫn tập trung chủ yếu vào tiếng Anh. Việt Nam với dân số hơn 97 triệu người và là ngôn ngữ bản địa phổ biến thứ 17 trên thế giới lại đang đối mặt với tình trạng thiếu hụt nghiêm trọng các đồ thị tri thức chuẩn hóa và bộ dữ liệu đánh giá chất lượng cao. Đặc biệt, trong bối cảnh đại dịch toàn cầu bùng phát giai đoạn 2019 - 2021, nhu cầu tiếp cận thông tin y tế chính xác, tức thời từ ngôn ngữ tự nhiên đặt ra bài toán cấp thiết.

Luận văn tập trung giải quyết bài toán hỏi đáp trên đồ thị tri thức (KGQA - Knowledge Graph Question Answering) chuyên sâu về lĩnh vực dịch tễ COVID-19 với khả năng hỗ trợ song ngữ Anh - Việt. Mục tiêu trọng tâm của nghiên cứu là thiết kế quy trình trích xuất tự động và bán tự động nhằm xây dựng đồ thị tri thức tiếng Việt ViDBpedia với quy mô 2.645.822 bộ ba ngữ nghĩa từ hơn 1.000.000 bài viết bách khoa toàn thư Wikipedia. Đồng thời, nghiên cứu kiến tạo bộ dữ liệu chuẩn đối sánh COVID-KGQA gồm 1.000 cặp câu hỏi - câu trả lời song ngữ đi kèm truy vấn SPARQL chuẩn xác. Đóng góp này giúp nâng cao độ chính xác truy vấn ngữ nghĩa, rút ngắn thời gian phản hồi thông tin y tế và tạo nền tảng vững chắc cho các hệ thống trợ lý ảo phục vụ cộng đồng tại Việt Nam và quốc tế.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng trên nền tảng vững chắc của công nghệ Web ngữ nghĩa (Semantic Web) và các tiêu chuẩn quốc tế do W3C ban hành. Mô hình biểu diễn dữ liệu cốt lõi sử dụng khung miêu tả tài nguyên (RDF 1.1), trong đó tri thức được cấu trúc hóa dưới dạng các bộ ba vị từ bao gồm chủ thể, vị từ và đối tượng. Cấu trúc này cho phép liên kết linh hoạt các thực thể y tế phức tạp thành mạng lưới quan hệ đa chiều.

Bên cạnh đó, ngôn ngữ bản thể học web (OWL 2) đóng vai trò định nghĩa cấu trúc ngữ nghĩa, ràng buộc logic và phân cấp lớp dữ liệu. Hệ thống kế thừa và mở rộng hệ thống phân loại ontology của DBpedia chuẩn với 768 lớp đối tượng và 60.231 vị từ thuộc tính. Để khai thác kho tri thức, nghiên cứu ứng dụng ngôn ngữ truy vấn giao thức SPARQL 1.1, cho phép thực thi các phép toán lọc dữ liệu, nhóm tổng hợp và suy diễn logic phức tạp. Hai trường phái tiếp cận chính của KGQA gồm phân tích ngữ nghĩa (Semantic Parsing) chuyển đổi ngôn ngữ tự nhiên thành biểu diễn logic và truy xuất thông tin (Information Retrieval) dựa trên so khớp đồ thị con được tích hợp để tối ưu hóa hiệu quả giải vấn đề.

Phương pháp nghiên cứu

Nghiên cứu sử dụng phương pháp chọn mẫu phân tầng có chủ đích (stratified purposive sampling) để thiết lập kho ngữ liệu thực nghiệm. Cỡ mẫu đánh giá bao gồm 1.000 câu hỏi song ngữ thuộc bộ dữ liệu COVID-KGQA, được phân chia cân đối theo 3 nhóm cấu trúc ngữ nghĩa chính: truy vấn danh sách (List), truy vấn đếm số lượng (Count), và truy vấn kiểm tra điều kiện logic đúng/sai (Boolean). Nguồn dữ liệu thô phục vụ xây dựng đồ thị tri thức được thu thập toàn diện từ Wikipedia tiếng Việt trong giai đoạn từ tháng 11 năm 2018 đến tháng 11 năm 2021, xử lý thành công hơn 1.000.000 bài viết để trích xuất 2.645.822 bộ ba RDF.

Lý do lựa chọn phương pháp phân tích thực nghiệm so sánh end-to-end là nhằm kiểm chứng khách quan hiệu năng của 4 kiến trúc KGQA tiên tiến nhất hiện nay gồm gAnswer, TeBaQA và QAsparql trên cả 2 ngôn ngữ. Toàn bộ quy trình gán nhãn câu hỏi, sinh mã SPARQL và hiệu chỉnh ngữ pháp được thực hiện nghiêm ngặt qua quy trình 7 bước: sinh câu hỏi, phân loại hình thái, ánh xạ cụm từ, tạo truy vấn mẫu, kiểm tra logic, hiệu chỉnh ngữ cảnh và thẩm định chéo độc lập bởi các chuyên gia ngôn ngữ học.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình thực nghiệm diện rộng trên tập kiểm thử mang lại nhiều phát hiện học thuật quan trọng:

Thứ nhất, việc xây dựng thành công đồ thị tri thức ViDBpedia với 2.645.822 bộ ba tri thức đã lấp đầy khoảng trống dữ liệu ngữ nghĩa tiếng Việt, tích hợp hoàn chỉnh hệ thống thực thể dịch tễ học và thông tin hành chính của 63 tỉnh thành Việt Nam.

Thứ hai, kết quả phân tích cấu trúc ngôn ngữ trên 1.000 câu hỏi của COVID-KGQA cho thấy câu hỏi dạng danh sách chiếm tỷ trọng cao nhất với khoảng 65%, câu hỏi dạng đếm số lượng chiếm 20% và câu hỏi logic Boolean chiếm 15%. Cấu trúc tiền tố câu hỏi trong COVID-KGQA tập trung chủ yếu vào các từ để hỏi như When, Where, What và How many, thể hiện sát thực tế nhu cầu tra cứu y tế của người dùng.

Thứ ba, hiệu năng của các hệ thống KGQA có sự phân hóa rõ rệt giữa hai ngôn ngữ. Điểm số F1-score trung bình của mô hình hàng đầu trên ngữ liệu tiếng Anh đạt từ 68% đến 74%, trong khi trên ngữ liệu tiếng Việt chỉ đạt từ 48% đến 55%, tạo ra mức chênh lệch hiệu năng khoảng 15% đến 22%.

Thứ tư, độ phức tạp của cú pháp câu hỏi ảnh hưởng trực tiếp đến thời gian xử lý. Các truy vấn đơn bước (single-hop) có thời gian phản hồi trung bình chỉ 0,45 giây, trong khi các truy vấn đa bước (multi-hop) đi kèm các toán tử phức tạp như FILTER, ORDER BY, LIMIT hoặc GROUP BY làm tăng thời gian phản hồi lên khoảng 1,85 giây đến 2,40 giây.

Thảo luận kết quả

Khoảng cách hiệu năng giữa tiếng Anh và tiếng Việt bắt nguồn từ hai nguyên nhân kỹ thuật then chốt: sự phức tạp trong việc tách từ ghép và sự thiếu hụt các công cụ liên kết thực thể (Entity Linking) chuyên sâu cho ngôn ngữ tiếng Việt. Trong khi các hệ thống tiếng Anh có thể dễ dàng nhận diện và ánh xạ chính xác các thực thể y tế nhờ các kho dữ liệu bổ trợ khổng lồ, việc ánh xạ từ tự nhiên tiếng Việt sang các URI chuẩn của DBpedia thường gặp sai lệch do hiện tượng đa nghĩa và từ đồng âm.

Khi đối sánh với các bộ dữ liệu generic chuẩn quốc tế như LC-QuAD với 5.000 câu hỏi hay QALD-9 với 408 câu hỏi, bộ dữ liệu COVID-KGQA cho thấy độ đặc thù cao hơn về mặt thuật ngữ chuyên ngành nhưng vẫn đảm bảo tính đa dạng cú pháp. Dữ liệu thực nghiệm có thể được mô hình hóa trực quan thông qua biểu đồ cột so sánh điểm F1-score và biểu đồ đường thể hiện độ trễ thời gian phản hồi giữa các hệ thống. Ngoài ra, việc thiết lập bảng ma trận nhầm lẫn (confusion matrix) chi tiết cho từng loại toán tử SPARQL giúp minh họa rõ ràng các điểm nghẽn kỹ thuật khi mô hình phải xử lý các câu hỏi chứa mệnh đề phủ định hoặc so sánh hơn nhất.

Đề xuất và khuyến nghị

Nhằm tối ưu hóa hiệu quả ứng dụng của đồ thị tri thức và nâng cao độ chính xác của hệ thống hỏi đáp ngữ nghĩa, luận văn đề xuất 4 nhóm giải pháp chiến lược:

Thứ nhất, mở rộng quy mô đồ thị tri thức tiếng Việt. Nhóm nghiên cứu thuộc các viện và trường đại học công nghệ cần chủ động tự động hóa luồng trích xuất dữ liệu từ các nguồn chính thống như Bộ Y tế và Tổ chức Y tế Thế giới, đặt mục tiêu mở rộng ViDBpedia đạt trên 5.000.000 bộ ba tri thức trong vòng 12 tháng tới.

Thứ hai, nâng cấp công cụ liên kết thực thể tiếng Việt. Đội ngũ kỹ sư xử lý ngôn ngữ tự nhiên cần tập trung huấn luyện các mô hình nhận dạng thực thể tên riêng chuyên biệt cho cấu trúc ngữ pháp tiếng Việt, hướng tới mục tiêu gia tăng chỉ số F1-score của hệ thống hỏi đáp tiếng Việt thêm tối thiểu 18% trong thời hạn 6 tháng.

Thứ ba, kết hợp kiến trúc đồ thị tri thức với mô hình ngôn ngữ lớn (LLM-KGQA hybrid framework). Các tổ chức nghiên cứu cần tích hợp khả năng suy diễn của đồ thị tri thức với năng lực sinh ngôn ngữ tự nhiên của các mô hình ngôn ngữ lớn, nhằm giảm tỷ lệ sinh thông tin sai lệch (hallucination) và rút ngắn thời gian xử lý các câu hỏi đa quan hệ xuống dưới mức 0,8 giây trong lộ trình 9 tháng.

Thứ tư, thương mại hóa và ứng dụng đa nền tảng. Doanh nghiệp công nghệ và cơ quan y tế cần đẩy mạnh triển khai hệ thống chatbot hỏi đáp dịch tễ trên nền tảng web và ứng dụng di động, cam kết phục vụ ổn định trên 10.000 lượt truy vấn mỗi ngày trong vòng 3 tháng kể từ khi phát hành.

Đối tượng nên tham khảo luận văn

Luận văn là tài liệu tham khảo học thuật và kỹ thuật giá trị cho 4 nhóm đối tượng trọng tâm:

Thứ nhất, giảng viên, nghiên cứu sinh và sinh viên chuyên ngành Khoa học Máy tính, Hệ thống Thông tin và Xử lý Ngôn ngữ Tự nhiên. Luận văn cung cấp khung phương pháp luận hoàn chỉnh về thiết kế đồ thị tri thức quy mô lớn và xây dựng bộ ngữ liệu đánh giá KGQA song ngữ chuẩn mực.

Thứ hai, kỹ sư dữ liệu và kiến trúc sư hệ thống Web ngữ nghĩa (Semantic Web Engineers). Các chuyên gia có thể trực tiếp ứng dụng quy trình trích xuất tự động từ Wikipedia, các mẫu ánh xạ ontology DBpedia và kỹ thuật tối ưu hóa câu truy vấn SPARQL trên cơ sở dữ liệu hơn 2.600.000 bản ghi.

Thứ ba, chuyên gia y tế công cộng và các nhà phân tích dữ liệu dịch tễ. Tài liệu cung cấp góc nhìn thực tiễn về việc cấu trúc hóa thông tin y tế rời rạc thành mạng lưới tri thức có khả năng truy vấn chính xác, hỗ trợ công tác ra quyết định và phổ biến kiến thức phòng chống dịch bệnh.

Thứ tư, doanh nghiệp phát triển giải pháp trí tuệ nhân tạo, trợ lý ảo và Chatbot thông minh. Luận văn đem lại tài liệu thiết kế hệ thống hỏi đáp tự động có độ tin cậy cao, hạn chế lỗi thông tin nhờ dựa trên nền tảng tri thức có cấu trúc.

Câu hỏi thường gặp

Hỏi đáp trên đồ thị tri thức (KGQA) khác biệt gì so với các công cụ tìm kiếm thông thường? Thay vì chỉ trả về danh sách liên kết tài liệu chứa từ khóa như công cụ tìm kiếm truyền thống, KGQA phân tích sâu ngữ nghĩa câu hỏi, chuyển đổi thành truy vấn logic SPARQL và trích xuất trực tiếp câu trả lời chính xác từ mạng lưới tri thức với độ trễ chỉ khoảng 0,45 giây cho các truy vấn đơn.

Bộ dữ liệu COVID-KGQA được xây dựng như thế nào và có điểm gì nổi bật? COVID-KGQA gồm 1.000 cặp câu hỏi song ngữ Anh - Việt về dịch tễ COVID-19 kèm mã SPARQL chuẩn, được gán nhãn thủ công qua quy trình 7 bước nghiêm ngặt, bao quát đầy đủ 3 nhóm câu hỏi chính là danh sách, đếm số lượng và kiểm tra logic đúng/sai.

Đồ thị tri thức ViDBpedia giải quyết bài toán thiếu hụt dữ liệu tiếng Việt ra sao? ViDBpedia trích xuất tự động và chuẩn hóa hơn 1.000.000 bài viết Wikipedia tiếng Việt thành 2.645.822 bộ ba RDF, liên kết trực tiếp với bản thể học DBpedia quốc tế, tạo ra kho dữ liệu mở quy mô lớn phục vụ cộng đồng nghiên cứu xử lý ngôn ngữ tự nhiên tại Việt Nam.

Tại sao câu hỏi đa bước (multi-hop) lại là thách thức lớn nhất trong KGQA? Câu hỏi đa bước đòi hỏi hệ thống phải liên kết nhiều bộ ba thực thể và áp dụng đồng thời các toán tử phức tạp như FILTER hoặc GROUP BY, dẫn đến không gian tìm kiếm bùng nổ và làm tăng thời gian phản hồi trung bình lên khoảng 1,85 giây.

Hệ thống trong luận văn có thể mở rộng sang các chuyên ngành khác ngoài y tế không? Hoàn toàn khả thi, quy trình trích xuất đồ thị tri thức và đường ống xử lý phân tích ngữ nghĩa được thiết kế tổng quát, cho phép tái áp dụng hiệu quả cho các lĩnh vực như tài chính, luật pháp, giáo dục và thương mại điện tử.

Kết luận

Nghiên cứu đã giải quyết trọn vẹn bài toán xây dựng hệ thống hỏi đáp trên đồ thị tri thức song ngữ phục vụ tra cứu thông tin y tế với các kết quả nổi bật:

  • Kiến tạo thành công ViDBpedia với 2.645.822 bộ ba tri thức, cung cấp hạ tầng dữ liệu ngữ nghĩa tiếng Việt chuẩn hóa đầu tiên tương thích hoàn toàn với chuẩn DBpedia quốc tế.
  • Phát triển bộ dữ liệu chuẩn đối sánh COVID-KGQA gồm 1.000 câu hỏi song ngữ chất lượng cao, phản ánh chính xác cấu trúc ngôn ngữ thực tế và nhu cầu tra cứu dịch tễ.
  • Thực hiện đánh giá thực nghiệm toàn diện trên 4 mô hình KGQA tiên tiến, làm rõ sự chênh lệch hiệu năng 15% đến 22% giữa tiếng Anh và tiếng Việt để chỉ rõ phương hướng cải tiến kỹ thuật.
  • Xây dựng thành công ứng dụng hỏi đáp thực tế hoạt động đa nền tảng, cho phép người dùng truy vấn thông tin y tế nhanh chóng và chuẩn xác.
  • Đề xuất lộ trình công nghệ từ 6 đến 18 tháng kết hợp đồ thị tri thức với mô hình ngôn ngữ lớn nhằm tối ưu hóa độ chính xác và giảm thiểu độ trễ truy vấn.

Đóng góp của luận văn là bước đệm quan trọng thúc đẩy sự phát triển của công nghệ Web ngữ nghĩa và xử lý ngôn ngữ tự nhiên tại Việt Nam. Các nhà nghiên cứu, kỹ sư hệ thống và doanh nghiệp quan tâm có thể khai thác mã nguồn mở, đồ thị tri thức ViDBpedia và bộ ngữ liệu COVID-KGQA để tiếp tục phát triển các thế hệ trợ lý ảo thông minh phục vụ cộng đồng.