Tổng quan nghiên cứu

Sự bùng nổ của thông tin trực tuyến đặt ra thách thức lớn cho các công nghệ thu nhận và truy xuất dữ liệu tự động. Trong khi các công cụ tìm kiếm thông thường chỉ trả về danh sách tài liệu được xếp hạng buộc người sử dụng phải duyệt qua hàng loạt văn bản, hệ thống Hỏi - Đáp (Question Answering - QA) hướng tới việc cung cấp câu trả lời chính xác bằng kỹ thuật xử lý ngôn ngữ tự nhiên. Thành phần phân tích câu hỏi tự nhiên đóng vai trò là khối chức năng mở đầu trong mọi hệ thống QA, chịu trách nhiệm chuyển đổi câu hỏi tự nhiên thành cấu trúc biểu diễn trung gian phục vụ truy xuất tri thức.

Phần lớn các nghiên cứu công bố trước năm 2011 đều áp dụng phương pháp tiếp cận dựa trên luật (rule-based) để phân tích cú pháp và ngữ nghĩa. Tuy nhiên, việc xây dựng tập luật theo phương thức rời rạc, thủ công (ad-hoc) bộc lộ nhược điểm lớn khi tốn kém chi phí, dễ phát sinh lỗi và gặp khó khăn nghiêm trọng trong việc duy trì tính nhất quán khi quy mô tập luật mở rộng.

Luận văn thạc sĩ chuyên ngành Khoa học máy tính (Mã số: 60 48 01) của tác giả Nguyễn Quốc Đạt, thực hiện tại Trường Đại học Công nghệ – Đại học Quốc gia Hà Nội dưới sự hướng dẫn của Tiến sĩ Phạm Bảo Sơn vào năm 2011, đã giải quyết triệt để nút thắt này. Đề tài tập trung xây dựng phương pháp thu nhận tri thức độc lập ngôn ngữ dựa trên mô hình Quy tắc Ripple Down phân loại đơn (Single Classification Ripple Down Rules - SCRDR). Nghiên cứu chuẩn hóa cấu trúc biểu diễn trung gian dạng bộ 6 phần tử trên nền tảng kiến trúc GATE và văn phạm JAPE, thử nghiệm thành công trên 2 ngôn ngữ là tiếng Việt và tiếng Anh trong phạm vi dữ liệu quản lý đào tạo đại học, tạo tiền đề vững chắc cho các hệ thống QA dựa trên bản thể học (Ontology).

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Khung lý thuyết của luận văn được xây dựng trên 3 trụ cột kỹ thuật chính:

  • Mô hình Quy tắc Ripple Down phân loại đơn (SCRDR): Cấu trúc cây nhị phân gồm 2 nhánh liên kết rời rạc là nhánh ngoại lệ (except) và nhánh điều kiện sai (if-not). Mỗi nút đại diện cho một quy tắc dạng "nếu điều kiện đúng thì kết luận". Quy tắc mới chỉ được thêm vào cây khi kết luận hiện tại sai, gắn trực tiếp vào nút kích hoạt qua liên kết ngoại lệ hoặc liên kết phủ định, giúp kiểm soát xung đột quy tắc mà không ảnh hưởng đến các luật sẵn có.
  • Kiến trúc kỹ nghệ xử lý văn bản GATE và văn phạm JAPE: Hệ thống sử dụng bộ công cụ ANNIE trên GATE để bóc tách các tầng chú thích ngôn ngữ (Token, Sentence, POS tag, Lookup). Văn phạm JAPE (Java Annotation Patterns Engine) đóng vai trò bộ chuyển đổi hữu hạn trên các chú thích, cho phép định nghĩa các biểu thức chính quy phức tạp kết hợp mã Java can thiệp trực tiếp vào dữ liệu chú thích.
  • Mô hình biểu diễn trung gian mở rộng (Intermediate Representation): Cấu trúc trung gian được chuẩn hóa thành bộ 6 phần tử bao gồm: kiểu cấu trúc câu hỏi, phân lớp câu hỏi, khái niệm mục tiêu (Term 1), quan hệ ngữ nghĩa (Relation), thực thể ràng buộc thứ nhất (Term 2) và thực thể ràng buộc thứ hai (Term 3). Mô hình này bao phủ 13 kiểu cấu trúc câu hỏi (như Normal, ThreeTerm, UnknRel, And, Or, Clause) và 10 phân lớp câu hỏi (như List, Entity, ManyClass, HowWhy, YesNo).

Phương pháp nghiên cứu

Nghiên cứu áp dụng quy trình thực nghiệm kết hợp xây dựng hệ thống với các thông số cụ thể:

  • Nguồn dữ liệu và cỡ mẫu nghiên cứu: Bộ ngữ liệu tiếng Việt gồm 400 câu hỏi thuộc miền dữ liệu trường đại học được sinh ra từ tập 115 câu hỏi hạt giống (seed corpus). Để đánh giá độ tin cậy và khả năng bao quát, nghiên cứu sử dụng một tập dữ liệu kiểm thử độc lập gồm 102 câu hỏi hoàn toàn mới (unseen corpus) chưa từng xuất hiện trong quá trình huấn luyện.
  • Phương pháp chọn mẫu: Mẫu câu hỏi được thu thập và phân loại dựa trên tính đa dạng của cấu trúc ngôn ngữ thực tế, trải dài từ câu hỏi đơn giản (câu hỏi xác định thực thể, đếm số lượng) đến các câu hỏi phức hợp chứa mệnh đề quan hệ, liên từ logic và cấu trúc so sánh.
  • Quy trình phân tích dữ liệu: Pipeline xử lý trải qua 3 giai đoạn: tiền xử lý ngôn ngữ tiếng Việt (chuẩn hóa TokenVn và xác định 10 nhóm từ khóa hỏi); phân tích cú pháp nhận diện cụm danh từ qua 8 mẫu từ loại và nhận diện quan hệ qua 4 mẫu JAPE chuyên biệt; cuối cùng là phân tích ngữ nghĩa tự động thông qua cơ chế kích hoạt cây SCRDR để xuất ra bộ biểu diễn trung gian kết nối module truy vấn Ontology. Phương pháp phân tích này được lựa chọn vì tính năng cô lập lỗi vượt trội so với các mô hình ngữ pháp phi ngữ cảnh hay mô hình so khớp mẫu truyền thống.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình thực nghiệm đã chứng minh tính hiệu quả vượt trội của phương pháp tiếp cận SCRDR đối với bài toán phân tích câu hỏi tự nhiên:

  • Quy mô và phân bố cơ sở tri thức SCRDR tiếng Việt: Cơ sở tri thức hoàn chỉnh cho tiếng Việt được xây dựng với tổng cộng 92 luật, phân bổ qua 4 tầng cấu trúc ngoại lệ. Cụ thể, Tầng 1 chứa 26 luật cơ sở; Tầng 2 phát triển 41 luật ngoại lệ (chiếm 44.57% tổng số luật); Tầng 3 bao gồm 20 luật và Tầng 4 có 4 luật ngoại lệ chuyên sâu. Tỷ lệ phân tầng này phản ánh chính xác quy luật hội tụ tri thức ngôn ngữ, trong đó các trường hợp đặc biệt được xử lý triệt để ở tầng sâu.
  • Hiệu năng xử lý trên ngữ liệu kiểm thử độc lập: Đánh giá trên tập 102 câu hỏi kiểm thử mới, mô hình đạt độ chính xác cao trong việc gán nhãn cấu trúc câu và trích xuất đúng các thành phần khái niệm, thực thể và quan hệ ngữ nghĩa.
  • Tối ưu hóa thời gian và công sức xây dựng luật: Tác giả chứng minh rằng thời gian để thêm một luật mới vào cây SCRDR hoàn toàn độc lập với quy mô của 92 luật đã có. Việc bổ sung luật sửa lỗi diễn ra cục bộ tại nút kích hoạt sai, loại bỏ 100% hiện tượng xung đột chéo giữa các quy tắc – nhược điểm cố hữu của các hệ thống ad-hoc trước đây vốn làm tiêu tốn từ 60% đến 70% thời gian cho việc kiểm thử hồi quy.
  • Khả năng thích ứng đa ngôn ngữ: Áp dụng quy trình thu nhận tri thức tương tự cho ngữ liệu tiếng Anh, cơ sở tri thức SCRDR tiếng Anh được thiết lập nhanh chóng với hiệu suất phân tích tương đương, khẳng định tính độc lập ngôn ngữ của phương pháp.

Thảo luận kết quả

Thành công của mô hình bắt nguồn từ cơ chế kiểm soát ngữ cảnh cục bộ của SCRDR. Trong các hệ thống dựa trên luật truyền thống như AquaLog, mỗi khi thêm một luật mới để xử lý câu hỏi lạ, lập trình viên phải rà soát toàn bộ tập luật để tránh việc ghi đè hoặc tạo vòng lặp vô tận. Ngược lại, cấu trúc cây nhị phân SCRDR chỉ cho phép luật mới can thiệp vào duy nhất nhánh đang xảy ra sai sót.

Về mặt trực quan hóa, toàn bộ dữ liệu phân bổ 92 luật theo 4 tầng ngoại lệ có thể được biểu diễn trực quan thông qua biểu đồ cột giảm dần, minh họa rõ nét sự giảm thiểu của các trường hợp ngoại lệ hiếm gặp (từ 41 luật ở tầng 2 xuống còn 4 luật ở tầng 4). Đồng thời, một bảng ma trận nhầm lẫn giữa 13 kiểu cấu trúc câu hỏi sẽ thể hiện chi tiết khả năng nhận dạng chính xác giữa các cấu trúc phức tạp như Normal, ThreeTerm và And.

So với công trình AquaLog của Lopez và cộng sự (2007) chỉ xử lý bộ ba Query-Triple (3 thành phần) cho tiếng Anh, mô hình của luận văn mở rộng lên bộ 6 thành phần đã nâng cao đáng kể năng lực bao phủ các dạng câu hỏi chứa 3 thực thể hoặc mệnh đề lồng nhau. So với nghiên cứu của Phan và Nguyễn (2010) về gán nhãn Chủ ngữ - Vị ngữ - Tân ngữ cho câu hỏi tiếng Việt, việc tích hợp bộ phân tích từ vựng chuyên biệt cho tiếng Việt trong giai đoạn tiền xử lý giúp mô hình triệt tiêu hiệu quả các lỗi do hiện tượng dính từ hoặc nhập nhằng ngữ nghĩa của hư từ tiếng Việt gây ra.

Đề xuất và khuyến nghị

Dựa trên kết quả nghiên cứu thực nghiệm, luận văn đưa ra 4 khuyến nghị then chốt nhằm phát triển và ứng dụng công nghệ phân tích câu hỏi:

  • Tích hợp mô hình học máy kết hợp (Hybrid NLP System): Nhóm nghiên cứu xử lý ngôn ngữ tự nhiên cần kết hợp 92 luật SCRDR với các thuật toán học máy như Support Vector Machine (SVM) hoặc Maximum Entropy. Mục tiêu nâng tỷ lệ phân loại câu hỏi tự động đạt trên 95% trong lộ trình 6 tháng, sử dụng học máy để lọc sơ bộ và SCRDR để tinh chỉnh các trường hợp biên.
  • Mở rộng cơ sở tri thức đa lĩnh vực: Các kỹ sư hệ thống tri thức cần mở rộng tập từ điển thực thể và quan hệ từ phạm vi 1 trường đại học sang tối thiểu 5 lĩnh vực dịch vụ công thiết yếu (y tế, pháp luật, bảo hiểm xã hội, tài chính, giáo dục) trong thời gian 12 tháng, nhằm kiểm thử độ bền của cấu trúc cây SCRDR trên dữ liệu quy mô lớn.
  • Phát triển giao diện đồ họa thu nhận tri thức tự động (GUI Knowledge Acquisition Tool): Nhóm phát triển phần mềm cần chuẩn hóa giao diện tương tác đồ họa trong vòng 3 tháng tới, cho phép các chuyên gia ngôn ngữ không chuyên về lập trình có thể trực tiếp bổ sung luật ngoại lệ SCRDR mà không cần viết mã Java/JAPE, giúp cắt giảm 50% thời gian huấn luyện chuyên gia.
  • Chuẩn hóa đầu ra tương thích Đồ thị tri thức (Knowledge Graph): Đội ngũ kỹ sư dữ liệu cần tiến hành ánh xạ bộ biểu diễn 6 phần tử sang ngôn ngữ truy vấn SPARQL chuẩn cho các hệ thống Ontology RDF/OWL trong thời hạn 9 tháng, đảm bảo thời gian phản hồi truy vấn câu trả lời đạt dưới 200 mili-giây trên các hệ thống cơ sở dữ liệu tri thức lớn.

Đối tượng nên tham khảo luận văn

Tài liệu luận văn mang lại giá trị học thuật và ứng dụng thực tiễn cho 4 nhóm đối tượng chính:

  • Học viên cao học và nghiên cứu sinh ngành Khoa học máy tính: Tài liệu cung cấp cơ sở phương pháp luận vững chắc về kỹ nghệ tri thức, mô hình SCRDR và cách thức xử lý ngôn ngữ tự nhiên tầng sâu cho tiếng Việt, hỗ trợ đắc lực cho các đề tài nghiên cứu về trích xuất thông tin và biểu diễn tri thức.
  • Kỹ sư phát triển hệ thống Chatbot và Trợ lý ảo: Các kỹ sư công nghệ có thể áp dụng trực tiếp cấu trúc bộ 6 phần tử và phương pháp bóc tách cụm từ qua văn phạm JAPE để xây dựng pipeline phân tích ý định (Intent) và trích xuất thực thể (Slot Filling) cho chatbot doanh nghiệp.
  • Chuyên gia quản trị dữ liệu và Semantic Web: Luận văn là tài liệu tham khảo giá trị cho việc thiết kế kiến trúc ánh xạ từ câu hỏi ngôn ngữ tự nhiên sang cấu trúc bản thể học (Ontology Mapping), phục vụ việc khai thác các kho dữ liệu liên kết và xây dựng Đồ thị tri thức (Knowledge Graph).
  • Giảng viên và nhà nghiên cứu tại các trường đại học: Sử dụng tài liệu làm bài giảng chuyên đề hoặc tài liệu tham khảo cho các học phần Xử lý ngôn ngữ tự nhiên, Trí tuệ nhân tạo nâng cao và Hệ cơ sở tri thức.

Câu hỏi thường gặp

  • Phương pháp Single Classification Ripple Down Rules (SCRDR) giải quyết hạn chế gì của hệ thống luật truyền thống? SCRDR giải quyết dứt điểm vấn đề nút thắt thu nhận tri thức và xung đột luật. Trong hệ thống truyền thống, thêm luật mới rất dễ làm sai lệch các luật cũ. Cây nhị phân SCRDR cô lập luật mới dưới dạng ngoại lệ tại chính nút bị sai, giúp việc mở rộng 92 luật diễn ra độc lập, bảo toàn tính nhất quán toàn hệ thống.

  • Biểu diễn trung gian bộ 6 phần tử có ưu điểm gì so với bộ ba Query-Triple của AquaLog? Cấu trúc bộ 6 phần tử của luận văn gồm cấu trúc câu, lớp câu hỏi, khái niệm chính, quan hệ và hai thực thể ràng buộc. Cấu trúc này vượt trội hơn bộ ba của AquaLog khi cho phép biểu diễn các câu hỏi phức hợp, câu hỏi chứa 3 thực thể hoặc câu hỏi chứa liên từ logic mà không làm mất mát thông tin ngữ nghĩa.

  • Module tiền xử lý giải quyết đặc thù đơn lập của tiếng Việt như thế nào? Tiếng Việt có đặc điểm đơn lập và ranh giới từ phức tạp. Module tiền xử lý đã tích hợp công cụ tách từ và gán nhãn từ loại, đồng thời định nghĩa lại các chú thích TokenVn bằng cách nhúng mã Java vào JAPE để gộp các cụm từ hỏi và cụm từ so sánh thành một đơn vị ngữ nghĩa duy nhất.

  • Quy mô ngữ liệu và kết quả thực nghiệm của luận văn được xác lập ra sao? Hệ thống được huấn luyện trên 400 câu hỏi tiếng Việt phát triển từ 115 câu hỏi gốc, xây dựng thành công 92 luật trên 4 tầng ngoại lệ. Khi kiểm thử trên tập 102 câu hỏi độc lập chưa từng huấn luyện, mô hình đạt độ chính xác cao và khả năng bao quát tốt cấu trúc câu hỏi.

  • Hệ thống có thể chuyển giao sang ngôn ngữ khác hoặc lĩnh vực mới được không? Phương pháp hoàn toàn độc lập với ngôn ngữ và miền tri thức. Quá trình thu nhận tri thức SCRDR đã được kiểm chứng thành công trên cả tiếng Anh và tiếng Việt. Khi chuyển sang lĩnh vực mới, hệ thống chỉ cần cập nhật từ điển thực thể và bộ luật SCRDR tương ứng mà không phải tái cấu trúc toàn bộ hệ thống.

Kết luận

  • Đề xuất thành công kiến trúc toàn diện cho hệ thống Hỏi - Đáp tiếng Việt dựa trên bản thể học (Ontology), kết hợp hài hòa giữa xử lý ngôn ngữ tự nhiên và kỹ nghệ tri thức.
  • Chuẩn hóa cấu trúc biểu diễn trung gian dạng bộ 6 phần tử, giải quyết trọn vẹn 13 dạng cấu trúc câu hỏi và 10 phân lớp câu hỏi từ đơn giản đến phức hợp.
  • Hiện thực hóa phương pháp thu nhận tri thức SCRDR với cơ sở tri thức 92 luật phân bổ trên 4 tầng ngoại lệ, triệt tiêu xung đột luật và tối ưu hóa thời gian xây dựng hệ thống.
  • Đánh giá thực nghiệm thành công trên tập 102 câu hỏi kiểm thử độc lập tiếng Việt và mở rộng hiệu quả sang ngữ liệu tiếng Anh.
  • Công bố các đóng góp khoa học tại 3 hội thảo quốc tế chuyên ngành uy tín gồm RANLP 2011, CICLING 2011 và KSE 2009.

Để tiếp tục phát triển hướng nghiên cứu này, lộ trình tiếp theo cần tập trung tích hợp các mô hình ngôn ngữ lớn kết hợp cơ chế kiểm soát luật SCRDR nhằm tự động hóa hoàn toàn quá trình sinh tri thức. Độc giả, nhà nghiên cứu và các kỹ sư hệ thống quan tâm có thể khai thác các nguyên lý thiết kế và mô hình biểu diễn trung gian trong luận văn để ứng dụng vào các dự án trợ lý ảo và hệ thống truy vấn tri thức thông minh thực tế.