Mở đầu 6 Trình bày lý do chọn đề tài, mục đích, đối tượng và phạm vi nghiên cứu, ý nghĩa khoa học và thực tiễn của đề tài nghiên cứu rút trích tri thức ngữ nghĩa từ tên thể loại Wikipedia. Chương 2: Tổng quan Nội dung chương này trình bày việc phân tích, đánh giá các công trình nghiên cứu về rút trích thông tin Wikipedia của các tác giả trong và ngoài nước; nêu những vấn đề còn tồn tại và đưa ra định hướng mà đề tài tập trung nghiên cứu, giải quyết đó là tập trung khai thác tính ngữ nghĩa từ hệ thống phân loại thể loại của Wikipedia. Chương 3: Rút trích đặc trưng từ Wikipedia Chương này tập trung chủ yếu trình bày các cơ sở lý thuyết, lý luận, và các phương pháp đề xuất đã được sử dụng trong Luận văn. Các phương pháp nghiên cứu được trình bày theo từng khái niệm thông qua các tính chất và ví dụ minh hoạ.
Chương 4: Thực nghiệm Nội dung chương 4 trình bày quá trình thực nghiệm tính các độ đo WordNet, tính hệ số tương quan Pearson (ký hiệu là r). Trình bày phương pháp huấn luyện dữ liệu sử dụng mô hình hàm nhân phi tuyến (Radial Basis Function - RBF), kiểm tra chéo 5 phần (5 folds cross-validation). Chương 4 đồng thời trình bày mô phỏng ứng dụng mở rộng truy vấn sử dụng các đặc trưng đã rút trích được từ Wikipedia. Chương 5: Đánh giá Chương này, luận văn trình bày mô tả ngắn gọn công việc thực nghiệm của đề tài và trình bày các số liệu các kết quả của quá trình thực nghiệm và nhận xét đánh giá kết quả thực nghiệm.
Cụ thể là so sánh kết quả tính độ tương quan của các độ đo chuẩn WordNet và độ tương quan khi có thêm các đặc trưng ngữ nghĩa Wikipedia. Chương 6: Kết luận và hướng phát triển 7 Nội dung của chương 6 là phần tổng kết, trong đó trình bày tóm lược các kết quả của luận văn, một số vấn đề còn tồn tại và hướng phát triển trong tương lai, liên quan đến đề tài. Phần cuối của luận văn là các phụ lục. Trong đó, phụ lục A trình bày tóm lược về hệ thống bách khoa toàn thư mở Wikipedia.
Phụ lục B trình bày danh mục các từ loại tiếng Anh.1 Trong nước Hệ thống bách khoa toàn thư mở Wikipedia được xem như một cơ sở tri thức, việc khai thác dữ liệu từ hệ thống Wikipedia đã trở thành tiêu điểm của nhiều nghiên cứu gần đây trong lĩnh lực rút trích thông tin (Information Extraction - IE) và việc xây dựng cơ sở tri thức. Tuy nhiên, việc rút trích thông tin ngữ nghĩa nói chung và rút trích thông tin ngữ nghĩa từ hệ thống dữ liệu Wikipedia nói riêng vẫn là công việc đầy khó khăn thử thách. Trong nghiên cứu “Mô hình rút trích cụm từ đặc trưng ngữ nghĩa trong tiếng Việt” [3] nhóm tác giả Nguyễn Quang Châu, PGS. Phan Thị Tươi đã đề xuất mô hình xác định cụm từ đặc trưng ngữ nghĩa ViKEa dùng phương pháp so trùng mẫu dựa trên việc khai thác Vi.Wikipedia như một Ontology tiếng Việt.
Đề xuất phương pháp khai thác Vi.Wikipedia như một ontology tiếng Việt không chỉ để phục vụ cho việc xác định cụm danh từ đặc trưng ngữ nghĩa cho câu tiếng Việt mà còn mở ra một hướng giải quyết cho vấn đề thiếu hụt về kho ngữ liệu của các công trình nghiên cứu về xử lý ngôn ngữ tiếng Việt bằng máy tính hiện nay. Ở nghiên cứu “Tóm tắt đa văn bản dựa vào trích xuất câu” [3] của nhóm tác giả Trần Mai Vũ, PGS. Hà Quang Thụy đã đề xuất Phương pháp tính độ tương đồng câu dựa vào Wikipedia, nghiên cứu này sử dụng các trang bài viết trong Wikipedia. Ở nghiên cứu [7] của nhóm tác giả Hien T Nguyen, Tru H Cao.
đã khai thác dữ liệu từ Wikipedia phục vụ bài toán khử nhập nhằng tự động cho thực thể có tên. Nhóm nghiên cứu định hướng xây dựng và phát triển chuyên sâu về bài toán thực thể có tên và ontology.2 Nước ngoài Trên thế giới hiện nay có khá nhiều đề tài, công trình nghiên cứu sử dụng tài nguyên Wikipedia trong các lĩnh vực rút trích thông tin, truy xuất thông tin. Tuy 9 nhiên nhiều tính năng của tài nguyên Wikipedia này vẫn chưa được khai thác hết tiềm năng. Đặc biệt là hệ thống tên loại Wikipedia với dung lượng nhỏ nhưng hàm chứa nhiều tính năng ngữ nghĩa.
Một số nghiên cứu rút trích thông tin từ Wikipedia sử dụng phương pháp học máy có giám sát (Supervised Machine Learning) lấy thông tin từ hệ thống phân cấp tên loại Wikipedia. Trong nghiên cứu [9], chỉ ra tầm quan trọng của thứ tự trong danh sách các thể loại (Category) mà bài viết thuộc về. Vị trí của category trong danh sách đó cho biết độ liên quan tới bài viết và mức độ quan trọng của nó. Nghiên cứu [5] công bố một ontology mới – YAGO, vừa có phạm vi rộng vừa có chất lượng cao.
Đề xuất này lợi dụng các trang category, đưa ra kỹ thuật rút trích thông tin sự kiện từ Wikipedia kết hợp Wordnet. Giải pháp [12] của nhóm Maria Ruiz - Casado cho phép khai thác các quan hệ ngữ nghĩa của Wikipedia để bổ sung cho WordNet thông qua sử dụng các mẫu từ vựng xác định để thể hiện quan hệ ngữ nghĩa giữa các khái niệm. Kết quả đạt được bao gồm 270 câu cho quan hệ hạ danh, 158 câu cho quan hệ thượng danh, 247 câu cho quan hệ bộ phận và 222 câu cho quan hệ toàn thể. Việc phân tích tiếp cho 1.204 quan hệ dạng hạ danh với 852 quan hệ chưa tồn tại trong WordNet với độ chính xác bình quân là 0,69; 418 quan hệ dạng bộ phận với 303 chưa có trong WordNet dẫn đến độ chính xác 0,61, và 184 quan hệ mới dạng toàn thể với độ chính xác 0,61.
Giải pháp [14] đề xuất sử dụng mạng ngữ nghĩa Wikipedia để thay thế Wordnet. Vì rằng các phương pháp tính độ tương đồng câu sử dụng kho ngữ liệu Wordnet được đánh giá cho ra kết quả cao. Tuy nhiên, kho ngữ liệu Wordnet chỉ hỗ trợ ngôn ngữ tiếng Anh, việc xây dựng kho ngữ liệu này cho các ngôn ngữ khác đòi hỏi sự tốn kém về mặt chi phí, nhân lực và thời gian. Trong giải pháp này Simone Paolo Ponzetto và cộng sự tập trung vào việc áp dụng và cải tiến một số độ đo phổ biến về tính độ tương đồng từ trên tập ngữ liệu Wordnet cho việc tính độ tương đồng giữa các khái trên mạng ngữ nghĩa Wikipedia.
10 Luận văn này tập trung tìm hiểu các đặc trưng ngữ nghĩa của WCN dùng cho việc trút trích thông tin từ Wikipedia. Sau đó trình bày mô phỏng ứng dụng mở rộng truy vấn sử dụng các đặc trưng này. RÚT TRÍCH ĐẶC TRƯNG NGỮ NGHĨA TỪ TÊN LOẠI WIKIPEDIA 3.1 Cơ sở lý luận Wikipedia được xem như một ontology mở, được xây dựng bởi những người tình nguyện theo hướng tiếp cận từ dưới lên, với các khái niệm được hình thành từ một tập từ vựng tự do và các thoả thuận mang tính cộng đồng. Trong quá trình phân loại bài viết Wikipedia, người ta luôn xếp một bài viết vào loại có liên quan.
Điều đó cũng có nghĩa là người ta luôn cố gắng dùng tên phân loại sao cho bao gồm được các tên bài viết thuộc tên phân loại đó. Mỗi bài viết Wikipedia chứa một danh sách các thể loại mà nó thuộc về. Tiêu đề bài viết và danh sách các tên thể loại mà bài viết đó thuộc về có quan hệ ngữ nghĩa với nhau. Ví dụ, mối quan hệ một bài viết với các thể loại chứa nó, cụ thể với bài viết ‘Eraser’ trong Wikipedia như hình 3.
Bài viết ‘Eraser’ thuộc các thể loại ‘Stationery’, ‘Writing implements’, ‘Art materials’. Bài viết ‘Eraser’ và thể loại ‘Stationery’ có quan hệ ngữ nghĩa với nhau. Bài viết ‘Eraser’ và thể loại ‘Writing implements’ có quan hệ ngữ nghĩa với nhau. Bài viết ‘Eraser’ và thể loại ’Art materials’ có quan hệ ngữ nghĩa với nhau.
Thể loại ‘Stationery’ và thể loại ‘Writing implements’ có quan hệ ngữ nghĩa. Thể loại ‘Stationery’ và thể loại ‘Art materials’có quan hệ ngữ nghĩa. Thể loại ‘Writing implements’ và thể loại ‘Art materials’có quan hệ ngữ nghĩa. Ngoài ra, thứ tự của các thể loại trong danh sách thể loại này mang ý nghĩa nhất định đối với bài báo.
Các thể loại bên trái trong danh sách có quan hệ ngữ nghĩa cao hơn, điều này được chứng minh trong nghiên cứu [9]. Do đó, luận văn xem xét khai 12 thác đặc trưng thứ tự vị trí của thể loại trong danh sách thể loại của bài viết. Đây là cơ sở để tính đặc trưng ngữ nghĩa ‘Leftness’ ở các phần sau. Bài viết Eraser Danh sách Category của bài viết Eraser Hình 3.1 Các thể loại của một bài viết trong hệ thống Wikipedia Các thể loại (category) và bài viết (article) của Wkipedia được tổ chức lưu trữ dưới dạng mạng lưới các khái niệm liên quan ngữ nghĩa với nhau gọi là Wikipedia Category Network (WCN) [16].
13 Stationery Writing implements Art materials C1 C2 C3 Stapler Notebook Pencil Eraser Highlighter Wood C Wikipedia Category: Thể loại Wikipedia Article: Bài viết Hình 3.2 Mô hình Wikipedia Category Network (WCN) Từ những phân tích trên cho thấy WCN là nguồn dữ liệu mang tính ngữ nghĩa cao. Vì vậy, luận văn tập trung khai thác thông tin từ danh sách tên thể loại và tên tiêu đề bài viết của mạng lưới thể loại Wikipedia. Luận văn này trình bày một phương pháp với các đặc trưng ngữ nghĩa của WCN dùng cho việc trút trích thông tin từ Wikipedia. Luận văn đồng thời trình bày đánh giá các đặc trưng ngữ nghĩa trên các tập dữ liệu chuẩn.2 Phân tích hệ thống cấp bậc Phần này tập trung phân tích vị trí của một thể loại trong WCN, đầu tiên là phân tích thể loại đơn và sau đó là xem xét cặp thể loại.1 NormalizedRepresentation (NR1) Tên thể loại biểu diễn các bài viết bằng một khái niệm hoặc chủ đề.
Vì vậy, số lượng bài viết dưới một thể loại được xem như độ biểu diễn của nó. Để tránh chênh lệch với thể loại lớn luận văn chuẩn hóa phép đo này bằng cách chia nó cho tổng của các biểu diễn của các thể loại mà các bài viết thuộc về. Với tham chiếu đến WCN trong hình 3.2, có thể được viết như sau: #𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑙𝑙𝑒𝑒 (𝐶𝐶1 ) 𝑁𝑁𝑁𝑁1 (𝐶𝐶1 ) = #𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎 (𝐶𝐶1 ) + #𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎 (𝐶𝐶2 ) + #𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎 (𝐶𝐶3 ) Công thức 3-1. Tính đặc trưng NR1 Trong đó: #article(C 1 ) là số bài viết của thể loại C 1 #article(C 2 ) là số bài viết của thể loại C 2 #article(C 3 ) là số bài viết của thể loại C 3 3.2 Leftness1 Độ đo leftness của một thể loại (ký hiệu là Leftness1) là độ liên quan của thể loại và bài viết.