Rút Trích Tri Thức Ngữ Nghĩa Từ Tên Thể Loại Wikipedia

Luận văn thạc sĩ công nghệ thông tin nghiên cứu rút trích tri thức ngữ nghĩa từ tên thể loại Wikipedia, ứng dụng trong phân tích dữ liệu.

Chuyên ngành

Công Nghệ Thông Tin

Người đăng

Ẩn danh

Thể loại

Luận Văn Thạc Sĩ

2015

63
3
0

Phí lưu trữ

30 Point

Tóm tắt

I. Tổng quan về Rút Trích Tri Thức Ngữ Nghĩa Từ Wikipedia

Rút trích tri thức ngữ nghĩa từ Wikipedia là một lĩnh vực nghiên cứu quan trọng trong công nghệ thông tin. Wikipedia, với vai trò là một bách khoa toàn thư mở, cung cấp một kho dữ liệu phong phú cho việc khai thác thông tin. Việc rút trích tri thức từ hệ thống này không chỉ giúp cải thiện khả năng tìm kiếm mà còn hỗ trợ trong việc phát triển các ứng dụng trí tuệ nhân tạo. Nghiên cứu này sẽ tập trung vào việc phân tích và phát triển các phương pháp rút trích tri thức từ tên thể loại của Wikipedia.

1.1. Định nghĩa và Ý nghĩa của Rút Trích Tri Thức

Rút trích tri thức ngữ nghĩa là quá trình khai thác thông tin có giá trị từ các nguồn dữ liệu lớn. Trong bối cảnh Wikipedia, điều này có nghĩa là sử dụng các tên thể loại để thu thập và tổ chức thông tin một cách có hệ thống.

1.2. Lịch sử và Phát triển của Wikipedia

Wikipedia đã phát triển từ một dự án nhỏ thành một trong những nguồn thông tin lớn nhất trên thế giới. Sự phát triển này đã mở ra nhiều cơ hội cho việc nghiên cứu và khai thác dữ liệu từ hệ thống này.

II. Thách Thức Trong Rút Trích Tri Thức Từ Wikipedia

Mặc dù Wikipedia cung cấp một nguồn dữ liệu phong phú, nhưng việc rút trích tri thức từ đây không phải là điều dễ dàng. Các thách thức bao gồm độ phức tạp của ngôn ngữ tự nhiên, sự đa dạng trong cách diễn đạt và cấu trúc thông tin không đồng nhất. Những vấn đề này cần được giải quyết để tối ưu hóa quá trình rút trích.

2.1. Độ Phức Tạp Của Ngôn Ngữ Tự Nhiên

Ngôn ngữ tự nhiên có nhiều biến thể và cách diễn đạt khác nhau, điều này gây khó khăn cho việc rút trích thông tin chính xác từ Wikipedia.

2.2. Cấu Trúc Thông Tin Không Đồng Nhất

Wikipedia chứa nhiều loại thông tin khác nhau, từ bài viết đến infobox, điều này tạo ra thách thức trong việc xác định cách thức rút trích hiệu quả.

III. Phương Pháp Rút Trích Tri Thức Ngữ Nghĩa Từ Wikipedia

Để rút trích tri thức ngữ nghĩa từ Wikipedia, nhiều phương pháp đã được đề xuất. Các phương pháp này bao gồm việc sử dụng các thuật toán học máy, phân tích cú pháp và khai thác dữ liệu. Mỗi phương pháp có những ưu điểm và nhược điểm riêng, và việc lựa chọn phương pháp phù hợp là rất quan trọng.

3.1. Sử Dụng Học Máy Để Rút Trích Thông Tin

Học máy có thể được áp dụng để phân tích và rút trích thông tin từ các tên thể loại, giúp cải thiện độ chính xác của kết quả.

3.2. Phân Tích Cú Pháp Tên Thể Loại

Phân tích cú pháp giúp xác định cấu trúc ngữ nghĩa của tên thể loại, từ đó rút trích các đặc trưng hữu ích cho việc tìm kiếm thông tin.

IV. Ứng Dụng Thực Tiễn Của Rút Trích Tri Thức Ngữ Nghĩa

Việc rút trích tri thức ngữ nghĩa từ Wikipedia có nhiều ứng dụng thực tiễn trong các lĩnh vực như tìm kiếm thông tin, phát triển hệ thống trí tuệ nhân tạo và khai thác dữ liệu. Những ứng dụng này không chỉ giúp cải thiện trải nghiệm người dùng mà còn nâng cao hiệu quả của các hệ thống thông tin.

4.1. Cải Thiện Hệ Thống Tìm Kiếm

Rút trích tri thức ngữ nghĩa giúp cải thiện độ chính xác và tốc độ của các hệ thống tìm kiếm thông tin, đáp ứng tốt hơn nhu cầu của người dùng.

4.2. Phát Triển Ứng Dụng Trí Tuệ Nhân Tạo

Các ứng dụng trí tuệ nhân tạo có thể sử dụng tri thức ngữ nghĩa rút trích từ Wikipedia để nâng cao khả năng hiểu biết và tương tác với người dùng.

V. Kết Luận và Hướng Phát Triển Tương Lai

Rút trích tri thức ngữ nghĩa từ Wikipedia là một lĩnh vực nghiên cứu đầy tiềm năng. Những thách thức hiện tại cần được giải quyết để tối ưu hóa quá trình rút trích. Hướng phát triển tương lai có thể bao gồm việc cải tiến các phương pháp hiện tại và áp dụng công nghệ mới để nâng cao hiệu quả rút trích.

5.1. Cải Tiến Phương Pháp Rút Trích

Cần nghiên cứu và phát triển các phương pháp mới để cải thiện độ chính xác và hiệu quả của việc rút trích tri thức từ Wikipedia.

5.2. Khai Thác Công Nghệ Mới

Việc áp dụng các công nghệ mới như học sâu có thể mở ra nhiều cơ hội mới cho việc rút trích tri thức ngữ nghĩa từ Wikipedia.

17/07/2025
Luận văn thạc sĩ công nghệ thông tin rút trích tri thức ngữ nghĩa từ tên thể loại wikipedia

Trích đoạn nội dung tài liệu

Mở đầu 6 Trình bày lý do chọn đề tài, mục đích, đối tượng và phạm vi nghiên cứu, ý nghĩa khoa học và thực tiễn của đề tài nghiên cứu rút trích tri thức ngữ nghĩa từ tên thể loại Wikipedia. Chương 2: Tổng quan Nội dung chương này trình bày việc phân tích, đánh giá các công trình nghiên cứu về rút trích thông tin Wikipedia của các tác giả trong và ngoài nước; nêu những vấn đề còn tồn tại và đưa ra định hướng mà đề tài tập trung nghiên cứu, giải quyết đó là tập trung khai thác tính ngữ nghĩa từ hệ thống phân loại thể loại của Wikipedia. Chương 3: Rút trích đặc trưng từ Wikipedia Chương này tập trung chủ yếu trình bày các cơ sở lý thuyết, lý luận, và các phương pháp đề xuất đã được sử dụng trong Luận văn. Các phương pháp nghiên cứu được trình bày theo từng khái niệm thông qua các tính chất và ví dụ minh hoạ.

Chương 4: Thực nghiệm Nội dung chương 4 trình bày quá trình thực nghiệm tính các độ đo WordNet, tính hệ số tương quan Pearson (ký hiệu là r). Trình bày phương pháp huấn luyện dữ liệu sử dụng mô hình hàm nhân phi tuyến (Radial Basis Function - RBF), kiểm tra chéo 5 phần (5 folds cross-validation). Chương 4 đồng thời trình bày mô phỏng ứng dụng mở rộng truy vấn sử dụng các đặc trưng đã rút trích được từ Wikipedia. Chương 5: Đánh giá Chương này, luận văn trình bày mô tả ngắn gọn công việc thực nghiệm của đề tài và trình bày các số liệu các kết quả của quá trình thực nghiệm và nhận xét đánh giá kết quả thực nghiệm.

Cụ thể là so sánh kết quả tính độ tương quan của các độ đo chuẩn WordNet và độ tương quan khi có thêm các đặc trưng ngữ nghĩa Wikipedia. Chương 6: Kết luận và hướng phát triển 7 Nội dung của chương 6 là phần tổng kết, trong đó trình bày tóm lược các kết quả của luận văn, một số vấn đề còn tồn tại và hướng phát triển trong tương lai, liên quan đến đề tài. Phần cuối của luận văn là các phụ lục. Trong đó, phụ lục A trình bày tóm lược về hệ thống bách khoa toàn thư mở Wikipedia.

Phụ lục B trình bày danh mục các từ loại tiếng Anh.1 Trong nước Hệ thống bách khoa toàn thư mở Wikipedia được xem như một cơ sở tri thức, việc khai thác dữ liệu từ hệ thống Wikipedia đã trở thành tiêu điểm của nhiều nghiên cứu gần đây trong lĩnh lực rút trích thông tin (Information Extraction - IE) và việc xây dựng cơ sở tri thức. Tuy nhiên, việc rút trích thông tin ngữ nghĩa nói chung và rút trích thông tin ngữ nghĩa từ hệ thống dữ liệu Wikipedia nói riêng vẫn là công việc đầy khó khăn thử thách. Trong nghiên cứu “Mô hình rút trích cụm từ đặc trưng ngữ nghĩa trong tiếng Việt” [3] nhóm tác giả Nguyễn Quang Châu, PGS. Phan Thị Tươi đã đề xuất mô hình xác định cụm từ đặc trưng ngữ nghĩa ViKEa dùng phương pháp so trùng mẫu dựa trên việc khai thác Vi.Wikipedia như một Ontology tiếng Việt.

Đề xuất phương pháp khai thác Vi.Wikipedia như một ontology tiếng Việt không chỉ để phục vụ cho việc xác định cụm danh từ đặc trưng ngữ nghĩa cho câu tiếng Việt mà còn mở ra một hướng giải quyết cho vấn đề thiếu hụt về kho ngữ liệu của các công trình nghiên cứu về xử lý ngôn ngữ tiếng Việt bằng máy tính hiện nay. Ở nghiên cứu “Tóm tắt đa văn bản dựa vào trích xuất câu” [3] của nhóm tác giả Trần Mai Vũ, PGS. Hà Quang Thụy đã đề xuất Phương pháp tính độ tương đồng câu dựa vào Wikipedia, nghiên cứu này sử dụng các trang bài viết trong Wikipedia. Ở nghiên cứu [7] của nhóm tác giả Hien T Nguyen, Tru H Cao.

đã khai thác dữ liệu từ Wikipedia phục vụ bài toán khử nhập nhằng tự động cho thực thể có tên. Nhóm nghiên cứu định hướng xây dựng và phát triển chuyên sâu về bài toán thực thể có tên và ontology.2 Nước ngoài Trên thế giới hiện nay có khá nhiều đề tài, công trình nghiên cứu sử dụng tài nguyên Wikipedia trong các lĩnh vực rút trích thông tin, truy xuất thông tin. Tuy 9 nhiên nhiều tính năng của tài nguyên Wikipedia này vẫn chưa được khai thác hết tiềm năng. Đặc biệt là hệ thống tên loại Wikipedia với dung lượng nhỏ nhưng hàm chứa nhiều tính năng ngữ nghĩa.

Một số nghiên cứu rút trích thông tin từ Wikipedia sử dụng phương pháp học máy có giám sát (Supervised Machine Learning) lấy thông tin từ hệ thống phân cấp tên loại Wikipedia. Trong nghiên cứu [9], chỉ ra tầm quan trọng của thứ tự trong danh sách các thể loại (Category) mà bài viết thuộc về. Vị trí của category trong danh sách đó cho biết độ liên quan tới bài viết và mức độ quan trọng của nó. Nghiên cứu [5] công bố một ontology mới – YAGO, vừa có phạm vi rộng vừa có chất lượng cao.

Đề xuất này lợi dụng các trang category, đưa ra kỹ thuật rút trích thông tin sự kiện từ Wikipedia kết hợp Wordnet. Giải pháp [12] của nhóm Maria Ruiz - Casado cho phép khai thác các quan hệ ngữ nghĩa của Wikipedia để bổ sung cho WordNet thông qua sử dụng các mẫu từ vựng xác định để thể hiện quan hệ ngữ nghĩa giữa các khái niệm. Kết quả đạt được bao gồm 270 câu cho quan hệ hạ danh, 158 câu cho quan hệ thượng danh, 247 câu cho quan hệ bộ phận và 222 câu cho quan hệ toàn thể. Việc phân tích tiếp cho 1.204 quan hệ dạng hạ danh với 852 quan hệ chưa tồn tại trong WordNet với độ chính xác bình quân là 0,69; 418 quan hệ dạng bộ phận với 303 chưa có trong WordNet dẫn đến độ chính xác 0,61, và 184 quan hệ mới dạng toàn thể với độ chính xác 0,61.

Giải pháp [14] đề xuất sử dụng mạng ngữ nghĩa Wikipedia để thay thế Wordnet. Vì rằng các phương pháp tính độ tương đồng câu sử dụng kho ngữ liệu Wordnet được đánh giá cho ra kết quả cao. Tuy nhiên, kho ngữ liệu Wordnet chỉ hỗ trợ ngôn ngữ tiếng Anh, việc xây dựng kho ngữ liệu này cho các ngôn ngữ khác đòi hỏi sự tốn kém về mặt chi phí, nhân lực và thời gian. Trong giải pháp này Simone Paolo Ponzetto và cộng sự tập trung vào việc áp dụng và cải tiến một số độ đo phổ biến về tính độ tương đồng từ trên tập ngữ liệu Wordnet cho việc tính độ tương đồng giữa các khái trên mạng ngữ nghĩa Wikipedia.

10 Luận văn này tập trung tìm hiểu các đặc trưng ngữ nghĩa của WCN dùng cho việc trút trích thông tin từ Wikipedia. Sau đó trình bày mô phỏng ứng dụng mở rộng truy vấn sử dụng các đặc trưng này. RÚT TRÍCH ĐẶC TRƯNG NGỮ NGHĨA TỪ TÊN LOẠI WIKIPEDIA 3.1 Cơ sở lý luận Wikipedia được xem như một ontology mở, được xây dựng bởi những người tình nguyện theo hướng tiếp cận từ dưới lên, với các khái niệm được hình thành từ một tập từ vựng tự do và các thoả thuận mang tính cộng đồng. Trong quá trình phân loại bài viết Wikipedia, người ta luôn xếp một bài viết vào loại có liên quan.

Điều đó cũng có nghĩa là người ta luôn cố gắng dùng tên phân loại sao cho bao gồm được các tên bài viết thuộc tên phân loại đó. Mỗi bài viết Wikipedia chứa một danh sách các thể loại mà nó thuộc về. Tiêu đề bài viết và danh sách các tên thể loại mà bài viết đó thuộc về có quan hệ ngữ nghĩa với nhau. Ví dụ, mối quan hệ một bài viết với các thể loại chứa nó, cụ thể với bài viết ‘Eraser’ trong Wikipedia như hình 3.

Bài viết ‘Eraser’ thuộc các thể loại ‘Stationery’, ‘Writing implements’, ‘Art materials’. Bài viết ‘Eraser’ và thể loại ‘Stationery’ có quan hệ ngữ nghĩa với nhau. Bài viết ‘Eraser’ và thể loại ‘Writing implements’ có quan hệ ngữ nghĩa với nhau. Bài viết ‘Eraser’ và thể loại ’Art materials’ có quan hệ ngữ nghĩa với nhau.

Thể loại ‘Stationery’ và thể loại ‘Writing implements’ có quan hệ ngữ nghĩa. Thể loại ‘Stationery’ và thể loại ‘Art materials’có quan hệ ngữ nghĩa. Thể loại ‘Writing implements’ và thể loại ‘Art materials’có quan hệ ngữ nghĩa. Ngoài ra, thứ tự của các thể loại trong danh sách thể loại này mang ý nghĩa nhất định đối với bài báo.

Các thể loại bên trái trong danh sách có quan hệ ngữ nghĩa cao hơn, điều này được chứng minh trong nghiên cứu [9]. Do đó, luận văn xem xét khai 12 thác đặc trưng thứ tự vị trí của thể loại trong danh sách thể loại của bài viết. Đây là cơ sở để tính đặc trưng ngữ nghĩa ‘Leftness’ ở các phần sau. Bài viết Eraser Danh sách Category của bài viết Eraser Hình 3.1 Các thể loại của một bài viết trong hệ thống Wikipedia Các thể loại (category) và bài viết (article) của Wkipedia được tổ chức lưu trữ dưới dạng mạng lưới các khái niệm liên quan ngữ nghĩa với nhau gọi là Wikipedia Category Network (WCN) [16].

13 Stationery Writing implements Art materials C1 C2 C3 Stapler Notebook Pencil Eraser Highlighter Wood C Wikipedia Category: Thể loại Wikipedia Article: Bài viết Hình 3.2 Mô hình Wikipedia Category Network (WCN) Từ những phân tích trên cho thấy WCN là nguồn dữ liệu mang tính ngữ nghĩa cao. Vì vậy, luận văn tập trung khai thác thông tin từ danh sách tên thể loại và tên tiêu đề bài viết của mạng lưới thể loại Wikipedia. Luận văn này trình bày một phương pháp với các đặc trưng ngữ nghĩa của WCN dùng cho việc trút trích thông tin từ Wikipedia. Luận văn đồng thời trình bày đánh giá các đặc trưng ngữ nghĩa trên các tập dữ liệu chuẩn.2 Phân tích hệ thống cấp bậc Phần này tập trung phân tích vị trí của một thể loại trong WCN, đầu tiên là phân tích thể loại đơn và sau đó là xem xét cặp thể loại.1 NormalizedRepresentation (NR1) Tên thể loại biểu diễn các bài viết bằng một khái niệm hoặc chủ đề.

Vì vậy, số lượng bài viết dưới một thể loại được xem như độ biểu diễn của nó. Để tránh chênh lệch với thể loại lớn luận văn chuẩn hóa phép đo này bằng cách chia nó cho tổng của các biểu diễn của các thể loại mà các bài viết thuộc về. Với tham chiếu đến WCN trong hình 3.2, có thể được viết như sau: #𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑙𝑙𝑒𝑒 (𝐶𝐶1 ) 𝑁𝑁𝑁𝑁1 (𝐶𝐶1 ) = #𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎 (𝐶𝐶1 ) + #𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎 (𝐶𝐶2 ) + #𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎𝑎 (𝐶𝐶3 ) Công thức 3-1. Tính đặc trưng NR1 Trong đó: #article(C 1 ) là số bài viết của thể loại C 1 #article(C 2 ) là số bài viết của thể loại C 2 #article(C 3 ) là số bài viết của thể loại C 3 3.2 Leftness1 Độ đo leftness của một thể loại (ký hiệu là Leftness1) là độ liên quan của thể loại và bài viết.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu "Rút Trích Tri Thức Ngữ Nghĩa Từ Wikipedia: Luận Văn Thạc Sĩ Công Nghệ Thông Tin" khám phá các phương pháp và kỹ thuật để rút trích tri thức từ nguồn dữ liệu phong phú như Wikipedia. Luận văn này không chỉ cung cấp cái nhìn sâu sắc về cách thức xử lý và phân tích ngữ nghĩa mà còn nhấn mạnh tầm quan trọng của việc áp dụng công nghệ thông tin trong việc tối ưu hóa quy trình rút trích tri thức. Độc giả sẽ tìm thấy những lợi ích thiết thực từ việc hiểu rõ hơn về các công cụ và phương pháp hiện đại, giúp nâng cao khả năng phân tích và ứng dụng trong các lĩnh vực khác nhau.

Để mở rộng kiến thức của bạn, bạn có thể tham khảo thêm tài liệu Luận văn thạc sĩ ngành hệ thống thông tin phân tích dữ liệu văn bản dựa trên học máy thế giới mở và ứng dụng, nơi cung cấp cái nhìn sâu sắc về phân tích dữ liệu văn bản. Ngoài ra, tài liệu Nghiên cứu nhận dạng thực thể có tên và thực thể biểu hiện trong văn bản và ứng dụng sẽ giúp bạn hiểu rõ hơn về nhận dạng thực thể trong văn bản, một phần quan trọng trong việc rút trích tri thức. Cuối cùng, bạn cũng có thể tìm hiểu về Luận văn áp dụng kỹ thuật khai phá dữ liệu dự báo thuê bao rời mạng trong mạng di động, tài liệu này sẽ cung cấp thêm thông tin về ứng dụng khai phá dữ liệu trong các lĩnh vực khác nhau. Những tài liệu này sẽ là cơ hội tuyệt vời để bạn đào sâu hơn vào các chủ đề liên quan và mở rộng kiến thức của mình.