Luận Văn Thạc Sĩ Khoa Học Máy Tính: Nghiên Cứu Kết Nối Từ Điển Với Wikipedia

Luận văn thạc sĩ khoa học máy tính nghiên cứu kết nối từ điển với Wikipedia, ứng dụng công nghệ xử lý ngôn ngữ tự nhiên và trí tuệ nhân tạo.

Chuyên ngành

Khoa học máy tính

Người đăng

Ẩn danh

Thể loại

luận văn thạc sĩ

2014

66
3
0

Phí lưu trữ

30 Point

Tóm tắt

I. Giới thiệu

Luận văn thạc sĩ Khoa học Máy tính với chủ đề 'Kết nối từ điển với Wikipedia' tập trung vào việc nâng cao chất lượng tra cứu từ điển trực tuyến bằng cách liên kết các nghĩa của từ với các khái niệm tương ứng trong Wikipedia. Kết nối từ điểnWikipedia là hai yếu tố chính được nghiên cứu để hỗ trợ người dùng hiểu rõ hơn các nghĩa của từ thông qua việc truy cập trực tiếp vào các bài viết chi tiết trên Wikipedia. Nghiên cứu khoa học này đề xuất hai phương pháp chính: dựa trên luật và học máy, nhằm giải quyết bài toán phân giải nhập nhằng nghĩa của từ.

1.1. Bài toán và phạm vi nghiên cứu

Bài toán chính của luận văn là phân giải nhập nhằng nghĩa của từ (Word Sense Disambiguation) bằng cách liên kết các nghĩa trong từ điển với các khái niệm tương ứng trong Wikipedia. Từ điển trực tuyến như Wiktionary và Oxford được sử dụng làm nguồn dữ liệu chính. Phạm vi nghiên cứu tập trung vào các danh từ tiếng Anh và hai phương pháp tiếp cận: dựa trên luậthọc máy.

1.2. Các công trình liên quan

Nhiều nghiên cứu trước đây đã sử dụng Wikipedia để làm giàu ngữ nghĩa cho các văn bản không có cấu trúc hoặc các nguồn tri thức từ vựng như WordNet. Các công trình như của Ruiz-Casado (2005), Suchanek (2008), và Fernando và Stevenson (2012) đã đề xuất các phương pháp kết nối WordNet với Wikipedia. Ngoài ra, các nghiên cứu như Mihalcea và Csomai (2007) và Milne và Witten (2008) đã sử dụng học máy để giải quyết nhập nhằng trong văn bản.

II. Cơ sở lý thuyết

Luận văn dựa trên nền tảng lý thuyết về Wikipedia và các từ điển trực tuyến. Wikipedia được coi là một cơ sở tri thức mở rộng lớn, cung cấp thông tin chi tiết về các khái niệm thông qua các trang thực thể, trang phân giải nhập nhằng, và trang thể loại. Từ điển trực tuyến như Wiktionary và Oxford cung cấp các nghĩa của từ với chú thích ngắn gọn, nhưng đôi khi gây khó hiểu cho người dùng. Việc kết nối hai nguồn này giúp cải thiện trải nghiệm tra cứu.

2.1. Wikipedia

Wikipedia là một nguồn tri thức mở với hơn 31,6 triệu trang web và hỗ trợ 287 ngôn ngữ. Các trang thực thể, trang phân giải nhập nhằng, và trang thể loại là các thành phần chính. Trang thực thể mô tả chi tiết thông tin về một khái niệm, trong khi trang phân giải nhập nhằng giúp xác định nghĩa chính xác của từ trong các trường hợp nhập nhằng.

2.2. Từ điển trực tuyến

Từ điển trực tuyến như Wiktionary và Oxford cung cấp các nghĩa của từ với chú thích ngắn gọn. Tuy nhiên, các chú thích này đôi khi không đủ để người dùng hiểu rõ nghĩa của từ. Việc kết nối các nghĩa này với Wikipedia giúp người dùng truy cập thông tin chi tiết hơn về các khái niệm liên quan.

III. Phương pháp đề xuất

Luận văn đề xuất hai phương pháp chính để kết nối các nghĩa trong từ điển với Wikipedia: dựa trên luậthọc máy. Phương pháp dựa trên luật sử dụng các quy tắc cụ thể để xác định liên kết, trong khi phương pháp học máy dựa trên việc phân tích dữ liệu để đưa ra quyết định. Cả hai phương pháp đều được thử nghiệm trên hai bộ từ điển Wiktionary và Oxford.

3.1. Phương pháp dựa trên luật

Phương pháp này sử dụng các quy tắc cụ thể để xác định liên kết giữa các nghĩa trong từ điển và các trang Wikipedia. Các quy tắc bao gồm so sánh tiêu đề, nội dung, và các liên kết trong Wikipedia. Kết quả thử nghiệm cho thấy độ chính xác và độ đầy đủ đạt 73.0% cho Wiktionary và 77.2% cho Oxford.

3.2. Phương pháp học máy

Phương pháp học máy sử dụng các thuật toán để phân tích dữ liệu và xác định liên kết giữa các nghĩa trong từ điển và Wikipedia. Kết quả thử nghiệm cho thấy độ chính xác và độ đầy đủ đạt 67% cho Wiktionary và 69.8% cho Oxford.

IV. Đánh giá phương pháp

Các phương pháp đề xuất được đánh giá dựa trên độ chính xác và độ đầy đủ. Kết quả cho thấy phương pháp dựa trên luật có hiệu suất cao hơn so với phương pháp học máy. Tuy nhiên, cả hai phương pháp đều có giá trị thực tiễn trong việc cải thiện chất lượng tra cứu từ điển trực tuyến.

4.1. Kết quả thí nghiệm

Kết quả thí nghiệm cho thấy phương pháp dựa trên luật đạt độ chính xác và độ đầy đủ cao hơn so với phương pháp học máy. Điều này cho thấy các quy tắc cụ thể có thể giúp xác định liên kết chính xác hơn giữa các nghĩa trong từ điển và Wikipedia.

4.2. Ứng dụng thực tiễn

Các phương pháp đề xuất có thể được áp dụng trong các hệ thống từ điển trực tuyến để cải thiện trải nghiệm người dùng. Việc kết nối các nghĩa với Wikipedia giúp người dùng hiểu rõ hơn về các khái niệm liên quan, đặc biệt trong các lĩnh vực chuyên ngành.

V. Tổng kết

Luận văn đã đề xuất và đánh giá hai phương pháp kết nối các nghĩa trong từ điển với Wikipedia: dựa trên luậthọc máy. Kết quả cho thấy cả hai phương pháp đều có giá trị thực tiễn, với phương pháp dựa trên luật có hiệu suất cao hơn. Nghiên cứu này mở ra hướng phát triển mới trong việc cải thiện chất lượng tra cứu từ điển trực tuyến.

5.1. Hướng phát triển

Trong tương lai, nghiên cứu có thể mở rộng sang các ngôn ngữ khác và tích hợp thêm các nguồn tri thức khác ngoài Wikipedia. Việc cải tiến các phương pháp học máy cũng là một hướng phát triển tiềm năng.

21/02/2025

Trích đoạn nội dung tài liệu

đặt vấn đề trong phần giới thiệu, hiện nay các chú thích cho nghĩa trong các từ điển vẫn còn đơn giản. Vì vậy để hỗ trợ tốt hơn cho ngƣời sử dụng hiểu một cách rõ ràng từng nghĩa của từ khi sử dụng các từ điển, chúng tôi sẽ liên kết từng nghĩa đến khái niệm tƣơng ứng trong một cơ sở tri thức. Và Wikipedia là một cở sở tri thức hữu dụng và chất lƣợng với việc cung cấp mô tả chi tiết cho các khái niệm trong các trang thực thể. Bởi vì một từ hay một cụm từ trong từ điển có thể mang nhiều nghĩa khác nhau, vì vậy việc xác định chính xác khái niệm tƣơng ứng trong cơ sở tri thức cho từng nghĩa cơ bản cũng chính là bài toán phân giải nhập nhằng nghĩa của từ (Word Sense Disambiguation) dựa vào ngữ cảnh miêu tả cho nghĩa đó (chú thích, các ví dụ minh hoạ cho việc sử dụng, các từ có mối quan hệ ngữ nghĩa tƣơng ứng).

Để giải quyết cho bài toán phân giải nhập nhằng nghĩa của từ, chúng tôi đã dựa trên hai phƣơng pháp tiếp cận cơ bản là: dựa trên luật (Rule-based) và học máy (Machine Learning). Trong luận văn này, chúng tôi tiến hành nghiên cứu và đề xuất hai phƣơng pháp để kết nối nghĩa của các danh từ tiếng Anh trong các từ điển đến các khái niệm tƣơng ứng trong Wikipedia. Để đánh giá các phƣơng pháp đề xuất, chúng tôi tiến hành hiện thực, thử nghiệm và đánh giá trên hai bộ từ điển Wiktionary và Oxford. Các công trình liên quan Hiện nay, đã có một số nghiên cứu trƣớc đây sử dụng cơ sở tri thức Wikipedia để làm giàu ngữ nghĩa cho các văn bản không có cấu trúc hoặc các nguồn cơ sở tri thức từ vựng khác, chẳng hạn nhƣ mạng từ vựng WordNet.

Để lựa chọn đúng các khái niệm tƣơng ứng trong Wikipedia, phƣơng pháp đề xuất cho các nghiên cứu này dựa trên hai hƣớng tiếp cận: dựa trên luật và học máy. Có nhiều công trình nghiên cứu trƣớc đây đã tiến hành kết nối mạng từ vựng WordNet với cơ sở tri thức Wikipedia, chẳng hạn nhƣ Ruiz-Casado (2005), Suchanek (2008), Ponzetto và Navigli (2010), Fernando và Stevenson (2012). Các nghiên cứu này định nghĩa giải thuật với các luật hoặc heuristic khác nhau để lựa chọn khái niệm tƣơng ứng trong Wikipedia cho các WordNet synset. Ruiz-Casado (2005) đã sử dụng việc so sánh mức độ tƣơng tự văn bản giữa các synset và trang Wikipedia để kết nối WordNet và Simple Wikiepdia tiếng Anh.

3 Suchanek (2008) đã sử dụng các phƣơng pháp heuristic để kết nối các trang thể loại của Wikipedia với các WordNet synset. Ponzetto và Navigli (2010) sử dụng các phƣơng pháp giao nhau văn bản để lựa chọn trang Wikipedia phù hợp nhất cho từng WordNet synset, tuy nhiên khi tìm kiếm các trang Wikipedia ứng viên tác giả chỉ sử dụng tiêu đề của trang Wikipedia mà không sử dụng nội dung của nó. Nghiên cứu gần đây nhất của việc kết nối WordNet và Wikipedia là công trình của Fernando và Stevenson (2012). Tác giả đã đề xuất một phƣơng pháp tự động kết nối các WordNet synset đến các trang Wikipedia với ba bƣớc: xác định tập các trang ứng viên cho từng WordNet synset (Generation of Candidate Articles), lựa chọn các kết nối tốt nhất (Selecting the Best Mappings) và tinh lọc các kết nối (Refining the Mappings).

Trong phƣơng pháp của Fernando và Stevenson, mục tiêu của bƣớc thứ nhất là thu giảm không gian tìm kiếm trang Wikipedia kết nối cho từng synset. Với bƣớc thứ hai, mục tiêu là giải quyết nhập nhằng để xác định trang Wikipedia phù hợp nhất và tác giả đã sử dụng hai độ đo: tƣơng tự văn bản (Text Similarity) và tƣơng tự tiêu đề (Title Similarity). Cuối cùng, một phƣơng pháp đánh giá toàn cục và các liên kết trong Wikipedia đƣợc sử dụng để tinh lọc những kết nối tốt nhất. Ngoài ra, cũng có một số nghiên cứu khác đã tiến hành kết nối các văn bản không có cấu trúc với Wikipedia, chẳng hạn nhƣ Mihalcea và Csomai (2007), Milne và Witten (2008).

Các nghiên cứu này sử dụng phƣơng pháp học máy để phân giải nhập nhằng cho các cụm từ trong văn bản. Mihalcea và Csomai (2007) đã đề xuất phƣơng pháp Wikify để làm giàu ngữ nghĩa cho các văn bản không có cấu trúc với hai bƣớc chính: rút trích từ khoá (Keyword Extraction) và giải quyết nhập nhằng (Word Sense Disambiguation). Rút trích từ khoá là xác định các từ và các cụm từ quan trọng trong văn bản, chúng là các thuật ngữ kỹ thuật (Technical Terms), các thực thể đƣợc định danh (Named Entities), các thuật ngữ mới (New Terminology). Để rút trích các từ khoá trong văn bản, đầu tiên tác giả tiến hành xây dựng một từ điển với các tiêu đề của các trang Wikipedia, sau đó văn bản sẽ đƣợc phân tích và rút trích ra các từ và cụm từ nếu chúng nằm trong từ điển.

Tiếp theo để đánh giá các từ và cụm từ nào quan trọng, một hàm xếp hạng (ranking) dựa trên truy hồi thông tin (IR), xác suất, hoặc độc lập tuyến tính đƣợc sử dụng. Ví dụ, với văn bản "A tree is a large, perennial, woody plant [.] The earliest 4 trees were tree ferns and horsetails, which grew in forests in the Carboniferous Period." thì các từ khoá đƣợc rút trích là: "perennial", "plant", "tree ferns", "horsetails", "Carboniferous". Sau khi rút trích đƣợc các từ khoá trong văn bản, Mihalcea và Csomai sử dụng giải thuật học máy dựa trên việc phân tích các liên kết trong Wikipedia để giải quyết nhập nhằng cho các từ khoá và liên kết chúng đến các trang Wikipedia tƣơng ứng. Trong đoạn văn bản của ví dụ trên, từ "plant" có một vài nghĩa khác nhau, chẳng hạn "green plant" (cây xanh) hay "industrial plant" (nhà máy công nghiệp), nhƣng nghĩa đúng của từ "plant" trong đoạn văn bản nên là "green plant" (cây xanh).

Milne và Witten (2008) đề xuất một phƣơng pháp cải tiến cho phƣơng pháp Wikify trong việc kết nối các văn bản không câu trúc với Wikipedia. Và để giải quyết nhập nhằng cho các từ khoá, Milne và Witten đã sử dụng phƣơng pháp học máy dựa trên ba nhân tố chính: độ phổ biến (Commoness), độ tƣơng quan ngữ cảnh (Semantic Relatedness) và chất lƣợng của ngữ cảnh (Context Quality). Ngoài các nghiên cứu kết nối WordNet và các văn bản đến Wikipedia, còn có một số nghiên cứu khác kết nối các cơ tri thức từ vựng lại với nhau. Chẳng hạn nhƣ, Meyer và Gurevych (2011) đã đề xuất một phƣơng pháp kết nối các WordNet synset với các nghĩa tƣơng ứng trong Wiktionary.

Ví dụ, synset {plant, works, industrial plant -- (buildings for carrying on industrial labor; "they built a large plant to manufacture automobiles")} trong WordNet sẽ đƣợc kết nối với nghĩa "A factory or other industrial or institutional building or facility" của từ "plant" trong Wiktionary. Phƣơng pháp của Meyer và Gurevych bao gồm hai bƣớc chính: rút trích các ứng viên (Candidate Extraction) và giải quyết nhập nhằng các ứng viên (Candidate Disambiguation). Rút trích các ứng viên nghĩa là xác định một tập các nghĩa ứng viên trong Wiktionary cho từng WordNet synset. Với từng WordNet synset, tác giả lấy tất cả các nghĩa trong Wiktionary của các từ đồng nghĩa và thêm vào tập các nghĩa ứng viên.

Sau khi xác định đƣợc tập các nghĩa ứng viên, tác giả sử dụng hai hàm đánh giá COS (Cosine Similarity) và PPR (Personalized PageRank Based Measure) để giải quyết nhập nhằng và xác định những kết nối đúng cho từng WordNet synset đến từng nghĩa trong Wiktionary. 5 CHƢƠNG 2 CƠ SỞ LÝ THUYẾT 2. Wikipedia Wikipedia4 là một nguồn tri thức mở to lớn của con ngƣời, đƣợc đƣa vào hoạt động chính thức vào ngày 15 tháng 1 năm 2001 nhờ hai ngƣời sáng lập Jimmy Wales và Larry Sanger, cùng với vài ngƣời cộng tác nhiệt thành. Trong những năm gần đây, Wikipedia đã phát triển rất nhanh nhờ sự đóng góp tích cực của đông đảo cộng đồng ngƣời sử dụng trên toàn thế giới và trở thành nguồn thông tin đáng tin cậy.

Tính đến tháng 5 năm 2014, cơ sở dữ liệu của Wikipedia bao gồm hơn 31,6 triệu trang Web, hơn 46 triệu ngƣời sử dụng, bao quát nhiều lĩnh vực khác nhau, hỗ trợ trên 287 ngôn ngữ khác nhau5. Theo Alexa6, hiện nay Wikipedia là một website phổ biến đứng hàng thứ sáu trên thế giới. Và theo comScore7, mỗi tháng có trung bình khoảng 495 triệu lƣợt truy cập đến Wikipedia trên toàn thế giới, trong đó 85 triệu lƣợt truy cập đến từ Mỹ. Xét về mức độ tin cậy thông tin của Wikipedia, nhiều nghiên cứu trƣớc đây đã chỉ ra rằng độ chính xác của Wikipedia có thể tƣơng đƣơng với các nguồn tri thức đóng khác.

Giles (2005) đã so sánh Wikipedia và từ điển bách khoa toàn thƣ Britannica8 bằng việc thu thập ngẫu nhiên 41 bài viết có chủ đề liên quan đến khoa học, và kết quả có 162 lỗi trên các bài viết của Wikipedia so với 123 lỗi của các bài 4 http://wikipedia.org/ 5 http:// en.org/wiki/History_of_Wikipedia 6 http://www.com/siteinfo/wikipedia.org 7 http://www.com/ 8 http://www.com/ 6 viết lấy từ Britannica. Weaver và Strickland (2006) đánh giá mức độ chính xác của liên kết giữa các bài viết trong Wikipedia đạt 97%. Điều này có thể khẳng định rằng Wikipedia có mức độ tin cậy cao và là nguồn tri thức đáng giá. Trong phạm vi luận văn này, chúng tôi sử dụng phiên bản Wikipedia vào ngày 22 tháng 7 năm 2011 làm cơ sở tri thức với số lƣợng trang cho mỗi loại đƣợc thống kê nhƣ sau: - Trang thực thể: 3,573,789 trang.

- Trang phân giải nhập nhằng: 148,818 trang. - Trang thể loại: 739,980 trang. - Trang chuyển hƣớng: 5,001,026 trang. Sau đây, chúng tôi sẽ trình bày sơ lƣợc các thành phần cơ bản của Wikipedia.

Trang thực thể Trang thực thể là thành phần quan trọng nhất của Wikipedia, mô tả chi tiết thông tin về một thực thể mà nó đề cập tới và đƣợc xác định bằng một tiêu đề (title), cũng là định danh của thực thể. Trong trƣờng hợp tiêu đề bị nhập nhằng thì sẽ có một phần văn bản phân giải nhập nhằng đi kèm phía sau và nhận diện bằng ký hiệu đóng mở ngoặc "()" hay ký hiệu dấu phẩy ",". Ví dụ, trong hình 2.1 là một phần nội dung của trang thực thể "Mouse (computing)" đƣợc trích từ Wikipedia tiếng Anh. Tiêu đề của trang thực thể này bao gồm hai phần: tiêu đề chính "Mouse" và phần văn bản phân giải nhập nhằng "computing".

Và phần văn bản phân giải nhập nhằng này giúp xác định trang thực thể đang đề cập đến chuột máy tính, chứ không phải là chuột sinh học. Ngoài tiêu đề, trang thực thể còn có một số thành phần khác nhƣ infobox, liên kết vào (in-going link), liên kết ra (out-going link)… Infobox là nội dung tóm tắt quan trọng về thực thể hoặc chứa liên kết đến các thực thể có liên hệ mật thiết; Infobox thƣờng đƣợc biểu diễn dƣới dạng một bảng (table) nằm ở góc phải ngoài cùng của một trang thực thể.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Luận Văn Thạc Sĩ Khoa Học Máy Tính: Kết Nối Từ Điển Với Wikipedia là một nghiên cứu chuyên sâu về việc tích hợp từ điển với nền tảng Wikipedia, nhằm tạo ra một hệ thống thông tin liên kết mạnh mẽ và tiện ích hơn cho người dùng. Tài liệu này không chỉ đề cập đến các phương pháp kỹ thuật để thực hiện kết nối mà còn phân tích lợi ích của việc tích hợp này, như cải thiện khả năng truy cập thông tin, tăng tính chính xác của dữ liệu, và hỗ trợ nghiên cứu học thuật. Đây là một nguồn tài liệu quý giá cho những ai quan tâm đến lĩnh vực xử lý ngôn ngữ tự nhiên và phát triển hệ thống thông tin.

Nếu bạn muốn khám phá thêm về các ứng dụng của khoa học máy tính trong xử lý ngôn ngữ, hãy xem Luận văn thạc sĩ khoa học máy tính tóm tắt văn bản tiếng việt sử dụng hệ thống học sâu. Để hiểu rõ hơn về cách phát triển các nền tảng web hiện đại, bạn có thể tham khảo Báo cáo phát triển phần mềm mã nguồn mở xây dựng website kinh doanh như ý smartphone. Ngoài ra, nếu quan tâm đến việc nâng cao tính năng website, Tiểu luận thảo luận nhóm tmu hoàn thiện tính năng website của công ty tnhh httpavanta vn avanta diagnostics sẽ là một tài liệu hữu ích. Mỗi liên kết này mở ra cơ hội để bạn mở rộng kiến thức và khám phá sâu hơn các chủ đề liên quan.