ĐẠI HỌC QUOC GIA TP. HCM TRƯỜNG ĐẠI HỌC BÁCH KHOA HUYNH MINH HUY PHAN GIAI NHAP NHANG THUC THE BANG PHUONG PHAP HOC MAY Chuyén nganh: Khoa Hoc May Tinh Mã số: 60. HO CHI MINH, tháng 11 năm 2013 Công trình được hoàn thành tại: Trường Đại Học Bách Khoa —- DHQG-HCM Cán bộ hướng dẫn khoa học: GS. Cao Hoàng Tru .-ẶẶẶ 22222255 «2 (Ghi rõ họ, tên, học hàm, học vi và chữ ký) Cán bộ chấm nhận xét |:.
St SE SE 1112111 E51115111 1111111 1111111111 1E xe. (Ghi rõ họ, tên, học hàm, học vi và chữ ký) Cán bộ chấm nhận Xét 2: .ct SE S S121 E1 151115811 1115151 1111111111111 1111111 xe. (Ghi rõ họ, tên, học ham, học vi và chữ ký) Luận văn thạc sĩ được bảo vệ tại: Trường Dai Hoc Bach Khoa, DHQG TP. Thanh phan Hội đồng đánh giá luận văn thạc sĩ gồm: 1.
Cao Hoàng Trụ 2.TS Phan Thị Tươi 3.TS Quản Thành Tho 4. Hồ Bảo Quốc 5. Nguyễn Hứa Phùng Xác nhận của Chủ tịch Hội đồng đánh giá LV và Trưởng Khoa quản lý chuyên ngành sau khi luận văn đã được sửa chữa (nếu có). CHỦ TỊCH HỘI DONG TRƯỞNG KHOA.
ĐẠI HỌC QUỐC GIA TP.HCM CỘNG HÒA XÃ HỘI CHỦ NGHĨA VIỆT NAM TRƯỜNG ĐẠI HỌC BÁCH KHOA Độc lập - Tự do -Hạnh phúc NHIỆM VỤ LUẬN VĂN THẠC SĨ Họ và tên học viên: HUYNH MINH HUY. Ngày, thang, năm sinh: 01/01/198S6.cccS+2<s+2 Noi sinh: TP. Chuyên ngành: KHOA HOC MAY TINH. TÊN DE TÀI: PHAN GIẢI NHAP NHANG THUC THE BẰNG PHƯƠNG PHAP ;i9 9.
NHIỆM VỤ VÀ NỘI DUNG:. St Sn SE 321111581153 11 1131151111111 111111 1111111111111 tre II. NGÀY GIAO NHIỆM VỤ: 20/08/2012. NGÀY HOÀN THÀNH NHIỆM VU: 22/11/2013.
57222 ccCcck2Ecrerrxee IV. CÁN BỘ HƯỚNG DẪN: GS. CAO HOÀNG TRỤ TP. CAN BỘ HƯỚNG DAN TRƯỞNG KHOA.
CAO HOÀNG TRỤ LỜI CÁM ƠN Trước hết, tôi xin gửi lời cảm ơn chân thành và sâu sắc đến thầy hướng dẫn của tôi, GS. Cao Hoàng Trụ. Trong suốt quá trình làm luận văn này, thay đã tận tình, kiên nhẫn chỉ dẫn tôi từng bước và thường xuyên khích lệ tôi. Sự hướng dẫn và lời khuyên quý báu từ thay là một nhân tố không thể thiếu dé tôi có thể hoàn thành được luận văn này.
Tôi cũng xin gửi lời cảm ơn đến TS. Nguyễn Thanh Hiên, người đã tạo điều kiện ban đầu cho tôi bước vào con đường nghiên cứu cũng như giúp tôi gặp được thay hướng dẫn luận văn của tôi GS:TS Cao Hoàng Trụ. Tôi xin gửi lời cảm ơn đến gia đình tôi, những người luôn ủng hộ, cỗ vũ và tạo điều kiện tốt nhất cho việc học tập và nghiên cứu của tồi. Xin chân thành biết ơn sự tận tình giảng dạy và giúp đỡ của tất cả quý thây cô tại trường Đại học Bách khoa, đặc biệt là các thay cô trong khoa Khoa học và Kỹ thuật Máy tính.
TOM TAT Trong mot van ban thuong ton tại những cum từ (nhãn tham chiếu) bị nhập nhăng. Tùy thuộc vào ngữ cảnh của văn bản mà cụm từ đó có thé mang các nghĩa khác nhau. Việc xác định chính xác đúng nghĩa cho các cụm từ như thế trong văn bản được gọi là phân giải nhập nhang. Mục tiêu của luận văn này hướng đến việc phân giải nhập nhang và ánh xạ các cụm từ xuất hiện trong văn bản vào các thực thể tương ứng trong Wikipedia.
Dựa trên phương pháp nên của Milne và Witten (2008), chúng tôi cải tiến phương pháp của họ băng việc tích hợp một số các kỹ thuật như đồng tham chiếu, heuristic, lặp cải thiện dần và sử dụng từ gốc. Kết quả nhận được tương đối khả quan, hiệu suất đều cao hơn tương đối rõ khi so sánh với phương pháp nền của Milne và Witten (2008) và phương pháp được cho là tân thời của Ratinov và các cộng sự (2011). ABSTRACT In a document, there may contain several terms (mentions) whose meanings are ambiguous. That is, depending on the context, the meaning of the same term may vary between different documents.
The task of identifying correct meaning of a term is called disambiguation. The goal of this thesis is to disambiguate and link terms to their correct referent entities in Wikipedia. Based upon Milne and Witten's work (2008), we enhancing it by integrating with various techniques; in particular, the coreference relations, heuristics, incremental and stemming. The results of our experiments show that our method achieves better performance than the baseline method, which is Milne and Witten's method (2008), and Ratinov et al's method (2011), which is considered the state-of-the-art one.
LỜI CAM ĐOAN Tôi xin cam đoan răng, ngoại trừ các kêt quả tham khảo từ các công trình khác như đã ghi rõ trong luận văn, các nội dung trình bày trong luận văn này là do chính tôi thực hiện và chưa có phân nội dung nào của luận văn này được nộp đê lây băng cấp ở một trường khác. Huynh Minh Huy MỤC LỤC 1801909922 i DANH MỤC HINHou.ceccceccccscscsssscssscsssscscscscsssscscssscsscscscsssssscscscsvsssecscsessssessscseesseeees iii DANH MỤC BẢNG. iv CHUONG 1 TONG QUAN Qieeecccccccccccccscscsssscscscscssesescscssscsesssessscsesssssssssestssssssseeteens | 1. Bài toán và phạm VI.
Các công trình lIÊn QU411.4 CHUONG 2 CƠ SỞ LÝ THUYẾTT.- ¿22 S252 SE SEEE9E2EEEEEEEEEEEEEEEEEEErErrrrkred 7 2. Thực thé và nhãn tham chiỀU. Nhận dạng nhãn tham ChiẾU. (S1 SS1 SE E1 1118 515118 5111181515111 E11E1 111158 keo 17 2.
Phân giải đồng tham chiếu .------ + ¿6E S2 SE SE£E£E£EEEEEE£EEEEEEErkrkrrerrrered 18 2. Gom cụm thực thé nam ngoài CO SỞ trl HHUC 00.-- -- c5 <1 10333010101 1111133 11111111 ng ren 22 CHƯƠNG 3 PHƯƠNG PHÁP DE XUẤTT. Phương pháp nền. Phương pháp cải tIẾn.
28 CHUONG 4 DANH GIÁ PHƯƠNG PHÁP.-- 5-5-5 252222222 £E£E£Ezezzrsred 35 “ri 0n 8 ẽẽ. Tập đánh giá. Phương pháp đánh gØ1á. -- - S000 0022299 TT ng re 37 4.
Kết quả thí nghiệm.---- ¿2-5-5 SE22SE SE E9 E23 3921212111 212111 231111111. 42 CHƯƠNG 5 TONG KKẾT. Hướng phát triển. TÀI LIỆU THAM KHẢO i DANH MỤC HÌNH Hình 1.1: Trích từ [21] cho thấy cụm từ Baghdad được chú thích thêm thông tin từ WiIKipedia, —.2: Một mô hình phân giải nhập nhang thực thé có tên [23].1: Một trang thực thé trong Wikipedia.----- - 5+5 Se+x+xczzxexererrrrerxrree 9 Hình 2.2: Các trang chuyển hướng.3: Trang phân giải nhập nhang.ccccccsscscssssesssscsessesesessesesessesssessesesssseseeeeees II Hình 2.4: Minh họa cho hệ thống phân loại của Wikipedia .5: Một ví dụ về giải thuật C4.6: Một ví dụ về các chuỗi đồng tham chiẾUu.7: Một vi dụ về øom cụm thực thể năm ngoài cơ sở tri thức.1: Mô hình tổng quát về MACH.2: Một ví dụ về truy hồi ứng viên với nhãn tham chiếu đại diện.3: Một ví dụ về heuristic lọc UNG VIÊN.
-GG SH re 30 lil DANH MỤC BANG Bang 3.1: Kết quả phân giải của các giải thuật hoc máy theo Milne.1: Các tập đánh giá phố thong .------ + 2£ 52E+EE2£E£E£E+E£EEE£ErErEzrerered 36 Bang 4.2: Cac tập đánh giá trên TÁC.3: Kết quả MAA của các phương pháp trên các tập đánh giá phố thông.4: Kết quả Fsør của các phương pháp trên các tập đánh giá phố thông.5: Kết qua MAA của các mô hình trên tập đánh giá TAC 2011 và 2012.6: Hiệu suất của MACH trên tập đánh giá TAC 2012.7: So sánh kết quả Ƒg.c„;¿+ của MACH và một số phương pháp dẫn dau 09:09.8: Số lượng đặc trưng sử dụng trong phân giải nhập nhằng. 46 IV CHUONG 1 TONG QUAN 1. Giới thiệu Ngày nay, Internet đóng một vai trò quan trọng trong việc lưu trữ và truyền tải thông tin của nhân loại. Song song đó, quá trình xuất bản tài liệu dưới dạng số và phố biến chúng thông qua Word Wide Web (thường gọi tắt là Web) đang diễn ra mạnh mẽ đã tạo nên sự bùng nỗ thông tin trên Internet.
Con người có thể dễ dàng tiếp cận được nguồn thông tin chứa đựng nhiều tri thức đáng giá nay, nhưng giữa một kho tàng tri thức không 16 như vậy, có nhiều khả năng con người sẽ bị lạc lối và không tìm được thông tin cần thiết nếu không có sự trợ giúp của công cụ hữu hiệu — có thể tự động đọc hiểu và trích rút các thông tin quan trọng từ các tài liệu trên Web. Tuy vậy, các trang web phan lớn là phi hoặc bán cấu trúc, chiếm 80% khối lượng lưu trữ trên Web; trong khi, nội dung của chúng đa phân được diễn đạt bằng ngôn ngữ tự nhiên chỉ phù hợp cho con người đọc hiểu [25]. Để máy tính có thể giúp được con người trong việc tìm kiếm thông tin thì nó phải hiểu được nội dung của văn bản, điều này thúc day nhiều kỹ thuật và ứng dụng ra đời trong đó xử lý ngôn ngữ tự nhiên (Nature Language Processing) giúp cho máy tính phan nào hiểu được ngôn ngữ con người. Hướng tiếp cận nhằm hiểu một cách đầy đủ ngữ nghĩa của một văn bản trên Web đòi hỏi phân tích ngôn từ và văn phạm được sử dụng trong văn bản phải thật chuẩn xác, nhưng đối với một nơi được cho là khá tự do và hỗn độn trong truyền tải thông tin như Internet thì điều này là không khả thi.
Một hướng tiếp cận khác hợp lý hơn là thay vì bắt buộc máy phải hiểu rõ nội dung của văn bản dưới dạng ngôn ngữ của con người thì ta chỉ cần yêu cầu chúng năm bắt được các nội dung chính quan trọng mà văn bản đó thể hiện. Các nội dung này là các chủ đề nói về các khái niệm hay về thực thể được thể hiện dưới dạng các cum tu (nhãn tham chiếu) xuất hiện trong văn bản và các mối quan hệ giữa chúng. Khai thác được các thông này sẽ giúp bố sung thêm thông tin chú thích cho nội dung các trang web dựa trên các cơ sở tri thức. Ví dụ trong một đoạn văn bản có chứa câu: "The Chicago Bulls announced yesterday that Michael Jordan will .", ta có thé xác định các thực thé trong cau gom "Chicago Bulls" là một đội bóng rổ chuyên nghiệp va "Michael Jordan" là một cầu thủ bóng rô.
Biết được thực thé trong văn ban đang nói đến đối tượng nao cũng sẽ giúp cho máy tính tìm được câu trả lời phù hợp hơn cho người dùng. Ví dụ như câu trên, "Michael Jordan" có thể là một vận động viên bóng rô hoặc là một chính trị gia người Ai-len, giả sử người dùng muốn tìm kiếm thông tin về "cầu thủ bóng rô Michael Jordan" thì việc hiểu được văn ban có chứa thực thé về cầu thủ bóng rd Michael Jordan sẽ giúp máy tinh trả về được kết quả phù hop hơn. Ngoài ra, việc máy tự động xác định các thực thé và liên kết nó với các bài viết trong nguồn tri thức như Wikipedia! sẽ giúp cho việc doc hiểu nội dung bài viết nhanh chóng hon nhờ các thông tin liên quan được chú thích dựa trên Wikipedia.