CHƯƠNG 1 TONG QUAN 1. Giới thiệu Ngày nay, mang xã hội ngày càng trở nên phố biến và dang ảnh hưởng đến mọi mặt của đời sống xã hội. Sự phát trién mạnh mẽ của mạng xã hội cùng với một lượng lớn các thông tin truyén tải trên đó dẫn đến một số van dé được quan tâm như: phát hiện những tin tức đồn nhảm nhăm ngăn chặn kịp thời; kiếm duyệt thông tin; phân tích hành vi, thói quen, sở thích, quan điểm của người dùng nhằm tăng hiệu quả quảng cáo trực tuyên, và nhiêu van đê khác. Một trong những mạng xã hội phố biến hiện nay là Twitter.
Twitter là dịch vụ mạng xã hội miễn phí cho phép người sử dụng đọc, nhăn và cập nhật các mẫu tin nhỏ gọi la tweet. Gidi hạn về độ dài của tweet là 140 ký tự, có tính tương thích với tin SMS (Short Message Service), mang đến cho cộng đồng mạng một hình thức tốc ký đáng chú ý, đã được sử dụng rộng rãi đối với SMS’. Với hơn hàng triệu người dùng và hàng trăm triệu tweet mỗi ngày [1] thì việc khai thác những thông tin hữu ích trên đó có thê giúp con người sử dụng vào nhiêu mục đích khác nhau. Có rất nhiều công trình nghiên cứu liên quan đến khai thác thông tin trên Twitter như: phân tích thông tin, ý kiến người dùng, sản phẩm ưa chuộng hay thông tin của nhà sản xuất được người tiêu dùng ưa chuộng: rút trích thông tin, tìm hiểu và khám phá chủ dé dé phát hiện sở thích của người dùng [2]; tìm những sự kiện mà người dùng quan tâm; hay theo dõi tình trang sức khỏe của người dùng dé phát hiện và thong kê tình hình sức khỏe xã hội [3]; phát hiện thông tin đồn nhảm.org/wiki/Twitter Ví dụ 1: Một người dung A chia sẽ trên Twitter và các bạn bè của A cũng chia sẽ ngược trở lại, nội dung như sau: A: “Nào là Clear, Head and Shoulder, Pantene cái nào cũng ko hết gau ® hichic ” B: “Dove xài tot lam! @A ơi.
` ° “X-Men number 1, tui thứ rùi nè ;-) ” 9m “Ở,. X-Men cũng ok” “ok, to sẽ mua X-Men xài. Hi vọng hit gàu và lep trai ^^” B: “n.mai tui di mua X-Men xài luôn! ” Phân tích ví dụ trên, ta thấy: người ding A dang có xu hướng chuyền sang sử dụng dầu gội đầu X-Men và không thích dầu gội Clear, Head and Shoulder và Pantene. Hai người bạn B và C cũng sử dụng dau gội X-Men.
Với ví dụ 1, chúng ta có thé khai thác thông tin trên phục vụ cho nhu cau phát hiện và phân tích hành vi, sở thích dùng cho việc quảng cáo, thu thập thông tin ý kiến người dùng. Nhưng vẫn dé đặt ra là làm sao cho máy tính có thé hiểu được “X-Men” là một nhãn hiệu dầu sội đầu “X-Men” hay là tên của bộ phim “X-Men”. Tương tự, “Head and Shoulder” cũng là tên của một nhãn hiệu dầu gội hay là hai đối tượng là “Head” và “Shoulder”. Đối với một tweet thì văn phong hoàn toàn không theo một chuẩn hay quy luật nào cả.
Nó chỉ phụ thuộc vào sở thích hay theo văn phong của người viết. Cho nên, việc phân tích ngữ nghĩa, cú pháp, nhận diện được thực thể trở nên khó khăn. Ví dụ 2: Một tweet có nội dung như sau: A: “Ronaldo, than tượng cua tui ^—^, huyền thoại cua Brazil, anh hung cua Real-Madrid.!’ “Ronaldo” là một nhãn tham chiếu có thé nói đến “Ronaldo Luis Nazario de” và “Cristiano Ronaldo”. Nhưng với ví dụ 2, thì “Ronaldo” đang đề cập trong tweet là “Ronaldo Luis Nazário de Lima” của đội tuyên Brazil, đã từng thi dau ở câu lạc bộ Real Madrid.
Không phải dé cập đến “Cristiano Ronaldo” của đội tuyên Bồ Đào Nha, cũng là một cau thủ dang thi đấu tại Real Madrid. Vấn đề đặt ra là làm sao để máy có thể tự động nhận diện được các thực thể được dé cập trong các tweet góp phan cho máy hiểu ngữ nghĩa của tweet. Mục tiêu đặt ra là để máy tính hay các hệ thống tự động có thể phân tích và hiểu được nội dung của tweet. Chăng hạn như ở ví dụ trên, việc hiểu đúng nội dung của các tweet giúp cho hệ thống phân tích đúng rang người dùng A đang nói về “Ronaldo Luis Nazário đe Lima” và xu thé là người này rất quan tâm về những tin tức có liên quan đến “Ronaldo Luis Nazário de Lima” (Hình 1.1 minh họa cho ví dụ 2).
Cristiano Ronaldo Ronaldo Luis Nazario de Lima (Kết quả mong muốn) Hình 1.1 Ví dụ phân giải nhập nhăng thực thé Ví dụ 3: Một tweet có nội dung sau: A: “Đường lythuongkiet và 3-2 dang kẹt xe” (Lúc 16h40, tại TP. Hỗ Chi Minh) Với ví dụ 3 này, nội dung của tweet đang dé cập đến 3 cụm từ chính là “Iythuongkief°, “3-2” và “TP. Hỗ Chi Minh”. Như vậy, “lythuongkiet” đang nói về hai đối tượng là “Lý Thường Kiệt” và một con đường có tên là “Ly Thuong Kiet’.
Đối với “3-2” thì đang nói về 2 đối tượng là con đường “3 thdng 2” và ngày “3 tháng 2”. Việc hiểu rõ được 2 đối tượng “lythuongkiet” và “3-2” được căn cứ vào ngữ nghĩa xung quanh 2 đối tượng này là “ket xe” và “TP. Hồ Chí Minh”. Dựa trên các yếu tố này, ta hiểu được là “/ythuongkier” là đang nói về con đường “Lý Thirong Kiệt” và “3-2” thì đang nói vé con đường “3 thang 2” (Hình].2 minh họa cho ví dụ 3).
Nhưng trong ví du này, dé máy tính có thé hiểu được 2 đối tượng “lythuongkiet” và “3-2” là một van dé gây ra không ít khó khăn. Nguyên nhân là do cụm từ “lythuongkiet” hay “3-2” bị ảnh hưởng bởi văn phong của người viết và ngữ cảnh của tweet đó. Chính vì vậy, văn phong của người viết có ảnh hưởng rất lớn đến việc nhận diện và hiệu đúng của máy tinh. Bài toán và phạm vi Chúng tôi tập trung và thực hiện việc phân giải nhập nhang thực thé trong các tweet tải trên mang xã hội Twitter, bao gdm cả tweet tiếng Anh và tweet tiếng Việt.
Tuy nhiên, giữa tiếng Anh và tiếng Việt lại có những đặc trưng khác nhau, vì vậy tùy vào ngôn ngữ mà chúng tôi thực hiện việc chọn lựa các đặc trưng, phương pháp và thuật toán phù hợp để đạt được kết quả tốt nhất. Chúng tôi chỉ quan tâm đến các thực thể tôn tại trong Wikipedia. Các công trình liên quan Bài toán phân giải nhập nhang thực thé chú trọng đến việc phân giải các thực thé và đa số được áp dụng cho các văn bản chính quy (có nội dung dai và tương đối day đủ về mặt ngữ nghĩa). Đối với các văn bản tiếng Anh thường được viết tuân theo các luật như tên riêng phải viết hoa, tên phải được đặt trước họ, đầu câu phải viết hoa, không có các ký hiệu đặc biệt (như: ^^, ;-),.
Còn đối với tiếng Việt thì phải viết đúng chính tả, bỏ dau đúng quy định, tên riêng phải viết hoa,. Cho nên, việc phân giải nhập nhang thực thé cho một văn bản chính quy thì khác với việc phải phân giải nhập nhăng thực thể cho mạng xã hội. Vẫn đề khác biệt mà chúng tôi dé cap ở day đó là quá trình nhận diện các thực thể xuất hiện trong nội dung tweet và quá trình phân giải nhập nhằng cho các thực thể đó. Các công trình nghiên cứu liên kết thực thể hay phân giải nhập nhăng thực thể cho tweet thực hiện theo nhiều hướng và phương pháp khác nhau.
Một số công trình nghiên cứu gan đây và nỗi bật như công trình của Meij, Cassidy, Liu,. [ “lythuongkiet” Lý Thường Kiệt Nha Thi Đầu Đa Š Nang Phu Thọ =. ye » San Van ong Duong Ly Thuong Kiét va Duong 3 thang 2 Tại Thanh phô Hồ Chí Minh | “Tp. Hỗ Chí Minh”.
Kết quả cần đạt được Hình 1.2 Ví dụ về phân giải nhập nhang thực thé Công trình nghiên cứu của Meij Công trình của Meij [4] chủ yếu là tìm các khái niệm có liên quan đến nội dung của tweet tiếng Anh (Hình 1.3 mô tả về hệ thống của Meij). Các khái niệm được tác giả đề cập ở đây là các trang thực thể trong Wikipedia. High Precision N-gram -— sl : Lesicd Danh sách KN ứng viên “- L€XIC Danh sách KN ứngẹ viên ai 1e bse tal Danh sach | “ching, ”: Mae 1 ik? | - RF Š My-> ->T,(t. ty) Ty tise † tye «+ E1 Nhãn tham chiếu M={m;.
ren my Taitays tạ oo tỷ mmmin> T;ftyy ays vs tý Mey =i sf na NA S. m ~> Ta{t v Pent 2 1ì -> li t.3 Mô ta tong quan hệ thống của Meij Hệ thống này sử dụng phương pháp n-gram dé tìm các nhãn tham chiếu có thé trong nội dung của tweet. Một n-gram được xem là nhãn tham chiếu nếu n-gram đó so khớp với một nhãn liên kết trong Wikipedia. Sau đó, tiến hành tìm các thực thể ứng viên cho các nhãn tham chiêu vừa tìm được.
Giai đoạn cuôi cùng là dùng học máy dé cho điêm và xêp hạng cho các thực thê ứng viên. Cho nên, mục tiêu chính của hệ thong này chủ yêu là tìm và cho điêm các thực thê ứng viên đê thu được khái niệm gân nhât cho các nhãn tham chiêu trong tweet. Công trình nghiên cứu của Cassidy Khác với nghiên cứu của Meij, nghiên cứu của Cassidy [1] dùng một hệ thống phân giải nhập nhang dành cho văn bản tiếng Anh gọi là GLOW [5] dé áp dụng cho quá trình phân giải nhập nhang thực thé cho tweet (Hình 1.4 mô tả về hệ thống của Cassidy). GLOW dựa trên việc sử dụng các đặc trưng cục bộ và toàn cục như: mỗi quan hệ giữa nhãn tham chiếu và thực thể, mối quan hệ giữa các thực thể với nhau và mỗi quan hệ giữa các nhãn tham chiếu với nhau.
Điểm khác biệt là nội dung của tweet thì quá ngắn và quá ít thực thé, thiếu ngữ cảnh; trong khi đó hệ thống GLOW lại dùng cho văn bản dài và giàu ngữ cảnh; cho nên nghiên cứu này lẫy ý tưởng chính là làm giàu ngữ cảnh cho tweet. Việc làm giàu ngữ cảnh cho tweet được tác giả thực hiện theo hai phương pháp chính là: gom nhóm các tweet theo tác giả và gom nhóm các tweet theo chủ đê. Thê nhưng, với việc làm giàu ngữ cảnh như vậy cho tweet thì gặp phải một số van dé cần quan tâm. Đó là: - Néu gom nhóm theo tác giả thì không thé xác định là các tweet này có liên quan nội dung với nhau hay không.
Cho nên, ngữ cảnh được tạo ra khi gom nhóm theo phương pháp này sẽ rời rạc và mức độ liên quan về ngữ nghĩa sẽ không cao. - Néu gom nhóm theo chủ dé thì các tweet có thé cùng một chủ đề nhưng về mức độ ý nghĩa cua từng tweet thì không rõ ràng.