CHƯƠNG 1 TỔNG QUAN BÀI TOÁN KẾ THỪA VĂN BẢN TRÊN DỮ LIỆU TWITTER Chương này của luận văn trình bày nội dung chính là: Giới thiệu chung về lĩnh vực xử lý ngôn ngữ tự nhiên và các ứng dụng trong thực tế. Giới thiệu về bài toán phát hiện kế thừa văn bản và phát hiện kế thừa văn bản trên dữ liệu Twitter. Giới thiệu về mạng xã hội Twitter và tổng quan về bài toán phát hiện kế thừa văn bản trên dữ liệu Twitter. Các nghiên cứu liên quan đến bài toán dã được thực hiện và đưa ra trên thế giới cũng như ở Việt Nam Trình bày các nội dung sẽ thực hiện trong luận văn để đạt được mục tiêu đặt ra, các nghiên cứu, đóng góp của luận văn 1.
Giới thiệu về xử lý ngôn ngữ tự nhiên Xử lý ngôn ngữ tự nhiên (natural language processing – NLP) [4] [9] là một lĩnh vực nghiên cứu của trí tuệ nhân tạo, tập trung vào nghiên cứu các phương pháp, kỹ thuật cho phép xử lý ngôn ngữ tự nhiên bằng máy tính, từ đó xây dựng các chương trình, hệ thống máy tính xử lý ngôn ngữ của con người. Xử lý ngôn ngữ tự nhiên được áp dụng trong nhiều bài toán và ứng dụng thực tế, trong nhiều lĩnh vực: Nhận dạng chữ viết: Có hai kiểu nhận dạng. Thứ nhất là nhận dạng chữ in, thứ hai, phức tạp hơn là nhận dạng chữ viết tay, có khó khăn bởi vì chữ viết tay không có khuôn dạng rõ ràng và thay đổi từ người này sang người khác. Với chương trình nhận dạng chữ viết in có thể chuyển hàng ngàn đầu sách trong thư viện thành văn bản điện tử trong thời gian ngắn.
Nhận dạng chữ viết của con người có ứng dụng trong khoa học hình sự và bảo mật thông tin (nhận dạng chữ ký điện tử). Luan van 5 Nhận dạng tiếng nói: Nhận dạng tiếng nói rồi chuyển chúng thành văn bản tương ứng. Giúp thao tác của con người trên các thiết bị nhanh hơn và đơn giản hơn. Đây cũng là bước đầu tiên cần phải thực hiện trong ước mơ thực hiện giao tiếp giữa con người với robot.
Nhận dạng tiếng nói có khả năng trợ giúp người khiếm thị rất nhiều. Tổng hợp tiếng nói: Từ một văn bản tự động tổng hợp thành tiếng nói. Giống như nhận dạng tiếng nói, tổng hợp tiếng nói là sự trợ giúp tốt cho người khiếm thị, nhưng ngược lại nó là bước cuối cùng trong giao tiếp giữa robot với người. Dịch máy (machine translate): Như tên gọi đây là chương trình dịch tự động từ ngôn ngữ này sang ngôn ngữ khác.
Tìm kiếm và truy xuất thông tin: Đặt câu hỏi và chương trình tự tìm ra nội dung phù hợp nhất. Thông tin ngày càng đầy lên theo cấp số nhân, đặc biệt với sự trợ giúp của internet việc tiếp cận thông tin trở lên dễ dàng hơn bao giờ hết. Việc khó khăn lúc này là tìm đúng nhất thông tin mình cần giữa bề bộn tri thức và đặc biệt thông tin đó phải đáng tin cậy. Tóm tắt văn bản: Từ một văn bản dài tóm tắt thành một văn bản ngắn hơn theo mong muốn nhưng vẫn chứa những nội dung thiết yếu nhất.
Khai phá dữ liệu: Từ rất nhiều tài liệu khác nhau phát hiện ra tri thức mới. Thực tế để làm được điều này rất khó, nó gần như là mô phỏng quá trình học tập, khám phá khoa học của con người, đây là lĩnh vực đang trong giai đoạn đầu phát triển. Khát quát về kế thừa văn bản Trong cuộc sống hằng ngày, bằng việc sử dụng ngôn ngữ tự nhiên, chúng ta có thể diễn đạt một vấn đề theo nhiều cách khác nhau với các từ ngữ và cấu trúc cú pháp khác nhau. Vấn đề biến đổi này trong biểu diễn ngữ nghĩa có thể được xem như là vấn đề nhập nhằng trong ngôn ngữ tự nhiên.
Các ứng dụng trong xử lý ngôn ngữ tự nhiên như: hệ hỏi đáp (QA), trích xuất thông tin (IE), tóm tắt văn bản (Summarization), và đánh giá dịch máy MT) cần một Luan van 6 mô hình cho hiện tượng biến đổi này để phát hiện xem một ý nghĩa cụ thể nào đó có được suy luận ra từ các biến thể văn bản khác nhau hay không. Vào năm 2004, phát hiện kế thừa văn bản (RTE) đã được đề xuất như một bài toán tổng quát để thu thập các nhu cầu liên quan đến suy luận ngữ nghĩa trên nhiều ứng dụng xử lý ngôn ngữ tự nhiên. Từ năm 2004 đến nay, hội nghị RTE đã tổ chức thường niênhàng năm (RTE-1 đến RTE-8) nhằm mục đích đánh giá, so sánh các phương pháp tiếp cận của các nhà nghiên cứu. Ba hội nghị RTE đầu tiên (RTE- 1 năm 2005, RTE-2 năm 2006 và RTE-3 năm 2007) được tổ chức tại chuỗi PASCAL (Pattern Analysis, Statistical Modeling and Computational Learning).
Các hội nghị RTE còn lại (RTE-4 năm 2008,RTE-5 năm 2009, RTE-6 năm 2010, RTE-7 năm 2011 và RTE-8 năm 2012) được tổ chức thuộc hội nghị Phân tích xử lý văn bản (TAC: Text Analysis Conference) của NIST (National Institute of Standards and Technology). Hội nghị Phân tích và xử lý văn bản TAC được tổ chức để khuyến khích nghiên cứu xử lý ngôn ngữ tự nhiên và các ứng dụng liên quan bằng cách cung cấp tập các dữ liệu kiểm thử lớn, các thủ tục đánh giá và một diễn đàn để các nhóm nghiên cứu chia sẻ kết quả của họ. Khái niệm kế thừa văn bản Hiện nay, khái niệm kế thừa văn bản có thể định nghĩa theo nhiều cách khác nhau. Theo Glickman và Dagan [3], kế thừa văn bản là một mối quan hệ giữa một văn bản T nhất quán T với một thể hiện ngôn ngữ của nó – giả thuyết H (H là một hệ quả của T), ký hiệu là T → H nếu như ý nghĩa của H, đặt vào ngữ cảnh của T thì có thể suy ra ý nghĩa của H.
Một cách chung nhất thì văn bản T được gọi là kế thừa giả thuyết H nếu như sự thật về H có thể suy luận được từ T. Điều này có nghĩa là T bao hàm ý nghĩa của H khi đọc cả hai. Do vậy, ta có thể nói T kế thừa H khi một số biểu diễn của H có thể trùng khớp (qua một số bước chuyển đổi bảo toàn ngữ nghĩa) với một số (hoặc một phần của) các biểu diễn của T, ở một cấp độ chi tiết và trừu tượng nhất định. Luan van 7 Dưới đây là một số ví dụ minh họa để giải thích về khái niệm kế thừa văn bản.
STT Văn bản Giả thuyết Kế thừa Bountiful đã tới saiu khi chiến tranh kết thúc, cập vịnh San Francisco vào ngày 21 tháng 8 năm 1945.Bountiful sau đó được chỉ Bountiful đã tới San 1 định làm tài bệnh viện ở Yokosuka, khởi Francisco vào tháng 8 YES hành từ San Francisco vào ngày 1 tháng 11 năm 1945. Tập đoàn Boeing đặt tại Chicago đã hủy bỏ Trụ sở của tập đoàn 2 ba đơn hang vào năm 2006 mà Air Canada Boeing năm ở NO đã đặt. Canada Dưới tiêu đề “Greed instead of quanlity”, Hai quỹ đầu tư của Die Tageszeitung của Đưucs nói chẳng có 3 Anh và Mỹ đã thâu YES điều tốt đẹp việc thâu tóm xuất bản Berliner tóm Berliner Verlag. Verlag của hai quỹ đầu tư của Anh và Mỹ.
Scott Island đã được thuyền trưởng William Thuyền trưởng Scott Colbeck người chỉ huy của Morning, con tài đã đặt chân tới đảo 4 cứu viện cho cuộc viễn chinh của thuyền NO Scott Island vào trưởng Robert F.Scott, tìm ra vào tháng 12 tháng 12 năm 1902 năm 1902 Chiếc xe hơi đã và vào hòm thư thuộc về Clark là người họ 5 James Clark, 68 tuổi, một người quen của NO hang của Jones gia đình James Jones.1: Ví dụ về kế thừa văn bản 1. Phát biểu bài toán phát hiện kế thừa văn bản Bài toán phát hiện kế thừa văn bản là bài toán xác định quan hệ kế thừa giữa văn bản T và giả thuyết H. Việc phân loại mối quan hệ kế thừa giữa văn bản và giả thuyết có thể theo 2 cách dựa trên số nhãn kế thừa mà hệ thống gán cho một cặp văn bản giả thuyết. Phân loại kế thừa 3 lớp bao gồm các nhãn : Kế thừa: Khi T kế thừa H.
Luan van 8 Mâu thuẫn: Khi T không kế thừa H. Không xác định: Khi không có đủ điều kiện để xác định xem T kế thừa H hay không. Phân loại kế thừa 2 lớp: Trong phân loại 2 lớp, mối quan hệ mâu thuẫn và không xác định đều được phân vào lớp “Không kế thừa”. 2 lớp sử dụng là: Kế thừa: Khi T kế thừa H.
Không kế thừa: Khi nội dung trong T mẫu thuẫn với nội dung trong H hoặc không xác định được quan hệ giữa T và H. Hiện nay, đa số các hệ thống phát hiện kế thừa sử dụng sự phân lớp nhị phân (hai nhãn). Việc phán quyết kế thừa được gán nhãn là YES/NO (YES: trong trường hợp kế thừa và NO nếu ngược lại). Trong khóa luận này, em tiến hành thực nghiệm theo nhãn nhị phân như trên.
Dựa trên tiếp cận về quan hệ kế thừa trên, bài toán được phát biểu như sau: Đầu vào: Tập các cặp câu văn bản T và giả thuyết H thuộc cùng một chủ đề. Đầu ra: Gán nhãn kế thừa YES/NO với từng cặp. Phát hiện kế thừa văn bản trên dữ liệu Twitter 1. Khái niệm Sự bùng nổ thông tin được viết bằng các ngôn ngữ khác nhau trên web đã giúp cho người sử dụng có cơ hội tiếp cận và truyền tải thông tin về một chủ đề bằng ngôn ngữ của họ.
Với sự phát triển nhanh chóng và mạnh mẽ của những mạng xã hội hiện đại như ngày nay như: facebook, google +, twitter, v. Việc ứng dụng phát hiện kế thừa văn bản trong hệ hỏi đáp (QA), trích xuất thông tin (IE), tóm tắt văn bản (Summarization), và đánh giá dịch máy MT) cần một mô hình cho hiện tượng biến đổi này để phát hiện xem một ý nghĩa cụ thể nào đó có được suy luận ra từ các biến thể văn bản khác nhau. Đã có nhiều công trình nghiên cứu liên quan đến bài toán phát hiện kế thừa văn bản theo các phương pháp khác nhau từ nhiều nguồn dữ liệu mà Twitter là một nguồn dữ liệu phổ biến.5 Facebook Twitter 1 Google+ 0.1: Số lượng người sử dụng một số mạng xã hội lớn[17] Bài toán kế thừa văn bản dữ liệu trên mạng xã hội Twitter là một bài toán nhằm phát hiện sự kế thừa về thực thể trên mạng xã hội Twitter. Tuy nhiên, việc kế thừa văn bản với dữ liệu Twitter gặp khá nhiều khó khăn và thách thức.
Khác với các văn bản truyền thống, các tweet rất ngắn (tối đa 140 ký tự).