CHƯƠNG 1. TỔNG QUAN NGHIÊN CỨU Trong chương này, đề tài tập trung giải quyết các vấn đề sau: tổng quan về tình hình nghiên cứu; giới thiệu bài toán trích chọn thông tin; tổng quan về sự kiện; trích chọn sự kiện trong văn bản tin tức tiếng Việt (tin tức được đề cập là vụ tai nạn); ý nghĩa khoa học và ý nghĩa thực tiễn của bài toán trích chọn sự kiện vụ tai nạn. Bài toán trích chọn thông tin trong văn bản Theo Douglas E. Appelt, trích chọn thông tin (Information Extraction- IE) có thể được coi nằm giữa thu hồi thông tin (Information Retrieval - IR) và hiểu văn bản (Text Understanding - UT) [2].
Không giống như thu hồi thông tin chỉ tập trung vào các mẫu thông tin có liên quan trong văn bản mà không chú trọng đến việc hiểu văn bản; trích chọn thông tin còn quan tâm tới các sự kiện có liên quan trong văn bản và biểu diễn chúng dưới dạng các khuôn mẫu thông tin có liên quan trong văn bản và biểu diễn chúng dưới dạng khuôn mẫu. Khác với hiểu văn bản chỉ tập trung trên một phần nhỏ của văn bản (câu, đoạn), trích chọn thông tin quan tâm tới toàn bộ nội dung văn bản. Theo Peshkin và Pfeffer [11], trích chọn thông tin có thể được định nghĩa: như là một công việc điền thông tin vào các mẫu từ các dữ liệu chưa biết trước trong miền được định nghĩa trước. Mục tiêu của trích chọn thông tin là lấy từ văn bản các thông tin nổi bật của các sự kiện, thực thể, các mối liên hệ.
Như vậy, có thể coi trích xuất thông tin là một kỹ nghệ lấy và biểu diễn tri thức thành các thông tin có định dạng và hữu ích từ nguồn dữ liệu lớn trên Internet. Bài toán trích chọn thông tin trong văn bản có thể được phát biểu như sau: - Đầu vào: dữ liệu văn bản bất kỳ - Đầu ra: thông tin hữu ích dưới dạng có cấu trúc. Tổng quan về sự kiện Trích chọn sự kiện với vai trò trích chọn ra các thông tin có ý nghĩa từ tập dữ liệu lớn và được cộng đồng khoa học rất quan tâm và đầu tư nghiên cứu. Năm 1987, Message Understanding Conferences (MUC) được tổ chức với sự hỗ trợ của Quỹ nghiên cứu Bộ quốc phòng Hoa Kỳ7 và lần đầu tiên khái niệm event (sự kiện) được đề cập.
Sau đó, rất nhiều hội nghị được tổ chức tạo thành dãy hội nghị MUC. Với mỗi hội 2 nghị, thông tin được quan tâm khác nhau nhưng đều có đặc điểm chung là chúng được trích xuất từ dữ liệu nói về khủng hoảng (crisis). Các chủ đề trong dữ liệu thường là tội phạm, khủng bố, đánh bom… một trong những đóng góp lớn của MUC là đưa ra việc trích chọn thông tin dựa trên mẫu (scenariotemplate). Các mẫu được ban tổ chức quy định và các đội tham gia cần điền thông tin vào các mẫu này một các tự động.
Cuối cùng, các sự kiện được trích chọn gồm các thông tin: tổ chức, đối tượng tham gia (người, sự vật, sự việc), thời gian, địa điểm, số lượng…Độ chính xác (precision) và hồi tưởng (recall) của các nghiên cứu tham dự MUC nằm trong khoảng 50% đến 60% [5]. Chương trình Phát hiện và theo dõi chủ đề (Topic Detection and Tracking, TDT) được tổ chức từ năm 1997 thu hút nhiều nhóm nghiên cứu từ các trường đại học tham gia. Chương trình này được phối hợp bởi Viện Công nghệ và Chuẩn hoá quốc gia Hoa Kỳ (NIST) và DAPRA nhằm giải quyết bài toán phát hiện, theo dõi và xâu chuỗi sự kiện. Một số nhóm nghiên cứu tham gia chương trình như sau: nhóm CMU của đại học Carnegie Mellon, nhóm BBN từ công ty BBN Technologies, nhóm DRAGON của công ty Dragon, nhóm UPENN của trường đại học Pennsylvania (UPENN).
Các bài toán quan trọng của TDT gồm: Story Segmentation, Topic Tracking, Topic Detection, First Story Detection, và Link Detection. Chương trình Trích chọn nội dung tự động (Automatic Content Extraction, ACE) của đại học Pennsylvania cũng thu hút được nhiều quan tâm từ các cộng đồng nghiên cứu và trích chọn thông tin cũng như trích chọn sự kiện. Chương trình này tập trung vào các ngôn ngữ như tiếng Anh, Trung Quốc và Ả rập. Các thông tin được trích chọn gồm các thực thể, quan hệ giữa các thực thể, và các sự kiện chúng tham gia vào.
Như vậy, có thể thấy rằng trích chọn thông tin nói chung và trích chọn sự kiện nói riêng là một vấn đề quan trọng và thời đại, nhận được rất nhiều quan tâm từ cộng đồng khoa học. Trong phần tiếp theo đề tài sẽ làm sáng tỏ định nghĩa sự kiện [1.1] và trích chọn sự kiện [1. Định nghĩa sự kiện Trích chọn sự kiện lần đầu tiên được giới thiệu như một chủ đề quan trọng trong Message Understanding Conference (MUC) năm 1987 [21]. Trong MUC, một sự kiện được định nghĩa như sau: “một sự kiện có tác nhân (actor), thời gian (time), địa điểm (place) và tác động tới môi trường xung quanh”.
Trong chương trình ACE, Dodington Deorge R và cộng sự đưa ra định nghĩa sự kiện như sau: “một sự kiện là một hành động được tạo bởi những người tham gia”[22]. ACE chia sự kiện thành 8 loại khác nhau: LIFE (sự sống - chết), MOVEMENT (sự di chuyển), TRANSACTION (giao dịch), BUSINESS (kinh tế), CONFLICT (xung đột), CONTACT (giao thiệp), PERSONNEL (nhận - đổi việc), JUSTICE (pháp lý). Mỗi dạng sự kiện lại phân biệt từng dạng con. Ví dụ, LIFE có các dạng con như BE-BORN (chào đời), INJURE (bị thương), DIE (chết), hay PERSONAL có START-POSITION (vị trí khi nhận việc), END-POSITION (vị trí khi thôi việc), NOMINATE (bổ nhiệm), ELECT (bầu chọn),.
Có thể thấy rằng các nghiên cứu liệt kê ở trên đều đồng ý rằng sự kiện có thể coi như một mẫu (template) gồm nhiều các thuộc tính (elements). Quá trình trích chọn sự kiện quan tâm tới việc làm thế nào có thể điền các thông tin phù hợp từ các văn bản gốc tương ứng từng thuộc tính. Trích chọn sự kiện Trích chọn sự kiện và trích chọn thông tin có điểm gì chung? Có thể nói rằng trích chọn sự kiện là một lĩnh vực con của trích chọn thông tin. Nếu như trích chọn thông tin chỉ quan tâm các dữ liệu rời rạc (tên người, địa điểm, các con số,…) thì trích chọn sự kiện quan tâm nhiều hơn tới tính cấu trúc và mức độ liên quan của thông tin trong một sự kiện.
Từ đó, người đọc có thể dễ ràng suy luận ra các thông tin có ý nghĩa. Ví dụ, “ngay sáng ngày 30/4, trên đường Xuân Thuỷ, thủ đô Hà Nội đã xảy ra vụ tai nạn nghiêm trong làm 2 người trên xe máy bị thương nặng. Nguyên nhân bước đầu được cho là do tài xế tắc-xi đã tăng tốc khi nhận điểm nên đã xô thẳng vào xe máy đi cùng chiều.” Trong ví dụ này, trích chọn thông tin đưa ra các kết quả rời rạc như: 30/4, Hà Nội, 2 hoặc tắc xi; trong khi đó trích chọn sự kiện thì quan tâm tới một bộ các 4 thuộc tính biểu diễn cho sự kiện gồm {30/4, Hà Nội, 2 người bị thương, tắc-xi}. Rõ ràng, với tập dữ liệu trên, thông tin là hữu ích và đầy đủ hơn các thông tin rời rạc.
Một cách tổng quát, có thể coi trích chọn sự kiện trong văn bản nhận đầu vào là các văn bản phi cấu trúc và đầu ra là tri thức được biểu diễn dưới dạng thông tin có cấu trúc. Những thông tin này rất hữu ích cho việc khai thác dữ liệu như: thống kê, hệ thống giám sát, các hệ thống hỗ trợ ra quyết định. Trích chọn sự kiện có thể áp dụng cho một miền dữ liệu cụ thể như vụ tai nạn giao thông, thông tin các tour du lịch, bệnh dịch,… đồng thời đưa ra các thông tin xung quanh sự kiện đó thường bao gồm: Thời gian, địa điểm, số lượng, … Theo Grishman và cộng sự, trích chọn sự kiện là một bài toán khó do vấn đề xử lý ngôn ngữ tự nhiên (Natural Language Processing - NLP) và đặc trưng dữ liệu [21]. Dễ ràng nhận thấy trích chọn sự kiện phụ thuộc nhiều vào NLP, cụ thể là bài toán nhận dạng thực thể (Named Entity Recognition - NER).
Bên cạnh đó, dữ liệu đầu vào của trích chọn sự kiện rất đa dạng nên sẽ ảnh hưởng tới tính hiệu quả của quá trình trích chọn. Trích chọn sự kiện trong văn bản tin tức tiếng việt 1. Bài toán trích chọn sự kiện vụ tai nạn Trích chọn thông tin (Information Extraction - IE), đặc biệt là trích chọn sự kiện (Event Extraction - EE) là một lĩnh vực con trong khai phá dữ liệu (Data Mining - DM). Những năm gần đây, trích chọn sự kiện đã thu hút nhiều sự quan tâm từ các nhà khoa học.
Nó là bước đi tốt cho việc khai thác tri thức trên văn bản. Trích chọn thông tin về sự kiện vụ tai nạn như: thời gian(giờ trong ngày), thời gian (dd/mm/yyyy), thứ/tuần, tháng/năm, địa điểm xảy ra vụ tai nạn, số thương vong, phương tiện tham gia trong vụ tai nạn, phương tiện gây tai nạn, độ tuổi của người điều khiển phương tiện gây tai nạn, ngành nghề, địa hình gây tai nạn, nguyên nhân gây tai nạn. Kết quả của quá trình trích chọn được làm đầu vào cho hệ thống khai thác như thống kê và trực quan hoá trên bản đồ Việt Nam những địa điểm nóng hay xảy ra tai nạn, thời gian nào trong ngày có nguy cơ xảy ra tai nạn nhiều hơn, tháng nào hay mùa nào trong năm có nguy cơ tai nạn giao thông nhiều hơn, độ tuổi có nguy cơ xảy ra tai nạn… Những điều đó giúp ích cho các nhà quản lý có biệt pháp giúp khắc phục để 5 giảm thiểu số vụ tai nạn, đặt bảng biển báo hiệu nơi có nguy cơ tai nạn cao, có biệm pháp giáo dục người dân khi tham gia giao thông. Mặt khác, giúp người dân biết cách tự phòng tránh không để mình là mạn nhân đáng tiếc trong các vụ tai nạn.
Bài toán trích chọn sự kiện vụ tai nạn được phát biểu như sau: Đầu vào: bản tin bất kỳ trên báo điện tử Đầu ra: trích chọn những thông tin của sự kiện vụ tai nạn (nếu có). Bài toán trích chọn sự kiện vụ tai nạn được chia thành hai bài toán. Bài toán thứ nhất, phát hiện sự kiện vụ tai nạn, đầu vào là bản tin bất kỳ trên báo điện tử, bài toán phải chỉ ra đâu là sự kiện vụ tai nạn.