Chương 1.1 Vấn đề và tình hình nghiên cứu Xuất phát từ lượng thông tin, dữ liệu gia tăng không ngừng trên internet và nhu cầu tìm kiếm, phân loại thông tin văn bản từ các trang web, bài toán rút trích thông tin di sớm xuất hiện từ những năm cuối thập kỷ 1970, là tiền thân của phương pháp xử lý ngôn ngữ tự nhiên hiện nay. Trong khi đó, bài toán phân lớp văn bản có sự nhen nhóm trước đó, từ những năm 1960. Nhưng mãi cho đến những năm 1980, phân loại văn bản mới có nhiều bước tiến rõ nét. Phương pháp phân loại văn bản đầu tiên phải kể đến là Knowledge Engineering (1980).
Phương pháp này dựa trên một tập luật được mã hóa bởi kiến thức chuyên gia để phân loại tài liệu dựa trên danh mục có sẵn. Năm 1990, phân loại văn ban đã trở thành một nhánh chính của hệ thống thông tin. Các cách tiếp cận lúc này chủ yếu dựa trên machine learning dé xây dựng tiến trình phân loại văn bản tự động. VAn đề rút trích tự động các ý trong văn bản nhận được nhiều sự quan tâm của các nhà công nghệ thông tin trên thế giới.
Có thể thấy rõ nhất là qua công cụ AutoSumarize trong phần mềm Microsoft Word của tập đoàn Microsoft [4]. Phần mềm này dựa trên số lượng của từ được lặp lại nhiều lần trong mỗi câu dé đưa ra gợi ý cho người dùng. Ngoài ra, còn có một số nghiên cứu, bài báo liên quan đến vấn đề xử lý ngôn ngữ tự nhiên dựa trên phương pháp tiếp cận học máy, đánh giá tự động phần tóm tắt dựa trên N-gram kết hợp với thống kê tần suất. Các đề tài trên chủ yếu tập trung vào xử lý các văn bản tiếng Anh.
Nếu áp dụng vào tiếng Việt, độ chính xác giảm đi rất nhiều do sự khác biệt về ngôn ngữ và đặc điểm phức tạp của tiếng Việt[7]. Bên cạnh đó, một số công trình nghiên cứu trong nước đã được thực hiện bởi các chuyên gia công nghệ thông tin như: đề tài Rứt trich ý chính từ văn bản tiếng Việt hỗ trợ tạo tóm tắt nội dung (GS.TSKH Hoàng Kiếm và TS. Đỗ Phúc), đề tài Xây dựng hệ thống tự động rút trích nội dung chính trong các văn bản điện tử tiếng Việt (Đỗ Văn Long, Châu Thu Trân, Dương Quốc Thắng và Trần Minh Vũ, Phân viện công nghệ 8 thông tin Viện Khoa học và công nghệ, Thành phó Hồ Chí Minh, Việt Nam). Đề tài là sự kết hợp giữa việc phân loại văn bản theo cấu trúc của nhà ngôn ngữ với kỹ thuật xử lý ngôn ngữ tự nhiên của tin học.
Ý tưởng chính của hệ thống là rút trích nội dung chính của văn bản từ việc xác định những đặc trưng và cấu trúc văn bản thông dụng. Phương pháp này tạo ra một bản tóm tắt cô đọng, đủ ý thông qua việc thu thập và tập hợp các câu, cụm từ mang nội dung chính trong văn bản [4]. Đề tài Nghiên cứu các phương pháp rút trích thông tin trên web, xây dựng bộ công cụ hỗ trợ soạn thảo và sưu tập tài liệu tham khảo trên web, hỗ trợ soạn thảo các giáo trình đào tạo và đề tài Nghiên cứu các phương pháp xác định cấu trúc cây tổng quát cho phân đa lớp văn ban (PGS. Có thể thấy nhiều nghiên cứu đi theo hướng cụ thể, chú trọng sâu vào các phương pháp nhằm đem lại tính hiệu quả và tối ưu cho vấn đề rút trích và phân lớp văn bản.
Điều này cho thấy tầm quan trọng và cần thiết của bài toán rút trích thông tin và phân lớp văn bản trong thời đại internet toàn cầu hóa như hiện nay. 12 Mục tiêu Đến thời điểm hiện tại, nhiều nghiên cứu cải tiền kỹ thuật rút trích, phân lớp, phân đa lớp văn bản ra đời. tạo ra những bước tiến mới trong phát triển công nghệ. Ti lệ thuận theo đó là trình độ công nghệ thông tin của con người ngày càng được nâng lên, kéo theo nhu cầu ngày càng cao trong việc khai thác thông tin.
Do đó, cần thiết tăng cường nghiên cứu và thử nghiệm những giải pháp cải tiến mới trong trích lọc và phân lớp thông tin. Trong các phương pháp phân lớp văn bản, Support Vector Machines (SVM§) là phương pháp phân lớp cho độ chính xác cao và được sử dung rất phô biến hiện nay. Theo nhu cầu khai thác thông tin thực tế, người dùng cần sử dụng các chiến lược để phân đa lớp văn bản. Trong khi đó SVMs chỉ tập trung vào phân loại văn bản thành hai lớp.
Do đó, cần thiết nghiên cứu, đề xuất các phương pháp kết hợp SVMs và các chiến lược khác đề vừa tạo độ chính xác trong phân lớp, vừa đáp ứng yêu cầu phân đa lớp văn bản trong thực tế. DDAG là một trong những phương pháp phân đa lớp sử dụng SVMs phô biến nhất hiện nay và được sử dung rat rộng rãi, cho kết quả phân lớp cao. Hạn chế của phương pháp này là vẫn chưa có phương pháp cụ thé dé xác định cấu trúc tối ưu cho đồ thị, độ phức tạp cao. Trong khi đó, HAH là chiến lược sử dụng phương pháp đệ quy chia nhỏ các tập dữ liệu thành các cây con cho đến khi phân loại được chúng nhưng lại có hạn chế là chưa xác định được các tập lớp con tối ưu, chưa đáp ứng được các ứng dụng thực tế.
Do đó can phải cải tiên các chiến lược này để tăng độ chính xác và hiệu quả trong phân đa lớp văn bản. Đã có rất nhiều nghiên cứu về rút trích thông tin và phân đa lớp văn bản với nhiều phương pháp nồi bật. Trong nội dung khóa luận này, học viên xin đi vào tìm hiểu một số phương pháp rút trích và phân lớp văn bản tiêu biểu. Đặc biệt, khóa luận chú trọng nghiên cứu phương pháp HAH và DDAG, thử nghiệm, đưa ra thuật toán cải tiến và cài đặt chương trình kiểm chứng.
Lấy dữ liệu là các văn bản dạng text trên các website internet thuộc một số lĩnh vực đặc trưng như: giao thông, y tế, môi trường, pháp luật, và các lĩnh vực khác. Dữ liệu được tải về sẽ đi vào quá trình trích lọc thông tin và phân lớp các văn bản này. Mục tiêu trọng tâm của khóa luận là tìm hiểu, đề xuất một mô hình thuật toán rút trích thông tin và phân đa lớp văn bản dựa trên nền tảng các phương pháp, chiến lược đã có, ở đây, khóa luận sử dụng hai chiến lược phân đa lớp là Half — Against — Half (HAH) và Dicision Directed Acyclic Graph (DDAG). Đồng thời, cài đặt và kiểm chứng thuật toán đề xuất bằng các nguồn dữ liệu tin cậy.
RÚT TRÍCH THÔNG TIN 2.1 KHÁI NIỆM Rút trích thông tin (Information Extraction) là một kỹ thuật, một lĩnh vực nghiên cứu có liên quan đến truy vấn thông tin (Information Retrieval), khai thác dit liệu (Data mining), cũng như xử lý ngôn ngữ tự nhiên (Natural Language Processing). Mục tiêu chính của rút trích thông tin là tim ra những thông tin cấu trúc từ văn bản không cấu trúc hoặc bán cấu trúc. Rút trích thông tin sẽ tìm cách chuyền thông tin trong văn bản không hay bán cấu trúc về dạng có cấu trúc và có thé biểu diễn hay thể hiện chúng một cách hình thức dưới dạng một tập tin cấu trúc XML hay một bảng cấu trúc (như bảng trong co sở dữ liệu chẳng hạn). Với nhiều định nghĩa từ những nghiên cứu khác, rút trích thông tin là quá trình thiết lập cấu trúc và kết hợp một cách có chọn lọc các dữ liệu được tìm thấy, xuất hiện trong một hay nhiều tài liệu văn bản [9].
Rút trích thông tin thuộc lĩnh vực nghiên cứu hẹp của xử lý ngôn ngữ tự nhiên và xuất phát từ việc xác định những thông tỉn cụ thể từ một tài liệu ngôn ngữ tự nhiên. Mục đích của rút trích thông tin là chuyên văn bản về dạng có cấu trúc. Thông tin được rút trích từ những nguồn tài liệu khác nhau và được biéu diễn đưới một hình thức thống nhất. Những hệ thống rút trích thông tin văn bản không nhằm mục tiêu hiểu văn bản đưa vào, mà nhiệm vụ chính của nó là tìm kiếm các thông tin cần thiết liên quan, mà chúng ta mong muốn được tìm thấy.
Thành phần cốt lõi của các hệ thống rút trích thông tin là một tập hợp các luật và mẫu dùng dé xác định những thông tin liên quan cần rút trích. Rút trích thông tin còn được coi là quá trình truy vấn những thông tin cấu trúc từ những văn bản không cấu trúc. 11 Hệ thống rút trích thông tin tiến hành phân tích văn bản nhằm trích ra những thông tin cần thiết theo các dạng được định nghĩa trước, chẳng hạn như những sự kiện, các thực thể và các mối quan hệ [6]. Khi dữ liệu, thông tin từ các nguồn khác nhau, từ internet có thể biểu diễn một cách hình thức, có cấu trúc, ta có thể sử dụng các kỹ thuật phân tích, khai thác dữ liệu (data mining) để khám phá ra các mẫu thông tin hữu ích.
Chẳng hạn việc cấu trúc lại các mẫu tin quảng cáo, mẫu tin bán hàng trên internet có thể giúp hỗ trợ tư vấn, định hướng người dùng khi mua sắm. Việc rút trích và câu trúc lại các mẫu tin tìm người, tìm việc sẽ giúp cho quá trình phân tích thông tin nghề nghiệp, xu hướng công việc,. hỗ trợ cho các người tìm việc, cũng như nhà tuyển dụng. Rút trích thông tin không đòi hỏi hệ thống phải đọc hiểu nội dung của tài liệu văn bản, nhưng hệ thống phải có kha năng phân tích tài liệu và tìm kiếm các thông tin liên quan mà hệ thống mong muốn được tìm thấy.
Các kỹ thuật rút trích thông tin có thé áp dụng cho bắt kỳ tập tài liệu nào mà chúng ta cần rút ra những thông tin chính yếu, cần thiết cũng như các sự kiện liên quan. Các kho dữ liệu văn bản về một lĩnh vực trên internet là ví dụ điền hình, thông tin trên đó có thé tồn tại ở nhiều nơi khác nhau, dưới nhiều định dạng khác nhau. Sẽ rất hữu ích cho các khảo sát, ứng dụng liên quan đến một lĩnh vực néu như những thông tin lĩnh vực liên quan được rút trích và tích hợp lại thành một hình thức thống nhát và biéu diễn một cách có cau trúc. Khi đó thông tin trên internet sẽ được chuyền vào một cơ sở dữ liệu có cấu trúc phục vụ cho các ứng phân tích và khai thác khác nhau.2 PHƯƠNG PHÁP 2.1 Sử dụng Wrapper Wrapper là phương pháp rút trích thông tin phổ biến từ các trang web.
Một wrapper được xem như một thủ tục thiết kế để rút trích nội dung của một nguồn thông tin cụ thể.