CHƯƠNG 1 TỔNG QUAN VỀ PHÂN LOẠI NỘI DUNG VĂN BẢN Trong chương này, luận văn sẽ trình bày tổng quan về xử lý và phân loại nội dung của một văn bản tiếng Việt, các phương pháp tiếp cận bài toán phân loại văn bản và các bước hay dùng trong giai đoạn tiền xử lý văn bản. Tổng quan về bài toán phân loại nội dung văn bản Trong thực tế ứng dụng quan trọng nhất của bài toán phân loại văn bản là xây dựng công cụ tìm kiếm thông tin nhanh hơn. Bài toán phân loại văn bản giúp giới hạn phạm vi tìm kiếm thông tin bằng việc phân loại được nội dung của các bài viết có liên quan đến một chủ đề nhất định, từ đó đưa ra các gợi ý đúng với mục đích tìm kiếm. Phân loại văn bản góp phần quan trọng trong việc tổ chức và quản lý hiệu quả thông tin, tri thức.
Ứng dụng phổ biến nhất của phân loại văn bản là trợ giúp cho việc tìm kiếm và lọc văn bản do đó tăng tốc độ truy cập thông tin, tối ưa hóa các kết quả đưa ra phù hợp với yêu cầu tìm kiếm. Phân loại văn bản cũng đóng vai trò quan trọng trong việc xây dựng hiệu quả các công việc quản lí thông tin như là sắp xếp loại thư điện tử, các file trong các hệ thống, phân loại nội dung các tin tức điện tử, xác minh chủ đề của thông tin để trợ giúp cho các tiến trình xử lí, duyệt, tìm kiếm các thông tin cấu trúc, các loại tài liệu mà người dùng quan tâm. Trong chương này, luận văn trình bày các khái niệm cơ bản về phân loại văn bản tự động, một vài thuật toán hay được sử dụng cho bài toán phân loại nội dung văn bản, từ đó giới thiệu một số các phương pháp nghiên cứu liên quan dựa trên cách tiếp cận học máy và một số phương pháp đánh giá hiệu năng của hệ thống phân loại văn bản tự động 1. Giới thiệu về bài toán phân loại văn bản Các nghiên cứu về khai phá dữ liệu, học máy dạng văn bản đang được quan tâm hơn trong thời gian gần đây vì số lượng các tài liệu, thông tin điện tử chứa tri thức tăng rất nhanh với rất nhiều nguồn khác nhau như mạng Internet,.
Bao gồm Luan van 4 tất cả những văn bản có cấu trúc, các văn bản không cấu trúc cũng tăng lên rất lớn. Mục đích chính của việc khai phá dữ liệu văn bản là cho phép người dùng trích xuất, rút gọn thông tin của các nguồn văn bản và sử dụng các thông tin đó để xây dựng các công cụ như: tra cứu, hỏi đáp, phân loại và tóm tắt sử dụng ngôn ngữ tự nhiên. Phân loại văn bản là một trong những bài toán quan trọng của việc khai phá dữ liệu văn bản, rất nhiều các hệ thống phân loại văn bản sử dụng kỹ thuật dựa trên tri thức (knowledge based) hoặc dựa trên các luật được xây dựng sẵn để tạo thành một tập hợp các quy tắc logic để hiểu và phân loại văn bản. Mỗi lớp (class) tương đương với một chủ đề được định nghĩa ví dụ “pháp luật”, “đời sống” ,“thể thao”.
Nhiệm vụ phân loại được bắt đầu xây dựng từ một tập các văn bản D = {d1,d2,.,dn} được gọi là tập huấn luyện và trong đó các tài liệu di được gán nhãn cj với cj thuộc tập các chủ đề C={c1,c2,. Nhiệm vụ tiếp theo đó là xác định được mô hình phân loại mà có thể gán đúng lớp để một tài liệu bất kỳ có thể phân loại chính xác vào một trong những chủ đề của tập chủ đề. 1 Mô tả bài toán phân loại nội dung văn bản [12]. Vậy phân loại văn bản là quá trình phân loại, gán nhãn (lớp) cho các tài liệu văn bản bao gồm các văn bản có cấu trúc hoặc không cấu trúc vào một tập hợp của một hay nhiều chủ đề đã được định nghĩa trước đó.
Ứng dụng bài toán phân loại văn bản Lọc thư rác Thư rác được gửi với các mục đích chính như sau: - Các thông tin sai lệch, các hình thức kiếm tiền trực tuyến không đúng sự thật nhằm lừa gạt người dùng. - Quảng cáo sản phẩm, dịch vụ của một tổ chức, công ty trên mạng - Gửi kèm virus trong tập tin kèm theo của thư điện tử, từ đó đưa virus vào vào hệ thống mạng và lấy cắp các thông tin quan trọng. - Nói xấu, xuyên tạc, tuyên truyền những điều sai trái về chính trị. Việc phân loại được nội dung thư rác sẽ giúp chúng ta loại trừ được những thư chứa các nội dung mà chúng ta không muốn tiếp cận.
Ngoài ra chúng ta có thể tránh được các nguy cơ tiềm ẩn như virus, trojan. xâm nhập vào máy tính cá nhân, hệ thống chúng ta đang sử dụng Phân loại tin tức điện tử - Ngày nay sự phát triển của mạng Internet, các tin tức điện tử có chứa thông tin, tri thức ngày càng nhiều. - Người dùng muốn tìm hiểu các tin tức điện tử liên quan đến chủ đề mà người dùng quan tâm, các hệ thống muốn phân loại các tin tức điện tử để dễ dàng quản lý. - Ứng dụng thành công bài toán phân loại điện tử giúp giải quyết được nhu cầu của người dùng cũng như các hệ thống muốn tiếp cận nhanh, chính xác cả tin tức điện tử liên quan đến chủ đề.
Xây dựng các cỗ máy tìm kiếm - Đây là ứng dụng quan trọng nhất của bài toán phân loại văn bản. - Việc phân loại văn bản sẽ giúp hệ thống tìm kiếm thông tin tổ chức, xếp xếp, quản lý thông tin do đó tăng tốc độ truy cập thông tin của hệ thống. Luan van 6 - Các văn bản đã được phân loại (gán nhãn) sẽ giúp cho hệ thống tìm kiếm dễ dàng tiếp cận, xử lý, lọc thông tin và trả lại các kết quả chính xác hơn với yêu cầu của người dùng. Mô hình cho bài toán phân loại văn bản Chúng ta có thể tưởng tượng bài toán phân loại văn bản như sau : Cho một tập gồm nn văn bản - document đầu vào kí hiệu D={𝑑1 , 𝑑2 ,., 𝑑𝑛 } bằng các kĩ thuật xử lý, thuật toán nào đó chúng ta sẽ phân tập văn bản trên vào một tập gồm mm phân lớp - categories kí hiệu là C={𝑐1 , 𝑐2 ,.
Trong phần này, luận văn sẽ giới thiệu mô hình để thực hiện phân loại văn bản vào các lớp. 2 Mô hình thực hiện bài toán phân loại văn bản [9]. Yêu cầu đối với bài toán phân loại văn bản Minh họa trực quan nhất cho việc phân loại văn bản đó chính là việc sắp xếp các tin tức trên báo vào các danh mục tương ứng như thể thao, giải trí, xã hội. như các tờ báo điện tử thường làm.
Việc này có thể được thực hiện thủ công bởi các Luan van 7 biên tập viên tuy nhiên nó rất là mất thời gian và công sức. Thay vào đó chúng ta sẽ sử dụng một số kĩ thuật học máy để tiến hành phân loại tự động các tin tức đó. Vậy để giải quyết được bài toán phân loại văn bản chúng ta cần phải nắm được: - Dữ liệu đầu vào cho việc phân loại (tin tức điện tử, bài báo khoa học, nghị luận chính trị .) - Mô hình thực hiện phân loại văn bản - Thuật toán sử dụng để phân loại văn bản - Kết quả và đánh giá. Trong luận văn này, dữ liệu đầu vào sẽ các bài báo trên mạng Internet.
Giai đoạn huấn luyện Các văn bản đầu vào được gán nhãn và được trích chọn đặc trưng để nhận dạng và sử dụng thuật toán học để lưu trữ lại các giá trị của đặc trưng theo một mô hình chuẩn Hình 1. 3 Chi tiết giai đoạn huấn luyện [5]. Giai đoạn huấn luyện gồm các bước sau: Tiền xử lý dữ liệu: là bước làm sạch dữ liệu trước khi bắt đầu bất kì xử lý nào trên tập dữ liệu, việc này bao gồm các bước xử lý ngôn ngữ tự nhiên như loại bỏ stop words (từ dừng), kiểm tra chính tả, tách từ. Tách từ: đây một bước rất quan trọng khi xử lý tiền văn bản, nhất là đối với tiếng Việt.
Bởi vì cấu trúc cũng như đặc trưng của tiếng Việt nên việc tách từ trong Luan van 8 văn bản dữ liệu đầu vào là rất quan trọng, đảm bảo tính chính xác khi thực hiện bước tiếp theo. Trích chọn đặc trưng: bằng các kĩ thuật, phương pháp, thuật toán, ta sẽ trích chọn đặc trưng các từ trong bài báo để được phiên bản cô đọng của văn bản, dễ dàng thao tác trên dữ liệu nhận được. Kết quả của bước này là dữ liệu đầu vào cho các thuật toán phân loại văn bản. Huấn luyện: đây là bước dựa vào thuật toán phân loại sử dụng và tập dữ liệu mẫu để xây dựng mô hình phân loại sử dụng cho các văn bản cần phân loại.
Giai đoạn phân lớp Đây là giai đoạn thực hiện phân loại cho một văn bản chưa có nhãn dựa trên mô hình mẫu đã được xây dựng từ giai đoạn huấn luyện. Giai đoạn này gồm các bước sau: - Trích trọn đặc trưng: văn bản đầu vào sẽ được xử lý qua một số bước như ở giai đoạn huấn luyện gồm tiền xử lý, tách từ, trích trọn đặc trưng. - Biểu diễn văn bản: sau khi trích trọn được những đặc trưng của văn bản đầu vào, chúng ta cần biểu diễn văn bản dưới các mô hình tiện cho việc thực hiện phân loại. - Phân loại: Dựa trên mô hình chuẩn đã được huấn luyên để phân loại nội dung văn bản theo đúng chủ đề.
- Đưa ra kết quả. Tiền xử lý văn bản Trong phần này, luận văn sẽ trình bày các bước cơ bản được thực hiện trong giai đoạn tiền xử lý văn bản và một số mô hình và phương pháp áp dụng để thực hiện trong giai đoạn này. Tách từ trong văn bản Khi thực hiện phân loại văn bản, trong bước tiền xử lý, việc đầu tiên cần xử lý văn bản đó chính là việc tách từ. Bời vì sự phức tạp của tiếng Việt, nên việc áp Luan van 9 dụng phương pháp phù hợp để thực hiện tách từ khi xử lý văn bản đầu vào là việc rất quan trọng.
Trong phần này luận văn giới thiệu một vài phương pháp dùng để tách từ trong văn bản Phương pháp khớp tối đa Tư tưởng của phương pháp khớp tối đa (Maximum Matching) [6] là duyệt một câu từ trái qua phải và chọn từ có nhiều tiếng nhất mà có mặt trong từ điển tiếng Việt. Thuật toán có 2 dạng sau: Dạng đơn giản: Giả sử có một chuỗi các tiếng trong câu là t1, t2, .