Mở đầu. Trình bày lý do chọn đề tài, mục tiêu, đối tượng và phạm vi nghiên cứu của đề tài. Chương 2 - Cơ sở lý thuyết. Phân tích và đánh giá các hướng nghiên cứu liên quan đến luận văn của nhóm tác giả trong và ngoài nước liên quan đến bài toán mà học viên đang nghiên cứu.
Trình bày những vấn đề còn tồn động và những vấn đề mà nhóm tập trung giải quyết. Trình bày nội dung lý thuyết của những phương pháp Support Vector Machine, Naïve Bayes và các phương pháp học sâu như CNN, LSTM, mô hình ngôn ngữ BERT. Chương 3 – Phương pháp thử nghiệm. Mô hình cho bài toán phân loại văn bản dựa trên phương pháp máy học, học sâu.
Chương 4 - Thí nghiệm và kết quả. Trình bày các công đoạn tiền xử lý ngữ liệu, đưa ra các thông số cho ngữ liệu mà học viên đã cài đặt. Trình bày kết quả đạt được trong thí nghiệm. Chương 5 - Chương trình minh họa Chương 6 - Kết luận và hướng phát triển.
Cuối cùng, tôi xin tổng kết lại các kết quả quan trọng trong đề tài đã nghiên cứu và thực hiện, đưa ra các hạn chế và hướng phát triển của đề tài mà nhóm định hướng. 5 CHƯƠNG 2: CƠ SỞ LÝ THUYẾT 2.1 Nghiên cứu liên quan Phân loại văn bản là một bài toán xử lí văn bản cổ điển, đó là phân loại một văn bản vào một chủ đề đã biết trong một tập hữu hạn các chủ đề dựa trên ngữ nghĩa của văn bản. Do đó, bài toán này đã được nghiên cứu trên các ngôn ngữ khác nhau và trong đó có tiếng Việt. Sau đây học viên sẽ trình bày các nghiên cứu liên quan đến bài toán phân loại văn bản trong và ngoài nước.1 Nghiên cứu ngoài nước Trên thế giới đã có nhiều công trình nghiên cứu đạt những kết quả khả quan, nhất là đối với phân loại văn bản tiếng Anh.
Đối với các mô hình máy học truyền thống, chúng ta có các công trình điển hình như sau: Tác giả ThorstenJoachims và cộng sự [1] đã trình bày về việc sử dụng và cải tiến kĩ thuật Support Vector Machines (SVM) cho việc học máy có hiệu quả trong việc phân loại văn bản. Nhóm tác giả Tong Zhang và Franks J. Oles [2] đã nghiên cứu phương pháp phân loại văn bản tuyến tính áp dụng các kĩ thuật máy học khác nhau như Linear Least Squares Fit, Logistic Regression, SVM và cho kết quả tốt trên bộ dữ liệu kiểm tra. Cụ thể, các tác giả đã chứng minh được phương pháp SVM cho hiệu quả tốt nhất trong các phương pháp thử nghiệm.Tác giả Fabrizio Sebastiani [3] đã trình bày ba giai đoạn trong một hệ thống phân loại văn bản: lập chỉ mục tài liệu văn bản dùng LSI (Latent Semantic Index), học tập phân loại văn bản dùng SVM và Boosting, và đánh giá phân loại văn bản.
Bên cạnh đó, với sự phát triển của các phương pháp biểu diễn văn bản khác nhau như là BoW, TFIDF, word2vec và sự phát triển của các mô hình học sâu như mạng tích chập CNN, mạng hồi quy LSTM thì các kết quả nghiên cứu cho bài toán phân loại văn bản đạt những thành tựu nhất định. Mô hình học sâu bao gồm các mạng thần kinh nhân tạo mô phỏng não người để tự động học các tính năng cấp cao từ dữ liệu, thu được kết quả tốt hơn các mô hình truyền thống trong các bài toán khác nhau của trí tuệ nhân tạo như nhận dạng giọng nói, xử lý hình ảnh và phân loại văn bản. Do đó, nhiều mô hình học sâu đã được đề xuất trong vài thập kỷ qua để phân loại văn bản. Trong đó, nổi bật nhất tác giả Kim [4] đã trình bày một nghiên cứu thực nghiệm đánh giá hiệu quả của mô hình mạng tích chập CNN cho bài toán phân loại văn bản khác nhau và cho kết quả tốt, mở ra một hướng tiếp cận mới cho các bài toán trên bộ dữ liệu phân loại văn bản.
Tiếp theo sau đó, thay vì sử dụng mô hình mạng tích chập CNN trên mức độ từ vựng như tác 6 giả Kim [4], tác giả Yang và các cộng sự đã nghiên cứu thử nghiệm mô hình CNN trên các bài toán phân loại khác nhau trên mức độ ký tự và đạt hiệu quả tót hơn mô hình CNN trên mức độ từ. Từ đó cho thấy rằng việc phân loại văn bản trên mức độ từ cũng hiệu quả và giải quyết trường hợp không có vecto biểu diễn từ. Tác giả Yang và cộng sự [6] nghiên cứu mô hình mạng Capsule Network cho bài toán phân loại văn bản – đây là một mô hình cải tiến của mô hình mạng tích chập CNN cho các bài toán xử lý ảnh và đã được nghiên cứu cho các bài toán phân loại văn bản và cho kết quả tương đối khả quan. Tương tự như vậy, tác giả Wang và các cộng sự [7] cũng áp dụng ý tưởng tương tự nhưng dựa trên mô hình mạng hồi LSTM kết hợp với Capsule và thử nghiệm trên các bài toán khác nhau cho kết quả vượt trội với các công trình nghiên cứu trước đây.
Gần đây với sự phát triển mạnh mẽ của mô hình BERT [8] đã tạo tiền đề cho sự phát triển của bài toán phân loại vvawnbarn trong lĩnh vực xử lý ngôn ngữ tự nghiên. Nhiều kiến trúc và mô hình ngôn ngữ khác nhau đã được đề xuất và giải quyết các bài toán khác nhau và mang lại hiệu quả. Điển hình như tác giả Sun và các cộng sự [9] đã trình bày một nghiên cứu tổng quan làm sao để tinh chỉnh mô hình ngôn ngữ BERT cho các bài toán phân loại khác nhau. Trong công trình của họ thì họ trình bày các thí nghiệm đánh giá sự biểu diễn khác nhau của từng lớp trong mô hình BERT trên các bộ dữ liệu chuẩn.
Tác giả Garg và cộng sự [10] cũng trình bày mô mô hình dựa trên mô hình ngôn ngữ BERT cho các bài toán phân loại văn bản. Từ đó chúng ta thấy rằng mô hình BERT đã đem lại hiệu quả và đang là kiến trúc tốt nhất cho các bài toán phân loại văn bản.2 Nghiên cứu trong nước Hầu hết các công trình trên đều dựa trên tiếp cận máy học, mô hình xác suất và thống kê, thường tập trung vào bài toán phân làm phân lớp lớp và gặp khó khăn với dữ liệu lớn. Mặt khác, các công trình này dành cho xử lí ngôn ngữ tiếng nước ngoài, cụ thể là tiếng Anh. Đối với các ccong trình nghiên cứu trong nước trong tiếng Việt thì có các nghiên cứu như sau.
Tác giả Đỗ Phúc và Hoàng Kiếm [11] đã trình bày một phương pháp phân loại dựa trên các cụm từ phổ biến. Tác giả Đệ và cộng sự [12] đã sử dụng mô hình máy học Support Vector Machine và Cây quyết định để nghiên cứu và so sánh hiệu quả trên bài toán phân loại văn bản tiếng Việt. Kết quả thí nghiệm cho thấy rằng phương pháp SVM cho kết quả tốt hơn phương pháp còn lại. Tác giả Phúc [13] cũng trình bày một nghiên cứu về đề tài phân loại nội dung tài liệu trang web tiếng Việt sử dụng các mô hình máy học khác nhau.
Chúng ta thấy rằng các công trình trên đều có những ưu 7 điểm, tuy nhiên kết quả cho ra độ chính xác không được đồng nhất và khó để đánh giá để kết luận phương pháp nào tốt nhất. Bên cạnh đó cũng có các công trình sử dụng các phương pháp học sâu và ứng dụng cho các bài toán phân loại văn bản như sau. Tác giả Tuan và các cộng sự [14] đã trình bày nghiên cứu áp dụng tinh chỉnh mô hình PhoBERT [15] cho bài toán phân loại tin tức các bài post trên mạng xã hội, ngoài ra tác giả còn so sánh với các mô hình máy học truyền thống khác nhau. Kết quả cho thấy rằng mô hình ngôn ngữ BERT cho kết quả tốt nhất.
Tác giả Hoang và cộng sự [16] đã trình bày một nghiên cứu so sánh các phương pháp phân loại văn bản khác nhau trên tập dữ liệu văn bản tin tức. Tác giả Van và cộng sự [17] đề xuất một số phương pháp giải bài toán phân loại tin tức Việt Nam bằng cách sử dụng túi từ với cách tiếp cận trích xuất từ khóa và Mạng nơ ron, chúng tôi đã đào tạo một mô hình học máy có thể đạt được độ chính xác trung bình là 99,75%. Các tác giả cũng đã phân tích ưu điểm và nhược điểm của từng phương pháp để tìm ra phương pháp tốt nhất để giải phân loại văn bản trong tin tức Việt Nam. Tác giả Dương và cộng sự [19] đã tổng hợp các bộ phân loại nhiều lớp nổi tiếng trong tài liệu và áp dụng chúng để đánh giá trên bộ dữ liệu điểm chuẩn mới của Tin tức Việt Nam (VNNews-01).
Cơ sở dữ liệu này được tạo ra từ hơn ba mươi trang báo điện tử của Việt Nam và được nhóm lại thành 25 chuyên mục. Đề xuất và đánh giá của công trình này có thể thúc đẩy các nghiên cứu liên quan cho việc khai thác văn bản tiếng Việt. Trong nghiên cứu này [22], các tác giả giới thiệu điểm chuẩn đánh giá phân loại văn bản truyền thông xã hội (SMTCE), như một tập hợp các bộ dữ liệu và mô hình trên một tập hợp các tác vụ SMTC đa dạng. Với điểm chuẩn được đề xuất, các tác giả thực hiện và phân tích hiệu quả của một loạt các mô hình dựa trên BERT đa ngôn ngữ (MBERT, XLM-R và DISTILMBERT) và các mô hình dựa trên Bert đơn ngữ (Phobert, Vibert, Velectra và Vibert4News).
Các mô hình đơn ngữ vượt trội so với các mô hình đa ngôn ngữ và đạt được kết quả hiện đại trên tất cả các bài toán phân loại văn bản. Các tác giả [23] đề xuất một mạng lưới thần kinh tích chập dựa trên Phobert (CNN) để phân loại văn bản. Đầu ra của các nhúng theo ngữ cảnh của bốn lớp cuối cùng của Phobert đã được đưa vào CNN. Điều này làm cho mạng có khả năng có được nhiều thông tin cục bộ từ văn bản.
Bên cạnh đó, đầu ra Phobert cũng được trao cho các lớp bộ mã hóa máy biến áp để sử dụng kỹ thuật tự cân nhắc, và điều này cũng làm cho mô hình tập trung hơn vào thông tin quan trọng của các phân đoạn văn bản. Kết quả thử nghiệm chứng minh rằng phương pháp đề xuất mang lại hiệu 8 suất cạnh tranh so với các nghiên cứu hiện tại trên ba bộ dữ liệu công cộng với các văn bản Việt Nam. Trong bài báo này [24], các tác giả trình bày ba đóng góp chính: đầu tiên là các bước tiền xử lý trong văn bản, thứ hai là mô hình kết hợp dựa trên PhoBERT và CNN.