Chương 1: Tổng quan Giới thiệu về bài toán phân tích cảm xúc với dữ liệu mạng xã hội và phương pháp tiếp cận từ vựng cảm xúc được xây dựng; Tính ứng dụng của các kết quả nghiên cứu trong bối cảnh hiện tại. Giới thiệu một số công trình nghiên cứu liên quan đến bài toán được xây dựng, cũng như các mô hình huấn luyện cho phân tích cảm xúc; Cùng với đó là các nghiên cứu về xử lý dữ liệu theo thời gian thực. > Chương 2: Cơ sở lý thuyết Trình bày cở sở nền tang dé có thé tiếp cận bài toán phân tích cảm xúc. Bao gồm cơ sở bài toán phân tích cảm xúc, thông tin tổng quan các bộ dữ liệu, tách từ, cùng với đó là các mô hình phân loại cho bài toán.
> Chương 3: Phương pháp đề xuất Mô tả phương pháp được đề xuất của chúng tôi để kết hợp các thuộc tính từ bộ từ vựng cảm xúc với các mô hình học máy phân loại. Cùng với đó là mô tả các kỹ thuật tiền xử lý dữ liệu được sử dụng, cũng như các mô hình CƠ SỞ. > Chương 4: Thứ nghiệm và kết quả Chúng tôi trình bày các thông tin về quá trình thiết lập thử nghiệm, phân tích và đánh giá các kết quả đạt được. > Chương 5: Chương trình minh họa Chúng tôi trình bày hai chương trình minh họa ứng dụng kết quả từ phương pháp tiếp cận từ vựng, bao gồm chương trình phân tích cảm xúc của văn bản, file và chương trình minh họa hỗ trợ phân tích cảm xúc các bình luận trên mạng xã hội Việt Nam theo thời gian thực.
> Chương 6: Kết luận và hướng phát triển Chúng tôi tổng kết các kết quả đạt được, hạn chế và đề xuất các hướng phát triển trong tương lai của khoá luận. Giới thiệu bài toán Bài toán phân tích cảm xúc đã và đang là đề tài nhận được rất nhiều sự quan tâm, nghiên cứu từ giới học thuật. Trong phạm vi khóa luận lần này, chúng tôi đề xuất phương pháp tiếp cận từ vựng cảm xúc cho các bộ dữ liệu mạng xã hội tiếng Việt. Từ đó giúp tăng cường khả năng phân tích cảm xúc của các mô hình phân loại.
Với phương pháp tiếp cận từ vựng, chúng tôi nghiên cứu và áp dụng kết quả từ những công trình đi trước, có thê kế đến là các phương pháp tiền xử lý và các mô hình học máy đạt hiệu suất cao[7]-[9]. Cũng như các nghiên cứu chỉ ra vai trò của tử và cụm tu mang giá tri cảm xúc trong câu [5], [6]. Qua đó chúng tôi có được những thử nghiệm cụ thể để kiểm chứng và đánh giá phương pháp được đề xuất. Các bộ dữ liệu mạng xã hội cho tiếng Việt đóng vai trò trung tâm dé huấn luyện.
Một số công trình trước đây trong các tác vụ về tình cảm Việt Nam đã xây dựng bộ dữ liệu về các lĩnh vực cụ thể như mạng xã hội, giáo dục, thương mại điện tử và từ điển cảm xúc. Trong bài báo này, chúng tôi sử dụng ba bộ dữ liệu bao gồm UIT-VSMEC [1], UIT-VSFC [2] và VIHSD [3] cùng với bộ từ vựng VnEmoLex [10] đề thử nghiệm hiệu suất của phương pháp tiếp cận được đề xuất đối với tác vụ phân tích cảm xúc cho tiếng Việt. Cả ba bộ dữ liệu đều là những bộ dữ liệu quy mô lớn và được những người gán nhãn chú thích theo cách thủ công với quy trình chú thích nghiêm ngặt trên một lĩnh vực cụ thể, lần lượt là lĩnh vực truyền thông xã hội (UIT-VSMEC), lĩnh vực sinh viên và giáo dục (UIT-VSFC) va phát hiện lời nói căm thù (ViHSD). Bên cạnh đó, VnEmoLex là một bộ từ vựng về cảm xúc với tám loại cảm xúc khác nhau và chứa tổng cộng 12.
Bài toán này nhằm mục đích trích xuất các đặc trưng cảm xúc có sẵn trong một bình luận. Qua đó kết hợp với bình luận dé xác định xem cảm xúc của nó mang lại trên mạng xã hội. Bài toán có thê được mô tả ngăn gọn như sau: - Input: Một câu trong các bộ dữ liệu cảm xúc tiêng Việt, cùng với các từ trong câu xuât hiện trong bộ từ vựng cảm xúc VnEmolex. - Output: Nhãn thé hién cung bậc cảm xúc cua câu ứng với từng bộ dữ liệu Anger Fear / tức giận / sợ hãi Cho đáng đời con quỷ.
về nhà lôi Danh nhân 1 0 0 0 con nhà may ra mà đánh danh tiếng 1 0 0 1 nghệ thuật nhac kịch 0 0 0 0 sự nổi tiếng 1 1 0 1 bất tận 0 0 0 0 bệnh dịch 0 1 1 1 bỏ cuộc 0 1 0 1 bùng nổ 0 0 1 0 đóng đời = 1 0 0 0 đáng đời 0 1 1 0 | 7 “ aa con quỷ 0 1 1 1 x> đánh 0 1 0 0 VAO đánh Minh họa bộ từ vựng VnEmolex Hình 1. Ví dụ minh hoạ phương pháp tiếp cận cho các bộ dữ liệu cảm xúc với bộ từ vựng VnEmolex. + Một câu trong bộ dữ liệu UIT-VSMEC: “cho đáng đời con quỷ. về nhà lôi con nhà mày ra mà đánh.” + Các từ như: “đáng đời”, “con quý”, “lôi”, “đánh” có xuất hiện trong bộ tu 1399 66 vựng, và mỗi từ thé hiện một cảm xúc nhất định (từ “đáng đời” mang cảm xúc tức giận).
Qua đó hình thành các vec tơ đặc trưng (mỗi vec tơ đặc trưng là tập hợp các từ xuất hiện và mang giá trị cảm xúc trong bộ từ vựng VnEmolex).1 minh họa một số câu ban đầu, và sau khi được kết hợp cùng bộ từ vựng VnEmolex minh họa ở Bảng 1. + Sau đó thực hiện kết hợp vec tơ đặc trưng thu được với câu trong các bộ dữ liệu cảm xúc. Huân luyện và đánh giá với các mô hình máy học. Cuôi cùng là tiên hành các thử nghiệm và rút ra kêt luận.
Minh họa một số điểm trong bộ dữ liệu UIT-VSMEC ban đầu. ID Cảm xúc Bình luận 1 |Other cho minh xin bai nhạc tên là gi với ạ 2_ |Disgust cho đáng đời con quý. về nhà lôi con nhà mày ra mà đánh 3 |Enjoyment ước gi sau này về già vẫn có thê như cụ nay :)) thang kia sao mày bắt vợ với bồ tao don thé kia. nhà mày 4 |Anger , , ở dau tao đên thịt mày chet 5_ J|Other một lí do trog muôn van lí do 6_ |Surprise thật hay đùa ác vậy.
không thể tin được Bang 1. Minh họa một số điểm trong bộ dit liệu UIT-VSMEC sau khi kết hợp cùng VnEmolex. Với các thuộc tính Disgust, Fear, Enjoy, Sadness, Surprise, Anger, Other lần lượt là D, F, E, Sa, Su, A, O. Bình luận Cảm xúc |DEF [El|Sal|SulA|O cho mình xin bai nhạc tên là gi với a Other 010101010100 cho đáng đời con quỷ.
về nhà lôi con nhà mày ra mà đánh |Disgust 1{110|01012|0 uớc gì sau này về già vẫn có thê như cụ này :)) EnJoyment| 0021010101 thang kia sao mày bắt vợ với bồ tao dọn thé kia. nhà mày ở đâu tao đến thịt mày chết pAnger Oy P99] 9 | 2/0 một lí do trog muôn van lí do Other 0/01010100Ị1 thật hay đùa ác vậy. không thể tin được Surprise |0|1|2|10|1110|2 1. Các công trình nghiên cứu liên quan Tác vụ phân tích cảm xúc có thê được phân loại là tác vụ phân loại văn bản.
Các bộ dữ liệu khác nhau được tạo ra dé phục vụ tác vụ phân tích cảm xúc tiếng Việt cho các lĩnh vực khác nhau, chăng hạn như bộ dữ liệu VLSP 2018 [11] và UIT-ABSA [12] cho phân tích cảm xúc với lĩnh vực nhà hàng và khách sạn, UIT-VSFC [2] bộ dữ liệu dé phân tích cảm xúc về phản hồi của sinh viên, UIT-VSMEC [1] dé phân loại cảm xúc đối với nhận xét của người dùng trên các trang mạng xã hội, UIT-ViSFD [13] để phân tích cảm xúc về phản hồi trên điện thoại thông minh và ViHSD [3] và VLSP 2019 HSD [14] bộ dữ liệu để phát hiện lời nói căm thù trên các văn bản trên mạng xã hội (Theo [15], các tác vụ phát hiện lời nói căm thù và phân tích tình cảm có liên quan với nhau vì chúng đều xử lý tình cảm tiêu cực và tích cực thông qua thông điệp lời nói căm thù). Chúng tôi chọn UIT-VSMEC, UIT-VSFC và ViHSD làm ba bộ dữ liệu để đánh giá phương pháp đề xuất của chúng tôi. Bên cạnh các bộ dữ liệu có chú thích, VnEmoLex [10] và VietSentiWordNet [16] là hai từ điển được sử dụng cho tác vụ phân tích tình cảm. VnEmoLex chứa tám cấp độ cảm xúc cơ bản bao gồm joy (Vu), sadness (Buôn bã), anger (Tức giận), fear (Sợ hai), trust (Tin tưởng), disgust (Ghé tom), surprise (Ngạc nhiên) and anticipation (Mong doi) trong khi VietSentiWordNet chỉ chứa ba cap độ, đó là positive (Tích cực), negative (Tiêu cực) va neutral (Trung tính).
Trong phạm vi khóa luận lần này, chúng tôi sử dụng bộ từ vựng VnEmoLex vì nó có nhiều mức độ cảm xúc, và phù hợp dé kết hợp với các bộ dữ liệu được chọn hơn so với VietSentiWordNet. Ngoài ra, dựa trên mỗi bộ dữ liệu, có một số cách tiếp cận đề xây dựng các mô hình phân loại nhăm phát hiện cảm xúc từ văn bản. Mô hình Maximum entropy đạt được kết quả tốt nhất trên bộ dữ liệu UIT-VSFC [2], mô hình Text-CNN thu được kết quả cao nhất trên bộ dữ liệu UIT-VSMEC [1] và mô hình BERT cho kết quả tốt nhất trên bộ dữ liệu ViHSD [3]. Cùng với đó là các công trình nghiên cứu đạt kết quả cao trên dữ liệu mạng xã hội tiếng Việt, cụ thé [9] sử dụng mô hình hồi quy đa thức (Multinomial Logistic Regression) trên UIT-VSMEC, [8] với mô hình két hop PhoBERT-CNN trên ViHSD hay [7] với mô hình mạng thần kinh học sâu (Deep neural network) trên UIT-VSFC.
Từ các mô hình cơ sở hiện tại trên ba bộ dữ liệu, cũng như các kết quả từ các công trình nghiên cứu liên quan. Chúng tôi đề xuất phương pháp kết hợp từ vựng cảm xúc với các mô hình phân loại dé tăng hiệu suất. Từ những mô hình cơ sở tới những mô hình có hiệu quả cho phân loại văn bản, phân loại cảm xúc. Bên cạnh đó việc cập nhật và xử lý dữ liệu ngay lập tức để có thể nắm bắt thông tin hoặc đưa ra những giải pháp kịp thời cũng là vấn đề cần được quan tâm và phát triển.
Phương pháp và các hệ thống cho dang dir liệu theo thời gian thực được [17] giới thiệu. [18] Xử ly dữ liệu real-time từ Twitter sử dụng Spark Streaming.