Đặt vấn đề Ngày nay, có không ít ứng dụng trên điện thoại, trang web đã được tạo ra nhằm giao dịch các loại mặt hàng khác nhau như: Shopee, Tiki, Lazada,. Điểm chung của các nền tảng trên là cho phép người dùng vừa có thé là một người mua hàng từ các cửa hàng trực tuyến, vừa đóng vai trò như một người chủ cửa hang dé bay bán những sản phẩm cá nhân. Khi người quản lý cửa hang nắm bắt được thái độ, hành vi cũng như cảm xúc phản hồi từ khách hàng đến từng sản phẩm cụ thể, người quản lý có thé thay đổi chiến lược bán hàng phù hợp nhằm tăng doanh thu. Đứng dưới góc độ người mua hàng, khi một người khách hàng muốn mua một sản phẩm, khách hàng đó sẽ có xu hướng muốn biết trải nghiệm mua hàng của các khách hàng trước cũng như những bình luận tích cực hay tiêu cực đến sản phẩm đó, qua đó có thể cân nhắc đưa ra quyết định mua hay không.
Để biết một bình luận là tích cực hay tiêu cực, bài toán cần phải giải quyết chính là Phân tích cảm xúc (Sentiment Analysis). Trong bài toán này, hệ thống sẽ đánh giá một bình luận là tích cực, tiêu cực hay trung tính tùy vào sắc thái của câu bình luận mà đưa ra đánh giá cụ thể. Ưu điểm của hệ thống này là đánh giá đưa ra có tính tổng quát trên cả câu bình luận, hệ thống dễ dàng xây dựng. Nhưng thực tế, ngôn ngữ là vô cùng phức tạp.
Việc con người đọc một câu bình luận và đưa ra phân tích về cảm xúc của câu đó có thể không chính xác. Nên việc hệ thống không thẻ phân tích cảm xúc của những câu bình luận phức tạp, mang nhiều tầng nghĩa, mang nhiều khía cạnh, làm tiền đề cho bài toán Phân tích cảm xúc theo khía cạnh ra đời. Phân tích cảm xúc theo khía cạnh là việc thực hiện đọc — hiểu và đưa ra những đánh giá theo từng khía cạnh trong câu. Kết quả cuối cùng cho ra kết luận tích cực, tiêu cực, trung tính,.
trên từng khía cạnh. Thẻ hiện chính xác phản hồi của người dùng lên khía cạnh đó, qua đó có thê tập trung nhìn vào khía cạnh mong muốn mà đưa ra quyết định tương ứng. Từ những lý do đó mà chúng tôi quyết định thực hiện nghiên cứu hệ thống phân tích cảm xúc theo khía cạnh. Sản phâm mà nhóm chúng tôi hướng đến là son môi vì số lượng bình luận cho sản phẩm son môi rất nhiều và chất lượng bình luận khá tốt, chứa nhiều khía cạnh trên một bình luận.
Bên cạnh đó, chưa có nhiều công trình nghiên cứu bài toán ABSA trên dữ liệu tiếng Việt liên quan đến các sản phẩm làm đẹp, đặc biệt là son môi. Nền tảng thương mại điện tử mà nhóm thực hiện nghiên cứu hệ thống Phân tích cảm xúc theo khía cạnh là Shopee — một trong những trang thương mại điện tử lớn nhất hiện nay. Chúng tôi thực hiện xây dựng hệ thống phân tích cảm xúc của người dùng theo từng khía cạnh trên bình luận của sản phâm và biểu diễn thông tin dưới dạng biểu đồ một cách dễ hiểu, trực quan, thuận tiện, dễ nắm bắt thông tin một cách chính xác và tin cậy nhất. Hệ thống được lên lịch để chạy theo từng thời điểm mong muốn.
Một cách cụ thể, bài toán phân tích cảm xúc theo khía cạnh mà chúng tôi thực hiện gồm 2 bài toán nhỏ là phát hiện khía cạnh (aspect detection) và phân loại cảm xúc (sentiment classification). Đối với bài toán phát hiện khía cạnh, đầu vào là những câu bình luận của người dùng, mô hình sẽ xử lý và đưa ra những khía cạnh nào được đề cập trong câu bình luận đó. Đối với bài toán phân loại cảm xúc, đầu vào sẽ là những câu bình luận của người dùng đã qua xử lý của mô hình phát hiện khía cạnh trước đó, hay nói cách khác là nhận đầu ra của bài toán phát hiện khía cạnh làm đầu vào. Sau đó, mô hình phân loại cảm xúc thực hiện phân loại cảm xúc tương ứng với từng khía cạnh trong câu, cho ra đầu ra cuối cùng.
Đối với hệ thống, đầu vào sẽ nhận những bình luận, đánh giá của khách hàng trên một sản phẩm cụ thể tại trang thương mại điện tử Shopee, sau đó thực hiện phát hiện khía cạnh, phân loại cảm xúc và đầu ra sẽ là những biểu đồ phân tích cảm xúc phân theo từng khía cạnh một cách trực quan, dé quan sát và dé dàng đưa ra đánh giá. Tóm tắt kết quả Bộ dữ liệu: Xây dựng thành công bộ dữ liệu có tính thực tế dé sử dung cho mô hình phân tích cảm xúc theo khía cạnh. Bộ dữ liệu bao gồm 16,227 bình luận với 8 khía cạnh và 3 sắc thái cảm xúc khác nhau (32,775 cặp khía cạnh - cảm xúc). Mô hình: Cài đặt thành công 5 loại mô hình bao gồm: BiLSTM, BiGRU, BiLSTM+ Conv1D, BiGRU+ Conv1D, BiLSTM + BiGRU + ConvI1D trên 2 phương pháp là Single-task Learning va Multi-task Learning.
Các kết quả thực nghiệm cho thấy phương pháp Single-task Learning cho kết quả tốt hơn Multi- task Learning và kiến trúc mô hình BiGRU+ Conv1D cho kết quả tốt nhất với 97.36% Fl-score macro cho phát hiện khía cạnh trong bình luận và 69.13% Fl-score macro cho phân loại cảm xúc theo khía cạnh. Hệ thống: Xây dựng, thiết kế thành công hệ thống tự động tích hợp mô hình dự đoán cũng như tạo lập được các biéu đồ cung cấp day đủ thông tin phân tích về bình luận sản phẩm cho người bán sản phẩm có thé sử dụng. CAC CÔNG TRÌNH NGHIÊN CỨU LIEN QUAN 2. Các công trình nghiên cứu nước ngoài Bài toán phân tích cảm xúc của văn bản nói chung và phân tích cảm xúc theo khía cạnh nói riêng là một bài toán phổ biến trong lĩnh vực Xử lí ngôn ngữ tự nhiên.
Hiện nay, đã có nhiều công trình nghiên cứu liên quan về phân tích cảm xúc theo khía cạnh cho bình luận của khách hàng và đã một vài nghiên cứu cho bình luận về sản phẩm son môi cũng như các sản phẩm làm đẹp khác. Dưới đây là một vài công trình nghiên cứu liên quan đến bài toán Phân tích cảm xúc theo khía cạnh. Arthamevia và cộng sự [I] đã sử dụng thuật toán Support Vector Machine (SVM) kết hợp với phương pháp TF-IDF dé xây dựng mô hình phân loại cảm xúc của các bình luận sản phẩm trên nền tảng thương mại điện tử. Cac tác giả đã sử dụng các độ đo Accuracy, Precision, Recall và Fl-score để đo hiệu suất các mô hình và đạt được kết quả 88.
Đây là một trong những nguyên cứu cơ bản về bài toán phân tích cảm xúc của các bình luận sản phẩm trên nền tảng thương mại điện tử, có thé phát triển thêm như sử dụng các mô hình học sâu đề cải thiện hiệu suất. Bài toán phân tích cảm xúc theo khía cạnh có thể chia làm hai bài toán nhỏ hơn là phát hiện khía cạnh và phân loại cảm xúc của khía cạnh. Đối với VIỆC SỬ dụng các phương pháp học sâu cho bài toán phân tích cảm xúc theo khía cạnh, có hai cách tiếp cận phô biến là xây dựng từng mô hình cho từng bài toán nhỏ (Single- task Learning) và xây dựng một mô hình có thể đảm nhiệm hai hoặc nhiều bài toán nhỏ cùng lúc (Multi-task Learning). Yequan Wang và cộng sự [2] đã thực nghiệm trên bộ dữ liệu SemEval 2014 Task 4 theo phương pháp Single-task Learning với thuật toán Attention-based LSTM.
Độ chính xác của mô hình đạt 84% cho bài toán phân loại khía cạnh và 77.2% cho bài toán phân loại cảm xúc theo từng khía cạnh cho bộ dữ liệu về bình luận cho nhà hàng. Mặc dù kết quả đạt được là rất cao nhưng một nhược điểm của Single-task Learning là cần phải huấn luyện và triển khai nhiều mô hình cho bai toán phân tích cảm xúc theo khía cạnh, dẫn đến tốn nhiều thời gian và chỉ phí cho xây dựng và sử dụng mô hình. Đối với phương pháp thứ hai là Multi-task Learning, một vài nghiên cứu liên quan đã chứng minh được sự tiện lợi cũng như là hiệu quả của phương pháp này. Ruidan He và cộng sự [3] đã giới thiệu kiến trúc Interactive Multi-Task Learning Network (IMN) với mô hình có thé giải quyết hai bài toán nhỏ trong phân tích cảm xúc theo khía cạnh đồng thời và tận dụng thông tin từ bài toán phân loại khía cạnh đề bổ trợ cho bài toán phân loại cảm xúc theo khía cạnh.
Nhóm tác giả sử dụng thuật toán Convolutional Neural Network (CNN) và bộ dữ liệu thực nghiệm là SemEval 2014 Task 4 cho bình luận về nhà hàng. Kết quả đạt được là 84.01% F1-score cho bài toán phân loại khía cạnh và 85.644% F1-score cho bài toán phân tích cảm xúc theo khía cạnh. Phương pháp Multi-task Learning mà nhóm tác giả đề xuất cho hiệu suất khá cao trên bộ dữ liệu thực nghiệm nhưng chưa có một sự so sánh cụ thể với phương pháp Single-task Learning để đưa ra kết luận phương pháp nao là tốt hơn. Cũng trong công trình nghiên cứu của Ruidan He [4] cùng các cộng sự, nhóm tác giả đã thực hiện so sánh kết quả của các phương pháp khác nhau, trong đó có Multi-task Learning và các phương pháp LSTM kết hợp (Single-task Learning) trên các bộ dữ liệu SemEval 2014, 2015, 2016.
Kết quả so sánh cho thấy, hướng tiếp cận Multi-task Learning cho kết quả macro F1-score lần lượt trên 4 bộ dir liệu: 66.56%, tốt hơn so với các mô hình Single-task Learning từ 1%-5%. Các công trình nghiên cứu trong nước Bên cạnh các công trình nguyên cứu về bài toán phân tích cảm xúc theo khía cạnh trên thé giới, ở Việt Nam cũng đã có những nguyên cứu và bộ dữ liệu về bài toán phân tích cảm xúc nói chung và phân tích cảm xúc theo khía cạnh nói riêng. Bộ dữ liệu ABSA-VLSP 2018 trong cuộc thi VLSP2018 [5] phục vụ bài toán phân tích cảm xúc theo khía cạnh cho bình luận về nhà hàng và khách sạn. Các tác giả đã tạo nên bộ dữ liệu với 4751 bình luận cho bộ dữ liệu về nhà hàng và 5600 bình luận cho bộ dữ liệu về khách sạn.
Đây là một trong những bộ dữ liệu hình mẫu dé tạo nên những bộ dữ liệu tương tự cho các lĩnh vực khác như sản phẩm trên nên tảng thương mại điện tử. Hệ thống đạt hiệu suất cao nhất là 77% FI-score cho bộ dit liệu về nhà hang và 69% F1-score cho bộ dữ liệu khách san. Hệ thống này là một tập hợp của các mô hình phân loại [6]. Sau khi mô hình phân loại cho khía cạnh thứ nhất dự đoán khía cạnh đó trong câu, kết quả sẽ được truyền qua mô hình phân loại cảm xúc của khía cạnh đó.