Chương 1: Tổng quan Giới thiệu về bài toán phân tích cảm xúc dựa trên khía cạnh và tính ứng dụng thực tiễn. Chương 2: Các công trình nghiên cứu liên quan Chúng tôi giới thiệu một số công trình nghiên cứu nỗi bật trên thế giới và trong nước liên quan đến các quy trình xây đựng đữ liệu ABSA và đề xuất các phương pháp giải quyết bài toán phân tích cảm xúc dựa trên khía cạnh. Chương 3: Xây dựng bộ dữ liệu Chúng tôi trình bày quy trình xây dựng nghiệm ngặt bộ dữ liệu UIT-ViSFD. Sau đó phân tích và thống kế các số liệu của bộ dữ liệu dé hiệu rõ hơn về bộ dữ liệu.
Từ đó đưa ra phương pháp áp dụng cho bộ dữ liệu một cách hợp lí. Chương 4: Các phương pháp thử nghiệm Đưa ra các phương pháp thử nghiệm thuộc Học máy truyền thống, Học sâu và Học chuyền giao lên bộ dữ liệu. Và đề xuất mô hình PhoBERT-GRU cho bài toán ABSA. Chương 5: Cài đặt và kết quả thử nghiệm Trình bày cách cài đặt và đánh giá kết quả thu được từ các thử nghiệm trên.
Và phân tích các lỗi thường gặp của các mô hình. Chương 6: Chương trinh minh hoa Chúng tôi đã xây dựng một chương trình minh họa cho bài toán ABSA trên bộ dữ liệu UIT-ViSFD. Chương 7: Kết luận và hướng phát triển Tổng hợp lại các kết quả đạt được từ đó đưa ra hướng phát triển trong tương lai.1 Giới thiệu bài toán Chúng ta trích xuất các khía cạnh của điện thoại và các cảm xúc của khía cạnh đó từ các bình luận. Từ đó người dùng có thé tham khảo các đánh giá của những người đã trải nghiệm điện thoại trước đó và chọn được điện thoại phù hợp với nhu cầu của mình.
Hay các nhà sản xuất, các nhà phân phối từ các nhận xét của khách hàng về sản pham của mình, họ có thể cải thiện và phát triển sản phẩm tốt hơn. Ví dụ với một nhận xét của khách hàng khi đã mua và sử dụng một chiếc điện thoại di động “Pin trâu, màn hình đẹp, to nhưng cảm biến vân tay quang học trong màn hình hơi chậm", chúng ta có thê khai thác những thông tin sau: khía cạnh năng lượng (BATTERY) có cảm xúc là tích cực vì có mang từ” trâu”, khía cạnh màn hình (SCREEN) có thé được chú thích cảm xúc tích cực vì từ "man hình đẹp, to", khía cạnh chức năng (FEATURES) có thé được gán tiêu cực do mệnh đề "cam biến van tay quang hoc trong màn hình hơi chậm". Bài toán ABSA gồm ba nhiệm vụ chính là: phát hiện khía cạnh ( Aspect Detection ), trích xuất ý kiến ( Opinion Target Expression ) và phân tích cảm xúc ( Sentiment Polarity ). Va bộ dữ liệu cua chúng tôi xây dựng tập trung vào hai nhiệm vụ là phát hiện khía cạnh và phân tích cảm xúc của khía cạnh đó.
Mô tả bài toán: Đầu vào: Bình luận của khách hàng về điện thoại thông minh. Đâu ra: Khia cạnh và cảm xúc của khía cạnh. và pin trâu. 'GENERAL#Positive}: tSER&ACC#Positive) Hình 1 Một ví dụ về dau vào và đâu ra 1.2 Ý nghĩa của khóa luận Bài toán Phân tích cảm xúc dựa trên khía cạnh có tính ứng dụng rất lớn và có thể áp dụng trong nhiều lĩnh vực trong đời sóng.
Hiện nay, người dung có thường xuyên tham khảo các bình luận của người dùng khác trước khi đưa ra quyết định mua một sản phẩm mới trên các trang thương mại điện tử. Hay đối với các công ty kinh doanh thì việc nắm bắt các phản hồi, các đánh giá của người dùng về sản phẩm của mình là điều hết sức cần thiết. Khi đó chủ doanh nghiệp có thé đưa ra kế hoạch trong tương lai dé cải thiện và phát triển sản phẩm đáp ứng nguyện vọng của khách hàng. Tuy nhiên việc này trở thành một khó khăn khi số lượng đánh giá ngày càng nhiều, người dùng hay các doanh nghiệp không thé nắm bat tat cả các đánh giá của khách hàng.
Vì thế bài toán Phân tích cảm xúc dựa trên khía cạnh được đề ra dé áp dụng giải quyết khó khăn này. Với bài toán này, ta có thé dé dang năm bắt được các phản hồi, các đánh gia của người dùng một cach chi tiết về sản phẩm một cách tự động và chính xác cao. Những lợi ích khi ta ứng dụng bài toán này vào thực tế như: ° Người dùng mới có thé lựa chọn sản pham phù hợp với ban thân thông qua các bình luận của những người trước. Họ có thể biết được đặc trưng, chất lượng của từng khía cạnh trên sản phâm đó.
° Doanh nghiệp có thé nắm bắt được những nhận xét của khách hàng về sản pham của minh. Từ đó họ có thé đưa ra những giải pháp nâng cao chất lượng sản phâm một cách nhanh chóng. Khóa luận không những góp phần tạo ra những ứng dụng cho cuộc sống mà còn góp phần làm giàu tài nguyên cho cộng động nghiên cứu khoa học. Số lượng các bộ dữ liệu trên lĩnh vực NLP của ngôn ngữ tiếng Việt đang còn nhiều hạn chế.
Vì thế chúng tôi đã xây dựng bộ dữ liệu này với mong muốn góp phan làm giàu tài nguyên dữ liệu cho cộng động nghiên cứu NLP. Bộ dữ liệu được cung cấp miễn phí cho các nghiên cứu sinh với mục đích là nghiên cứu khoa học trên bộ dữ liệu này. CÁC CÔNG TRÌNH NGHIÊN CỨU LIÊN QUAN 2.1 Công trình trên thế giới Các bộ dữ liệu về bài toán ABSA trên thế giới đã được xây dựng rất nhiều và đa dạng trên nhiều lĩnh vực và ngôn ngữ khác nhau. Có rất nhiều cuộc thi về ABSA đã được tô chức trên thế giới và cung cấp nhiều các bộ dữ liệu trên nhiều ngôn ngữ khác nhau.
Với ngôn ngữ tiếng Anh, có nhiều bộ dữ liệu trên lĩnh vực điện [1], sách hay các thiết bị nhà bếp và các sản phẩm điện [2]. Hay các bộ dữ liệu về lĩnh vực laptop, nhà hàng và khách sạn được xây dựng từ các cuộc thi như SemEval 2014 Task 4 [3], SemEval 2015 Task 12 [4] và SemEval 2016 Task 5 [5]. Với ngôn ngữ Pháp thi có Marianna Apidianaki và các cộng sự [6] đã xây dựng bộ đữ liệu trên lĩnh vực nhà hàng với 457 câu đánh giá. Hay nhiều công trình khoa học đã đề xuất nhiều cách giải quyết với này toán này như Ghadery và cộng sự [7] đã sử dụng kết hợp Mạng nơ-ron tích chập CNN với lớp nhúng đa ngôn ngữ MUSE theo hướng tiếp cận đa ngôn ngữ dé phát hiện khía cạnh và cảm xúc trong các ngôn ngữ khác nhau.
Bên cạnh đó cũng có nhiều bộ dữ liệu ABSA của lĩnh vực điện thoại như Singh và cộng sự [8], Yiran và cộng sự [9]. Singh và cộng sự [8] đã xây dựng bộ dữ liệu với nhiều khía cạnh: Camera, OS, Battery, processor, screen, size, cost, storage cùng với đó là hai nhãn cảm xúc: tích cực và tiêu cực. Bộ dữ liệu của Yiran va cộng sự [9] cùng với các khía cạnh: display, battery, camera và ba nhãn cảm xúc: tích cực, tiêu cực và trung tinh. Wei Xue và Tao Li [10] đã đề xuất một mô hình dựa trên mạng no ron phức hợp và cơ chế kiểm soát.
Đầu tiên là Gated Tanh-ReLU có thé trích xuất các đặc trưng một cách có chọn lọc các tính năng tình cảm theo khía cạnh hoặc các thực thé nhất định. Thứ hai, các tính toán của mô hình có thé dé dang tính toán song song trong quá trình đào tạo, bởi vì các lớp phức hợp không có phụ thuộc vào thời gian như trong các lớp LSTM mà hiện nay đang được sử dụng và các units gating cũng hoạt động độc lập với nhau. Các phương pháp cua Wei Xue va Tao Li áp dụng lên bộ dữ liệu từ cuộc thi SemEval 2014 Task 4. Shiliang Zheng và cộng sự [11] đã đề xuất một cách tiếp cận mới trong bài toán ABSA là mạng nơ-ron phân tích từ trái sang phải với rotatory attention (LCR-Rot).
Cách tiếp cận của họ có hai đặc điểm là: 1) phương pháp có ba điểm LSTM được tách biệt nhau ở trai, giữa và bên phải tương ứng với ba phần của đánh giá là ngữ cảnh bên trái, cụm từ chính và ngữ cảnh bên phải; 2) phương pháp có một rotatory attention dùng dé mô hình hóa mối quan hệ giữa hai ngữ cảnh trai/phai với cụm từ chính. Và đặc biệt target2context attention được sử dụng dé nắm bắt các từ chỉ cảm xúc, tình cảm ở trong hai ngữ cảnh trái/phải. Sau đó lớp này sẽ nắm bắt các từ quan trọng trong mục tiêu. Điều này dẫn đến hai bên đại diện ngữ cảnh của mục tiêu là: mục tiêu nhận biết trái và mục tiêu nhận thức phải.
Họ tiếp tục so sánh cách tiếp cận của họ trên ba tập dữ liệu điểm chuẩn với mười phương pháp liên quan được đề xuất gần đây. Ba bộ đữ liệu là SemEval 2014 Task 4 [3] trên cả hai lĩnh vực là nhà hàng, khách sạn và bộ tweets được thu thập bởi Dong và các cộng sự [12]. Và các kết quả cho thay cach tiép cận cua họ vượt trội hơn đáng kề so với các SOTA hiện nay. Qiao Liu và các cộng sự [13] đã đề xuất phân loại tình cảm dựa trên khía cạnh dựa trên khía cạnh với hai cơ chế attention enhancing là: cấp độ câu cơ chế chú ý có khả năng nắm bắt được điều quan trọng thông tin về các khía cạnh nhất định từ quan điểm toàn cầu, cơ chế chú ý ngữ cảnh chịu trách nhiệm đồng thời xem xét thứ tự của các từ và mối tương quan của chúng, bằng cách nhúng chúng vào một loạt ký ức tùy chỉnh.
Điều này để giải quyết vấn đề các cơ chế được đề xuất để phân loại tình cảm dựa trên khía cạnh chủ yếu tập trung vào việc xác định các từ cảm xúc hoặc chuyển đổi, mà không xem xét mức độ liên quan của những từ đó đối với các khía cạnh đã cho trong câu. Do đó, chúng thường không đủ dé xử ly các câu đa nghĩa và về mặt cú pháp cau trúc câu phức tạp. Thực nghiệm đã chứng minh kết quả của các mô hình của họ hoạt động tốt hơn mô hình SOTA, trong đó các cơ chế đề xuất đóng vai trò chủ đạo. Yukun Ma và các cộng sự [14] đã đề xuất một giải pháp mới dé nhắm mục tiêu phân tích tình cảm dựa trên khía cạnh, giải quyết các thách thức của cả phân tích tình cảm dựa trên khía cạnh và phân tích tình cảm có mục tiêu bằng cách khai thác kiến thức chung.
Họ tăng 10 cường mạng bộ nhớ ngắn hạn dài (LSTM) với một cơ chế chú ý phân cấp bao gồm chú ý cấp độ mục tiêu và chú ý cấp độ câu.