Đặt vấn đề Trong thời dai phát triển của công nghệ thông tin và Internet, các website ra đời như là một giải pháp quảng bá và tiếp thị từ xa của các doanh nghiệp đến với khách hàng. Chi với vài từ khóa đơn giản về sản phẩm hay dịch vụ mà chúng ta quan tâm, sẽ có hàng triệu kết quả tìm kiếm được hiển thị dé người dùng có thể tham khảo va lựa chọn. Không chỉ dừng lại ở đó, các trang web còn đóng vai trò cung cấp thông tin theo chiều ngược lại từ khách hàng đến với doanh nghiệp. Đó không gì khác chính là những phản hồi và bình luận của khách hàng nhằm bày tỏ thái độ và đánh giá của bản thân đối với sản phẩm và dịch vụ mà họ đã sử dụng.
Thông qua đó, không chỉ doanh nghiệp có thé tiếp nhận thông tin dé cải thiện chất lượng cho sản phẩm và dịch vụ của mình mà nó còn là nguồn thông tin tham khảo cho những khách hàng khác có ý định sử dụng những sản phẩm và dịch vụ này. Chính vì điều này, việc có thê thấu hiểu hành vi khách hàng thông qua ý kiến tích cực hay tiêu cực về sản phẩm và dịch vụ được trải nghiệm là một trong những van dé quan trọng cho sự phát trién bền vững của doanh nghiệp. Việc phân tích cảm xúc trong văn bản, cụ thé là các phản hồi và bình luận được ứng dụng trong hàng loạt các vấn đề như: Quản trị thương hiệu doanh nghiệp, thương hiệu, chất lượng sản phẩm; quản trị quan hệ khách hàng; phân tích nam bat xu hướng thị trường; tham khảo chất lượng sản pham trước khi quyết định thanh toán. Tuy nhiên trong bối cảnh công nghệ số, vấn đề được đặt ra là số lượng phản hồi của người dùng là một con số không lồ và không ngừng tăng lên theo thời gian, chưa kể đến việc danh mục các sản phẩm và dịch vụ lại vô cùng đa dạng.
Một ví dụ cụ thé có thé kế đến trang thương mại điện tử Amazon. Tại đây mỗi ngày có khoảng 1,6 triệu kiện hàng được gửi đi, với tỉ lệ phản hồi của người dùng đạt khoảng 2% thi đã có đến 32.000 phản hồi cần được xem xét!. Công việc này nếu được tiến hành thủ công bởi con người thì sẽ tiêu tốn một lượng công lao động không hề nhỏ. Chính vì thế, một hệ thống có khả năng tự động nhận diện chính xác cảm xúc trên bình luận là vô cùng cân thiệt đê tăng hiệu suat và giảm thiêu chi phí.
Nắm bắt nhu cầu thực tế đó, nhiều bài toán về phân loại cảm xúc đã được đặt ra có thé ké đến như: Phân loại cảm xúc cho văn bản, phân loại cảm xúc cho văn bản dựa trên khía cạnh cụ thé và phân loại cảm xúc cho đối tượng cụ thể trong văn bản dựa trên từng khía cạnh. Song song với đó là các bộ dữ liệu thực nghiệm và các phương pháp, mô hình từ học máy cơ bản cho đến học sâu để giải các bài toán trên đã được công bố với kết quả ngày càng được cải tiến. Tuy nhiên, hầu hết những nghiên cứu nổi bật trong SỐ ay đều được thực hiện trên tiếng Anh, đặc biệt đối với bài toán Phân tích cảm xúc cua doi tượng dựa trên khía cạnh. Do đó, chúng tôi quyết định lựa chọn bài toán này đề thực hiện các nghiên cứu về dữ liệu va hiệu quả của các phương pháp giải quyết đối với tiếng Việt.
Đây có thê được xem là một trong những nghiên cứu đầu tiên về bài toán TABSA trên tiếng Việt. Giới thiệu bài toán Bài toán Phân tích cảm xúc của đối tượng dựa trên khía cạnh được đề cập lần đầu tiên bởi Marzieh Saeidi và các cộng sự [1]. Day là bài toán được phát triển lên từ ba bài toán Phân tích cảm xúc cho văn bản, Phân tích cảm xúc dựa trên khía cạnh và Phân tích cảm xúc của doi tượng. e Đôi với bài toán Phán tích cảm xúc cho văn ban, dt liệu đầu vào là một đoạn van ban trơn, dau ra chỉ đơn giản là nhãn cảm xúc chung cho toàn bộ nội dung ! Số liệu từ trang Market.
Chưa tính đến việc nhiều đơn đặt hàng được vận chuyển cùng nhau hoặc được giao bởi người bán không thông qua sàn giao dich. Mỗi đơn cũng có thé có nhiều hon 1 sản phẩm. Nhãn cảm xúc có thé là {Tích cực; Tiêu cực} hoặc {Tích cực; Trung tính; Tiêu cực} hay chỉ tiết hơn có thé là thang đo mức độ cảm xúc chăng hạn như {-3; -2; -1; 0; 1; 2; 3}. ® O bài toán Phân tích cảm xúc dựa trên khía cạnh (Aspect based Sentiment Analysyis - ABSA), với đầu vào là một đoạn văn ban, bài toán có thé được chia thành hai tác vụ chính bao gồm nhận diện tập khía cạnh mà văn bản đề cập và phân loại cảm xúc cho từng khía cạnh đã nhận diện được.
Việc này nhằm trích xuất được thông tin về cảm xúc một cách cụ thể hơn cho từng khía cạnh được đề cập đến trong văn bản thay vì chỉ một cảm xúc chung cho toàn bộ văn bản. e Ở bài toán Phân tích cảm xúc của đối tượng (Targeted Sentiment Analysis - TSA), đầu vào là một đoạn văn ban cùng với một đối tượng cụ thể trong văn bản đó. Đầu ra của bài toán là cảm xúc cho đối tượng được nhắm đến, nhãn cảm xúc có thê tương tự các bài toán trên. Với bài toán Phân tích cảm xúc của đối tượng dựa trên khía cạnh, nó là sự kết hợp giữa Phân tích cảm xúc dựa trên khía cạnh và Phân tích cam xúc cua đối tượng và có thê được chia thành hai tác vụ (Hình 1.
Thứ nhất là xác định xem từng khía cạnh cụ thể của đối tượng có mang cảm xúc hay không. Thứ hai là phân loại cảm xúc cho các cặp đối tượng — khía cạnh đã được xác định là có mang cảm xúc ở phần trước. Thông qua hai tác vụ này có thê đưa ra được thông tin cảm xúc cho các khía cạnh của từng đối tượng cụ thé được nhắm đến trong văn bản. Tập khía cạnh = {Chất lượng thức ăn, Giá thức ăn, Vệ sinh, Dịch vụ} Văn bản: * ngon, BAG dở nhưng giá rẻ hon may quán khác.
Quán cũng do quá làm tôi thất vọng thật sự.” Cơm Tích cực == ^ * Phở J8. T Đối tượng | Khíacanh | Cảmxúc — Quán Tiêu cực Cơm Chất lượng thức ăn Tích cực (a) Dau ra của bài toán TSA AS Chat lượng thức ăn Tiêu cực ` Giá thức ăn Tích cực Quán Vệ sinh "Tiêu cực Kinh Các cặp đối tượng - khía cạnh còn lại Không Chất lượng thức ăn Trung tính (c) Dau ra của bài toán TABSA Giá thức ăn Tích cực ca Vệ sinh "Tiêu cực (b) Dau ra của bài toán ABSA Hình 1.2: Ví dụ phân biệt giữa TSA, ABSA và TABSA. Thông qua Hình 1.2 có thé thay rang bài toán Phân tích cảm xúc của đối tượng dựa trên khia cạnh mang lại thông tin về cảm xúc một cách chỉ tiết và cụ thê nhất trong số các bài toán ké trên. Nó rất phù hợp dé áp dụng vào phân tích cảm xúc cho các phản hồi về sản phẩm và dịch vụ khi một phản hồi có thé nhắc đến nhiều đối tượng và ta cân biệt chính xác khía cạnh nao của đôi tượng đang được nhac đên với một thái độ như thế nảo.
Mục tiêu và đóng góp 1. Mục tiêu Trong nghiên cứu này, chúng tôi đặt ra 3 mục tiêu chính cần thực hiện và hoàn thành như sau: - Thứ nhất: nghiên cứu va hoàn thành việc xây dựng bộ dữ liệu cho bai toán phân tích cảm xúc của đối tượng dựa trên khía cạnh (TABSA). ¢ Thứ hai: thực nghiệm các mô hình SOTA trên bộ dữ liệu đã xây dựng, so sánh và phân tích hiệu quả giữa các mô hình. » Thứ ba: phân tích và chỉ ra những khó khăn và thách thức còn tồn tại ở bộ dit liệu đôi với bài toán TABSA nói riêng lẫn tác vụ phân tích cảm xúc nói chung.
Đóng góp Đóng góp chính của chúng tôi thông qua nghiên cứu này là một bộ dữ liệu tiếng Việt miền mở được xây dựng từ 6.000 bình luận cho bài toán phân tích cảm xúc của đối tượng dựa trên khía cạnh (TABSA). Hon thé nữa, những kinh nghiệm được rút ra từ quá trình xây dựng dữ liệu cũng như đánh giá và phân tích kết quả trong nghiên cứu của chúng tôi có thé được sử dụng làm tư liệu tham khảo dé nâng cao hiệu suất và chất lượng của những nghiên cứu có liên quan trong thời gian tiếp theo. Đối tượng và phạm vỉ nghiên cứu 1. Đối tượng Đôi tượng chính trong nghiên cứu của chúng tôi là các câu bình luận và phản hôi của người dùng tại Việt Nam.
Những bình luận và phản hồi này được thu thập từ nguồn dữ liệu thực tế trên các trang mạng về các thiết bị di động, nhà hàng và khách sạn. Đây là nguồn dữ liệu chứa đựng thông tin về thái độ và cảm xúc của những khách hang đã sử dụng sản phẩm và dich vụ. Đó cũng chính là phan thông tin được ca những nhà quản lí lẫn những người có ý định sử dụng sản phẩm va dich vụ quan tâm đến vì nó phản ánh một cách khách quan và đa chiều về chất lượng của sản phẩm và dịch vụ. Phạm vi Đối voi dữ liệu, chúng tôi tập trung vào nghiên cứu và xây dựng đối với đữ liệu thuộc 3 lĩnh vực là điện thoại thông minh (Di Động), Nhà Hàng và Khách Sạn.
Phạm vi thông tin được quan tâm là thái độ hay cảm xúc của người dùng đối với từng khía cạnh của các đối tượng cụ thé được dé cap dén trong cac điểm dữ liệu. Đối với các phương pháp và mô hình dùng đề đánh giá bộ đữ liệu, chúng tôi nghiên cứu và sử dụng những phương pháp và mô hình SOTA cho bài toán TABSA đã được công bồ trên các tạp chí khoa học uy tín về lĩnh vực Xử lí ngôn ngữ tự nhiên. Câu trúc khóa luận Phân còn lai của khóa luận này gôm 5 chương với các nội dung chính như sau: o Chương 2: Tông quan Trong chương nay, chúng tôi giới thiệu vê các hướng nghiên cứu đã có của các tác gia trong và ngoai nước liên quan đên đê tài; nêu những van dé còn tôn tại; chỉ ra những vân đê mà đê tải cân tập trung, nghiên cứu giải quyết. o Chương 3: Xây dựng bộ dit liệu Chương nay trình bày quá trình thu thập dir liệu, tiền xử lý va gan nhãn dit liệu.
Bên cạnh đó là các số liệu thống kê và nhận xét chỉ tiết về bộ đữ liệu do chúng tôi thực hiện.