CHƯƠNG 1. THỰC TRẠNG VÀ CƠ SỞ LÝ THUYẾT 1. Tổng quan tình hình nghiên cứu trên thế giới và trong nước 1. Tình hình nghiên cứu trên thế giới Một nghiên cứu của Abdulaziz M.
Alayba và cộng sự (2018) [2] đã nghiên cứu về một mô hình kết hợp mạng thần kinh tích chập (Convolutional Neural Network - CNN) và mạng bộ nhớ dài ngắn hạn (Long Short-Term Memory - LSTM) cùng với các tác vụ Xử lý ngôn ngữ tự nhiên (Natural Language Processing – NLP) để phân loại cảm xúc cho văn bản. Nghiên cứu sử dụng bô bộ dữ liệu văn bản bằng tiếng Ả Rập, được gán nhãn với hai lớp cảm xúc bao gồm Tích cực và Tiêu cực. Bộ dữ liệu được tạo ra bởi bốn tập dữ liệu bao gồm: Tập dữ liệu dịch vụ y tế Ả Rập, tập dữ liệu các tweet trên Twitter (Ar-Twitter) chứ 2000 tweet với 1000 tweet cho mỗi lớp cảm xúc, một tập dữ liệu khác về cảm xúc bằng Tiếng Ả Rập chưa 54.000 tweets bao gồm bốn lớp cảm xúc, trong đó chỉ xử dụng 1684 tweet có với cảm xúc tiêu cực và 795 tweet có cảm xúc tích cực. Các tác giả mở rộng số lượng tính năng trong tập dữ liệu thông qua phương pháp phân tách văn bản theo ba cấp độ bao gồm: cấp độ ký tự, cấp độ chuỗi ký tự và cấp độ từ.
Thí nghiệm cho thấy đối với phương pháp phân tách văn bản theo cấp độ từ hoặc chuỗi ký tự có kết quả phân loại tình cảm tốt hơn đối với cấp độ ký tự. Mô hình đã cho ra kết quả phân loại cảm xúc dối với tập dữ liệu Dịch vụ Y tế Ả Rập (AHS) đạt 94,24%. Một nghiên cứu khác của Rehman và cộng sự (2019) [3]cũng đã đề xuất mô hình có tên là Hybird CNN-LSTM để giải quyết vấn đề phân tích tình cảm. Đầu tiên, nghiên cứu này sử dụng phương pháp Word to Vector (Word2Vc) để huấn luyện các biểu diễn từ ban đầu còn được gọi là nhúng từ.
Word2Vc chuyển đổi các chuỗi văn bản thành một vector các giá trị số, tính toán khoảng cách giữa các từ và tạo các nhóm các từ tương tự dựa trên ý nghĩa của chúng. Sau khi thực hiện nhúng từ, mô hình đề xuất kết hợp tập hợp các đặc trưng được trích xuất bởi các lớp tích chập và lớp tổng hợp tối đa toàn cầu với các phụ thuộc dài hạn. Mô hình đề xuất cũng sử dụng kỷ thuật bỏ học, chuẩn hóa và một đơn vị tuyến tính chỉnh lưu để cải thiện độ chính xác. Kết quả của nghiên cứu cho thấy rằng Mô hình Hybird CNN-LSTM được đề xuất vượt trội hơn các kỹ thuật học sâu và học máy truyền thống về các điểm đánh giá như precision, 5 recall, f-measure, và accuracy.
Mô hình được đào tạo trên tập dữ liệu đánh giá phim IMDB với 40.000 bài đánh giá và tập dữ liệu đánh giá phim Amazon với 2000 bài đánh giá. Tất cả các bài đánh giá đều được gán nhãn từ hai phân loại cảm xúc tích cực và tiêu cực. Kết quả thí nghiệm đã đạt được những điểm nổi bật là mô hình được đề xuất cải thiện điểm số f-measure lên tới 4-8% so với các mô hình CNN hay LSTM riêng lẻ. Độ chính xác của mô hình cũng đạt được hơn 90%.
Kết quả này vẫn thấp hơn với mô hình kết hợp Naïve Bayes và Support Vector Machine tuy sự chênh lệch về độ chính xác là không nhiều. Một nghiên cứu của Ali Ahani và cộng sự (2019) [4]đã nghiên cứu về việc áp dụng các phương pháp học máy vào phân tích các đánh giá và xếp hạng trực tuyến đối với khách sạn. Mục tiêu của nghiên cứu này là phát triển phương pháp phân khúc khách sạn spa và dự đoán lựa chọn du lịch của khách hàng bằng cách áp dụng các phương pháp học máy. Phương pháp đánh giá được thực hiện thông qua tập hợp các tập dữ liệu từ xếp hạng của khách du lịch và đánh giá bằng văn bản về các khách sạn spa trên TripAdvisor.
Nghiên cứu đã đề xuất một phương pháp phân khúc khách sạn qua các bước: Chuẩn bị dữ liệu, phân cụm dữ liệu bằng phương pháp phân cụm không giám sát (Self-Organizing Map - SOM), tính toán độ tương đồng giữa các cụm bằng phương pháp phân tích dữ liệu đa chiều Phân tích (Hierarchical Orthogonal Singular Value Decomposition – HOSVM), dự đoán mối quan tâm của khách hàng trong từng cụm bằng phương pháp phân loại và hồi quy dựa trên cây quyết định (Classification and Regression Trees – CART), phương pháp khai phá văn bản (Text mining). Kết quả nghiên cứu đã phát hiện được chín phân khúc thị trường khách sạn khác nhau. Một nghiên cứu của Said Gadri và cộng sự (2021) [5] nghiên cứu được một hệ thống có thể dự đoán được sự hài lòng của khách hàng đối với các dịch vụ du lịch với độ chính xác lên đến 85%. Hệ thống sử dụng các phương pháp học máy và học sâu như Linear Discriminant Analysis, k-nearest neighbors, Classification and Regression Trees, Naive Bayes, Deep Neural Networks và Support Vector Machines.
Tập dữ liệu được thu thập gồm các khoảng 100.000 lời bình luận trên Tripadvisor cho nhiều loại dịch vụ du lịch. Dữ liệu đã được gán nhãn bởi mộ nhóm chuyên gia dựa trên các tiêu chí về nội dung, từ ngữ, giọng điệu và một số yếu tố khác theo thang điểm của mức độ hài lòng từ 1 đến 5 sao với sự cân bằng về tỉ lệ cho khoảng 20% lời bình luận ở mỗi mức độ. Nghiên cứu này có một số hạn chế về tập dữ liệu có thể kể đến đầu tiên về quy mô tập dữ liệu, dữ liệu được chia nhỏ thành nhiều mảng cho nhiều dịch vụ với khoảng 10.000 lời bình luận cho mỗi dịch vụ. Điều này có thể khiến cho kết 6 quả dự đoán không chính xác theo từng ngữ cảnh cụ thể của từng dịch vụ.
Thứ hai việc gắn nhãn được xử lý thủ công bởi một nhóm chuyên gia và dựa trên một số tiêu chí, tuy điều này giúp tập dữ liệu chính xác hơn nhưng cũng dẫn đến sai lệch do sự chủ quan trong phân tích, gây tốn kém về sức người và thời gian xử lý và sẽ rất khó khăn nếu cần xử lý trên tập dữ liệu kích thước lớn hơn. Một nghiên cứu của Mingyang Li và cộng sự (2022) [6] đã đề xuất một phương pháp dựa trên lý thuyết bằng chứng (Evidence Theory - là một mô hình toán học để xử lý thông tin không chắc chắn) để khám phá sự hài lòng ẩn chứa bên trong các bài đánh giá của khách hàng với khách sạn thông qua các bài đánh giá trực tuyến đa website. Phương pháp này đầu tiên xác định các thuộc tính khách sạn quan trọng nhất từ các bài đánh giá, sau đó sử dụng lý thuyết bằng chứng để tính toán mức độ hài lòng của khách hàng với từng thuộc tính. Phương pháp này được đánh giá trên một tập dữ liệu gồm 1000 bài đánh giá trực tuyến cho 10 khách sạn.
Kết quả cho thấy phương pháp này có thể tính toán mức độ hài lòng của khách hàng với độ chính xác cao. Nghiên cứu này có một số hạn chế. Đầu tiên, nghiên cứu chỉ sử dụng một tập dữ liệu với kích thước nhỏ. này có thể dẫn đến sự thiên vị trong kết quả nghiên cứu.
Thứ hai, nghiên cứu chỉ tập trung vào một số thuộc tính khách sạn nhất định, chẳng hạn như vị trí, giá cả, tiện nghi và dịch vụ khách hàng. Điều này có thể dẫn đến việc bỏ qua các thuộc tính khách sạn quan trọng khác. Cuối cùng, nghiên cứu chỉ sử dụng phương pháp dựa trên lý thuyết bằng chứng để tính toán mức độ hài lòng của khách hàng. Điều này có thể dẫn đến việc bỏ qua các phương pháp khác có thể chính xác hơn.
Tình hình nghiên cứu tại Việt Nam Tại Việt Nam, các nghiên cứu về ứng dụng học máy và xử lý ngôn ngữ tự nhiên cũng được triển khai từ rất sớm. Trong đó có thể kể đến nghiên cứu của Nguyễn Tấn Phát và cộng sự (2014) [7] đưa ra một hệ thống phân tích quan điểm các nhận xét của tiếng Việt trên các website thương mại điện tử dựa trên xử lý ngôn ngữ tự nhiên. Hệ thống này có khả năng xác định xác định các chủ đề được đề cập đến trong lời bình luận và đưa ra nhận định về ý nghĩa của nhận xét mang tính tích cực, tiêu cực hoặc trung tính. Tập dữ liệu sử dụng trong nghiên cứu này bao gồm ba loại: Tập dữ liệu bình luận một thực thể chứa các bình luận nói về một thực thể duy nhất, tập dữ liệu bình luận nhiều thực thể chứa các bình luận nói về nhiều hơn một thực thể, tập dữ liệu hỗn hợp chứa cả các lời bình luận về chỉ một thực thể hoặc nhiều hơn một thực thể.
Kết quả của nghiên cứu này có độ chính xác trên tập bình luận một thực thể là 90,37%, trên tập bình luận nhiều thực thể là 67,44% và trên tập bình luận về một hoặc nhiều 7 thực thể là 84,5%. Kết quả này cho thấy mô hình hệ thống có nhược điểm đối với việc xác định các thực thể của tập dữ liệu bình luận. Tập dữ liệu cần được xác định chủ đề về các thực thể được đề cập đến, hiệu suất mô hình cũng ảnh hưởng nhiều đối với số lượng thực thể được đề cập đến trong bình luận. Võ Hoàng Quân và cộng sự (2017) [8] cũng đã nghiên cứu một mô hình Đa kênh LSTM-CNN để phân tích cảm xúc đối với ngôn ngữ Việt Nam.
Nghiên cứu được triển khai trên hai tập dữ liệu gồm một tập dữ liệu do nhóm tác giả tự tạo đó là Vietnamese sentiment (VS) chứa 17.500 bài đánh giá bằng tiếng Việt trên các sàn thương mại điện tử và được gán nhãn bằng tay cho ba phân loại cảm xúc tích cực, tiêu cực và trung lập, một tập dữ liệu khác là tập dữ liệu Vietnamese Language and Speech Processing (VLSP) năm 2016 chứa 5.100 bài đánh giá đã được gán nhãn cho ba phân loại cảm xúc. Kết quả mô hình đạt tốt nhất trên tập dữ liệu VS với điểm số Precision lần lượt trên ba phân loại tích cực, trung lập và tiêu cực là 0,92, 0,81 và 0,9 , với điểm số F1 lần lượt là 0,91, 0,85, 0,864, kết quả này tốt hơn nhiều so với kết quả trên tập dữ liệu VSLP với điểm số Precision cho ba phân loại lần lượt là 0,622, 0,534 và 0,632, với điểm số F1 lần lượt là 0,676, 0,5 và 0,598. Một nghiên cứu khác gần đây của Nguyễn Thành Thuỷ và cộng sự (2019) [9] đề xuất một mô hình học máy trong phân tích ý kiến khách hàng dựa trên văn bản tiếng Việt đối với bài toán dịch vụ khách sạn, phân lớp sắc thái một lời bình luận là tích cực hay tiêu cực.