Chương 1, giới thiệu tổng quan như đã được trình bày ở trên. Trong đó, chúng tôi trình bày sự phát triển của thị trường TMĐT ở Việt Nam trong những năm gần đây và vấn đề xuất hiện ngày càng nhiều các bài đánh giá rác. Bên cạnh đó, chúng tôi cũng trình bày những thách thức, mục tiêu, phương pháp nghiên cứu và những đóng góp của chúng tôi trong dé tài này. Chương 2, trình bày cơ sở lý thuyết của dé tài nghiên cứu.
Trong đó, chúng tôi sẽ mô tả bài toán và khảo sát các công trình liên quan. Sau đó giới thiệu hai hướng tiếp cận cho bài toán phát hiện bài đánh giá rác bao gồm rule-based và model-based. Tiếp theo, chúng tôi trình bày một số kỹ thuật trích xuất đặc trưng từ văn bản, một số mô hình mạng nơ-ron học sâu và mô hình học chuyển tiếp được sử dụng cho bài toán phát hiện các bài đánh giá rác. Cuối cùng là giới thiệu một số phương pháp kết hợp metadata vào mô hình phân loại bao gồm dữ liệu dạng danh mục và dạng văn bản.
Chương 3, trình bày quy trình xây dựng bộ dữ liệu cho bài toán. Trong chương này, chúng tôi sẽ mô tả chi tiết về quá trình thu thập dữ liệu, các công cu dùng để thu thập va gan nhãn dif liệu, xây dựng hướng dẫn gán nhãn và quá trình thực hiện gán nhãn cho bộ dữ liệu và phương pháp đánh giá độ đồng thuận giữa những người gán nhãn. CAU TRÚC KHÓA LUẬN Chương 4, chúng tôi sẽ trình bày chi tiết cách cài đặt thử nghiệm của chúng tôi. Trong đó bao gồm các độ đo đánh giá, các bước tiền xử lý dữ liệu và chỉ tiết thiết lập thông số để huấn luyện mô hình.
Chương 5, trình bày chi tiết các kết quả thử nghiệm trên bộ dữ liệu thu thập được. Trong đó, chúng tôi sẽ trình bày kết quả thử nghiệm ban đầu và phân tích lỗi. Sau đó trình bày tổng quan về phương pháp đề xuất kết hợp metadata hai thuộc tính danh mục sản phẩm và mô tả sản phẩm. Tiếp theo, chúng tôi thử nghiệm và đánh giá hiệu suất các mô hình khi kết hợp metadata trên bộ dữ liệu, sau đó phân tích lỗi trong từng trường hợp.
Cuối cùng, chúng tôi đánh giá hiệu quả của phương pháp dé xuất. Chương 6, chúng tôi trình bày chương trình minh họa cho bài toán phát hiện đánh giá rác. Sau khi đã thử nghiệm và đánh giá kết quả, chúng tôi tiến hành xây dựng chương trình minh họa. Các nội dung trình bày bao gồm kiến trúc tổng quan, xây dựng và đánh giá chương trình minh họa.
Chương 7, đây cũng là chương cuối cùng của khóa luận, từ những kết quả nghiên cứu, chúng tôi sẽ đi đến kết luận dé tài bao gồm những kết quả đạt được, hạn chế cũng như hướng phát triển trong tương lai.1 Mô tả bài toán 2.1 Khai niệm bài đánh giá, bài đánh giá rác Bài đánh giá trên các trang TMĐT là một hình thức phản hồi từ phía người dùng về chất lượng sản phẩm đã mua hoặc dịch vụ bán hàng, hình thức này được áp dụng trên hầu hết các nền tảng hoặc các trang web mua bán trực tuyến. Các bài đánh giá thường bao gồm các ý kiến, nhận xét hoặc đánh giá từ người dùng đã mua và trải nghiệm sản phẩm trước đó. Những người mua hàng có thể đánh giá những khía cạnh khác nhau của sản phẩm như chất lượng, đặc tính sản phẩm, dịch vụ và nhiều yếu tố khác có liên quan. Một bài đánh giá thường có điểm số hoặc xếp hạng để thể hiện đánh giá tổng thể của người dùng về sản phẩm, chang hạn như đánh giá từ 1 đến 5 sao.
Bên cạnh đó, người mua hàng cũng có thể thêm các bình luận để mô tả chỉ tiết về sản phẩm mà họ nhận được. Các bài đánh giá từ những người mua trước có vai trò quan trọng trong quyết định mua hàng của người tiêu dùng, họ thường sử dụng những đánh giá này để hiểu rõ hơn về sản phẩm trước khi quyết định mua. Bên cạnh đó, các bài đánh giá cũng giúp nhà cung cấp và người bán hàng cải thiện chất lượng sản phẩm và dịch vụ dựa trên những phản hồi từ phía người dùng. Những bài đánh giá có nội dung tích cực thường giúp tăng danh tiếng của nhà bán hàng và thu nhiều lợi nhuận, trong khi đó những bài đánh giá giả mạo để quảng cáo hoặc làm mất danh tiếng của cửa hàng cũng có ảnh hưởng đáng kể đến lợi ích của nhà bán hàng và nhà sản xuất.
Theo Jindal và Liu [3, 4], những cá nhân tao ra các bài đánh giá này được gọi là những người opinion spammers (những người gửi ý kiến rác) và hành động của họ gọi là opinion spamming (gửi ý kiến rác). Các bài đánh giá được tạo ra bởi những người này được gọi là các bài đánh giá rác (spam reviews), do đó chúng ta cần lưu ý rằng không phải tất cả các bài đánh giá đều chính xác và đáng tin cậy, có thể tổn tại các bài đánh giá giả mạo từ đối thủ cạnh tranh hoặc người dùng không trung thực. Các bài đánh giá rác cần được phát hiện và loại bỏ để đảm bảo rằng ý kiến đánh giá trên các trang TMĐT là nguồn thông tin đáng tin cậy, cung cấp cho người dùng có cái nhìn khách quan và chính xác về sản phẩm. Trong đề tài này, chúng tôi lựa 11 2.
MÔ TẢ BÀI TOÁN chọn phát hiện các bài đánh giá rác trên các trang TMDT và phân loại các bài đánh giá rác dựa trên đặc điểm của chúng.2 Định nghĩa các nhiệm vụ cho bài toán Bài toán phát hiện các bài đánh giá rác của chúng tôi được xem như là bài toán phân phân loại văn bản. Trong đó, chúng tôi xác định hai nhiệm vụ cụ thể: Task 1 là nhiệm vụ phân lớp nhị phân để xác định xem một bài đánh giá có phải là đánh giá rác hay không và Task 2 là nhiệm vụ phân loại nhiều lớp để xác định loại của các bài đánh giá rác dựa trên các đặc điểm của chúng. Nhãn của bài đánh giá rác trong Task 2 là một trong ba loại sẽ được trình bày chi tiết trong Phan 3. Chúng tôi huấn luyện cùng với các bài đánh giá thông thường để đồng thời phân loại bài đánh giá rác và xác định loại của chúng để tránh dự đoán qua nhiều mô hình phức tạp.
Bài toán phân loại và ứng dụng trong việc phát hiện bài đánh giá rác Phân loại là bài toán được nghiên cứu phổ biến trong lĩnh vực học máy, với nhiệm vụ dự đoán nhãn cho các dữ liệu đầu vào. Mục tiêu của bài toán là xây dựng mô hình dự đoán nhãn từ bộ dữ liệu đã được gán nhãn trước đó, mô hình sẽ học các đặc trưng từ dữ liệu này và tìm ra quy luật dùng cho việc phân loại các điểm dit liệu mới. S⁄ INBOX ae CLASSIFIER SZ} SEE Hình 2. Minh hoa bài toán phân loại email rác !.
'Nguén ảnh: https: //developers. com/machine-1earning/guides/ text-classification 12 2. MÔ TẢ BÀI TOÁN Chang hạn như trong bài toán phân loại email rác, chúng ta xây dựng mô hình dựa trên email đã có nhãn trước đó, khi có email mới được gửi đến sẽ qua bộ phân loại để đặt các email vào thư mục tương ứng như được minh hoa trong Hình 2. Bài toán phân loại được chia thành ba loại như sau: ¢ Phân loại nhị phân (binary classification): đây là bài toán phân loại mà mỗi điểm dif liệu chỉ có thể thuộc một trong hai lớp.
« Phân loại nhiều lớp (multi-class classification): đây là bài toán loại mà mỗi điểm dữ liệu thuộc một trong nhiều hơn hai lớp. s Phân loại nhiều nhãn (multi-label classification): đây là bài toán phân loại ma mỗi điểm dữ liệu có thể có nhiều hơn một nhãn. Chúng tôi áp dụng bài toán phân loại văn bản để phát hiện các bài đánh giá rác trên các trang TMĐT, cụ thể là bài toán văn loại văn bản cho các bình luận từ người dùng. Hai nhiệm vụ trong bài toán tương ứng với phân loại nhị phân và phân loại nhiều nhãn.
Minh họa bài toán phát hiện các bài đánh giá rác. Một cách tổng quan, cho một tập các bình luận đánh giá của người dùng W = {w1, t0ạ,., to„}, mục tiêu của chúng tôi là huấn luyện một hàm ánh xạ f(W) để dự đoán chính xác nhãn € {z¡,a.,p} với p là số lớp, cụ thể trong bài toán của chúng tôi p € {2,4}. Khi hàm f(W) có trọng số đã được huấn luyện trên tập dữ liệu, 13 2. CÁC CÔNG TRÌNH LIÊN QUAN chúng ta có thể sử dụng nó để dự đoán nhãn cho các bài đánh giá khác trong tương lai.
Ngoài bình luận của người dùng, hàm f(W) còn được tùy chỉnh để có thể kết hợp thêm một số thuộc tính phụ của bài đánh để tăng hiệu quả dự đoán. Bài toán phát hiện đánh giá rác của chúng tôi được mô tả như sau: « Input: Một bài đánh giá của người dùng (số sao, bình luận) và có thể thêm một số thuộc tính phụ liên quan đến sản phẩm (danh mục, mô tả sản phẩm). « Output: Nhãn của bài đánh giá này nhằm xác định bài đánh giá có phải là đánh giá rác hay không và nếu là đánh giá rác thì xác định loại của chúng.2 Các công trình liên quan Nghiên cứu sơ bộ đã chỉ ra vấn đề ý kiến rác (opinion spam) xuất hiện nhiều trên các nội dung web [3]. Các nghiên cứu sau đó đã đặt ra những thách thức trong việc phát hiện các ý kiến rác, bên cạnh đó cũng chỉ đặc điểm và dé xuất ba khía cạnh cho các ý kiến rác đó [4].
Về bộ dữ liệu, trong Tiếng Anh, có một vài bộ dữ liệu đã được giới thiệu cho bài toán phát hiện đánh giá rác như Yelp Dataset [5], AMT-TripAdvisor [6], Rules- Amazon [4]. Trong Tiếng Việt, cũng có một số bộ dữ liệu về đánh giá của người dùng trên các nền tảng TMĐT, chang hạn như bộ dữ liệu về đánh giá điện thoại và nhà hàng [7, 8], bộ dif liệu phản hồi về điện thoại thông minh [9, 10] và bộ dif liệu phát hiện khiếu nại trên trang web TMĐT [11]. Tuy nhiên, vẫn chưa có bộ dữ liệu cụ thể để phát hiện đánh giá rác trên các trang TMĐT Việt Nam. Do đó, động lực của chúng tôi là xây dựng một bộ dữ liệu phục vụ cho bài toán phát hiện đánh giá rác trên các nền tảng TMĐT của Việt Nam.
Về phương pháp, có nhiều hướng nghiên cứu cho bài toán phát hiện nội dung rác trong đó một vài nghiên cứu đã sử dụng các mẫu (pattern) và quy luật (rule) để lọc ra các nội dung spam [12, 13, 14].