Chương 1. Tổng quan về bai toán. Phạm vi nghién CỨU. Mục tiêu cần at QUOC 177.
Các công trình liên quan được thực hiện .-- ¿+5 «c+c+cec+xexex+ 6 Chương 2. XÂY DỰNG BỘ DỮ LIỆU ĐÁNH GIÁ SẢN PHẢM CỦA KHÁCH HÀNG. Bộ dit liệu. Giai đoạn 1: Chọn và thu thập dữ liệu.
Giai đoạn 2: Chuẩn hóa dit liệu. Giai đoạn 3: Xây dựng hướng dẫn gan nhãn và gan nhãn. Giai đoạn 4: Hoàn thiện đữ liệu. Phân tích bộ dữ liệu.
Các mô hình phân tích cảm xúc cho các đánh giá sản phẩm. Các mô hình truyền thống. Multilingual transformer models. Monolingual transformer models for Vietnamese .3 Độ đo cho bai toán phân lớp.
KET QUA THỰC NGHIỆM. Cài đặt thử nghiệm. + tt ttettrrhtrrrrrrrrrrrrrerrrrrerrrer Al 3. Kết quả thực nghiém.
KET LUẬN VÀ HƯỚNG PHÁT TRIÊN.1 Kết quả nghiên cứu.2 Hướng phát triỂn.----2¿-222+22VE+++t2EEE+++tEEEEEEt2E2E11E222112 2221. ccrrriv44 DANH MỤC HÌNH Hình 2. Tổng quan về xây dựng bộ dữ liệu Hình 2.2 : Biểu đồ về số lượng nhãn trong bộ dữ liệu Hình 2. Minh họa mô hình Rừng ngẫu nhiên (Random Forest) Hình 3.1: Kết quả thử nghiệm DANH MỤC BẢNG Bang 2.1 Một số quy tắc ngữ pháp trong tiếng Việt được áp dụng.
Bộ dữ liệu tiếng Việt trước va sau cân bằng.3: Thông tin tong quan về dit liệu.4: Sự phân bố nhãn trong tập dữ liệu.5: Kết quả thử nghiệm các mô hình TÓM TẮT KHÓA LUẬN Cùng với sự phát triển của mạng Internet, các phương tiện truyền thông, mạng xã hội, website là lượng thông tin vô cùng lớn được tạo bởi người dùng - khách hàng của các doanh nghiệp. Tam quan trong của những dữ liệu này là không phải bàn cãi, ta có thé thấy gã khống lồ Facebook là một trong những tập đoàn lớn nhất thé giới với nguồn sông chính là thông tin được tạo ra bởi chính người dùng - loại tai sản giá trị nhất hiện nay. Một trong những thông tin mà các doanh nghiệp rất quan tâm chính là đánh giá của khách hàng về sản phẩm của họ, đó cũng là lý do cho các mô hình phân tích cảm xúc đánh giá sản phẩm ra đời. Tuy nhiên, bài toán này còn tồn tại nhiều thách thức, như việc liệu bộ dtr liệu được sử dung có đủ tính thực tế hay không, liệu các mô hình có thé hoạt động đủ hiệu quả trên các ngôn ngữ khác nhau, đặc biệt là các ngôn ngữ phức tạp như tiếng Việt.
Nghiên cứu này giới thiệu một hướng tiếp cận mới dé giải quyết bài toán phân tích cảm xúc đánh giá sản phẩm trên tiếng Việt. Tiếng Việt, niềm tự hào của người Việt Nam vốn là một ngôn ngữ rất đặc biệt với sự phức tạp trong ngữ pháp cũng như sự đa dạng nghĩa dựa trên sắc thái, tính đa nghĩa, tính nhập nhằng là điều dé thấy. Điều đó tạo ra nhiều sự khó khăn, thách thức dé có thé phân tích, nhận diện được ý nghĩa cảm xúc trong câu nói trong giao tiếp. Với sự phức tạp và mơ hồ, đang dạng ngữ nghĩa, xây dựng một mô hình phân tích chính xác cảm xúc trong tiếng Việt vốn đã khó khăn trong giao tiếp người — người thực tế nay lại càng khó khăn với một mô hình phân tích.
Dựa trên quan sát, thông thường đối với bạn toán phân tích cảm xúc, các phương pháp phổ biến thường xử lý trên bộ dữ liệu gồm 3 nhãn positive, neutral và negative. Tiếp cận theo một hướng khác, dé có thé phân tích chính xác hơn mà trong nghiên cứu này chúng tôi đưa ra một phương pháp cho bài toán phân tích cảm xúc trong tiếng Việt với 5 nhãn: rất tốt (very positive), tốt (positive), bình thường (neutral), tệ (negative), rất tệ (very negative) thay cho 3 nhãn như ở các mô hình rat phố biến hiện tại dé tăng tính thực tế cho mô hình. Về độ chính xác, băng cách vận dụng các mô hình học máy phô biến, thử nghiệm, tinh chỉnh dé giúp mô hình dự đoán đạt được mức độ chính xác tốt hơn. Ngoài ra, mô hình có kết hợp với đó sử dụng các phương pháp tăng cường đữ liệu để gia tăng tính ứng dụng trong thực tế.
Từ đó cho ra được một một hướng tiếp cận mới với một mô hình phân tích cảm xúc có khả năng mở rộng trên các bộ dữ liệu lớn hơn trong thực tiễn và có tính ứng dụng cao với 5 mức độ cảm xúc, phục vụ nhu cầu đánh giá mức độ hài lòng sản phâm/dịch vụ của một nhãn hàng trong công tác chăm sóc khách hàng và nghiên cứu thị trường. Tổng quan về bài toán Trong kỷ nguyên mà công nghệ thông tin phát triển như vũ bão, sự thống tri của internet và mạng xã hội mang đến lượng thông tin không lồ day giá trị cho các doanh nghiệp, cá nhân khai thác. Nắm bắt, khai thác và phân tích suy nghĩ, phản hồi, đánh giá của khách hàng dé hiểu sự hài lòng, thái độ của họ với sản phẩm, với thương hiệu là điều mà bat cứ doanh nghiệp nào cũng phải làm. Cách thức duy nhất dé có thể làm được điều đó trong một lượng thông tin khổng lồ và phức tạp là sử dụng sự tiến bộ của công nghệ thông tin dé tự động hóa các công việc thu thập, xử lý và phân tích đữ liệu.
Phân tích cảm xúc (SA) là một mảng lớn trong lĩnh vực Xử lý ngôn ngữ tự nhiên, đây là một tác vụ trong xử lý ngôn ngữ tự nhiên, với mục tiêu là trích xuất được cảm xúc được thé hiện từ văn bản bằng ngôn ngữ tự nhiên. Trong thực tế đã có rất nhiều ứng dụng, được các doanh nghiệp quan tâm sử dụng như là một công cụ quan trọng trong công tác tiếp thị, chăm sóc khách hàng. Trong SA, bài toán phân tích cảm xúc đánh giá sản pham giúp cho doanh nghiệp năm bắt và hiểu được khách hàng đang nói gì về sản phẩm, về thương hiệu của mình và đặc biệt là họ thực sự nghĩ gì về chúng. Trước bồi cảnh như vậy, rất nhiều công cụ được xây dựng nhằm đáp ứng nhu cầu đó.
Trong lĩnh vực tiếp thị, những công cụ phân tích cảm xúc đánh giá sản phẩm được dùng để nắm bắt các xu hướng trong thị trường [15,39]. Dễ hiểu hơn, doanh nghiệp muốn biết những cơ hội nào mà họ có thé khai thác từ những tập khách hàng tiềm năng này. Trong [1,28] cũng được sử dụng dé dé tìm kiếm những người dùng có ảnh hưởng trên nền tảng truyền thông xã hội. Thị trường Việt Nam đây tiềm năng nằm trong châu Á được dự đoán sẽ phát triển mạnh mẽ trong 30 năm tới, vậy thì đương nhiên tiếng Việt sẽ là một ngôn ngữ phải quan tâm đến nếu muốn thâm nhập thị trường này.
Tuy nhiên, tiếng Việt lại là một ngôn ngữ rất phức tạp, từ việc có các cấu trúc ngữ pháp phức tạp, sự đa dạng trong nghĩa của từ, của câu tạo nên sự nhập nhằng, mơ hồ trong nghĩa [24]. Trong một số câu cụ thể, ta có thể có được một câu mới có nghĩa khác đi, hoàn toàn đúng ngữ pháp bằng cách đảo vị trí các từ [32]. Cùng một câu nhưng kết thúc bằng dấu câu khác như dấu hỏi, dấu than, dấu ba cham sẽ thay déi đi đáng kể nghĩa của câu, thậm chí trở thành một câu có nghĩa hoàn toàn không liên quan. Không như tiếng Anh có các từ tình thái giúp đễ xác định nghĩa của câu mà thay vào đó là vị trí, thứ tự của các từ sẽ định hình ngữ nghĩa, sắc thái của câu [24].
Vay nên tim ra một hướng tiếp cận mới cho bài toán phân tích cảm xúc đánh giá sản phẩm trên tiếng Việt được đặt ra. Vấn dé mà bài toán này giải quyết là xây dựng một mô hình, làm sao dé khi đưa vào một đánh giá sản phẩm từ phía khách hang vào mô hình thì ta thu được dau ra là một nhãn thé hiện đúng mức độ cảm xúc của đánh giá đó một cách tự động và có khả năng áp dụng trên quy mô, phạm vi lớn. Để làm được như vậy, yêu cầu đặt ra cho nghiên cứu này là phải có một bộ dữ liệu được xây dựng cho tiếng Việt bao gồm các đánh giá sản phâm mà ta hướng đến và xây dựng một mô hình dự đoán sử dụng các kỹ thuật học máy, học sâu dé huấn luyện trên bộ dữ liệu đã có. Thông thường, để tăng tính chính xác cho mô hình dự đoán, cụ thể trong bài toán phân tích cảm xúc đánh giá sản phẩm, các nghiên cứu thường chỉ tập trung vào việc lựa chọn, kết hợp và tinh chỉnh các mô hình thịnh hành nhất tại thời điểm đó và rõ ràng là hướng đi đó đã dẫn đến nhiều kết quả đáng kẻ.
Tuy nhiên đó không phải là hướng đi duy nhất dé có thé tiến xa hơn trong bai toán này. Trong nghiên cứu này sẽ giới thiệu về một hướng tiếp cận khác chuyên biệt cho bài toán phân tích cảm xúc đánh giá sản phẩm và đặc biệt là trong bộ dữ liệu tiếng Việt - một ngôn ngữ thuộc hàng phức tạp trong bài toán xử lý ngôn ngữ tự nhiên. Hướng tiếp cận này hứa hẹn mang đến một cách mới để góp phần vào cải thiện khả năng dự đoán chính xác của các mô hình dự đoán, có khả năng trở thành một mô đun có thể kết hợp với hướng tiếp cận bằng cách kết hợp và tỉnh chỉnh các mô hình học máy, học sâu phổ biến hiện nay dé tăng hiệu quả của mô hình mà lại ít tốn kém chi phí có kha năng áp dụng trên các bộ dữ liệu lớn hơn, ứng dụng vào thực tế. Ứng dụng trong thực tế mô hình phân tích cảm xúc đánh giá sản pham có nhiều ứng dụng trong thực tế, có thé kể đến hỗ trợ công tác thu thập phản hồi khách hàng, công cụ thăm dò thông tin trên mạng xã hội cho tổ chức, chính phủ, công cụ hỗ trợ phân tích, dự đoán xu hướng sản phẩm, công cụ hỗ trợ xác định người nồi tiếng phù hợp cho các chiến dich quảng cáo của nhãn hàng.
Nhìn qua các công trình nghiên cứu gần đây, đã có những bộ dữ liệu được xây dựng cho tiếng Việt. Trong [6], các tác giả đã xây dựng bộ dữ liệu phát hiện mục đích công cộng và bộ dữ liệu Slot filling cho tiếng Việt. Bộ dữ liệu The Association for Vietnamese Language and Speech Processing (VLSP) cho việc đánh giá, xử lý các tác vụ của văn bản và tiếng nói, đặc biệt là phân tích cảm xúc về đánh giá sản phẩm [31]. Hay bộ The dataset of YouTube comments for sentiment analysis (YCSA) chứa cac danh gia vé dién thoai thông minh, từ đó đưa ra mô hình dự đoán trên bộ dữ ligu[23].