Chương 1: Tổng quan Giới thiệu về bài toán lắng nghe quan điểm người dùng trên nền tảng bán lẻ trực tuyến. Tính ứng dụng của khoá luận với mong muốn giải quyết một số van đề khó khăn của bài toán trong thực tế. - Chương 2: Giới thiệu các công trình nghiên cứu liên quan Giới thiệu tổng quan bộ dữ liệu được sử dụng xuyên suốt đề tài, các mô hình học máy và các công trình liên quan tới bài toàn lắng nghe xã hội của một số ngôn ngữ khác trên toàn cầu. - _ Chương 3: Bộ dữ liệu UIT-ViSD4SA và các phương pháp đề xuất Cung cấp thông tin chỉ tiết về bộ dit liệu UIT-ViSD4SA cùng với một sé kĩ thuật khai phá dữ liệu để hiểu rõ hơn về bộ dữ liệu.
Lí thuyết các mô hình học máy được dùng trong khoá luận cũng được cung cấp và phân loại thành các nhóm khác nhau. - _ Chương 4: Cài đặt, thử nghiệm và đánh giá Trang | 18 Trong chương này, các thiết lập thí nghiệm trên bộ dữ liệu được chọn sẽ được cung cấp. Sau đó thực hiện phân tích, so sánh, và đưa ra kết luận về tính khả thi của các mô hình được thực nghiệm đối với bài toán. Chương 5: Kết luận và hướng phát triển Tổng kết lại kết quả đạt được, ưu nhược điểm và đề xuất một số hướng phát triển của khoá luận.
Trang | 19 Chuong 1 TONG QUAN 1. Giới thiệu khoá luận Sự phát triển và phô biến của internet đã buộc các nhóm ngành nghề truyền thống cũng phải thay đôi dé phù hợp hơn với thị hiểu chung của người dùng. Một trong những nhóm ngành ghi nhận sự thay đổi lớn nhất có thé kế đến là lĩnh vực bán lẻ. Thói quen của người dùng đã thay đổi sang lựa chọn sản phẩm được kinh doanh trên các trang bán lẻ trực tuyến hoặc các sản thương mại thay vì đến tận cửa hàng mua sản phẩm.
Tính năng bình luận đánh giá mở toang cánh cửa dé người dùng có thé chia sẻ quan điểm của mình đến với đơn vị phân phối lẻ và doanh nghiệp sản xuất. Việc lắng nghe, tìm hiểu hành vi khách hàng cũng dần chuyền dịch và không còn bó buộc trong các phương pháp khảo sắt truyền thống nữa mà dần chuyển sang hình thức lắng nghe và phân tích quan điểm người dùng [10], từ đó có thé nam bắt nhu cầu, mong muốn va thái độ của khách hàng dé đưa ra các chiến lược kinh doanh hiệu quả. Tuy nhiên, tại Việt Nam, các công cụ hỗ trợ nghiên cứu và phát triển thị trường phô biến hiện tại, ở giai đoạn kiểm định và phân loại dữ liệu hiện tại đang được thực hiện thủ công. Việc phân loại đữ liệu thủ công này vừa gây tốn kém về mặt tài chính, vừa kéo dai thời gian thực hiện các chương trình phân tích hành vi người dùng.
Hậu quả là dẫn tới các chiến dịch kinh doanh được đưa ra không bắt kịp xu hướng, từ đó bỏ lỡ mắt một tệp khác hàng tiềm năng. Tinh ứng dụng của khoá luận Nhu cầu hiểu khách hang từ các động thái của thị trường, cụ thé ở đây là lang nghe xã hội (buzz) của các doanh nghiệp đang ngày càng tăng. Theo khảo sát “Dental trauma in social media-Analysis of Facebook content and public engagement” được thực hién boi Suha Abu-Ghazaleh va cac đồng nghiệp [11], có khoản 1.145 tỉ tỉ MB dữ liệu được sinh ra, 511.914 bình luận và 293.000 câu trạng thái (status) được cập nhật mỗi phút trên mạng xã hội phô biến nhất — Facebook. Việc ứng dụng các quy trình tự động Trang | 20 trong quá trình nghiên cứu khách hàng gần như là bắt buộc dé có thé xử lí được khối lượng dữ liệu được sản sinh liên tục này.
Với việc ứng dụng kĩ thuật xử lí ngôn ngữ tự nhiên dựa trên các nghiên cứu hiện đại, đây có thê sẽ là một hướng giải quyết mới thay cho việc thực hiện thủ công giai đoạn phân loại và đánh giá dữ liệu của doanh nghiệp khi thực hiện nghiên cứu thị trường. Từ đầu ra của khoá luận này, các doanh nghiệp hoàn toàn dùng nó như nguồn tham chiếu với quy trình phân tích kiếm định cũ của mình dé suy nghĩ về việc thay đổi quy trình thực hiện của một chiến dịch phân tích hành vi khách hàng. Từ đó họ có thé rút gọn thời gian các chiến dịch và thay đổi theo thị hiếu của người tiêu dùng, tối ưu hoá được lợi nhuận sản phẩm. Ngoài ra, khoá luận của tôi còn được thực hiện với nên tảng chi phí thấp, tiêu tốn ít tài nguyên dé đạt được kết quả.
Từ điều này các doanh nghiệp có thé xem xét nghiên cứu của tôi như một phương pháp dé thay thé các kĩ thuật truyền thống đã dan lỗi thời. Đây có thé được xem như một trong điểm cộng về mặt kinh tế của đề tài này. Trang | 21 Chương2 GIỚI THIỆU CÁC CONG TRÌNH NGHIÊN CỨU LIÊN QUAN 2. Công trình nghiên cứu về dữ liệu Được xem như nguồn tai sản, tài nguyên không thé bỏ lỡ của bat kì doanh nghiệp, tô chức, đữ liệu đã và đang đóng một vai trò đưa ra quyết định trong nhiều lĩnh vực hiện nay.
Từ xã hội, giáo dục, sáng tạo. cho đến một số nhóm ngành đặc thù như trí tuệ nhân tạo, khoa học dữ liệu, nguồn dữ liệu đóng vai trò quyết định dự án có thành công hay không. Một nguồn dữ liệu chất lượng sẽ giúp đảm bảo được hiệu suất, đầu ra của các mô hình học máy. Quan trọng là vậy nhưng các nghiên cứu về các bộ dữ liệu có chat lượng cao với tiếng Việt van còn hạn chế.
Tính tới thời điểm khoá luận này được thực hiện, chi có một vài bộ dữ liệu tiếng Việt nằm rải rác ở nhiều chủ đề khác nhau. Với mục đích nhận diện chuỗi xúc phạm và phan cảm sẽ có hai bộ ViHSD [12] và HSD-VLSP [13]; mục đích phân tích tính độc hại hay tính xây dựng trên bình luận mạng xã hội sẽ có bộ UIT-ViCTSD [14]; hay bộ ViHOS phục vụ cho bài toán nhận diện chuỗi xúc phạm va phản cảm. Với bải toán phân tích quan điểm dựa trên khía cạnh đối với Anh ngữ, có một sé bộ dit liệu được ghi nhận như nền tang cho các nghiên cứu như bộ dit liệu MAMS [15] có nội dung về đánh giá nhà hàng được thực hiện bởi Qingnan Jiang và các đồng tác giả vào năm 2019. Hoặc bộ dữ liệu SemEval-2014 [16] với nội dung bao gồm các đánh giá nhà hàng và máy tính xách tay.
Hoặc bộ dữ liệu Twitter [17] do tác giả Li Dong và cộng sự với nội dung bao gồm các tweet trên mạng xã hội Twitter. Với bài toán trên nội dung tiếng Việt, các bộ dữ liệu cũng được thực hiện nhưng với một con số tương đối khiêm tốn. Ví dụ bộ dữ liệu đánh giá điện thoại thông minh [18] do tác giả Long Mai và Bắc Lê chỉ gồm có 2,098 câu bình luận. Bộ dữ liệu UIT-VISED [19] do tác giả Luong Phan cho thiết bị di động trên các nên tảng thương mại điện tử gồm 11,122 bình luận được sử dụng phương pháp đánh dau dữ liệu.
Và gần đây nhất, được kế thừa từ bộ dit liệu UIT- VISFD là UIT-VISD4SA phục vụ cho bài toán phân tích quan điểm dựa trên khía cạnh. Trang | 22 UIT-ViSD4SA bao gồm 35,396 chuỗi bình luận trên 10 khía cạnh sản phẩm và 3 tính chất bình luận. _ Các công trình nghiên cứu về mô hình giải quyết bài toán nhận diện Xử lý ngôn ngữ tự nhiên là một lĩnh vực rộng trong mảng khoa học dữ liệu bao gồm nhiều bài toán khác nhau như dịch tự động, tóm tắt văn bản, trích xuất thông tin, hệ trả lời tự động. Mỗi bài toán đều có được đặt ra với mục đích giúp tự động hoá và giải quyết các van dé của người dùng.
Các nghiên cứu trên thé giới cũng tập trung từng ngách nhỏ của từng bài toán khác nhau, và bài toán phân tích quan điểm (sentiment analysis) cũng thu hút được rất nhiều sự quan tâm của giới nghiên cứu. Phân tích quan điểm được hiéu như một phương pháp giúp cho máy học từ dit liệu để tìm ra các đặc điểm, cảm xúc, thái độ của một đoạn văn bản, âm thanh là tích cực hay tiêu cực. Tính ứng dụng của bài toán phân tích quan điểm là rất rộng khi nó được sử dụng trong đa dạng lĩnh vực như lắng nghe xã hội, trợ lý thông minh, hỗ trợ người dùng. Bài toán phân tích quan điểm lại được chia ra làm nhiều bài toán con.
Một số dạng phổ biến được nghiên cứu nhiều là phân tích chỉ tiết, phân tích khía cạnh, phân tích cảm xúc và phân tích ý định. Để tiếp cận với bài toán phân tích quan điểm, tính đến thời điểm hiện tại có rất nhiều cách tiếp cận khác nhau. Trong nghiên cứu của tác giả V. Singh và cộng sự đã có hướng tiếp cận dựa trên phương pháp từ vựng [20].
Hướng tiếp cận sử dụng học máy cũng có nhiều nghiên cứu với kết quả thu được rất khả quan. Từ việc sử dụng các mô hìn học máy cơ bản như Logistic Regression, Suport Vector Machine hoặc Random Forest. Một số mô hình học sâu như RNNs hoặc CNNs cũng được sử dụng cho bài toán này. Mạng nơ-ron Transformers được phát triển và tin dùng, chúng đã dần thay thế những kiến trúc trước đó bởi kết quả thu được tích cực hơn nhiều so với các mô hình trước đó.
Các mô hình như BERT [21], GPT [22], RoBERTa [23] đã đang phủ sóng trên nhiều lĩnh vực khác nhau bởi hiệu suất ấn tượng mà chúng mang lại. Trang | 23 Chương 3 BO DU LIEU UIT-ViSD4SA VÀ CÁC PHƯƠNG PHAP DE XUẤT 3. Giới thiệu bộ dữ liệu UIT-ViSD4SA UIT-ViSD4SA — “Vietnamese smartphone feedback dataset for ABSA and span detection” là bộ dữ liệu tiếng Việt được sử dụng cho bài toán phân tích quan điểm dựa trên khía cạnh. UIT-ViSD4SA là một nguồn đữ liệu uy tín trên tiếng Việt được thực hiện với các quy trình gán nhãn dữ liệu, kiểm tra chất lượng và được cộng đồng nghiên cứu khoa học trên toàn cầu công nhận là một nguồn đáng tin cậy cho bài toán phân tích quan điểm dựa trên khía cạnh.
Nền tảng và nguồn gốc bộ dữ liệu UIT-ViSD4SA Bộ dữ liêu UIT-ViSD4SA được phat triển dựa trên bộ dữ liệu có sẵn “Vietnamese Smartphone Feedback Dataset” - UIT-ViSFD bao gồm các phản hồi sản phẩm được thu thập trên các nền trang bán lẻ trực tuyến lớn tại Việt Nam như thegioididong, fptshop, shopee, tiki và lazada. UIT-ViSED là bộ dit liệu chất lượng cao về phản hồi chất lượng điện thoại di động tại Việt Nam, là bộ dữ liệu lớn và đa dạng hơn so với bộ dữ liệu Vietnamese ABSA chỉ gồm có 2,098 điểm dữ liệu.