Phân Tích Quan Điểm Dựa Trên Khía Cạnh Tiếng Việt

Khóa luận trình bày phương pháp nhận dạng minh chứng cho bài toán phân tích quan điểm trong ngữ cảnh tiếng Việt, góp phần phát triển khoa học dữ liệu.

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2023

53
2
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: TỔNG QUAN

1.1. Giới thiệu khoá luận

1.2. Tính ứng dụng của khoá luận

2. CHƯƠNG 2: GIỚI THIỆU CÁC CÔNG TRÌNH NGHIÊN CỨU LIÊN QUAN

2.1. Công trình nghiên cứu về dữ liệu

2.2. Các công trình nghiên cứu về mô hình giải quyết bài toán nhận diện

3. CHƯƠNG 3: BỘ DỮ LIỆU UIT-ViSD4SA VÀ CÁC PHƯƠNG PHÁP ĐỀ XUẤT

3.1. Giới thiệu bộ dữ liệu UIT-ViSD4SA

3.2. Nền tảng và nguồn gốc bộ dữ liệu UIT-ViSD4SA

3.3. Tóm lược về quy trình gán nhãn của UIT-ViSD4SA

3.4. Phân tích bộ dữ liệu

3.5. Các phương pháp đề xuất

3.6. Phương pháp làm sạch dữ liệu

3.7. Kĩ thuật học chuyển tiếp (Transfer learning)

4. CHƯƠNG 4: CÀI ĐẶT, THỬ NGHIỆM VÀ ĐÁNH GIÁ

4.1. Quy trình thực nghiệm

4.2. Các mô hình học máy truyền thống

4.3. Các mô hình học chuyển tiếp

4.4. Bộ dữ liệu cho bài toán nhận dạng minh chứng cho phân tích quan điểm tiếng Việt

4.5. Cài đặt thí nghiệm và kết quả

4.5.1. Cài đặt thí nghiệm

4.5.2. Kết quả thí nghiệm

4.5.3. Phân tích kết quả

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng Quan Về Phân Tích Quan Điểm Dựa Trên Khía Cạnh Tiếng Việt

Phân tích quan điểm dựa trên khía cạnh tiếng Việt là một lĩnh vực nghiên cứu quan trọng trong ngôn ngữ học và khoa học dữ liệu. Nó không chỉ giúp hiểu rõ hơn về cách người dùng tương tác với sản phẩm mà còn cung cấp cái nhìn sâu sắc về tâm lý và hành vi của người tiêu dùng. Việc áp dụng các phương pháp hiện đại trong phân tích ngôn ngữ tự nhiên đã mở ra nhiều cơ hội mới cho việc nghiên cứu và ứng dụng trong thực tiễn.

1.1. Khái Niệm Phân Tích Quan Điểm Trong Ngôn Ngữ Học

Phân tích quan điểm là quá trình xác định và phân loại ý kiến của người dùng về một sản phẩm hoặc dịch vụ. Điều này bao gồm việc nhận diện các yếu tố cảm xúc và thái độ trong ngôn ngữ mà người dùng sử dụng.

1.2. Tầm Quan Trọng Của Phân Tích Quan Điểm Trong Thương Mại Điện Tử

Trong bối cảnh thương mại điện tử, việc hiểu rõ ý kiến của khách hàng thông qua phân tích quan điểm giúp doanh nghiệp đưa ra quyết định kinh doanh chính xác hơn, từ đó nâng cao trải nghiệm người dùng và tăng trưởng doanh thu.

II. Những Thách Thức Trong Phân Tích Quan Điểm Tiếng Việt

Mặc dù có nhiều tiềm năng, việc phân tích quan điểm tiếng Việt vẫn gặp phải nhiều thách thức. Ngôn ngữ tiếng Việt có cấu trúc ngữ pháp phức tạp và đa dạng về từ vựng, điều này gây khó khăn cho các mô hình phân tích ngôn ngữ tự nhiên.

2.1. Đặc Điểm Ngôn Ngữ Tiếng Việt Ảnh Hưởng Đến Phân Tích

Tiếng Việt có nhiều từ đồng âm và nghĩa khác nhau, điều này làm cho việc phân tích ngữ nghĩa trở nên khó khăn hơn. Các mô hình cần phải được điều chỉnh để phù hợp với đặc điểm này.

2.2. Thiếu Dữ Liệu Chất Lượng Cao Cho Phân Tích

Một trong những thách thức lớn nhất là thiếu hụt bộ dữ liệu chất lượng cao cho việc huấn luyện các mô hình. Điều này ảnh hưởng đến độ chính xác và hiệu quả của các phương pháp phân tích.

III. Phương Pháp Phân Tích Quan Điểm Dựa Trên Khía Cạnh Tiếng Việt

Để giải quyết các thách thức trong phân tích quan điểm tiếng Việt, nhiều phương pháp đã được đề xuất. Các phương pháp này không chỉ giúp cải thiện độ chính xác mà còn tối ưu hóa quy trình phân tích.

3.1. Sử Dụng Mô Hình Học Máy Hiện Đại

Các mô hình học máy như PhoBERT và BiLSTM-CRF đã được áp dụng để cải thiện khả năng phân tích ngữ nghĩa và cảm xúc trong tiếng Việt. Những mô hình này cho thấy hiệu suất cao trong việc nhận diện ý kiến người dùng.

3.2. Kỹ Thuật Tiền Xử Lý Dữ Liệu

Tiền xử lý dữ liệu là bước quan trọng trong quy trình phân tích. Việc làm sạch và chuẩn hóa dữ liệu giúp tăng cường độ chính xác của các mô hình học máy.

IV. Ứng Dụng Thực Tiễn Của Phân Tích Quan Điểm Tiếng Việt

Phân tích quan điểm tiếng Việt có nhiều ứng dụng thực tiễn trong các lĩnh vực như marketing, nghiên cứu thị trường và phát triển sản phẩm. Việc áp dụng các phương pháp phân tích hiện đại giúp doanh nghiệp nắm bắt nhanh chóng xu hướng và nhu cầu của khách hàng.

4.1. Tăng Cường Trải Nghiệm Khách Hàng

Doanh nghiệp có thể sử dụng phân tích quan điểm để cải thiện sản phẩm và dịch vụ, từ đó nâng cao trải nghiệm khách hàng và tăng cường sự trung thành của họ.

4.2. Đưa Ra Quyết Định Kinh Doanh Chính Xác

Phân tích quan điểm giúp doanh nghiệp đưa ra quyết định dựa trên dữ liệu thực tế, từ đó tối ưu hóa chiến lược kinh doanh và tăng trưởng doanh thu.

V. Kết Luận Về Phân Tích Quan Điểm Dựa Trên Khía Cạnh Tiếng Việt

Phân tích quan điểm dựa trên khía cạnh tiếng Việt là một lĩnh vực đầy tiềm năng nhưng cũng không kém phần thách thức. Việc áp dụng các phương pháp hiện đại sẽ giúp nâng cao hiệu quả và độ chính xác trong phân tích, từ đó mang lại giá trị thực tiễn cho doanh nghiệp.

5.1. Tương Lai Của Phân Tích Quan Điểm Tiếng Việt

Với sự phát triển không ngừng của công nghệ, tương lai của phân tích quan điểm tiếng Việt hứa hẹn sẽ có nhiều bước tiến mới, mở ra cơ hội cho các nghiên cứu và ứng dụng mới.

5.2. Khuyến Nghị Đối Với Các Nghiên Cứu Tiếp Theo

Cần tiếp tục nghiên cứu và phát triển các mô hình học máy mới, đồng thời cải thiện chất lượng dữ liệu để nâng cao hiệu quả của phân tích quan điểm trong tiếng Việt.

10/07/2025
Khóa luận tốt nghiệp khoa học dữ liệu nhận dạng các minh chứng cho bài toán phân tích quan điểm dựa trên khía cạnh tiếng việt

Trích đoạn nội dung tài liệu

Chương 1: Tổng quan Giới thiệu về bài toán lắng nghe quan điểm người dùng trên nền tảng bán lẻ trực tuyến. Tính ứng dụng của khoá luận với mong muốn giải quyết một số van đề khó khăn của bài toán trong thực tế. - Chương 2: Giới thiệu các công trình nghiên cứu liên quan Giới thiệu tổng quan bộ dữ liệu được sử dụng xuyên suốt đề tài, các mô hình học máy và các công trình liên quan tới bài toàn lắng nghe xã hội của một số ngôn ngữ khác trên toàn cầu. - _ Chương 3: Bộ dữ liệu UIT-ViSD4SA và các phương pháp đề xuất Cung cấp thông tin chỉ tiết về bộ dit liệu UIT-ViSD4SA cùng với một sé kĩ thuật khai phá dữ liệu để hiểu rõ hơn về bộ dữ liệu.

Lí thuyết các mô hình học máy được dùng trong khoá luận cũng được cung cấp và phân loại thành các nhóm khác nhau. - _ Chương 4: Cài đặt, thử nghiệm và đánh giá Trang | 18 Trong chương này, các thiết lập thí nghiệm trên bộ dữ liệu được chọn sẽ được cung cấp. Sau đó thực hiện phân tích, so sánh, và đưa ra kết luận về tính khả thi của các mô hình được thực nghiệm đối với bài toán. Chương 5: Kết luận và hướng phát triển Tổng kết lại kết quả đạt được, ưu nhược điểm và đề xuất một số hướng phát triển của khoá luận.

Trang | 19 Chuong 1 TONG QUAN 1. Giới thiệu khoá luận Sự phát triển và phô biến của internet đã buộc các nhóm ngành nghề truyền thống cũng phải thay đôi dé phù hợp hơn với thị hiểu chung của người dùng. Một trong những nhóm ngành ghi nhận sự thay đổi lớn nhất có thé kế đến là lĩnh vực bán lẻ. Thói quen của người dùng đã thay đổi sang lựa chọn sản phẩm được kinh doanh trên các trang bán lẻ trực tuyến hoặc các sản thương mại thay vì đến tận cửa hàng mua sản phẩm.

Tính năng bình luận đánh giá mở toang cánh cửa dé người dùng có thé chia sẻ quan điểm của mình đến với đơn vị phân phối lẻ và doanh nghiệp sản xuất. Việc lắng nghe, tìm hiểu hành vi khách hàng cũng dần chuyền dịch và không còn bó buộc trong các phương pháp khảo sắt truyền thống nữa mà dần chuyển sang hình thức lắng nghe và phân tích quan điểm người dùng [10], từ đó có thé nam bắt nhu cầu, mong muốn va thái độ của khách hàng dé đưa ra các chiến lược kinh doanh hiệu quả. Tuy nhiên, tại Việt Nam, các công cụ hỗ trợ nghiên cứu và phát triển thị trường phô biến hiện tại, ở giai đoạn kiểm định và phân loại dữ liệu hiện tại đang được thực hiện thủ công. Việc phân loại đữ liệu thủ công này vừa gây tốn kém về mặt tài chính, vừa kéo dai thời gian thực hiện các chương trình phân tích hành vi người dùng.

Hậu quả là dẫn tới các chiến dịch kinh doanh được đưa ra không bắt kịp xu hướng, từ đó bỏ lỡ mắt một tệp khác hàng tiềm năng. Tinh ứng dụng của khoá luận Nhu cầu hiểu khách hang từ các động thái của thị trường, cụ thé ở đây là lang nghe xã hội (buzz) của các doanh nghiệp đang ngày càng tăng. Theo khảo sát “Dental trauma in social media-Analysis of Facebook content and public engagement” được thực hién boi Suha Abu-Ghazaleh va cac đồng nghiệp [11], có khoản 1.145 tỉ tỉ MB dữ liệu được sinh ra, 511.914 bình luận và 293.000 câu trạng thái (status) được cập nhật mỗi phút trên mạng xã hội phô biến nhất — Facebook. Việc ứng dụng các quy trình tự động Trang | 20 trong quá trình nghiên cứu khách hàng gần như là bắt buộc dé có thé xử lí được khối lượng dữ liệu được sản sinh liên tục này.

Với việc ứng dụng kĩ thuật xử lí ngôn ngữ tự nhiên dựa trên các nghiên cứu hiện đại, đây có thê sẽ là một hướng giải quyết mới thay cho việc thực hiện thủ công giai đoạn phân loại và đánh giá dữ liệu của doanh nghiệp khi thực hiện nghiên cứu thị trường. Từ đầu ra của khoá luận này, các doanh nghiệp hoàn toàn dùng nó như nguồn tham chiếu với quy trình phân tích kiếm định cũ của mình dé suy nghĩ về việc thay đổi quy trình thực hiện của một chiến dịch phân tích hành vi khách hàng. Từ đó họ có thé rút gọn thời gian các chiến dịch và thay đổi theo thị hiếu của người tiêu dùng, tối ưu hoá được lợi nhuận sản phẩm. Ngoài ra, khoá luận của tôi còn được thực hiện với nên tảng chi phí thấp, tiêu tốn ít tài nguyên dé đạt được kết quả.

Từ điều này các doanh nghiệp có thé xem xét nghiên cứu của tôi như một phương pháp dé thay thé các kĩ thuật truyền thống đã dan lỗi thời. Đây có thé được xem như một trong điểm cộng về mặt kinh tế của đề tài này. Trang | 21 Chương2 GIỚI THIỆU CÁC CONG TRÌNH NGHIÊN CỨU LIÊN QUAN 2. Công trình nghiên cứu về dữ liệu Được xem như nguồn tai sản, tài nguyên không thé bỏ lỡ của bat kì doanh nghiệp, tô chức, đữ liệu đã và đang đóng một vai trò đưa ra quyết định trong nhiều lĩnh vực hiện nay.

Từ xã hội, giáo dục, sáng tạo. cho đến một số nhóm ngành đặc thù như trí tuệ nhân tạo, khoa học dữ liệu, nguồn dữ liệu đóng vai trò quyết định dự án có thành công hay không. Một nguồn dữ liệu chất lượng sẽ giúp đảm bảo được hiệu suất, đầu ra của các mô hình học máy. Quan trọng là vậy nhưng các nghiên cứu về các bộ dữ liệu có chat lượng cao với tiếng Việt van còn hạn chế.

Tính tới thời điểm khoá luận này được thực hiện, chi có một vài bộ dữ liệu tiếng Việt nằm rải rác ở nhiều chủ đề khác nhau. Với mục đích nhận diện chuỗi xúc phạm và phan cảm sẽ có hai bộ ViHSD [12] và HSD-VLSP [13]; mục đích phân tích tính độc hại hay tính xây dựng trên bình luận mạng xã hội sẽ có bộ UIT-ViCTSD [14]; hay bộ ViHOS phục vụ cho bài toán nhận diện chuỗi xúc phạm va phản cảm. Với bải toán phân tích quan điểm dựa trên khía cạnh đối với Anh ngữ, có một sé bộ dit liệu được ghi nhận như nền tang cho các nghiên cứu như bộ dit liệu MAMS [15] có nội dung về đánh giá nhà hàng được thực hiện bởi Qingnan Jiang và các đồng tác giả vào năm 2019. Hoặc bộ dữ liệu SemEval-2014 [16] với nội dung bao gồm các đánh giá nhà hàng và máy tính xách tay.

Hoặc bộ dữ liệu Twitter [17] do tác giả Li Dong và cộng sự với nội dung bao gồm các tweet trên mạng xã hội Twitter. Với bài toán trên nội dung tiếng Việt, các bộ dữ liệu cũng được thực hiện nhưng với một con số tương đối khiêm tốn. Ví dụ bộ dữ liệu đánh giá điện thoại thông minh [18] do tác giả Long Mai và Bắc Lê chỉ gồm có 2,098 câu bình luận. Bộ dữ liệu UIT-VISED [19] do tác giả Luong Phan cho thiết bị di động trên các nên tảng thương mại điện tử gồm 11,122 bình luận được sử dụng phương pháp đánh dau dữ liệu.

Và gần đây nhất, được kế thừa từ bộ dit liệu UIT- VISFD là UIT-VISD4SA phục vụ cho bài toán phân tích quan điểm dựa trên khía cạnh. Trang | 22 UIT-ViSD4SA bao gồm 35,396 chuỗi bình luận trên 10 khía cạnh sản phẩm và 3 tính chất bình luận. _ Các công trình nghiên cứu về mô hình giải quyết bài toán nhận diện Xử lý ngôn ngữ tự nhiên là một lĩnh vực rộng trong mảng khoa học dữ liệu bao gồm nhiều bài toán khác nhau như dịch tự động, tóm tắt văn bản, trích xuất thông tin, hệ trả lời tự động. Mỗi bài toán đều có được đặt ra với mục đích giúp tự động hoá và giải quyết các van dé của người dùng.

Các nghiên cứu trên thé giới cũng tập trung từng ngách nhỏ của từng bài toán khác nhau, và bài toán phân tích quan điểm (sentiment analysis) cũng thu hút được rất nhiều sự quan tâm của giới nghiên cứu. Phân tích quan điểm được hiéu như một phương pháp giúp cho máy học từ dit liệu để tìm ra các đặc điểm, cảm xúc, thái độ của một đoạn văn bản, âm thanh là tích cực hay tiêu cực. Tính ứng dụng của bài toán phân tích quan điểm là rất rộng khi nó được sử dụng trong đa dạng lĩnh vực như lắng nghe xã hội, trợ lý thông minh, hỗ trợ người dùng. Bài toán phân tích quan điểm lại được chia ra làm nhiều bài toán con.

Một số dạng phổ biến được nghiên cứu nhiều là phân tích chỉ tiết, phân tích khía cạnh, phân tích cảm xúc và phân tích ý định. Để tiếp cận với bài toán phân tích quan điểm, tính đến thời điểm hiện tại có rất nhiều cách tiếp cận khác nhau. Trong nghiên cứu của tác giả V. Singh và cộng sự đã có hướng tiếp cận dựa trên phương pháp từ vựng [20].

Hướng tiếp cận sử dụng học máy cũng có nhiều nghiên cứu với kết quả thu được rất khả quan. Từ việc sử dụng các mô hìn học máy cơ bản như Logistic Regression, Suport Vector Machine hoặc Random Forest. Một số mô hình học sâu như RNNs hoặc CNNs cũng được sử dụng cho bài toán này. Mạng nơ-ron Transformers được phát triển và tin dùng, chúng đã dần thay thế những kiến trúc trước đó bởi kết quả thu được tích cực hơn nhiều so với các mô hình trước đó.

Các mô hình như BERT [21], GPT [22], RoBERTa [23] đã đang phủ sóng trên nhiều lĩnh vực khác nhau bởi hiệu suất ấn tượng mà chúng mang lại. Trang | 23 Chương 3 BO DU LIEU UIT-ViSD4SA VÀ CÁC PHƯƠNG PHAP DE XUẤT 3. Giới thiệu bộ dữ liệu UIT-ViSD4SA UIT-ViSD4SA — “Vietnamese smartphone feedback dataset for ABSA and span detection” là bộ dữ liệu tiếng Việt được sử dụng cho bài toán phân tích quan điểm dựa trên khía cạnh. UIT-ViSD4SA là một nguồn đữ liệu uy tín trên tiếng Việt được thực hiện với các quy trình gán nhãn dữ liệu, kiểm tra chất lượng và được cộng đồng nghiên cứu khoa học trên toàn cầu công nhận là một nguồn đáng tin cậy cho bài toán phân tích quan điểm dựa trên khía cạnh.

Nền tảng và nguồn gốc bộ dữ liệu UIT-ViSD4SA Bộ dữ liêu UIT-ViSD4SA được phat triển dựa trên bộ dữ liệu có sẵn “Vietnamese Smartphone Feedback Dataset” - UIT-ViSFD bao gồm các phản hồi sản phẩm được thu thập trên các nền trang bán lẻ trực tuyến lớn tại Việt Nam như thegioididong, fptshop, shopee, tiki và lazada. UIT-ViSED là bộ dit liệu chất lượng cao về phản hồi chất lượng điện thoại di động tại Việt Nam, là bộ dữ liệu lớn và đa dạng hơn so với bộ dữ liệu Vietnamese ABSA chỉ gồm có 2,098 điểm dữ liệu.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu "Phân Tích Quan Điểm Dựa Trên Khía Cạnh Tiếng Việt" cung cấp cái nhìn sâu sắc về cách thức ngôn ngữ tiếng Việt ảnh hưởng đến các khía cạnh văn hóa và xã hội. Bài viết nhấn mạnh tầm quan trọng của việc hiểu biết về ngôn ngữ trong việc giao tiếp và xây dựng mối quan hệ trong cộng đồng. Độc giả sẽ nhận được những lợi ích từ việc nắm bắt các quan điểm đa dạng, từ đó có thể áp dụng vào thực tiễn trong công việc và cuộc sống hàng ngày.

Để mở rộng thêm kiến thức, bạn có thể tham khảo tài liệu Luận văn những nhân tố ảnh hưởng đến ý định mua hàng trực tuyến nghiên cứu trong ngành bán lẻ trực tuyến việt nam, nơi phân tích các yếu tố tác động đến hành vi tiêu dùng trong môi trường số. Ngoài ra, tài liệu Luận văn thạc sĩ luật học pháp luật về quảng cáo thương mại trong bối cảnh chuyển đổi số ở việt nam sẽ giúp bạn hiểu rõ hơn về các quy định pháp lý liên quan đến quảng cáo trong thời đại số. Cuối cùng, tài liệu Khoá luận tốt nghiệp pháp luật về khuyến mại trên website thương mại điện tử ở việt nam sẽ cung cấp cái nhìn sâu sắc về các chiến lược khuyến mại hiệu quả trong lĩnh vực thương mại điện tử. Những tài liệu này sẽ giúp bạn mở rộng hiểu biết và áp dụng vào thực tiễn một cách hiệu quả hơn.