Luận văn thạc sĩ: Phân loại cảm xúc cho văn bản đơn giản sử dụng contextual valence shifters

Khám phá luận văn thạc sĩ về việc sử dụng contextual valence shifters trong phân loại cảm xúc cho văn bản đơn giản trong khoa học máy tính.

Trường đại học

Đại học Quốc gia TP. HCM

Chuyên ngành

Khoa học máy tính

Người đăng

Ẩn danh

Thể loại

luận văn thạc sĩ

2014

84
1
0

Phí lưu trữ

30 Point

Tóm tắt

I. Giới thiệu

Phân loại cảm xúc văn bản là một lĩnh vực nghiên cứu quan trọng trong xử lý ngôn ngữ tự nhiên. Mục tiêu chính của nghiên cứu này là áp dụng contextual valence shifters để phân loại cảm xúc cho các văn bản đơn giản. Nghiên cứu tập trung vào việc xác định các phương pháp phân loại cảm xúc, từ đó đề xuất một phương pháp mới nhằm cải thiện độ chính xác trong việc phân loại cảm xúc. Phân loại cảm xúc có thể được phân chia thành ba loại: dương, âm và trung lập. Theo tác giả, việc xác định cảm xúc không chỉ dựa vào từ ngữ mà còn phụ thuộc vào ngữ cảnh, điều này dẫn đến việc áp dụng contextual valence shifters như một giải pháp hiệu quả.

1.1 Lý do chọn đề tài

Trong bối cảnh hiện đại, việc hiểu biết về cảm xúc của người khác trở nên quan trọng hơn bao giờ hết. Phân loại cảm xúc không chỉ giúp các tổ chức hiểu rõ ý kiến của khách hàng mà còn hỗ trợ trong các lĩnh vực như chính trị và marketing. Nghiên cứu này nhằm cung cấp một công cụ tự động hóa cho việc phân tích cảm xúc, từ đó giúp nâng cao khả năng tương tác giữa con người và máy tính. Việc áp dụng contextual valence shifters vào phân loại cảm xúc sẽ mở ra những hướng nghiên cứu mới, giúp cải thiện độ chính xác trong việc phân tích cảm xúc từ văn bản.

II. Tổng quan

Nghiên cứu về phân loại cảm xúc đã có nhiều công trình nổi bật. Một trong những công trình quan trọng là của Livia Polanyi và Annie Zaenen (2004), trong đó họ nhấn mạnh rằng việc xác định cảm xúc chỉ dựa vào hóa trị của từ sẽ không cho kết quả chính xác. Họ đề xuất sử dụng contextual valence shifters để cải thiện độ chính xác của việc phân loại cảm xúc. Phương pháp này cho phép xác định cảm xúc dựa trên ngữ cảnh của từ, từ đó giúp phân loại chính xác hơn. Việc nghiên cứu các công trình trước đó sẽ giúp xác định được các phương pháp hiệu quả và những vấn đề cần giải quyết trong nghiên cứu hiện tại.

2.1 Các công trình nghiên cứu liên quan

Các công trình nghiên cứu trước đây đã chỉ ra rằng việc áp dụng các phương pháp truyền thống trong phân loại cảm xúc thường gặp nhiều khó khăn. Đặc biệt, việc chỉ dựa vào từ điển từ để xác định cảm xúc có thể dẫn đến những sai sót trong phân tích. Nghiên cứu của Vivek Narayanan và cộng sự (2013) cũng đã chỉ ra rằng việc kết hợp nhiều phương pháp sẽ mang lại kết quả tốt hơn. Do đó, nghiên cứu hiện tại sẽ tiếp tục khai thác và phát triển các phương pháp này, đặc biệt là việc kết hợp giữa contextual valence shifters và các mô hình học máy hiện đại như Naive Bayes.

III. Phương pháp nghiên cứu

Nghiên cứu sử dụng phương pháp kết hợp giữa contextual valence shifters và các mô hình học máy để phân loại cảm xúc văn bản. Phương pháp này bao gồm việc xây dựng một bộ từ điển mới với 21137 phần tử, kết hợp từ điển hiện có với các từ ngữ mới. Việc sử dụng mô hình Naive Bayes kết hợp với N-Gram và các kỹ thuật xử lý như Chi-Square và Good-Turing Discounting sẽ giúp cải thiện độ chính xác của việc phân loại cảm xúc. Kết quả thu được từ các thử nghiệm cho thấy độ chính xác đạt được là 89%, cho thấy tính hiệu quả của phương pháp đề xuất.

3.1 Kết quả thử nghiệm

Kết quả thử nghiệm cho thấy rằng việc áp dụng contextual valence shifters trong phân loại cảm xúc mang lại hiệu quả cao hơn so với các phương pháp truyền thống. Độ chính xác đạt được trong các bài kiểm tra cho thấy rằng mô hình kết hợp có thể xử lý tốt các văn bản phức tạp, từ đó nâng cao khả năng phân loại cảm xúc trong các ứng dụng thực tế. Những kết quả này không chỉ chứng minh tính khả thi của phương pháp mà còn mở ra hướng đi mới cho các nghiên cứu tiếp theo trong lĩnh vực này.

IV. Kết luận

Nghiên cứu đã chỉ ra rằng contextual valence shifters là một công cụ hữu ích trong việc phân loại cảm xúc văn bản. Bằng cách kết hợp các phương pháp hiện có và cải tiến chúng, độ chính xác trong việc phân loại cảm xúc đã được nâng cao đáng kể. Kết quả nghiên cứu không chỉ có giá trị lý thuyết mà còn có ứng dụng thực tiễn trong việc phát triển các hệ thống phân tích cảm xúc tự động. Từ đó, nghiên cứu mở ra hướng đi mới cho việc áp dụng công nghệ trong phân tích ngữ nghĩa và cảm xúc trong văn bản.

4.1 Ứng dụng thực tiễn

Với sự phát triển của công nghệ thông tin, việc phân loại cảm xúc có thể được ứng dụng trong nhiều lĩnh vực như marketing, phân tích dư luận, và chăm sóc khách hàng. Các tổ chức có thể sử dụng các công cụ phân tích cảm xúc tự động để hiểu rõ hơn về phản hồi của khách hàng, từ đó cải thiện chất lượng sản phẩm và dịch vụ. Nghiên cứu này không chỉ cung cấp một cái nhìn sâu sắc về cảm xúc trong văn bản mà còn tạo ra nền tảng cho các nghiên cứu và ứng dụng trong tương lai.

07/01/2025

Trích đoạn nội dung tài liệu

ĐẠI HỌC QUỐC GIA TP. HCM TRƢỜNG ĐẠI HỌC BÁCH KHOA VÕ NGỌC PHÚ SỬ DỤNG “CONTEXTUAL VALENCE SHIFTERS” ĐỂ PHÂN LOẠI CẢM XÚC CHO CÁC VĂN BẢN ĐƠN GIẢN TRONG MỘT LĨNH VỰC Chuyên ngành : Khoa Học Máy Tính Mã số: 60.01 LUẬN VĂN THẠC SĨ TP. HỒ CHÍ MINH, tháng 06 năm 2014 1 CÔNG TRÌNH ĐƢỢC HOÀN THÀNH TẠI TRƢỜNG ĐẠI HỌC BÁCH KHOA –ĐHQG -HCM Cán bộ hƣớng dẫn khoa học : GS.Phan Thị Tƣơi (Ghi rõ họ, tên, học hàm, học vị và chữ ký) Cán bộ chấm nhận xét 1 : PGS.Quản Thành Thơ (Ghi rõ họ, tên, học hàm, học vị và chữ ký) Cán bộ chấm nhận xét 2 : TS.Huỳnh Trung Hiếu (Ghi rõ họ, tên, học hàm, học vị và chữ ký) Luận văn thạc sĩ đƣợc bảo vệ tại Trƣờng Đại học Bách Khoa, ĐHQG Tp. HCM ngày 17 tháng 07 năm 2014 Thành phần Hội đồng đánh giá luận văn thạc sĩ gồm: (Ghi rõ họ, tên, học hàm, học vị của Hội đồng chấm bảo vệ luận văn thạc sĩ) 1.

Chủ tịch hội đồng: TS. Thƣ ký hội đồng: TS.Bùi Hoài Thắng 3. Cán bộ hƣớng dẫn: GS. Cán bộ chấm nhận xét 1 : PGS.Quản Thành Thơ 5.

Cán bộ chấm nhận xét 2 : TS.Huỳnh Trung Hiếu Xác nhận của Chủ tịch Hội đồng đánh giá LV và Trƣởng Khoa quản lý chuyên ngành sau khi luận văn đã đƣợc sửa chữa (nếu có). CHỦ TỊCH HỘI ĐỒNG TRƢỞNG KHOA………… 2 ĐẠI HỌC QUỐC GIA TP.HCM CỘNG HÒA XÃ HỘI CHỦ NGHĨA VIỆT NAM Độc lập - Tự do - Hạnh phúc TRƢỜNG ĐẠI HỌC BÁCH KHOA NHIỆM VỤ LUẬN VĂN THẠC SĨ Họ tên học viên: Võ Ngọc Phú. Ngày, tháng, năm sinh: 28/10/1982. Nơi sinh: TP HCM.

Chuyên ngành: Khoa Học Máy Tính. TÊN ĐỀ TÀI: SỬ DỤNG “CONTEXTUAL VALENCE SHIFTERS” ĐỂ PHÂN LOẠI CẢM XÚC CHO CÁC VĂN BẢN ĐƠN GIẢN TRONG MỘT LĨNH VỰC II. NHIỆM VỤ VÀ NỘI DUNG: - Nghiên cứu các phƣơng pháp xác định cảm xúc ở các mức: từ, cụm từ, câu, văn bản. - Nghiên cứu các phƣơng pháp phân loại cảm xúc ở các mức.

- Đề xuất phƣơng pháp thực hiện phân loại cảm xúc ở một mức trong một lĩnh vực. NGÀY GIAO NHIỆM VỤ : (Ghi theo trong QĐ giao đề tài). NGÀY HOÀN THÀNH NHIỆM VỤ: (Ghi theo trong QĐ giao đề tài). CÁN BỘ HƢỚNG DẪN (Ghi rõ học hàm, học vị, họ, tên): GS.

TS Phan Thị Tƣơi Tp. CÁN BỘ HƢỚNG DẪN TRƢỞNG KHOA….……… (Họ tên và chữ ký) (Họ tên và chữ ký) 3 LỜI CẢM ƠN Tôi xin gởi lời cảm ơn chân thành và sâu sắc nhất đến GS. Cám ơn Cô đã tận tình chỉ bảo, hƣớng dẫn, định hƣớng cho tôi trong suốt thời gian thực hiện Luận văn. Cám ơn Cô đã chia sẻ cho tôi những kinh nghiệm quý báu trong nghiên cứu khoa học.

Điều đó đã giúp tôi rất nhiều trong việc thực hiện Luận văn cũng nhƣ trong công việc giảng dạy, nghiên cứu của tôi sau này. Tôi cũng xin cảm ơn gia đình đã động viên và tạo mọi điều kiện tốt nhất để tôi có thể tiếp tục theo đuổi việc học tập nghiên cứu. Con xin cám ơn Cha Mẹ, nhờ công lao dƣỡng dục của Ngƣời mà con mới có đƣợc thành quả nhƣ ngày hôm nay. Con xin hứa sẽ tiếp tục cố gắng phấn đấu để vƣơn cao hơn nữa.

Võ Ngọc Phú 4 TÓM TẮT ĐỀ TÀI Tác giả đã nghiên cứu các phƣơng pháp khác nhau của việc cải thiện độ chính xác của phân loại cảm xúc. Sự định hƣớng cảm xúc của một tài liệu có thể là dƣơng (+), âm (-), hoặc neutral (0). Tác giả đã kết hợp 5 bộ từ điển từ [2,3,4,5,6] thành một bộ từ điển với 21137 phần tử. Bộ từ điển mới có nhiều động từ, trạng từ, tính từ, danh từ, các cụm từ và các thành ngữ không có trong 5 bộ từ điển.

Luận văn đã trình bày phƣơng pháp kết hợp dựa trên phƣơng pháp đếm thuật ngữ và phƣơng pháp Contextual Valence Shifters đƣợc cải tiến. Phƣơng pháp cải này đã đạt độ chính xác 68.984% trên tập kiểm tra, và 69.224% trên tập huấn luyện. Luận văn này cũng trình bày phƣơng pháp đƣợc đề xuất dựa trên sự kết hợp của phƣơng pháp N-Gram, phƣơng pháp lựa chọn nét Chi-Square, phƣơng pháp Good- Turing Discounting và phƣơng pháp Contextual Valence Shifters đã cải thiện độ chính xác của phân loại cảm xúc. Phƣơng pháp kết hợp này đạt độ chính xác 89.

Bằng việc sử dụng mô hình Naive Bayes với sự kết hớp N-Gram, lựa chọn nét và phƣơng pháp Good-Turing Discounting để phân loại cảm xúc cho các bài nhận xét về phim, tác giả đã đạt độ chính xác 89. Sau đó, tác giả sử dụng mô hình Naive Bayes để phân loại cảm xúc cho các bài nhận xét về phim với nhiều nét mà đƣợc tạo ra bởi phƣơng pháp Contextual Valence Shifters và tác giá đạt độ chính xác 65. Tất cả các phƣơng pháp đƣợc thực thi để phân loại cảm xúc các bài nhận xét về phim đƣợc dựa trên bộ từ điển mới của tác giả và tập dữ liệu về phim. 5 ABSTRACT We have explored different methods for improving the accuracy of sentiment classification.

The sentiment orientation of a document can be positive (+), negative (-), or neutral (0). We combine five dictionaries from [2, 3, 4, 5, 6] into the new one with 21137 entries. The new dictionary has many additionalverbs, adverbs, phrases and idioms, that are not in five ones before. The thesis shows that our proposed method based on the combination of Term-Counting method and Enhanced Contextual Valence Shifters method, that has improved the accuracy of sentiment classification.

The combined method has accuracy 68.984% on the testing dataset, and 69.224% on the training dataset. The thesis also shows that our proposed method based on the combination of N- Gram, Chi-Square feature selection, Good-Turing Discounting,and Contextual Valence Shifters methods, that has improved the accuracy of sentiment classification. The combined method has an accuracy 89. By using the Naïve Bayes model with combining N-Gram, Chi-Square feature selection and Good-Turing Discounting methods to classify emotions in reviews, we have achievedof 89.

Then, we use Naive Bayes model to classsify reviews with many features which are created by Contextual Valence Shifters method and we have achievedof 65. All of these methods are implemented to classify the reviews based on our new dictionary and the Internet Movie data set. 6 LỜI CAM ĐOAN Tôi cam đoan rằng, ngoại trừ các kết quả tham khảo từ các công trình khác nhƣ đã ghi rõ trong luận văn, các công việc trình bày trong luận văn này là do chính tôi thực hiện và chƣa có phần nội dung nào của luận văn này đƣợc nộp để lấy một bằng cấp ở trƣờng này hoặc trƣờng khác. Ngày 23 tháng 07 năm 2014 Võ Ngọc Phú 7 MỤC LỤC DANH MỤC HÌNH.

10 DANH MỤC BẢNG. 12 CHƢƠNG 1: GIỚI THIỆU. Lý do chọn đề tài. Mục đích nghiên cứu.14 c) Phạm vi nghiên cứu .15 d) Cấu trúc của đề tài .15 CHƢƠNG 2: TỔNG QUAN.

Các công trình nghiên cứu liên quan. Công trình nghiên cứucủaLivia Polanyivà Annie Zaenen năm 2004 .17 a) CVS phân tích cảm xúc ở mức câu .18 b) Phƣơng phápCVS phân loại cảm xúc ở mức văn bản. Công trình nghiên cứucủa A. Công trình nghiên cứucủa Vivek Narayanan, Ishan Arora và Arjun Bhatia năm 2013.

Phƣơng pháp đề xuất .29 CHƢƠNG 3: GIẢI PHÁP .32 a) Tổng quan đề tài.32 b) Phƣơng pháp TC-CVS .32 c) Giải thuật phân loại cảm xúc bằng kết hợp mô hình Naive Bayes với N-Gram, xử lý phủ định, xử lý nhiễu Chi-Square, và làm mịn Good-Turing Discounting (F1).1: Phân loại cảm xúc F1 .33 8 d) Giải thuật phân loại cảm xúc bằng phƣơng pháp Contextual ValenceShifters để tạo các nét cho mô hình Naive Bayes (F2) .33 e) Giải thuật phân loại cảm xúc bằng mô hình Naive Bayes với N-Gram, xử lý phủ định, xử lý nhiễu Chi-Square, làm mịn Good-Turing Discounting, và Contextual Valence Shiters (F1+F2) .3: Phân loại cảm xúc F1+F2. Xây dựng cơ sở dữ liệu. Viết chƣơng trình thử nghiệm .48 CHƢƠNG 4: PHƢƠNG PHÁP ĐÁNH GIÁ.51 CHƢƠNG 5: PHÂN LOẠI CẢM XÚC: KẾT HỢP PHƢƠNG PHÁP ĐẾM THUẬT NGỮ VỚI CONTEXTUAL VALENCE SHIFTERS. Phƣơng pháp kết hợp bao gồm phƣơng pháp đếm thuật ngữ với Contextual Valence Shifters (TC-CVS) .1: Phân loại cảm xúc bằng phƣơng pháp kết hợp TC-CVS ở mức độ câu .2: Phân loại cảm xúc bằng phƣơng pháp kết hợp TC&CVS ở mức độ văn bản .3: Tạo từ điển mới từ năm từ điển .58 CHƢƠNG 6: PHÂN LOẠI CẢM XÚC: KẾT HỢP MÔ HÌNH NAÏVE BAYES VỚI N-GRAM, XỬ LÝ PHỦ ĐỊNH, XỬ LÝ NHIỄU CHI-SQUARE, VÀ LÀM MỊN GOOD-TURING DISCOUNTING.

Xử lý phủ định. Xử lý nhiễu Chi-Square. Làm mịn Good-Turing Discounting .63 CHƢƠNG 7: PHÂN LOẠI CẢM XÚC: KẾT HỢP MÔ HÌNH NAÏVE BAYES VỚI N-GRAM, XỬ LÝ PHỦ ĐỊNH, XỬ LÝ NHIỄU CHI-SQUARE, LÀM MỊN GOOD-TURING DISCOUNTING VÀ PHƢƠNG PHÁP CONTEXTUAL VALENCE SHIFTERS. Phân loại cảm xúc bằng phƣơng pháp Contextual Valence Shifters để tạo các nét cho mô hình Naïve Bayes (F2).

Chuyển đổi hóa trị sang tần số (F2.1: Chuyển đổi hóa trị sang tần số .2: Chuyển phủ định. Nhấn mạnh và giảm nhẹ (F2.3: Nhấn mạnh và giảm nhẹ. Phân loại cảm xúc bằng sự kết hợp mô hình Naïve Bayes với N_Gram, xử lý phủ định, xử lý nhiễu Chi-Square, làm mịn Good-Turing Discounting và Contextual Valence Shifters (F1+F2) .68 CHƢƠNG 8: THỬ NGHIỆM VÀ ĐÁNH GIÁ. Phân loại cảm xúc bằng phƣơng pháp kết hợp đếm thuật ngữ với Contextual Valence Shifters.

Phân loại cảm xúc bằng sự kết hợp mô hình Naive Bayes với N-GRAM, xử lý phủ định, xử lý nhiễu Chi-Square, và làm mịn Good-Turing Discouting (F1). Phân loại cảm xúc bằng sự kết hợp mô hình Naive Bayes với N-GRAM, xử lý phủ định, xử lý nhiễu Chi-Square, làm mịn Good-Turing Discounting và phƣơng pháp Contextual Valence Shifters (F1+F2). Phân loại cảm xúc bằng phƣơng pháp Contextual Valence Shifters để tạo các nét cho mô hình Naive Bayes (F2). Phân loại cảm xúc bằng sự kết hợp mô hình Naive Bayes với N-GRAM, xử lý phủ định, xử lý nhiễu Chi-Square, làm mịn Good-Turing Discounting và phƣơng pháp Contextual Valence Shifters (F1+F2) .76 CHƢƠNG 9: KẾT LUẬN.

Phân loại cảm xúc bằng phƣơng pháp kết hợp đếm thuật ngữ với phƣơng pháp Contextual Valence Shifters. Phân loại cảm xúc bằng sự kết hợp mô hình Naive Bayes với N-GRAM, xử lý phủ định, xử lý nhiễu Chi-Square, và làm mịn Good-Turing Discounting. Phân loại cảm xúc bằng sự kết hợp mô hình Naive Bayes với N-GRAM, xử lý phủ định, xử lý nhiễu Chi-Square, làm mịn Good-Turing Discounting và phƣơng pháp Contextual Valence Shifters .79 CÔNG TRÌNH NGHIÊN CỨU. 80 TÀI LIỆU THAM KHẢO.

81 11 DANH MỤC HÌNH 2.1: Giải thuật xử lý phủ định[9] .2: Độ chính xác so với số các feature .1: Mô hình phân loại cảm xúc đƣợc đề xuất .2 :Giao diện chƣơng trình .1 : Minh hoạ bộ từ điển mới .2: Các n-grams sau khi áp dụng phƣơng pháp Chi-Square .3: Các n-grams sau khi áp dụng phƣơng pháp Good-Turing Discounting .

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Bài luận văn thạc sĩ mang tiêu đề "Phân loại cảm xúc cho văn bản đơn giản sử dụng contextual valence shifters" của tác giả Võ Ngọc Phú, dưới sự hướng dẫn của GS. Phan Thị Tươi tại Đại học Quốc gia TP. HCM, tập trung vào việc phát triển phương pháp phân loại cảm xúc cho văn bản đơn giản bằng cách sử dụng các yếu tố điều chỉnh giá trị ngữ cảnh. Nghiên cứu này không chỉ cung cấp cái nhìn sâu sắc về cách thức mà cảm xúc có thể được phân loại trong văn bản mà còn mở ra hướng đi mới cho các ứng dụng trong lĩnh vực xử lý ngôn ngữ tự nhiên. Độc giả có thể tìm thấy giá trị trong việc áp dụng các kỹ thuật này vào các lĩnh vực như truyền thông, marketing và phân tích dữ liệu.

Để mở rộng thêm kiến thức về các ứng dụng trong lĩnh vực khoa học máy tính và công nghệ thông tin, bạn có thể tham khảo bài viết "Ứng Dụng Active Learning trong Lựa Chọn Dữ Liệu Gán Nhãn cho Bài Toán Nhận Diện Giọng Nói", nơi nghiên cứu về việc lựa chọn dữ liệu gán nhãn cho các bài toán nhận diện giọng nói, có liên quan đến việc xử lý ngữ nghĩa và cảm xúc.

Ngoài ra, bài viết "Phân Tích Giao Thông Dựa Trên Hình Ảnh Trong Khoa Học Máy Tính" cũng có thể cung cấp cái nhìn thú vị về cách mà công nghệ hình ảnh và phân tích dữ liệu có thể hỗ trợ trong việc hiểu và phân loại thông tin.

Cuối cùng, bạn có thể tìm hiểu thêm về "Nhận diện giọng nói tiếng Việt qua học sâu và mô hình ngôn ngữ", một nghiên cứu rất phù hợp với chủ đề phân tích và xử lý ngữ nghĩa trong văn bản. Những tài liệu này sẽ giúp bạn có cái nhìn toàn diện hơn về các ứng dụng và công nghệ hiện đại trong lĩnh vực này.