Phân Loại Cảm Xúc Văn Bản Tiếng Việt Theo Đối Tượng Trong Nghiên Cứu Thạc Sĩ Khoa Học Máy Tính

Luận văn thạc sĩ khoa học máy tính tập trung phân loại cảm xúc văn bản tiếng Việt theo đối tượng, ứng dụng công nghệ xử lý ngôn ngữ tự nhiên hiệu quả.

Chuyên ngành

Khoa học máy tính

Người đăng

Ẩn danh

Thể loại

luận văn thạc sĩ

2014

90
0
0

Phí lưu trữ

30 Point

Tóm tắt

I. Phân loại cảm xúc văn bản tiếng Việt

Luận văn tập trung vào phân loại cảm xúc trong văn bản tiếng Việt, đặc biệt là việc xác định cảm xúc theo đối tượng cụ thể. Đây là một bài toán quan trọng trong lĩnh vực xử lý ngôn ngữ tự nhiêntrí tuệ nhân tạo, đặc biệt khi ứng dụng vào các bình luận trên mạng xã hội và diễn đàn. Luận văn sử dụng phương pháp học máyphân tích ngữ nghĩa để giải quyết bài toán này, với mục tiêu xây dựng một hệ thống tự động phân tích cảm xúc chính xác và hiệu quả.

1.1. Phương pháp phân tích cảm xúc

Luận văn đề cập đến hai phương pháp chính: học máy (sử dụng các thuật toán như SVM, Naive Bayes) và phân tích hướng ngữ nghĩa. Phương pháp phân tích hướng ngữ nghĩa được ưu tiên vì khả năng xử lý các cấu trúc câu phức tạp trong tiếng Việt. Hệ thống sử dụng đồ thị khái niệmontology để phân tích cấu trúc câu và xác định cảm xúc theo từng đối tượng.

1.2. Ứng dụng thực tiễn

Hệ thống phân loại cảm xúc được phát triển trong luận văn có thể ứng dụng trong nhiều lĩnh vực như marketing, quản lý thương hiệu, và nghiên cứu thị trường. Ví dụ, các công ty có thể sử dụng hệ thống để phân tích phản hồi của khách hàng về sản phẩm, từ đó điều chỉnh chiến lược kinh doanh. Điều này đặc biệt hữu ích trong bối cảnh bùng nổ thông tin trên mạng xã hội và diễn đàn.

II. Đối tượng và phạm vi nghiên cứu

Luận văn tập trung vào các văn bản tiếng Việt liên quan đến nhiều sản phẩm và dịch vụ khác nhau, đặc biệt là các bình luận trên mạng xã hội và diễn đàn. Đối tượng nghiên cứu chính là các văn bản rõ nghĩa, được viết đúng chính tả và có dấu đầy đủ. Luận văn chưa xử lý các văn bản dài, phức tạp hoặc không dấu, điều này mở ra hướng nghiên cứu tiếp theo trong tương lai.

2.1. Phân tích cảm xúc theo đối tượng

Hệ thống được thiết kế để phân tích cảm xúc ở mức độ khía cạnh, tức là xác định cảm xúc của người viết đối với từng đối tượng cụ thể trong văn bản. Ví dụ, trong một bình luận về nhiều sản phẩm, hệ thống có thể xác định cảm xúc tích cực hay tiêu cực đối với từng sản phẩm. Điều này giúp các nhà sản xuất hiểu rõ hơn về phản hồi của khách hàng.

2.2. Thách thức trong phân tích tiếng Việt

Tiếng Việt là một ngôn ngữ có cấu trúc phức tạp, với nhiều biến thể từ ngữ và cấu trúc ngữ pháp đa dạng. Điều này đặt ra thách thức lớn cho việc phân tích cảm xúc. Luận văn đã đề xuất giải pháp sử dụng ontologyđồ thị khái niệm để xử lý các cấu trúc câu phức tạp, từ đó nâng cao độ chính xác của hệ thống.

III. Kết quả và đánh giá

Luận văn đã xây dựng thành công một hệ thống phân loại cảm xúc dựa trên phân tích ngữ nghĩa, đạt độ chính xác cao trong việc phân tích các văn bản tiếng Việt có nhiều đối tượng. Hệ thống có khả năng xử lý các câu so sánh và cấu trúc câu phức tạp, điều này được chứng minh qua các thử nghiệm thực tế.

3.1. Độ chính xác của hệ thống

Kết quả thử nghiệm cho thấy hệ thống đạt độ chính xác cao trong việc phân tích cảm xúc theo đối tượng. Điều này khẳng định hiệu quả của phương pháp phân tích hướng ngữ nghĩa kết hợp với đồ thị khái niệmontology. Hệ thống cũng có khả năng xử lý các văn bản thuộc nhiều miền dữ liệu khác nhau.

3.2. Hướng phát triển tương lai

Luận văn đề xuất hướng phát triển tiếp theo là mở rộng hệ thống để xử lý các văn bản dài, phức tạp và không dấu. Ngoài ra, việc tích hợp thêm các thuật toán học máy tiên tiến có thể giúp nâng cao hiệu quả của hệ thống trong tương lai.

21/02/2025

Trích đoạn nội dung tài liệu

ĐẠI HỌC QUỐC GIA TP. HỒ CHÍ MINH TRƢỜNG ĐẠI HỌC BÁCH KHOA ---------------------- NGUYỄN THANH TÙNG PHÂN LOẠI CẢM XÖC VĂN BẢN TIẾNG VIỆT THEO ĐỐI TƢỢNG Chuyên ngành : Khoa học máy tính Mã số: 60.01 LUẬN VĂN THẠC SĨ TP. HỒ CHÍ MINH, tháng 06 năm 2014 CÔNG TRÌNH ĐƢỢC HOÀN THÀNH TẠI TRƢỜNG ĐẠI HỌC BÁCH KHOA - ĐHQG - HCM Cán bộ hƣớng dẫn khoa học: PGS. Quản Thành Thơ Cán bộ chấm nhận xét 1: GS.

Phan Thị Tƣơi Cán bộ chấm nhận xét 2: TS. Nguyễn Chánh Thành Luận văn thạc sĩ đƣợc bảo vệ tại Trƣờng Đại học Bách Khoa, ĐHQG Tp. HCM ngày 17 tháng 07 năm 2014. Thành phần Hội đồng đánh giá luận văn thạc sĩ gồm: 1.

Quản Thành Thơ 3. Nguyễn Chánh Thành 4. Huỳnh Trung Hiếu 5. Bùi Hoài Thắng Xác nhận của Chủ tịch Hội đồng đánh giá LV và Trƣởng Khoa quản lý chuyên ngành sau khi luận văn đã đƣợc sửa chữa (nếu có).

CHỦ TỊCH HỘI ĐỒNG TRƢỞNG KHOA ĐẠI HỌC QUỐC GIA TP.HCM CỘNG HÕA XÃ HỘI CHỦ NGHĨA VIỆT NAM TRƢỜNG ĐẠI HỌC BÁCH KHOA Độc lập - Tự do - Hạnh phúc NHIỆM VỤ LUẬN VĂN THẠC SĨ Họ tên học viên: Nguyễn Thanh Tùng MSHV: 12070555 Ngày, tháng, năm sinh: 20/22/1986 Nơi sinh: Bình Định Chuyên ngành: Khoa học Máy tính Mã số : 60 48 01 I. TÊN ĐỀ TÀI: PHÂN LOẠI CẢM XÚC VĂN BẢN TIẾNG VIỆT THEO ĐỐI TƢỢNG II. NHIỆM VỤ VÀ NỘI DUNG: - Nghiên cứu các phƣơng pháp phân loại cảm xúc văn bản. - Lựa chọn giải pháp phù hợp áp dụng cho văn bản tiếng Việt.

- Phát triển hệ thống phân loại cảm xúc văn bản tiếng Việt. - Phân tích các kết quả thực nghiệm và đánh giá hệ thống. NGÀY GIAO NHIỆM VỤ: 02/01/2014 IV. NGÀY HOÀN THÀNH NHIỆM VỤ: 21/11/2014 V.

CÁN BỘ HƢỚNG DẪN: PGS. Quản Thành Thơ Tp. HCM, ngày … tháng 08 năm 2014 CÁN BỘ HƢỚNG DẪN TRƢỞNG KHOA PGS. Quản Thành Thơ LỜI CẢM ƠN Xin đặc biệt gửi lời cảm ơn đến thầy giáo PGS.TS Quản Thành Thơ, ngƣời đã truyền đạt nhiều kiến thức, kinh nghiệm quý báu và tận tình hƣớng dẫn trong suốt thời gian tìm hiểu và hoàn thành luận văn.

Cảm ơn các thầy cô trƣờng đại học Bách Khoa thành phố Hồ Chí Minh đã tận tình chỉ dạy trong thời gian học tập tại trƣờng. Chân thành cảm ơn công ty cổ phần YouNet Media đã hỗ trợ môi trƣờng, công nghệ, dữ liệu và tạo điều kiện thuận lợi trong suốt quá trình học tập và làm đề cƣơng luận văn. Gửi lời cảm ơn sâu sắc tới hai em Nguyễn Thị Kim Anh, Nguyễn Phạm Mỹ Trang và các thành viên trong nhóm phân tích cảm xúc văn bản tại công ty YouNet Media đã hỗ trợ trong suốt thời gian thực hiện luận văn tại công ty. Xin cảm ơn gia đình và bạn bè đã hỗ trợ và động viên tiếp thêm nghị lực trong suốt quá trình học tập vừa qua.

Mặc dù đã cố gắng rất nhiều trong việc thực hiện đề cƣơng luận văn, song với thời gian có hạn, nên không thể tránh khỏi những thiếu sót, rất mong nhận đƣợc sự đóng góp ý kiến của quý Thầy Cô. Học viên Nguyễn Thanh Tùng TÓM TẮT Sự phát triển của mạng xã hội và các diễn đàn điện tử đã tạo ra một lƣợng lớn các bài viết của ngƣời dùng về việc đánh giá và so sánh các sản phẩm, dịch vụ mà họ sử dụng. Thông tin trong các bài viết này rất giá trị đối với cả khách hàng lẫn nhà sản xuất trong việc đƣa ra quyết định mua sắm hay định hƣớng chiến lƣợt phát triển sản phẩm. Việc rút trích và phân loại hƣớng cảm xúc trong các bình luận là bài toán thiết thực nhƣng cũng rất phức tạp, đặc biệt là phân tích cảm xúc đúng theo các đối tƣợng đƣợc đề cập trong bài viết.

Có hai phƣơng pháp chính đƣợc sử dụng để giải quyết bài toán phân tích cảm xúc: phƣơng pháp học máy (Support Vector Machine, Naive Bayes, Maximal Entropy) và phƣơng pháp phân tích hƣớng ngữ nghĩa (mức độ văn bản, mức độ câu, mức khía cạnh). Trong khuôn khổ bài toán phân tích cảm xúc văn bản tiếng Việt theo đối tƣợng, đề tài đã sử dụng phƣơng pháp phân tích hƣớng ngữ nghĩa bằng cách sử dụng kết hợp ontology, đồ thị khái niệm và luật phân tích cảm xúc để phân tích cảm xúc theo cấu trúc câu. Ở đây, đồ thị khái niệm và ontology sẽ giúp tự động phân tích cấu trúc câu và luật phân tích cảm xúc sẽ đƣợc sử dụng để phân tích cảm xúc dựa trên cơ sở tri thức đƣợc tạo ra bởi các chuyên gia và đƣợc tích hợp vào hệ thống. Việc sử dụng kết hợp giữa đồ thị khái niệm, ontology và luật phân tích cảm xúc đã giúp hệ thống đạt độ chính xác khá cao trong việc phân tích các bài viết tiếng Việt có chứa nhiều đối tƣợng.

ABSTRACT The growth of social networks and forums generated a huge number of user reviews about products and services they used. The information of these reviews is very valued for shopping decision of customers and also for product development strategy of producers. Sentiment analysis is a pratical problem but it is also very complecated. Especially, target-dependent sentiment analysis is more difficute.

There are two main approachs to solve this problem: machine learning (Support Vector Machine, Naive Bayes, Maximal Entropy) and semantics analysis (document level, sentence level and aspect level). This thesis use a novel semantics analysis approach which combines domain ontology, conceptual graph and operational sentiment rules to solve the target-dependent sentiment problem for Vietnamese text. Ontology and conceptual graph will be used to parse structure of natural sentences automatically and operational sentiment rules allow the sentiment system captures the linguistic knowledge provided by experts and integrates this knowledge seamlessly into the sentiment analysis process. The combination of domain ontology, conceptual graph and operational sentiment rules helped the system get a high accuracy when analyse multi objects Vietnamese texts.

LỜI CAM ĐOAN Tôi xin cam đoan đây là công trình nghiên cứu của tôi. Các số liệu, kết quả nêu trong luận văn là trung thực, khách quan và chƣa từng đƣợc công bố trong bất kỳ một công trình nào khác. Học viên Nguyễn Thanh Tùng MỤC LỤC TÓM TẮT .5 LỜI CAM ĐOAN. Lý do chọn đề tài.

Mục đích nghiên cứu. Đối tƣợng và phạm vi nghiên cứu. Phƣơng pháp nghiên cứu .5 Chƣơng 1: TỔNG QUAN. Bài toán phân tích cảm xúc văn bản.

Phân tích cảm xúc ở mức độ văn bản. Phân tích cảm xúc ở mức độ câu. Phân tích cảm xúc ở mức độ khía cạnh. Những khó khăn trong phân tích cảm xúc văn bản tiếng Việt .12 Chƣơng 2: PHÂN TÍCH CẢM XÚC VĂN BẢN THEO ĐỐI TƢỢNG.

Các công trình nghiên cứu liên quan .17 Chƣơng 3: CƠ SỞ LÝ THUYẾT. Hệ thống dựa trên tri thức. Đồ thị khái niệm. Những kí hiệu cơ bản.

Ngữ nghĩa hình thức. Đồ thị khái niệm cơ bản. Đồ thị khái niệm lồng nhau. Đồ thị khái niệm và phép toán phủ định.

Luật dựa trên đồ thị khái niệm. Ứng dụng đồ thị khái niệm cải tiến trong hệ thống. Từ điển cảm xúc. Trƣờng hợp sử dụng từ cảm xúc.

Xây dựng đồ thị khái niệm từ văn bản. Trình tự xây dựng một đồ thị khái niệm. Hệ thống chuyển đổi và luật phân tích cảm xúc. Hệ thống chuyển đổi.

Luật phân tích cảm xúc .38 Chƣơng 4: MÔ HÌNH PHÂN TÍCH CẢM XÚC THEO ĐỐI TƢỢNG. Tiền xử lý văn bản tiếng Việt. Xử lý các ngữ cảm xúc trong tiếng Việt. Luật rút trích ngữ cảm xúc.

Tính điểm cho ngữ cảm xúc. Mô hình phân tích cảm xúc. Mô hình hệ thống phân tích cảm xúc. Mô hình tìm kiếm ngữ nghĩa chung.

Mô hình tìm kiếm cảm xúc đa miền .48 Chƣơng 5: THỰC NGHIỆM VÀ ĐÁNH GIÁ .51 Chƣơng 6: KẾT LUẬN. Hƣớng phát triển. DANH MỤC CÁC TÀI LIỆU THAM KHẢO: .63 DANH MỤC HÌNH Hình 1.1: Minh hoạ phƣơng pháp SVM ( [16] .1: Một đồ thị khái niệm cơ bản.2: Một đồ thị khái niệm cơ bản.3: Hai cách vẽ khác nhau của cùng một luật.4: Luật mở rộng.5: Một đồ thị khái niệm cơ bản của câu “Tôi thích điện thoại A”.6: Đồ thị khái niệm phân cực của câu “Công ty A đánh bại công ty B”.7: Một đồ thị khái niệm lồng của câu “Z2 đẹp nhƣng tôi thích S5”.8: Mô tả tổng quát của một ontology.9: Ví dụ về một ontology.10: Đồ thị khái niệm của câu “Z2 không thua kém gì Galaxy S5”.11: Trình tự xây dựng một đồ thị khái niệm.1: Đồ thị khái niệm của câu “Tôi thích điện thoại A nhƣng tôi mua điện thoại C của công ty B” .2: Mô hình chung của các kĩ thuật tìm kiếm ngữ nghĩa.3: Mô hình hệ thống phân tích cảm xúc.1: Độ chính xác của các chiến lƣợc phân tích cảm xúc.51 DANH MỤC BẢNG Bảng 1.1: Các cách tính Delta idf trong [19].1: Luật kết hợp ngữ cảm xúc trong công trình của Turney [24] .1: Cấu trúc từ điển cảm xúc.2: Minh họa một số luật phân tích cảm xúc.1: Sự phân bố các lớp trong tập mẫu.2: Kết quả phân loại của lớp positive.3: Kết quả phân loại của lớp negative.4: Kết quả phân loại của lớp neutral.57 TỪ VIẾT TẮT Từ viết tắt Dạng đầy đủ Nghĩa AKO A-Kind-Of Quan hệ một loại của CG Conceptual Graph Đồ thị khái niệm CSS Cross-domain Semantic Hệ thống tìm kiếm ngữ nghĩa theo Search miền IDF Inverse Document Frequency Nghịch đảo độ phổ biến của một từ KB Knowledge Base Cơ sở tri thức NCG Nested Conceptual Graph Đồ thị khái niệm lồng NLP Natural Language Processing Xử lý ngôn ngữ tự nhiên OSR Operational sentiment rules Luật phân tích cảm xúc PMI Pointwise Mutual Information Độ đo mối tƣơng quan thông tin POS Part of Speech Nhãn từ loại SO Sentiment Orient Hƣớng cảm xúc SVM Support Vector Machine Phƣơng pháp phân loại văn bản theo vector TF Term Frequency Tần suất xuất hiện của từ TF-IDF Term Frequency - Inverse Giá trị thông tin Document Frequency I. Lý do chọn đề tài Liên mạng internet và các ứng dụng web đang phát triển rất mạnh tại Việt Nam đã tạo ra một sự bùng nổ thông tin điện tử.

Các mạng xã hội, các diễn đàn điện tử, các trang web thƣơng mại và các kênh tin tức cũng đang lớn mạnh một cách nhanh chóng và ngày càng phổ dụng nên con ngƣời có rất nhiều lựa chọn để phát biểu ý kiến của mình, đặc biệt là các đánh giá của họ về các sản phẩm hay dịch vụ đang lƣu hành trên thị trƣờng.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Phân Loại Cảm Xúc Văn Bản Tiếng Việt Theo Đối Tượng Trong Luận Văn Thạc Sĩ Khoa Học Máy Tính là một nghiên cứu chuyên sâu về việc áp dụng các phương pháp học máy để phân loại cảm xúc trong văn bản tiếng Việt dựa trên đối tượng cụ thể. Tài liệu này cung cấp cái nhìn chi tiết về cách xây dựng mô hình, xử lý ngôn ngữ tự nhiên (NLP) và ứng dụng thực tiễn trong việc phân tích cảm xúc, giúp người đọc hiểu rõ hơn về các thách thức và giải pháp trong lĩnh vực này. Đặc biệt, nghiên cứu này mang lại giá trị lớn cho những ai quan tâm đến NLP và AI trong bối cảnh tiếng Việt.

Để mở rộng kiến thức về các ứng dụng học sâu trong xử lý ngôn ngữ tiếng Việt, bạn có thể tham khảo Luận văn thạc sĩ khoa học máy tính xây dựng hệ thống học sâu tự động thêm dấu cho tiếng việt, nghiên cứu về việc tự động thêm dấu cho văn bản tiếng Việt. Ngoài ra, Luận văn thạc sĩ khoa học máy tính trích xuất thông tin thực thể và quan hệ trong văn bản tiếng việt bằng mô hình đồ thị động cung cấp góc nhìn về trích xuất thông tin từ văn bản. Cuối cùng, Luận văn thạc sĩ khoa học máy tính tóm tắt văn bản tiếng việt sử dụng hệ thống học sâu là một tài liệu hữu ích để hiểu sâu hơn về tóm tắt văn bản bằng học sâu.