Khóa luận tốt nghiệp: Tầm ảnh hưởng của tách từ trong nhận dạng chuỗi tiếng Việt

Khóa luận tốt nghiệp nghiên cứu tốt nghiệp công nghệ thông tin nghiên cứu tầm ảnh hưởng của tách từ trên các bài toán nhận dạng, vận dụng lý thuyết vào thực tế, đề xuất giải pháp

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2022

87
2
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: TỔNG QUAN

1.1. ĐẶT VẤN ĐỀ

1.1.1. Đặc điểm ngôn ngữ

1.1.2. Kỹ thuật tách từ

1.1.2.1. Word-based tokenization algorithm (Thuật toán mã hóa dựa trên từ)

1.1.2.2. Subword-based tokenization algorithm (Thuật toán mã hóa dựa trên từ phụ)

1.1.2.3. Character-based tokenization algorithm (Thuật toán mã hóa dựa trên ký tự)

1.2. Đối tượng và phạm vi nghiên cứu

1.2.1. Đối tượng

1.2.2. Phạm vi

1.3. Giới thiệu bài toán

1.4. Bài toán nhận diện cảm xúc theo khía cạnh

1.5. Bài toán hệ thống hỏi đáp

1.6. Cấu trúc khóa luận

1.7. Tính ứng dụng của đề tài

2. CHƯƠNG 2: CÔNG TRÌNH NGHIÊN CỨU LIÊN QUAN

2.1. Công trình trên thế giới

2.1.1. Bài toán phân tích cảm xúc dựa trên khía cạnh

2.1.2. Bài toán đọc hiểu tự động

2.2. Công trình trong nước

2.2.1. Bài toán phân tích tình cảm dựa trên khía cạnh

2.2.2. Bài toán đọc hiểu máy

3. CHƯƠNG 3: CƠ SỞ LÝ THUYẾT, THỬ NGHIỆM

3.1. Dữ liệu sử dụng trong thử nghiệm

3.2. Mô hình BiLSTM-CRF

3.3. Quy trình thực hiện

3.4. Phương pháp đánh giá

3.5. Thông số cài đặt mô hình

3.5.1. Tham số mô hình PhoBERT và mô hình XLM-R

3.5.2. Tham số mô hình BiLSTM-CRF

4. CHƯƠNG 4: KẾT QUẢ

4.1. Bài toán nhận diện cảm xúc theo khía cạnh

4.2. Phân tích kết quả chi tiết

4.3. Bài toán nhận diện khía cạnh

4.4. Bài toán nhận diện cảm xúc

4.5. Kết luận

5. CHƯƠNG 5: KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng quan về tách từ và nhận dạng chuỗi tiếng Việt

Tách từ là một bước quan trọng trong xử lý ngôn ngữ tự nhiên (NLP), đặc biệt với tiếng Việt. Nhận dạng chuỗi là bài toán xác định các thực thể trong văn bản. Ngữ nghĩa đóng vai trò trung tâm trong việc hiểu và xử lý ngôn ngữ. Từ khóa ngữ nghĩatừ khóa LSI giúp tối ưu hóa nội dung và cải thiện hiệu suất nhận dạng. Phân tích ngữ nghĩalập chỉ mục ngữ nghĩa là các kỹ thuật hỗ trợ quá trình này. Công nghệ nhận dạngthuật toán nhận dạng là nền tảng cho các hệ thống NLP hiện đại.

1.1. Đặc điểm ngôn ngữ tiếng Việt

Tiếng Việt thuộc nhóm ngôn ngữ đơn lập, nơi các từ không luôn có nghĩa riêng lẻ. Tách từ trong tiếng Việt phức tạp do sự kết hợp của các âm tiết tạo thành từ có nghĩa. Nhận dạng chuỗi phụ thuộc vào việc xác định ranh giới từ chính xác. Ngữ nghĩa của câu thay đổi tùy thuộc vào cách tách từ, gây ra sự nhập nhằng. Từ khóa ngữ nghĩatừ khóa LSI giúp giải quyết vấn đề này bằng cách liên kết các từ với ngữ cảnh.

1.2. Kỹ thuật tách từ

Có ba kỹ thuật tách từ phổ biến: mã hóa dựa trên từ, mã hóa dựa trên từ phụ, và mã hóa dựa trên ký tự. Mã hóa dựa trên từ chia văn bản thành các từ riêng lẻ. Mã hóa dựa trên từ phụ giải quyết vấn đề từ vựng lớn và từ OOV. Mã hóa dựa trên ký tự chia văn bản thành các ký tự riêng lẻ, giảm kích thước từ vựng nhưng tăng độ dài chuỗi. Nhận dạng chuỗi tiếng Việt đòi hỏi sự kết hợp của các kỹ thuật này để đạt hiệu quả cao.

II. Ứng dụng của tách từ trong nhận dạng chuỗi

Tách từ ảnh hưởng trực tiếp đến hiệu suất của các bài toán nhận dạng chuỗi. Nhận dạng chuỗi đơnnhận dạng chuỗi đa là hai bài toán chính. Nhận dạng chuỗi đơn tập trung vào việc xác định một thực thể duy nhất, trong khi nhận dạng chuỗi đa xác định nhiều thực thể. Ngữ nghĩatừ khóa ngữ nghĩa giúp cải thiện độ chính xác của các bài toán này. Công nghệ nhận dạngthuật toán nhận dạng như BiLSTM-CRF và PhoBERT được sử dụng rộng rãi.

2.1. Bài toán nhận diện cảm xúc theo khía cạnh

Nhận diện cảm xúc theo khía cạnh là bài toán nhận dạng chuỗi đa, nơi cần xác định nhiều thực thể liên quan đến cảm xúc. Tách từ chính xác giúp xác định các khía cạnh và cảm xúc liên quan. Ngữ nghĩa của từ và cụm từ đóng vai trò quan trọng trong việc phân tích cảm xúc. Từ khóa ngữ nghĩatừ khóa LSI giúp liên kết các từ với ngữ cảnh cụ thể. Công nghệ nhận dạng như PhoBERT và XLM-R được sử dụng để cải thiện hiệu suất.

2.2. Bài toán đọc hiểu tự động

Đọc hiểu tự động là bài toán nhận dạng chuỗi đơn, nơi cần xác định một thực thể duy nhất trong văn bản. Tách từ chính xác giúp xác định câu trả lời chính xác từ văn bản. Ngữ nghĩa của câu hỏi và văn bản đóng vai trò quan trọng. Từ khóa ngữ nghĩatừ khóa LSI giúp liên kết câu hỏi với văn bản. Công nghệ nhận dạng như BiLSTM-CRF và PhoBERT được sử dụng để cải thiện hiệu suất.

III. Kết quả và đánh giá

Tách từ có ảnh hưởng đáng kể đến hiệu suất của các bài toán nhận dạng chuỗi. Nhận dạng chuỗi đơnnhận dạng chuỗi đa đều được cải thiện khi sử dụng các kỹ thuật tách từ phù hợp. Ngữ nghĩatừ khóa ngữ nghĩa giúp tăng độ chính xác của các bài toán. Công nghệ nhận dạngthuật toán nhận dạng như BiLSTM-CRF và PhoBERT đạt hiệu suất cao trong các thử nghiệm. Tối ưu hóa SEOtối ưu nội dung cũng được cải thiện nhờ việc sử dụng từ khóa LSI.

3.1. Phân tích kết quả thử nghiệm

Các thử nghiệm trên bộ dữ liệu UIT-ViSD4SAUIT-ViQuAD cho thấy tách từ chính xác giúp cải thiện hiệu suất của các bài toán nhận dạng chuỗi. Nhận diện cảm xúc theo khía cạnh đạt độ chính xác cao hơn khi sử dụng từ khóa ngữ nghĩatừ khóa LSI. Đọc hiểu tự động cũng được cải thiện nhờ việc xác định chính xác các thực thể trong văn bản. Công nghệ nhận dạng như PhoBERT và XLM-R đạt hiệu suất cao trong các thử nghiệm.

3.2. Đánh giá thực tiễn

Tách từnhận dạng chuỗi có ứng dụng rộng rãi trong các hệ thống NLP. Nhận diện cảm xúc theo khía cạnh giúp cải thiện dịch vụ khách hàng. Đọc hiểu tự động hỗ trợ các hệ thống hỏi đáp tự động. Ngữ nghĩatừ khóa ngữ nghĩa giúp tối ưu hóa nội dung và cải thiện hiệu suất. Công nghệ nhận dạngthuật toán nhận dạng như BiLSTM-CRF và PhoBERT là nền tảng cho các ứng dụng NLP hiện đại.

21/02/2025

Trích đoạn nội dung tài liệu

Chương 1. TỔNG QUAN 12 Trong chương này, chúng tôi giới thiệu về một số đặc điểm của bộ dit liệu được sử dụng trong khóa luận, các mô hình sử dụng, các mô hình liên quan và phương pháp đánh giá mô hình. Cùng với đó là quy trình thử nghiệm các mô hình để so sánh. Chương 4: Kết quả Trong chương này, chúng tôi sẽ trình bày phân tích kết quả đạt được từ hai bài toán và các lỗi gặp phải.

Chương 5: Kết luận và hướng phát triển Trong chương này, chúng tôi sẽ chỉ ra sự đóng góp, các vấn dé khó khăn gặp phải và hướng phát triển của khóa luận 1.6 Tính ứng dung của đề tài Trong khoá luận này, chúng tôi sẽ làm rõ liệu tách từ theo từ hay tách từ theo âm tiết sẽ mang lại kết quả tốt hơn cho các bài toán nhận diện chuỗi. Cụ thể hơn, đó là hai bài toán đọc hiểu tự động và phân tích cảm xúc dựa trên khía cạnh. Chúng tôi thực hiện đẻ tài này với mục đích: * Tạo tiền dé cơ sở cho các nghiên cứu để lựa chọn phương pháp tách từ phù hợp với mô hình thực hiện hơn. Tránh việc phải thử nghiệm nhiều lần, lãng phí thời gian và chi phí.

se Góp phần nâng cao độ chính xác dựa trên sự lựa chọn phương pháp tách từ phù hợp với mô hình đang thực hiện.7 Kếtluận Tom lại, trong khoá luận này, chúng tôi thực hiện nghiên cứu kỹ thuật tach từ nào sẽ phù hợp cho bài toán nhận dạng chuỗi trên tiếng Việt. Tổng quan khoá luận được thể hiện như hình 4. ˆ- Âm tiết Nhận dạng chuỗi mang ý nghĩa cảm xúc Am tiết: [Hôm, nay, bầu, trời, thật, trong, xanh, và, đẹp] Pin trâurosrnvr đó nhưng điện iöại Khẩ Tă ñặñg.:oarn: hơn nữa màu sắc không đẹp limvecative Nhận dạng đơn chuỗi Bài toán hệ thống hỏi đáp. BÀI TOÁN NHAN Nhận dạng chuỗi chứa cảm xúc theo khía cạnh [DẠNG CHUOI TREN TIENG VIET Pin trauearrery đó nhưng điệ8 ffi6ậï KiẩTä ñặñg;:arua: hơn nữa màu sắc không đẹp lắmzrroawAxce Nhận dạng đa chuỗi Bài toán phân tích cảm xúc phân cực Pin trâunArrraysrosrnvr đó nhưng Riệñff68ïKfiẩlWfiặfB::¬rusrsx:oArr: hơn nữa mầu sắc không đẹp lắmzraroswaxcezxroarivr Từ Nhận dạng chuỗi mang ý nghĩa khía cạnh Từ: [Hôm_ nay, bầu_trời, thât, trong_ xanh, và, đẹp] 11 HINH 1.5: Tổng quan khoá luận.

CÔNG TRÌNH NGHIÊN CỨU LIÊN QUAN Trong thời gian gần đây, việc phát triển chóng mặt của các trang mạng xã hội cũng như các trang thương mại điện tử giúp cho các doanh nghiệp có thể tìm hiểu được nhiều hơn thông tin đánh giá của khách hàng dành cho sản phẩm của mình. Tuy nhiên, cùng với lợi ích trên thì các doanh nghiệp cũng đang phải đối mặt với "cơn lũ" dữ liệu. Việc khai thác được triệt để những dữ liệu này là điểm mau chốt dé các doanh nghiệp có thể triển khai nhanh chóng các quyết định, cải thiện sản phẩm của mình giúp cho doanh thu cao hơn khi đưa sản phẩm ra thị trường. Vẫn đề được đặt ra là có quá nhiều thông tin để xử lý không thể sử dụng nguồn lực con người để đọc và phân tích đánh giá.

Tuy nhiên hầu hết các dữ liệu đánh giá sản phẩm của người dùng đều là dữ liệu phi cấu trúc. Để giải quyết bài toán trên, những năm trước đây, người ta sẽ sử dụng các bài toán nhận diện cảm xúc (sử dụng phương pháp phân lớp theo câu - Text Classification). Tuy nhiên phương pháp này cũng mang đến rất nhiều van dé cần quan tâm như việc nó sẽ dễ nhận diện sai khi bình luận của khách hàng mang nhiều ý nghĩa khác nhau. Ví dụ đối với câu bình luận: "Máy xài khá ổn đấy.

Tuy nhiên màn hình của nó có vẻ hơi nhỏ nhưng được cái pin khá trâu.", néu là bài toán phân tích cảm xúc sẽ rat khó để có thể đánh giá bình luận trên là tích cực hay tiêu cực. Vì thế mà những năm gần đây các bài toán nhận dạng chuỗi trở nên được chú ý hơn hẳn bởi độ tiện dụng của nó. Bài toán nhận dạng chuỗi gồm hai loại chính là: Nhận dạng đơn chuỗi (Single Span Detection) và Nhận dạng đa chuỗi (Mutil Chương 2. CÔNG TRÌNH NGHIÊN CUU LIÊN QUAN 15 Span Detection).

Bài toán nhận dạng đơn chuỗi được ứng dụng nhiều trong thực tế như các hệ thống hỏi đáp, đọc hiểu tự động,. Bài toán nhận dạng đa chuỗi cũng được quan tâm rất nhiều trong những năm gan đây, có thể kể đến bài toán nhận diện đoạn văn bản mang ý nghĩa cảm xúc khía cạnh giải quyết được các vấn đề bắt cập được kể trên. Ví dụ đối với ví dụ đề cập ở trên, bài toán có thể cho kết quả (Máy xài khá ổn- GENERAL#NEUTRAL, màn hình của nó có vẻ hơi nho-SCREEN#NEGATIVE, pin khá trâu-BATTERY#POSITIVE). Có thể thấy nó khắc phục được nhược điểm nhập nhằng, hơn thế nữa còn có thể trích xuất đoạn văn bản mang ý nghĩa cảm xúc.

Hai bài toán được đề cập ở trên tuy rằng ứng dụng rất tốt trong các ứng dụng thực tế nhưng hiện tại hiệu suất của nó trên các bộ dữ liệu tiếng Việt vẫn chưa được đánh giá cao. Bài toán Nhận diện cảm xúc theo khía cạnh đạt 45,70% [27]. Vì thế mà chúng tôi nghiên cứu tầm ảnh hưởng của tách từ đối với hai bài toán này với mục tiêu đưa ra được một phương pháp tách từ hiệu quả giúp cải thiện hiệu suất cho bài toán nhận dạng chuỗi. Cụ thể là bài toán phân tích cảm xúc khía cạnh và bài toán đọc hiểu máy 2.1 Công trình trên thê giới 2.1 Bài toán phân tích cảm xúc dựa trên khía cạnh Phân tích cảm xúc dựa trên khía cạnh (ABSA) bao gồm ba nhiệm vụ cơ bản: trích xuất cụm từ khía cạnh, trích xuất cụm từ ý kiến và phân loại tình cảm ở cấp độ khía cạnh.

Phân tích cảm xúc dựa trên khía cạnh đã được nghiên cứu và giới thiệu bởi Hu và các cộng sự vào năm 2004 [10], về các khía cạnh đánh giá sản phẩm áp dụng một bộ quy tắc dựa trên các quan sát các số liệu thống kê. Bài toán Phân Chương 2. CÔNG TRÌNH NGHIÊN CUU LIÊN QUAN 16 tích khía cạnh cảm xúc bắt đầu được biết đến từ cuộc thi SemEval 2015 task 12 va SemEval 2016. Trong đánh giá ngữ nghĩa SemEval2014 [22], phân tích cảm xúc dựa trên khía cạnh lần đầu tiên được giới thiệu như một nhiệm vụ chung đối với các bài đánh giá tiếng Anh ở cấp độ câu cho hai lĩnh vực là nhà hàng và khách sạn.

Trong nhiệm vụ 12 của SemEval2015 (SE-ABSA15) [20], phân tích cảm xúc dựa trên khía cạnh ở cấp độ văn bản, có ba tác vụ dành cho người tham gia: ® Nhận diện khía cạnh. © Biểu hiện mục tiêu ý kiến (Opinion Target Expression-OTE). e Nhận diện cảm xúc. Ở tác vụ 1 và tác vụ 3, hệ thống phải có khả năng trích xuất các danh mục khía cạnh và xác định cảm xúc đồi với từng khía cạnh trong các câu hoặc bài đánh giá.

Trong SemEval2015 Task 12 tập dữ liệu đã được xây dựng dựa trên SemEval2014 Task 14 (SE-ABSA14). Trong SE-ABSA15 mô tả danh mục khía cạnh của nó như một loại thực thể được kết hợp với một loại thuộc tính (ví dụ:Food#Style.) Trong task 5 của SemEval2016 [21]: Phân tích cảm xúc dựa trên khía cạnh. Bài báo này mô tả nhiệm vụ được chia sẻ của SemEval 2016 về phân tích cảm xúc dựa trên khía cạnh (ABSA), sự tiếp nối của các nhiệm vụ tương ứng của năm 2014 và 2015. Trong năm thứ ba, nhiệm vụ đã cung cấp 19 tập dữ liệu dao tạo và 20 tập dit liệu thử nghiệm cho 7 lĩnh vực (Khách sạn, Điện tử gia dụng, Viễn thông, Bảo tàng,.) và 8 ngôn ngữ khác (tiếng Hà Lan, tiếng Pháp, tiếng Nga, tiếng Tây Ban Nha, tiếng Thổ Nhĩ Kỳ và tiếng Ả Rập,.) cũng như một thủ tục đánh giá chung.

Từ các bộ dữ liệu này, 25 cho cấp độ câu và 14 cho ABSA cấp van bản; cái sau được giới thiệu lần đầu tiên dudi dang nhiệm vụ con trong SemEval. Nhiệm vụ thu hút 245 bài dự thi từ 29 đội. Với sự gia tăng của nội dung do người dùng cung cấp, với sự quan tâm đến cảm xúc và ý kiến phản hồi, lượng dữ liệu khai thác được từ văn bản đã tăng Chương 2. CÔNG TRÌNH NGHIÊN CUU LIÊN QUAN 17 lên nhanh chóng, cả trong học thuật và kinh doanh.

Tuy nhiên, phần lớn các phương pháp tiếp cận hiện tại cố gắng phát hiện tính tích cực tổng thể của một câu, đoạn văn hoặc khoảng văn bản, bắt kể các thực thể được đề cập (ví dụ: máy tính xách tay, pin, màn hình) và các thuộc tính của chúng (vi dụ: giá cả, thiết kế, chất lượng). Nhiệm vụ phân tích cảm xúc dựa trên các khía cạnh của SemEval- 2015 (SE-ABSA15) là sự tiếp nối của Nhiệm vụ 4 của SemEval-2014 (SE-ABSA14). Trong phân tích tình cảm dựa trên khía cạnh, mục đích là xác định các khía cạnh của các thực thể và tình cảm được thể hiện cho từng khía cạnh. Mục tiêu cuối cùng là có thể tạo ra các bản tóm tắt liệt kê tất cả các khía cạnh và cực tổng thể của chúng.

Phân tích cảm xúc dựa trên khía cạnh nhận được nhiều sự quan tâm. Chứng kiến sự phát triển nhanh chóng của nghiên cứu trong Xử lý ngôn ngữ tự nhiên các công việc ban đầu chỉ tập trung vào việc giải quyết một trong những nhiệm vụ phụ này một cách riêng lẻ. Một sO công việc gần đây tập trung vào việc giải quyết sự kết hợp của hai nhiệm vụ phụ, ví dụ: trích xuất các thuật ngữ khía cạnh cùng với các phân cực tình cảm hoặc trích xuất các thuật ngữ khía cạnh và ý kiến một cách khôn ngoan. Gần đây hơn, nhiệm vụ trích xuất bộ ba đã được đề xuất, tức là trích xuất bộ ba (thuật ngữ khía cạnh, thuật ngữ quan điểm, phân cực cảm xúc) từ một câu.

Tuy nhiên, các cách tiếp cận trước đây không giải quyết được tất cả các nhiệm vụ con trong một khuôn khổ thống nhất. Năm 2021, Mao và các cộng sự [14] đã giới thiệu nhiệm vụ trích xuất bộ ba.2 Bài toán đọc hiểu tự động Khái niệm đọc hiểu máy hay đọc hiểu tự động (MRC) xuất hiện từ rất sớm từ những năm 1970. Nhưng đến năm 2015, các nhà nghiên cứu DeepMind [9] đã dé xuất một giải pháp mới để tạo dữ liệu có giám sát với quy mô lớn để học các mô hình MRC. Đánh dấu sự hồi sinh của bài toán MRC, với sự xuất hiện hàng loạt Chương 2.

CÔNG TRÌNH NGHIÊN CUU LIÊN QUAN 18 của các bộ đữ liệu lớn dựa trên giải pháp mới. Đầu tiên là Bộ dir liệu CNN [8]. Họ cũng dé xuất một mô hình Neural Network-mô hình LSTM dựa trên Attention- based có tên là Attentive Reader [8].

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu "Nghiên cứu tách từ và ảnh hưởng đến nhận dạng chuỗi tiếng Việt" tập trung vào việc phân tích quá trình tách từ trong tiếng Việt và tác động của nó đến khả năng nhận dạng chuỗi văn bản. Nghiên cứu này đưa ra các phương pháp tối ưu hóa việc tách từ, giúp cải thiện độ chính xác trong các ứng dụng xử lý ngôn ngữ tự nhiên (NLP) như dịch máy, phân loại văn bản và nhận dạng thực thể. Đây là nguồn tài liệu hữu ích cho những ai quan tâm đến việc nâng cao hiệu quả xử lý ngôn ngữ tiếng Việt trong lĩnh vực khoa học máy tính.

Để mở rộng kiến thức về các phương pháp xử lý ngôn ngữ tiếng Việt, bạn có thể tham khảo Luận văn đề tài xây dựng mô hình ngôn ngữ cho tiếng Việt, nghiên cứu này cung cấp cái nhìn sâu hơn về việc xây dựng các mô hình ngôn ngữ phù hợp với đặc thù của tiếng Việt. Ngoài ra, Luận văn thạc sĩ khoa học máy tính bắt lỗi chính tả bằng phương pháp Transformer cũng là một tài liệu đáng chú ý, giúp bạn hiểu rõ hơn về các kỹ thuật hiện đại trong việc xử lý lỗi chính tả. Cuối cùng, Luận án tiến sĩ khoa học máy tính phân tích cảm xúc trên cơ sở trị cảm xúc chuyển dịch theo ngữ cảnh cho tiếng Việt sẽ mang đến góc nhìn chuyên sâu về phân tích cảm xúc, một ứng dụng quan trọng trong NLP.

Những tài liệu này không chỉ bổ sung kiến thức mà còn giúp bạn khám phá các phương pháp tiên tiến trong lĩnh vực xử lý ngôn ngữ tiếng Việt.