Khóa Luận Tốt Nghiệp: Sửa Lỗi Chính Tả Cho Từ Độc Hại Trong Bình Luận Tiếng Việt

Khóa luận trình bày phương pháp sửa lỗi chính tả cho từ độc hại trong bình luận tiếng Việt, góp phần nâng cao chất lượng nội dung trực tuyến.

Chuyên ngành

Khoa học máy tính

Người đăng

Ẩn danh

Thể loại

Khóa luận tốt nghiệp

2021

68
3
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: MỤC TIÊU KHÓA LUẬN

1.1. Đối tượng và phạm vi nghiên cứu

1.2. Kết quả của đề tài

2. CHƯƠNG 2: TÌNH HÌNH NGHIÊN CỨU

2.1. Tình hình nghiên cứu trên các thứ tiếng khác

2.2. Tình hình nghiên cứu trên tiếng Việt

3. CHƯƠNG 3: KIẾN THỨC NỀN TẢNG

3.1. Nhúng từ

3.2. Nhúng từ dựa trên đếm

3.3. Nhúng từ dựa trên dự đoán

3.4. Khoảng cách chỉnh sửa

4. CHƯƠNG 4: PHƯƠNG PHÁP

4.1. Mô hình tổng quát

4.2. Tiền xử lý dữ liệu

4.3. Sửa lỗi chính tả

4.4. Tạo ứng viên

4.5. Tạo dữ liệu đánh giá chứa lỗi chính tả độc hại

5. CHƯƠNG 5: THÍ NGHIỆM VÀ KẾT QUẢ

5.1. Sửa lỗi chính tả cho từ độc hại

5.2. Kết luận và hướng phát triển

DANH MỤC HÌNH

DANH MỤC BẢNG

DANH MỤC TỪ VIẾT TẮT

Tóm tắt

I. Tổng Quan Về Sửa Lỗi Chính Tả Trong Bình Luận Tiếng Việt

Sửa lỗi chính tả trong bình luận tiếng Việt là một vấn đề quan trọng trong lĩnh vực xử lý ngôn ngữ tự nhiên. Việc phát hiện và sửa lỗi chính tả không chỉ giúp cải thiện chất lượng văn bản mà còn nâng cao trải nghiệm người dùng. Đặc biệt, trong bối cảnh mạng xã hội phát triển mạnh mẽ, việc kiểm soát nội dung bình luận trở nên cần thiết hơn bao giờ hết. Nghiên cứu này sẽ tập trung vào các phương pháp sửa lỗi chính tả cho các từ độc hại trong bình luận tiếng Việt.

1.1. Định Nghĩa và Tầm Quan Trọng Của Sửa Lỗi Chính Tả

Sửa lỗi chính tả là quá trình phát hiện và chỉnh sửa các từ sai trong văn bản. Điều này đặc biệt quan trọng trong các bình luận trực tuyến, nơi mà ngôn ngữ không chính thức thường được sử dụng. Việc sửa lỗi giúp đảm bảo thông điệp được truyền đạt một cách rõ ràng và chính xác.

1.2. Các Loại Lỗi Chính Tả Thường Gặp Trong Bình Luận

Có hai loại lỗi chính tả chính: lỗi non-word và lỗi real-word. Lỗi non-word là những từ không tồn tại trong từ điển, trong khi lỗi real-word là những từ có nghĩa nhưng được sử dụng sai ngữ cảnh. Việc phân loại này giúp xác định phương pháp sửa lỗi hiệu quả hơn.

II. Vấn Đề và Thách Thức Trong Sửa Lỗi Chính Tả

Mặc dù có nhiều công cụ và phương pháp sửa lỗi chính tả, nhưng vẫn tồn tại nhiều thách thức trong việc áp dụng chúng cho bình luận tiếng Việt. Các lỗi chính tả độc hại thường được tạo ra một cách cố ý để qua mặt các bộ lọc nội dung. Điều này đặt ra yêu cầu cao hơn cho các hệ thống sửa lỗi chính tả.

2.1. Tình Trạng Lỗi Chính Tả Độc Hại Trong Bình Luận

Lỗi chính tả độc hại thường nhắm vào các từ khóa nhạy cảm, gây khó khăn cho việc phát hiện và xử lý. Những từ này có thể mang tính xúc phạm hoặc quấy rối, làm giảm chất lượng của các cuộc thảo luận trực tuyến.

2.2. Khó Khăn Trong Việc Phát Hiện Lỗi Chính Tả

Việc phát hiện lỗi chính tả trong bình luận tiếng Việt gặp khó khăn do sự đa dạng trong cách viết và ngữ cảnh sử dụng. Các bộ lọc hiện tại thường không đủ mạnh để nhận diện và xử lý các lỗi này một cách hiệu quả.

III. Phương Pháp Sửa Lỗi Chính Tả Hiệu Quả Nhất

Nghiên cứu đã chỉ ra rằng việc sử dụng mô hình Word Embedding, đặc biệt là mô hình word2vec Skip-gram, mang lại hiệu quả cao trong việc sửa lỗi chính tả cho các từ độc hại. Phương pháp này cho phép biểu diễn chính xác các từ hiếm gặp và cải thiện độ chính xác của việc sửa lỗi.

3.1. Mô Hình Word2Vec Skip Gram

Mô hình word2vec Skip-gram hoạt động bằng cách dự đoán các từ ngữ xung quanh một từ mục tiêu. Phương pháp này đã được chứng minh là hiệu quả trong việc xử lý các từ hiếm gặp và cải thiện độ chính xác của việc sửa lỗi chính tả.

3.2. Cải Tiến Trong Thuật Toán Sửa Lỗi

Nghiên cứu cũng đề xuất một số cải tiến trong thuật toán sửa lỗi chính tả, giúp nâng cao hiệu suất và độ chính xác của các mô hình hiện tại. Những cải tiến này bao gồm việc tối ưu hóa quy trình phát hiện và sửa lỗi.

IV. Ứng Dụng Thực Tiễn Của Phương Pháp Sửa Lỗi Chính Tả

Phương pháp sửa lỗi chính tả cho từ độc hại không chỉ có giá trị trong nghiên cứu mà còn có thể được áp dụng rộng rãi trong các hệ thống kiểm soát nội dung trên mạng xã hội. Việc tích hợp công cụ sửa lỗi vào các bộ lọc nội dung sẽ giúp ngăn chặn các bình luận độc hại và cải thiện trải nghiệm người dùng.

4.1. Tích Hợp Vào Hệ Thống Kiểm Soát Nội Dung

Việc tích hợp công cụ sửa lỗi chính tả vào các hệ thống kiểm soát nội dung sẽ giúp phát hiện và xử lý các bình luận độc hại một cách hiệu quả hơn. Điều này sẽ góp phần tạo ra một môi trường trực tuyến an toàn hơn cho người dùng.

4.2. Kết Quả Nghiên Cứu và Đánh Giá

Kết quả nghiên cứu cho thấy mô hình sửa lỗi chính tả đã đạt được độ chính xác cao hơn so với các công cụ hiện có như Google Spell Checker và SymSpell. Điều này chứng tỏ tính khả thi và hiệu quả của phương pháp đề xuất.

V. Kết Luận và Tương Lai Của Nghiên Cứu

Nghiên cứu về sửa lỗi chính tả trong bình luận tiếng Việt đã mở ra nhiều hướng đi mới cho việc phát triển các công cụ xử lý ngôn ngữ tự nhiên. Tương lai của nghiên cứu này sẽ tập trung vào việc cải thiện độ chính xác và khả năng phát hiện lỗi chính tả độc hại trong các ngữ cảnh khác nhau.

5.1. Hướng Phát Triển Nghiên Cứu

Các nghiên cứu tiếp theo có thể tập trung vào việc mở rộng mô hình sửa lỗi chính tả cho các ngôn ngữ khác và các lĩnh vực khác nhau. Điều này sẽ giúp nâng cao khả năng ứng dụng của phương pháp trong thực tiễn.

5.2. Tầm Quan Trọng Của Việc Sửa Lỗi Chính Tả

Sửa lỗi chính tả không chỉ là một vấn đề kỹ thuật mà còn là một yếu tố quan trọng trong việc duy trì chất lượng và sự tôn trọng trong các cuộc thảo luận trực tuyến. Việc phát triển các công cụ hiệu quả sẽ góp phần tạo ra một môi trường giao tiếp tích cực hơn.

10/07/2025
Khóa luận tốt nghiệp khoa học máy tính sửa lỗi chính tả cho từ độc hại trong bình luận tiếng việt

Trích đoạn nội dung tài liệu

Chương 1. Mục tiêu khóa luan. Đối tượng và phạm vi nghiên cứu. Phạm vi nghiên cứỨu.--- ¿+ + ++k*k+kE*EEEESkke ng rưưy 5 1.

Kết qua của dé tài. Sửa lỗi chính tả. Tình hình nghiên CỨU.--- -- ¿2+ + SE *E£EEk#EEEEEEEEEkEkekrkerrrkrkrre § 2. Tình hình nghiên cứu trên các thứ tiếng khác.

Tinh hình nghiên cứu trên tiếng Việt.01,E Le 1 Chương 3. KIÊN THUC NEN TẢNG. Nhúng từ. _ Nhúng từ dựa trên đếm.

Nhúng từ dựa trên dự đoán. Khoảng cách chỉnh sửa.-----+- 5+ St S+ 2xx E1 111g grrec 20 Chương 4. PHƯƠNG PHÁP.--22222222+2222EE2222tEE222E12ErrEtrrrrkrcree 22 4. Mô hình tổng quát.

Tiền xử lý dữ liệu. Sửa lỗi chính tả. _ Tạo ứng viÊn. 2Q ST HH 1n T HH Hee rey 25 4.

Tạo dit liệu đánh giá chứa lỗi chính tả độc hại. THÍ NGHIEM VA KET QUẢ.SG-Sc Ct E1 1 1E 1112112112111 011111 1111111110111 11k 37 5. Sửa lỗi chính tả cho từ độc hại. _ Sửa lỗi chính tả cho từ độc hại như một bước tiền xử lý đầu vao.

KẾT LUẬN VÀ HƯỚNG PHÁT TRIEN .-- 2-5 sz+sz+se+x+ 46 DANH MỤC HÌNH Hình 1. Bad Word Filter PRO khi không có lỗi chính tả độc hại. Bad Word Filter PRO khi gặp lỗi chính tả độc hại .------2¿5¿©5z+cx+2zxvzxeerxevrsersere 16 Hình 3. Mô hình word2vec Skip-gram (nguồn: X.

Mô hình word2vec CBOW (nguôn: X. Mô hình sửa lỗi chính tả tổng quát. Mô hình hóa công đoạn tạo Ứng VIÊN. 5 «xxx sseeseereeee 24 Hình 4.

Mô hình hóa công đoạn sửa lỗi chính tả. Mô hình hóa công đoạn tạo dữ liệu đánh giá chứa lỗi chính tả độc hại. Phân phối các lớp nhãn của bộ dữ liệu VLSP Hate Speech gốc. Phân phối các lớp nhãn của bộ dữ liệu VLSP Hate Speech mới.

Quy trình đánh gia mô hình Hate Speech Detection. Giao diện công cụ sửa lỗi chính tả cho từ độc hại. Két quả công cu sửa lỗi chính tả cho từ độc hại.- ¿5 s55s+s+s 51 DANH MỤC BANG Bảng 2. Cac vi du vé 16i real-Word 0N.

Vi dụ về thao tác và KCCS với từ “dién”. Các loại KCCS và các thao tác tương Ứng. Ví dụ về tiền xử lý dit liệu .-----2¿ 2 ++EE+EE£EEeEEEEEEEEEEEEerkrrkerreee 23 Bảng 5. Một vài ví dụ về các bình luận thuộc ba nhãn lớp.

Phân phối chiều dài của các lỗi chính tả độc hại. Phân phối thao tác chỉnh sửa của các lỗi chính tả độc hại. Các kết quả sửa lỖi. Các kết quả sửa lỗi khi không có cải tiến trong công đoạn.

Một số ví dụ sửa từ bình thường thành từ độc hại. Các ví dụ sửa lỗi thành từ đồng nghĩa. Thống kê số lượng lỗi được sửa thành từ đồng nghĩa với từ mục tiêu. Hiệu suất của mô hình sửa lỗi sử dụng word2vec Skip-gram.

Biến động hiệu suất của mô hình Hate Speech Detection. 45 DANH MỤC TU VIET TAT Acc Accuracy CBOW Continuous Bag of Words DNN Deep Neural Network FNR False Positive Rate KCCS Khoang cach chinh sua XLNNTN Xu lý ngôn ngữ tự nhiên TOM TAT KHÓA LUẬN Sửa lỗi chính tả là bài toán có đầu vào là dữ liệu văn bản, và đầu ra là các từ sai lỗi chính tả (nếu có) đã được sửa lỗi. Trong đề tài này, chúng tôi tập trung sửa lỗi chính tả cho các từ độc hại trong dữ liệu bình luận tiếng Việt. Từ độc hại trong phạm vi khóa luận này là những từ ngữ nói tục, chửi thề, mang tính xúc phạm, gây hắn, thù địch.

Mặc dù đã có công trình nghiên cứu về bài toán này trên dit liệu tiếng Anh, chưa có một công trình nào nghiên cứu về bài toán này cho dữ liệu tiếng Việt. Chính vì vậy, công trình của chúng tôi là công trình đầu tiên thử nghiệm bài toán này trên dữ liệu tiếng Việt. Phương pháp sửa lỗi chính tả cho từ độc hại trong khóa luận này dựa trên Word Embedding được tham khảo từ công trình của nhóm tác giả H. Gong [1] đã được thử nghiệm trên dữ liệu tiếng Anh.

Tuy nhiên, thay vì sử dụng mô hình word2vec CBOW như các tác giả, chúng tôi đề xuất sử dung mô hình word2vec Skip-gram vì mô hình này hoạt động tốt hon và cho phép biểu diễn các từ hiếm gặp một cách chính xác hơn. Bên cạnh đó, chúng tôi cũng đề xuất thêm một cải tiễn mới trong thuật toán sửa lỗi chính tả mà chúng tôi sẽ trình bày chỉ tiết hơn trong phần phương pháp thực hiện. Dữ liệu mà chúng tôi sử dụng cho bài toán này là bộ dữ liệu Hate Speech của cuộc thi VLSP Shared Task 2019. Tuy nhiên, bộ dữ liệu này chưa phải là dữ liệu chứa lỗi chính tả độc hại phù hợp với yêu cầu của bài toán nên chúng tôi cũng đề xuất một cách tạo lỗi chính tả mang tính thực tế vào bộ dữ liệu này để có thể đánh giá được phương pháp sửa lỗi một cách khách quan và toàn diện hơn.

Cuối cùng, kết quả thí nghiệm cho thấy mô hình sửa lỗi chính tả của chúng tôi cho bài toán này tốt hơn công cụ sửa lỗi chính tả của Google và thư viện Symspell đối với những từ độc hại. Đặt vẫn đề Gần đây, với sự phát triển mạnh mẽ của internet va mạng xã hội, tình trạng một sỐ người dùng có những hành động như cố ý quấy rối, xúc phạm, đe doa, ., đến những người dùng khác ngày càng gia tăng và khó kiểm soát. Dé khắc phục điều đó, các nhà phát triển dịch vụ đã cố gang sử dung các bộ lọc để kiểm soát nội dung nhưng với sự tan công của một số người dùng có ý định xấu thì các bộ lọc này dễ dàng bị qua mặt bởi các lỗi chính tả mà những người dùng này cố ý tạo ra. Những lỗi chính tả này được gọi là lỗi chính tả “độc hại” và đặc điểm chung của chúng là: nhắm vào các từ khoá nhạy cảm mà bộ lọc sử dụng dé đưa ra quyết định dẫn đến tình trạng rất nhiều câu qua mặt được bộ lọc.

Tuy nhiên, các từ sai chính tả này vẫn truyền đạt được nội dung mà người tạo ra chúng mong muốn [2]. Bad Word Filter PRO!, một công cụ hữu ích có chức năng lọc những từ ngữ chửi thề và nội dung xấu với 25 ngôn ngữ, cũng dễ dàng bị qua mặt bởi các lỗi chính tả độc hại. Lấy ví dụ với câu bình luận “Thằng chó chết”, nêu một trong hai từ khóa nhạy cảm “chớ” hoặc “chế?” không bị viết sai chính ta, Bad Word Fiter có thé dé dàng tìm được bad word là “chó chết” và gán câu bình luận này là câu chứa nội dung xấu (xem Hình 1. Tuy nhiên, nếu một trong hai từ “chớ” hoặc “chết” bị cố tình viết sai chính tả thành “cho” hoặc “chétt“, Bad Word Filter sẽ không thể tìm được từ nào là bad word và kết quả là quyết định câu bình luận trên là một câu bình thường (xem Hình 1.

Từ ví dụ ở trên chúng ta có thé thay duoc rang việc tích hợp một công cu sửa lỗi chính tả cho các từ độc hại như một bước tiền xử ly đầu vào cho các hệ thống kiểm soát mạng xã hội hay cụ thể hơn là các bộ lọc, bộ phân lớp, phát hiện nội dung xấu là một điều thực sự rất cần thiết để ngăn chặn các lỗi chính tả độc hại đó qua mặt các hệ thông và gây ảnh hưởng xấu đến những người dùng khác.com/media/data/assets/badwordfilter/webgl/ (ngày truy cập: 01/12/2020) Dé đáp ứng nhu cầu này này, nhóm tác giả H. Gong [1] đã đề xuất một phương pháp sửa lỗi chính tả cho các từ “độc hại” và phương pháp này được thử nghiệm trên dữ liệu tiếng Anh. Tuy nhiên, đối với dit liệu tiếng Việt, chưa có một công trình nào nghiên cứu về bài toán này, và đó chính là lí do mà chúng tôi đến với đề tài này. Tóm lại, bài toán mà chúng tôi trình bày trong luận văn này được phát biểu như sau: e Đầu vào: là một câu tiếng Việt e Đầu ra: là câu được sửa lỗi chính tả đối với những từ độc hại chó chết Hình 1.

Bad Word Eilter PRO khi không có lỗi chính tả độc hại thang chó chếtt Hình 1. Bad Word Filter PRO khi gặp lỗi chính tả độc hại 1. Mục tiêu khóa luận Vì chưa có một công trình nào nghiên cứu đề tài này cho tiếng Việt nên mục tiêu chính của chúng tôi là nghiên cứu, cài đặt và đánh giá phương pháp sửa lỗi chính tả cho từ độc hại sử dụng Word Embedding trên dữ liệu tiếng Việt. Song song với việc nghiên cứu phương pháp sửa lỗi chính tả cho từ độc hại, chúng tôi còn đề xuất một cải tiến mới trong thuật toán sửa lỗi chính tả giúp nâng cao hiệu suất của phương pháp này.

Bên cạnh đó, chúng tôi còn thử nghiệm tính hiệu quả của ba loại mô hình Word Embedding là fastText CBOW, word2vec CBOW và word2vec Skip-gram đối với phương pháp sửa lỗi chính tả này. Tiệp theo, đê đánh giá độ hiệu quả của mô hình sửa lỗi chính tả cho từ độc hại, chúng tôi thực hiện so sánh kết quả sửa lỗi của chúng tôi đôi với hai công cụ sửa lỗi chính tả: Google spell checker? và thư viện Symspell’. Cuối cùng, dé chứng minh va nhấn mạnh lại mức độ cần thiết của bài toán, chúng tôi tiễn hành đánh giá mô hình Hate Speech Detection trước và sau khi tích hợp bộ sửa lỗi chính tả cho từ độc hại của chúng tôi ở công đoạn tiên xử lý dữ liệu. Đối tượng và phạm vi nghiên cứu 1.

Đối tượng Việc nghiên cứu các lỗi chính tả độc hại trên dữ liệu tiếng Việt là một đối tượng quan trọng trong đề tài này, đây là cơ sở để có thể đề xuất các ứng viên sửa lỗi chính tả một cách hợp lý, góp phần nâng cao độ chính xác sửa lỗi, giúp phục hồi các từ độc hại hay còn gọi là các từ khóa mà các bộ lọc và các bộ phân lớp sử dụng dé dua ra quyét dinh. Bên cạnh đó, nghiên cứu các lỗi chính tả độc hại cũng góp phan quan trọng trong việc xác định các dạng lỗi và đê ra cách tạo dữ liệu lôi một cách tự động phục vụ cho việc huấn luyện và kiểm thử phương pháp.com/noahcoad/google-spell-check (rgày truy cập: 01/12/2020) 3 https://github.com/wolfgarbe/SymSpell (ngày truy cập: 01/12/2020) 1. Phạm vi nghiên cứu Dữ liệu mà chúng tôi nghiên cứu trong phạm vi của đề tài này là bộ dữ liệu VLSP Hate Speech 2019. Bộ dữ liệu này chứa các bình luận tiếng Việt với ba lop HATE, OFFENSIVE và CLEAN, sẽ được mô tả chỉ tiết trong phần thí nghiệm.

Các mô hình Word Embedding được thử nghiệm cho phương pháp sửa lỗi chính tả độc hại trong đề tài này bao gồm fastText CBOW, word2vec CBOW và word2vec Skip-gram.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu "Sửa Lỗi Chính Tả Trong Bình Luận Tiếng Việt: Nghiên Cứu và Phương Pháp" cung cấp một cái nhìn sâu sắc về các phương pháp hiệu quả để phát hiện và sửa lỗi chính tả trong bình luận tiếng Việt. Bài viết không chỉ phân tích nguyên nhân gây ra lỗi chính tả mà còn đề xuất các giải pháp cụ thể, giúp người đọc cải thiện kỹ năng viết của mình. Những lợi ích mà tài liệu mang lại bao gồm việc nâng cao chất lượng nội dung bình luận, tạo ấn tượng tốt hơn trong giao tiếp trực tuyến và góp phần vào việc xây dựng một môi trường mạng xã hội văn minh hơn.

Để mở rộng thêm kiến thức về các ứng dụng công nghệ trong việc xử lý thông tin, bạn có thể tham khảo tài liệu Khóa luận tốt nghiệp hệ thống thông tin xây dựng ứng dụng phân loại tin tức covid 19 trên mạng xã hội twitter. Tài liệu này sẽ giúp bạn hiểu rõ hơn về cách thức phân loại và quản lý thông tin trên mạng xã hội, từ đó có thể áp dụng vào việc cải thiện chất lượng bình luận và nội dung trực tuyến.