Chương 1. Mục tiêu khóa luan. Đối tượng và phạm vi nghiên cứu. Phạm vi nghiên cứỨu.--- ¿+ + ++k*k+kE*EEEESkke ng rưưy 5 1.
Kết qua của dé tài. Sửa lỗi chính tả. Tình hình nghiên CỨU.--- -- ¿2+ + SE *E£EEk#EEEEEEEEEkEkekrkerrrkrkrre § 2. Tình hình nghiên cứu trên các thứ tiếng khác.
Tinh hình nghiên cứu trên tiếng Việt.01,E Le 1 Chương 3. KIÊN THUC NEN TẢNG. Nhúng từ. _ Nhúng từ dựa trên đếm.
Nhúng từ dựa trên dự đoán. Khoảng cách chỉnh sửa.-----+- 5+ St S+ 2xx E1 111g grrec 20 Chương 4. PHƯƠNG PHÁP.--22222222+2222EE2222tEE222E12ErrEtrrrrkrcree 22 4. Mô hình tổng quát.
Tiền xử lý dữ liệu. Sửa lỗi chính tả. _ Tạo ứng viÊn. 2Q ST HH 1n T HH Hee rey 25 4.
Tạo dit liệu đánh giá chứa lỗi chính tả độc hại. THÍ NGHIEM VA KET QUẢ.SG-Sc Ct E1 1 1E 1112112112111 011111 1111111110111 11k 37 5. Sửa lỗi chính tả cho từ độc hại. _ Sửa lỗi chính tả cho từ độc hại như một bước tiền xử lý đầu vao.
KẾT LUẬN VÀ HƯỚNG PHÁT TRIEN .-- 2-5 sz+sz+se+x+ 46 DANH MỤC HÌNH Hình 1. Bad Word Filter PRO khi không có lỗi chính tả độc hại. Bad Word Filter PRO khi gặp lỗi chính tả độc hại .------2¿5¿©5z+cx+2zxvzxeerxevrsersere 16 Hình 3. Mô hình word2vec Skip-gram (nguồn: X.
Mô hình word2vec CBOW (nguôn: X. Mô hình sửa lỗi chính tả tổng quát. Mô hình hóa công đoạn tạo Ứng VIÊN. 5 «xxx sseeseereeee 24 Hình 4.
Mô hình hóa công đoạn sửa lỗi chính tả. Mô hình hóa công đoạn tạo dữ liệu đánh giá chứa lỗi chính tả độc hại. Phân phối các lớp nhãn của bộ dữ liệu VLSP Hate Speech gốc. Phân phối các lớp nhãn của bộ dữ liệu VLSP Hate Speech mới.
Quy trình đánh gia mô hình Hate Speech Detection. Giao diện công cụ sửa lỗi chính tả cho từ độc hại. Két quả công cu sửa lỗi chính tả cho từ độc hại.- ¿5 s55s+s+s 51 DANH MỤC BANG Bảng 2. Cac vi du vé 16i real-Word 0N.
Vi dụ về thao tác và KCCS với từ “dién”. Các loại KCCS và các thao tác tương Ứng. Ví dụ về tiền xử lý dit liệu .-----2¿ 2 ++EE+EE£EEeEEEEEEEEEEEEerkrrkerreee 23 Bảng 5. Một vài ví dụ về các bình luận thuộc ba nhãn lớp.
Phân phối chiều dài của các lỗi chính tả độc hại. Phân phối thao tác chỉnh sửa của các lỗi chính tả độc hại. Các kết quả sửa lỖi. Các kết quả sửa lỗi khi không có cải tiến trong công đoạn.
Một số ví dụ sửa từ bình thường thành từ độc hại. Các ví dụ sửa lỗi thành từ đồng nghĩa. Thống kê số lượng lỗi được sửa thành từ đồng nghĩa với từ mục tiêu. Hiệu suất của mô hình sửa lỗi sử dụng word2vec Skip-gram.
Biến động hiệu suất của mô hình Hate Speech Detection. 45 DANH MỤC TU VIET TAT Acc Accuracy CBOW Continuous Bag of Words DNN Deep Neural Network FNR False Positive Rate KCCS Khoang cach chinh sua XLNNTN Xu lý ngôn ngữ tự nhiên TOM TAT KHÓA LUẬN Sửa lỗi chính tả là bài toán có đầu vào là dữ liệu văn bản, và đầu ra là các từ sai lỗi chính tả (nếu có) đã được sửa lỗi. Trong đề tài này, chúng tôi tập trung sửa lỗi chính tả cho các từ độc hại trong dữ liệu bình luận tiếng Việt. Từ độc hại trong phạm vi khóa luận này là những từ ngữ nói tục, chửi thề, mang tính xúc phạm, gây hắn, thù địch.
Mặc dù đã có công trình nghiên cứu về bài toán này trên dit liệu tiếng Anh, chưa có một công trình nào nghiên cứu về bài toán này cho dữ liệu tiếng Việt. Chính vì vậy, công trình của chúng tôi là công trình đầu tiên thử nghiệm bài toán này trên dữ liệu tiếng Việt. Phương pháp sửa lỗi chính tả cho từ độc hại trong khóa luận này dựa trên Word Embedding được tham khảo từ công trình của nhóm tác giả H. Gong [1] đã được thử nghiệm trên dữ liệu tiếng Anh.
Tuy nhiên, thay vì sử dụng mô hình word2vec CBOW như các tác giả, chúng tôi đề xuất sử dung mô hình word2vec Skip-gram vì mô hình này hoạt động tốt hon và cho phép biểu diễn các từ hiếm gặp một cách chính xác hơn. Bên cạnh đó, chúng tôi cũng đề xuất thêm một cải tiễn mới trong thuật toán sửa lỗi chính tả mà chúng tôi sẽ trình bày chỉ tiết hơn trong phần phương pháp thực hiện. Dữ liệu mà chúng tôi sử dụng cho bài toán này là bộ dữ liệu Hate Speech của cuộc thi VLSP Shared Task 2019. Tuy nhiên, bộ dữ liệu này chưa phải là dữ liệu chứa lỗi chính tả độc hại phù hợp với yêu cầu của bài toán nên chúng tôi cũng đề xuất một cách tạo lỗi chính tả mang tính thực tế vào bộ dữ liệu này để có thể đánh giá được phương pháp sửa lỗi một cách khách quan và toàn diện hơn.
Cuối cùng, kết quả thí nghiệm cho thấy mô hình sửa lỗi chính tả của chúng tôi cho bài toán này tốt hơn công cụ sửa lỗi chính tả của Google và thư viện Symspell đối với những từ độc hại. Đặt vẫn đề Gần đây, với sự phát triển mạnh mẽ của internet va mạng xã hội, tình trạng một sỐ người dùng có những hành động như cố ý quấy rối, xúc phạm, đe doa, ., đến những người dùng khác ngày càng gia tăng và khó kiểm soát. Dé khắc phục điều đó, các nhà phát triển dịch vụ đã cố gang sử dung các bộ lọc để kiểm soát nội dung nhưng với sự tan công của một số người dùng có ý định xấu thì các bộ lọc này dễ dàng bị qua mặt bởi các lỗi chính tả mà những người dùng này cố ý tạo ra. Những lỗi chính tả này được gọi là lỗi chính tả “độc hại” và đặc điểm chung của chúng là: nhắm vào các từ khoá nhạy cảm mà bộ lọc sử dụng dé đưa ra quyết định dẫn đến tình trạng rất nhiều câu qua mặt được bộ lọc.
Tuy nhiên, các từ sai chính tả này vẫn truyền đạt được nội dung mà người tạo ra chúng mong muốn [2]. Bad Word Filter PRO!, một công cụ hữu ích có chức năng lọc những từ ngữ chửi thề và nội dung xấu với 25 ngôn ngữ, cũng dễ dàng bị qua mặt bởi các lỗi chính tả độc hại. Lấy ví dụ với câu bình luận “Thằng chó chết”, nêu một trong hai từ khóa nhạy cảm “chớ” hoặc “chế?” không bị viết sai chính ta, Bad Word Fiter có thé dé dàng tìm được bad word là “chó chết” và gán câu bình luận này là câu chứa nội dung xấu (xem Hình 1. Tuy nhiên, nếu một trong hai từ “chớ” hoặc “chết” bị cố tình viết sai chính tả thành “cho” hoặc “chétt“, Bad Word Filter sẽ không thể tìm được từ nào là bad word và kết quả là quyết định câu bình luận trên là một câu bình thường (xem Hình 1.
Từ ví dụ ở trên chúng ta có thé thay duoc rang việc tích hợp một công cu sửa lỗi chính tả cho các từ độc hại như một bước tiền xử ly đầu vào cho các hệ thống kiểm soát mạng xã hội hay cụ thể hơn là các bộ lọc, bộ phân lớp, phát hiện nội dung xấu là một điều thực sự rất cần thiết để ngăn chặn các lỗi chính tả độc hại đó qua mặt các hệ thông và gây ảnh hưởng xấu đến những người dùng khác.com/media/data/assets/badwordfilter/webgl/ (ngày truy cập: 01/12/2020) Dé đáp ứng nhu cầu này này, nhóm tác giả H. Gong [1] đã đề xuất một phương pháp sửa lỗi chính tả cho các từ “độc hại” và phương pháp này được thử nghiệm trên dữ liệu tiếng Anh. Tuy nhiên, đối với dit liệu tiếng Việt, chưa có một công trình nào nghiên cứu về bài toán này, và đó chính là lí do mà chúng tôi đến với đề tài này. Tóm lại, bài toán mà chúng tôi trình bày trong luận văn này được phát biểu như sau: e Đầu vào: là một câu tiếng Việt e Đầu ra: là câu được sửa lỗi chính tả đối với những từ độc hại chó chết Hình 1.
Bad Word Eilter PRO khi không có lỗi chính tả độc hại thang chó chếtt Hình 1. Bad Word Filter PRO khi gặp lỗi chính tả độc hại 1. Mục tiêu khóa luận Vì chưa có một công trình nào nghiên cứu đề tài này cho tiếng Việt nên mục tiêu chính của chúng tôi là nghiên cứu, cài đặt và đánh giá phương pháp sửa lỗi chính tả cho từ độc hại sử dụng Word Embedding trên dữ liệu tiếng Việt. Song song với việc nghiên cứu phương pháp sửa lỗi chính tả cho từ độc hại, chúng tôi còn đề xuất một cải tiến mới trong thuật toán sửa lỗi chính tả giúp nâng cao hiệu suất của phương pháp này.
Bên cạnh đó, chúng tôi còn thử nghiệm tính hiệu quả của ba loại mô hình Word Embedding là fastText CBOW, word2vec CBOW và word2vec Skip-gram đối với phương pháp sửa lỗi chính tả này. Tiệp theo, đê đánh giá độ hiệu quả của mô hình sửa lỗi chính tả cho từ độc hại, chúng tôi thực hiện so sánh kết quả sửa lỗi của chúng tôi đôi với hai công cụ sửa lỗi chính tả: Google spell checker? và thư viện Symspell’. Cuối cùng, dé chứng minh va nhấn mạnh lại mức độ cần thiết của bài toán, chúng tôi tiễn hành đánh giá mô hình Hate Speech Detection trước và sau khi tích hợp bộ sửa lỗi chính tả cho từ độc hại của chúng tôi ở công đoạn tiên xử lý dữ liệu. Đối tượng và phạm vi nghiên cứu 1.
Đối tượng Việc nghiên cứu các lỗi chính tả độc hại trên dữ liệu tiếng Việt là một đối tượng quan trọng trong đề tài này, đây là cơ sở để có thể đề xuất các ứng viên sửa lỗi chính tả một cách hợp lý, góp phần nâng cao độ chính xác sửa lỗi, giúp phục hồi các từ độc hại hay còn gọi là các từ khóa mà các bộ lọc và các bộ phân lớp sử dụng dé dua ra quyét dinh. Bên cạnh đó, nghiên cứu các lỗi chính tả độc hại cũng góp phan quan trọng trong việc xác định các dạng lỗi và đê ra cách tạo dữ liệu lôi một cách tự động phục vụ cho việc huấn luyện và kiểm thử phương pháp.com/noahcoad/google-spell-check (rgày truy cập: 01/12/2020) 3 https://github.com/wolfgarbe/SymSpell (ngày truy cập: 01/12/2020) 1. Phạm vi nghiên cứu Dữ liệu mà chúng tôi nghiên cứu trong phạm vi của đề tài này là bộ dữ liệu VLSP Hate Speech 2019. Bộ dữ liệu này chứa các bình luận tiếng Việt với ba lop HATE, OFFENSIVE và CLEAN, sẽ được mô tả chỉ tiết trong phần thí nghiệm.
Các mô hình Word Embedding được thử nghiệm cho phương pháp sửa lỗi chính tả độc hại trong đề tài này bao gồm fastText CBOW, word2vec CBOW và word2vec Skip-gram.