Đặt vấn đề: Trong thời đại công nghệ hiện nay, mạng xã hội đã trở thành một phần không thể thiếu trong đời sống con người. Các nền tảng như Facebook, Youtube, TikTok, Twitter,…. không chỉ là nơi mọi người chia sẻ thông tin và kết nối bạn bè, người thân mà còn là nơi để mọi người tự do bày tỏ quan điểm và cảm xúc cá nhân. Tuy nhiên, với sự phát triển vượt bậc, lượng người sử dụng ngày càng tăng, không khó để bắt gặp những bình luận tiêu cực, bao gồm những nội dung xúc phạm, bạo lực, phân biệt chủng tộc,.
Những bình luận này không chỉ ảnh hưởng đến tâm lý con người mà còn tạo ra môi trường độc hại trên mạng xã hội. Theo nghiên cứu [1], người dùng sau khi đọc các bình luận tiêu cực, đặc biệt là các bình luận tiêu cực nhắm đến bản thân, họ có thể trải qua các tác động tâm lý tiêu cực như cảm giác buồn bã, tức giận, sợ hãi,…. Những tác động này làm suy giảm tinh thần lạc quan, tăng cảm giác căng thẳng và giảm sự tự tin của người đọc. Họ cũng chỉ ra rằng, việc tiếp xúc thời gian dài với các bình luận tiêu cực có thể dẫn đến các vấn đề về sức khỏe tinh thần như bệnh trầm cảm,….
Cũng trong nghiên cứu, tác giả quan sát và phân tích hành vi người dùng sau khi tiếp xúc với bình luận tiêu cực, người dùng sẽ trở nên ít hoạt động và tương tác hơn trên mạng xã hội. Điều này cho thấy, việc tiếp xúc các bình luận độc hại còn làm giảm số lượng người dùng trên mạng xã hội, đây sẽ là vấn đề mà các nền tảng và tổ chức không mong muốn. Các bình luận tiêu cực còn có thể lan rộng và có thể vô tình trở thành xu hướng để người dùng làm theo, cụ thể là tình trạng phân biệt vùng miền ở Việt Nam ngày càng tăng, một phần là từ các thế lực muốn chia rẽ nhưng phần lớn là tới những người dùng thích cảm giác trêu chọc và chọc tức người khác, việc làm tuy sai trái nhưng lâu dần nó trở thành điều mà mọi người thấy thú vị, do đó cần phải cải thiện môi trường mạng xã hội càng sớm và có nhiều biện pháp đối với những người bình luận mang tính công kích. 1 Các bình luận tiêu cực trên mạng xã hội không chỉ ảnh hưởng đến sức khỏe tinh thần mà đôi khi nó còn gây ra nhiều hệ quả nghiêm trọng, như gần đây, hiện tượng “Bắt nạt trên mạng” (Cyber-bullying) diễn ra ngày càng phổ biến, đây là hiện tượng ám chỉ việc người dùng bị nhiều người khác nhắm đến công kích trong một thời gian dài nhằm khiến nạn nhân sợ hãi, tức giận, xấu hổ,….
Lâu dần khiến người dùng ảnh hưởng trầm trọng về tâm lý, sức khỏe tinh thần dẫn đến hậu quả nghiêm trọng hơn. Mặc dù các nền tảng mạng xã hội hiện nay đã có nhiều phương pháp để ngăn chặn điều này như cho phép người dùng báo cáo những bình luận tiêu cực nhưng với số lượng bình luận tiêu cực quá nhiều khiến người dùng khác cũng không muốn báo cáo hoặc thuê nhân viên kiểm duyệt nhưng cũng chỉ thực hiện thủ công và lâu dần những nhân viên kiểm duyệt cũng sẽ bị ảnh hưởng tâm lý vì thường xuyên tiếp xúc với các bình luận tiêu cực. Vào năm 2022, Microsoft đã đưa ra bảng đánh giá về những nước kém văn minh nhất thế giới trên Internet, trong đó Việt Nam là nước thuộc top 5 bởi những hành vi kém văn minh [2]. Cũng trong [2], bài báo có nói rằng có đến 87% bạn đọc của báo Zing.vn đồng tình với bảng xếp hạng này, điều đó cho thấy rằng mức độ tiêu cực trong bình luận của người Việt Nam là rất nhiều và dễ dàng nhận thấy mỗi khi sử dụng.
Do đó việc nghiên cứu về phân loại các bình luận tiêu cực ở Việt Nam sử dụng các mô hình học sâu là nhu cầu cấp bách trong bối cảnh hiện nay. Hướng tiếp cận: Nghiên cứu trong lĩnh vực phân loại bình luận trên mạng xã hội đã thu hút sự quan tâm của nhiều nhà khoa học và chuyên gia công nghệ. Các hướng tiếp cận và giải pháp đã được đề xuất và triển khai bao gồm: 1. Mô hình học sâu: Trước sự xuất hiện của các mô hình học sâu, các mô hình thường được sử dụng trong NLP thường dựa vào các phương pháp và thuật toán truyền thống như SVM, Logistic Regression, Naïve Bayes,….
Đây thường là những phương pháp dựa trên quy tắc và sử dụng các đặc trưng được thiết kế thủ công, điều này có nghĩa là là các đặc trưng này không được mô hình tự động học từ dữ liệu, mà thay vào đó chúng xác định và xây dựng theo cách thủ công dựa trên kiến thức và hiểu biết 2 của con người về dữ liệu. Tuy nhiên cho đến khi các mô hình học sâu như Convolutional Neural Network (CNN), Gated Recurrent Unit (GRU),…. và đặc biệt là Transformer ra đời đã tạo ra bước đột phá lớn trong lĩnh vực xử lý ngôn ngữ tự nhiên. Đã có nhiều công trình nghiên cứu, so sánh và thấy rằng các mô hình học sâu có hiệu suất vượt trội ở trong các mô hình truyền thống.
Các nghiên cứu [3],[4] đã thực hiện so sánh hiệu suất và thấy rằng các mô hình học sâu đều cải thiện hiệu suất đáng kể so với các mô hình truyền thống, cải thiện những nhược điểm vốn có của các mô hình truyền thống như: • Phụ thuộc vào các đặc trưng thủ công: Đòi hỏi tính toán và trích xuất các đặc trưng của văn bản bằng thủ công, đòi hỏi sự hiểu biết về ngôn ngữ và không phản ảnh được sự tự nhiên của dữ liệu. • Khó khăn trong xử lý dữ liệu phi cấu trúc: Các đầu vào như văn bản tự do, các bình luận ngắn thường không tuân thủ theo một cấu trúc câu không thích hợp cho các mô hình truyền thống vì chúng yêu cầu dữ liệu đầu vào phải được biểu diễn dưới dạng các đặc trưng có cấu trúc. • Khả năng tổng quát hóa kém: Mặc dù đạt hiệu suất tốt trên các tập huấn luyện nhưng khả năng dự đoán các câu mới thường gặp khó khăn khi các dữ liệu mới không quen thuộc. Mô hình CNN đã cho thấy sự thành công trong phân loại văn bản.
Trong nghiên cứu [5] tác giả đã giới thiệu mô hình CNN, sử dụng mô hình word2vec để nhúng các từ trong văn bản thành các vector, giống như các vector điểm ảnh, tinh chỉnh tham số và thực hiện huấn luyện. Kết quả cho thấy rất tốt, đặc biệt với tác vụ phân loại văn bản. Tác giả cũng phát hiện ra rằng CNN đạt kết quả tốt nhất xử lý các văn bản ngắn và có độ dài cố định do tính chất cấu trúc của nó. Các bình luận trên mạng xã hội hiện nay thường là câu hoặc đoạn văn ngắn, rất phù hợp với mô hình CNN.
Do đó, tôi sử dụng mô hình CNN để nghiên cứu cho nhiệm vụ phân loại các bình luận trên mạng xã hội. Transformer là một loại kiến trúc mạng nơ-ron dựa trên cơ chế Attention, được giới thiệu bởi Vaswani et al. trong bài báo “Attention is All You Need” vào năm 2017 [6]. Tiếp nối thành công của kiến trúc Transformer, vào năm 2018, Google 3 đã công bố nghiên cứu mới mang tính đột phá BERT.
BERT hiểu đơn giản là mô hình được tiền huấn luyện (học sẵn) với ý tưởng sử dụng Transformer và huấn luyện trên một lượng dữ liệu lớn để học cách biểu diền ngữ nghĩa. Mặc dù BERT thu được kết quả tối ưu nhất cho hầu hết các nhiệm vụ xử lý ngôn ngữ tự nhiên. Tuy nhiên, mô hình BERT chỉ được huấn luyện trên dữ liệu tiếng Anh do đó trên các tập dữ liệu tiếng Việt vẫn còn hạn chế. Để giải quyết vấn đề này, vào năm 2020, VinAI Research đã tiến hành huấn luyện phoBERT, phát triển như một biến thể của BERT, trên một lượng lớn dữ liệu tiếng Việt [7].
Kết quả là phoBERT đã có khả năng hiểu và biểu diễn ngôn ngữ tự nhiên tiếng Việt một cách chính xác và hiệu quả. Mục tiêu của đề tài là phân loại bình luận tiếng Việt, do đó, tôi chọn mô hình PhoBERT để giải quyết bài toán xử lý ngôn ngữ Tiếng Việt để tối ưu hiệu suất, đồng thời tôi cũng sử dụng BERT để so sánh hiệu năng giữa hai mô hình. Mô hình kết hợp: Các mô hình kết hợp đang ngày càng trở nên phổ biến do khả năng tận dụng các ưu điểm nhiều kiến trúc khác nhau để đạt được hiệu suất cao hơn trong các nhiệm vụ cụ thể. Trong [8], tác giả đã giới thiệu các mô hình kết hợp giữa 2 mô hình học sâu như BERT-CNN, kết quả đã đạt được hiệu suất tốt nhất vượt qua hai mô hình đơn BERT và CNN.
Ý tưởng của mô hình này là tận dụng khả năng hiểu ngữ nghĩa của các mô hình tiền huấn luyện như BERT để hiểu và biểu diễn ngữ cảnh, trong khi CNN được sử dụng để trích xuất các đặc trưng cụ thể từ văn bản. Kết quả nghiên cứu cũng cho thấy mô hình kết hợp có độ chính xác cao trên các dữ liệu từ mạng xã hội, đồng thời cũng cho thấy tính linh hoạt và hiệu quả của phương pháp này trong việc giải quyết vấn đề nhận dạng nội dung xúc phạm trực tuyến. Mô hình kết hợp giữa PhoBERT và CNN đã được triển khai ở [9] cùng với tập dữ liệu mà tôi sẽ thực hiện trong đề tài này và thu về kết quả tốt nhất so với các mô hình khác. Đây có thể được xem là mô hình sẽ đem lại hiệu suất tốt nhất vì nó tận dụng sức mạnh của cả 2 mô hình được xem là tối ưu nhất cho bài toán phân loại bình luận mạng xã hội.
Do đó tôi sử dụng mô hình này để thử nghiệm và so sánh giữa các mô hình khác để tìm hiệu suất tốt nhất. Dữ liệu tiếng Việt: 4 Dữ liệu là phần quan trọng nhất trong học máy, dữ liệu chất lượng và đa dạng đóng vai trò quan trọng trong việc quyết định hiệu suất và độ chính xác của mô hình. Mục tiêu đề tài là thực hiện trên dữ liệu các bình luận tiêu cực tiếng Việt, sau khi tiến hành tìm kiếm và đánh giá các nguồn dữ liệu khác nhau, tôi quyết định sử dụng tập dữ liệu ViHSD phù hợp nhất với đề tài, tập dữ liệu này được phát triển và công bố vào năm 2021 [10]. Dữ liệu này được gán nhãn bởi người thật và dùng nhiều phương pháp kiểm tra khác nhau để đảm bảo độ chính xác.