Chương 1: Giới thiệu. Trình bày lý do chọn đề tài, mục tiêu, đối tượng và phạm vi nghiên cứu của đề tài. e Chương 2: Khái quát. Trong phần này tôi sẽ trình bày các khái niệm tin giả với sự tham khảo trong lĩnh vực báo chí vì đây cũng là đề tài mang tính xã hội.
Trong chương này tôi cũng sẽ trình bày chi tiết về khái niệm tin giả, dấu hiệu nhận biết chúng cũng như mối nguy hại của chúng đối với xã hội và tình hình nghiên cứu trên thế giới, thách thức còn tồn đọng trong lĩnh vực này cần giải quyết. e Chương 3: Dữ liệu. Giới thiệu bộ dữ liệu ReINTEL và quy trình tao ra ngữ liệu này. Trình bày các kĩ thuật tiền xử lý đặc trưng để tối ưu hóa mô hình dự đoán.
Dua ra nhận xét các thuộc tính bên trong bộ dữ liệu, phân tích mối tương quan giữa đặc trưng và nhãn phân lớp bằng các phương pháp thống kê. e Chương 4: Cơ sở lý thuyết. Cung cấp cơ sở lý thuyết của các kiến thức nền tảng về các mô hình Deep learning truyền thống và các mô hình mạng liên quan cũng như các phương hướng giải thuật liên quan đến đề tài. e Chương 5: Mô hình phân loại.
Khảo sát các phương pháp được thực hiện. Đồng thời trình bày chi tiết về kĩ thuật transfer learning nói chung và các pretrained models dành cho tiếng Việt nói riêng; ví dụ như PhoBERT (23), ViBERT hay viELECTRA và phương pháp cải tiến kết quả. 12 e Chương 6: Kết quả thực nghiệm. Trình bày số liệu kết quả đạt được với từng phương pháp, hyper-parameters và những cách tiền xử lý dữ liệu khác nhau để giải quyết vấn đề dữ liệu nhiễu và quan sát được sức ảnh hưởng đến độ hiệu quả chính xác của mô hình.
So sánh kết quả của chúng tôi với các công trình nghiên cứu trước đây. Ngoài ra, chúng tôi còn cho thực nghiệm kết quả trên từng layer của mô hình đạt kết quả cao nhất trong đề tài này, để đưa ra nhận xét và đánh giá. e Chương 7: Tổng kết và hướng phát triển. Tóm tắt những kết quả đạt được.
Phân tích lỗi và trình bày những thách thức còn tồn đọng trong đề tài này để rút ra cho mình những hướng phát triển tiếp theo trong tương lai.1 Khái niệm tin giả Hiện nay, có rất nhiều cách định nghĩa khác nhau về tin giả. Tuy nhiên, nhìn chung thì tin giả có thể hiểu khái quát là “những thông tin sai sự thật, thường có tính chất giật gân được ẩn bọc dưới lớp vỏ tin tức”. Cụ thể hơn, từ điển Cambridgd'l đã đưa ra định nghĩa cụ thể hơn như sau: “Tin giả là những câu chuyện sai sự thật có vẻ giống như là tin tức, được lan truyền rộng rãi trên Internet hoặc sử dụng các phương tiện truyền thông khác, thường được dùng để tạo ảnh hưởng đến quan điểm chính trị của quần chúng hoặc chỉ đơn giản là một trò đùa”. Theo tác giả Himma-Kadakas và Marju [7| thi tin giả có thể được phân thành 2 loại khác nhau: tin giả xuyên tạc và tin không hoàn toàn chính xác e Tin giả xuyên tạc: Là loại thông tin ngụy tạo, không hề có căn cứ mà ` tác giả tạo ra nhằm dẫn dắt độc giả theo ý kiến của mình với ý đồ muốn gây tổn hại đến uy tín một cá nhân, tổ chức nào đó.
e Tin không hoàn toàn chính xác: Là loại thông tin sai do sự hiểu lầm và diễn đạt sai của tác giả dù đã tiếp cận với nguồn tài liệu thực tế. Loại thông tin này vẫn có một phần sự thật trong đó, tuy nhiên một nửa sự thật vẫn không phải là sự thật.2 Tác động tiêu cực của tin giả Thời đại công nghệ thông tin càng ngày phát triển, mạng xã hội càng dễ tiếp cận với nhiều người dùng phổ thông hơn và dẫn đên mặt trái là thông thttps://dietionary.org/ 14 tin được lan truyền rất nhanh và cũng thiếu sự kiểm chứng. Chính vì thế mà nhiều cá nhân lợi dụng được mặt trái này để làm lợi cho mình. Vì đặc điểm của tin giả là có tình chất giật gân, có ý kích động được dàn dựng rất tỉnh vi và chi tiết.
Nếu người dùng mạng xã hội lại thiếu kiến thức thì lại càng tiếp tay cho tin giả được lan truyền mạnh hơn. Tuy thông tin là ảo nhưng hậu quả đến với người bi hại là thật, với việc chia sé một tin tức thiếu chính xác làm nhanh chóng hủy hoại thanh danh, uy tín của một người. Tin giả thường xuất hiện rất nhiều trong những sự kiện lớn toàn cầu. Đặc biệt là vào đầu năm 2020 đến nay, cụm từ fake news (tin giả) được nhắc đến rất nhiều trong bối cảnh đại dịch Covid-19 đang hoành hành trên khắp thế giới.
Đây là thời điểm mà tin giả bùng nổ mạnh mẽ nhất. Trong khoảng thời gian này, hầu hết mọi người trên thế giới bị hạn chế di chuyển do các quy định phong tỏa nên họ sẽ có xu hướng tìm kiếm các tin đồn được lan truyền trong cộng đồng mà không có sự kiểm chứng. Hơn nữa với tâm lý sợ hãi một cơn bệnh lạ mới xuất hiện, nên độc giả càng sẽ dễ tin tưởng vào những thong tin phòng tránh bệnh được đồn thổi trên các mang xã hội, và những thông tin như vậy thì thật giả khó lường vì không có sự thấm định của các chuyên gia y tế (24). Dứng trước thực tại tin giả ngày càng tăng ở những phương tiện truyền thông xã hội và thế giới kĩ thuật số, độc giả cần đặc biệt tỉnh táo, chú ý phân tích, đối chiếu và so sánh nhiều nguồn tin khác nhau để tìm ra tin tức đáng tin cậy.Vì vậy, khả năng nhận dạng thông tin đáng tin cậy cũng là một kĩ năng cơ bản trong thời đại số với tất cả mọi người, đặc biệt là các học sinh, sinh viên trong môi trường giáo dục.2 Cách nhận dạng thông tin dang tin cậy Thời đại thông tin càng phát triển, cuộc chiến chống tin giả càng khốc liệt.
Theo lời của giáo sư Lee E. Krahenbuhl đến từ Đại hoc Stevenson *} “Cho dù bạn là nhà báo, nhà nghiên cứu, nhà văn hay một người trong các lĩnh vực chuyên môn, điều quan trọng là phải biết cách xác định thông tin thực và sử dụng nó một cách chính xác. Đó là thách thức thực sự của chúng ta trong thế kỷ 21”. Thực tế hiện nay lại cho thấy Internet càng phát triển vượt bậc thì lượng thông tin được viết bởi rất nhiều tác giả khác nhau, bao gồm cả những người không chuyên, do đó số lượng tin giả và tin thật khó có thể kiểm soát được.
Chính vì thế, tự bản thân mỗi độc giả cần phải trang bị cho bản thân mình bộ kĩ năng nhất định để xác thực được những tin tức dang tin. Chính vì thế, chúng tôi có đề xuất những cách sau đây để phát hiện tin thật, tin giả sau khi đã phân tích, đối chiếu và so sánh với nhiều ý kiến khác nhau: e Kiểm tra kĩ đường dẫn (URL): Nhiều trang web chứa thông tin giả mạo được tạo ra bằng cách thay đổi tên miền sao cho gần giống với tên miền gốc nhưng giao diện vẫn khá tương đồng nhau. Độc giả nên nhớ kĩ tên miền gốc, can thận với loại lừa đảo trên. e Kiểm tra nguồn tin: Những nguồn tin, cá nhân có uy tin, được chứng nhận sẽ dam bảo tin tức đáng tin cậy hơn.
Nếu như bạn chưa chắc chắn được website hay cá nhân đó có đáng tin cậy thì bạn có thể phân tích và so sánh những đánh giá của người khác về website, cá nhân đó. e Kiểm tra mốc thời gian: Những tin tức ngụy tạo thường sẽ có thiếu ?https://www.edu/ 16 logic về mặt thời gian. Ví du bài viết sai lệch đó được viết, dan dựng sẵn vào trước thời điểm mà sự kiện thực sự diễn ra. Đối chiếu với những nguồn tin khác: Một sự kiện lớn xảy ra thì sẽ được rất nhiều cơ quan và phương tiện truyền thông loan tin.
Tuy nhiên, nếu bạn đọc một bài viết có tiêu đề và nội dung giật gân, hấp dẫn nhưng lại không thấy nội dung đó được đăng tải ở nơi nào khác, thì gần như đó là tin giả. Chú ý văn phong, định dạng chữ: Một bài viết có tính chân thực cao thì sẽ có cách hành văn rất nghiêm túc, câu từ trong sáng và ít có lỗi chính tả vì đã được kiểm tra và hiệu đính nhiều lần. Ngược lại, ở những bài viết chứa tin tức giả mạo thì sẽ có những ngôn ngữ han học, mang tính đả kích hơn; ngoài ra còn mắc nhiều lỗi chính tả và định dạng chữ lộn xộn. Đối chiều với những dẫn chứng: Thông thường các bài viết đáng tin cậy sẽ có dẫn chứng rất rõ ràng, ta có thể điều hướng tới những nguồn thông tin chứa dẫn chứng một cách dễ dàng.
Ngược lại, ở những bài viết sai lệch thì gần như chỉ mang thông tin một chiều đến từ tác giả và không rõ nguồn gốc của thông tin từ đâu. Kiểm tra hình ảnh: Một bài viết xuyên tạc thường sẽ chứa những hình ảnh đã được chỉnh sửa, cắt ghép thiếu ngữ cảnh theo hướng có lợi cho tác giả và gây thiệt hại cho tổ chức, cá nhân bị nhắm tới. Phân tích xem có phải ý kiến chủ quan không: O các tòa soạn chuyên nghiệp, họ thường phân chia thành 2 mục bài viết rõ ràng: news (tin tức) và opinion (quan điểm cá nhân của ký giả, không phải của tòa soạn). Nếu bài viết bạn đọc thuộc về mục quan điểm cá nhân, 17 thì thông tin đó chỉ mang tính tham khảo, chưa thể khẳng định được tính đúng sai của sự kiện.3 Tình hình nghiên cứu 2.1 Nghiên cứu trong nước Vì bài toán nhận dạng tin giả là một đề tài mới nổi trong Việt Nam gần đây nên còn rất nhiều trở ngại trong nghiên cứu nói chung, đặc biệt là tiếng Việt vẫn chưa có nhiều bộ dữ liệu nào liên quan đến chủ đề này.
Các nghiên cứu trước đây vẫn tập trung nhiều vào dữ liệu văn bản mà chưa khảo sát đến những thuộc tính khác có quan trọng như thế nào. Cụ thể thì chúng tôi đã khảo sát những công trình nghiên cứu sau đây và tóm tắt lại ý tưởng của họ: e Kim đã đề xuất phương pháp phân loại thông tin thật, giả dựa trên phương pháp transfer learning, cu thể là thực hiện fine-tune trên 2 mô hình ViBERT4news và PhoBERT (23). Nhóm tokenize dữ liệu văn bản bằng VNCoreNLP [34 khi khi 4p dụng mô hình PhoBERT và BertTokenizer đối với Vibert4news. Kết quả tốt nhất của nhóm dat 94.5 ROC-AUC khi kết hợp cả 2 mô hình.