ĐẠI HỌC QUỐC GIA TP. HCM TRƯỜNG ĐẠI HỌC BÁCH KHOA --------------------------------------- NGUYỄN BÌNH LONG NHẬN DIỆN CÁC VIDEO CÓ YẾU TỐ CHÍNH TRỊ VIỆT NAM TRÊN MẠNG XÃ HỘI TIKTOK Chuyên ngành: Khoa Học Máy Tính Mã số: 8.01 LUẬN VĂN THẠC SĨ TP. HỒ CHÍ MINH, tháng 7 năm 2022. CÔNG TRÌNH ĐƯỢC HOÀN THÀNH TẠI: TRƯỜNG ĐẠI HỌC BÁCH KHOA –ĐHQG -HCM Cán bộ hướng dẫn khoa học 1: PGS.TS Đặng Trần Khánh Cán bộ hướng dẫn khoa học 2: PGS.TS Lê Hồng Trang Cán bộ chấm nhận xét 1: TS.
Đặng Trần Trí Cán bộ chấm nhận xét 2: PGS.TS Nguyễn Tuấn Đăng Luận văn thạc sĩ được bảo vệ tại Trường Đại học Bách Khoa, ĐHQG Tp. Hồ Chí Minh ngày 21 tháng 7 năm 2022. Thành phần Hội đồng đánh giá luận văn thạc sĩ gồm: 1.TS Trần Minh Quang - Chủ tịch 2. TS Phan Trọng Nhân - Thư ký 3.
TS Đặng Trần Trí - GV Phản biện 1 4.TS Nguyễn Tuấn Đăng - GV Phản biện 2 5.TS Lê Hồng Trang - Ủy viên Xác nhận của Chủ tịch Hội đồng đánh giá LV và Trưởng Khoa quản lý chuyên ngành sau khi luận văn đã được sửa chữa (nếu có). CHỦ TỊCH HỘI ĐỒNG TRƯỞNG KHOA KHOA HỌC VÀ KỸ THUẬT MÁY TÍNH ĐẠI HỌC QUỐC GIA TP.HCM CỘNG HOÀ XÃ HỘI CHỦ NGHĨA VIỆT NAM TRƯỜNG ĐẠI HỌC BÁCH KHOA Độc lập – Tự do – Hạnh phúc NHIỆM VỤ LUẬN VĂN THẠC SĨ Họ tên học viên: Nguyễn Bình Long MSHV: 1870570 Ngày, tháng, năm sinh: 03/05/1992 Nơi sinh: Quảng Ngãi Chuyên ngành: Khoa học máy tính Mã số: 8. TÊN ĐỀ TÀI: Nhận diện các video có yếu tố chính trị Việt Nam trên mạng xã hội Tiktok / Identifying Viet Nam politcal video contents on TikTok social Network. NHIỆM VỤ VÀ NỘI DUNG: Thực hiện việc thu thập bộ dữ liệu gồm các video có yếu tố chính trị và phi chính trị, tìm hiểu các công trình nghiên cứu về sử dụng mô hình học sâu và kết hợp đa mô hình để phân loại video.
Đề xuất, xây dựng và thử nghiệm mô hình học sâu phù hợp để giải quyết bài toán của đề tài. NGÀY GIAO NHIỆM VỤ: 14/02/2022 IV. NGÀY HOÀN THÀNH NHIỆM VỤ: 30/06/2022 V. CÁN BỘ HƯỚNG DẪN: PGS.TS Đặng Trần Khánh – PGS.TS Lê Hồng Trang Tp.
Hồ Chí Minh, ngày tháng năm 2022 CÁN BỘ HƯỚNG DẪN I CÁN BỘ HƯỚNG DẪN II CHỦ NHIỆM BỘ MÔN ĐÀO TẠO (Họ tên và chữ ký) (Họ tên và chữ ký) (Họ tên và chữ ký) PGS.TS Đặng Trần Khánh PGS.TS Lê Hồng Trang TRƯỞNG KHOA KHOA HỌC & KỸ THUẬT MÁY TÍNH (Họ tên và chữ ký) i LỜI CẢM ƠN Đầu tiên, tôi xin được bày tỏ lòng biết ơn sâu sắc tới PGS.TS Đặng Trần Khánh và PGS.TS Lê Hồng Trang, người đã hướng dẫn tôi trong suốt quá trình thực hiện luận văn cũng như đề cương. Nhờ có những chỉ dẫn và góp ý của thầy mà tôi mới có thể hoàn thành tốt được đề tài luận văn này. Tôi xin được gửi lời cảm ơn đến quý thầy cô khoa Khoa học và Kỹ thuật máy tính đã truyền thụ những kiến thức, kinh nghiệm quý báu cho tôi trong hơn hai năm qua. Xin gửi lời tri ân đến tất cả các thành viên trong nhóm DSTAR LAB của thầy Khánh vì những sự giúp đỡ và hỗ trợ trong suốt quá trình học tập và thực hiện luận văn.
Cuối cùng, tôi xin gửi lời cảm ơn chân thành đến gia đình và bạn bè, những người đã luôn động viên, ủng hộ tôi trong suốt thời gian học Cao học. Hồ Chí Minh, ngày tháng năm 2022 ii TÓM TẮT LUẬN VĂN Với việc ra đời bộ luật “An ninh mạng Việt Nam năm 2018”, một trong những chủ đề được các nhà quản lý quan tâm hiện nay là phân loại tự động video thành danh mục chính trị hoặc các chủ đề khác để có thể bước đầu xử lý và nắm bắt những gì đang xảy ra trên mạng internet nói chung và mạng xã hội Tiktok nói riêng. Các video này chứa đựng nhiều đặc trưng như: hình ảnh, văn bản, âm thanh mỗi đặc trưng đều chứa thông tin có giá trị. Để nâng cao khả năng phân loại, điều cần thiết là phải phân tích hiệu quả tất cả thông tin được trích xuất từ các đặc trưng khác nhau, trong khi hầu hết các mô hình học tập hiện tại đều bỏ qua một số đặc trưng và chỉ tập trung vào một phương thức duy nhất.
Trong đề tài này, trình bày một framework kết hợp đa mô hình học tập có giám sát dựa trên nhiều đặc trưng để phân loại hiệu quả video có yếu tố chính trị. Trong đó, sử dụng kỹ thuật Word Embedding là FastText để phân tích văn bản, các mô hình CNN đã được huấn luyện trước gồm: Inception-V3, MTCNN, VGG-Face để trích xuất đặc trưng hình ảnh và gương mặt, sau đó, một kỹ thuật kết hợp chậm dựa trên mô hình Light GBM được sử dụng để tổng hợp thông tin và phân loại ở cấp độ video. Framework có thể phân loại video khi một đặc trưng bị thiếu bằng cách sử dụng các đặc trưng còn lại. Framework được áp dụng cho tập dữ liệu mới chứa 10.000 videos chính trị và phi chính trị được thu thập từ Tiktok.
Các kết quả thử nghiệm của framework cho kết quả tốt hơn so với một số mô hình dựa trên từng đặc trưng riêng lẻ, cũng như phương pháp kết hợp thông thường. Cụ thể độ chính xác tốt nhất của framework đạt 0.93, trong khi phương pháp kết hợp sử dụng logistic regression đạt 0.92, và mô hình dựa trên từng đặc trưng văn bản, gương mặt, hình ảnh lần lượt là 0. iii ABSTRACT With the introduction of “Law On Cybersecurity 2018”, the most concerned topic of the managers is political video classification system, gasping the activities on the internet as we as Tiktok. These videos contain a lot of features like images, texts, and audio.
Each of these features is very informative. To improve the classification, the effective usage of all features is required. However, most of current systems only make use of only one feature. In this thesis, I propose a framework that utilizing multiple model based on different features to effectively classify political video.
We have used Word Embedding for text analysis, CNN models that included Inception-V3, MTCNN, and VGG-Face for facial and image feature extraction, after that slow fusion based on Light GBM is used for information aggregation and classification. Framework can analyze a video when some features are missing by using the remaining features. Framework has been applied to a dataset with 10,000 political and non-political video collected from TikTok. The results of framework are shown to be better than some models based on a single feature as well as traditional combination method.
The accuracy of framework is 0.93, while the accuracy of logistic regression is 0.92 and the models based on text, facial, and image feature is 0. iv LỜI CAM ĐOAN Tôi xin cam đoan luận văn “Nhận diện các video có yếu tố chính trị Việt Nam trên mạng xã hội Tiktok” là kết quả nghiên cứu của tôi dưới sự hướng dẫn, góp ý của PGS.TS Đặng Trần Khánh và PGS.TS Lê Hồng Trang. Những thông tin tham khảo từ các công trình khác có liên quan đều đã được ghi rõ trong luận văn. Nội dung nghiên cứu và các kết quả đều là do chính tôi thực hiện, không sao chép hay lấy từ một nguồn nào khác.
Tôi xin chịu toàn bộ trách nhiệm về lời cam đoan này. Hồ Chí Minh, ngày tháng năm 2022 Học Viên Nguyễn Bình Long v MỤC LỤC NHIỆM VỤ LUẬN VĂN THẠC SĨ. ii TÓM TẮT LUẬN VĂN. iv LỜI CAM ĐOAN.
v DANH MỤC HÌNH VẼ. ix DANH MỤC BẢNG. x DANH MỤC MÃ CHƯƠNG TRÌNH. xi DANH MỤC CHỮ VIẾT TẮT.
xii 1 GIỚI THIỆU .1 Tổng quan đề tài .2 Tính ứng dụng của đề tài .3 Mục tiêu và giới hạn của đề tài .2 Giới hạn đề tài.4 Cấu trúc của luận văn. 8 2 KIẾN THỨC NỀN TẢNG .1 Mạng nơron nhân tạo (Artificial Neural Network – ANN) .2 Các hàm kích hoạt (Activation function).3 Hàm chi phí mất mát.4 Các kỹ thuật xử lý với mạng nơ ron .2 Mạng nơ ron tích chập (Convolutional Neural Network - CNN) .1 Lớp tích chập – Convolution layer .2 Lớp gộp – Pooling layer .3 Lớp kết nối đầy dủ – Fully connected layer .3 Kiến trúc mô hình mạng chuyển đổi đa tác vụ (Multi-task Cascaded Convolutional Networks - MTCN) .4 Tổng quan kiến trúc mô hình xác minh khuôn mặt DeepFace .5 Tổng quan kiến trúc mô hình Inception-V3 .6 Mô hình Word Embedding .1 Mô hình Word2Vec .3 Skip-gram model .4 Mô hình FastText.7 Các chiến lược kết hợp nhiều mô hình trong phân loại video. 32 3 CÁC CÔNG TRÌNH LIÊN QUAN .1 Phân loại video trên quy mô lớn với mạng nơ ron tích chập (CNN) .2 Phân loại video trên quy mô lớn dựa trên đặc trưng văn bản .3 Phương pháp kết hợp nhiều mô hình học sâu để phân loại video. 37 4 PHƯƠNG PHÁP THỰC HIỆN .1 Phương pháp thu thập và xử lý dữ liệu .1 Phương pháp thu thập dữ liệu .2 Phương pháp xử lý dữ liệu văn bản .3 Phương pháp xử lý dữ liệu âm thanh .4 Phương pháp xử lý dữ liệu video và hình ảnh .2 Phương pháp trích xuất đặc trưng và xây dựng mô hình phân loại văn bản .3 Phương pháp trích xuất đặc trưng và nhận diện khuôn mặt .4 Phương pháp xây dựng mô hình phân loại hình ảnh .5 Phương pháp xây dựng mô hình kết hợp .6 Phương pháp đánh giá.
47 5 HIỆN THỰC VÀ ĐÁNH GIÁ .2 Thu thập dữ liệu .3 Xử lý dữ liệu .1 Tải video và audio .2 Gán nhãn dữ liệu .3 Trích xuất khung hình chính từ video.4 Xử lý và huấn luyện dữ liệu văn bản với mô hình word embedding FastText …………………………………………… .5 Phát hiện và nhận diện gương mặt.4 Huấn luyện mô hình phân loại dựa trên đặc trưng hình ảnh .5 Chiến lược huấn luyện và thử nghiệm .6 Huấn luyện mô hình kết hợp .7 Kết quả của mô hình và nhận xét .1 Tập dữ liệu .2 Thử nghiệm và đánh giá kết quả.8 Xây dựng ứng dụng thử nghiệm .1 Các kết quả đạt được .2 Khó khăn và hạn chế .3 Hướng mở rộng của đề tài. 70 TÀI LIỆU THAM KHẢO. 72 LÝ LỊCH TRÍCH NGANG. 75 viii DANH MỤC HÌNH VẼ Hình 1.1 Framework được đề xuất kết hợp dữ liệu chậm ở cấp độ video.2 Minh họa tính ứng dụng của framework.1 Đồ thị hàm tanh [22].2 Đồ thị hàm Sigmoid [22].3 Đồ thị hàm ReLU [22].4 Minh họa họa giai đoạn P-Net tạo ra Image Pyramid [9].5 Minh họa kiến trúc P-Net [9].6 Minh họa cho phép NMS, những box bị trùng nhau sẽ bị loại bỏ và giữ lại 1 box có mức tin tưởng cao nhất [9].7 Minh họa kiến trúc R-Net [9].8 Minh họa kiến trúc O-Net [9].9 Minh họa kết quả của mạng O-Net gồm 3 giá trị [9].10 Sơ lược về kiến trúc DeepFace, mạng bao gồm 120 triệu tham số [10].