Khóa luận tốt nghiệp khoa học máy tính tăng cường khả năng phát hiện các cuộc tấn công đối kháng trong hệ thống phát hiện xâm nhập mạng dựa trên học máy sử dụng đa mô hình đột biến

Khóa luận tốt nghiệp nghiên cứu tốt nghiệp khoa học máy tính tăng cường khả năng phát hiện các cuộc tấn công đối kháng trong hệ, vận dụng lý thuyết vào thực tế, đề xuất giải pháp

Trường đại học

Ho Chi Minh National University

Chuyên ngành

Bachelor of Computer Science

Người đăng

Ẩn danh

Thể loại

graduation thesis

2023

130
2
0

Phí lưu trữ

35 Point

Mục lục chi tiết

ACKNOWLEDGEMENTS

TABLE OF CONTENTS

LIST OF SYMBOLS, ABBREVIATIONS

1. INTRODUCTION

1.1. Overview

1.2. Application

1.3. Scientific

2. FOUNDATION & RELATED WORK

2.1. Overview of Evasion Attacks

2.2. Generative Adversarial Networks (GAN)

2.2.1. Introduction to GAN

2.2.2. Structure of GAN model

2.3. Intrusion Detection System (IDS)

2.3.1. Operational methodology of IDS

2.4. Machine learning algorithms

2.4.1. Multi-Layer Perceptron (MLP)

2.4.2. Extreme Gradient Boosting (XGBoost)

2.4.3. Convolutional Neural Network (CNN)

2.4.4. Gated Recurrent Unit (GRU)

2.4.5. Linear Discriminant Analysis

2.4.6. Extra Trees

2.5. Overview of Multimodal

2.6. Overview of Ensemble Learning

2.6.1. Mechanics of Ensemble Learning

2.7. Synthetic Minority Oversampling Technique (SMOTE)

2.7.1. Overview of SMOTE

2.8. Related Research Studies

2.8.1. Ensemble Learning with Adversarial Training (ELAT)

2.8.2. Multimodal Attention-based Deep Learning for Alzheimer’s Disease Diagnosis (MaDDi)

2.8.3. Generating Adversarial Malware Examples for Black-Box Attacks Based on GAN

2.8.4. Increasing the Performance of Machine Learning-Based IDSs on an Imbalanced and Up-to-Date Dataset

2.8.5. A novel adversarial example detection method for malicious PDFs using multiple mutated classifiers

2.9. GAN-based Model Target Attacks

2.9.1. Multiple Mutated Classifiers

2.9.2. Multimodal with Adversarial Training

2.10. Architecture & Operation of the Proposed Model

2.10.1. Multiple Mutated Classifiers

2.10.2. Multimodal Adversarial Training (MAT) Architecture

3. EXPERIMENTS AND EVALUATION

3.1. Adversarial data generation

3.2. Scenarios

3.2.1. Scenarios 1: Comparison between MMCs and Baseline models, with and without adversarial retraining, against GAN’s Attacks

3.2.2. Scenarios 2: Comparison between Multimodal Models, MATs, and Baseline Models, before and after undergone adversarial retraining, against GAN’s Attacks

3.2.3. Scenarios 3: Comparison between Multimodal Methods, MAT, and Ensemble Learning, before and after adversarial retraining, against GANs attacks

3.3. Discussing experimental results

3.3.1. Hypotheses: Why Infiltration is harder to detect than other classes of malicious data

REFERENCES

LIST OF SYMBOLS, ABBREVIATIONS

LIST OF FIGURES

LIST OF TABLES

Tóm tắt

I. Tổng quan về cải thiện khả năng chống lại tấn công đối kháng

Trong bối cảnh an ninh mạng hiện nay, việc phát hiện và ngăn chặn các cuộc tấn công đối kháng là một thách thức lớn đối với các hệ thống phát hiện xâm nhập (IDS) dựa trên học máy. Các cuộc tấn công này thường được thiết kế để đánh lừa các mô hình học máy, khiến chúng không thể phát hiện ra các hành vi xâm nhập. Do đó, việc cải thiện khả năng chống lại các cuộc tấn công này là rất cần thiết để bảo vệ hệ thống mạng.

1.1. Tầm quan trọng của hệ thống phát hiện xâm nhập

Hệ thống phát hiện xâm nhập (IDS) đóng vai trò quan trọng trong việc bảo vệ an ninh mạng. Chúng giúp phát hiện các hành vi xâm nhập và cảnh báo kịp thời để ngăn chặn thiệt hại. Tuy nhiên, các IDS hiện tại gặp khó khăn trong việc phát hiện các cuộc tấn công đối kháng do sự thiếu hụt dữ liệu huấn luyện và sự phức tạp của các mẫu tấn công.

1.2. Các thách thức trong phát hiện tấn công đối kháng

Một trong những thách thức lớn nhất là sự không đồng nhất của dữ liệu huấn luyện. Nhiều mô hình học máy không thể phát hiện các cuộc tấn công mới hoặc chưa được biết đến, dẫn đến việc giảm hiệu quả phát hiện. Điều này đòi hỏi các nghiên cứu mới để cải thiện khả năng phát hiện của IDS.

II. Phương pháp cải thiện khả năng chống lại tấn công đối kháng

Để nâng cao khả năng chống lại các cuộc tấn công đối kháng, nhiều phương pháp đã được nghiên cứu và áp dụng. Một trong những phương pháp hiệu quả là sử dụng các bộ phân loại đột biến đa dạng (MMC) kết hợp với học sâu. Phương pháp này không chỉ giúp cải thiện độ chính xác mà còn tăng cường khả năng phát hiện các mẫu tấn công phức tạp.

2.1. Sử dụng bộ phân loại đột biến đa dạng

Bộ phân loại đột biến đa dạng (MMC) cho phép tạo ra nhiều biến thể của mô hình học máy bằng cách thay đổi các tham số. Điều này giúp mô hình học được nhiều khía cạnh khác nhau của dữ liệu, từ đó cải thiện khả năng phát hiện các cuộc tấn công đối kháng.

2.2. Kết hợp học sâu và huấn luyện đối kháng

Học sâu kết hợp với huấn luyện đối kháng giúp mô hình học được các mẫu tấn công tinh vi hơn. Bằng cách sử dụng các ví dụ tấn công trong quá trình huấn luyện, mô hình có thể cải thiện khả năng phát hiện và phân loại các hành vi xâm nhập.

III. Ứng dụng thực tiễn của các phương pháp mới

Các phương pháp cải thiện khả năng chống lại tấn công đối kháng đã được áp dụng trong nhiều hệ thống phát hiện xâm nhập thực tế. Kết quả cho thấy sự cải thiện đáng kể trong khả năng phát hiện các cuộc tấn công phức tạp, từ đó bảo vệ tốt hơn cho hệ thống mạng.

3.1. Kết quả nghiên cứu từ CIC IDS2018

Nghiên cứu trên tập dữ liệu CIC-IDS2018 cho thấy các mô hình sử dụng MMC và học sâu có khả năng phát hiện các cuộc tấn công đối kháng tốt hơn so với các mô hình truyền thống. Điều này chứng tỏ tính hiệu quả của các phương pháp mới trong việc bảo vệ an ninh mạng.

3.2. Ứng dụng trong các tổ chức lớn

Nhiều tổ chức lớn đã áp dụng các phương pháp này để cải thiện hệ thống bảo mật của họ. Việc phát hiện sớm các cuộc tấn công giúp giảm thiểu thiệt hại và bảo vệ thông tin nhạy cảm của tổ chức.

IV. Kết luận và tương lai của nghiên cứu

Nghiên cứu về cải thiện khả năng chống lại các cuộc tấn công đối kháng trong hệ thống phát hiện xâm nhập dựa trên học máy đang mở ra nhiều hướng đi mới. Các phương pháp như MMC và học sâu kết hợp với huấn luyện đối kháng hứa hẹn sẽ mang lại những bước tiến lớn trong lĩnh vực an ninh mạng.

4.1. Tương lai của hệ thống phát hiện xâm nhập

Với sự phát triển không ngừng của công nghệ, các hệ thống phát hiện xâm nhập sẽ ngày càng trở nên thông minh hơn. Việc áp dụng các phương pháp mới sẽ giúp nâng cao khả năng phát hiện và bảo vệ hệ thống mạng hiệu quả hơn.

4.2. Khuyến nghị cho nghiên cứu tiếp theo

Cần tiếp tục nghiên cứu và phát triển các phương pháp mới để đối phó với các cuộc tấn công ngày càng tinh vi. Việc kết hợp nhiều nguồn dữ liệu và mô hình học máy sẽ là chìa khóa để nâng cao khả năng phát hiện trong tương lai.

10/07/2025
Khóa luận tốt nghiệp khoa học máy tính tăng cường khả năng phát hiện các cuộc tấn công đối kháng trong hệ thống phát hiện xâm nhập mạng dựa trên học máy sử dụng đa mô hình đột biến

Trích đoạn nội dung tài liệu

HO CHI MINH NATIONAL UNIVERSITY UNIVERSITY OF INFORMATION TECHNOLOGY DEPARTMENT OF COMPUTER SCIENCE GRADUATION THESIS REPORT Enhancing robustness against adversarial attacks in machine learning-based intrusion detection system using multiple mutated classifiers Tăng cường kha năng phát hiện các cuộc tan công đối kháng trong hệ thống phát hiện xâm nhập mạng dựa trên học máy sử dụng đa mô hình đột biến BACHELOR OF COMPUTER SCIENCE INSTRUCTORS: PhD. Phạm Văn Hậu MSc. Phan Thế Duy Ho Chỉ Minh city, 2023 HO CHI MINH NATIONAL UNIVERSITY UNIVERSITY OF INFORMATION TECHNOLOGY DEPARTMENT OF COMPUTER SCIENCE GRADUATION THESIS REPORT Enhancing robustness against adversarial attacks in machine learning-based intrusion detection system using multiple mutated classifiers Tăng cường kha năng phát hiện các cuộc tấn công đối khang trong hệ thống phát hiện xâm nhập mạng dựa trên học máy sử dụng đa mô hình đột biến BACHELOR OF COMPUTER SCIENCE INSTRUCTORS: PhD. Phạm Văn Hậu MSc.

Phan Thế Duy Ho Chỉ Minh city, 2023 ASSESSMENT COMMITTEE by Rector of the University of Information Technology. Sa - Member ĐẠI HỌC QUOC GIA TP. HO CHÍMINH CỘNG HÒA XÃ HỘI CHỦ NGHĨA VIỆT NAM TRƯỜNG ĐẠI HỌC Độc Lập - Tự Do - Hạnh Phúc CÔNG NGHỆ THÔNG TIN re TP. NHAN XET KHOA LUAN TOT NGHIEP (CUA CAN BO HUONG DAN) Tên khóa luận: TANG CƯỜNG KHẢ NĂNG PHAT HIEN CÁC CUỘC TAN CÔNG DOI KHÁNG TRONG HỆ THÓNG PHÁT HIỆN XÂM NHẬP MẠNG DỰA TRÊN HỌC MÁY SỬ DỤNG DA MO HÌNH DOT BIEN Nhóm SV thực hiện: Cán bô hướng dẫn: Đoàn Ngọc Như Quỳnh 20520732 TS.

Phạm Văn Hậu Cao Thế Thuận 20520793 ThS. Phan Thế Duy Đánh gia Khóa luận 1. Vé cuôn báo cáo: Số trang - Số chương So bảng sô liệu So hình vẽ Sô tài liệu tham khảo Sản phâm Một sô nhận xét vê hình thức cuôn báo cáo: 3. Về chương trình ứng dụng: Người nhận xét (Ký tên và ghi rõ họ tên) ĐẠI HỌC QUOC GIA TP.

HO CHÍMINH CỘNG HÒA XÃ HỘI CHỦ NGHĨA VIỆT NAM TRƯỜNG ĐẠI HỌC Độc Lập - Tự Do - Hạnh Phúc CÔNG NGHỆ THÔNG TIN re TP. NHAN XET KHOA LUAN TOT NGHIEP (CUA CAN BO PHAN BIEN) Tên khóa luận: TANG CƯỜNG KHẢ NĂNG PHAT HIEN CÁC CUỘC TAN CÔNG DOI KHÁNG TRONG HỆ THÓNG PHÁT HIỆN XÂM NHẬP MẠNG DỰA TRÊN HỌC MÁY SỬ DỤNG DA MO HÌNH DOT BIEN Nhóm SV thực hiên: Cán bô phản biên: Đoàn Ngọc Như Quỳnh 20520732. Cao Thế Thuận 20520793 Đánh gia Khóa luận 1. Vé cuôn báo cáo: Số trang - Số chương So bảng sô liệu So hình vẽ Sô tài liệu tham khảo Sản phâm Một sô nhận xét vê hình thức cuôn báo cáo: 3.

Về chương trình ứng dụng: Người nhận xét (Ký tên và ghi rõ họ tên) vì ACKNOWLEDGEMENTS We sincerely express our heartfelt gratitude to our supervisors, PhD. Pham Van Hau and MSc. Phan Thé Duy, for their guidance, support, and encour- agement throughout our research. Their extensive knowledge, experience, and feedback have been invaluable in the successful completion of this thesis.

We also extend our deepest appreciation to Mr. Doan Minh Trung, a re- searcher at UIT Information Security Laboratory, for his exceptional guidance, valuable feedback, and insightful recommendations that have tremendously as- sisted us in identifying appropriate pathways. Finally, we would like to convey our deepest gratitude to our families for their unwavering love, support, and encouragement, without which this thesis would not have been possible. Doan Ngoc Nhu Quynh Cao Thé Thuan Vil TABLE OF CONTENTS ACKNOWLEDGEMENTS.

vi TABLE OF CONTENTS. vii LIST OF SYMBOLS, ABBREVIATIONS. xi LIST OF. xiii LIST OF TABLES.3 Scientific ẤY' gm ym eee tTee bì 1.5 Objectives, Subject, and Scope of the Study.4 The structure of thesis.FOUNDATION & RELATED WORK 10 2.1 Overview of Evasion Attacks .3 Generative Adversarial Networks (GAN).1 Introduction to GAN .2 Structure of GAN model.4 Intrusion Detection System (IDS).2 Operational methodology of IDS .9 Machine learning algorithms .3 Multi-Layer Perceptron (MLP).4 Extreme Gradient Boosting (XGBoost) .5 Convolutional Neural Network(CNN).6 Gated Recurrent Unit (GRU).7 Linear Discriminant Analysis .8 Extra Trees số `.

= i i iG iw i“ iw ww.1 Overview of Multimodal. Overview of Ensemble Learning. Mechanics of Ensemble Learning .8 Synthetic Minority Oversampling Technique (SMOTE) .1 Overview of SMOTE .9 Related Research Studies.1 Ensemble Learning with Adversarial Training (ELAT) .2 Multimodal Attention-based Deep Learning for Alzheimer’s Disease Diagnosis (MaDDi) .3 Generating Adversarial Malware Examples for Black-Box Attacks Based on GAN .4 Increasing the Performance of Machine Learning-Based IDSs on an Imbalanced and Up-to-Date Dataset .5 A novel adversarial example detection method for mali- cious PDFs using multiple mutated classifiers.2 GAN-based Model Target Attacks.1 Multiple Mutated Classifiers .2 Multimodal with Adversarial Training .4 Architecture & Operation of the Proposed Model.1 Multiple Mutated Classifiers .2 Multimodal Aversarial Training (MAT) Architecture .EXPERIMENTS AND EVALUATION 65 4.3 Adversarial data generation .1 Scenarios 1: Comparison between MMCs and Baseline mod- els, with and without adversarial retraining, against GAN’s Attacks.2 Scenarios 2: Comparison between Multimodal Models, MATs, and Baseline Models, before and after undergone adversar- ial retraining, against GAN’s Attacks.3 Scenarios 3: Comparison between Multimodal Methods, MAT, and Ensemble Learning, before and after adversarial retraining, against GANsattacks.4 Discussing experimental results .1 Hypotheses: Why Infiltration is harder to detect than other classes of malicious data. ca 105 REFERENCES 105 Xl LIST OF SYMBOLS, ABBREVIATIONS D_ loss loss value of Discriminator G_ loss loss value of Generator TDR True Detection Rate EIR Error Increase Rate DR Detection Rate O-DR Ordinary Detection Rate A-DR Adversarial Detection Rate Acc-DR Ordinary Accuracy Acc-DR Adversarial Accuracy Al Artificial Intelligent ML Machine Learning DL Deep Learning NLP Natural language processing CV Computer Vision IDS Intrusion Detection System HIDS Host Intrusion Detection Systems NIDS Network Intrusion Detection Systems loT Internet of Things HoT Industrial Internet of Things DoS Denial of Service MLP Multi-layer Perceptron ET Extra Tree XGB Extreme Gradient Boosting RF Random Forest xI LDA Linear Discriminant Analysis RNN Recurrent Neural Network CNN Convolutional Neural Network DT Decision Tree BCE Binary Cross-Entropy SMOTE Synthetic Minority Oversampling Technique ELAT Ensemble learning adversarial training GAN Generative Adversarial Network GAN-RNN GAN with RNN as the target model MAT Multimodal Adversarial Training MAT-RNN MAT using adversarial samples targeting RNN xiii LIST OF FIGURES Figure 2.1 Diagram of blackbox attack.2 Diagram of the model evasion attack.3 The block diagram of a classical GAN model .4 The Intrusion Detection and Prevention System (IDPS) model.

ng gà kg va 17 Figure 2.5 Basic diagram of decision free.6 Random Forest algorithm intuilon.7 Multilayer perceptron (MLP) architecture with two hidden layers and two prediction output.9 Convolutional Neural Network (CNN) architecture.10 The architecture of GRU.11 A general multimodal workflow .12 Ensemble Learning Method .13 Using SMOTE to oversample .15 Illustrates the relationship between the issues on the left and solutions on the right side in the design.17 The architecture of MalGAN .18 Flowchart of the IDSs with sampled data .19 The overall design of the malicious PDFs detection system 50 Figure 3.2 GAN’s attacks on Multimodal.3 Multimodal Adversarial Training Architecture .1 Generated data efect.1 Accuracies comparision between Multimodals, MATs, and baseline models against GAN’s adversarial samples.4 Accuracy comparision between Multimodals, MATs, and adversarial retrained baseline models against GAN’s adversarial samples 2. Quà g gà kg va 88 Figure 4.5 Comparative of Defense Model against GAN Attacks .6 Malicious data distribution of test dataset. 98 XV LIST OF TABLES Table 4.1 Data distribution of CIC-IDS-2018 dataset before prepro- CeSSNG 6. CSE-CIC-IDS2018 label mapping.

68 Table 43 CSE-CIC-IDS2018 after preprocessing .4 CICIDS2018 functional feature groups .5 CICIDS2018 functional features.7 Baseline models hyperparameter values .10 Comparison of Accuracy between Multiple Mutated DTs and a Simple DT Model, Pre and Post Adversarial Retraining, Using Different Target Models’ Adversarial Samples .11 Comparison of Accuracy between Multiple Mutated RFs and a Simple RF Model, Pre and Post Adversarial Retraining, Using Different Target Models’ Adversarial Samples .12 Comparison of Accuracy between Multiple Mutated ETs and a Simple ET Model, Pre and Post Adversarial Retraining, Using Different Target Models’ Adversarial Samples .13 Comparison of Accuracy between XGBs and a Simple XGB Model, Pre and Post Adversarial Retraining, Using Different Tar- get Models’ Adversarial Samples.14 Comparison of Accuracy between Multiple Mutated MLPs and a Simple MLP Model, Pre and Post Adversarial Retraining, Using Different Target Models’ Adversarial Samples .15 Accuracies comparision between Multimodals, MATs, and baseline models against GAN’s adversarial samples.16 Effectiveness of GAN generated DoS attack against several ML and DL models .17 Effectiveness of GAN generated Brute Force attack against several ML and DL models.18 Effectiveness of GAN generated Bot attack against several ML and DL models .19 Effectiveness of GAN generated Infiltration attack against several ML and DL models.20 Effectiveness of GAN generated SQL Injection attack against several ML and DL models.21 Accuracy comparision between Multimodals, MATs, and adversarial retrained baseline models against GAN adversarial samples.22 Robustness comparison between adversarial retrained Ma- chine Learning Models, Multimodal, and MATs against GAN’s Adversarial Examples.23 Effectiveness of GAN generated DoS attacks against Mul- timodals, MATs, and several Adversarial retrained ML and DL models.24 Effectiveness of GAN generated Bot attacks against Mul- timodals, MATs, and several Adversarial retrained ML and DL xvii Table 4.25 Effectiveness of GAN generated Brute Force attacks against Multimodals, MATs, and several Adversarial retrained ML and DL models .26 Effectiveness of GAN generated Infiltration attacks against Multimodals, MATs, and several Adversarial retrained ML and DL models .27 Effectiveness of GAN generated SQL Injection attacks against Multimodals, MATs, and several Adversarial retrained ML and DL models .28 Accuracy comparison between Ensemble models, Multi- modals, MATs, and AT baseline models against adversarial data crafted on different target models. The baselines row represent the accuracies of adversarial retrained models relative to GAN’s target models ay .29 Accuracy comparison between Adversarial retrained ensem- ble models, Multimodals, MATs, and Adversarial retrained base- line models against adversarial data crafted on different target models. The baselines row represent the accuracies of adversarial retrained models relative to GAN’s target models. 96 ABSTRACTION In the field of cybersecurity, researchers have made significant efforts to im- prove the detection and classification of attack traffic in Intrusion Detection Systems (IDS).

However, current IDS models based on machine learning (ML) and deep learning (DL) face several critical challenges. One of these challenges is the ability to detect evasive attack traffic hidden within normal network traffic. This issue often arises due to the scarcity and imbalance of training data for the models. It has been demonstrated that the accuracy of ML or DL-based IDS models heavily relies on the quantity and quality of the training data.

This poses a significant barrier to achieving effective detection and classification perfor- mance in real-world systems. Therefore, there is a need to explore new methods to enhance the detection and classification capabilities of ML and DL models in order to improve the detection of evasive attack traffic in practical scenarios and address this concerning issue in society. In this thesis, we conducted experiments using various defense methods, in- cluding machine learning and deep learning models, to evaluate their effective- ness in addressing the challenges of imbalanced data and sophisticated attack patterns generated by GANs. We also explored the widely employed Adversarial Training technique, which enables the models to learn attack patterns with sub- tle perturbations that are difficult to discern, thereby enhancing their detection capability against malicious traffic.

One approach we implemented was MMC, Multiple Mutated Classifier. In this approach, instead of using a single set of hyperparameters for the model, you randomize or mutate the hyperparameters to create multiple variations of the model. The aim was to introduce diversity in the training process, allowing the models to capture different aspects of the data and improve overall detection and classification performance. Another approach we investigated is the Multimodal architecture, which in- corporates multiple sources of information during the classification and detection process.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu có tiêu đề "Cải thiện khả năng chống lại các cuộc tấn công đối kháng trong hệ thống phát hiện xâm nhập dựa trên học máy" tập trung vào việc nâng cao hiệu quả của các hệ thống phát hiện xâm nhập (IDS) thông qua việc áp dụng các kỹ thuật học máy. Tài liệu này nêu bật những thách thức mà các hệ thống IDS phải đối mặt trước các cuộc tấn công đối kháng, đồng thời đề xuất các phương pháp cải thiện khả năng phát hiện và ngăn chặn những mối đe dọa này. Độc giả sẽ tìm thấy những thông tin hữu ích về cách thức mà học máy có thể được tối ưu hóa để bảo vệ hệ thống mạng, từ đó nâng cao độ tin cậy và an toàn cho các ứng dụng thực tế.

Để mở rộng kiến thức của bạn về lĩnh vực này, bạn có thể tham khảo thêm tài liệu "Khóa luận tốt nghiệp an toàn thông tin hệ thống bền vững và tin cậy cho phát hiện xâm nhập dựa trên học máy đối kháng và trí tuệ nhân tạo khả diễn giải", nơi cung cấp cái nhìn sâu sắc về các hệ thống IDS bền vững. Ngoài ra, tài liệu "Phát triển một số mạng nơ ron học sâu cho bài toán phát hiện tấn công mạng" sẽ giúp bạn hiểu rõ hơn về ứng dụng của mạng nơ ron trong việc phát hiện các cuộc tấn công. Cuối cùng, bạn cũng có thể tìm hiểu về "Nghiên cứu thực hiện thuật toán học máy sử dụng cho an ninh mạng trên thiết bị nhúng tại edge cloud", tài liệu này sẽ mở rộng thêm kiến thức về an ninh mạng trong môi trường edge cloud.