Khóa luận tốt nghiệp an toàn thông tin nghiên cứu khả năng kháng mẫu đối kháng của các trình phát hiện xâm nhập dựa trên học máy

Luận văn tốt nghiệp nghiên cứu tốt nghiệp an toàn thông tin nghiên cứu khả năng kháng mẫu đối kháng của các trình phát hiện xâm, điều tra thực trạng, phân tích số liệu, đề xuất

Người đăng

Ẩn danh

Thể loại

khóa luận

2024

109
5
0

Phí lưu trữ

35 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: TỔNG QUAN ĐỀ TÀI

1.1. Đặt vấn đề

1.2. Mục tiêu nghiên cứu

1.3. Phạm vi nghiên cứu

1.4. Đối tượng nghiên cứu

1.5. Phương pháp nghiên cứu

1.6. Cấu trúc khóa luận tốt nghiệp

2. CHƯƠNG 2: CƠ SỞ LÝ THUYẾT

2.1. Intrusion Detection System

2.2. Machine Learning và Deep Learning

2.3. Các thuật toán thường được sử dụng

3. CHƯƠNG 3: PHƯƠNG PHÁP THỰC HIỆN

3.1. Tổng quan về mô hình

3.1.1. Phase 1: Probe Phase

3.1.2. Phase 2: Create adversarial traffic phase

3.1.3. Phase 3: Another adversarial traffic generation phase

3.1.4. Phase 4: Execute attack phase

3.1.5. Phase 5: Defense Adversarial Training

3.2. Bộ phân loại

3.2.1. Gaussian Naive Bayes - GNB

3.2.2. Decision Trees - DT

3.2.3. Logistic Regression - LR

3.2.4. Deep Neural Networks - DNN

3.2.5. Long Short Term Memory - LSTM

3.3. Mô hình của các thuật toán tấn công đối kháng

3.3.1. Fast Gradient Sign Method - FGSM

4. CHƯƠNG 4: THÍ NGHIỆM VÀ ĐÁNH GIÁ

4.1. Thiết lập thí nghiệm

4.1.1. Môi trường cần thiết

4.1.2. Tiêu chí đánh giá

4.1.3. Tập dữ liệu

4.1.4. Adversarial Examples Attack

4.1.5. Phân chia dữ liệu

4.2. Triển khai kịch bản thí nghiệm

4.2.1. Hiệu suất của các Detector trước dữ liệu gốc

4.2.2. Tấn công đối kháng và Transferability

4.2.3. Attack Defense dùng Adversarial Training

5. CHƯƠNG 5: KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng Quan Về Nghiên Cứu Khả Năng Chống Tấn Công Đối Kháng

Nghiên cứu khả năng chống tấn công đối kháng của hệ thống phát hiện xâm nhập (IDS) dựa trên machine learning đang trở thành một chủ đề nóng trong lĩnh vực an ninh mạng. Các hệ thống IDS ngày càng được cải tiến để phát hiện các hành vi xâm nhập, nhưng sự xuất hiện của các cuộc tấn công đối kháng đã đặt ra nhiều thách thức mới. Việc hiểu rõ về khả năng chống lại các tấn công này là rất quan trọng để bảo vệ hệ thống khỏi những mối đe dọa ngày càng tinh vi.

1.1. Định Nghĩa Hệ Thống Phát Hiện Xâm Nhập

Hệ thống phát hiện xâm nhập (IDS) là công cụ quan trọng trong an ninh mạng, giúp giám sát và phát hiện các hoạt động bất thường. IDS có thể được phân loại thành nhiều loại, bao gồm NIDS và HIDS, mỗi loại có những ưu điểm và nhược điểm riêng.

1.2. Tầm Quan Trọng Của Machine Learning Trong An Ninh Mạng

Machine learning đã trở thành một phần không thể thiếu trong các hệ thống IDS hiện đại. Các mô hình học máy giúp cải thiện khả năng phát hiện các cuộc tấn công mạng, nhưng cũng đồng thời tạo ra những thách thức mới với các cuộc tấn công đối kháng.

II. Vấn Đề Tấn Công Đối Kháng Đối Với Hệ Thống IDS

Tấn công đối kháng là một trong những thách thức lớn nhất mà các hệ thống IDS phải đối mặt. Các cuộc tấn công này được thiết kế để đánh lừa các mô hình học máy, khiến chúng không thể phát hiện được các hành vi xâm nhập. Điều này không chỉ gây ra thiệt hại cho hệ thống mà còn làm giảm độ tin cậy của các giải pháp an ninh mạng.

2.1. Các Dạng Tấn Công Đối Kháng Phổ Biến

Có nhiều dạng tấn công đối kháng khác nhau, bao gồm FGSM, Deepfool và C&W. Mỗi dạng tấn công có cách thức hoạt động riêng, nhưng đều nhằm mục đích làm cho các mô hình học máy đưa ra kết quả sai lệch.

2.2. Hệ Quả Của Tấn Công Đối Kháng Đối Với An Ninh Mạng

Tấn công đối kháng có thể dẫn đến những hậu quả nghiêm trọng, từ việc mất mát dữ liệu đến thiệt hại tài chính. Ví dụ, vụ tấn công vào Sony Pictures đã cho thấy sự nguy hiểm của các cuộc tấn công này.

III. Phương Pháp Nghiên Cứu Khả Năng Chống Tấn Công Đối Kháng

Để nghiên cứu khả năng chống tấn công đối kháng, nhóm nghiên cứu đã áp dụng mô hình Generative Adversarial Network (GAN) kết hợp với Multimodal Learning. Phương pháp này cho phép tạo ra các mẫu đối kháng nhằm đánh lừa các hệ thống IDS, từ đó đánh giá khả năng phòng thủ của chúng.

3.1. Sử Dụng Mô Hình GAN Để Tạo Mẫu Đối Kháng

Mô hình GAN được sử dụng để tạo ra các mẫu đối kháng, giúp đánh lừa các hệ thống IDS. Việc này không chỉ giúp kiểm tra khả năng phát hiện mà còn đánh giá tính chuyển giao của các mẫu đối kháng.

3.2. Đánh Giá Khả Năng Phòng Thủ Của Hệ Thống IDS

Khả năng phòng thủ của các hệ thống IDS được đánh giá thông qua việc sử dụng các mẫu đối kháng đã tạo ra. Các phương pháp như Adversarial Training cũng được áp dụng để cải thiện khả năng chống lại các cuộc tấn công.

IV. Ứng Dụng Thực Tiễn Của Nghiên Cứu Về IDS

Nghiên cứu về khả năng chống tấn công đối kháng của hệ thống IDS có nhiều ứng dụng thực tiễn trong lĩnh vực an ninh mạng. Các kết quả nghiên cứu có thể giúp cải thiện các giải pháp bảo mật hiện có, đồng thời cung cấp thông tin quý giá cho các tổ chức trong việc bảo vệ hệ thống của họ.

4.1. Cải Thiện Các Giải Pháp Bảo Mật Hiện Tại

Kết quả nghiên cứu có thể được áp dụng để cải thiện các giải pháp bảo mật hiện tại, giúp các hệ thống IDS trở nên hiệu quả hơn trong việc phát hiện các cuộc tấn công.

4.2. Đề Xuất Các Hướng Nghiên Cứu Mới

Nghiên cứu cũng mở ra các hướng nghiên cứu mới trong lĩnh vực an ninh mạng, từ việc phát triển các mô hình học máy mới đến việc cải thiện các phương pháp phòng thủ.

V. Kết Luận Về Khả Năng Chống Tấn Công Đối Kháng

Khả năng chống tấn công đối kháng của hệ thống IDS là một vấn đề quan trọng trong an ninh mạng. Nghiên cứu này không chỉ giúp hiểu rõ hơn về các cuộc tấn công đối kháng mà còn cung cấp các giải pháp để cải thiện khả năng phòng thủ của các hệ thống IDS trong tương lai.

5.1. Tóm Tắt Các Kết Quả Nghiên Cứu

Nghiên cứu đã chỉ ra rằng việc sử dụng mô hình GAN kết hợp với các thuật toán tạo mẫu đối kháng có thể giúp đánh giá khả năng chống lại các cuộc tấn công đối kháng của hệ thống IDS.

5.2. Đề Xuất Hướng Phát Triển Trong Tương Lai

Các hướng phát triển trong tương lai có thể bao gồm việc cải thiện các mô hình học máy và phát triển các phương pháp phòng thủ mới để đối phó với các cuộc tấn công ngày càng tinh vi.

10/07/2025
Khóa luận tốt nghiệp an toàn thông tin nghiên cứu khả năng kháng mẫu đối kháng của các trình phát hiện xâm nhập dựa trên học máy

Trích đoạn nội dung tài liệu

Chương 1: TONG QUAN DE TÀI Trình bày khái quát định hướng nghiên cứu của khóa luận mà chúng tôi muốn hướng tới. e Chương 2: CO SỞ LÝ THUYET Trình bày các định nghĩa, khái niệm cũng như những kiến thức nền tảng để có thể thực hiện được nghiên cứu. Đồng thời trình bày sơ lược một số công trình liên quan có cùng hướng nghiên cứu. e Chương 3: PHƯƠNG PHÁP THỰC HIỆN Là phần trọng tâm của khoá luận, trình bày những nội dung chính về phương pháp thực hiện và mô hình được sử dụng.

e Chương 4: HIỆN THỰC, ĐÁNH GIÁ VÀ THẢO LUẬN Đề cập đến quá trình hiện thực hóa phương pháp đề cập ở Chương 3. Sau đó trình bày phương pháp thực nghiệm, đánh giá kết quả và thảo luận chung e Chương 5: KẾT LUẬN VÀ HƯỚNG PHÁT TRIEN Đưa ra kết luận về đề tài, đề xuất một số hướng phát triển mở rộng cho các nghiên cứu trong tương lai. CƠ SỞ LÝ THUYET Trong chương này, chúng tôi trình bày các cơ sở lý thuyết của khóa luận. Các kiến thức về Intrusion Detection System, Machine Learning, Deep Learning và Ensemble Learning.

Lý thuyết về tấn công đối kháng, cũng như các kỹ thuật tạo mẫu đối kháng. Bên cạnh đó trình bày thêm về phương pháp Transferability và phương pháp phòng thủ tấn công đối kháng. Intrusion Detection System Hệ thống phát hiện xâm nhập (Intrusion Detection System - IDS) là một công cụ an ninh mạng được thiết kế nhằm bảo vệ hệ thống và phát hiện các hoạt động đáng ngờ. Chức năng chính của IDS là phát hiện các dấu hiệu của các cuộc tấn công mạng, bao gồm xâm nhập trái phép, khai thác lỗ hổng bảo mật và các hoạt động độc hại khác.

Tùy thuộc vào phạm vi triển khai và nhiệm vụ cụ thể, IDS được phân loại thành nhiều loại khác nhau: e NIDS - Network Intrusion Detection System: tập trung vào việc theo đõi va phát hiện các hoạt động xâm nhập trong môi trường mạng. Hệ thống này thường được triển khai ở cấp độ mạng, đặc biệt tại các điểm truy cập chính hoặc các biên mạng, nơi dễ bị đe dọa. NIDS giám sát lưu lượng mạng đến và đi từ tất cả các thiết bị, cho phép quét toàn bộ lưu lượng để phát hiện các dấu hiệu của các cuộc tấn công mạng. e HIDS - Host Intrusion Detection System: chuyên giấm sát và phát hiện các hoạt động xâm nhập trên một máy tính hoặc hệ thống cụ thể.

HIDS được cài đặt trực tiếp trên từng thiết bị cần bảo vệ, theo dõi các gói dữ liệu ra vào trên mỗi máy. Nó tập trung vào việc bảo vệ truy cập nội bộ 8 và bảo vệ từng máy tính trước các mối đe dọa bên trong, do đó không thể giám sát toàn bộ lưu lượng mạng như NIDS. e Signature-based IDS: loại hệ thống IDS này hoạt động bằng cách so sánh các hoạt động mạng với các mẫu tấn công đã biết trước. Nếu phát hiện sự trùng khớp, hệ thống sẽ đưa ra cảnh báo.

Tuy nhiên, Signature-based IDS gặp khó khăn trong việc phát hiện các cuộc tấn công sử dụng các mẫu liên tục thay đổi. e Anomaly-based IDS: loại hệ thống IDS này giám sát hoạt động tổng thể của mạng và hệ thống để phát hiện các hành vi bất thường hoặc khả nghi. Thay vì dựa vào các mẫu tấn công cụ thể, Anomaly-based IDS phát hiện các hành vi không bình thường bằng cách so sánh chúng với mức bình thường đã được thiết lập trước đó (baseline). Khi phát hiện lưu lượng truy cập khác biệt so với baseline, hệ thống sẽ đưa ra cảnh báo.

Machine Learning và Deep Learning Ở phần này, chúng tôi sẽ đề cập tới khái niệm, quy trình, cách thức hoạt động nN 2 ^ z là of 2 :. và các thuật toán tiêu biểu cua Machine Learning va Deep Learning. Khai niém Machine learning (hoc máy) là một lĩnh vực của trí tuệ nhân tao (Artificial Intelligence - AT) tập trung vào việc phát triển các thuật toán và mô hình để máy tính có thể tự động học từ dữ liệu và cải thiện hiệu suất của mình theo thời gian. Phân loại Machine Learning vẫn cần sự can thiệp của con người.

Tuy nhiên, mức độ tham gia của con người thay đổi tùy theo loại hình machine learning. Cụ thể, có ba loại chính của machine learning như sau: Học có giám sát (Supervised Machine Learning) Máy học có giám sát sử dụng các tập dữ liệu được gán nhãn để xây dựng các thuật toán phân loại hoặc dự đoán với độ chính xác cao. Công nghệ này giúp giải quyết nhiều vấn đề thực tế, chang hạn như phân loại thư rác trong hộp thư điện tử. Máy học không giám sát (Unsupervised Machine Learning) Máy học không giám sát phân tích và gom cụm các tập dữ liệu không được gán nhãn thông qua các thuật toán.

Điều này cho phép hệ thống khám phá các mẫu hoặc nhóm dữ liệu ẩn mà không cần sự can thiệp của con người. Nhờ khả năng tìm ra sự tương đồng và khác biệt trong dữ liệu, máy học không giám sát lý tưởng cho việc phân tích dữ liệu, nhận dạng hình ảnh, và phân tích thông tin khách hàng. Nó cũng giúp giảm số lượng đặc trưng trong mô hình thông qua các thuật toán giảm chiều dữ liệu như Phân tích thành phần chính (PCA - Principal Component Analysis ) và Phân tích giá trị đơn lẻ (SVD - Singular Value Decomposition). Máy học bán giám sát (Semi-supervised Machine Learning) Máy học bán giám sát kết hợp giữa máy học có giám sát và không giám sát.

Nó sử dụng một tập dữ liệu nhỏ được gán nhãn để trích xuất đặc trưng và phân loại từ một tập dữ liệu lớn hơn không được gán nhãn. Phương pháp này hiệu quả trong các trường hợp thiếu dữ liệu gán nhãn, giúp huấn luyện các thuật toán mấy học có giám sát một cách nhanh chóng và hiệu quả. Các thuật toán thường được sử dụng Chúng tôi sẽ đề cập tới 4 thuật toán thường được sử dụng trong các mô hình Machine Learning. Linear Regression - Hồi quy tuyến tính Hồi quy tuyến tính là mô hình cố gắng tìm đường thắng (hoặc siêu phẳng trong không gian nhiều chiều) tốt nhất mà mô hình hóa mối quan hệ giữa biến độc lập X và biến phụ thuộc Y.

Công thức tổng quát 2.1) Trong đó: - Bo là điểm cắt trục Y - đ¡ là độ dốc - € là sai số Đặc điểm: Dễ hiểu, dễ triển khai, hiệu quả với dữ liệu tuyến tính. Ứng dụng: Dự đoán giá nhà, dự báo doanh thu, phân tích xu hướng. Logistic Regression - Hồi quy logistic Thuật toán học có giám sát này đưa ra dự đoán cho các biến phản hồi phan loại (câu trả lời có/không). Hồi quy logistic sử dụng hàm logistic (hàm sigmoid) để mô hình hóa xác suất của biến nhị phân Y.2) 1 + e-(®+8iX) Trong do: 11 - P(Y = I|X): Xác suất của biến phụ thuộc Y bằng 1 (sự kiện xảy ra) khi biết giá trị của biến độc lập X.

Đây là xác suất điều kiện, nghĩa là xác suất của Y dựa trên điều kiện của X. - Y: Biến phụ thuộc nhị phân, có thể nhận giá trị 0 hoặc 1. Ví dụ, Y có thể biểu thị một sự kiện như "email là spam" (1) hoặc "email không phải là spam" (0). - X: Biến độc lập hoặc biến dự đoán.

Đây có thể là một giá trị đơn hoặc một vector chứa nhiều biến đầu vào. Ví dụ, X có thể bao gồm các đặc trưng như "số lượng từ trong email", "có chứa từ khóa ’khuyén mãi", v. - Bo: Hệ số chặn hoặc hằng số giao nhau. Đây là giá trị của Y khi tất cả các biến X bằng 0.

- 6: Hệ số hoi quy tương ứng với biến X. No đại diện cho mức độ ảnh hưởng của X lên xác suất của Y. - e: Cơ số của logarit tự nhiên, khoảng bang 2. Đặc điểm: Hiệu quả cho các bài toán phân loại, dễ triển khai và giải thích.

Ứng dung: Phân loại nhị phân như chan đoán bệnh, phân loại email spam. Decision Tree - Cây quyết định Thuật toán được sử dụng cho cả dự đoán hồi quy và phân loại dữ liệu thành các mục con dựa trên các thuộc tính của dữ liệu. Decision trees sử dụng một chuỗi phân nhánh của các quyết định được liên kết có thể biểu diễn bằng sơ đồ cây. Decision Tree chia dữ liệu dựa vào các câu hỏi đơn giản về các đặc trưng, và mỗi nút lá của cây đại diện cho một lớp hoặc giá trị dự đoán.

Các Decision Tree thường được sử dụng để phân loại (classification) hoặc hồi quy (regression) tùy thuộc vào bài toán cụ thể.1 minh họa một cây cấu quyết định có cấu trúc đơn giản. 12 Root Node ———*> With Friends? a Splitting Yes No Decision Node Windy? Walk or cart? ves / mo aa | jean Above ; par Cold? Above Cold? par Yes / /No ' ves/ / No Above Below Above par par par Branch Leaf Nodes Hình 2.1: Kiến trúc của một Decision Tree đơn giản. Ứng dụng: Phân loại khách hàng, ra quyết định quản lý, dự đoán kết quả. Đặc điểm: Dễ hiểu và giải thích, có thể xử lý dữ liệu thiếu, dé bị quá khớp.

Random Forest Random Forest là một tập hợp của nhiều cây quyết định được huấn luyện trên các mẫu con khác nhau của dữ liệu và kết hợp lại để cải thiện độ chính xác và độ on định. Kết quả cuối cùng là trung bình hoặc đa số phiếu của các cây. Ứng dụng: Phân loại và hồi quy, phát hiện gian lận, chẩn đoán y tế. Đặc điểm: Kháng quá khớp, hiệu quả cao, dễ triển khai.

Khai niém Deep learning, một phan của lĩnh vực Trí tuệ Nhân tao (AT), tập trung vào việc sử dụng mạng nơ-ron nhân tạo để thực hiện các tác vụ phức tạp như phân tích, xử ly dữ liệu và mô phỏng hành vi. Công nghệ này cố gắng mô phỏng cách mà não của con người xử lý thông tin bằng cách sử dụng các lớp nơ-ron để tự động học và hiểu các mẫu từ dữ liệu. Phân loại Cũng như Machine Learning đã nêu ở phần trước, thì ở Deep Learning cũng có thể được chia làm 3 loại là Giám sát, Bán giám sát hoặc Không giám Z sát. Các thuật toán thường được sử dung 1.

Deep Neural Networks - DNNs DNNs là một loại mạng nơ-ron sâu có nhiều lớp ẩn giữa lớp đầu vào và lớp dau ra. Các lớp ẩn này cho phép mô hình học các biểu diễn phức tạp của dữ liệu và thực hiện các tác vụ phức tạp như phân loại va dự đoán.2 mô tả một kiến trúc DNN đơn giản bao gồm 4 Input (đầu vào) và có 1 Output(dau ra). 14 Input Layer (3) Hidden Layer (10) Output Layer (1) X Letter Frequency Analysis _—> Alphanumerical Character X; Analysis X: Request Length Analysis — Bias ——® Hình 2.2: Kiến trúc của một mô hành Neural Networks .

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu "Nghiên Cứu Khả Năng Chống Tấn Công Đối Kháng Của Hệ Thống Phát Hiện Xâm Nhập Dựa Trên Machine Learning" cung cấp cái nhìn sâu sắc về cách mà các hệ thống phát hiện xâm nhập có thể được cải thiện khả năng chống lại các cuộc tấn công đối kháng. Nghiên cứu này không chỉ phân tích các phương pháp hiện tại mà còn đề xuất các giải pháp mới nhằm nâng cao hiệu quả của hệ thống trong việc phát hiện và ngăn chặn các mối đe dọa an ninh mạng. Độc giả sẽ tìm thấy những thông tin hữu ích về cách thức hoạt động của machine learning trong lĩnh vực an ninh mạng, từ đó có thể áp dụng vào thực tiễn để bảo vệ hệ thống của mình tốt hơn.

Để mở rộng thêm kiến thức, bạn có thể tham khảo các tài liệu liên quan như Khóa luận tốt nghiệp an toàn thông tin nghiên cứu trình phát hiện xâm nhập dựa trên few shot learning, nơi nghiên cứu về các phương pháp học máy tiên tiến trong phát hiện xâm nhập. Bên cạnh đó, tài liệu Khóa luận tốt nghiệp an toàn thông tin mô hình cộng tác phát hiện xâm nhập dựa trên học liên kết bán giám sát và cơ chế tăng cường dữ liệu sẽ giúp bạn hiểu rõ hơn về các mô hình hợp tác trong phát hiện xâm nhập. Cuối cùng, tài liệu Khóa luận tốt nghiệp an toàn thông tin nghiên cứu phương pháp cải thiện khả năng kháng mẫu đối kháng cho các trình phát hiện tấn công mạng sẽ cung cấp thêm thông tin về cách nâng cao khả năng phát hiện tấn công mạng. Những tài liệu này sẽ là cơ hội tuyệt vời để bạn khám phá sâu hơn về lĩnh vực này.