Xây Dựng Hệ Thống Phát Hiện Xâm Nhập Hai Tầng Hiệu Quả

Khóa luận trình bày phương pháp xây dựng hệ thống phát hiện xâm nhập hai tầng hiệu quả trong an toàn thông tin, nâng cao bảo mật hệ thống.

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2022

99
2
0

Phí lưu trữ

35 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: TỔNG QUAN ĐỀ TÀI

1.1. Tên đề tài

1.2. Từ khóa

1.3. Tổng quan tình hình nghiên cứu

1.4. Đối tượng và phạm vi nghiên cứu

1.5. Cấu trúc khóa luận

2. CHƯƠNG 2: CƠ SỞ LÝ THUYẾT

2.1. Tổng quan về hệ thống phát hiện xâm nhập (IDS)

2.1.1. Khái niệm hệ thống phát hiện xâm nhập

2.1.2. Phân loại hệ thống phát hiện xâm nhập

2.2. Ngôn ngữ lập trình và các thư viện hỗ trợ

2.2.1. Ngôn ngữ lập trình Python

2.2.2. Thư viện TensorFlow

2.2.3. Thư viện SCIKIT-Learn

2.2.4. Các thư viện hỗ trợ liên quan

2.3. Học máy và học sâu

2.3.1. Tổng quan về học máy

2.3.2. Decision tree và các thuật toán học máy

2.3.3. Tổng quan về học sâu

2.3.4. Convolutional Neural Network và các kiến trúc mạng học sâu

2.3.5. Tập dữ liệu lưu lượng mạng

2.3.6. Mạng sinh đối kháng - Generative Adversarial Network (GAN)

2.3.6.1. Học có giám sát và học không giám sát
2.3.6.2. Mô hình phân biệt và mô hình tạo sinh
2.3.6.3. Huấn luyện GAN
2.3.6.4. Mẫu đối kháng
2.3.6.5. Kỹ thuật sinh mẫu đối kháng Carlini & Wagner attack
2.3.6.6. Kỹ thuật sinh mẫu đối kháng Decision Tree attack

3. CHƯƠNG 3: MÔ HÌNH HỆ THỐNG TWO-STAGE IDS

3.1. Tổng quát hóa mô hình triển khai Two-stage IDS

3.2. Phát hiện tấn công với trí tuệ nhân tạo

3.2.1. Tiền xử lí dữ liệu lưu lượng

3.2.2. Phân loại nhị phân với Decision Tree

3.2.3. Phân loại đa lớp với CNN

3.3. Phát hiện mẫu đối kháng với ML-LOO

4. CHƯƠNG 4: THỰC NGHIỆM VÀ ĐÁNH GIÁ

4.1. Tập dữ liệu CIC-IDS-2017

4.2. Các thông số đánh giá

4.3. Đánh giá hiệu năng mô hình đề xuất

4.3.1. Sàng lọc mẫu đối kháng với ML-LOO

4.3.2. Hiệu suất phân loại của Two-stage IDS

5. CHƯƠNG 5: TỔNG KẾT VÀ HƯỚNG PHÁT TRIỂN

5.1. Tổng kết

5.2. Hướng phát triển

PHỤ LỤC

A. Hướng dẫn sử dụng Google Colaboratory

B. Phương pháp nhân tử Lagrange

C. Phương pháp phạm vi tứ phân vị - Interquartile Range (IQR)

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng quan về Hệ Thống Phát Hiện Xâm Nhập Hai Tầng Hiệu Quả

Hệ thống phát hiện xâm nhập (IDS) hai tầng là một giải pháp tiên tiến trong việc bảo vệ an ninh mạng. Với sự gia tăng của các cuộc tấn công mạng, việc phát hiện và ngăn chặn các mối đe dọa trở nên cấp thiết hơn bao giờ hết. Hệ thống này không chỉ giúp phát hiện các hành vi xâm nhập mà còn tối ưu hóa quy trình xử lý dữ liệu, từ đó nâng cao hiệu quả bảo mật thông tin.

1.1. Khái niệm về Hệ Thống Phát Hiện Xâm Nhập

Hệ thống phát hiện xâm nhập (IDS) là công cụ quan trọng trong việc bảo vệ an ninh mạng. Nó giúp phát hiện các hành vi xâm nhập bất hợp pháp và cảnh báo kịp thời cho người quản trị hệ thống.

1.2. Lợi ích của Hệ Thống Hai Tầng

Hệ thống hai tầng giúp phân loại và xử lý dữ liệu hiệu quả hơn. Giai đoạn đầu sàng lọc lưu lượng mạng bất thường, trong khi giai đoạn hai phân loại cụ thể các loại tấn công, từ đó nâng cao khả năng phát hiện.

II. Vấn đề và Thách thức trong An Ninh Mạng Hiện Nay

Sự gia tăng của các cuộc tấn công mạng đã đặt ra nhiều thách thức cho các hệ thống bảo mật. Các phương thức tấn công ngày càng tinh vi, yêu cầu các giải pháp phát hiện xâm nhập phải liên tục được cải tiến. Việc phát hiện kịp thời các mối đe dọa là rất quan trọng để bảo vệ dữ liệu và thông tin nhạy cảm.

2.1. Các loại tấn công phổ biến hiện nay

Các cuộc tấn công như tấn công từ chối dịch vụ (DDoS) và tấn công lừa đảo (phishing) đang gia tăng. Những cuộc tấn công này không chỉ gây thiệt hại về tài chính mà còn ảnh hưởng đến uy tín của tổ chức.

2.2. Thách thức trong việc phát hiện tấn công

Việc phát hiện các cuộc tấn công ngày càng khó khăn do sự phức tạp của các phương thức tấn công. Hệ thống IDS một tầng không còn đủ khả năng đáp ứng yêu cầu trong bối cảnh dữ liệu lớn.

III. Phương pháp Xây dựng Hệ Thống Phát Hiện Xâm Nhập Hai Tầng

Để xây dựng một hệ thống phát hiện xâm nhập hai tầng hiệu quả, cần áp dụng các thuật toán học máy và học sâu. Giai đoạn đầu sử dụng thuật toán học máy để sàng lọc lưu lượng mạng, trong khi giai đoạn hai áp dụng học sâu để phân loại các loại tấn công.

3.1. Thuật toán học máy trong giai đoạn sàng lọc

Giai đoạn đầu sử dụng các thuật toán như Decision Tree và Random Forest để sàng lọc lưu lượng mạng bất thường. Những thuật toán này có khả năng xử lý nhanh và chính xác.

3.2. Học sâu trong phân loại tấn công

Giai đoạn hai áp dụng các mô hình học sâu như Convolutional Neural Network (CNN) để phân loại các loại tấn công. Mô hình này có khả năng tự học và cải thiện theo thời gian.

IV. Ứng dụng Thực tiễn của Hệ Thống Phát Hiện Xâm Nhập Hai Tầng

Hệ thống phát hiện xâm nhập hai tầng đã được áp dụng thành công trong nhiều tổ chức. Việc phát hiện kịp thời các mối đe dọa giúp bảo vệ dữ liệu và thông tin nhạy cảm, đồng thời giảm thiểu thiệt hại do các cuộc tấn công gây ra.

4.1. Kết quả nghiên cứu và thử nghiệm

Nghiên cứu cho thấy hệ thống hai tầng có hiệu suất phân loại cao hơn so với hệ thống một tầng. Việc áp dụng các phương pháp phát hiện mẫu đối kháng cũng giúp nâng cao khả năng phát hiện.

4.2. Tích hợp vào hệ thống bảo mật hiện có

Hệ thống IDS hai tầng có thể được tích hợp vào các hệ thống bảo mật hiện có, giúp nâng cao khả năng bảo vệ và phát hiện các mối đe dọa mới.

V. Kết luận và Hướng phát triển trong Tương lai

Hệ thống phát hiện xâm nhập hai tầng là một giải pháp hiệu quả trong việc bảo vệ an ninh mạng. Tương lai, cần tiếp tục nghiên cứu và phát triển các thuật toán mới để nâng cao khả năng phát hiện và giảm thiểu rủi ro từ các cuộc tấn công mạng.

5.1. Tương lai của Hệ thống IDS

Hệ thống IDS sẽ tiếp tục phát triển với sự hỗ trợ của công nghệ mới như trí tuệ nhân tạo và học máy. Điều này sẽ giúp cải thiện khả năng phát hiện và phản ứng nhanh chóng với các mối đe dọa.

5.2. Nghiên cứu và phát triển thêm

Cần nghiên cứu thêm về các phương pháp phát hiện mới và cải tiến các thuật toán hiện có để đáp ứng tốt hơn với các cuộc tấn công ngày càng tinh vi.

10/07/2025
Khóa luận tốt nghiệp an toàn thông tin xây dựng hệ thống phát hiện xâm nhập hai tầng hiệu quả

Trích đoạn nội dung tài liệu

CHƯƠNG 1 — TONG QUAN ĐÈ TÀI Đã có rat nhiều các bai nghiên cứu của các học gia nỗi tiếng sử dung các thuật toán machine learning như Decision Tree, SVM, K-means. dé phát hiện các lưu lượng bất thường đem lại kết quả rất tích cực nhưng tỉ lệ dự đoán chính xác vẫn cần phải được cải thiện [AK]. Các thuật toán deep learning, được triển khai bằng cách bắt chước hành vi phân biệt, cách tư duy não bộ của con người thông qua các tế bào thần kinh, đã được áp dụng thành công trong các lĩnh vực như nhận dạng hình ảnh, phân tích chuyển động, xử lý ngôn ngữ tự nhiên. cũng đã được sử dung trong việc phat hiện xâm nhập trái phép.

Tuy nhiên, những thuật toán như Deep Neural Network (DNN), Recurrent Neural Network (RNN), Long Short-Term Memory (LSTM) thường tiêu tốn quá nhiều thời gian trong việc huấn luyện mô hình. Với sự phát triển chóng mặt của công nghệ thông tin, lượng dữ liệu được trao đồi trở nên không lồ hơn bao giờ hết. Các mô hình One-stage IDS phải đối mặt với lượng dit liệu lớn ngày càng trở nên ít hiệu quả, làm ảnh hưởng đến sự an toàn thông tin của toàn bộ hệ thong mạng. Do đó, mô hình One-stage IDS không thé đáp ứng được các yêu cầu trong ngữ cảnh dữ liệu lớn như hiện nay.

Đề giải quyết van dé này, chúng em đề xuất một hệ thống Two-stage IDS dé cải thiện hiệu năng phân loại của IDS nhằm phân loại các cuộc tấn công một cách nhanh chóng và chính xác hơn. Cụ thê ở bài nghiên cứu này, chúng em sẽ kết hợp thuật toán Decision Tree và Convolutional Neural Network (CNN) đề xây dựng hệ thống Two- stage IDS nhăm giải quyết những van đề mà One-stage IDS phải đối mặt. Hệ thống Two-stage IDS được dé xuất bao gồm hai giai đoạn phân loại. Giai đoạn thứ nhất đảm nhận vai trò nhận dạng các lưu lượng mạng bất thường và giai đoạn thứ hai sẽ phân loại tan công từ những lưu lượng bat thường được phân loại từ giai đoạn thứ nhất.

Giai đoạn thứ nhất được xây dựng dựa trên thuật toán machine learning, thuật toán machine learning có ưu điểm là tốc độ xử lý nhanh và có độ tin cậy cao trong việc phân loại nhị phân, phù hợp trong việc sàng lọc lưu lượng mạng bất thường. Thuật toán deep learning được áp dụng cho giai đoạn hai nhằm tận dụng ưu điểm là khả năng tự học theo thời gian cùng với khả năng đưa ra các dự đoán có tỉ lệ (+) | CHƯƠNG 1 — TONG QUAN ĐÈ TÀI chính xác cao dé tiến hành phân loại đa lớp nhằm phát hiện cụ thể loại tan công.4 Mục tiêu của dé tài e Xây dựng và triển khai hệ thống phát hiện xâm nhập hai tang áp dụng ML và DL dé ngăn ngừa các cuộc tan công mạng. e Triển khai tích hợp hệ thống phát hiện mẫu đối kháng vào mô hình đề xuất dé cải thiện hiệu năng, ngăn chặn sự đánh lừa IDS từ các mẫu đối kháng.5 Đối tượng và phạm vi nghiên cứu 1.1 Đối tượng nghiên cứu e Ngôn ngữ Python được sử dụng trong việc xây dựng và hoàn thiện mô hình. e Thu viện TensorFlow2 dé xây dựng mô hình hệ thống.

e Kỹ thuật tấn công Carlini & Wagner dé tạo mẫu đối kháng. e Tỉnh chỉnh và trién khai tích hợp hệ thống ML-LOO vào Two-stage IDS.2 Phạm vi nghiên cứu e Các thuật toán học máy, học sâu. e Các kỹ thuật sàng lọc và xử lí dữ liệu lưu lượng mạng. e_ Giải pháp tích hợp thuật toán học máy và học sâu dé xây dựng mô hình đề xuất.

e Các kỹ thuật sinh mẫu đối kháng. e Các giải pháp hiện có dé phát hiện các mẫu đối kháng.6 Cấu trúc khóa luận: Khóa luận được trình bay với cấu trúc như sau: e Chương 1. Tổng quan đề tài. Chương l sẽ giới thiệu tông quan về dé tài nghiên cứu, mục tiêu nghiên cứu, đối tượng nghiên cứu và phạm vi nghiên cứu.

(5} | CHƯƠNG 1 — TONG QUAN ĐÈ TÀI e Chương 2. Co sở lý thuyết. Chương2 sẽ trình bay các kiến thức tổng quan về hệ thống phát hiện xâm nhập, giới thiệu về ngôn ngữ lập trình được sử dụng và các thư viện hỗ trợ có liên quan, giới thiệu về học máy và học sâu, các thuật toán học máy và mô hình học sâu và các tập di liệu lưu lượng mạng, giới thiệu về mang sinh đối kháng, các kiểu tan công phố biến và hệ thống phát hiện mẫu đối kháng. Mô hình hệ thống Two-stage IDS.

Chương 3 mô tả chỉ tiết về hệ thống Two-stage IDS, các giai đoạn riêng biệt và quá trình tích hợp hệ thống phát hiện mẫu đối kháng. Thực nghiệm và đánh giá. Chương 4 trình bày quá trình thực nghiệm hệ thống, đưa ra các thông số chỉ tiết thé hiện độ chính xác, hiệu năng của mô hình đề xuất và đánh giá kết quả. Chương 5 tông kết toàn bộ quá trình nghiên cứu, xây dựng hệ thống và đề xuất các mục tiêu phát triển trong tương lai.

e Phụ lục Phụ lục trình bày cách sử dụng môi trường Google Colab trong việc xử lí và huấn luyện mô hình, các lỗi gặp phải trong quá trình nghiên cứu và phương pháp giải quyết. e Tài liệu tham khảo Toàn bộ các công trình nghiên cứu, các bài viết chia sẻ kiến thức và hình ảnh được sử dụng trong báo cáo sẽ được trích dẫn ở phần này. (>} CHƯƠNG2 CƠ SỞ LÝ THUYET 2.1 Tổng quan về hệ thống phát hiện xâm nhập (IDS) 2.1 Khái niệm hệ thống phát hiện xâm nhập IDS (Intrusion Detection System hay “Hệ thống phát hiện xâm nhập”) được cấu thành từ hai từ “xâm nhập” và “hệ thống phát hiện”. Xâm nhập đề cập đến việc truy cập trái phép vào thông tin hoặc hệ thống mang làm ảnh hưởng đến ba yếu tố gồm: bao mật (Confidentiality), toàn ven (Integrity) và khả dụng (Availability).

Hệ thong phát hiện là cơ chế bảo mật phát hiện các xâm nhập bat hợp pháp. Vì vậy IDS là một hệ thông hoạt động thường trực với nhiệm vụ là giảm sát hệ thong mang va kiém tra lưu lượng mạng, kiểm tra sự tồn tại của các hoạt động đáng nghi ngờ có khả năng làm ảnh hưởng đến ba yếu tố C-I-A đã nêu trên. Hình 2-1 thê hiện một hệ thống mạng cơ bản có lắp đặt các IDS. AI-IDS là áp dụng trí tuệ nhân tạo vào IDS giúp IDS có khả năng phát hiện tốt hơn, học hỏi được các loại tan công mới trong lưu lượng mạng và tự động phát hiện được lưu lượng bắt thường nhằm tăng khả năng phát hiện xâm nhập tốt hơn.

MIDS NIDS management Read-only The Internet Firewall Trusted network Hình 2-1 Mô hình mạng cơ bản có lắp đặt IDS [1] 2.2 Phan loại hệ thống phát hiện xâm nhập IDS có thể được phân loại theo phạm vi giám sat và theo kĩ thuật thực hiện.1 IDS dựa trên phạm vi giám sát Dựa vào phạm vi giảm sát thì IDS được chia thành hai loại: dựa trên Host (HIDS) va dựa trên Network (NIDS). HIDS được triển khai trên host với nhiệm vụ giám sát hoạt động của host được triển khai đề phát hiện những hành vi vi phạm tới chính sách và những hành vi bất thường. NIDS được triển khai trên hệ thống mạng với mục đích bảo vệ hệ thống mạng khỏi sự xâm nhập trái phép. NIDS giám sát liên tục lưu lượng mạng và xem xét các packet trong mạng để phát hiện xâm nhập trái phép.2 IDS dựa trên kỹ thuật thực hiện IDS dựa trên kỹ thuật thực hiện được chia làm hai loại: dựa trên dấu hiệu nhận biết (Signature-based IDS) và dựa trên sự bất thường (Anomoly-based IDS).

Signature-based IDS hay còn gọi là phát hiện xâm nhập dựa trên những dấu hiệu, ý tưởng đã biết dé xác định dấu hiệu nhận biết cho các loại tan công. Các dấu hiệu nhận biết này được lưu trữ trong cơ sở dữ liệu các dấu hiệu nhận biết và các mẫu dữ liệu được khớp với các dâu hiệu được lưu trữ này đê phát hiện các cuộc tân công. (+} | CHƯƠNG 2- CƠ SỞ LÝ THUYET Ưu điểm của Signature-based IDS là cực kì hiệu quả khi phát hiện các cuộc tấn công đã biết từ trước. Mặt khác, phương pháp này thiếu khả năng phát hiện các cuộc tấn công biến thé và mới do không có các mẫu dấu hiệu có sẵn trong cơ sở dữ liệu.

Việc dé phát hiện được nhiều dau hiệu mới đòi hỏi cơ sở dit liệu phải lưu trữ rất nhiều dấu hiệu và khi một cuộc tấn công có ý định xâm nhập vao hệ thống thì việc kiểm tra các mau dé xác định kiểu tan công cũng sẽ làm tiêu tốn tài nguyên. Anomoly-based IDS hay còn gọi là hệ thống phát hiện xâm nhập dựa trên sự bat thường dựa trên ý tưởng xác định ngưỡng hoạt động nao là bình thường, ngưỡng nao là bat thường. Bat kì sai lệch nào so với ngưỡng bình thường sẽ được coi là hành vi bất thường. Ưu điểm của Anomoly-based IDS là khả năng phát hiện các cuộc tấn công mới chưa biết và khả năng điều chỉnh các ngưỡng bình thường cho các mạng và ứng dụng khác nhau.

Tuy nhiên, nhược điểm chính là tỉ lệ báo động giả cao vì khó tìm ra ranh giới giữa ngưỡng bình thường và bất thường đề phát hiện xâm nhập. Ngôn ngữ lập trình và các thư viện hỗ trợ Di cùng với sự phát triển của lĩnh vực trí tuệ nhân tạo là sự trợ giúp của các công cụ, thư viện, framework đặc thù, được xây dựng dé hỗ trợ trong việc nghiên cứu và phát triển mô hình/ứng dụng một các thuận tiện.1 Ngôn ngữ lập trình Python Python là một ngôn ngữ lập trình rất phổ biến hiện nay, nó được tạo ra bởi Guido van Rossum vào năm 1991. Với khả năng mạnh mẽ của minh, Python được dùng dé lập trình ra các ứng dụng web, xử lý các tính toán khoa học, tao ra các sản pham phân mềm chất lượng. Python hỗ trợ nhiều nền tảng khác nhau như Windows, Mac, Linux.

Ngôn ngữ này có cú pháp đơn giản, dễ hiểu và dễ tiếp cận. Python sử dụng trình thông dịch đề thực thi nên có thê thực thì ngay mà không cần biến dịch toàn bộ chương trình. Với khả năng xử lý các phép toán phức tạp cùng việc có nhiều thư viện hỗ trợ tốt như scipy, numpy, sklearn, tensorflow, pytorch, pandas. nên Pythen được sử dụng rât nhiêu trong lĩnh vực học máy, học sâu nói riêng và nghiên cứu trí tuệ (>} | CHƯƠNG 2- CƠ SỞ LÝ THUYET nhân tạo nói chung.2 Thu viện TensorFlow Tensorflow là một thư viện miễn phí và mã nguồn mở phục vụ cho machine learning (học máy) được phát triển bởi đội ngũ Google Brain vào năm 2015.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu có tiêu đề Hệ Thống Phát Hiện Xâm Nhập Hai Tầng Hiệu Quả trình bày một phương pháp tiên tiến trong việc phát hiện xâm nhập mạng, giúp bảo vệ hệ thống thông tin khỏi các mối đe dọa an ninh. Hệ thống này hoạt động dựa trên hai tầng, cho phép phát hiện và phản ứng nhanh chóng với các hành vi xâm nhập, từ đó nâng cao khả năng bảo mật cho các tổ chức và doanh nghiệp.

Độc giả sẽ tìm thấy nhiều lợi ích từ tài liệu này, bao gồm việc hiểu rõ hơn về cách thức hoạt động của hệ thống phát hiện xâm nhập, cũng như các chiến lược để cải thiện an ninh mạng. Để mở rộng kiến thức của mình, bạn có thể tham khảo thêm tài liệu Xây dựng công cụ phát hiện xâm nhập mạng máy tính, nơi cung cấp thông tin chi tiết về các công cụ hỗ trợ trong việc phát hiện xâm nhập.

Ngoài ra, tài liệu Nghiên cứu và xây dựng mô hình hệ thống dò tìm xâm nhập thời gian thực sẽ giúp bạn hiểu rõ hơn về các mô hình hiện đại trong việc phát hiện xâm nhập ngay lập tức. Cuối cùng, bạn cũng có thể tìm hiểu về Khóa luận tốt nghiệp an toàn thông tin xây dựng phương pháp lựa chọn thuộc tính hiệu quả cho hệ thống phát hiện xâm nhập mạng, tài liệu này sẽ cung cấp những phương pháp lựa chọn thuộc tính giúp tối ưu hóa hiệu quả của hệ thống phát hiện xâm nhập.

Những tài liệu này không chỉ mở rộng kiến thức mà còn cung cấp những góc nhìn đa dạng về lĩnh vực an ninh mạng, giúp bạn nắm bắt tốt hơn các xu hướng và công nghệ mới nhất.