Khóa luận tốt nghiệp an toàn thông tin phát triển bộ phân loại hai lớp dựa trên học máy cho hệ thống phát hiện xâm nhập

Khóa luận trình bày phương pháp phát triển bộ phân loại hai lớp dựa trên học máy cho hệ thống phát hiện xâm nhập an toàn thông tin.

Chuyên ngành

Cử nhân ngành An toàn thông tin

Người đăng

Ẩn danh

Thể loại

khóa luận

2024

71
3
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: TỔNG QUAN ĐỀ TÀI

1.1. Lý do chọn đề tài

1.2. Mục tiêu nghiên cứu

1.3. Đối tượng nghiên cứu

1.4. Phạm vi nghiên cứu

1.5. Phương pháp nghiên cứu

1.6. Cấu trúc khóa luận

2. CHƯƠNG 2: KIẾN THỨC NỀN TẢNG VÀ NGHIÊN CỨU LIÊN QUAN

2.1. Hệ thống phát hiện xâm nhập IDS

2.2. Tổng quan

2.3. Hệ thống phát hiện xâm nhập dựa trên học máy (AI-based IDS)

3. CHƯƠNG 3: PHƯƠNG PHÁP ĐỀ XUẤT

3.1. Sử dụng XAI để lựa chọn đặc trưng

3.2. Ranking các đặc trưng sau khi thu được kết quả từ các phương pháp XAI

3.3. Sử dụng Decision Tree để đánh giá top các đặc trưng được chọn lọc

3.4. Xây dựng bộ phân loại hai lớp dựa trên học máy

3.5. Quá trình huấn luyện

3.6. Quá trình kiểm tra

4. CHƯƠNG 4: HIỆN THỰC - THỰC NGHIỆM VÀ ĐÁNH GIÁ

4.1. Môi trường thực nghiệm

4.2. Tập dữ liệu thực nghiệm và các tham số đánh giá mô hình

4.3. Tiền xử lý dữ liệu

4.4. Các thông số đánh giá (Độ đo)

4.5. Hiện thực phương pháp

4.6. Sử dụng XAI làm Feature Selection

4.7. Hiện thực mô hình hai lớp

5. CHƯƠNG 5: KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

DANH MỤC HÌNH ẢNH

DANH MỤC BẢNG BIỂU

DANH MỤC TỪ VIẾT TẮT

TÓM TẮT KHÓA LUẬN

Tóm tắt

I. Tổng Quan Về Phát Triển Bộ Phân Loại Hai Lớp Dựa Trên Học Máy

Trong bối cảnh an ninh mạng ngày càng phức tạp, việc phát triển bộ phân loại hai lớp dựa trên học máy cho hệ thống phát hiện xâm nhập (IDS) trở nên cần thiết. Hệ thống IDS truyền thống thường gặp khó khăn trong việc xử lý lượng dữ liệu lớn và phát hiện các cuộc tấn công mới. Do đó, nghiên cứu này nhằm mục tiêu cải thiện hiệu suất và độ chính xác của IDS thông qua việc áp dụng các kỹ thuật học máy tiên tiến.

1.1. Lý Do Cần Phát Triển Bộ Phân Loại Hai Lớp

Sự gia tăng các cuộc tấn công mạng đã chỉ ra rằng các hệ thống IDS truyền thống không còn đủ hiệu quả. Việc phát triển bộ phân loại hai lớp giúp cải thiện khả năng phát hiện và xử lý dữ liệu lớn, đồng thời tối ưu hóa thời gian phản hồi.

1.2. Mục Tiêu Nghiên Cứu Bộ Phân Loại Hai Lớp

Mục tiêu chính của nghiên cứu là phát triển một mô hình phân loại hai lớp, trong đó lớp đầu tiên xử lý dữ liệu nhanh chóng và lớp thứ hai đảm bảo độ chính xác cao. Điều này sẽ giúp nâng cao hiệu quả phát hiện xâm nhập trong thời gian thực.

II. Thách Thức Trong Hệ Thống Phát Hiện Xâm Nhập Hiện Nay

Hệ thống phát hiện xâm nhập hiện tại đối mặt với nhiều thách thức, bao gồm khả năng phát hiện các cuộc tấn công mới và xử lý lượng dữ liệu lớn. Các phương pháp truyền thống như dựa trên chữ ký không thể đáp ứng kịp thời với các mối đe dọa mới. Điều này dẫn đến việc cần thiết phải áp dụng các kỹ thuật học máy để cải thiện khả năng phát hiện.

2.1. Khó Khăn Trong Việc Phát Hiện Cuộc Tấn Công Mới

Các cuộc tấn công mới thường không nằm trong cơ sở dữ liệu chữ ký, dẫn đến việc hệ thống không thể phát hiện kịp thời. Điều này yêu cầu các hệ thống IDS phải có khả năng học hỏi và thích ứng với các mối đe dọa mới.

2.2. Vấn Đề Xử Lý Dữ Liệu Lớn

Khi lưu lượng mạng tăng lên, các hệ thống IDS truyền thống gặp khó khăn trong việc xử lý và phân tích dữ liệu lớn. Điều này làm giảm hiệu suất và độ chính xác của hệ thống, cần có giải pháp mới để cải thiện tình hình.

III. Phương Pháp Phát Triển Bộ Phân Loại Hai Lớp Dựa Trên Học Máy

Nghiên cứu này áp dụng các phương pháp học máy để phát triển bộ phân loại hai lớp cho hệ thống IDS. Lớp đầu tiên sử dụng các thuật toán học máy để xử lý dữ liệu nhanh chóng, trong khi lớp thứ hai áp dụng mô hình Transformer để cải thiện độ chính xác. Việc sử dụng các kỹ thuật eXplainable AI (XAI) cũng giúp tối ưu hóa quá trình lựa chọn đặc trưng.

3.1. Sử Dụng Thuật Toán Học Máy Trong Lớp Đầu Tiên

Lớp đầu tiên của bộ phân loại sử dụng các thuật toán học máy như Decision Tree và Random Forest để xử lý dữ liệu nhanh chóng. Điều này giúp phát hiện các cuộc tấn công trong thời gian thực với độ chính xác cao.

3.2. Áp Dụng Mô Hình Transformer Trong Lớp Thứ Hai

Mô hình Transformer được áp dụng trong lớp thứ hai để cải thiện độ chính xác của hệ thống. Mô hình này có khả năng phân tích các đặc trưng phức tạp và giúp phát hiện các cuộc tấn công chưa xác định.

IV. Ứng Dụng Thực Tiễn Của Bộ Phân Loại Hai Lớp Trong IDS

Bộ phân loại hai lớp được phát triển trong nghiên cứu này đã được thử nghiệm trên tập dữ liệu CICIDS2017. Kết quả cho thấy mô hình có khả năng phát hiện các cuộc tấn công với độ chính xác cao và thời gian phản hồi nhanh. Điều này chứng tỏ tính khả thi và hiệu quả của phương pháp mới.

4.1. Kết Quả Thử Nghiệm Trên Tập Dữ Liệu CICIDS2017

Kết quả thử nghiệm cho thấy bộ phân loại hai lớp đạt được độ chính xác cao trong việc phát hiện các cuộc tấn công. Mô hình đã chứng minh khả năng xử lý dữ liệu lớn và phát hiện kịp thời các mối đe dọa.

4.2. Tính Khả Thi Của Mô Hình Trong Thực Tế

Mô hình phân loại hai lớp có thể được áp dụng trong các hệ thống IDS thực tế, giúp nâng cao hiệu quả bảo mật cho các tổ chức và doanh nghiệp. Điều này mở ra hướng đi mới cho việc phát triển các giải pháp an ninh mạng.

V. Kết Luận Và Hướng Phát Triển Tương Lai Của Nghiên Cứu

Nghiên cứu đã phát triển thành công bộ phân loại hai lớp dựa trên học máy cho hệ thống phát hiện xâm nhập. Kết quả cho thấy mô hình có khả năng cải thiện đáng kể hiệu suất và độ chính xác. Hướng phát triển tương lai có thể bao gồm việc áp dụng các kỹ thuật học sâu và mở rộng mô hình cho các loại hình tấn công khác.

5.1. Tóm Tắt Kết Quả Nghiên Cứu

Bộ phân loại hai lớp đã chứng minh được hiệu quả trong việc phát hiện xâm nhập. Mô hình không chỉ cải thiện độ chính xác mà còn tối ưu hóa thời gian xử lý dữ liệu.

5.2. Hướng Phát Triển Mới Trong Tương Lai

Nghiên cứu có thể mở rộng để áp dụng các kỹ thuật học sâu và các mô hình tiên tiến khác nhằm nâng cao khả năng phát hiện và xử lý các cuộc tấn công phức tạp hơn trong tương lai.

10/07/2025
Khóa luận tốt nghiệp an toàn thông tin phát triển bộ phân loại hai lớp dựa trên học máy cho hệ thống phát hiện xâm nhập

Trích đoạn nội dung tài liệu

Chương 1 TONG QUAN DE TÀI Trinh bày ly do chọn đề tài, mục tiêu, đối tượng, phạm vi và các phương pháp nghiên cứu dé tài Chương 2 KIÊN THỨC NEN TANG VÀ NGHIÊN CỨU LIÊN QUAN Trình bày các định nghĩa, khái niệm cũng như những kiến thức nền tảng để có thể thực hiện được nghiên cứu. Ngoài ra, cũng phân tích tình hình nghiên cứu đã có trong và ngoải nước Chương 3 PHƯƠNG PHÁP ĐÈ XUẤT Là phần trọng tâm của khoá luận, trình bày những nội dung chính về phương pháp thực hiện và mô hình được sử dụng. Chương 4 HiỆn thực — thực nghiệm và đánh giá Đề cập đến quá trình thực nghiệm cùng với kết quả thu được Chương 5 KET LUẬN VA HƯỚNG PHÁT TRIEN Đưa ra kết luận về đề tài, thuận lợi và khó khăn khi thực hiện đề tài đề xuất một số hướng phát triển mở rộng cho các nghiên cứu trong tương lai. KIÊN THỨC NEN TANG VÀ NGHIÊN CỨU LIÊN QUAN 2.

Hệ thống phát hiện xâm nhập IDS 2. Tổng quan Mục đích của quá trình phát hiện xâm nhập là kiểm toán và phân tích các sự kiện bảo mật đề có thé xác định kịp thời các hoạt động độc hại. Thuật ngữ “IDS” được lần đầu giới thiệu năm 1980, có thể được coi là phần cứng và/hoặc phần mềm tự động hóa các quy trình theo dõi, kiểm tra, phân tích và xác định các mối đe dọa tiềm an. Nói chung, một IDS sẽ tập trung vào các công việc chính như sau: 1) Theo dõi cả người dùng và hệ thống dé xác định các sự cố 2) Ghi lại tat cả thông tin nhật ký về chúng 3) Phan tích, rà soát cầu hình hệ thống và các lỗ hông 4) Đánh giá tính toàn vẹn của hệ thống cũng như các tập tin 5) Nhận biết được các hoạt động bat thường va các dấu hiệu điển hình của các cuộc tan công 6) Gửi báo cáo đến quản trị viên hệ thông Ngoài ra, IDS còn có một số chức năng khác tùy thuộc vào mục đích của người sử dụng.

Ví dụ như các doanh nghiệp có thé dùng IDS dé phát hiện các van dé trong chính sách bao mật, b6 sung cập nhật các mối nguy hại hay xác định cá nhân vi phạm chính sách Hình 2-1 dưới đây minh họa kiến trúc cơ bản của một IDS, trong đó có 3 mô-đun chính a) một hoặc nhiều agent/sensor b) bộ phận phân tích c) bộ phận phản hồi. Các agent/sensor sẽ chịu trách nhiệm thu thập thông tin, thường là ghi lại nhật ký các sự kiện, lưu lượng mạng có ích cho việc phân tích. Sau đó các thông tin này sẽ được chuyền đến bộ phận phân tích. Đặc biệt, dựa vào vi trí đặt các agent/sensor (hay còn gọi tùy theo nguồn đữ liệu) mà ta có thé chia IDS thành 2 loại cơ bản như sau: Intrusion Detection Techniques Signatures Anomalies Specifications Response LÌ l8 Computer Tablet Smartphone Hình 2-1: Kiến trúc cơ bản của IDS a) Hệ thống phát hiện xâm nhập dựa trên mạng (Network-based IDS) Là một thiết bị phần cứng độc lập có đầy đủ khả năng phát hiện xâm nhập.

Thường được đặt tại các điểm chiến lược trên cơ sở hạ tầng mạng như biên giữa các mạng, máy chủ mạng riêng ảo (VPN), máy chủ truy cập từ xa và trên mạng không dây. NIDS sẽ tập trung giám sát toàn bộ lưu lượng mạng di qua các mang con, sau đó phân tích dit liệu thu thập được dé phát hiện các cuộc tan công đã biết hoặc các hoạt động độc hại, hoặc phân tích các hoạt động của giao thức mạng và ứng dụng dé xác định hoạt động bat thường và đáng ngờ, từ đó cảnh báo sẽ được gửi đến người quản trị b) Hệ thống phát hiện xâm nhập dựa trên máy chủ (Host-based IDS) Thường được đặt trên các thiết bị hoặc máy chủ đơn lẻ quan trọng có trên mạng. Các thông tin được ghi lại là các dữ liệu liên quan đến hệ thống của riêng máy chủ đó, ví dụ như tiến trình hệ điều hành, lời gọi hệ thống. HIDS sẽ được giám sát các lưu lượng đến, đi từ máy chủ đó và sẽ cảnh báo nếu có bất kỳ sự kiện nào được ghi lại được cho là bất thường hoặc độc hại.

Tiếp theo, bộ phận phân tích có chức năng phân tích dữ liệu thu thập được từ các agent/sensor và dựa vào các kỹ thuật phát hiện xâm nhập dé xác định cuộc tấn công. Cuối cùng, bộ phận phản hồi sẽ báo cho người quản trị hệ thống thông qua các cảnh báo và cung cấp thêm thông tin từ kết quả thu được bởi bộ phận phân tích. Ngoài ra, bộ phân phản hồi còn có thê thực hiện một số hành động nhất định đề tự động giảm thiểu sự xâm nhập, trong trường hợp này gọi là hệ thống ngăn ngừa xâm nhập IPS Cần nói thêm liên quan các phương pháp của bộ phận phân tích dé phát hiện các mối nguy hại hay bat thường. Ta cũng có thé chia IDS thành 3 loại chính dựa trên kỹ thuật phát hiện xâm nhập như sau: a) Hệ thống phát hiện xâm nhập dựa trên chữ ký (Signature-based IDS) Với phương pháp tiếp cận này, các hoạt động trong hệ thống hay người dùng sẽ được so khớp với tập hợp các mẫu tân công đã được xác định từ trước, hay còn gọi là chữ ký.

Ưu điểm của cách tiếp cận này là thời gian phát hiện nhanh, tỷ lệ phát hiện cao cũng như tỷ lệ cảnh báo sai (FAR) thấp với các cuộc tấn công đã biết. Vì vậy, điểm yếu của nó là đối mặt với các cuộc tấn công mới hay biến thể ngày càng nhiều và phức tạp như hiện nay. Ngoài ra, chi phí dé duy trì một cơ sở dữ liệu chữ ký không lồ cùng với khả năng đồng bộ trong hệ thống khiến cách tiếp cận này khó trở thành giải pháp lâu dài b) Hệ thống phát hiện xâm nhập dựa trên bat thường (Anomaly-based IDS) Với cách tiếp cận này, dữ liệu được cho là từ các hành vi bình thường của người dùng sẽ được thiết lập. Khi tiến hành kiểm tra xâm nhập, tập dữ liệu này sẽ được so sánh với dit liệu thực tế của người dùng.

Ở đây, giá trị ngưỡng sẽ quyết định hành vi của người dùng có phải là bất thường hay không. Hiện nay, học máy được sử dụng để tạo ra một mô hình đáng tin cậy, theo đó bất kỳ hoạt động nào không nằm trong mô hình sẽ được coi là đáng ngờ. Vì mô hình được huấn luyện phù hợp với yêu cầu ứng dụng và cau hình phan cứng nên mang tinh chat tong quát hóa tốt hơn so với IDS dựa trên chữ ký. Tuy tỷ lệ phát hiện xâm nhập kém chính xác hơn so với cách tiếp cận theo chữ ký nhưng có khả năng phát hiện được các cuộc tan công mới, chưa xác định từ trước, c) Hệ thống phát hiện xâm nhập dựa trên thông số kỹ thuật (Specification-based IDS) Theo kỹ thuật phát hiện xâm nhập này, một tập hợp các quy tắc theo sự rang buộc sẽ định nghĩa các hành vi bình thường của hệ thống.

Nếu có hành vi khác với các thông số kỹ thuật được xác định trước sẽ được coi là bat thường và sinh ra cảnh báo. Tuy có thé phát hiện các cuộc tấn công mới với tỷ lệ đương tinh giả thấp nhưng khó có thể triển khai thành một mô hình chính xác hoàn toàn do sự phức tạp cũng như tài nguyên tiêu tốn khá lớn 2. Hệ thống phát hiện xâm nhập dựa trên hoc máy (AI-based IDS) Các hệ thống an ninh mạng hỗ trợ ngăn chặn tấn công theo thời gian thực chủ yếu sử dụng các phương pháp dựa trên chữ ký để phát hiện các mẫu nhất định trong lưu lượng mạng. Phát hiện theo thời gian thực yêu cầu các thuật toán xử lý nằm trong nội tuyến dé phát hiện các cuộc tan công ở tốc độ đường truyền.

Mặc dù tốc độ phát hiện có thé cải thiện khi sử dụng các hệ thông phân tán, nhưng cũng phải chịu chi phí đồng bộ tốn kém. Vì vậy, cần phải có phương pháp phát hiện nhanh chóng là điều tất yếu dé triển khai các hệ thống phát hiện theo thời gian thực. Điểm mạnh của cách tiếp cận phát hiện dựa trên chữ ký là độ chính xác và tốc độ cao với các cuộc tân công đã biết. Tuy nhiên, hầu như phương pháp này không thé xác định được các cuộc tan công chưa rõ như tan công Zero-day và các biến thé có thé bỏ qua cách phát hiện này thông qua việc làm rỗi mã hay mã hóa.

Ngoài ra, việc tạo cơ sở dir liệu dé lưu các chữ ký với cách tiếp cận này cũng là vấn đề mang tính gánh nặng cao. Trái ngược với phát hiện dựa trên chữ ký, các tiếp cận phát hiện dựa trên sự bất thường sẽ quan sát các đặc điểm thống kê theo từng luồng dữ liệu trong mạng và tiến hành chân đoán phát hiện nếu có sự bất thường vượt quá phạm vi thống kê thông thường. Phương pháp này sẽ không dem lại gánh nặng về chi phí để duy trì cơ sở dữ liệu giống như phát hiện dựa trên chữ ký, ngoài ra còn hoạt động mạnh mẽ dé phát hiện các cuộc tân công Zero-day hay các tân công biên thê. Trong các giải pháp phòng thủ mạng, hệ thống phát hiện xâm nhập IDS đã trở thành một lớp phòng thủ quan trọng và ngày càng được nâng tầm quan trọng trong cơ sở hạ tầng bảo mật.

Cốt lõi của hệ thống phát hiện xâm nhập đó là phát hiện các hành vi xâm nhập và phân loại tấn công dựa trên nhiều ngữ cảnh khác nhau. Đặc biệt, với sự giúp sức của công nghệ trí tuệ nhân tạo(A]), bao gồm học máy (ML) và học sâu (DL), hệ thống phát hiện xâm nhập dựa trên AI (AI-based IDSs) đã và dang dem lại sự nhanh chóng, chính xác cũng như khả năng mở rộng khi phân tích tấn công so với các kỹ thuật bảo mật thông thường khác. Ưu điểm của AI-based IDS so với các loại hình IDS truyền thống Một trong những ưu điểm nồi bật của AI-based IDS là khả năng thích ứng. Trong khi các IDS truyền thống dựa vào tập hợp các chữ ký hay quy tắc cố định dé phát hiện được các mối de dọa đã biết thì AI-based IDS có thé liên tục học hỏi, điều chỉnh ban thân.

Theo thời gian, AI-based có thé thích nghỉ với các bất thường, các biến thé tan công, xâm nhập mới, tạo cho chúng một sức mạnh phòng thủ mạnh mẽ và chủ động hơn Một ưu điểm khác của AI-based IDS đó là kha năng nhận biết các mẫu tan công hay hành vi bất thường trong một lượng lớn dữ liệu mạng.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu này không có tiêu đề cụ thể, nhưng nó có thể liên quan đến các nghiên cứu và phát triển trong lĩnh vực an toàn thông tin, đặc biệt là về các hệ thống phát hiện xâm nhập. Những nghiên cứu này cung cấp cái nhìn sâu sắc về các phương pháp hiện đại như học máy và học liên kết, giúp cải thiện khả năng phát hiện và ngăn chặn các cuộc tấn công mạng.

Để mở rộng kiến thức của bạn về chủ đề này, bạn có thể tham khảo các tài liệu sau: Khóa luận tốt nghiệp an toàn thông tin nghiên cứu trình phát hiện xâm nhập dựa trên few shot learning, nơi bạn sẽ tìm hiểu về cách tiếp cận học máy để phát hiện xâm nhập hiệu quả hơn. Ngoài ra, tài liệu Khóa luận tốt nghiệp an toàn thông tin mô hình cộng tác phát hiện xâm nhập dựa trên học liên kết bán giám sát và cơ chế tăng cường dữ liệu sẽ giúp bạn hiểu rõ hơn về các mô hình cộng tác trong phát hiện xâm nhập. Cuối cùng, bạn cũng có thể tìm hiểu về Khóa luận tốt nghiệp an toàn thông tin nghiên cứu khả năng kháng mẫu đối kháng của các trình phát hiện xâm nhập dựa trên học máy, tài liệu này sẽ cung cấp thông tin về khả năng chống lại các cuộc tấn công tinh vi hơn.

Mỗi tài liệu đều là cơ hội để bạn khám phá sâu hơn về các phương pháp và công nghệ trong lĩnh vực an toàn thông tin, từ đó nâng cao kiến thức và kỹ năng của mình.