Phát Triển Hệ Thống Phát Hiện Xâm Nhập Giải Thích Bằng Machine Learning

Luận văn tốt nghiệp y tế nghiên cứu tốt nghiệp an toàn thông tin phát triển hệ thống phát hiện xâm nhập có khả năng lý giải sử dụng máy, điều tra thực trạng, phân tích số liệu, đề

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2023

92
3
0

Phí lưu trữ

35 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: ĐẶT VẤN ĐỀ

1.1. Mục tiêu của đề tài

1.2. Đối tượng và phạm vi nghiên cứu

2. CHƯƠNG 2: CƠ SỞ LÝ THUYẾT

2.1. Giới thiệu hệ thống phát hiện xâm nhập

2.2. Các dạng hệ thống phát hiện xâm nhập

2.3. Áp dụng trí tuệ nhân tạo vào hệ thống phát hiện xâm nhập

3. CHƯƠNG 3: NGHIÊN CỨU THỰC NGHIỆM HOẶC LÍ THUYẾT

3.1. Mô hình tổng quan

3.2. Phương pháp thực hiện

3.3. Lựa chọn thuật toán

3.4. Sử dụng phương pháp giải thích SHAP

3.5. Học máy đối kháng

4. CHƯƠNG 4: TRÌNH BÀY, ĐÁNH GIÁ BÀN LUẬN VỀ KẾT QUẢ

4.1. Tạo bộ dữ liệu DDOS dựa trên các bộ dữ liệu công khai

4.2. Mô hình có khả năng giải thích

4.3. Cách thực hiện trên mô hình

4.4. Áp dụng phương pháp giải thích

4.5. Đánh giá sự bền vững của mô hình

4.6. Tấn công Evasion Attack

4.7. Áp dụng SHAP phát hiện cuộc tấn công

5. CHƯƠNG 5: TỔNG KẾT VÀ HƯỚNG PHÁT TRIỂN

5.1. Kết quả đạt được

5.2. Hướng phát triển

DANH MỤC HÌNH ẢNH

DANH MỤC BẢNG

DANH MỤC TỪ VIẾT TẮT

Tóm tắt

I. Tổng quan về phát triển hệ thống phát hiện xâm nhập bằng Machine Learning

Hệ thống phát hiện xâm nhập (IDS) là một phần quan trọng trong an ninh mạng, giúp phát hiện và ngăn chặn các cuộc tấn công. Việc áp dụng machine learning vào IDS đã mở ra nhiều cơ hội mới trong việc cải thiện khả năng phát hiện và phân tích các mối đe dọa. Tuy nhiên, tính minh bạch và khả năng giải thích của các mô hình này vẫn là một thách thức lớn. Bài viết này sẽ khám phá các khía cạnh quan trọng trong việc phát triển hệ thống IDS có khả năng giải thích.

1.1. Hệ thống phát hiện xâm nhập là gì

Hệ thống phát hiện xâm nhập (IDS) là một công cụ giám sát lưu lượng mạng nhằm phát hiện các hành vi xâm nhập trái phép. IDS có thể phân loại thành nhiều loại khác nhau như NIDS và HIDS, mỗi loại có cách thức hoạt động riêng biệt.

1.2. Tại sao cần phát triển IDS giải thích

Việc phát triển IDS có khả năng giải thích giúp người quản trị hiểu rõ hơn về các quyết định của hệ thống. Điều này không chỉ tăng cường độ tin cậy mà còn giúp cải thiện quy trình phản ứng với các mối đe dọa.

II. Những thách thức trong phát triển hệ thống phát hiện xâm nhập

Mặc dù machine learning mang lại nhiều lợi ích cho IDS, nhưng vẫn tồn tại nhiều thách thức. Các mô hình thường hoạt động như một 'black box', khiến cho việc hiểu rõ lý do đằng sau các quyết định trở nên khó khăn. Điều này có thể dẫn đến sự thiếu tin tưởng từ phía người dùng và quản trị viên.

2.1. Vấn đề về tính minh bạch

Tính minh bạch trong các mô hình machine learning là một vấn đề lớn. Nhiều mô hình phức tạp không thể giải thích được lý do đưa ra quyết định, điều này gây khó khăn cho việc phân tích và xử lý các cuộc tấn công.

2.2. Khó khăn trong việc cập nhật dữ liệu

Các cuộc tấn công mạng liên tục thay đổi, do đó, việc cập nhật dữ liệu và mô hình để phát hiện các mối đe dọa mới là một thách thức lớn. Điều này đòi hỏi các nhà nghiên cứu phải liên tục cải tiến và điều chỉnh hệ thống.

III. Phương pháp phát triển hệ thống IDS giải thích hiệu quả

Để phát triển một hệ thống IDS có khả năng giải thích, cần áp dụng các phương pháp như SHAP và LIME. Những phương pháp này giúp làm rõ lý do đằng sau các quyết định của mô hình, từ đó tăng cường độ tin cậy và khả năng phản ứng của hệ thống.

3.1. Sử dụng SHAP để giải thích mô hình

SHAP (SHapley Additive exPlanations) là một phương pháp mạnh mẽ giúp giải thích các quyết định của mô hình machine learning. Nó cung cấp thông tin về mức độ ảnh hưởng của từng tính năng đến quyết định cuối cùng.

3.2. LIME và khả năng giải thích cục bộ

LIME (Local Interpretable Model-agnostic Explanations) cho phép giải thích các dự đoán của mô hình trên từng trường hợp cụ thể. Phương pháp này giúp người dùng hiểu rõ hơn về lý do đằng sau các quyết định của mô hình.

IV. Ứng dụng thực tiễn của hệ thống phát hiện xâm nhập

Hệ thống IDS có khả năng giải thích đã được áp dụng trong nhiều lĩnh vực khác nhau, từ ngân hàng đến y tế. Việc sử dụng machine learning trong IDS không chỉ giúp phát hiện các cuộc tấn công mà còn cải thiện quy trình ra quyết định của người quản trị.

4.1. Ứng dụng trong lĩnh vực ngân hàng

Trong lĩnh vực ngân hàng, IDS giúp phát hiện các hành vi gian lận và bảo vệ thông tin khách hàng. Việc giải thích các quyết định của mô hình giúp tăng cường độ tin cậy và bảo mật.

4.2. Ứng dụng trong lĩnh vực y tế

Hệ thống IDS cũng được áp dụng trong lĩnh vực y tế để bảo vệ thông tin bệnh nhân. Việc giải thích các quyết định giúp các chuyên gia y tế hiểu rõ hơn về các mối đe dọa và cách thức bảo vệ thông tin.

V. Kết luận và tương lai của hệ thống phát hiện xâm nhập

Hệ thống phát hiện xâm nhập có khả năng giải thích sẽ đóng vai trò quan trọng trong việc bảo vệ an ninh mạng trong tương lai. Việc áp dụng machine learning và các phương pháp giải thích sẽ giúp cải thiện khả năng phát hiện và phản ứng với các mối đe dọa mới.

5.1. Tương lai của IDS trong an ninh mạng

Với sự phát triển không ngừng của công nghệ, IDS sẽ ngày càng trở nên thông minh hơn. Việc tích hợp AI và các phương pháp giải thích sẽ giúp nâng cao hiệu quả và độ tin cậy của hệ thống.

5.2. Định hướng nghiên cứu tiếp theo

Nghiên cứu trong lĩnh vực IDS cần tiếp tục tập trung vào việc cải thiện tính minh bạch và khả năng giải thích của các mô hình. Điều này sẽ giúp tăng cường sự tin tưởng từ phía người dùng và quản trị viên.

10/07/2025
Khóa luận tốt nghiệp an toàn thông tin phát triển hệ thống phát hiện xâm nhập có khả năng lý giải sử dụng máy học

Trích đoạn nội dung tài liệu

ĐẠI HỌC QUOC GIA TP. HO CHÍ MINH TRUONG DAI HOC CONG NGHE THONG TIN KHOA MANG MAY TINH VA TRUYEN THONG NGUYEN THUY LINH — 19520147 KHOA LUAN TOT NGHIEP PHAT TRIEN HE THONG PHAT HIEN XAM NHAP CO KHA NANG LY GIAI SU DUNG MAY HOC DEVELOPING A EXPLAINABLE IDS USING MACHINE LEARNING KY SU AN TOAN THONG TIN GIANG VIEN HUONG DAN TH.S LE MINH KHANH HOI TP. HO CHÍ MINH, 2023 LỜI CẢM ƠN Em xin được bày tỏ lòng biết ơn sâu sắc đến quý thầy, cô và toàn thê những người công tác tại khoa Mang máy tinh và Truyền thông, cũng như tat cả quý thay, cô khác đang đảm nhận trách nhiệm giảng dạy tại trường Đại học Công nghệ Thông tin— ĐHQG HCM. Trong suốt quãng thời gian bốn năm qua, quý thầy, cô đã tận tâm truyền đạt những kiến thức, bài học và kinh nghiệm quý báu cho chúng em.

Đặc biệt, chúng em xm gửi lời cảm ơn chân thành nhất đến giảng viên, TS Lê Kim Hùng và ThS Lê Minh Khánh Hội. Quy thay, cô đã dành thời gian và công sức dé giúp em hiểu rõ hơn về lĩnh vực bảo mật. Nhờ những kiến thức mà quý thay, cô đã truyền đạt, em đã được khám phá cái nhìn sâu hơn và những góc nhìn mới trong lĩnh vực này. Những kiến thức này không chỉ giúp em hiéu rõ về tầm quan trọng và ý nghĩa của đề tài mà em đã chọn, mà còn giúp em phát triển tư duy phân tích và ứng dụng trong công việc và cuộc sóng.

Tiếp theo, em muốn bày tỏ lòng biết ơn sâu sắc đến gia đình, bạn bè và những người thân yêu đã luôn ủng hộ và động viên tôi trong suốt quá trình nghiên cứu. Sự đồng hành và động viên của mọi người đã truyền sức mạnh và động lực cho em vượt qua những khó khăn. Cuối cùng, em biết ơn sự hỗ trợ và sự gắn kết của các anh, chị và các bạn sinh viên tại trường Dai học Công nghệ Thông tin — ĐHQG HCM, vi đã tạo nên một môi trường học tập tích cực và sáng tạo. Nhờ có sự đồng đội tuyệt vời như các anh, chị và các bạn sinh viên khác, em đã có cơ hội trau dồi kỹ năng, thực hành và phát triển bản thân.

Một lần nữa, em xin trân trọng cảm ơn quý thầy, cô vì sự tận tâm và sự cống hiến không ngừng nghỉ của mình trong việc giảng dạy và hướng dẫn chúng em. Chúc quý thầy, cô luôn khỏe mạnh, hạnh phúc và thành công trong sứ mệnh cao quý này. cv HH re 2 1. Mục tiêu của đề tài.

Đối tượng và phạm vi nghiên cứu.-----2- 2+ z+£x£+Exe£Ezerxerrxerrerrxee 3 LAL. Đối tượng nghiên cứu. Phạm vi nghiên CỨU.-- Ă S< + E383 ESESEESekEeeeereerreerre 3 Chương2. CO SỞ LÝ THUYÊT.

Giới thiệu hệ thống phát hiện xâm nhập. Các dạng hệ thống phát hiện xâm nhập. Áp dụng trí tuệ nhân tạo vào hệ thông phát hiện xâm nhập.c-SĂ G1111 HH HH HH HH HH rry 6 2. Giới thiệu chung.

__ Hệ thống phát hiện xâm nhập sử dụng Explainable AI. _ Phương pháp sử dụng Explainable AI. --- ----cc++<-<ex+exxxs 8 2. Các kỹ thuật Machine Learning phân tích.

Decision Tree MOdelL. Random Forest MOdelL. Tổng quan các cuộc tấn công DDOS. SGK ng HH ri 23 2.

ung TH gu H nhgưn 25 2. Tan công tang Application.- sgk 32 Chương 3. NGHIÊN CỨU THUC NGHIỆM HOẶC LÍ THUYÉT. Mô hình tổng quan.- 2-2 + ©£+E£+EE+EEE+EE+EEEEEEEEEEEEEEEEECEEErrkrrrkerrkree 4I 3.

Phương pháp thực hiỆn. Lưựa chọn thuật toán. _ Sử dụng phương pháp giải thích SHAP. Học máy đối kháng.----¿- 2£ 22+SE£2EE£EEESEE2EEE2112712211712271 21121.

xe 52 Chương4. TRÌNH BAY, ĐÁNH GIA BAN LUẬN VE KET QUẢ. Tạo bộ dữ liệu DDOS dựa trên các bộ dữ liệu công khaI. Mô hình có khả năng giải thích.

Cách thực hiện trên mô hình. Ap dụng phương pháp giải thích. Đánh giá sự bền vững của mô hình. Tấn công Evasion Attack.

Áp dụng SHAP phát hiện cuộc tấn công.--------2csz©cs+=+2 76 Chương 5. TONG KET VA HƯỚNG PHAT TRIẺN. Kết quả đạt được. Hướng phat triỀn.------©2<+2+++2Ekt2EEEE1EE21122711211271.

80 DANH MỤC HÌNH ANH Hình 2.1 Mô hình giải thích cây quyết định dự đoán hình thê người dưới 30.2 Giải thích dự đoán hình anh chó, loại nhạc cụ sử dụng LIME.3 Decision Tree MO(eÌ.- --- 5 + + 312111 119119119111 1H HH nh HH gà 17 Hình 2.4 Ví dụ Decision Tree model. -- ---- << 5+2 %3 3223 *£2EE£2 EE+eEEseeeseseeese 18 Hình 2.5 Random Forest MOdeÌ.- --- 5 <6 +21 311 511911931911 1 E1 11g ng gà, 20 Hình 2.6 Ví dụ Random Forest model.-- - -- ¿+ ++ +23 ++<E‡+*£E++eE+eeexeeeexesex 21 Hình 2.7 Tan công DDOS Flood Attack .8 Amplification DDOS attack oo. ieee eseeeenecneeseeeceecseeseeasesseeseeaeaseeens 24 Hình 2.9 Reflection DDOS attack.10 SYN flood DDOS atfacK. - 5S 1k9 TH HH HH HH, 26 Hình 2.11 Peer-to-peer DDOS atfaCs.---- 5 nàn HH HH ng nrêp 27 Hình 2.12 Nuke DDOS AtfaCK.- Ăn HH HH HH HH HH ng Hệ 27 Hình 2.13 Slowloris DDOS affaCK.

1191 9k9 9T HH HH gưkt 28 Hình 2.14 HTTP flood atfaCK.- 2ó 55 c1 11211211151 91 9319111 1 1kg nh HH gikt 29 Hình 2.15 Multi-Vector DDOS AtfaCEKS. HH» HH HH HH Hit 30 Hình 2. -s- c1 121 11v TH HH TH TH Hà TH Tnhh nrệp 30 Hình 2.17 Cài đặt trực tiếp cicflowmeter bang lệnh pip.18 Download file cIcfÏOWIm€I€T. --- 5 55 5+ +sE+eEeerskesersrrkrrke 33 Hình 2.19 Giải nén thư mục CICflowjMeter.20 Vào thư mục CICFlowMe(€T.1 Mô hình thực hiỆn.-- - + + 39193 9191 91 11 E111 81911 vn rkp 4I Hình 3.2 Biểu đồ biéu diễn các tinh năng quan trọng khi ghi bàn thắng.3 Biểu đồ giải thích phân bó của các tính năng.4 Công cụ Adversarial Robustness 'ToolOX.1 Giải thích tổng quan cho mô hình Decision Tree.2 Giải thích tong quan Normal.3 Giải thích tổng quan DDOS attack-HOIC.4 Giải thích tong quan DDOS attacks-LOIC-HTTP.5 Giải thích tổng quan DDOS attack-LOIC-UDP.6 Giải thích tổng quan DDOS.--2- 2: ©2S£22E22EEECEEEC2EESEEeerkeerrkerree 67 Hình 4.7 Giải thích cục bộ cho NormalÌ.8 Giải thích cục bộ DDOS attack-HOIC.9 Giải thích cục bộ cho DDOS attacks-LOIC-HTTP .10 Giải thích cục bộ cho DDOS attack-LOIC-UDP.11 Giải thích cục bộ cho DDOS attack .12 Giải thích tổng quan về các quyết định của mô hình Random Forest.13 Giải thích tong quan về Normal.

2-2 52+ £2E£+£+££EE+EE£2£+zzzsrsz 70 Hình 4.14 Giải thích tông quan DDOS.-2- 22-2-5252 S££+EEE£EEEEEvEEErrkerrerree 71 Hình 4.15 Giải thích tong quan DDOS attack-HOIC.---¿- 2 5s2©sz2cs2 71 Hình 4.16 Giải thích tổng quan DDOS attacks-LOIC-HTTP.17 Giải thích tông quan DDOS attack-LOIC-UDE.18 Giải thích cục bộ Normal.-- c5 << 22* 11 33*+££#EEE++zeeeeeezeeeeeezs 73 Hình 4.19 Giải thích cục bộ DDOS attack .-- --- 5 scs+sEsersrsererrske 73 Hình 4.20 Giải thích cục bộ DDOS attack-HO]IC.21 Giải thích cục bộ DDOS attacks-LOIC-HTTÌP.22 Giải thích cục bộ DDOS attack-LOIC-UDP.23 Độ chính xác khi bị tấn công AttackEvasion.24 Giải thích tong quan cuộc tan công Decision Tree.25 Giải thích tổng quan cuộc tan công Random FOrest.26 Giải thích tong quan cuộc tan công trên phân loại DDOS. 78 DANH MỤC BANG Bảng 2.1 Bảng các tinh năng CICFlowmeter thống kê và tính toán.1 Các tính năng được tính toán và thống kê.1 Bộ dữ liệu CIC-IDS-2017 và CSE-IDS-2018. --- cc«cs+<+<cseres 57 Bảng 4.2 Tính năng bộ dữ liệu tông hợp tan công DDOS từ 2 bộ dữ liệu.3 Số lượng bản ghi của bộ dit liệu tong hợp tan công DDOS.4 Đánh giá hiệu suất mô hình Decision 'Tree.----¿-¿©csz+csz+c5se¿ 63 Bảng 4.5 Đánh giá hiệu suất mô hình Random FOresi.----2--2 2222 63 DANH MỤC TU VIET TAT TU NOI DUNG DIEN GIAI DDOS Distributed Service Denial Of Tan công từ chối : dich : vu phân : tán TCP Transmission Control Protocol Giao thức điều khiến truyền nhân UDP User Datagram Protocol Giao thức dữ liệu người dùng HTTP | HyperText Transfer Protocol Giao thức truyén tai siêu văn ban HTTPS HyperText Transfer Protocol Giao thức HTTP có su dụng mã hóa Secure AI Artificial Intelligence Tri tué nhan tao IP Internet Protocol Giao thức Internet IDS Intrusion Detection System Hệ thống phát hiện xâm nhập ML Machine learning Học máy DL Deep learning Học sâu TOM TAT KHÓA LUẬN Việc áp dụng trí tuệ nhân tạo trở nên quan trọng trong hệ thống phát hiện xâm nhập, tính minh bạch và độ phức tạp của hệ thống cũng cần được quan tâm. Hệ thống kết hợp với việc áp dụng trí tuệ nhân tạo vẫn chỉ đưa ra những quyết định mà không đưa bat cứ bang chứng thông tin hay quy trình đưa ra các dự đoán vi vậy khiến con người khó có thê tin tưởng vào độ tin cậy của mô hình.

Trong khóa luận này, em sẽ đề xuất phương pháp giải thích cho các quyết định mà mô hình máy học đưa ra. Giúp cho người bình thường cũng có thé hiểu hoặc các nhà chuyên gia có thé giảm thời gian phân tích và dự đoán được các cuộc tan công mới. Từ đó giúp phát triển hệ thống phát hiện xâm nhập sử dụng máy học phải vừa có khả năng hoạt động hiệu quả, vừa có thê đưa ra các giải thích minh bạch cho các quyết định của mình. Bên cạnh đó mô hình máy học cây quyết định và rừng ngẫu nhiên được biết đến là những mô hình nhỏ, nhẹ và độ chính xác cao.

Em sẽ đánh giá sự bền vững của hai mô hình thông qua cuộc tan công dau độc và tan công qua mặt. Góp phần đánh giá lại độ bên của thuật toán trước các cuộc tân công máy học. Tên đề tài Tiếng Việt PHÁT TRIÊN HỆ THÓNG PHÁT HIỆN XÂM NHẬP CÓ KHẢ NANG LÝ GIẢI SỬ DUNG MAY HỌC. Tiếng Anh: Developing a explainable IDS using machine learning 1.

Đặt van đề Khối lượng lớn, đa dạng và tốc độ cao của dit liệu được tạo ra trong mạng đã làm cho quá trình phân tích dữ liệu bằng các kỹ thuật truyền thống trở nên rất khó khăn. Vi vậy hệ thống phát hiện xâm nhập IDS (The intrusion detection systems) dé thay thế cho các kỹ thuật truyền thống. Đề IDS trở nên tối ưu hơn, các nhà chuyên môn đã áp dụng thêm học máy (Machine Learning) và học sâu (Deep learning) dé học các thông tin dữ liệu từ dữ liệu lớn (Big Data) để đưa dự đoán. Tuy nhiên, tính minh bạch của hệ thống IDS là một van dé đáng quan tam.

Độ chính xác va sự dễ hiểu của model luôn tỉ lệ nghịch với nhau, Deep Learning IDS là các blackbox chỉ đưa ra kết quả, việc nâng cao chat lượng phát hiện các cuộc tan công va sự hiểu biết về các quyết định của IDS của người quan trị vẫn còn hạn chê. Bên cạnh đó các cuộc tấn công DDOS ngày càng gia tăng và do các luồng DDOS không có đặc điểm chung nên các hệ thống phát hiện xâm nhập (IDS) truyền thống phát hiện chúng chưa được chính xác. Nắm bắt vấn đề này, em thực hiện áp dụng phương pháp giải thích các quyết định của mô hình sử dụng SHAP, SHAP giúp đưa các tính năng quan trọng, và mức độ ảnh hưởng của từng tính năng đối với quyết định của mô hình. Với thực nghiệm, em thực hiện dé xuất mô hình máy học trên các tập dataset phô biến sau đó tiến hành tích hợp SHAP vào dé giải thích[ I].

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu "Phát Triển Hệ Thống Phát Hiện Xâm Nhập Giải Thích Bằng Machine Learning" cung cấp cái nhìn sâu sắc về việc ứng dụng công nghệ học máy trong việc phát hiện xâm nhập, một vấn đề ngày càng trở nên quan trọng trong lĩnh vực an toàn thông tin. Tài liệu này không chỉ giải thích các phương pháp và kỹ thuật mà còn nhấn mạnh lợi ích của việc sử dụng các mô hình học máy để cải thiện độ chính xác và khả năng giải thích của hệ thống phát hiện xâm nhập. Độc giả sẽ tìm thấy những thông tin hữu ích về cách mà machine learning có thể giúp phát hiện các mối đe dọa một cách hiệu quả hơn, từ đó nâng cao khả năng bảo vệ hệ thống thông tin.

Để mở rộng thêm kiến thức về chủ đề này, bạn có thể tham khảo tài liệu Khóa luận tốt nghiệp an toàn thông tin nghiên cứu khả năng kháng mẫu đối kháng của các trình phát hiện xâm nhập dựa trên học máy, nơi nghiên cứu khả năng chống lại các cuộc tấn công đối kháng. Ngoài ra, tài liệu Khóa luận tốt nghiệp an toàn thông tin phát triển bộ phân loại hai lớp dựa trên học máy cho hệ thống phát hiện xâm nhập cũng sẽ cung cấp thêm thông tin về việc phát triển các bộ phân loại hiệu quả cho hệ thống này. Những tài liệu này sẽ giúp bạn có cái nhìn toàn diện hơn về các ứng dụng của machine learning trong lĩnh vực an toàn thông tin.