Hệ Thống Phát Hiện Mã Độc Bền Vững Sử Dụng Học Liên Kết và Học Bán Giám Sát

Khóa luận trình bày mô hình cộng tác phát hiện mã độc bền vững, ứng dụng học liên kết và chiến lược học bán giám sát trong an toàn thông tin.

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2023

109
3
0

Phí lưu trữ

35 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: TỔNG QUAN ĐỀ TÀI

1.1. Giới thiệu vấn đề

1.2. Giới thiệu những nghiên cứu liên quan

1.3. Tính ứng dụng

1.4. Những thách thức

1.5. Mục tiêu, đối tượng, và phạm vi nghiên cứu

1.5.1. Mục tiêu nghiên cứu

1.5.2. Đối tượng nghiên cứu

1.5.3. Phạm vi nghiên cứu

1.6. Cấu trúc khóa luận tốt nghiệp

2. CHƯƠNG 2: CƠ SỞ LÝ THUYẾT

2.1. Giới thiệu chung về mã độc

2.2. Mô hình học máy

2.2.1. Tổng quan về mô hình học máy

2.2.2. Chiến lược học bán giám sát trong học máy

2.2.3. Mô hình Mạng nơron tích chập - CNN

2.2.4. Phương pháp chất lọc tri thức

2.3. Mô hình học liên kết

2.3.1. Tổng quan về mô hình học liên kết

2.3.2. Các thuật toán tổng hợp mô hình học liên kết

2.3.3. Dữ liệu phân phối không đồng nhất

2.3.4. Tấn công đầu độc mô hình học liên kết

2.3.5. Tổng quan về phương pháp phòng thủ FLARE

2.4. Các chỉ số đánh giá mô hình

2.4.1. Precision, Recall, F1-Score

2.4.2. Macro Average, Micro Average, Weighted Average

3. CHƯƠNG 3: MÔ HÌNH VÀ PHƯƠNG PHÁP THỰC HIỆN

3.1. Mô hình cộng tác phát hiện mã độc giữa học liên kết và chiến lược bán giám sát (SSFL)

3.2. Tấn công đầu độc mô hình SSFL

3.3. Ý tưởng về phương pháp phòng thủ chống lại tấn công lật nhãn

3.4. Chi tiết mô hình cộng tác phát hiện mã độc bền vững dựa trên SSFL (RobustSSFL)

4. CHƯƠNG 4: THÍ NGHIỆM VÀ ĐÁNH GIÁ

4.1. Thiết lập thí nghiệm

4.1.1. Môi trường thí nghiệm

4.1.2. Tiền xử lý dữ liệu

4.1.3. Mô hình học máy CNN

4.1.4. Các tham số liên quan và chỉ số đánh giá

4.2. Kết quả thí nghiệm

4.2.1. Hiệu năng của SSFL khi chưa bị tấn công

4.2.2. Tỉ lệ máy khách độc hại

4.2.3. Trường hợp phân bố dữ liệu 2 của tập dữ liệu NBaloT

4.2.4. Trường hợp tập dữ liệu khác - CICIDS2017

4.2.5. Trường hợp khi không có tấn công

5. CHƯƠNG 5: KẾT LUẬN

5.1. Kết luận

5.2. Hướng phát triển

PHỤ LỤC A: MA TRẬN CỦA CÁC TRƯỜNG HỢP THỰC NGHIỆM

A.1. Trường hợp phân phối dữ liệu 1 - NBaloT với tỷ lệ máy khách độc hại khác nhau

A.2. Trường hợp phân phối dữ liệu 2 - NBaloT

A.3. Trường hợp phân phối dữ liệu 3 - CICIDS2017

A.4. Trường hợp RobustSSFL khi không tấn công

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng quan về Hệ Thống Phát Hiện Mã Độc Bền Vững

Hệ thống phát hiện mã độc bền vững là một trong những giải pháp quan trọng trong việc bảo vệ an ninh mạng. Với sự phát triển của công nghệ, mã độc ngày càng trở nên tinh vi và khó phát hiện. Việc áp dụng các phương pháp học máy như học liên kết và học bán giám sát giúp cải thiện khả năng phát hiện mã độc. Hệ thống này không chỉ giúp phát hiện mà còn ngăn chặn các cuộc tấn công, bảo vệ thông tin và dữ liệu quan trọng.

1.1. Khái niệm về mã độc và tầm quan trọng của phát hiện

Mã độc là phần mềm độc hại có khả năng xâm nhập vào hệ thống máy tính, gây ra thiệt hại nghiêm trọng. Việc phát hiện mã độc kịp thời giúp ngăn chặn các cuộc tấn công và bảo vệ thông tin cá nhân.

1.2. Lợi ích của việc sử dụng học liên kết trong phát hiện mã độc

Học liên kết cho phép tổng hợp thông tin từ nhiều nguồn khác nhau mà không cần tập trung dữ liệu. Điều này giúp cải thiện khả năng phát hiện mã độc và bảo vệ quyền riêng tư của người dùng.

II. Những Thách Thức Trong Phát Hiện Mã Độc Bền Vững

Mặc dù có nhiều tiến bộ trong công nghệ phát hiện mã độc, nhưng vẫn tồn tại nhiều thách thức. Các cuộc tấn công ngày càng tinh vi, đặc biệt là tấn công lật nhãn, gây khó khăn cho việc duy trì độ chính xác của mô hình. Hệ thống cần phải đối mặt với dữ liệu không đồng nhất và sự tham gia của các máy khách độc hại.

2.1. Tấn công lật nhãn và ảnh hưởng đến mô hình

Tấn công lật nhãn là một trong những mối đe dọa lớn nhất đối với các mô hình học liên kết. Kẻ tấn công có thể dễ dàng thay đổi nhãn của dữ liệu, làm giảm độ chính xác của mô hình phát hiện.

2.2. Dữ liệu không đồng nhất và thách thức trong huấn luyện

Dữ liệu không đồng nhất gây khó khăn trong việc huấn luyện mô hình. Các máy khách có thể có dữ liệu khác nhau, ảnh hưởng đến khả năng tổng hợp và phát hiện mã độc.

III. Phương Pháp Học Liên Kết Trong Phát Hiện Mã Độc

Phương pháp học liên kết kết hợp với học bán giám sát đã được chứng minh là hiệu quả trong việc phát hiện mã độc. Mô hình này cho phép các máy khách trao đổi nhãn mà không cần chia sẻ dữ liệu, giúp bảo vệ quyền riêng tư và giảm chi phí truyền thông.

3.1. Cấu trúc mô hình học liên kết

Mô hình học liên kết cho phép các máy khách tham gia vào quá trình huấn luyện mà không cần gửi dữ liệu về máy chủ. Điều này giúp bảo vệ thông tin cá nhân và giảm thiểu rủi ro bảo mật.

3.2. Chiến lược học bán giám sát trong phát hiện mã độc

Chiến lược học bán giám sát giúp cải thiện hiệu suất của mô hình bằng cách sử dụng một lượng nhỏ dữ liệu có gắn nhãn. Điều này giúp tiết kiệm chi phí và thời gian trong quá trình huấn luyện.

IV. Ứng Dụng Thực Tiễn Của Hệ Thống Phát Hiện Mã Độc

Hệ thống phát hiện mã độc bền vững có thể được áp dụng trong nhiều lĩnh vực khác nhau, từ doanh nghiệp đến cá nhân. Việc phát hiện và ngăn chặn mã độc kịp thời giúp bảo vệ thông tin và tài sản của người dùng.

4.1. Ứng dụng trong doanh nghiệp

Doanh nghiệp có thể sử dụng hệ thống phát hiện mã độc để bảo vệ dữ liệu quan trọng và ngăn chặn các cuộc tấn công mạng. Điều này giúp duy trì hoạt động kinh doanh và bảo vệ uy tín.

4.2. Ứng dụng trong bảo mật thông tin cá nhân

Người dùng cá nhân cũng có thể áp dụng hệ thống này để bảo vệ thông tin cá nhân khỏi các cuộc tấn công mã độc. Việc phát hiện sớm giúp giảm thiểu rủi ro và thiệt hại.

V. Kết Luận và Tương Lai Của Hệ Thống Phát Hiện Mã Độc

Hệ thống phát hiện mã độc bền vững sử dụng học liên kết và học bán giám sát là một giải pháp hiệu quả trong việc bảo vệ an ninh mạng. Tương lai của hệ thống này hứa hẹn sẽ tiếp tục phát triển với nhiều cải tiến và ứng dụng mới.

5.1. Đánh giá hiệu quả của mô hình

Mô hình phát hiện mã độc bền vững đã cho thấy hiệu quả trong việc phát hiện và ngăn chặn mã độc. Các nghiên cứu tiếp theo cần tập trung vào việc cải thiện độ chính xác và khả năng chống lại các cuộc tấn công.

5.2. Hướng phát triển trong tương lai

Tương lai của hệ thống phát hiện mã độc sẽ tập trung vào việc phát triển các phương pháp mới, cải thiện khả năng phát hiện và bảo vệ thông tin cá nhân. Sự kết hợp giữa học máy và các công nghệ mới sẽ mở ra nhiều cơ hội.

10/07/2025
Khóa luận tốt nghiệp an toàn thông tin mô hình cộng tác phát hiện mã độc bền vững sử dụng học liên kết và chiến lược học bán giám sát

Trích đoạn nội dung tài liệu

CHƯƠNG 1: TONG QUAN DE TÀI 6 Trình bày khái quát về định hướng, phạm vi nghiên cứu của đề tài khóa luận hướng tới. CHƯƠNG 2: CƠ SỞ LÝ THUYẾT Trinh bày các định nghĩa, khái niệm cũng như những kiến thức nền tang liên quan CHUONG 3: MÔ HINH VÀ PHƯƠNG PHÁP THUC HIEN Phần trọng tâm - trình bày mô hình cộng tác phát hiện mã độc bền vững sử dụng học liên kết và chiến lược học bán giám sát đã nghiên cứu; Xác định các điểm tấn công và chiến lược tấn công lật nhãn của mô hình này; Đề xuất phương pháp phòng thủ cho loại tấn công này. CHƯƠNG 4: THÍ NGHIỆM VÀ DÁNH GIÁ Trinh bày quá trình hiện thực hóa phương pháp đề cập ở Chương 3. Sau đó đưa ra kết quả đánh giá và so sánh.

CHƯƠNG 5: KẾT LUẬN Kết luận về đề tài, đề xuất một số hướng phát triển mở rộng cho các nghiên cứu trong tương lai. CƠ SỞ LÝ THUYET Chương này trình bày cơ sở lý thuyết của nghiên cứu: Bao gồm mã độc, các chiến lược trong học máy, mô hình học liên kết và dữ liệu phan phối không đồng nhất. Giới thiệu chung về mã độc Mã độc hay phan mém độc hại là một thuật ngữ được sử dung để mô tả các ứng dụng hay mã độc hại có thể gây tổn hại lên hệ thống máy tính, làm phá vỡ khả năng hoạt động bình thường của các thiết bị, ảnh hưởng đến tính bí mật, tính toàn vẹn và tính sẵn sàng của dữ liệu người dùng, máy tính hoặc môi trường mạng. Nhìn chung, ta có thể phân loại mã độc thành một vài loại phổ biến sau: e Virus: là loại chương trình độc hại mà cần một tệp dữ liệu hay chương trình khác làm vật chủ để ký sinh, phải được kích hoạt bởi một sự kiện, hoạt động trên hệ thống máy tính để thực thi, và có khả năng nhân bản sau khi thực thi.

e Worm: là đoạn chương trình độc hại độc lập, có khả năng tự thân thực thi, tự nhãn ban, tự động 1é ; lan qua các khai thác lỗ hổng phần mềm hoặc chính sách an ninh được cấu hình ko cẩn thận e Trojan: các đoạn mã của Trojan được “che giấu” trong các phần mềm máy tính thông thường để bí mật xâm nhập vào máy nạn nhân. Khi tới thời điểm thuận lợi, chúng sẽ đánh cắp thông tin cá nhân và chiếm quyền điều khiển máy tính. Bản chất của Trojan là không tự lây lan mà biến hệ 8 thống máy tính bị nhiễm thành thành viên của mang botnet và thực hiện phát tán. e Botnet: là những máy tinh bị nhiễm virus va bị điều khiển thông qua Trojan, Virus,.Tin tặc lợi dụng sức mạnh của những máy tính bị nhiễm virus để thực hiện các hành vi phá hoại và ăn cắp thông tin.

Thiệt hại do Botnet gấy ra thường vô cùng lớn. Trước khi lây nhiễm, mã độc cần được tải xuống hoặc khi đã xâm nhập vào máy nạn nhân, chúng cần phải giao tiếp với máy chủ C&C để nhận lệnh, đặc biệt đối với các botnet thông qua mạng. Do đó, chúng ta có thể phát hiện và ngăn chặn kịp thời bằng các hệ thống tìm kiếm, phát hiện và ngăn chặn xâm nhập (IDPS). Và với sự phát triển của học máy /học sâu, chúng ta đã không phải quá phụ thuộc vào việc phải biết tường tận và phân tích sâu hành vi của mã độc để làm mẫu phát hiện (signature-based).

Hơn nữa, việc này chỉ phát hiện các tấn công đã biết. Việc kết hợp các thành tựu hiện đại trong trí tuệ nhân tạo đã thúc đẩy cho việc phát hiện các mối nguy chưa biết. Mô hình học máy 2. Tổng quan vé mô hành học máu Học mấy (tiếng Anh: Machine Learning - ML) là một mô hình thuật toán mô tả khả năng của các hệ thống học hỏi từ dit liệu đào tạo dành riêng, tự động xây dựng mô hình phân tích thực hiện các tác vụ dựa vào khuôn mẫu và suy luận mà không cần hướng dẫn cụ thể.

Học máy có mối liên hệ mật thiết tới thống kê, nó sử dung mô hình thống kê để "ghi nhớ" sự phân bố của bộ dữ liệu, tổng quát hóa những gì nhìn thấy ở dữ liệu đầu ra, kết hợp dữ liệu đầu vào, đào tạo và đưa ra dự đoán. Tiếp cận phương pháp kỹ thuật Học máy áp dụng vào mô hình mạng lưới loT được đánh giá cải thiện kha năng hoạt động, tăng tính linh hoạt các xử lý của thiết bị khi tối ưu hóa lưu lượng mạng, phân bổ nguồn tài nguyên 9 và tránh gây tắc nghẽn [16]. Mô hình Học máy được phát triển trên tập dữ liệu đào tạo được thu thập trực tiếp từ nhiều thiết bị riêng lẻ, có thể qua nhiều hoạt động xử lý, đưa về máy chủ tổng hợp và đào tạo ra mô hình Học máy chung. Trong Học máy, theo truyền thống, dựa trên vấn đề cần giải quyết, bộ dit liệu tồn tại, phân thành 2 dạng chiến lược chính bao gồm Học máy Giám sát và Không giám sát.

Trong chiến lược học máy giám sát, yêu cầu bộ dữ liệu để huấn luyện phải bao phủ được cả dữ liệu của đầu vào và đầu ra, có nghĩa thuật toán bắt buộc phải biết trước cặp dữ liệu (đầu vào, đầu ra), còn gọi là cặp (đữ liệu, nhãn), để dự đoán được đầu ra của dữ liệu mới. Dây cũng được xem là một nhược điểm của chiến lược đào tạo mô hình Học máy này. Phương pháp Học có giám sát được áp dụng phổ biến cho các bài toán Phân lớp (Classification) và bài toán Hồi quy (Regression). Minh họa cho mô hình sử dụng chiến lược Học có giám sát, ta có mô hình Support Vector Machine (SVM) thuộc bài toán Phân lớp.

Ý tưởng của mô hình SVM là siêu mặt phẳng phân chia có lề đạt lớn nhất trong không gian thuộc tính có ø chiều (Hinh 2. Dối với bài toán Hồi quy, mô hình Linear Regression hướng đến mục đích tìm ra đường thẳng phù hợp nhất mà ngay tai đó Hàm mat mát (Loss Function) đạt thấp nhất, có nghĩa mức độ chênh lệch giữa giá trị mô hình dự đoán và giá trị thực tế phải nhỏ, Hinh 2.1 - phải, thể hiện mô hình có đường thẳng thu nhỏ bình phương chênh lệch giữa giá trị quan sát được (thực tế) và giá trị dự đoán, đường thẳng đi qua trung bình của các đối tượng đặc điểm độc lập và phụ thuộc. Ở chiến lược học máy không giám sát, mô hình được đào tạo dựa trên dữ liệu không gan nhãn (unlabeled data), tức ta không biết được kết quả đầu ra mà chỉ có dit liệu đầu vào. Thuật toán này quét dữ liệu mới, cố gắng thiết lập kết nối có ý nghĩa giữa dữ liệu đầu vào và kết quả định sẵn, tìm ra một thông tin cấu trúc như các nhóm phần tử có chung thuộc tính (gọi là Phân cụm - Clustering) hoặc biểu diễn dit liệu theo hạng mục (Giảm số chiều - Dimension reduction) để lưu trữ và tính toán.

Ý tưởng của bài toán Phân cụm là chia dữ liệu thành các clusters (hoặc nhóm/cụm) bằng cách đặt các dữ liệu giống nhau nhiều vào 10 Hành 2.1: Lược dé biểu diễn điểm của mô hành SVM (bên trái) va mô hành Hồi quy tuyến tính (bên phải). chung cluster, sẽ có K số trung tam của nhóm có trong bộ dữ liệu, thường tinh toán khoảng cách để có thể gan dit liệu vào 1 nhóm, đưa đến mục đích chính là giảm tổng khoảng cách giữa các dữ liệu và trung tâm đại diện của cụm, tạo nên tập hợp các iểm ở gần nhau trong một không gian nào đó (Hinh 2.2: Lược dé biểu diễn phân cụm Bên cạnh hai hướng tiếp cận phổ biến trên, Học máy tăng cường thay vì cung cấp cặp dữ liệu (đầu vào, đầu ra) thì sẽ mô tả trạng thái hiện tại của mô hình và chỉ định ra một mục tiêu, mục đích của mô hình là cố gáng đạt được nhiều 11 điểm thưởng tối đa ở các bước mà thuật toán trải qua để đạt đến mục tiêu cuối cùng dưới sự ràng buộc hoàn cảnh cho kết quả đầu ra. Hiện tại, thuật toán Tăng cường chủ yếu được 4p dụng vào Lý Thuyết Trò Chơi, các thuật toán cần xác định nước đi tiếp theo để đạt được điểm số cao nhất. Chiến lược học ban giám sát trong học máy Học bán giám sát trong học máy cũng là một chiến lược dựa trên việc mở rộng của phương pháp học truyền thống là Có giám sát và Không giám sát khi mà dữ liệu dùng để huấn luyện mô hình bao gồm cả dit liệu có nhãn (labeled ata) và không nhãn (unlabeled data).

Day là một phương pháp dao tạo hiệu quả mang ngữ cảnh thực tế khi mà chỉ tồn tại số ít dữ liệu có nhãn và lượng lớn dữ liệu không gán nhãn. Phương pháp học bán giám sát có khả năng xây ung bộ phân loại tốt hơn để bù đắp cho việc thiếu dữ liệu có nhãn nếu như mô hình đã có đủ dữ liệu chưa có nhãn và dựa theo một số giả định nhất định về phân phối dit liệu [2]; đạt được hiệu suất tốt cho giải quyết bài toán phân loại. Fhực tế thì việc xây dựng mô hình huấn luyện tốt từ quá trình khai thác bộ dit liệu không gán nhãn có thể nói là không dễ dàng, do dữ liệu không gan nhãn chỉ có ích khi mà nó là thông tin di liệu mang tính hữu dụng cho việc dự đoán nhãn nếu như thông tin đó không tồn tại trong dữ liệu đào tạo có nhãn một cách đơn độc hoặc là thông tin đó không dễ dàng phân tích, trích xuất. Vì vậy, để ứng dụng chiến lược học bán giám sát vào ngữ cảnh thực tế, yêu cầu thuật toán phải có khả năng trích xuất thông tin.

Mô hành Mang noron tích chập - CNN Mô hình Mạng noron tích chập (tiếng Anh: Convolutional Neural Network - CNN) là một kiến trúc phân tích, trích xuất dữ liệu có chiều sâu và khái quát hóa đặc điểm dữ liệu dựa vào việc tập hợp các lớp Tích chập (Convolution) chồng lên nhau. Mạng tích chập có thể học các đặc điểm trừu tượng cao và có thể xác định các đối tượng một cách hiệu quả, áp dụng vào các lĩnh vực khác 12 nhau như phân loại hình ảnh, nhận diện đối tượng, nhận diện giọng nói, phương tiện hay phát hiện các lưu lượng mạng đáng ngờ,. Không giống như mô hình Mạng noron nhân tạo truyền thống (ANN), các noron trong bất kì lớp cụ thể nào của mô hình này sẽ chỉ kết nối với một vùng nhỏ của lớp trước nó.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu có tiêu đề Hệ Thống Phát Hiện Mã Độc Bền Vững Sử Dụng Học Liên Kết và Học Bán Giám Sát trình bày một phương pháp tiên tiến trong việc phát hiện mã độc thông qua việc áp dụng học liên kết và học bán giám sát. Các điểm chính của tài liệu bao gồm việc cải thiện độ chính xác trong việc nhận diện mã độc, giảm thiểu số lượng báo động giả và tối ưu hóa quy trình phát hiện. Đặc biệt, phương pháp này không chỉ giúp bảo vệ hệ thống mà còn nâng cao khả năng tự động hóa trong việc phát hiện và phản ứng với các mối đe dọa an ninh mạng.

Để mở rộng kiến thức của bạn về các ứng dụng của học máy trong lĩnh vực an toàn thông tin, bạn có thể tham khảo tài liệu Application of machine learning on automatic program repair of security vulnerabilities, nơi khám phá cách học máy có thể được áp dụng để sửa chữa tự động các lỗ hổng bảo mật. Ngoài ra, tài liệu Khóa luận tốt nghiệp an toàn thông tin phân tích động mã nguồn mở và ứng dụng học máy trong nhận biết mã độc trong mã nguồn mở sẽ cung cấp cái nhìn sâu sắc về việc phát hiện mã độc trong mã nguồn mở thông qua phân tích động và học máy. Cuối cùng, bạn cũng có thể tìm hiểu thêm về Nghiên cứu các phương pháp phát hiện tấn công web dựa trên học máy, tài liệu này sẽ giúp bạn hiểu rõ hơn về các phương pháp phát hiện tấn công trong môi trường web hiện đại. Những tài liệu này sẽ giúp bạn mở rộng kiến thức và hiểu biết về các xu hướng mới trong lĩnh vực an toàn thông tin.