Nghiên Cứu Mô Hình Tin Cậy và Bền Vững Trong Phát Hiện Mã Độc Đa Hình

Luận văn tốt nghiệp nghiên cứu tốt nghiệp an toàn thông tin nghiên cứu mô hình tin cậy và bền vững trong phát hiện mã độc đa hình, điều tra thực trạng, phân tích số liệu, đề xuất

Trường đại học

Đại học Công nghệ Thông tin

Chuyên ngành

An toàn thông tin

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2024

86
2
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: TỔNG QUAN ĐỀ TÀI

1.1. Lý do chọn đề tài

1.2. Phương pháp nghiên cứu

1.3. Mục tiêu nghiên cứu

1.4. Phạm vi và Đối tượng nghiên cứu

1.5. Cấu trúc Khóa luận tốt nghiệp

2. CHƯƠNG 2: CƠ SỞ LÝ THUYẾT

2.1. Tệp thực thi PE

2.1.1. Cấu trúc tệp thực thi

2.1.2. Trường tiêu đề DOS (DOS Header)

2.1.3. Trường DOS STUB

2.1.4. Trường tiêu đề PE (PE Header)

2.1.5. Phân đoạn bảng (Section Table)

2.2. Mô hình phát hiện mã độc

2.2.1. Phương pháp phân tích tĩnh

2.2.2. Phương pháp phân tích động

2.2.3. Kỹ thuật Giám sát hành vi

2.2.4. Kỹ thuật giả lập (Emulation)

2.2.5. Mô hình phát hiện mã độc dựa trên học máy

2.2.5.1. Thuật toán cây quyết định
2.2.5.2. Thuật toán rừng ngẫu nhiên
2.2.5.3. Thuật toán tăng cường độ dốc (Gradient Boosting)
2.2.5.4. Mạng nơron tích chập

2.2.6. Mô hình khả diễn giải - XAI

2.2.6.1. XAI với SHAP (SHapley Additive exPlanations)
2.2.6.2. Ứng dụng SHAP vào phát hiện mã độc dựa theo phương pháp phân tích
2.2.6.3. Deep Learning Important Features - DeepLIFT
2.2.6.4. Shapley Additive Global importance (SAGE)

2.2.7. Tình hình nghiên cứu và các công trình liên quan

3. CHƯƠNG 3: PHƯƠNG PHÁP THỰC HIỆN

3.1. Kiến trúc tổng quát

3.2. Luồng hoạt động chính

3.3. Lựa chọn đặc trưng hướng dẫn bởi XAI

3.4. Phát sinh mẫu đối kháng với XAI-GAN

3.5. Huấn luyện đối kháng

4. CHƯƠNG 4: THỰC NGHIỆM VÀ ĐÁNH GIÁ

4.1. Hiện thực

4.2. Thông tin chung về tập dữ liệu

4.3. Thuộc tính

4.4. Môi trường thực nghiệm

4.5. Xử lý dữ liệu

4.6. Các tiêu chí đánh giá

4.7. Thông tin về cấu hình của các mô hình được sử dụng

4.8. Độ tin cậy của những mẫu mã độc sau khi được thực hiện tạo mẫu đối kháng

4.8.1. Kịch bản 1a: Kiểm tra khả năng phát hiện mã độc đa hình của mô hình cơ sở

4.8.2. Kịch bản 1b: Kiểm tra khả năng chống lại mẫu đối kháng của mô hình cơ sở trước và sau khi thực hiện huấn luyện đối kháng

4.8.3. Kịch bản 2a: Kiểm tra khả năng phát hiện mã độc đa hình của mô hình đã được cập nhật thuộc tính

4.8.4. Kịch bản 2b: Kiểm tra khả năng chống lại mẫu đối kháng của mô hình đã cập nhật thuộc tính trước và sau khi thực hiện huấn luyện đối kháng

5. CHƯƠNG 5: KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

5.1. Kết luận

5.2. Hướng phát triển

Danh sách hình vẽ

Danh sách bảng

Danh mục từ viết tắt

Danh mục từ tạm dịch

Tóm tắt

I. Tổng Quan Về Mô Hình Tin Cậy Trong Phát Hiện Mã Độc Đa Hình

Mô hình tin cậy và bền vững trong phát hiện mã độc đa hình đang trở thành một chủ đề nóng trong lĩnh vực an ninh mạng. Sự gia tăng của các loại mã độc ngày càng tinh vi đã đặt ra thách thức lớn cho các hệ thống phát hiện hiện tại. Việc áp dụng các mô hình học máy khả diễn giải (XAI) và mạng sinh đối kháng (GAN) đã mở ra hướng đi mới trong việc phát hiện mã độc. Mục tiêu chính của nghiên cứu này là xây dựng một mô hình có khả năng phát hiện mã độc đa hình một cách hiệu quả và đáng tin cậy.

1.1. Lý Do Chọn Đề Tài Nghiên Cứu Mã Độc

Sự gia tăng nhanh chóng của mã độc đã thúc đẩy nhu cầu nghiên cứu về các phương pháp phát hiện hiệu quả. Các nghiên cứu trước đây cho thấy rằng việc áp dụng học máy có thể cải thiện đáng kể khả năng phát hiện mã độc. Tuy nhiên, các phương pháp này vẫn gặp khó khăn trong việc nhận diện mã độc nén và mã độc đối kháng.

1.2. Phạm Vi Nghiên Cứu Mô Hình Tin Cậy

Nghiên cứu tập trung vào việc phát triển mô hình phát hiện mã độc đa hình bằng cách kết hợp XAI và GAN. Mô hình sẽ được kiểm thử trên các tập dữ liệu thực tế để đánh giá hiệu quả và độ tin cậy trong việc phát hiện mã độc.

II. Vấn Đề và Thách Thức Trong Phát Hiện Mã Độc Đa Hình

Mã độc đa hình ngày càng trở nên tinh vi, khiến cho việc phát hiện trở nên khó khăn hơn. Các phương pháp truyền thống thường không đủ khả năng để nhận diện các biến thể mới của mã độc. Thách thức lớn nhất là khả năng chống lại các cuộc tấn công đối kháng, nơi mà mã độc được thiết kế để né tránh sự phát hiện của các hệ thống.

2.1. Các Hình Thức Tấn Công Đối Kháng

Các hình thức tấn công đối kháng như nén mã độc đã chứng minh khả năng né tránh các hệ thống phát hiện. Nghiên cứu cho thấy rằng mã độc có thể được nén để ẩn đi các đặc điểm nhận diện, làm giảm hiệu quả của các mô hình học máy.

2.2. Độ Tin Cậy Của Các Mô Hình Hiện Tại

Độ tin cậy của các mô hình phát hiện mã độc hiện tại đang bị đặt dấu hỏi lớn. Nhiều nghiên cứu đã chỉ ra rằng các mô hình này dễ bị đánh lừa bởi các cuộc tấn công đối kháng, dẫn đến tỷ lệ phát hiện thấp và nhiều kết quả dương tính giả.

III. Phương Pháp Nghiên Cứu Mô Hình Tin Cậy Trong Phát Hiện Mã Độc

Nghiên cứu áp dụng các phương pháp học máy tiên tiến để phát triển mô hình phát hiện mã độc. Việc kết hợp giữa XAI và GAN giúp tăng cường khả năng phát hiện và giảm thiểu các kết quả dương tính giả. Mô hình sẽ được huấn luyện trên các tập dữ liệu đa dạng để đảm bảo tính chính xác.

3.1. Kỹ Thuật Huấn Luyện Đối Kháng

Kỹ thuật huấn luyện đối kháng được áp dụng để tạo ra các mẫu mã độc giả lập, giúp mô hình học máy cải thiện khả năng phát hiện. Phương pháp này đã được chứng minh là hiệu quả trong việc tăng cường độ bền vững của mô hình.

3.2. Ứng Dụng XAI Trong Phát Hiện Mã Độc

XAI giúp giải thích các quyết định của mô hình, từ đó tăng cường độ tin cậy và khả năng hiểu biết của người dùng về cách thức hoạt động của mô hình. Việc áp dụng XAI vào phát hiện mã độc giúp cải thiện khả năng nhận diện các biến thể mới.

IV. Kết Quả Nghiên Cứu và Ứng Dụng Thực Tiễn

Kết quả nghiên cứu cho thấy mô hình phát hiện mã độc đa hình đạt được độ chính xác lên đến 90%. Việc áp dụng XAI và GAN đã giúp cải thiện đáng kể khả năng phát hiện mã độc nén và mã độc đối kháng. Các ứng dụng thực tiễn của mô hình này có thể được triển khai trong các hệ thống an ninh mạng hiện đại.

4.1. Đánh Giá Hiệu Quả Mô Hình

Mô hình đã được kiểm thử trên nhiều tập dữ liệu khác nhau và cho thấy khả năng phát hiện cao. Các chỉ số đánh giá cho thấy mô hình có thể phát hiện mã độc nén và mã độc đối kháng một cách hiệu quả.

4.2. Ứng Dụng Trong Thực Tế

Mô hình có thể được áp dụng trong các hệ thống an ninh mạng để bảo vệ người dùng khỏi các mối đe dọa từ mã độc. Việc triển khai mô hình này sẽ giúp nâng cao khả năng bảo mật cho các tổ chức và cá nhân.

V. Kết Luận và Hướng Phát Triển Tương Lai

Nghiên cứu đã chỉ ra rằng việc kết hợp giữa XAI và GAN có thể tạo ra một mô hình phát hiện mã độc đa hình đáng tin cậy. Hướng phát triển tương lai có thể bao gồm việc mở rộng mô hình để nhận diện các loại mã độc mới và cải thiện khả năng chống lại các cuộc tấn công đối kháng.

5.1. Hướng Phát Triển Mô Hình

Mô hình có thể được cải tiến bằng cách tích hợp thêm các kỹ thuật học sâu và các phương pháp mới trong lĩnh vực an ninh mạng. Việc nghiên cứu thêm về các loại mã độc mới cũng là một hướng đi quan trọng.

5.2. Tương Lai Của An Ninh Mạng

Với sự phát triển không ngừng của công nghệ, an ninh mạng sẽ tiếp tục đối mặt với nhiều thách thức mới. Việc nghiên cứu và phát triển các mô hình phát hiện mã độc tin cậy sẽ đóng vai trò quan trọng trong việc bảo vệ hệ thống thông tin.

10/07/2025
Khóa luận tốt nghiệp an toàn thông tin nghiên cứu mô hình tin cậy và bền vững trong phát hiện mã độc đa hình

Trích đoạn nội dung tài liệu

Chương 1: TONG QUAN DE TÀI Trình bày khái quát định hướng nghiên cứu của khóa luận mà chúng tôi muốn hướng tới. Chương 2: CƠ SỞ LÝ THUYET Trình bày các định nghĩa, khái niệm cũng như những kiến thức nền tảng để có thể thực hiện được nghiên cứu. Đồng thời trình bày sơ lược một số công trình liên quan có cùng hướng nghiên cứu. Chương 3: PHƯƠNG PHÁP THỰC HIỆN Là phần trọng tâm của khoá luận, trình bày những nội dung chính về phương pháp thực hiện và mô hình được sử dụng.

Chương 4: HIỆN THỰC, ĐÁNH GIÁ VÀ THẢO LUẬN Đề cập đến quá trình hiện thực hóa phương pháp dé cập ở Chương 3. Sau đó trình bày phương pháp thực nghiệm, đánh giá kết quả và thảo luận chung. Chương 5: KET LUẬN VÀ HƯỚNG PHÁT TRIỂN Dua ra kết luận về đề tài, dé xuất một số hướng phát triển mở rộng cho các nghiên cứu trong tương lai. Chương 2 CƠ SỞ LÝ THUYÊT Tóm tắt chương Chương này, nhóm chúng tôi sẽ trình bày cơ sở lý thuyết của nghiên cứu: Bao gồm tệp thực thi, mô hình phân tích mã độc bằng phương pháp học máy với những thuật toán khác nhau, mô hình khả điễn giải XAI, mạng sinh đối kháng GAN và cách kết hợp giữa XAI va GAN để lọc ra những thuộc tính, những mẫu đối kháng tốt nhất nhằm phục vụ cho việc huấn luyện đối kháng.1 Tệp thực thi PE 2.1 Cấu trúc tệp thực thi Trong nghiên cứu này chúng tôi chỉ sử dụng những tệp thực thi có định dạng PE làm đối tượng nghiên cứu.

Định dạng tệp PE, là một loại tệp thực thi tiêu chuẩn trên hệ hiệu hành Windows, tên đầy đủ là Portable Executable (PE), định dạng tệp tin PE là định dạng của tệp thực thi executables(.exe) và dynamic link library(.dll), được sử dụng cho cả 2 phiên bản hệ điều hành 32 bit và 64 bit. Định dạng này là một cấu trúc đóng gói đữ liệu cho trình tải hệ điều hành Windows(Windows OS loader) để quản lý và thực thi những mã lệnh. Những chức năng cơ bản của định dạng tệp tin PE: ¢ Mô tả Dinh dang PE: Dinh dang PE (Portable Executable) cung cấp một bản đồ chi tiết về cách chương trình được tải vào bộ nhớ. Nó xác định vị trí và cách mã và dữ liệu được lưu trữ trong bộ nhớ, cũng như các thư viện cần 6 Chương 2.

COSO LY THUYẾT thiết và cách chúng được liên kết. Bằng cách này, nó quy định cách chính xác để hệ điều hành tải chương trình và đảm bảo tính đồng nhất trong quá trình thực thi. © Tài nguyên sử dụng trong quá trình thực thi: Chương trình cung cấp các tài nguyên như hình ảnh, video, và chuỗi ký tự mà nó có thể sử dụng trong suốt quá trình thực thi. Các tài nguyên này đóng vai trò quan trọng trong việc cung cấp trải nghiệm người dùng hoàn chỉnh và đa dạng, bổ sung cho chức năng chính của chương trình.

e Cơ chế bảo mật: tập tin PE thường sử dung chữ ký số và các phương tiện khác để hệ điều hành có thể xác thực nguồn gốc của chương trình được nạp. Qua đó, hệ điều hành có khả năng đảm bảo tính toàn vẹn và nguồn gốc của mã, giúp ngăn chặn các cuộc tân công độc hại và đảm bảo tính ổn định của hệ thống. Cấu trúc chung của định dạng tệp tin PE sẽ có 2 phần là header và section, phần header dùng để lưu các giá trị định dang va offset của các section trong phan section. Trường tiêu dé DOS (DOS Header) Trường tiêu dé DOS có mục dich để thông báo tệp tin không thé hoạt động Trong môi trường MS-DOS, trường này được thực thi mỗi khi tệp tin chạy trong môi trường MS-DOS.

Cụ thể, Trường tiêu dé DOS chiếm 64 bytes đầu tiên trong tệp và bao gồm hai giá trị quan trọng: emagic (0x5a4b) và e_lfanew, một DWORD 4 bytes. Giá trị trong e_lfanew chứa khoảng cách (offset) đến Trường tiêu dé tập tin PE, xác định cách thức tập tin sẽ được thực thi. Để đảm bảo khả năng thực thi trong môi trường MS-DOS, 64 bytes đầu tiên của tệp thực thi PE được chiếm bởi trường tiêu dé DOS. Trong trường này, e_magic là chữ ký của tệp thực thi PE va e_là một DWORD chứa offset của PE Header so với vị trí đầu tệp.

Thông qua việc này, tệp tin được xác định và chuẩn bi để thực thi, giúp tăng tính linh hoạt của nó trong các môi trường khác nhau. COSO LY THUYẾT 64 bit 6x000 COFF 6x0008 Header 6x0010 6x0018 Standard 6x0020 COFF Fields 0x0028 0x0030 0x0038 0x0040 0x0048 Windows 9x0050 Specific Fields 0x0058 @xa060 0x0068 0x0070- Optional Header Data Directories Section Table Chương 2. COSO LY THUYẾT Trường DOS STUB Trường này là một chương trình DOS EXE dùng để thông báo lỗi: “This is pro- gram cannot be run in DOS mode” khi chương trình không tương thích. Trường tiêu dé PE (PE Header) Truong PE header bao gom cac thong tin can thiét dé tai chương trình lên bộ nhớ.

Câu trúc này gồm 3 phần được định nghĩa trong windows.inc: ¢ Signature: là 1 DWORD bắt đầu của PE Header chứa chữ ký : 50h, 45h, 00h, 00h. se IMAGE FILE HEADER: Trường nay bao gồm 20 bytes tiếp theo của PE Header, phan này chứa thông tin về sơ dé bố trí vật lý và các đặc tính của tệp tin. e® IMAGE_OPTIONAL_HEADER: Gồm 224 bytes tiếp theo sau FILE_HEADER. Chứa thông tin về sơ đồ logic trong tệp tin PE.

Trường nay chứa một số thông tin quan trọng giành cho việc chỉnh sửa tệp tin Magic (2 bytes): Xác định là tệp tin 32 bit (OB 01) hay 64 bit (OB 20) AddressOfEntryPoint (4bytes): Chứa dia chi ảo tương đối (RVA) của câu lệnh đầu tiên sé được thực thi khi chương trình PE loader san sàng để chạy tệp thực thi PE (. Nếu muốn chương trình bắt đầu từ một địa chỉ khác (để thực thi câu lệnh với mục đích khác) thì cần thay đổi địa chỉ này về địa chỉ tương đối của câu lệnh muốn thực thi. ImageBase: địa chỉ nạp được ưu tiên cho tệp tin PE. Section Alignment: Phần liên kết của các Section trong bộ nhớ.

File Alignment: Phan liên kết của các Section trong tệp tin. Tương tự như SectionAlignment nhưng áp dụng với tệp tin. SizeOfImage: Toàn bộ kích thước của Pe image trong bộ nhớ, là tổng của tất cả các headers và sections được liên kết tới Section Alignment SizeOfHeaders: Kích thước của tất cả các headers + section table = kích thước tệp tin trừ đi tổng kích thước của các section trong tệp tin. COSO LY THUYẾT — Data Directory: là một mảng gồm 16 phan tử, trong đó mỗi phần liên quan đến một cấu trúc di liệu quan trọng trong tệp tin PE.

Phân đoạn bảng (Section Table) Section Table là thành phần tiếp theo ngay sau Trường tiêu để PE, Section Ta- ble bao gồm một mảng những câu trúc IMAGE_SECTION_HEADER, Mỗi thành phần trong đó đều chứa thông tin về một phân đoạn cụ thể trong tệp tin PE: ¢ Kích thước ảo (VirtualSize): Kích thước thật của dữ liệu sau khi được tải lên bộ nhớ. ¢ Dia chỉ ao (VirtualAddress): Giá trị ánh xạ của các section sau khi được tải lên bộ nhớ. * SizeOfRawSection: Kích thước của section data có trên 6 đĩa. * PointerOfRawSection: là offset từ đầu tệp tin cho tới section data.

¢ Đặc tinh (Characteristic): Chia đặc tính của section: thực thi, dữ liệu khởi tạo. Phân đoạn tập tin PE (Section PE File) Phan sections của một tệp tin PE chứa dữ liệu cần thiết dé có thể thực thi được tệp tin. Mỗi phan của PE section đều có chứa tiêu dé riêng (Section Header) được lưu trữ trong Section Table.text là phân đoạn chứa mã thực thi của tệp tin PE. e data: Chua dữ liệu, các biến được khởi tao trong mã lệnh.rdata: Chứa những dữ liệu chỉ đọc, các biến const.idata: Chứa bảng nhập (Import Tables).

Phan này được trình tai sử dụng để xác định sẽ tải những DLL nào va các chức năng được sử dụng từ mỗi DLL.edata: Chứa những thư mục xuất (Export Directory). Phan nay bao gồm những hàm có chức năng xuất. COSO LY THUYẾT © .rsrc: Chứa tai nguyên mà một chương trình sử dung. Bao gồm hình ảnh, biểu tượng, .2 Hop ngữ Hop ngữ hay còn được gọi là Assembly code, là một loại ngôn ngữ bac thấp va có khả năng tương tác trực tiếp với vi xử lý.

Hợp ngữ có thể được dịch sang ngôn ngữ khác thông qua trình biên dịch assembly (assembler) và trình dịch ngược (disassembler) [1]. Dịch mã độc sang hợp ngữ giúp việc phân tích và điều tra trở nên dé dàng hơn nhờ tính tương thích với hoạt động của máy tính. Malware Author Malware Analyst High-level Language Low-Level Language int -¢; printf("Hello.\n"); exit(0); sub esp, 0x4ũ CPU Compiler Machine Code Disassembler Khi mã độc được dịch sang hợp ngữ, chúng thường sử dụng các lệnh để tương tác với hệ điều hành bằng cách gọi các thư viện liên kết động (DLL), các thư viện này được nạp vào bộ nhớ khi chương trình chạy. Các loại mã độc thường lợi dụng DLL để thay đổi thanh ghi hệ thống, sao chép tập tin,.

COSO LY THUYẾT Nghiên cứu của Moskovitch [14] cũng chi ra rằng việc sử dung hợp ngữ sé có hiệu quả cao hơn trong việc phân tích mã độc so với mã máy, ngoài ra mã độc nén và mã độc đa hình có thể bị phân tích bằng cách sử dụng những trình disassembler như IDA. Các kỹ thuật biến đổi hình dạng mã độc trên hợp ngữ như chèn mã chết, tái khai báo thanh ghi, tái sắp xếp chương trình con, thay thế lệnh, chuyển vị mã và tích hợp mã nhằm mục đích tránh được phát hiện bởi các trình phát hiện mã độc. Điều này làm nảy sinh nhu cầu phân tích mã hợp ngữ của các nhà khoa học để hiểu rõ cơ chế phát hiện mã độc của các công cụ phát hiện hiện tại. Một số vai trò của hợp ngữ trong việc phát hiện và phân tích mã độc: s® Phân tích chuyên sâu và chi tiết: Mã độc thường được viết hoặc dịch sang hợp ngữ để tăng độ khó trong việc phát hiện và phân tích.

Khả năng đọc hiểu hợp ngữ giúp các chuyên gia an ninh mạng tiếp cận mã độc từ gốc rễ, phân tích các hành vi bat thường hoặc độc hai ma các công cu tự động có thể bỏ sót. Nghiên cứu của Gu và cộng sự [4] đã nhấn mạnh tầm quan trọng của việc sử dụng hợp ngữ trong việc phát hiện mã độc thông qua phân tích tính và học máy. © Phat hiện kỹ thuật xáo trộn (Obfuscation): Kỹ thuật xáo trộn mã nhằm che giấu mục đích thực sự của mã độc bang cách thay đổi cấu trúc mà không làm thay đổi hành vi của nó.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu có tiêu đề Mô Hình Tin Cậy và Bền Vững Trong Phát Hiện Mã Độc Đa Hình cung cấp cái nhìn sâu sắc về các phương pháp và mô hình hiện đại trong việc phát hiện mã độc đa hình. Tài liệu nhấn mạnh tầm quan trọng của việc xây dựng các mô hình tin cậy và bền vững để đối phó với sự phát triển không ngừng của các mối đe dọa an ninh mạng. Độc giả sẽ tìm thấy những lợi ích thiết thực từ việc áp dụng các phương pháp này, bao gồm khả năng phát hiện chính xác hơn và giảm thiểu rủi ro cho hệ thống.

Để mở rộng kiến thức của bạn về lĩnh vực này, bạn có thể tham khảo thêm tài liệu Khóa luận tốt nghiệp an toàn thông tin phát hiện lỗi hồi quy trong hệ thống học sâu bằng phương pháp fuzzing, nơi bạn sẽ tìm hiểu về các kỹ thuật fuzzing trong phát hiện lỗi. Ngoài ra, tài liệu Khóa luận tốt nghiệp an toàn thông tin tích hợp trình phát hiện mã độc bằng ngôn ngữ tự nhiên vào hệ thống giám sát mạng sẽ giúp bạn khám phá cách tích hợp ngôn ngữ tự nhiên vào các hệ thống giám sát để nâng cao khả năng phát hiện mã độc. Những tài liệu này sẽ cung cấp cho bạn những góc nhìn đa dạng và sâu sắc hơn về các phương pháp phát hiện mã độc hiện đại.