CHƯƠNG 1. GIỚI THIỆU ĐÈ TÀI 11 Tên dé tai Tên Tiếng Việt: Phát hiện các cuộc tắn công lừa đảo dựa trên URL và dựa trên sự tương đồng trực quan bằng cách sử dụng mạng đối kháng tạo sinh. Tên Tiếng Anh: URL-based and visual-similarity-based phishing attacks detection using generative adversarial networks.2 Từ khóa Mang sinh đối kháng, tan công hộp đen, tăng cường dữ liệu. Tính khoa học, tính mới của đề tài Trong thời điểm hiện tại, mạng sinh đối kháng là một chủ đề nghiên cứu mới, tiềm năng và đang nhận được sự quan tâm đặc biệt không chỉ dành cho bài toán xử lý hình ảnh mà đang được nghiên cứu và phát triển rộng ra các lĩnh vực khác, trong đó có lĩnh vực an toàn thông tin.
Đặc biệt, trong giai đoạn phát triên nhanh chóng của khoa học công nghệ, các thuật toán học máy và học sâu được ứng dụng rộng rãi, kéo theo đó là các rủi ro về mat an toàn thông tin gia tăng đáng kể và đặc biệt là các cuộc tắn công lừa dao vẫn duy trì mức độ nguy hiểm cao trên không gian mạng. Các nghiên cứu về nâng cao khả năng phát hiện tan công lừa đảo vi thé có ý nghĩa rất quan trong. Tinh khoa học của luận văn được thé hiện thông qua việc nghiên cứu về kiến trúc và hoạt động của mô hình mạng sinh đối kháng; các kỹ thuật phân tích và các giải pháp học máy được sử dụng đề phát hiện trang web lừa đảo. Thông qua đó, đề tài luận văn dé xuất mô hình phát sinh dữ liệu đối kháng, tăng cường dữ liệu huấn luyện, giải quyết van đề mat cân bằng lớp và hỗ trợ tái huấn luyện giúp nâng cao hiệu suất của các trình phát hiện dựa trên học máy.
Tinh mới của luận văn thê hiện ở việc xây dựng một mô hình phát sinh dữ liệu dựa trên mạng sinh đối kháng có tính linh hoạt, nghĩa là có khả năng ứng dụng trên các loại kỹ thuật phân tích phát hiện trang web lừa đảo khác nhau, cụ thể trong đề tài này là kỹ thuật phân tích dựa trên URL và dựa trên sự tương đồng trực quan. Một hướng tiếp cận mới khác của đề tài là áp dụng phương pháp học chuyền giao, sử dụng 1 GIỚI THIỆU DE TÀI mô hình phân loại ảnh học sâu VGG16 được huấn luyện trước dé trích xuất đặc trưng từ ảnh chụp giao diện trang web, làm đầu vào cho các thuật toán học máy trong bài toán phát hiện trang web lừa đảo.4 Mục tiêu của đề tài Nghiên cứu áp dụng mạng sinh đối kháng trong nghiên cứu nâng cao hiệu suất phát hiện trang web lừa đảo, với các hướng: e _ Đánh giá hiệu suất và tính khả thi khi áp dụng mạng sinh đối kháng trong việc phát sinh các mẫu dữ liệu từ các đặc trưng được trích xuất thông qua đường dẫn URL của trang web, cố gắng lan tránh và qua mặt các trình phát hiện lừa đảo dựa trên học máy. ¢ anh giá hiệu suất và tính khả thi khi áp dung mạng sinh đối kháng trong việc phát sinh các mẫu dữ liệu từ các đặc trưng tương đồng trực quan của trang web (cụ thê trong đề tài này là giao điện của các trang web), có gắng lần tránh và qua mặt các trình phát hiện lừa đảo dựa trên học máy. ¢ Đánh giá khả năng áp dụng các mẫu phát sinh từ mô hình đề xuất dựa trên mạng sinh đối kháng đề giải quyết van đề mất cân bằng lớp huấn luyện, đồng thời sử dụng dé tái huấn luyện nâng cao hiệu suất của các trình phát hiện trang web lừa dao dựa trên học máy.5 __ Đối tượng áp dụng, phạm vi nghiên cứu của dé tài 1.1 Đối tượng áp dụng - __ Tấn công lừa đảo thông qua trang web.
- Mô hình mang sinh đối kháng GAN.2 Phạm vi nghiên cứu - Về kỹ thuật sử dụng dé phát hiện trang web lừa đảo (phishing website): kỹ thuật phát hiện dựa trên URL và kỹ thuật phát hiện dựa trên sự đương, đồng trực quan. - Về các mô hình học máy được sử dụng như là các trình phát hiện lừa đảo: SVM, DT, RF, LR, MLP. GIỚI THIEU DE TÀI 1.6 Nội dung và phương pháp nghiên cứu 1.1 Nội dung 1 Nội dung: Nghiên cứu kỹ thuật phát hiện trang web lừa đảo dựa trên URL và dựa trên sự tương đồng trực quan. Phương pháp: Nghiên cứu, khảo sát các công trình về kỹ thuật phát hiện trang web lừa đảo dựa trên đường dẫn URL và dựa trên sự tương đồng trực quan.
Trích xuất và chuẩn hóa các đặc trưng các mẫu dữ liệu từ tập dữ liệu huấn luyện.2 Nội dung 2 Nội dung: Nghiên cứu xây dựng mô hình nâng cao khả năng phát hiện trang web lừa đảo dựa trên Mạng sinh đối kháng. Phuong phap: Nghiên cứu, khảo sát các công trình liên quan đến mô hình phát sinh dữ liệu, cụ thể là Mạng sinh đối kháng trong việc tăng cường dữ liệu huấn luyện và phát sinh dữ liệu tan công các trình phát hiện trang web lừa đảo. Xây dựng kịch bản tấn công lần tránh, qua mặt các trình phát hiện trang web lừa đảo dựa trên học máy. Tái huấn luyện các trình học máy phát hiện trang web lừa đảo dựa trên mô hình phát sinh dữ liệu đề xuất.
Xây dựng kịch bản, thống kê số liệu đánh giá sự cải thiện hiệu suất phát hiện trang web lừa đảo sau quá trình tái huấn luyện dựa trên các mẫu đối kháng đã được phát sinh. 17 Đóng góp và công bố khoa học của tác giả 1.1 Đóng góp chính Đóng góp của tác giả thông qua việc ứng dụng thành công mạng sinh đối kháng trong việc nâng cao hiệu suất phát hiện trang web độc hại của các trình phát hiện dựa trên học máy có thé được cụ thé hóa như sau: © VỀ mặt khoa học, nghiên cứu đề xuất và triển khai thực nghiệm mô hình PWDGAN - mô hình phát sinh dữ liệu dựa trên mạng sinh đối kháng, sử 3 GIỚI THIỆU DE TÀI dụng các đặc trưng được trích xuất bằng kỹ thuật phát hiện trang web lừa đảo dựa trên URL (uPWDGAN) và dựa trên sự tương đồng trực quan (vPWDGAN). PWDGAN có khả năng phát sinh các mẫu đối kháng mới qua mặt thành công các trình phát hiện trang web lừa đảo dựa trên học máy, góp phan giải quyết vấn đề mat cân bằng lớp trong việc huấn luyện và nâng cao hiệu suất của các trình phát hiện học máy này. © Vẻ mặt thực tiễn, tập đữ liệu được trích xuất và chuẩn hóa dựa trên kỹ thuật phân tích URL và dựa trên sự tương đồng trực quan từ tập Phishtank va Alexa có thé được áp dụng cho các nghiên cứu liên quan đến miễn bài toán phát hiện trang web lừa đảo trong tương lai; mô hình PWDGAN sau huấn luyện có khả năng phát sinh dữ liệu đối kháng, tăng cường kích thước mẫu, hỗ trợ tái huấn luyện các trình phát hiện trang web lừa đảo dựa trên học máy.2 Công bố khoa học liên quan Tác giả đã công bó bài báo “PWDGAN: Generating Adversarial Malicious URL Examples for Deceiving Black-Box Phishing Website Detector using GANS” tại Hội nghị quốc tế lần thứ sáu Nghiên cứu về các tính toán thông minh trong kỹ thuật năm 2021 (Sixth International Conference on Research in Intelligent and Computing in Engineering 2021) (Bài báo được đính kèm trong phan Phụ lục của luận văn).
Bên cạnh đó, tác giả đã nộp va đang chờ bình duyệt bài báo “Transfer Learning with Pre-trained Deep Learning Image Classification Models for Visual Similarity- based Phishing Website Detection” tại Hội nghị quéc tế lần thứ 23 về An ninh Thông tin và Truyền thông năm 2021 (International Conference on Information and Communications Security 2021). GIỚI THIỆU DE TÀI 18 Cấu trúc của luận văn Luận văn sẽ được tác giả trình bày trong 5 chương. GIỚI THIỆU ĐÈ TÀI Trinh bày tổng quan về dé tài, mục tiêu, đối tượng, phạm vi nghiên cứu của dé tài, đồng thời cũng liệt kê các nội dung và phương pháp sẽ được nghiên cứu, tính khoa học, tính mới và cấu trúc của đề tài. TONG QUAN VAN ĐÈ NGHIÊN CỨU VA HƯỚNG TIẾP CẬN CỦA ĐÈ TÀI Giới thiệu các kiến thức về lừa đảo qua mạng, phương pháp và kỹ thuật để phát hiện và phòng chống các cuộc tấn công lừa đảo thông qua trang web.
Khảo sát, tìm hiểu và trình bày các hướng nghiên cứu, giải pháp, thuật toán học máy đã được áp dụng trong vấn đề phát hiện trang web lừa đảo. Trong chương này, mạng sinh đối kháng cũng được giới thiệu như một hướng tiếp cần tiềm năng dé giải quyết vấn dé mà đề tài đặt ra. MÔ HÌNH ĐÈ XUẤT Trình bày hướng tiếp cận sử dụng mạng sinh đối kháng trong việc xây dựng mô hình phát sinh dữ liệu đối kháng, tắn công các trình phát hiện trang web lừa đảo thông qua phương pháp tan công hộp đen. Ứng dụng mô hình đề xuất trong việc tăng cường dữ liệu, tái huấn luyện nâng cao hiệu suất phát hiện các trang web lừa đảo.
THỰC NGHIEM VÀ KET QUA Trinh bày chi tiết về các bộ dữ liệu, môi trường được sử dung đề thực nghiệm; chỉ tiết các kịch bản được hiện thực để kiểm chứng hiệu quả mô hình đề xuất. Các dữ liệu sẽ được thu thập, tổng hợp dé phân tích kết quả. KET LUẬN VÀ HƯỚNG PHÁT TRIEN Chương này sẽ tông kết lại kết quả giải quyết những van dé trong phạm vi đề tài này và cung cấp những hướng phát triển tiếp theo cho đề tài. TONG QUAN VAN ĐÈ NGHIÊN CỨU VÀ HƯỚNG TIẾP CAN CUA ĐÈ TÀI CHƯƠNG2.
TONG QUAN VẤN ĐÈ NGHIÊN CỨU VÀ HƯỚNG TIẾP CAN CUA ĐÈ TÀI 2.1 Các vấn đề nghiên cứu Lita đảo qua mạng (phishing) là một cuộc tan công nhằm đánh lừa người dùng mang va thu thập các thông tin cá nhân như tên người dùng, mật khâu, thẻ tín dụng, tài khoản ngân hàng và các dữ liệu nhạy cảm khác. Cuộc tắn công lừa đảo qua mạng được ghi nhận lần đầu tiên vào năm 1996, từ đó đến nay lừa đảo qua mạng trở thành một trong những mối đe doa nguy hiểm nhất trên không gian mạng, gây thiệt hại về tài sản và uy tín không chỉ người dùng mạng mà cả các doanh nghiệp và tổ chức. Các cuộc tấn công lừa đảo qua mạng thường được thực hiện thông qua hình thức một trang web hoặc một thư điện tử giả mạo, trong đó, việc sử dụng các trang web lừa đảo là hình thức phô biến [1]. Theo định nghĩa của Viện Tiêu chuẩn và Công nghệ - NIST (NIST SP 800-69 va NIST SP 800-44 V2), các trang web được tạo ra giống với một trang web tin cậy được sử dụng cho mục đích xấu được xem là một trang web lừa đảo/trang web độc hai (phishing websites).