Chương 1: TONG QUAN ĐỀ TÀI Khái quát mục tiêu dé tài của khoá luận cũng như động lực nghiên cứu của nhóm được trình bày tại chương này. Bên cạnh đó, công bố khoa học và các sản phẩm nghiên cứu đạt giải trong quá trình thực hiện dé tài khóa luận cũng được nhóm đề cập. * Chương 2: CƠ SỞ LÝ THUYET Tại chương này, nhóm trình bày các định nghĩa, kiến thức nền tảng cũng như các công nghệ được sử dụng trong khoá luận. Đồng thời cung cấp thông tin về các công trình nghiên cứu liên quan.
e Chương 3: PHƯƠNG PHÁP THỰC HIỆN Chương này chúng tôi trình bày chỉ tiết về phương pháp, chiến lược tấn công, phòng thủ và kiến trúc mô hình đa thể thức Shark-Eyes mà nhóm để xuất. ¢ Chương 4: HIỆN THUC, ĐÁNH GIÁ VÀ THẢO LUẬN Nhóm trình bày chỉ tiết đến quá trình hiện thực hóa phương pháp đề cập ở Chương 3. Sau đó trình bày phương pháp thực nghiệm, đánh giá kết quả thực nghiệm qua các kịch bản và thảo luận chung của nhóm. e Chương 5: KET LUẬN VÀ HUONG PHÁT TRIỂN Tại chương này, nhóm sẽ đưa ra kết luận vé dé tài nghiên cứu bao gồm cả ưu điểm và nhược điểm về phương pháp mà nhóm đề xuất.
Bên cạnh đó, chúng tôi sẽ thảo luận về các hướng phát triển mở rộng có tiém năng phát triển trong tương lai. Chương 2 CƠ SỞ LÝ THUYÊT Tóm tắt chương Trong chương này, chúng tôi trình bày chỉ tiết cơ sở lý thuyết của các công nghệ mà nhóm sử dụng trong khóa luận, bao gồm cái nhìn tổng quan về các mô hình trí tuệ nhân tạo nổi bật hiện đang được sử dụng trong ngữ cảnh phát hiện website lừa đảo. Bên cạnh đó, nhóm cũng sẽ đi sâu vào cơ sở lý thuyết của các mô hình mạng sinh đối kháng và mạng khả diễn giải, cũng như các kỹ thuật tắn công trốn tránh và tấn công chuyển giao phục vụ cho khung tấn công mà nhóm dé xuất. Đồng thời, chúng tôi tóm tắt các công trình nghiên cứu liên quan, so sánh ưu nhược điểm của các công trình này với để tài của nhóm, và chỉ ra những điểm mới, sáng tạo của dé tài nhóm so với các nghiên cứu trước đây.1 Tình hình nghiên cứu các ki thuật xây dựng và phát hiện Website lừa dao hiện nay Tính đến thời điểm hiện tại, tình hình nghiên cứu các kỹ thuật xây dựng và phát hiện website lừa đảo đang tiếp tục phát triển mạnh mẽ.
Đồng thời đối mặt với sự phức tạp và ngày càng tinh vi hóa của các phương thức lừa đảo trên mạng, các nghiên cứu mới tập trung vào việc phát triển công nghệ và phương pháp tiên tiến được dé xuất. Nhiều nghiên cứu mới được công bồ với khả năng nhận diện và ngăn chặn các trang web lừa đảo, đồng thời cung cấp cái nhìn sâu sắc về các công nghệ mới nhất để tạo ra các trang web giả mạo ngày càng phức tạp. COSO LY THUYẾT 2.1 Các ky thuật xây dung Website lừa dao hiện nay Trong thời đại công nghệ phát triển, kẻ gian liên tục tinh vi hóa các kỹ thuật xây dựng website lừa đảo. Các phương pháp mới bao gồm sự sáng tạo trong việc tạo ra giao diện giống hệt các trang web chính thống hay giao diện trang web mua bán, trúng thưởng đem lại sự tin cậy và thuyết phục, sử dụng kỹ thuật tối ưu hóa SEO để thu hút nhiều người truy cập, và tận dụng các phương tiện truyền thông xã hội để lan truyền thông điệp lừa đảo.
Các kỹ thuật này thường kết hợp sự lừa đảo tâm lý với công nghệ thông tin, tạo nên những trang web mà người dùng khó phân biệt được giữa thật và giả mạo. Bên cạnh đó, việc sử dụng các công cụ tạo trang web Phishing được chia sẽ trên mạng, kẻ xấu có thể tạo ra hàng loạt trang web với các diện mạo khác nhau trong thời gian ngắn. Có thể thấy, khả năng xây dựng trang web lừa đảo đang tăng mạnh về chất lượng và số lượng trong khoảng thời gian gần đây.2 Các phương pháp phát hiện Website lừa dao Các nhà nghiên cứu và chuyên gia bảo mật trong lĩnh vực an toàn thông tin đã và đang liên tục nỗ lực phát triển các công nghệ và phương pháp mới để phát hiện và ngăn chặn kịp thời các website lừa đảo. Bên cạnh các kĩ thuật truyền thống như sử dụng danh sách đen hoặc danh sách trắng thì các kỹ thuật tiên tiến đang được nghiên cứu mạnh mẽ.
Nổi bật là việc sử dụng trí tuệ nhân tạo và học máy để phân tích tự động các đặc điểm của các trang web, từ tên miền, cấu trúc mã nguồn đến nội dung và hoạt động mạng, nhằm xác định các dau hiệu của sự lừa dao kết hợp với các kỹ thuật khác để tăng tốc độ nhận định và tính chính xác cũng như giảm tối đa sức lực và tài nguyên con người [18]. Ngoài ra, các cơ quan chính phủ và tổ chức phi lợi nhuận cũng đang tăng cường hợp tác và cung cấp nguồn lực để phát hiện và cảnh báo về các trang web lừa đảo, nhằm bảo vệ người tiêu dùng và đảm bảo sự an toàn trên mạng. COSO LY THUYẾT 2.3 Ví dụ về tên miễn lừa dao nguyên ban và tên miễn lừa dao đối kháng Một trong những phương pháp phát hiện website lừa đảo hiệu quả trước đây là dựa vào tên miền để nhận định. Tuy nhiên, với kĩ thuật ngày càng tỉnh vi của kẻ tấn công, tên miễn lừa đảo đối kháng đã được ra đời.
Day là ví dụ về tên miền nguyên bản và tên miễn lừa đảo đối kháng. Tên miền lừa đảo nguyên bản Tên miễn lừa đảo thường được sử dụng để đánh lừa người dùng bằng cách làm giống giao diện và cấu trúc của các tên miễn hợp lệ, chỉ thay đổi một vài điểm nhỏ để khó phát hiện. Ví dụ: e Tên miễn hợp lệ: www.com e Tên miền lừa đảo nguyên bản: www.com (chữ ’s’ được thêm vào để đánh lừa người dùng) Tên miễn lừa đảo nguyên bản đối kháng Tên miền đối kháng được tạo ra bằng các kỹ thuật như GANs, nhằm qua mặt các hệ thống phân loại tên miễn. Loại tên miền này thường khó phát hiện hơn do đã được biến đổi và có nhiều đặc điểm phức tạp.
Các tên miễn lừa đảo đối kháng thường được thiết kế để vượt qua các hệ thống phát hiện dựa trên các mẫu tên miễn lừa đảo đã biết. Ví dụ: e Tên miễn lừa đảo đối kháng: www.com (chữ “s“ được thêm vào, chữ ‘i’ được thay bang số “1 và chữ “a' được thay bang số ’4’) So sánh: Tên miên lừa dao nguyên ban: ¢ Tập trung đánh lừa sự thiếu cảnh giác của người dùng. Do đó người dùng vẫn có thể phát hiện nếu chú ý. COSO LY THUYẾT * Các hệ thống phân loại có thể nhận biết được.
Tên miễn lừa đảo đối kháng: ¢ Tập trung đánh lừa các hệ thống phân loại và người dùng. Do đó tên miền này thường khó nhận biết bằng mắt thường và chúng có nhiều biến đổi phức tạp. ¢ Những hệ thống phân loại dựa trên hoc máy cũng có thể bị đánh lừa.2_ Mô hình học Da thể thức Phương pháp học da thể thức là một cải tiền so với học đơn thể thức (unimodal), bằng cách tận dụng dữ liệu từ nhiều nguồn hoặc phương thức khác nhau để cải thiện độ chính xác và hiệu quả của mô hình [23]. Không giống như học đơn thể thức, chỉ dựa vào một loại đữ liệu đầu vào như văn bản, hình ảnh, hoặc âm thanh, học đa thể thức kết hợp các đầu vào đa dạng này để có cái nhìn toàn diện hơn về thông tin đang được xử lý.
Sự tích hợp này cho phép tạo ra các mô hình mạnh mẽ hơn có thể xử lý các kịch bản phức tạp trong thế giới thực một cách hiệu quả hơn [7]. Các mô hình học đa thể thức hiện đang được nghiên cứu và áp dụng rộng rãi trong nhiều lĩnh vực khác nhau như Thị giác máy tính, An toàn thông tin, Xử lý ngôn ngữ tự nhiên, Y học, và Robotics.1 Phân loại các mô hình học đa thể thức Có ba loại hợp nhất chính (fusion) trong học đa thể thức: hợp nhất sớm, nơi dữ liệu từ các phương thức khác nhau được kết hợp trước khi được đưa vào mô hình học tập; hợp nhất muộn, nơi các dự đoán từ các mô hình riêng biệt cho từng phương thức được kết hợp; và hợp nhất lai, kết hợp các yêu tố của cả hợp nhất sớm và hợp nhất muộn, tối ưu hóa các điểm mạnh của mỗi loại để cải thiện hiệu suất tổng thể. Hợp nhất sớm tập trung vào việc tích hợp dữ liệu thô, hợp nhất muộn nhân mạnh việc kết hop các quyết định từ nhiều mô hình, và hợp nhất lai tận dụng cả dữ liệu thô và thông tin ở mức độ quyết định để có một cách tiếp cận toàn diện. Kiến trúc của các mô hình học đa thể thức được miêu tả trong Hình 2.
COSO LY THUYẾT Modalinput1. —> DL Module 1 Modalinput2 —> DL Module 2 MFoudsilen `.1: Tổng quan kiến trúc mô hình học da thể thức 2. Mô hình phân loại website áp dụng học Da thể thức Sử dụng các mô hình đa thể thức để phát hiện trang web lừa đảo (Phishing Web- site Detection - PWD) đang thu hút sự chú ý nhờ khả năng tổng hợp thông tin từ nhiều nguồn và kết hợp các kỹ thuật xử lý dữ liệu tiên tiền, dẫn đến hiệu quả cao trong phát hiện trang web lừa đảo và khả năng chống lại nhiễu loạn mạnh mẽ. Các chỉ tiết được trình bày trong Hình 2.2, phương pháp học đa thể thức hướng đến xây dựng các nhánh khác nhau, mỗi nhánh tập trung vào một thực thể cùng với một phương pháp xử lý để xử lí dữ liệu đầu vào cho các thuật toán học máy.
Cuối cùng, kết quả sẽ được hợp nhất theo nhiều cách khác nhau, chẳng hạn như nối và nhập vào mạng nhận diện, hoặc bỏ phiếu trung bình nếu các nhánh được thiết kế để đưa ra quyết định thay vì trích xuất đặc trưng. Các phương pháp tiếp cận đa thể thức có tiểm năng lớn cho các nghiên cứu sau này trong việc phân loại trang web lừa đảo. Sự biến đổi trong việc kết hợp các nhóm thuộc tính khác nhau cùng với các phương pháp xử lý dữ liệu đa dạng có thể dẫn đến một hệ thống đa thể thức mới đạt được độ tin cậy và hiệu quả cao mà không yêu cầu quá nhiều tài nguyên cho triển khai thực tế.