Nghiên Cứu Kỹ Thuật Phát Hiện Trang Web Giả Mạo và Ứng Dụng

Luận văn thạc sĩ kỹ thuật nghiên cứu hay nghiên cứu một số kỹ thuật phát hiện trang web giả mạo và ứng dụng, khảo sát thực trạng, phân tích nguyên nhân, đề xuất giải pháp cải

Chuyên ngành

Khoa Học Máy Tính

Người đăng

Ẩn danh

Thể loại

Luận Văn Thạc Sĩ

2016

77
18
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CAM ĐOAN

LỜI CẢM ƠN

1. CHƯƠNG 1: TỔNG QUAN VỀ AN NINH MẠNG VÀ BÀI TOÁN GIẢ MẠO WEBSITE

1.1. Tổng quan về an ninh mạng

1.2. Giới thiệu về an ninh mạng

1.3. Nguy cơ ảnh hưởng tới an toàn mạng

1.4. Các khái niệm cơ bản

1.5. Các loại tấn công mạng

1.6. Các phương thức tấn công

1.7. Dịch vụ website

1.8. Giới thiệu về Website

1.9. Các hình thức giả mạo web

1.10. Các kiểu lừa đảo của Phishing

1.11. Bài toán giả mạo website

1.12. Một số kỹ thuật

2. CHƯƠNG 2: CÁC KỸ THUẬT PHÁT HIỆN WEBSITE GIẢ MẠO

2.1. Thuật toán TF - IDF (Term Frequency/Inverse Document Frequency)

2.2. Phương pháp dựa trên tần số từ khóa (TF – Term Frequency)

2.3. Phương pháp dựa trên nghịch đảo tần số văn bản (IDF – Inverse Document Frequency)

2.4. Phương pháp TF × IDF

2.5. Thuật toán sử dụng phương pháp thống kê (Bayesian)

2.6. Định lý Naïve Bayes

2.7. Thuật toán Naïve Bayes

2.8. Thuật toán so khớp

2.9. Thuật toán so khớp chuỗi sơ khai

2.10. Thuật toán Rabin – Karp

2.11. Thuật toán Boyer Moore Horspool

2.12. Thuật toán dựa trên sự tương đồng về hình ảnh của trang web

2.13. Thuật Toán K-Means

2.14. Thuật toán so khớp đồ thị

3. CHƯƠNG 3: XÂY DỰNG CHƯƠNG TRÌNH PHÁT HIỆN WEBSITE GIẢ MẠO VÀ ỨNG DỤNG

3.1. Ứng dụng thuật toán Naive Bayes trong phát hiện website giả mạo

3.2. Các luật xác định giả mạo áp dụng cho thuật toán

3.3. Phát hiện giả mạo dựa trên thanh địa chỉ

3.4. Phát hiện giả mạo dựa trên các đặc tính bất thường

3.5. Phát hiện giả mạo dựa trên các tính năng dùng trong HTML và JavaScript

3.6. Phát hiện giả mạo dựa trên tên miền

3.7. Thiết kế chương trình

3.8. Phân tích thuật toán

3.9. Giao diện chương trình và kết quả

HƯỚNG PHÁT TRIỂN

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng Quan Về Kỹ Thuật Phát Hiện Trang Web Giả Mạo

Kỹ thuật phát hiện trang web giả mạo đang trở thành một lĩnh vực nghiên cứu quan trọng trong an ninh mạng. Với sự gia tăng của các cuộc tấn công giả mạo, việc phát triển các phương pháp hiệu quả để nhận diện và ngăn chặn các trang web này là rất cần thiết. Nghiên cứu này sẽ cung cấp cái nhìn tổng quan về các kỹ thuật hiện có và ứng dụng của chúng trong thực tiễn.

1.1. Khái Niệm Về Trang Web Giả Mạo

Trang web giả mạo là những trang được thiết kế để giống hệt với trang web thật nhằm lừa đảo người dùng. Chúng thường được sử dụng để thu thập thông tin nhạy cảm như mật khẩu và thông tin thẻ tín dụng.

1.2. Tầm Quan Trọng Của Việc Phát Hiện

Việc phát hiện trang web giả mạo không chỉ bảo vệ thông tin cá nhân mà còn giúp duy trì uy tín của các tổ chức và doanh nghiệp. Các cuộc tấn công giả mạo có thể gây thiệt hại lớn về tài chính và danh tiếng.

II. Vấn Đề và Thách Thức Trong Phát Hiện Trang Web Giả Mạo

Mặc dù có nhiều kỹ thuật phát hiện, nhưng vẫn tồn tại nhiều thách thức trong việc nhận diện trang web giả mạo. Các kẻ tấn công ngày càng tinh vi hơn, khiến cho việc phát hiện trở nên khó khăn hơn.

2.1. Sự Tinh Vi Của Các Cuộc Tấn Công

Các trang web giả mạo ngày nay thường sao chép giao diện và chức năng của trang thật một cách hoàn hảo, làm cho người dùng khó phân biệt. Điều này đòi hỏi các kỹ thuật phát hiện phải ngày càng cải tiến.

2.2. Thiếu Tài Nguyên và Công Nghệ

Nhiều tổ chức không có đủ tài nguyên để triển khai các giải pháp phát hiện hiệu quả. Việc thiếu hụt công nghệ và nhân lực cũng là một rào cản lớn trong việc bảo vệ an ninh mạng.

III. Phương Pháp Phát Hiện Trang Web Giả Mạo Hiệu Quả

Có nhiều phương pháp khác nhau để phát hiện trang web giả mạo, mỗi phương pháp có ưu và nhược điểm riêng. Việc lựa chọn phương pháp phù hợp là rất quan trọng để đảm bảo hiệu quả.

3.1. Thuật Toán TF IDF Trong Phát Hiện

Thuật toán TF-IDF (Term Frequency-Inverse Document Frequency) được sử dụng để xác định các từ khóa đặc trưng của trang web. Phương pháp này giúp phân loại trang web dựa trên nội dung và tần suất từ khóa.

3.2. Phương Pháp Bayesian Trong Phát Hiện

Phương pháp Bayesian cho phép phát hiện các trang web giả mạo chưa từng thấy trước đó. Đây là một giải pháp hứa hẹn cho việc phát hiện lừa đảo 0 ngày, giúp bảo vệ người dùng khỏi các mối đe dọa mới.

3.3. So Sánh Hình Ảnh Trang Web

Phương pháp này kiểm tra sự tương đồng về hình ảnh giữa các trang web. Nếu hai trang có cấu trúc hình ảnh giống nhau, khả năng cao một trong số đó là giả mạo.

IV. Ứng Dụng Thực Tiễn Của Kỹ Thuật Phát Hiện

Các kỹ thuật phát hiện trang web giả mạo đã được áp dụng rộng rãi trong nhiều lĩnh vực, từ ngân hàng đến thương mại điện tử. Việc ứng dụng hiệu quả các phương pháp này có thể giảm thiểu rủi ro cho người dùng.

4.1. Ứng Dụng Trong Ngân Hàng

Ngân hàng sử dụng các kỹ thuật phát hiện để bảo vệ khách hàng khỏi các trang web giả mạo. Điều này giúp duy trì lòng tin của khách hàng và bảo vệ thông tin tài chính.

4.2. Ứng Dụng Trong Thương Mại Điện Tử

Thương mại điện tử cũng áp dụng các phương pháp phát hiện để bảo vệ người tiêu dùng khỏi các trang web giả mạo. Việc này không chỉ bảo vệ thông tin cá nhân mà còn tăng cường trải nghiệm mua sắm trực tuyến.

V. Kết Luận và Tương Lai Của Kỹ Thuật Phát Hiện

Kỹ thuật phát hiện trang web giả mạo đang phát triển nhanh chóng. Tuy nhiên, vẫn cần nhiều nghiên cứu và cải tiến để đối phó với các mối đe dọa mới. Tương lai của lĩnh vực này hứa hẹn sẽ có nhiều tiến bộ.

5.1. Xu Hướng Nghiên Cứu Mới

Các nghiên cứu mới đang tập trung vào việc phát triển các thuật toán thông minh hơn, có khả năng học hỏi từ các cuộc tấn công trước đó để cải thiện khả năng phát hiện.

5.2. Tầm Quan Trọng Của Giáo Dục Người Dùng

Giáo dục người dùng về các mối đe dọa từ trang web giả mạo là rất quan trọng. Việc nâng cao nhận thức sẽ giúp người dùng tự bảo vệ mình tốt hơn.

17/07/2025
Luận văn thạc sĩ hay nghiên cứu một số kỹ thuật phát hiện trang web giả mạo và ứng dụng

Trích đoạn nội dung tài liệu

Đặt vấn đề Hiện nay, công nghệ thông tin hầu nhƣ đƣợc áp dụng rộng rãi trên toàn cầu, nƣớc chúng ta cũng đang dần chuyển mình từ từ tiếp xúc với công nghệ vì thấy đƣợc lợi ích to lớn trong việc áp dụng công nghệ thông tin vào các lĩnh vực nhƣ kinh doanh, quản lý, mua sắm,. nói chung là tất cả nhu cầu của con ngƣời. Một trong những dịch vụ công nghệ hàng đầu đƣợc sử dụng phổ biến nhất là dịch vụ WEB. Với công nghệ WEB hiện tại thì có thể đáp ứng mọi nhu cầu của con ngƣời và hơn thế nữa.

Giả mạo (phishing biến thể từ fishing nghĩa là câu cá và phreaking nghĩa là nhử ngƣời dùng tiết lộ bí mật), trong lĩnh vực bảo mật máy tính là một hành vi giả mạo ác ý nhằm lấy đƣợc các thông tin nhạy cảm nhƣ tên ngƣời dùng, mật khẩu và các chi tiết thẻ tín dụng bằng cách giả dạng thành một chủ thể tin cậy trong một giao dịch điện tử. Vấn đề giả mạo (phishing hay fake) nói chung và giả mạo web nói riêng là một loại tội phạm kỹ thuật xã hội đang có xu hƣớng gia tăng trên mạng. Giả mạo đƣợc báo cáo là vấn nạn web lần đầu tiên vào năm 2001 của hiệp hội bảo vệ khách hàng, hiệp hội thƣơng mại liên bang của Mỹ và ngày nay nhóm làm việc chống giả mạo APWG (Anti Phishing Working Group) đã đƣa ra thông số những trang web giả đang tăng khoảng 50% mỗi năm. Hầu hết các tấn công lừa đảo hiện đại xảy ra bằng cách thu hút ngƣời sử dụng truy cập vào một trang web độc hại trông và hoạt động giống nhƣ bản gốc.

Khi đó, ngƣời sử dụng nếu bị thuyết phục rằng trang này là xác thực có thể cung cấp thông tin cá nhân bao gồm cả thông tin xác thực hoặc thông tin ngân hàng. Những thông tin này thƣờng đƣợc kẻ sử dụng để thực hiện một số hình thức của hành vi trộm cắp hay gian lận trong thực tế. Do vậy, việc nghiên cứu và phát hiện các trang web giả mạo là một nhu cầu cấp thiết hiện nay. Phát hiện trang web giả mạo là việc đầu tiên để ngăn chặn và xóa bỏ các trang web giả mạo.

Hiện nay có rất nhiều các cách tiếp cận khác nhau để phát hiện các trang web giả mạo. LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 2 Một đặc tính nổi bật nhất của trang web giả mạo là nó phải tƣơng tự nhƣ trang web gốc. Điều này có nghĩa là hai trang web gốc và web giả mạo có cấu trúc giống nhau đến mức tốt nhất để ngƣời dùng có đủ tự tin tiết lộ những thông tin nhạy cảm. Hầu hết các trang lừa đảo đều làm tốt việc tạo giao diện hợp lệ bằng cách sao chép bố trí trang, font, kiểu, logo và thậm chí các thông tin bảo mật của trang hợp lệ.

Có nhiều kỹ thuật và giải pháp để phát hiện trang web giả mạo: 1. Hướng mở rộng các giải pháp từ thư rác: Thuật toán TF-IDF (Term Frequency/Inverse Document Frequency) sử dụng những từ khóa duy nhất để xác định một trang cụ thể. Kỹ thuật này thƣờng đƣợc dùng trong khai thác văn bản hoặc với các máy tìm kiếm để tìm các trang liên quan. Thuật toán TF- IDF sẽ xác định những từ khóa của một trang web, những từ khóa này đƣợc đƣa vào một máy tìm kiếm chẳng hạn Google và lấy ra nhóm những URL trên cùng.

Nếu trang web bị nghi ngờ nằm trong nhóm đó thì trang này đƣợc coi là hợp lệ, ngƣợc lại nó sẽ bị cho là lừa đảo vì hầu hết các trang lừa đảo không có thứ hạng cao trong các kết quả của máy tìm kiếm. Thuật toán này đƣợc ứng dụng trong giải pháp Cantina đƣợc phát triển bởi các nhà nghiên cứu của Đại học Carnegie Mellon với việc sử dụng năm từ khóa có tần suất xuất hiện cao nhất trong trang. Tuy nhiên giải pháp chỉ phù hợp khi có hai giả thiết sau: - Thứ nhất, trang lừa đảo phải nhìn và hoạt động giống với trang hợp lệ thì mới cho kết quả từ khóa đƣợc xác định bởi TF-IDF giống nhau. - Thứ hai, các máy tìm kiếm phải cho kết quả xếp hạng các trang web hợp lệ chính xác và cao hơn các trang lừa đảo.

Hướng sử dụng giải pháp Bayesian: Thuật toán lọc Bayesian vốn đƣợc phát triển để phát hiện thƣ rác nhƣng các nhà nghiên cứu của Đại học Iowa đã sử dụng thuật toán này để phát triển thành công cụ chống lừa đảo đƣợc đặt tên là B-APT. Lợi thế chính của thuật toán này là có khả năng phát hiện đƣợc những đối tƣợng chƣa từng nhìn thấy trƣớc đó. Việc sử dụng phép lọc Bayesian là một giải pháp hứa hẹn cho việc phát hiện lừa đảo 0 ngày LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 3 (zero-day) vì nó có thể phát hiện những trang web lừa đảo mới và không dựa trên một sách đen. Hướng tiếp cận để phát hiện các trang web giả mạo bước đầu là kiểm tra xem “hình dáng” hay cấu trúc của chúng có giống nhau không.

Nếu giống thì sẽ sử dụng thêm một số kỹ thuật khác để làm rõ các chi tiết kỹ thuật để phát hiện đó là trang web giả mạo hay trang web hợp lệ. Mặt khác, DOM là tên gọi tắt của Document Object Model – là một chuẩn đƣợc định nghĩa bởi W3C dùng để truy xuất và thao tác trên các tài liệu có cấu trúc dạng HTML và XML bằng các ngôn ngữ lập trình thông dịch nhƣ Javascript, PHP, python,… Do vậy, để so sánh hai trang web với nhau chúng ta có thể so sánh hai DOM – Tree tƣơng ứng của chúng. Hướng giải pháp liên quan đến một thuật toán phát hiện sự giống nhau của hai trang web về hình ảnh. Hƣớng tiếp cận này kiểm tra sự hiển thị tƣơng đồng của một trang web và so sánh những đặc trƣng hiển thị của nó với một trang web hợp lệ lƣu trong danh sách trắng.

Ngƣời ta đã đề xuất một giải pháp chống giả mạo mới bằng cách sử dụng 2 thuật toán K-mean và Naive bayes. Nếu hai trang web có cấu trúc giống nhau về hình ảnh thì có thể nghi ngờ, tiếp theo sử dụng các thuật toán dựa trên sự tƣơng đồng về hình ảnh của hai trang web để so sánh các thành phần chi tiết của chúng để phát hiện trang Web giả mạo. Chính vì vậy học viên lựa chọn đề tài “Nghiên cứu một số kỹ thuật phát hiện trang Web giả mạo và ứng dụng” cho luận văn cao học của mình. Mục tiêu của luận văn - Tìm hiểu bài toán và các kỹ thuật phát hiện giả mạo web.

- Xây dựng chƣơng trình và thử nghiệm tìm kiếm các trang web giả mạo bằng thuật toán Naïve Bayes. Đối tƣợng và phạm vi nghiên cứu - Bài toán giả mạo web, các thuật toán liên quan đến phát hiện trang web giả mạo, các trang web. - Ngôn ngữ lập trình C#. LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 4 Chƣơng 1 TỔNG QUAN VỀ AN NINH MẠNG VÀ BÀI TOÁN GIẢ MẠO WEBSITE.

Tổng quan về an ninh mạng 1. Giới thiệu về an ninh mạng Ngày nay an ninh mạng là một vấn đề đƣợc nhiều ngƣời quan tâm. Có rất nhiều trang web bị tấn công. Các cuộc tấn công này gây ra thiệt hại lớn về thông tin, tài sản, uy tín của các công ty, tổ chức.

[2] Theo thống kê của Bkav, trong năm 2012 vẫn có tới 2.203 website của các cơ quan doanh nghiệp tại Việt Nam bị tấn công, chủ yếu thông qua các lỗ hổng trên hệ thống mạng.245 website bị tấn công), con số này hầu nhƣ không giảm. Cuối năm 2013, việc lợi dụng các file văn bản để cài phần mềm gián điệp đã tiến thêm một bƣớc, không cần thông qua lỗ hổng mà chuyển sang sử dụng hình thức phishing. Trung tuần tháng 12, Bkav phát hiện một loạt các vụ tin tặc chèn mã độc vào file văn bản không sử dụng lỗ hổng. Mã độc ẩn dƣới hình thức một ảnh thu nhỏ đƣợc nhúng trực tiếp vào file văn bản.

Để đọc nội dung, chắc chắn ngƣời dùng sẽ click để mở ảnh lớn hơn, nhƣ vậy sẽ kích hoạt mã độc. Ông Ngô Tuấn Anh, Phó chủ tịch phụ trách An ninh mạng của Bkav, cho biết: “Với hình thức này, bất kỳ máy tính nào cũng sẽ bị cài phần mềm gián điệp mà không cần lỗ hổng. Phishing để cài đặt phần mềm gián điệp sẽ đƣợc sử dụng rộng rãi và là xu hƣớng trong năm 2014”. Có thể thấy, an ninh mạng ngày càng phức tạp và là vấn đề nóng trong những năm gần đây.

LUAN VAN CHAT LUONG download : add luanvanchat@agmail. Báo cáo về tội phạm Internet Hình 1. Số lƣợng dữ liệu bị đánh cắp 1. Nguy cơ ảnh hƣởng tới an toàn mạng Các hacker thƣờng xuyên lợi dụng lỗ hổng có sẵn để tấn công.

Dƣới đây là thống kê năm 2009 về một vài phƣơng pháp tấn công phổ biến : LUAN VAN CHAT LUONG download : add luanvanchat@agmail. Tỷ lệ lỗ hổng trên các trang web 1. Các khái niệm cơ bản 1.Tấn công giả mạo Tấn công giả mạo làm cho địa chỉ nguồn của gói tin bị thay đổi và có vẻ nhƣ đƣợc xuất phát từ một địa chỉ (máy tính) khác. Trong đó kẻ tấn công thiết lập một thế giới giả giống nhƣ thật xung quanh nạn nhân.

Nạn nhân có thể sẽ không nhận ra sự khác biệt giữa thật và giả đó. Hành động gây mất thông tin Là những quyết định, hành động của ngƣời dùng có thể dẫn tới hậu quả nhƣ bị tiết lộ, thất thoát những thông tin bí mật của bản thân hoặc bị kẻ khác vi phạm quyền riêng tƣ. Khung cảnh / bối cảnh Trình duyệt hiển thị cho ngƣời dùng nhiều loại khung cảnh, ngƣời dùng dựa vào đó để đƣa ra các quyết định của mình. Lỗ hổng Các lỗ hổng bảo mật trên một hệ thống là các điểm yếu có thể tạo ra sự ngƣng trệ của dịch vụ, thêm quyền đối với ngƣời sử dụng hoặc cho phép các truy nhập không hợp pháp vào hệ thống.

Các lỗ hổng cũng có thể nằm ngay các dịch vụ cung cấp nhƣ sendmail, web, ftp. Ngoài ra các lỗ hổng còn tồn LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 7 tại ngay chính tại hệ điều hành nhƣ trong Windows NT, Windows 95, UNIX; hoặc trong các ứng dụng mà ngƣời sử dụng thƣờng xuyên sử dụng nhƣ Word processing, các hệ databases. Theo cách phân loại của Bộ quốc phòng Mỹ, các loại lỗ hổng bảo mật trên một hệ thống đƣợc chia nhƣ sau:  Lỗ hổng loại C: Các lỗ hổng loại này cho phép thực hiện các phƣơng thức tấn công theo DoS (Dinal of Services - Từ chối dịch vụ).

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu có tiêu đề Kỹ Thuật Phát Hiện Trang Web Giả Mạo: Nghiên Cứu và Ứng Dụng cung cấp cái nhìn sâu sắc về các phương pháp và công nghệ hiện đại được sử dụng để phát hiện các trang web giả mạo. Tài liệu này không chỉ nêu rõ các kỹ thuật phát hiện mà còn phân tích hiệu quả của chúng trong việc bảo vệ người dùng khỏi các mối đe dọa trực tuyến. Độc giả sẽ tìm thấy những lợi ích thiết thực từ việc áp dụng các kỹ thuật này, bao gồm việc nâng cao nhận thức về an toàn mạng và bảo vệ thông tin cá nhân.

Để mở rộng kiến thức về bảo mật thông tin, bạn có thể tham khảo tài liệu Nghiên cứu thuật toán mã hóa có xác thực deoxysii luận văn thạc sĩ, nơi trình bày các phương pháp mã hóa tiên tiến giúp bảo vệ dữ liệu. Ngoài ra, tài liệu Luận văn thạc sĩ nghiên cứu nâng cao tính bảo mật trong giấu tin ứng dụng thuật toán giấu tin cpt trên ảnh 24 bit màu cũng sẽ cung cấp cho bạn những hiểu biết về cách giấu thông tin trong hình ảnh, một khía cạnh quan trọng trong bảo mật thông tin. Những tài liệu này sẽ giúp bạn có cái nhìn toàn diện hơn về các phương pháp bảo vệ thông tin trong môi trường số.