Chương 1: Giới thiệu đề tài. Luận văn gồm các phần sau: – Chương 2: Những công trình liên quan. Tổng quan các nghiên cứu liên quan, những hạn chế về giải pháp hiện tại. – Chương 3: Nền tảng lý thuyết.
Tóm tắt về hàm băm và toàn vẹn dữ liệu và thuật toán học máy cho phân loại. – Chương 4: Phương pháp sinh chữ ký tự động và đề xuất mô hình lai cho phân loại trang web. Trình bày mô hình lai cho phân loại trang web bị deface hay bình thường và cách tiếp cận mới cho việc sinh chữ ký tự động. – Chương 5: Kết quả và thảo luận.
Trình bày kết quả thực nghiệm, đánh giá so sánh với kết quả của các nghiên cứu trước đó. – Chương 6: Kết luận và hướng phát triển. Đánh giá kết quả đề tài và định hướng phát triển tiếp theo. 3 CHƯƠNG 2: NHỮNG CÔNG TRÌNH LIÊN QUAN 2.
Các nghiên cứu phát hiện kiểu tấn công an ninh mạng Deface 2.1 Woonyon Kim: Giải pháp giảm tỷ lệ cảnh báo sai (2006) [1] Bài báo tính tới thời điểm hiện tại đã qua thời gian khá dài, tuy nhiên kết quả và các kỹ thuật đều được các nghiên cứu sau này làm nền tảng để triển khai mở rộng. Tác giả đã chỉ giới hạn của việc sử dụng hàm băm để phát hiện thay đổi trên trang web, bởi vì các máy chủ web phản hồi dữ liệu được soạn bằng cách chạy các tập lệnh phía máy chủ hoặc hệ thống quản lý cơ sở dữ liệu truy vấn khi người dùng gửi yêu cầu lên các trang web, do đó nội dung của các trang web liên tục khác nhau. Để giải quyết vấn đề này nghiên cứu đề xuất giải pháp trích xuất đặc trưng của trang web trước và sau, sau đó tính toán sự tương đồng và dựa trên một ngưỡng nhất định để phát cảnh báo. Như vậy, về tổng quan có thể thấy giải pháp đề xuất của tác giả khá tương đồng với một hệ thống học máy.
Để trích xuất đặc trưng của trang web, nghiên cứu sử dụng mô hình n-gram là các kí tự liền kề của một chuỗi với n = 2. Dựa theo luật Zipf sẽ luôn có một bộ các từ với tần suất xuất hiện ưu thế hơn các từ khác của ngôn ngữ đang sử dụng. Do đó, trang web được tải tại hai thời điểm khác nhau nên có cùng phân phối 2-gram. Sau khi đã có bộ tần suất từ của trang web gọi là bộ vectơ đặc trưng, thì việc so sánh tương đồng khá đơn giản với việc tính khoảng cách sim(ti , t j ) cosin của vectơ trước và sau khi giám sát.
Việc phát cảnh báo sẽ dựa trên một ngưỡng nhất định, ngưỡng này cần được khởi tạo giá trị ban đầu khi chạy hệ thống và do nội dung trang web sẽ thay đổi theo thời gian cho nên nghiên cứu cũng đã đề xuất giải pháp định kỳ cập nhật ngưỡng cảnh báo cho trang web (2 lần mỗi ngày). Mặc dù kết quả thực nghiệm giải pháp cập nhật ngưỡng định kỳ khá tốt, tuy nhiên với các trang web có nội dung thay đổi liên tục thì sẽ khó có thể có hiệu quả cao. Mặt khác, việc tính tương đồng bằng cosin khá đơn giản và với sự phát triển của các thuật toán học máy ngày nay thì đây sẽ là khoảng trống cho các nghiên cứu mới có thể tối ưu.2 Hiện thực kỹ thuật phát hiện tấn công Deface (2015) [2] Nghiên cứu xây dựng một mô-đun dịch vụ web Apache cho phát hiện tấn công Deface. Cơ chế phát hiện thay đổi dựa trên so sánh giá trị băm các tập tin HTML.
Tuy nhiên, kỹ thuật này chỉ phù hợp cho trang web tĩnh và với trang web động có nội dung thay đổi liên tục sẽ không hiệu quả. Đây cũng chính là điểm hạn chế mà tác giả đề cập để phát triển cho nghiên cứu sau này.3 Công cụ giám sát xâm nhập và Deface trang web: WDIMT (2017) [3] WDIMT là công cụ được sử dụng để phát hiện hành vi phá hoại trang web. Kiến trúc triển khai với hai máy tính linux và window cho hai nhiệm vụ: • Máy linux: để quản trị viên thực hiện giám sát hệ thống, khởi tạo lại trạng thái ban đầu khi bị tấn công hay xác nhận trạng thái các tập tin trên máy chủ là an toàn. • Máy window: là giao diện tương tác người dùng, thể hiện các trạng thái của tập tin: tạo, xóa, sửa (hình 2.1: Trang web WDIMT với trạng thái thay đổi của các tập tin [3] Để xác thực sự thay đổi của trang web, công cụ sử dụng kỹ thuật so sánh giá trị băm của các file trên trang web.
Đây là điểm giới hạn mà nghiên cứu của Woonyon Kim đã chỉ ra, các trang web ngày nay với nội dung thay đổi liên tục thì việc so sánh giá trị băm sẽ cho ra cảnh báo sai và không hiệu quả. Một giới hạn thứ hai của công cụ là việc triển khai khá phức tạp. Với hai máy linux và window, sử dụng quản trị cần thành thạo các câu lệnh linux sẽ là trở ngại cho người dùng, do đó sẽ khó có thể đạt hiệu quả tốt.4 Phương thức phát hiện Deface trang web dựa trên học máy (2018) [4] Nghiên cứu đề xuất phương pháp phát hiện Deface dựa trên học máy gồm 2 giai đoạn: • Giai đoạn 1: thu thập dữ liệu bao gồm trang web trạng thái bình thường và trang web bị tấn công Deface từ zone-h. • Giai đoạn 2: Tiền xử lý dữ liệu và trích xuất đặc trưng để làm giữ liệu đầu vào cho thuật toán học máy.2: Các bước giai trong đoạn huấn luyện [4] Việc trích xuất đặc trưng tác giả cũng sử dụng mô hình n-gram với n=2 và 3.
Tiến hành tính toán tần suất xuất hiện của các gram (term frequency) và chọn 300 tần suất cao nhất để xây dựng vectơ đặc trưng. Sau đó, sử dụng 2 thuật toán học máy Naı̈ve Bayes và Cây quyết định J48 để phân loại. Tổng quan thực nghiệm, thuật toán cây quyết định J48 cho kết quả tốt hơn Naı̈ve Bayes. Tỷ lệ phân loại chính xác lên đến 93% và cảnh báo sai dưới 1% cho mọi trường hợp.
Từ đây cho thấy, các kỹ thuật học máy rất có tiềm năng cho xây dựng hệ thống phát hiện tấn công Deface hiệu quả. Mặt khác, tập dữ liệu khá nhỏ tổng cộng 400 trang web nên cần nghiên cứu với tập dữ liệu thực tế để mang tính thực tiễn hơn.5 Nghiên cứu các chiến dịch Deface trang web trên diện rộng (2018) [5] Nghiên cứu tập trung vào phân tích các trang web bị tấn công Deface. Tự động nhận diện chiến dịch, phân lớp các trang web tương đồng vào cùng cụm và gán nhãn cho cụm đó. Dữ liệu được trực quan hóa thành các bảng, biểu đồ cho thấy rằng các thông tin do các kẻ tấn công để lại cho phép một nhà phân tích chuyên môn điều tra phương thức hoạt động và cấu trúc xã hội của các tác nhân, đồng thời mở rộng từ một trang deface duy nhất sang một nhóm các deface liên quan.6 Giải pháp cho phát hiện và ngăn chặn Deface trang web (2019) [6] Phương pháp nghiên cứu đề xuất không chỉ tập trung vào việc phát hiện mà còn tập trung vào các cơ chế phòng ngừa và tự bảo vệ để giảm thiểu tác động của việc Deface trang web.
Mô hình triển khai gồm 2 thành phần: – Thành phần máy khách là tập lệnh python được cài đặt trên máy chủ web được giám sát. Mỗi lần thực thi tập lệnh, một tập tin chứa giá trị băm của tất cả các tệp của trang web sẽ được tạo. Tập tin này sau đó được tải lên máy chủ ngoại tuyến. – Thành phần máy chủ sẽ so sánh tệp tin nhận được từ máy khách với các giá trị tham chiếu của chúng được lưu trữ trên máy chủ ngoại tuyến.
Tại mỗi lần thay đổi nội dung tập tin của trang web, quản trị viên sẽ xác nhận và tăng giá trị λ lưu trữ trên máy chủ. Tiếp đó, giá trị băm mới của trang web sẽ được cập nhật.3: Tiến trình cập nhật làm mới tập tin băm [6] Khi giá trị băm ở máy chủ và máy khách khác nhau, cùng đó là giá trị λ không hợp lệ thì có nghĩa hệ thống đã bị xâm nhập, các tập tin trên trang web giám sát đã bị thay đổi bất hợp lệ. Lúc này, hệ thống sẽ tải lại các tập tin ở trạng thái ban đầu đề khắc phục sự cố. Nhìn chung, phương pháp nghiên cứu đề xuất khá tương đồng với công cụ WDIMT với hai thành phần: máy khách và máy chủ, và cơ chế khôi phục trạng thái gốc để khắc phục sự cố.
Cùng với đó là việc so sánh giá trị băm của các tập tin sẽ khó có thể có hiệu quả, khi dữ liệu được truy vấn từ cơ sở dữ liệu và thay đổi liên tục.7 Phương thức phát hiện Deface trang web dựa trên học máy và chữ ký tấn công (2019)[7] Là nghiên cứu mở rộng từ nghiên cứu trước của tác giả [4] với việc kết hợp thêm thông tin từ các trang web đã bị tấn công Deface trước đó gọi là chữ ký tấn công (attack signatures) và thuật toán học máy cho phân loại. Giai đoạn huấn luyện (hình 2.4) có ba điểm chính: tạo giá trị băm của trang web, huấn luyện mô hình học máy và tạo chữ ký tấn công.4: Mô hình lai: giai đoạn huấn luyện [6] Giai đoạn phát hiện (hình 2.5) tiến trình gồm các bước chính như sau: – Tải nội dung trang web, tiến hành trích xuất và so sánh chữ ký tấn công với cơ sở dữ liệu chữ ký đã xây dựng ở giai đoạn huấn luyện. Nếu kết quả không phát hiện bị tấn công tiến trình tới bước tiếp theo. – Phân loại với mô hình học máy đã huấn luyện.
Kết quả ở bước này sẽ là bị tấn công hay không. – Kiểm tra thay đổi nội dung trang web bằng việc so sánh giá trị băm của nội trung trang trước và tại thời điểm giám sát. Nếu kết quả là có thay đổi sẽ phát cảnh báo cho quản trị viên để xác nhận và cập nhật lại dữ liệu băm.5: Mô hình lai: giai đoạn phát hiện [6] Kết quả tổng quan thực nghiệm của mô hình rất tốt với độ chính xác lên đến 99.26% và tỷ lệ dự đoán sai dưới 0. Có thể nói là kết quả nổi trội nhất trong các nghiên cứu những năm gần đây.
Và việc sử dụng thuật toán học máy đơn giản, mô hinh tiêu tốn ít tài nguyên tính toán hơn. Với phương thức so sánh chữ ký tấn công tỷ lệ phát hiện từ 22%-47% và không có dự đoán sai cho thông tin trích xuất từ 50 trang web bị tấn công.