Đồ án: Ứng dụng học máy phát hiện và ngăn chặn tấn công web

Khám phá cách ứng dụng học máy để phát hiện và ngăn chặn tấn công web hiệu quả. Bài viết phân tích chi tiết các phương pháp và lợi ích.

Trường đại học

Đại học Bách Khoa Hà Nội

Chuyên ngành

Công Nghệ Thông Tin

Người đăng

Ẩn danh

Thể loại

Đồ án tốt nghiệp

2018

46
2
0

Phí lưu trữ

30 Point

Tóm tắt

I. Tổng Quan Phát Hiện Tấn Công Web Học Máy Giải Pháp Cybersecurity

Trong bối cảnh an ninh web ngày càng trở nên quan trọng, việc phát hiện và ngăn chặn các cuộc tấn công web là một thách thức lớn. Các phương pháp truyền thống dựa trên signature-based đang dần bộc lộ những hạn chế, đặc biệt là đối với các cuộc tấn công zero-day. Bài viết này sẽ khám phá cách học máy trong an ninh mạng có thể mang lại một giải pháp hiệu quả hơn. Theo thống kê từ các công ty bảo mật hàng đầu như Bkav, CMC, hàng năm có hàng ngàn website tại Việt Nam bị tấn công, với tỷ lệ lớn các website tồn tại những lỗ hổng nghiêm trọng. Điều này cho thấy sự cấp thiết của việc nâng cao khả năng phòng thủ cho các website. Các WAF (Web Application Firewall) hiện nay thường sử dụng phương pháp signature-based, đòi hỏi phải liên tục cập nhật bộ luật để đối phó với các cuộc tấn công mới, tốn kém thời gian và nguồn lực. Hơn nữa, phương pháp này không hiệu quả đối với các zero-day exploit. Học máy mang lại khả năng phát hiện tấn công web vượt trội, dễ duy trì, phát triển và có độ chính xác cao hơn. Mô hình học máy tập trung vào ứng dụng web mà nó đang bảo vệ, dựa trên các thuộc tính, đặc điểm của chính ứng dụng web đó để phát hiện ra các traffic độc hại, giảm bớt gánh nặng cho đội ngũ bảo mật. Mục tiêu của đồ án tốt nghiệp này là tìm ra phương pháp học máy cho độ chính xác cao nhất đối với việc phát hiện tấn công web và áp dụng phương pháp học máy tìm được để xây dựng một hệ thống WAF cơ bản, bảo vệ ứng dụng web.

1.1. Tầm Quan Trọng Của Phát Hiện Xâm Nhập Trong An Ninh Web

Việc phát hiện sớm các xâm nhập là yếu tố then chốt trong việc bảo vệ an ninh web. Một hệ thống IDS (Intrusion Detection System) hiệu quả có thể giúp ngăn chặn các cuộc tấn công trước khi chúng gây ra thiệt hại nghiêm trọng. Phát hiện xâm nhập sử dụng máy học cho phép nhận diện các hành vi bất thường và các tấn công chưa biết đến. Theo đồ án tốt nghiệp của Hoàng Phú Hoan, các hệ thống bảo mật web hiện tại vẫn còn nhiều hạn chế. Cần có một hệ thống có khả năng học và thích nghi để đối phó với các mối đe dọa mới.

1.2. Hạn Chế Của Phương Pháp Phát Hiện Tấn Công Web Truyền Thống

Các phương pháp phát hiện tấn công dựa trên signature-based có những hạn chế nhất định. Chúng chỉ có thể phát hiện các cuộc tấn công đã biết và đòi hỏi phải liên tục cập nhật bộ luật. Các cuộc tấn công zero-day thường không thể bị phát hiện bởi các hệ thống này. Cần có một phương pháp linh hoạt hơn, có khả năng học hỏi từ dữ liệu và phát hiện các hành vi bất thường. Máy học là một giải pháp tiềm năng cho vấn đề này.

1.3. Ứng Dụng Học Máy Trong Phòng Chống Tấn Công Mạng

Học máy có thể được sử dụng để xây dựng các hệ thống IPS (Intrusion Prevention System) thông minh, có khả năng tự động phát hiện và ngăn chặn các cuộc tấn công mạng. Các thuật toán học máy có thể phân tích dữ liệu traffic mạng để nhận diện các hành vi bất thường và các dấu hiệu của cuộc tấn công. Mô hình học máy này thay vì việc chạy theo các phương thức tấn công mới thì sẽ chỉ cần tập trung vào ứng dụng web mà nó đang bảo vệ, dựa trên các thuộc tính, đặc điểm của chính ứng dụng web đó để phát hiện ra các traffic độc hại.

II. Thách Thức An Ninh Web Tấn Công SQL Injection XSS DDoS

Các cuộc tấn công web ngày càng trở nên tinh vi và đa dạng. Tấn công SQL Injection, tấn công XSS (Cross-Site Scripting), và tấn công DDoS (Distributed Denial of Service) là những mối đe dọa phổ biến đối với an ninh web. Các cuộc tấn công này có thể gây ra thiệt hại nghiêm trọng cho website, bao gồm mất dữ liệu, gián đoạn dịch vụ, và tổn hại uy tín. Theo báo cáo từ OWASP, các lỗ hổng bảo mật web phổ biến nhất bao gồm: Tồn tại các file cũ, Lộ mã nguồn website, Không kiểm tra dữ liệu người dùng, Cross site scripting, SQL injection,... Các phương pháp bảo mật truyền thống thường không đủ sức để đối phó với các cuộc tấn công này. Cần có một giải pháp bảo mật toàn diện hơn, có khả năng phát hiện và ngăn chặn các cuộc tấn công một cách hiệu quả.

2.1. Phân Loại Tấn Công Web XSS SQL Injection DDoS và Hơn Thế Nữa

Có nhiều loại tấn công web khác nhau, mỗi loại có một cách thức hoạt động và mục tiêu riêng. Phân loại tấn công là bước đầu tiên quan trọng trong việc xây dựng một hệ thống phòng thủ hiệu quả. Ví dụ, tấn công SQL Injection lợi dụng các lỗ hổng trong việc xử lý dữ liệu đầu vào để thực hiện các truy vấn SQL trái phép, trong khi tấn công XSS chèn các đoạn mã độc vào website để tấn công người dùng.

2.2. Các Lỗ Hổng An Ninh Web Phổ Biến OWASP Top 10

OWASP Top 10 là một danh sách các lỗ hổng an ninh web phổ biến nhất, được cập nhật hàng năm. Danh sách này cung cấp một cái nhìn tổng quan về các mối đe dọa lớn nhất đối với an ninh web và giúp các nhà phát triển tập trung vào việc khắc phục các lỗ hổng quan trọng nhất. Việc hiểu rõ OWASP Top 10 là rất quan trọng để xây dựng một hệ thống bảo mật web hiệu quả.

2.3. Bảo Vệ API Security Ứng Dụng Web API và Mối Đe Dọa

API security là một lĩnh vực quan trọng trong an ninh web, đặc biệt là với sự phát triển của các ứng dụng web dựa trên API. Các API có thể trở thành mục tiêu của các cuộc tấn công, và việc bảo vệ API là rất quan trọng để bảo vệ dữ liệu và chức năng của ứng dụng web. Theo Hoàng Phú Hoan, các API có thể trở thành mục tiêu tấn công nếu không được bảo vệ đúng cách.

III. Cách Ứng Dụng Học Máy Mô Hình Thuật Toán Dữ Liệu Huấn Luyện

Học máy có thể được ứng dụng để xây dựng các hệ thống phát hiện và ngăn chặn tấn công web một cách hiệu quả. Các mô hình học máy có thể được huấn luyện bằng dữ liệu traffic web để nhận diện các hành vi bất thường và các dấu hiệu của cuộc tấn công. Các thuật toán học máy phổ biến được sử dụng trong an ninh web bao gồm học sâu (deep learning), Support Vector Machines, và Random Forests. Việc lựa chọn dữ liệu huấn luyện phù hợp là rất quan trọng để đảm bảo độ chính xác và hiệu quả của mô hình. Cần có một bộ dữ liệu lớn, đa dạng và được gán nhãn chính xác.

3.1. Các Thuật Toán Học Máy Ưu Việt Trong Phát Hiện Tấn Công Web

Một số thuật toán học máy đặc biệt hiệu quả trong việc phát hiện tấn công web. Ví dụ, học sâu (deep learning) có thể tự động trích xuất các đặc trưng quan trọng từ dữ liệu traffic web, trong khi Support Vector Machines có thể phân loại các cuộc tấn công với độ chính xác cao. Việc lựa chọn thuật toán phù hợp phụ thuộc vào đặc điểm của dữ liệu và yêu cầu của bài toán.

3.2. Kỹ Thuật Trích Xuất Đặc Trưng Feature Extraction Trong Bảo Mật

Kỹ thuật trích xuất đặc trưng (feature extraction) là một bước quan trọng trong việc huấn luyện các mô hình học máy. Các đặc trưng được trích xuất từ dữ liệu traffic web phải có khả năng phân biệt giữa các cuộc tấn công và các hành vi bình thường. Các đặc trưng phổ biến bao gồm độ dài của URL, số lượng ký tự đặc biệt, và sự xuất hiện của các từ khóa độc hại.

3.3. Đánh Giá Mô Hình Học Máy Precision Recall F1 Score

Việc đánh giá mô hình học máy là rất quan trọng để đảm bảo hiệu quả của hệ thống bảo mật. Các chỉ số đánh giá phổ biến bao gồm Precision, Recall, và F1-score. Precision đo lường tỷ lệ các cuộc tấn công được phát hiện chính xác, Recall đo lường tỷ lệ các cuộc tấn công được phát hiện, và F1-score là một thước đo kết hợp giữa Precision và Recall.

IV. Phân Tích Hành Vi Phát Hiện Bất Thường Học Máy Tìm Kiếm Rủi Ro

Phân tích hành vi và phát hiện bất thường là một phương pháp hiệu quả để phát hiện các cuộc tấn công web chưa biết đến. Các hệ thống này theo dõi hành vi của người dùng và website để phát hiện các dấu hiệu bất thường. Khi một hành vi bất thường được phát hiện, hệ thống sẽ cảnh báo cho người quản trị hoặc tự động ngăn chặn hành vi đó. Học máy đóng vai trò quan trọng trong việc xây dựng các hệ thống phân tích hành vi và phát hiện bất thường thông minh, có khả năng tự động học hỏi và thích nghi với các mối đe dọa mới. Các hệ thống WAF hiện nay cần được cải thiện bằng cách tích hợp phân tích hành vi

4.1. Ứng Dụng Phân Tích Hành Vi Trong Phát Hiện Tấn Công Web

Phân tích hành vi có thể được sử dụng để phát hiện các cuộc tấn công web bằng cách theo dõi hành vi của người dùng và website. Ví dụ, một hệ thống phân tích hành vi có thể phát hiện một cuộc tấn công SQL Injection bằng cách nhận thấy rằng một người dùng đang cố gắng truy cập vào cơ sở dữ liệu một cách bất thường. Các hành vi bất thường cần được theo dõi bao gồm các truy cập trái phép, các thay đổi dữ liệu không mong muốn, và các hoạt động đáng ngờ khác.

4.2. Phát Hiện Bất Thường Tìm Kiếm Hoạt Động Đáng Ngờ Trong Traffic Mạng

Phát hiện bất thường là một phương pháp khác để phát hiện các cuộc tấn công web chưa biết đến. Các hệ thống này theo dõi traffic mạng để phát hiện các dấu hiệu bất thường. Ví dụ, một hệ thống phát hiện bất thường có thể phát hiện một cuộc tấn công DDoS bằng cách nhận thấy rằng một website đang nhận được một lượng lớn traffic từ một số lượng lớn các địa chỉ IP khác nhau.

4.3. Kết Hợp Phân Tích Hành Vi và Học Máy Để Tối Ưu An Ninh Web

Việc kết hợp phân tích hành vi và học máy có thể mang lại một hệ thống bảo mật web mạnh mẽ hơn. Các mô hình học máy có thể được huấn luyện bằng dữ liệu hành vi để nhận diện các dấu hiệu bất thường và dự đoán các cuộc tấn công. Các hệ thống này có khả năng tự động học hỏi và thích nghi với các mối đe dọa mới, giúp bảo vệ website khỏi các cuộc tấn công một cách hiệu quả.

V. Nghiên Cứu Thực Tế Ứng Dụng Học Máy Trong WAF và IDS

Nhiều nghiên cứu đã chứng minh hiệu quả của việc ứng dụng học máy trong WAFIDS. Các nghiên cứu này đã cho thấy rằng các hệ thống sử dụng học máy có thể phát hiện và ngăn chặn các cuộc tấn công web một cách hiệu quả hơn so với các hệ thống truyền thống. Theo đồ án tốt nghiệp của Hoàng Phú Hoan, việc trích chọn dữ liệu và sử dụng các thuật toán học máy phù hợp có thể cải thiện đáng kể khả năng phát hiện tấn công web.

5.1. Áp Dụng Học Máy Để Phát Hiện Tấn Công XSS và SQL Injection

Học máy đã được chứng minh là hiệu quả trong việc phát hiện các cuộc tấn công XSStấn công SQL Injection. Các mô hình học máy có thể được huấn luyện để nhận diện các dấu hiệu của cuộc tấn công, chẳng hạn như sự xuất hiện của các ký tự đặc biệt hoặc các từ khóa độc hại. Nghiên cứu của Shailendra Rathore* & Pradip Kumar Sharma về tấn công XSS rất đáng để tham khảo.

5.2. Tối Ưu Hiệu Suất Performance Optimization Cho Hệ Thống Phát Hiện Tấn Công

Tối ưu hiệu suất (performance optimization) là một yếu tố quan trọng trong việc triển khai các hệ thống phát hiện tấn công web sử dụng học máy. Các hệ thống này phải có khả năng xử lý một lượng lớn traffic mạng một cách nhanh chóng và hiệu quả. Các kỹ thuật tối ưu hiệu suất bao gồm sử dụng các thuật toán học máy hiệu quả, giảm thiểu lượng dữ liệu cần xử lý, và sử dụng các kỹ thuật song song hóa.

5.3. Phát Hiện Tấn Công Theo Thời Gian Thực Real Time Detection Với Học Máy

Phát hiện tấn công theo thời gian thực (real-time detection) là một yêu cầu quan trọng đối với các hệ thống bảo mật web. Các hệ thống này phải có khả năng phát hiện và ngăn chặn các cuộc tấn công web ngay khi chúng xảy ra. Học máy có thể được sử dụng để xây dựng các hệ thống phát hiện tấn công theo thời gian thực, có khả năng liên tục phân tích traffic mạng và cảnh báo cho người quản trị khi một cuộc tấn công được phát hiện.

VI. Tương Lai An Ninh Web AI Security Threat Intelligence Tự Động Hoá

Tương lai của an ninh web sẽ được định hình bởi AI security, threat intelligence, và tự động hoá. AI security sẽ giúp các hệ thống bảo mật web trở nên thông minh hơn và có khả năng tự động học hỏi và thích nghi với các mối đe dọa mới. Threat intelligence sẽ cung cấp thông tin về các cuộc tấn công mới nhất và giúp các hệ thống bảo mật web chuẩn bị cho các cuộc tấn công này. Tự động hoá sẽ giúp giảm thiểu gánh nặng cho người quản trị và cho phép các hệ thống bảo mật web phản ứng nhanh chóng với các cuộc tấn công. Học máy là nền tảng quan trọng cho sự phát triển của các công nghệ này.

6.1. AI Security Ứng Dụng Trí Tuệ Nhân Tạo Nâng Tầm Bảo Mật Web

AI security là một lĩnh vực mới nổi trong an ninh web, tập trung vào việc sử dụng trí tuệ nhân tạo để cải thiện khả năng bảo mật của các hệ thống web. AI security có thể được sử dụng để phát hiện các cuộc tấn công, phân tích traffic mạng, và dự đoán các mối đe dọa trong tương lai.

6.2. Threat Intelligence Cập Nhật Thông Tin Về Các Mối Đe Dọa An Ninh Mạng

Threat intelligence là thông tin về các mối đe dọa an ninh mạng, bao gồm thông tin về các cuộc tấn công mới nhất, các lỗ hổng bảo mật, và các đối tượng tấn công. Threat intelligence giúp các tổ chức bảo vệ hệ thống của họ khỏi các cuộc tấn công và giảm thiểu rủi ro.

6.3. Tự Động Hóa Bảo Mật Automated Security Giảm Tải Cho Chuyên Gia

Tự động hóa bảo mật (automated security) là việc sử dụng các công cụ và quy trình tự động để thực hiện các tác vụ bảo mật, chẳng hạn như phát hiện tấn công, vá lỗ hổng, và phản ứng với các sự cố bảo mật. Tự động hóa bảo mật giúp giảm thiểu gánh nặng cho các chuyên gia bảo mật và cho phép các tổ chức phản ứng nhanh chóng với các cuộc tấn công. Với các bước tự động hóa giúp cho quá trình vận hành an ninh mạng trở nên dễ dàng hơn.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI từ nội dung tài liệu gốc; tài liệu do người dùng đóng góp và được kiểm duyệt trước khi xuất bản. Báo lỗi nội dung.

20/09/2025
Áp dụng phương pháp học máy trong phát hiện và ngăn chặn tấn công web

Trích đoạn nội dung tài liệu

ĐẠI HỌC BÁCH KHOA HÀ NỘI VIỆN CÔNG NGHỆ THÔNG TIN VÀ TRUYỀN THÔNG ------------*-------------- ĐỒ ÁN TỐT NGHIỆP ĐẠI HỌC NGÀNH CÔNG NGHỆ THÔNG TIN ÁP DỤNG PHƯƠNG PHÁP HỌC MÁY TRONG PHÁT HIỆN VÀ NGĂN CHẶN TẤN CÔNG WEB Sinh viên thực hiện: Hoàng Phú Hoan Lớp CNTT1.02 – K58 Giảng viên hướng dẫn: TS Nguyễn Hồng Quang HÀ NỘI, 05 – 2018 Áp dụng phương pháp học máy trong phát hiện và ngăn chặn tấn công web PHIẾU GIAO NHIỆM VỤ ĐỒ ÁN TỐT NGHIỆP 1. Thông tin về sinh viên Họ và tên sinh viên: Hoàng Phú Hoan Điện thoại liên lạc: 0968756614 Email:hoangphuhoan2012@gmail.com Lớp: CNTT1.02 Hệ đào tạo: Đại trà Đồ án tốt nghiệp được thực hiện tại: Viện Công nghệ thông tin, trường Đại học Bách Khoa Hà Nội Thời gian làm ĐATN: Từ ngày 1/3/2018 đến 30/5/2018 2. Mục đích nội dung của ĐATN Trong đồ án này, tôi muốn thực hiện việc áp dụng công nghệ học máy trong việc phát hiện tấn công bảo mật nhằm vào ứng dụng web đồng thời xây dựng một hệ thống để thực hiện việc ngăn chặn tấn công web 3. Các nhiệm vụ cụ thể của ĐATN Nhiệm vụ cụ thể của đồ án là: - Tìm ra phương pháp học máy cho độ chính xác cao nhất đối với việc phát hiện tấn công web - Áp dụng phương pháp học máy tìm được để xây dựng một hệ thống web application firewall cơ bản, bảo vệ ứng dụng web.

Lời cam đoan của sinh viên: Tôi Hoàng Phú Hoan cam kết ĐATN là công trình nghiên cứu của bản thân tôi dưới sự hướng dẫn của Tiến sỹ Nguyễn Hồng Quang Các kết quả nêu trong ĐATN là trung thực, không phải là sao chép toàn văn của bất kỳ công trình nào khác. Hà Nội, ngày 29 tháng 5 năm 2018 Hoàng Phú Hoan 5. Xác nhận của giáo viên hướng dẫn về mức độ hoàn thành của ĐATN và cho phép bảo S Hà Nội, ngày 29 tháng 5 năm 2018 Tiến sỹ Nguyễn Hồng Quang Hoàng Phú Hoan: 20131522 Khóa K58 Lớp CNTT1.02 1 Áp dụng phương pháp học máy trong phát hiện và ngăn chặn tấn công web TÓM TẮT NỘI DUNG ĐỒ ÁN TỐT NGHIỆP Trong thế giới hiện đại ngày nay, ứng dụng web ngày một trở nên quan trọng và là một phần không thể thiếu của mạng internet. Hâu hết các thông tin trên internet đều được lưu trữ trên các website.

Cũng chính vì vậy mà vấn đề về bảo mật web ngày càng trở thành một vấn đề được quan tâm. Hầu hết các ứng dụng web được bảo vệ hiện này thì đều được được sử dụng công nghệ dựa trên signature-based. Phương pháp này đã sớm bộc lộ nhiều hạn chế trong việc phát triển và duy trì cũng như phù hợp với đa dạng các tấn công ngay nay. Nhận thấy yêu cầu đó thì trong đồ án này tôi muốn tìm kiếm một phương pháp phát hiện tấn công web sử dụng học máy.

Nó sẽ đem lại khả năng phát hiện tấn công vượt trội, dễ duy trì, phát triển và có khả năng đạt độ chính xác cao. Cùng với đó, tôi cũng muốn áp dụng phương pháp mà mình nghiên cứu được vào việc xây dựng một hệ thống Web Application Firewall với chức năng cơ bản. Để đảm bảo khả năng phát hiện với độ chính xác cao thì trong nghiên cứu của mình tôi sẽ thực hiện việc phát hiện tấn công dựa trên một tập dữ liệu đã được sử dụng nhiều trong các nghiên cứu trước cũng như chưa một lượng dữ liệu đa dạng. Các công việc được thực hiện trong đồ án này: - Nghiên cứu về bảo mật ứng dụng web - Nghiên cứu về các phương pháp đã được sử dụng để phát hiện tấn công web - Đề xuất phương pháp phát hiện tấn công web dựa trên học máy của bản thân - Thử nghiệm phương pháp của mình trên tập dữ liệu CSIC 2010 - Xây dựng hệ thống Web Application Firewall áp dụng phương pháp do mình đề xuất để bảo vệ hệ thống web thực Hoàng Phú Hoan: 20131522 Khóa K58 Lớp CNTT1.02 2 Áp dụng phương pháp học máy trong phát hiện và ngăn chặn tấn công web MỤC LỤC PHIẾU GIAO NHIỆM VỤ ĐỒ ÁN TỐT NGHIỆP.

Tổng quan và mục tiêu của đồ án. Bố cục của đồ án. Tổng quan về ứng dụng web và vấn đề bảo mật cho ứng dụng web. Ứng dụng web.

Các vấn đề trong bảo mật web. Giới thiệu về Web Application Firewall. Các nghiên cứu liên quan. Sử dụng các phương pháp phân loại dựa trên học máy cơ bản.

Sử dụng deep learning. Các phương pháp khác. Phương pháp đề xuất và kết quả thu được. Tập dữ liệu.

Một số khái niệm. Một số phương pháp phân lớp thường dùng trong học máy. Cách đánh giá mô hình học máy. Trình bày phương pháp tiến hành và kết quả thu được.

Tổng quan về phương pháp tiến hành. Tiền xử lý đối với dữ liệu thô. Xây dựng cơ sở dữ liệu. Mô tả phương pháp trích chọn dữ liệu.

Tiến hành thí nghiệm và kết quả thu được. Kết luận, các công việc trong tương lai. Mô hình triển khai thực tế. Tổng quan mô hình và các thành phần.

39 Hoàng Phú Hoan: 20131522 Khóa K58 Lớp CNTT1.02 3 Áp dụng phương pháp học máy trong phát hiện và ngăn chặn tấn công web 2. Nguyên lý hoạt động của hệ thống. Đề xuất phát triển thêm cho mô hình này trong tương lai. 41 Tài liệu tham khảo.

44 Hoàng Phú Hoan: 20131522 Khóa K58 Lớp CNTT1.02 4 Áp dụng phương pháp học máy trong phát hiện và ngăn chặn tấn công web I. Tổng quan và mục tiêu của đồ án Ngành công nghệ thông tin càng phát triển thì đồng thời với nó, khả năng mất an toàn thông tin càng cao, đặc biệt là đối với các ứng dụng public rộng rãi đối với người dùng như một website thì khả năng trở thành mục tiêu tấn công lại càng lớn. Theo thống kê từ những công ty bảo mật lớn như Bkav, CMC thì hàng năm ở Việt Nam có hàng ngàn website bị tấn công, và trong năm 2017 có tới 40% số website ở Việt Nam tồn tại những lổ hổng nghiệm trọng, cho phép hacker có khả năng ăn cắp cơ sở dữ liệu thậm chí leo quyền, thực thi lệnh tùy ý đối với server. Nguy hiểm hơn, trong số những website tồn tại các lỗ hổng nghiêm trọng này thì có không ít là các website trọng yếu của các cơ quan nhà nước cũng như là website của các tập đoàn kinh tế lớn, quan trọng.

Tiêu biểu có thể kể tới một số sự vụ xảy ra trong vài năm gần đây liên quan trực tiếp tới việc đảm bảo an toàn thông tin cho website như vụ website của Tổng công ty hàng không Việt Nam năm 2016 bị hack khiến thông tin của 411.000 hành khách bị phát tán trên mạng hay trên vụ rò rỉ thông tin của 163 triệu tài khoản ZingID của VNG, một trong những công ty internet lớn nhất Việt Nam diễn ra vào đầu năm 2018. Thực tế này cho thấy rằng rõ ràng vấn đề an ninh, bảo mật đối với website, bộ mặt của một tổ chức và cũng là nơi chứa nhiều thông tin quan trọng chưa được xem xét và đầu tư đúng mức, cũng như đặt ra một yêu cầu cấp thiết phải nâng cấp khả năng phòng chống tấn công cho các website. Hoàng Phú Hoan: 20131522 Khóa K58 Lớp CNTT1.02 5 Áp dụng phương pháp học máy trong phát hiện và ngăn chặn tấn công web Hình 1.1 Thống kê số lượng website bị tấn công trong 9 tháng đầu năm 2017 (http://securitybox.vn) Để giúp các website có khả năng tự bảo vệ mình ở một mức nào đó mà không đòi hỏi chủ nhân website cần có kiến thức về bảo mật web, các công ty về an ninh mạng ở Việt Nam nói riêng và trên thế giới nói chung đều đưa ra các ứng dụng bảo vệ website tự động được gọi chung với tên WAF (Web Application Firewall). Tại Việt Nam, một số nhà cung cấp các sản phẩm dòng WAF có thể kể tới là Bkav, Viettel, Cystack… Tuy nhiên tại các doanh nghiệp này, công nghệ đang được sử dụng chủ yếu là chặn tấn công dựa trên việc phân tích http traffic và phát hiện tấn công dựa trên phương pháp signature-based.

Điểm yếu của phương pháp này đó là nó chủ yếu tập trung vào các kiểu tấn công, từ đó các chuyên gia về bảo mật sẽ dựa vào các đặc điểm như từ khóa, pattern để tạo lên các bộ luật mới nhằm lọc ra và ngăn chặn các traffic thỏa mãn các điều kiện hay nói cách khác là các traffic giống với các đặc điểm của một tấn công sẽ bị ngăn chặn. Điều đó đòi hỏi cần có một đội kĩ sử bảo mật luôn luôn túc trực để liên tục cập nhật bộ luật để chống lại các tấn công mới được phát hiện, mà trong bối cảnh có đến cả trăm ngàn kiểu traffic tấn công khác nhau, trong đó lại có các hình thức tấn công phức tạp, rất khó viết luật thì phương pháp này sau một thời gian sẽ dẫn tới vấn đề là khó dùy trì, quản lý, tập luật càng lớn theo thời gian thì thời gian xử lý sẽ càng lớn gây ra một loạt các vấn đề hệ thống khác. Hơn thế nữa, phương pháp tiếp cận signature-based lại không có khả năng phát hiện đối với các lỗ hổng chưa được công bố hay còn gọi là zero-day, đây chính là phương pháp mà cách hacker mũ đen chuyên nghiệp thường dùng để tấn công vào các hệ thống quan trọng, được bảo vệ kĩ tuy nhiên lại các phương pháp bảo vệ này hầu hết lại chỉ có tác dụng đối với các dạng tấn công đã được công bố. Vì vậy, để giải quyết các khó khăn trên đối với việc phát triển WAF, trong đồ án này, tôi muốn đề xuất ra một mô hình học máy đóng vai trò quyết định trong việc phát hiện tấn công web.

Mô hình học máy này thay vì việc chạy theo các phương thức tấn công mới thì sẽ chỉ cần tập trung vào ứng dụng web mà nó đang bảo vệ, dựa trên các thuộc tính, đặc điểm của chính ứng dụng web đó để phát hiện ra các traffic độc hại. Qua đó dễ thấy được sự vượt trội của phương pháp phát hiện và ngăn chặn tấn công nhằm vào ứng dụng web dựa trên học máy ở việc dễ dàng bảo trì, mở rộng, không cần có đội ngũ theo dõi và cải tiến ngày đêm để cập nhật khả năng đánh chặn đối với các kiểu tấn công mới.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ