Luận án tiến sĩ: Phương pháp phân tích và phát hiện lưu lượng bất thường trên mạng internet

Luận án tiến sĩ nghiên cứu nghiên cứu đề xuất phương pháp phân tích và phát hiện lưu lượng bất thường trên mạng internet, phân tích chuyên sâu, xây dựng mô hình lý thuyết, đề xuất

Người đăng

Ẩn danh

Thể loại

luận án

2017

144
7
0

Phí lưu trữ

35 Point

Tóm tắt

I. Phương pháp phân tích lưu lượng mạng

Phương pháp phân tích lưu lượng mạng là một trong những yếu tố quan trọng trong việc phát hiện lưu lượng bất thường. Các phương pháp này thường được chia thành ba nhóm chính: nhóm dựa vào thống kê, nhóm dựa vào khai phá dữ liệu và học máy, và nhóm dựa vào tri thức. Mỗi nhóm có những ưu điểm và nhược điểm riêng, phù hợp với các tình huống khác nhau trong việc phát hiện bất thường. Việc áp dụng các phương pháp này giúp quản trị viên mạng có thể theo dõi và phân tích lưu lượng một cách hiệu quả, từ đó phát hiện sớm các hành vi bất thường có thể gây hại cho hệ thống. Theo nghiên cứu, việc sử dụng các phương pháp phân tích như PCA (Phân tích thành phần chính) đã cho thấy hiệu quả cao trong việc phát hiện lưu lượng bất thường. Điều này cho phép các nhà nghiên cứu và quản trị viên mạng có thể tối ưu hóa quy trình giám sát và bảo mật mạng.

1.1. Các phương pháp thu thập lưu lượng Internet

Việc thu thập lưu lượng Internet là bước đầu tiên trong quá trình phân tích và phát hiện lưu lượng bất thường. Có hai phương pháp chính để thu thập dữ liệu: thu thập mức gói tin và thu thập mức luồng tin. Mỗi phương pháp có những ưu điểm riêng. Thu thập mức gói tin cho phép thu thập dữ liệu chi tiết hơn, trong khi thu thập mức luồng tin giúp giảm thiểu khối lượng dữ liệu cần xử lý. Việc lựa chọn phương pháp thu thập phù hợp sẽ ảnh hưởng trực tiếp đến chất lượng và độ chính xác của quá trình phân tích. Theo nghiên cứu, việc kết hợp cả hai phương pháp này có thể mang lại kết quả tốt nhất trong việc phát hiện lưu lượng bất thường.

II. Phát hiện lưu lượng bất thường

Phát hiện lưu lượng bất thường là một trong những nhiệm vụ quan trọng trong quản lý mạng. Lưu lượng bất thường có thể gây ra nhiều vấn đề nghiêm trọng, từ việc làm giảm hiệu suất mạng đến việc gây ra các cuộc tấn công mạng. Để phát hiện lưu lượng bất thường, các phương pháp như phân tích hành vi mạng và sử dụng các thuật toán học máy đã được áp dụng rộng rãi. Các nghiên cứu cho thấy rằng việc sử dụng các mô hình học máy có thể giúp cải thiện độ chính xác trong việc phát hiện các hành vi bất thường. Hơn nữa, việc phát hiện sớm các lưu lượng bất thường có thể giúp các nhà quản trị mạng có biện pháp ứng phó kịp thời, từ đó bảo vệ hệ thống mạng khỏi các mối đe dọa tiềm ẩn.

2.1. Nguyên nhân gây ra lưu lượng bất thường

Có nhiều nguyên nhân dẫn đến lưu lượng mạng bất thường, bao gồm lỗi thiết bị, lỗi đường truyền, và các cuộc tấn công mạng. Những nguyên nhân này có thể gây ra sự biến động lớn trong lưu lượng mạng, ảnh hưởng đến hiệu suất và tính sẵn sàng của hệ thống. Theo bảng A, các nguyên nhân điển hình như sự cố hệ thống, lỗi định tuyến, và các hoạt động tấn công từ bên ngoài đều có thể dẫn đến tình trạng này. Việc hiểu rõ nguyên nhân gây ra lưu lượng bất thường sẽ giúp các nhà quản trị mạng có những biện pháp phòng ngừa và ứng phó hiệu quả hơn.

III. Ứng dụng thực tiễn của phương pháp phân tích

Phương pháp phân tích và phát hiện lưu lượng bất thường có nhiều ứng dụng thực tiễn trong lĩnh vực an ninh mạng. Các hệ thống giám sát có thể sử dụng các phương pháp này để theo dõi lưu lượng mạng trong thời gian thực, từ đó phát hiện và ngăn chặn các cuộc tấn công mạng. Hệ thống phát hiện xâm nhập (IDS) là một ví dụ điển hình cho việc áp dụng các phương pháp phân tích lưu lượng. Hệ thống này có khả năng phát hiện các hành vi bất thường và cảnh báo cho quản trị viên mạng kịp thời. Việc áp dụng các phương pháp phân tích này không chỉ giúp bảo vệ hệ thống mà còn nâng cao hiệu quả quản lý mạng.

3.1. Hệ thống giám sát và phát hiện tấn công

Hệ thống giám sát mạng sử dụng các phương pháp phân tích để phát hiện lưu lượng bất thường và các cuộc tấn công mạng. Kiến trúc tổng thể của hệ thống này thường bao gồm các thành phần như trung tâm phân tích, phát hiện và cảnh báo. Các mô hình kết hợp phát hiện bất thường với phát hiện tấn công mạng dựa trên mẫu dấu hiệu đã được chứng minh là hiệu quả trong việc nâng cao khả năng phát hiện. Việc sử dụng các công nghệ mới như học máy và khai phá dữ liệu trong hệ thống giám sát sẽ giúp cải thiện độ chính xác và tốc độ phát hiện, từ đó bảo vệ hệ thống mạng một cách hiệu quả hơn.

01/03/2025
Luận án tiến sĩ nghiên cứu đề xuất phương pháp phân tích và phát hiện lưu lượng bất thường trên mạng internet

Trích đoạn nội dung tài liệu

Chương 1: Hệ thống hóa cơ sở lý thuyết và các vấn đề nghiên cứu liên quan, cụ thể như: thu thập lưu lượng mạng Internet; các phương pháp và mô hình phân tích, phát hiện lưu lượng mạng bất thường; nhóm phương pháp dựa trên PCA; phân tích, đánh giá ưu nhược điểm của những công trình nghiên cứu dựa trên PCA.  Chương 2: Mô hình hệ thống phân tích và phát hiện lưu lượng bất thường dựa trên PCA; đề xuất một công thức mới để tính khoảng cách và phân tích các tham số; đề xuất phương pháp dPCA với hai chế độ một mức ngưỡng và hai mức ngưỡng; thử nghiệm và đánh giá kết quả.  Chương 3: Trình bày vấn đề khử ngoại lai trong tập dữ liệu mẫu; đề xuất hai phương pháp phát hiện và khử ngoại lai bằng udPCA và bằng K-means; thử nghiệm phát hiện và khử ngoại lai, đánh giá hiệu quả của việc khử ngoại lai với udPCA và K-means trong tập dữ liệu mẫu; đánh giá kết quả phát hiện bất thường của dPCA khi sử dụng udPCA và K-means khử ngoại lai trong tập dữ liệu mẫu.  Chương 4: Đề xuất tích hợp phương pháp dPCA vào một hệ thống giám sát có thể áp dụng trong thực tế.

Các nội dung chủ yếu gồm: kiến trúc hệ thống giám sát; vấn đề nhận dạng, phân loại bất thường và khả năng kết hợp phát hiện lưu lượng bất thường với phát hiện xâm nhập dựa trên mẫu dấu hiệu; đề xuất mô hình kết hợp phát hiện bất thường với phát hiện xâm nhập dựa trên tập mẫu dấu hiệu; thử nghiệm phát hiện bất thường và một số loại tấn công mạng. 11 CHƢƠNG 1 CƠ SỞ LÝ THUYẾT VÀ CÁC NGHIÊN CỨU LIÊN QUAN 1. Thu thập lƣu lƣợng mạng Internet 1. Các đặc tính của lưu lượng mạng Lưu lượng mạng Internet được tạo thành từ các gói tin IP.

Mỗi gói tin IP có phần tiêu đề và phần dữ liệu. Tập các gói tin có chung địa chỉ IP và cổng tạo thành một luồng tin IP (IP flow) [62, 43]. Tập các luồng tin giữa hai điểm cuối của cùng một loại ứng dụng được gọi là phiên (session). Một luồng tin IP được định nghĩa là chuỗi đơn hướng các gói tin IP quan sát trong một khoảng thời gian và có chung một số thuộc tính đặc trưng của luồng tin.

Đặc tính lưu lượng Internet khi thu thập các gói tin và luồng tin thường được thể hiện qua các thuộc tính tách ra được. Các thuộc tính điển hình là kiểu giao thức, địa chỉ IP nguồn, địa chỉ IP đích, cổng nguồn, cổng đích. Trong thực tế, một số kỹ thuật của các hãng công nghệ sử dụng thêm những thuộc tính khác, thí dụ Cisco Netflow và Juniper J- Flow sử dụng thêm trường kiểu dịch vụ (ToS-Type of Service) và giao diện đầu vào [43, 16]. Một số nghiên cứu mô tả thu thập lưu lượng mạng đường trục (backbone) [36, 57].

Những mạng này có thể là mạng của nhà cung cấp dịch vụ Internet hoặc mạng diện rộng của những tổ chức lớn. Tuy nhiên do mức độ phức tạp của kiến trúc mạng như vậy, luận án chỉ đề cập đến việc thu thập lưu lượng trên bộ định tuyến hoặc thiết bị mạng có kết nối Internet của mạng nội bộ sở hữu bởi các doanh nghiệp, cá nhân. Trong phát hiện bất thường, có thể phân chia các thuộc tính thành hai loại: thuộc tính khối lượng (volume) và thuộc tính đặc trưng (feature). Thuộc tính khối lượng tính số lượng gói tin, số byte trên một liên kết, giao diện, luồng, kết nối, phiên trong những khoảng thời gian nhất định.

Theo khảo sát các nghiên cứu đã có, thuộc tính theo khối lượng thường dùng để phát hiện những bất thường có sự biến động lớn trong lưu lượng. Những thuộc tính đặc trưng, (ví dụ: địa chỉ IP, cổng) thường dùng để phát hiện những bất thường không tạo ra đột biến về gói tin hoặc byte nên nếu chỉ dùng thuộc tính khối lượng có thể không phát hiện được [36]. Để tạo được thuộc tính cho phát 12 hiện bất thường, cần thiết phải thu thập lưu lượng mạng. Gói tin, luồng tin sau khi được thu thập sẽ trích xuất ra các thuộc tính khối lượng và đặc trưng cho kết nối, luồng tin.

Tách thuộc tính được thực hiện với phần tiêu đề hoặc cả phần dữ liệu của gói tin cho các kết nối lớp giao vận hoặc phiên lớp ứng dụng. Đối với luồng tin, các thuộc tính được tách cũng tương tự như kết nối hoặc phiên.1 liệt kê những thuộc tính sử dụng trong hệ thống MINDS tại đại học Minnesota (Mỹ) [19] được tách từ luồng theo chuẩn Netflow. Một ví dụ về dữ liệu thuộc tính Thuộc tính Ý nghĩa # Byte Số lượng byte trong luồng # Packet Số lượng gói tin trong luồng Source IP Address Địa chỉ IP nguồn Destination IP Address Địa chỉ IP đích Source port Cổng nguồn Destination port Cổng đích Protocol Giao thức Flags Bit cờ của gói tin Số lượng luồng đến một địa chỉ duy nhất trên mạng Count-dest trong T giây từ cùng một nguồn Số lượng luồng từ cùng một địa chỉ nguồn bên trong Count-src mạng trong T giây đến cùng một đích Số lượng luồng từ địa chỉ IP nguồn đến cùng cổng đích Count-serv-src trong T giây Số lượng luồng đến địa chỉ IP đích từ cùng một cổng Count-serv-dest nguồn trong T giây Số lượng luồng đến địa chỉ IP đích duy nhất từ bên Count-dest-conn trong mạng trong N luồng cuối cùng từ cùng một nguồn Số lượng luồng từ cùng một địa chỉ IP nguồn duy nhất Count-src-conn bên trong mạng trong N luồng cuối cùng đến cùng một đích Số lượng luồng từ địa chỉ IP nguồn đến cùng cổng đích Count-serv-src-conn trong N luồng cuối cùng Số lượng luồng đến địa chỉ IP đích từ cùng một cổng Count-serv-dest-conn nguồn trong N luồng cuối cùng 13 Trong [43], những thuộc tính cơ bản nhất của luồng tin gồm: Số byte, số gói tin, số bản ghi, địa chỉ IP nguồn, địa chỉ IP đích, cổng nguồn, cổng đích, thời gian kết nối trung bình. Một tập các thuộc tính tương tự được sử dụng trong 31].

Có nhiều loại thuộc tính là thuộc tính đơn (gồm một thuộc tính dữ liệu) và đa thuộc tính (gồm nhiều thuộc tính dữ liệu), song các thuộc tính cần được sử dụng bổ sung cho nhau [43]. Trong thống kê, đây là bài toán đơn biến và đa biến. Phương pháp đơn biến chỉ xét một biến hoặc thuộc tính khi xử lý dữ liệu đầu vào. Ví dụ, phương pháp phát hiện bất thường chỉ dựa trên số lượng byte dữ liệu theo một chiều là phương pháp đơn biến.

Phương pháp đa biến xác định sự tương quan giữa hai hoặc nhiều hơn các biến thay vì quan sát các biến một cách độc lập. Phương pháp này hiệu quả khi các biến có sự liên quan đến nhau. Dữ liệu thu được sau quá trình thu thập thường chứa cả những thông tin không cần thiết. Vì vậy, cần có bước tiền xử lý nhằm lọc bỏ những thông tin không liên quan, đồng thời tách ra những thuộc tính quan trọng.

Thí dụ nếu dữ liệu ở dạng luồng, sẽ bao gồm những thông tin cơ bản như địa chỉ IP nguồn và đích, cổng nguồn và đích, giao thức. Ở dạng phức tạp hơn, dữ liệu cần có tính thống kê với đơn vị thay đổi theo từng loại dữ liệu. Ngoài ra, dữ liệu cũng cần chuyển đổi hoặc chuẩn hóa sang dạng phù hợp tùy thuộc vào cơ chế phát hiện của hệ thống. Việc lựa chọn thuộc tính dữ liệu rất quan trọng vì ảnh hưởng trực tiếp đến hiệu suất cũng như độ chính xác phát hiện.

Một số nghiên cứu đã sử dụng dữ liệu chuỗi thời gian (time series) 36, 57, 43]. Dữ liệu chuỗi thời gian có ưu điểm là có thể phân tích và áp dụng các thuật toán về thời gian như entropy, EWMA, histogram v. Biểu diễn dữ liệu chuỗi thời gian trên biểu đồ cũng dễ dàng hơn. Với dữ liệu chuỗi thời gian có thể tính được sự tương quan của cùng một biến (thuộc tính) tại những thời điểm khác nhau (tính tự tương quan – auto correlation).

Tuy nhiên khi phát hiện ra bất thường, dữ liệu chuỗi thời gian thường chỉ phát hiện được thời điểm hoặc khoảng thời gian có bất thường nhưng lại khó tìm ra nguồn gây ra bất thường. Một số nghiên cứu tổng hợp dữ liệu chuỗi thời gian từ luồng, gói tin vào các khoảng thời gian giống nhau sau đó lại phải tìm ra luồng trong khoảng thời gian đó 14 gây ra bất thường. Điều này gây lãng phí tài nguyên về cả năng lực xử lý và thời gian [43]. Các phương pháp phân tích dữ liệu chuỗi thời gian cũng có những nhược điểm cơ bản là luôn cần áp dụng thêm các phương pháp bổ sung khác như: phương pháp bầu chọn (voting), phương pháp khai phá dữ liệu (data mining) … để phát hiện luồng tin gây ra bất thường [57, 6].

Vì những lý do nêu trên, luận án lựa chọn dữ liệu thống kê tổng hợp từ kết nối (hay theo luồng tin), lựa chọn các thuộc tính dữ liệu lưu lượng mạng điển hình gồm: giao thức, địa chỉ IP nguồn/đích, cổng nguồn/đích,. Đây cũng chính là những thông số cơ bản của luồng nên hoàn toàn có thể áp dụng được cho dữ liệu được tổng hợp trực tiếp từ luồng theo các chuẩn Netflow, IPFIX. Ưu điểm của dữ liệu thống kê theo kết nối hoặc luồng tin là sau khi phát hiện ra bất thường, có thể biết được chính xác kết nối hoặc luồng nào (địa chỉ IP, cổng) gây ra bất thường mà không phải áp dụng các thuật toán, phương pháp nào khác như đối với dữ liệu chuỗi thời gian. Các phương pháp thu thập lưu lượng Internet Việc thu thập lưu lượng có thể thực hiện ở nhiều mức khác nhau: mức gói tin (bắt giữ từng gói tin), mức luồng tin (chỉ bắt giữ định danh luồng tin, Flow-Id), hay mức liên kết (thu thập gói tin/byte vào/ra trên các đường link).

Tuy nhiên, phổ biến nhất vẫn là thu thập mức gói tin và mức luồng tin. Thu thập mức gói tin Thu thập mức gói tin lấy thông tin chi tiết về từng gói tin. Đa số các hệ thống giám sát mạng và các hệ thống quản lý mạng truyền thống sử dụng phương pháp này. Các gói tin được bắt giữ ở các vị trí khác nhau trên mạng, cụ thể là tại các đầu ra của các bộ chuyển mạch, định tuyến, trạm đầu cuối ,… và được truyền về trung tâm phân tích.

Các gói tin có thể được bắt giữ với các phần mềm tiện ích chuẩn như pcap/libcap (Linux/Unix) hay winpcap (Windows) và được truyền về trung tâm thông qua các giao thức chuẩn như Remote Network Monitoring (RMON), Simple Network Management Protocol (SNMP), IP Flow Information eXport Protocol (IPFIX) [43]. Kỹ thuật thu thập mức gói tin có độ phức tạp cao, thời gian xử lý và phân tích lâu, yêu cầu bộ nhớ lớn để lưu các gói tin.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Luận án tiến sĩ "Phương pháp phân tích và phát hiện lưu lượng bất thường trên mạng internet" tập trung vào việc nghiên cứu các kỹ thuật tiên tiến để nhận diện và xử lý các hoạt động mạng bất thường, đặc biệt trong bối cảnh an ninh mạng ngày càng phức tạp. Tài liệu này cung cấp cái nhìn sâu sắc về các phương pháp phân tích dữ liệu mạng, từ đó giúp cải thiện khả năng phát hiện và ngăn chặn các mối đe dọa tiềm ẩn. Đây là nguồn tài liệu quý giá cho các nhà nghiên cứu và chuyên gia trong lĩnh vực an ninh mạng, cung cấp các giải pháp hiệu quả để bảo vệ hệ thống thông tin.

Để mở rộng kiến thức về các phương pháp phân tích dữ liệu, bạn có thể tham khảo Đề tài nghiên cứu khoa học phương pháp ước lượng lasso cơ sở toán học và ứng dụng, nơi trình bày chi tiết về các kỹ thuật ước lượng hiện đại. Ngoài ra, Luận văn thạc sĩ hệ thống thông tin nghiên cứu về các phương pháp học biểu diễn dữ liệu cung cấp góc nhìn sâu hơn về cách biểu diễn và xử lý dữ liệu trong các hệ thống thông tin. Cuối cùng, Luận văn thạc sĩ khoa học máy tính cải tiến giải thuật kmeans cho bài toán gom cụm dữ liệu chuỗi thời gian là tài liệu hữu ích để hiểu rõ hơn về các thuật toán phân cụm dữ liệu.