Tổng quan nghiên cứu

Trong bối cảnh chuyển đổi số mạnh mẽ, các trung tâm điều hành an ninh mạng phải tiếp nhận và xử lý trung bình hơn 10.000 sự kiện bảo mật mỗi giây. Mặc dù các hệ thống quản lý sự kiện và thông tin bảo mật đóng vai trò hạt nhân trong việc giám sát an toàn thông tin, tỷ lệ báo động giả trong thực tế thường xuyên dao động ở mức 70% đến 80%. Thực trạng này dẫn đến hiện tượng quá tải dữ liệu nghiêm trọng, khiến đội ngũ chuyên viên ứng cứu sự cố dễ dàng bỏ sót các cuộc tấn công có chủ đích nguy hiểm. Việc xây dựng các quy tắc nhận diện tấn công hiện nay chủ yếu phụ thuộc vào cấu hình tĩnh hoặc các mô hình học máy tự động dạng hộp đen thiếu tính giải thích.

Nhằm giải quyết triệt để bài toán này, đề tài tập trung nghiên cứu và xây dựng giải pháp cây quyết định trực quan tương tác phục vụ việc phát triển các quy tắc phát hiện tấn công mạng. Mục tiêu cụ thể là thiết kế một cơ chế trực quan hóa dữ liệu đa chiều, cho phép quản trị viên bảo mật lồng ghép trực tiếp kinh nghiệm và hiểu biết về ngữ cảnh vận hành vào quá trình sinh luật phát hiện. Phạm vi nghiên cứu được triển khai thực nghiệm tại phòng Công nghệ thông tin của một công ty tài chính ở Thành phố Hồ Chí Minh trong thời gian 10 tháng, từ tháng 2 năm 2018 đến tháng 12 năm 2018. Kết quả nghiên cứu mang ý nghĩa thực tiễn lớn khi nâng tỷ lệ phát hiện tấn công chính xác lên trên 96%, giảm thiểu tỷ lệ báo động nhầm xuống dưới 4%, đồng thời rút ngắn hơn 60% thời gian xây dựng và hiệu chỉnh quy tắc so với các phương pháp thủ công truyền thống.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng trên nền tảng tích hợp giữa 3 trụ cột lý thuyết chính: công nghệ phát hiện xâm nhập, hệ thống quản lý sự kiện và thông tin bảo mật, cùng các thuật toán học máy phân lớp dựa trên cây quyết định.

Hệ thống phát hiện xâm nhập được tiếp cận toàn diện qua 2 mô hình giám sát là mạng và máy chủ, kết hợp 2 kỹ thuật nhận diện cốt lõi gồm phát hiện dựa trên dấu hiệu và phát hiện bất thường. Hệ thống quản lý sự kiện bảo mật đóng vai trò chuẩn hóa, lưu trữ tập trung và thực hiện tương quan dữ liệu nhật ký thu thập từ tường lửa, thiết bị đầu cuối và máy chủ xác thực theo thời gian thực 24/7/365.

Đối với mô hình học máy phân lớp, đề tài kế thừa và phát triển từ 3 thuật toán kinh điển: ID3 với thước đo độ lợi thông tin dựa trên hàm Entropy, thuật toán C4.5 với khả năng xử lý thuộc tính liên tục và giá trị khuyết thiếu, cùng phương pháp cây hồi quy và phân loại CART sử dụng chỉ số Gini để tối ưu độ tinh khiết của nút phân tách. Hiệu năng của các quy tắc phát hiện được định lượng hóa chặt chẽ qua 4 chỉ số của ma trận hỗn loạn: tỷ lệ phát hiện đúng, tỷ lệ bỏ sót, tỷ lệ báo động nhầm và tỷ lệ bỏ qua đúng.

Phương pháp nghiên cứu

Nguồn dữ liệu nghiên cứu được trích xuất trực tiếp từ các nhật ký sự kiện xác thực trên hệ thống IBM QRadar SIEM đang vận hành thực tế tại một doanh nghiệp tài chính. Cỡ mẫu nghiên cứu gồm 1.400 mẫu dữ liệu đã được chuẩn hóa từ 1.427 bản ghi gốc thu thập trong giai đoạn từ ngày 29 tháng 10 năm 2018 đến ngày 7 tháng 11 năm 2018. Mẫu dữ liệu được gán nhãn chính xác bởi chuyên gia có trên 5 năm kinh nghiệm vận hành hệ thống, bao gồm 940 mẫu bình thường và 460 mẫu bất thường. Phương pháp chọn mẫu phân tầng ngẫu nhiên được áp dụng để chia đều tập dữ liệu theo tỷ lệ 50:50 thành 2 tập độc lập: tập huấn luyện gồm 470 mẫu bình thường, 230 mẫu bất thường và tập kiểm thử gồm 470 mẫu bình thường, 230 mẫu bất thường.

Lý do lựa chọn phương pháp phân tích bằng cây quyết định trực quan tương tác là nhằm khắc phục nhược điểm hộp đen của các mô hình học máy tự động, đồng thời cho phép người dùng tùy biến các hàm biểu thức động trên 12 trường thuộc tính nhật ký quan trọng. Hệ thống nguyên mẫu được hiện thực hóa trên nền tảng Java kết hợp 3 thư viện chuyên dụng: Java Expression Library để xử lý biểu thức logic thời gian thực, JFreeChart để trực quan hóa phân bố dữ liệu tại các nút, và bộ khung JUNG để biểu diễn cấu trúc đồ thị cây phân nhánh tương tác. Toàn bộ quy trình nghiên cứu, phát triển công cụ và kiểm thử thực nghiệm được tiến hành liên tục từ ngày 26 tháng 2 năm 2018 đến ngày 2 tháng 12 năm 2018.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình kiểm thử thực nghiệm nguyên mẫu với sự tham gia của 4 chuyên gia an ninh mạng giàu kinh nghiệm đã mang lại những kết quả định lượng và định tính nổi bật:

Thứ nhất, quy tắc phát hiện tấn công được sinh ra từ cây quyết định trực quan tương tác đạt tỷ lệ phát hiện đúng lên tới 96,5% trên tập kiểm thử 700 mẫu dữ liệu, vượt trội hơn khoảng 12,3% so với việc chỉ kích hoạt các tập luật phát hiện mặc định sẵn có trên hệ thống SIEM.

Thứ hai, tỷ lệ báo động nhầm giảm sâu xuống mức 3,8%, tương ứng với tỷ lệ bỏ qua đúng đạt 96,2%. Điều này giải quyết triệt để tình trạng các hoạt động quản trị hợp lệ ngoài giờ hành chính bị hệ thống gắn nhãn nhầm thành hành vi tấn công dò quét mật khẩu.

Thứ ba, thời gian trung bình để một quản trị viên phân tích dữ liệu và thiết lập hoàn chỉnh một quy tắc phát hiện tấn công phức tạp giảm từ 45 phút xuống chỉ còn khoảng 15 phút, tương đương mức tăng năng suất lao động đạt 66,7%.

Thứ tư, công cụ cho phép trích xuất và biến đổi linh hoạt 100% các biểu thức phân tách nhị phân thành các luật tương quan tương thích hoàn toàn với định dạng cấu hình của các nền tảng giám sát an ninh mạng thương mại.

Thảo luận kết quả

Hiệu quả vượt trội của phương pháp đề xuất bắt nguồn từ sự kết hợp hài hòa giữa khả năng xử lý tính toán của máy tính và tri thức chuyên gia của con người. Trong các hệ thống tự động hoàn toàn, thuật toán không thể nắm bắt được các thông tin ngoại cảnh như lịch bảo trì hệ thống định kỳ hay đặc thù phân quyền tài khoản tại đơn vị. Bằng việc trực quan hóa sự phân bố của các đối tượng dữ liệu tại từng nút, quản trị viên có thể dễ dàng lựa chọn thuộc tính phân tách tối ưu và loại bỏ các giá trị nhiễu.

Dữ liệu thực nghiệm có thể được trình bày trực quan thông qua bảng ma trận hỗn loạn đối chiếu chi tiết 4 trường hợp phân loại giữa phương pháp đề xuất và 15 tập luật quy tắc có sẵn trên IBM QRadar. Trên giao diện nguyên mẫu, sự phân bố của 700 đối tượng dữ liệu được biểu diễn sinh động qua biểu đồ tròn hiển thị tỷ lệ nhãn bình thường/bất thường tại từng nút phân nhánh, kết hợp cùng biểu đồ cột thể hiện tần suất dữ liệu theo các trục tọa độ. So sánh với các mô hình học máy phức tạp như mạng nơ-ron nhân tạo thường đòi hỏi hàng chục nghìn mẫu huấn luyện và không thể giải thích cơ chế ra quyết định, cây quyết định tương tác mang lại độ tin cậy vượt trội và tính ứng dụng thực tiễn cao hơn rất nhiều trong môi trường tác chiến an ninh mạng.

Đề xuất và khuyến nghị

Dựa trên các kết quả đạt được, nghiên cứu đưa ra 4 khuyến nghị hành động cụ thể nhằm nâng cao hiệu quả giám sát an toàn thông tin tại các tổ chức:

Thứ nhất, tích hợp công cụ cây quyết định trực quan tương tác vào quy trình phân tích sự kiện tại Trung tâm Điều hành An ninh mạng, đặt mục tiêu cắt giảm 50% số lượng cảnh báo giả trong vòng 6 tháng đầu tiên triển khai, do đội ngũ kỹ sư giám sát an ninh mạng chủ trì thực hiện.

Thứ tư, chuẩn hóa và xây dựng thư viện gồm 50 biểu thức động tùy biến cho toàn bộ các nguồn nhật ký xác thực và phân hệ tường lửa, hướng tới mốc hoàn thành trong 3 tháng dưới sự phụ trách của chuyên viên kỹ thuật an ninh hệ thống.

Thứ ba, thiết lập quy trình rà soát và tái cấu trúc cây quyết định định kỳ 30 ngày một lần nhằm cập nhật kịp thời các dấu hiệu và kỹ thuật tấn công có chủ đích mới, do trưởng nhóm phản ứng sự cố an toàn thông tin phê duyệt và chỉ đạo.

Thứ tư, đầu tư mở rộng khả năng kết nối API tự động giữa nguyên mẫu cây quyết định với các nền tảng SIEM phổ biến trên thị trường, cam kết hoàn thành trong lộ trình 12 tháng bởi bộ phận phát triển phần mềm và quản trị hạ tầng công nghệ thông tin.

Đối tượng nên tham khảo luận văn

Nội dung và kết quả nghiên cứu của luận văn mang lại giá trị thiết thực cho 4 nhóm đối tượng cụ thể:

Nhóm thứ nhất là các kỹ sư vận hành Trung tâm Điều hành An ninh mạng và đội ngũ phản ứng sự cố. Luận văn cung cấp giải pháp trực quan giúp họ hiểu rõ cơ chế tương quan sự kiện, từ đó dễ dàng tinh chỉnh các quy tắc giám sát, giảm thiểu tối đa áp lực từ các cảnh báo rác hàng ngày.

Nhóm thứ hai là các chuyên gia phân tích dữ liệu bảo mật. Tài liệu mang đến phương pháp luận thực chiến trong việc xử lý và khai phá dữ liệu nhật ký đa chiều, hỗ trợ xây dựng các biểu thức động để bóc tách hành vi bất thường từ hơn 10 trường thông tin phức tạp.

Nhóm thứ ba là các nhà nghiên cứu và học viên cao học chuyên ngành Khoa học máy tính hoặc An toàn thông tin. Đây là nguồn tài liệu học thuật giá trị về sự kết hợp liên ngành giữa học máy phân lớp, tương tác người - máy và bảo mật dựa trên trực quan hóa.

Nhóm thứ tư là các nhà quản lý công nghệ và lãnh đạo phụ trách an toàn thông tin tại các tổ chức tài chính, ngân hàng. Nghiên cứu cung cấp cơ sở khoa học vững chắc để tối ưu hóa chi phí đầu tư công nghệ, nâng cao hiệu suất làm việc của nhân sự và đảm bảo tuân thủ nghiêm ngặt các tiêu chuẩn an ninh quốc tế như ISO 27001 và PCI-DSS.

Câu hỏi thường gặp

Phương pháp cây quyết định trực quan tương tác có điểm gì vượt trội so với các thuật toán học máy tự động?

Phương pháp này cho phép người quản trị lồng ghép trực tiếp kiến thức chuyên môn và ngữ cảnh vận hành thực tế của tổ chức vào từng nhánh phân tách. Nhờ đó, quy tắc sinh ra có tính minh bạch 100%, dễ hiểu, dễ hiệu chỉnh và đạt tỷ lệ phát hiện đúng 96,5% mà không cần tập dữ liệu huấn luyện khổng lồ như các thuật toán hộp đen.

Tại sao nghiên cứu lại chọn dữ liệu nhật ký xác thực để thực nghiệm mô hình?

Nhật ký xác thực là mục tiêu trọng yếu trong các cuộc tấn công dò quét mật khẩu và leo thang đặc quyền tài khoản quản trị. Việc thử nghiệm trên 1.400 mẫu nhật ký xác thực thực tế giúp đánh giá chính xác khả năng phân biệt giữa hành vi đăng nhập bất thường ngoài giờ với các tác vụ bảo trì hợp lệ của nhân viên quản trị.

Nguyên mẫu phần mềm trong nghiên cứu sử dụng những công nghệ và thư viện nào?

Hệ thống nguyên mẫu được xây dựng hoàn toàn trên nền tảng ngôn ngữ Java với sự hỗ trợ của 3 thư viện mã nguồn mở chuyên dụng: thư viện Java Expression Library phục vụ tính toán biểu thức động, JFreeChart hiển thị biểu đồ phân bố dữ liệu tại các nút, và bộ công cụ đồ họa JUNG để trực quan hóa toàn bộ cấu trúc cây.

Làm thế nào để hệ thống ngăn chặn tình trạng quá tải thông tin khi dữ liệu nhật ký có quá nhiều trường?

Nguyên mẫu tích hợp một mô-đun ánh xạ dữ liệu và tập tin cấu hình bên ngoài, cho phép quản trị viên chủ động chọn lọc từ 10 đến 12 trường thuộc tính thực sự có ý nghĩa phân loại như địa chỉ nguồn, cổng đích hay trạng thái xác thực, đồng thời loại bỏ hoàn toàn các trường dữ liệu tĩnh không mang giá trị nhận diện.

Quy tắc được sinh ra từ công cụ có tương thích với các hệ thống SIEM khác ngoài IBM QRadar không?

Có, các điều kiện phân tách nhị phân được xuất ra dưới dạng các biểu thức logic tiêu chuẩn. Cấu trúc logic này hoàn toàn có thể chuyển đổi linh hoạt thành tập luật tương quan trên mọi nền tảng SIEM hiện đại khác như Splunk, ArcSight hay các giải pháp quản lý sự kiện bảo mật mã nguồn mở.

Kết luận

  • Luận văn đã giải quyết thành công bài toán quá tải dữ liệu và cảnh báo giả trên các hệ thống giám sát an ninh mạng thông qua phương pháp cây quyết định trực quan tương tác.
  • Hệ thống nguyên mẫu được hiện thực hóa hoàn chỉnh với khả năng xử lý biểu thức động, trực quan hóa phân bố dữ liệu nút và cấu trúc cây đa chiều.
  • Kết quả kiểm thử trên 1.400 mẫu nhật ký thực tế tại doanh nghiệp tài chính khẳng định tỷ lệ phát hiện đúng đạt 96,5% và tỷ lệ báo động nhầm giảm xuống mức 3,8%.
  • Nghiên cứu mở ra hướng đi mới trong việc kết hợp tri thức chuyên gia với sức mạnh tính toán thị giác để tối ưu hóa quy trình phân tích an toàn thông tin.
  • Trong lộ trình 12 đến 24 tháng tới, hướng phát triển trọng tâm là mở rộng mô hình cho dữ liệu chuỗi thời gian và lưu lượng mạng mã hóa; các tổ chức và chuyên viên bảo mật được khuyến khích ứng dụng ngay phương pháp này để nâng cao năng lực phòng thủ chủ động.