Tổng quan nghiên cứu

Sự gia tăng nhanh chóng của các dịch vụ số kéo theo nguy cơ mất an toàn thông tin nghiêm trọng trên không gian mạng. Thống kê từ Trung tâm Ứng cứu khẩn cấp máy tính Việt Nam (VNCERT) cho thấy, chỉ trong một tháng nghiên cứu tiêu biểu, hệ thống đã ghi nhận gần 600 sự cố tấn công mạng, bao gồm 248 cuộc tấn công lừa đảo (Phishing), 232 sự cố thay đổi giao diện (Deface) và 117 trường hợp lây nhiễm mã độc (Malware). Trong bối cảnh nền tảng máy chủ web như Apache chiếm hơn 46% thị phần toàn cầu cùng sự phổ biến của IIS và Nginx, máy chủ web trở thành đích ngắm trọng yếu của tin tặc nhằm khai thác thông tin, phá hoại dữ liệu và làm tê liệt hệ thống.

Đề tài "Nghiên cứu phương pháp phân tích, phát hiện truy cập bất thường dựa trên tập nhật ký web" được tác giả Nguyễn Anh Minh thực hiện dưới sự hướng dẫn khoa học của PGS. Hoàng Đăng Hải tại Học viện Công nghệ Bưu chính Viễn thông vào năm 2021. Luận văn thuộc chuyên ngành Hệ thống thông tin (mã số 8480104), tập trung giải quyết bài toán cốt lõi: làm thế nào để nhận diện sớm các nguy cơ xâm nhập thông qua việc khai thác tập dữ liệu nhật ký máy chủ (Weblog).

Mục tiêu cụ thể của công trình là xây dựng quy trình thu thập, tiền xử lý và trích chọn đặc trưng hành vi truy cập từ tập tin nhật ký, từ đó đối soát với mô hình hoạt động tiêu chuẩn để phát hiện sai lệch. Nghiên cứu có ý nghĩa thực tiễn to lớn trong việc nâng cao năng lực giám sát an ninh mạng, giảm thiểu hơn 70% thời gian rà soát thủ công của quản trị viên và thiết lập rào chắn chủ động bảo vệ hạ tầng công nghệ thông tin tại các cơ quan, doanh nghiệp.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu xây dựng trên nền tảng lý thuyết bảo mật ứng dụng web theo chuẩn OWASP với 10 nhóm lỗ hổng bảo mật phổ biến nhất, bao gồm chèn mã độc (Injection), tấn công giả mạo yêu cầu liên kết trang (CSRF), lỗi chéo trang (XSS) và cấu hình bảo mật yếu. Đồng thời, mô hình phòng thủ theo chiều sâu (Defense-in-Depth) được áp dụng để liên kết chặt chẽ các tầng bảo vệ từ tường lửa, hệ thống IDS/IPS, mạng DMZ đến kiểm soát xác thực người dùng tại tầng ứng dụng.

Các khái niệm then chốt cấu thành khung phân tích bao gồm:

  • Giao thức truyền tải siêu văn bản (HTTP/HTTPS): Cơ chế trao đổi thông điệp phi trạng thái (Stateless) hoạt động trên cổng tiêu chuẩn 80 và 443, xử lý các phương thức truy vấn như GET, POST và phân loại phản hồi qua các dải mã trạng thái từ 1xx đến 5xx.
  • Cấu trúc nhật ký web (Weblog): Bao gồm định dạng chuẩn Common Log File (CLF) và định dạng kết hợp mở rộng (Combined Log Format) ghi nhận 8 trường thông tin cốt lõi: Host, Ident, Authuser, Date/Time, Request Line, Status Code, Bytes, Referrer và User-Agent.
  • Mô hình truy cập bất thường: Định nghĩa tập trạng thái lệch chuẩn so với các chính sách an toàn thông tin thiết lập sẵn trên máy chủ web.

Phương pháp nghiên cứu

Luận văn tiếp cận theo phương pháp kiểm thử hộp đen (Black Box Testing) kết hợp phân tích tĩnh và động trên tập dữ liệu nhật ký hệ thống thu thập trong giai đoạn 2020 - 2021.

  • Cỡ mẫu dữ liệu: Hàng chục ngàn dòng nhật ký truy cập (access log) và nhật ký lỗi (error log) được trích xuất từ môi trường máy chủ Apache 2.4 và Nginx 1.18.
  • Phương pháp chọn mẫu: Lựa chọn mẫu phân tầng có chủ đích, bao gồm cả các luồng truy cập thông thường của người dùng hợp lệ và các chuỗi truy cập mang dấu hiệu quét cổng, dò quét thư mục (Directory Traversal) hoặc gửi payload độc hại.
  • Lý do lựa chọn phương pháp: Kiểm thử hộp đen kết hợp phân tích log cho phép đánh giá hệ thống toàn diện dưới góc nhìn của kẻ tấn công thực tế mà không đòi hỏi quyền truy cập sâu vào mã nguồn phần mềm, giúp tối ưu chi phí triển khai từ 40% đến 60% so với kiểm thử hộp trắng.
  • Công cụ phân tích: Luận văn sử dụng ngôn ngữ lập trình Python kết hợp biểu thức chính quy (Regular Expressions - Regex) để phân tích cú pháp chuỗi và đối chiếu với phần mềm phân tích nhật ký chuyên dụng Weblog Expert.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Nghiên cứu mang lại những kết quả định lượng rõ nét trong việc nhận diện hành vi xâm nhập trái phép:

  • Tối ưu hóa năng lực bóc tách dữ liệu: Thuật toán tiền xử lý dựa trên Regular Expressions bằng Python đã lọc và cấu trúc hóa thành công hơn 98% các trường dữ liệu phi cấu trúc trong file log, cho phép phát hiện chính xác các chuỗi ký tự tấn công XSS và SQLi dạng URL-encoded.
  • Phát hiện sớm hành vi rà quét hệ thống: Dữ liệu phân tích chỉ ra rằng các cuộc tấn công thăm dò (Footprinting) thường tạo ra tần suất mã lỗi 404 (Not Found) và 403 (Forbidden) tăng đột biến gấp 15 đến 20 lần so với lưu lượng truy cập tiêu chuẩn trong khoảng thời gian dưới 60 giây.
  • Phân loại rõ nét lưu lượng bất thường: Công cụ Weblog Expert giúp trực quan hóa lưu lượng theo thời gian thực, tách biệt rõ ràng các địa chỉ IP phát sinh hơn 500 yêu cầu liên tục mỗi phút với các tham số URI bất thường (như chèn ký tự ../ hoặc các hàm script nguy hại).
  • Đánh giá hiệu quả kiến trúc: So sánh với các hệ thống SIEM đắt đỏ như IBM QRadar hay Splunk (vốn tiêu tốn hàng chục ngàn USD phí bản quyền thường niên), mô hình phân tích log kết hợp bộ lọc Regex chứng minh hiệu quả vượt trội cho doanh nghiệp vừa và nhỏ với độ trễ xử lý dữ liệu dưới 2 giây cho mỗi tệp log 50MB.

Thảo luận kết quả

Nguyên nhân cốt lõi dẫn đến các lỗ hổng web nghiêm trọng bắt nguồn từ việc thiếu kiểm soát chặt chẽ dữ liệu đầu vào và thiết lập cấu hình mặc định thiếu an toàn trên máy chủ. Khác với hệ thống phát hiện xâm nhập IDS truyền thống chỉ dựa vào tập luật tĩnh (Signature) cố định, phương pháp phân tích sai lệch hành vi dựa trên Weblog có thể phát hiện các cuộc tấn công leo thang đặc quyền mà không đòi hỏi cập nhật mẫu nhận diện tức thời.

Kết quả nghiên cứu được biểu diễn rõ ràng qua hệ thống bảng thống kê tần suất truy vấn theo từng địa chỉ IP, biểu đồ cột phân bố lưu lượng theo từng khung giờ trong ngày và đồ thị phân bổ mã phản hồi HTTP (với tỷ lệ mã 200 đạt 85% trong trạng thái bình thường và giảm xuống dưới 45% khi xảy ra tấn công từ chối dịch vụ DoS). Việc trực quan hóa này cung cấp bằng chứng rõ ràng giúp bộ phận kỹ thuật khoanh vùng nguồn gốc tấn công trong vòng chưa đầy 5 phút.

Đề xuất và khuyến nghị

Dựa trên kết quả thực nghiệm, luận văn đưa ra 4 nhóm giải pháp mang tính ứng dụng cao:

  • Chuẩn hóa cấu hình ghi nhật ký toàn diện: Bắt buộc chuyển đổi 100% các máy chủ web (Apache, Nginx, IIS) sang định dạng Combined Log Format có bổ sung trường User-Agent, Referrer và thời gian phản hồi (Time-Taken). Thời gian triển khai trong vòng 1 tháng do Đội ngũ Quản trị hệ thống chủ trì.
  • Tự động hóa quy trình phân tích nhật ký bằng Regex: Triển khai các kịch bản Python tự động quét file access log định kỳ 10 phút một lần nhằm nhận diện ngay các payload chèn mã độc. Mục tiêu giảm thiểu 80% thời gian phát hiện sự cố, thực hiện trong vòng 3 tháng bởi Bộ phận An toàn thông tin.
  • Thiết lập cơ chế giám sát ngưỡng truy cập: Cấu hình quy tắc cảnh báo tự động khi một địa chỉ IP phát sinh vượt quá 100 truy vấn lỗi 4xx trong vòng 1 phút hoặc truy cập trái phép vào các tệp tin hệ thống. Thời gian hoàn thành trong 2 tháng với sự phối hợp giữa Quản trị mạng và Chuyên viên SOC.
  • Nâng cấp kiến trúc bảo vệ đa lớp: Bổ sung hệ thống lọc tường lửa ứng dụng web (WAF) ở vòng ngoài và định kỳ thực hiện kiểm thử xâm nhập hộp đen 6 tháng một lần. Giám đốc Công nghệ và Trưởng phòng An ninh mạng chịu trách nhiệm phê duyệt và giám sát lộ trình.

Đối tượng nên tham khảo luận văn

Công trình nghiên cứu mang lại giá trị học thuật và thực tiễn thiết thực cho 4 nhóm đối tượng chính:

  • Quản trị viên máy chủ và hạ tầng mạng (SysAdmin): Nắm vững cấu trúc tệp log trên nhiều nền tảng khác nhau (IIS, Apache, Nginx) để cấu hình tối ưu và phòng chống rủi ro hiệu quả.
  • Chuyên viên giám sát và điều tra an toàn thông tin (SOC Analyst): Ứng dụng các biểu thức chính quy Regex và quy trình phân tích Weblog để truy vết nguồn gốc tấn công, bóc tách dấu vết mã độc nhanh chóng.
  • Lập trình viên và kỹ sư phát triển ứng dụng Web: Hiểu rõ cơ chế khai thác của tin tặc thông qua giao thức HTTP để chủ động lập trình an toàn, xử lý triệt để các lỗ hổng đầu vào như SQLi và XSS.
  • Học viên cao học và sinh viên ngành Công nghệ thông tin: Sử dụng làm tài liệu tham khảo chất lượng cao về phương pháp nghiên cứu bảo mật mạng, phân tích nhật ký và kỹ thuật phát hiện bất thường dựa trên hành vi.

Câu hỏi thường gặp

Phân tích Weblog có thể phát hiện được những dạng tấn công nào?

Phương pháp phân tích Weblog có khả năng nhận diện hầu hết các hình thức tấn công phổ biến như SQL Injection, Cross-Site Scripting (XSS), Directory Traversal, dò quét tài nguyên (Footprinting) và tấn công từ chối dịch vụ (DoS). Thực nghiệm cho thấy việc bóc tách chuỗi HTTP request giúp phát hiện hơn 90% các mẫu truy vấn độc hại can thiệp vào tầng ứng dụng.

Tại sao nên dùng định dạng Combined Log Format thay cho Common Log Format?

Định dạng Combined Log Format bổ sung thêm 3 trường dữ liệu đặc biệt quan trọng là Referrer (URL trang giới thiệu), User-Agent (thông tin trình duyệt/hệ điều hành) và Cookie. Việc bổ sung này cung cấp thêm hơn 40% thông tin ngữ cảnh hành vi, hỗ trợ chuyên viên phân loại chính xác các công cụ rà quét tự động của tin tặc.

Phương pháp phân tích nhật ký khác gì so với hệ thống IDS truyền thống?

Hệ thống IDS truyền thống tập trung phân tích gói tin mạng theo thời gian thực dựa trên tập chữ ký tĩnh đã biết, dễ bỏ sót tấn công mới và gây quá tải đường truyền. Trong khi đó, phân tích Weblog đánh giá trực tiếp kết quả xử lý tại máy chủ, phát hiện hành vi vi phạm chính sách dựa trên độ lệch chuẩn với độ chính xác cao.

Biểu thức chính quy (Regex) đóng vai trò gì trong phân tích Weblog?

Biểu thức chính quy là công cụ mạnh mẽ giúp tự động hóa quá trình nhận diện mẫu chuỗi trong hàng trăm ngàn dòng log. Nhờ Regex, các mẫu ký tự đặc thù của mã độc (như dấu đóng mở thẻ script hoặc câu lệnh SQL) được trích xuất trong vài phần nghìn giây, tăng tốc độ xử lý lên gấp 50 lần so với rà soát thủ công.

Doanh nghiệp nhỏ có thể áp dụng mô hình này mà không tốn chi phí bản quyền không?

Hoàn toàn khả thi. Doanh nghiệp có thể tận dụng mã nguồn mở Python kết hợp các công cụ phân tích tệp nhật ký sẵn có như Weblog Expert phiên bản chuẩn để xây dựng hệ thống giám sát. Giải pháp này giúp tiết kiệm 100% chi phí đầu tư phần mềm chuyên dụng đắt đỏ mà vẫn đảm bảo an toàn vận hành.

Kết luận

  • Luận văn đã hệ thống hóa toàn diện cơ sở lý thuyết về an toàn máy chủ web, giao thức HTTP và cấu trúc lưu trữ nhật ký truy cập trên các nền tảng phổ biến.
  • Đề xuất thành công quy trình 4 bước gồm thu thập, tiền xử lý, phân tích định dạng và phát hiện truy cập bất thường dựa trên độ lệch chuẩn hành vi.
  • Xây dựng kịch bản Python ứng dụng biểu thức chính quy (Regex) giúp tự động hóa bóc tách các dấu hiệu tấn công XSS, SQLi với độ chính xác trên 95%.
  • Thử nghiệm thành công mô hình phân tích log với công cụ Weblog Expert, đưa ra các báo cáo trực quan về lưu lượng và cảnh báo kịp thời các nguy cơ tiềm ẩn.
  • Định hướng nghiên cứu tiếp theo trong giai đoạn 6 - 12 tháng tới tập trung vào việc tích hợp thuật toán học máy (Machine Learning) để tự động phân loại bất thường theo thời gian thực.

Quý độc giả, nhà nghiên cứu và kỹ sư an toàn thông tin quan tâm có thể tải toàn văn luận văn để tham khảo chi tiết mã nguồn kịch bản và áp dụng trực tiếp vào hệ thống quản trị máy chủ web của đơn vị.