Tổng quan nghiên cứu

Trong bối cảnh chuyển đổi số mạnh mẽ, các trang thông tin điện tử đóng vai trò huyết mạch trong việc truyền tải dữ liệu công cộng và giao dịch trực tuyến. Tuy nhiên, các cuộc tấn công mạng nhằm thay đổi nội dung (Deface) đang gia tăng với tốc độ hơn 45% mỗi năm, đe dọa trực tiếp đến tính toàn vẹn của dữ liệu số. Điển hình tại các cổng thông tin kết quả xổ số kiến thiết, mỗi ngày thu hút hàng triệu lượt truy cập và lưu chuyển các giá trị kinh tế ước tính hàng trăm tỷ đồng. Chỉ một sự sai lệch nhỏ hoặc hành vi cố ý can thiệp vào bảng số trúng thưởng có thể gây ra những thiệt hại kinh tế nghiêm trọng và làm suy giảm uy tín của các cơ quan quản lý.

Đề tài tập trung nghiên cứu và xây dựng giải pháp tự động nhằm phát hiện kịp thời các hành vi chỉnh sửa, giả mạo nội dung trên bảng kết quả của các trang thông tin điện tử xổ số kiến thiết. Phạm vi nghiên cứu được thực hiện tại Việt Nam trong giai đoạn năm 2020, tập trung vào các hệ thống portal có cấu trúc dữ liệu biến đổi động. Mục tiêu cốt lõi là thiết lập cơ chế giám sát đa tầng, kết hợp giữa đối soát mã nguồn HTML và nhận diện sai khác trên giao diện trực quan. Nghiên cứu mang lại ý nghĩa thực tiễn lớn khi cung cấp giải pháp phòng vệ chủ động, giúp giảm thiểu đến 99% nguy cơ bị khai thác lỗ hổng thay đổi giao diện, đồng thời duy trì thời gian đáp ứng cảnh báo sai lệch dưới 500 mili-giây cho hệ thống vận hành.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng dựa trên tam giác bảo mật thông tin chuẩn mực, tập trung chuyên sâu vào thuộc tính toàn vẹn dữ liệu (Data Integrity) nhằm đảm bảo thông tin chỉ được chỉnh sửa bởi các thực thể được cấp quyền. Cùng với đó, hệ thống ứng dụng mô hình kiến trúc Web 3 tầng (3-tier Architecture) bao gồm tầng trình diễn (Client), tầng ứng dụng và nghiệp vụ (Portal Server), cùng tầng cơ sở dữ liệu lưu trữ (Enterprise Resources).

Nền tảng lý thuyết băm mật mã học được khai thác dựa trên cấu trúc hàm băm Merkle-Damgård với các tính chất kháng tiền ảnh (Pre-image resistance) và kháng xung đột (Collision resistance). Bốn khái niệm học thuật then chốt được triển khai xuyên suốt bao gồm:

  1. Tấn công Deface và kỹ thuật chèn mã độc (SQL Injection, Cross-Site Scripting - XSS).
  2. Dấu vân tay tài liệu (Document Fingerprint) phục vụ đối sánh chuỗi.
  3. Thuật toán tìm chuỗi con chung dài nhất (Longest Common Subsequence - LCS) kết hợp phương pháp đường đi ngắn nhất (Shortest Middle Snake - SMS).
  4. Phân biệt giữa duyệt web tự động (Web Crawling) và trích xuất dữ liệu có cấu trúc chuyên biệt (Web Scraping).

Phương pháp nghiên cứu

Nguồn dữ liệu nghiên cứu bao gồm tập dữ liệu HTML và hình ảnh hiển thị thực tế thu thập từ 30 trang thông tin điện tử cung cấp kết quả xổ số kiến thiết tại 3 miền Bắc, Trung, Nam. Nghiên cứu áp dụng phương pháp chọn mẫu có chủ đích phân tầng (Stratified Purposive Sampling) nhằm lựa chọn các website có cấu trúc DOM phức tạp và lưu lượng người dùng cao.

Lý do lựa chọn phương pháp phân tích đa tầng là vì việc kiểm tra đơn lẻ mã nguồn thường gặp cảnh báo giả do các đoạn mã quảng cáo hoặc thời gian động thay đổi, trong khi việc chỉ so sánh ảnh lại tiêu tốn tài nguyên xử lý. Nghiên cứu kết hợp công cụ Scrapy để thu thập bóc tách dữ liệu theo thời gian thực, thuật toán Rabin Fingerprint cải tiến để băm khối văn bản thuần, thuật toán so sai khác Eugene Myers O(ND) cho mã nguồn, và phương pháp tối ưu hóa bộ nhớ LockBits trong ngôn ngữ C# để so sánh ma trận điểm ảnh. Quy trình thử nghiệm được tiến hành qua 3 đợt quan sát liên tục trong năm 2020 với chu kỳ giám sát tự động thiết lập từ 15 phút đến 60 phút một lần.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình thực nghiệm đã chứng minh hiệu quả vượt trội của mô hình đa thuật toán so với các giải pháp kiểm tra đơn lẻ truyền thống:

  • Thuật toán Rabin Fingerprint cải tiến với phương pháp chia khối kích thước cố định đã rút ngắn 38% thời gian tính toán mã băm so với thuật toán gốc, đạt tỷ lệ phát hiện biến đổi văn bản chính xác 100% trên toàn bộ các mẫu thử nghiệm.
  • Việc tích hợp chức năng LCS tối ưu vào thuật toán chênh lệch Myers O(ND) giúp giảm thời gian phân tích cây cú pháp từ 120 mili-giây xuống còn 42 mili-giây đối với các tệp mã nguồn HTML có độ dài trên 5.000 dòng.
  • Kỹ thuật LockBits áp dụng trong so sánh hình ảnh đã nâng tốc độ quét ma trận điểm ảnh lên gấp 12 lần so với phương thức chuẩn, xác định chính xác 99,4% các vùng pixel bị biến đổi và tự động khoanh vùng cảnh báo màu đỏ trực quan.
  • Hệ thống giám sát tổng hợp loại bỏ được hơn 95% hiện tượng cảnh báo giả phát sinh từ các thành phần HTML động không chứa nội dung kết quả quay số.

Thảo luận kết quả

Nguyên nhân chính tạo nên sự tối ưu là việc loại bỏ hoàn toàn các thẻ định dạng dư thừa trước khi tạo dấu vân tài liệu, đồng thời việc truy xuất bộ nhớ trực tiếp thông qua con trỏ LockBits đã khắc phục triệt để hiện tượng nghẽn luồng xử lý do hàm khóa và mở khóa hình ảnh liên tục gây ra. Khi so sánh với các công cụ thu thập diện rộng như Mercator hay HTTrack, giải pháp dựa trên Scrapy kết hợp module bóc tách tùy biến giúp tiết kiệm 75% băng thông mạng và giảm tải CPU máy chủ xuống dưới mức 15%.

Dữ liệu thực nghiệm thu được qua 3 lần chạy kiểm thử có thể được biểu diễn trực quan qua biểu đồ cột so sánh độ trễ xử lý (Lần 1 đạt 2,1 giây; Lần 2 đạt 1,8 giây; Lần 3 đạt 1,5 giây) và bảng tổng hợp phân loại độ chính xác phát hiện xâm nhập. Kết quả cho thấy phương pháp không chỉ bảo đảm tính toàn vẹn của thông tin xổ số mà còn mở ra hướng tiếp cận mới trong giám sát an ninh mạng cho các cổng dịch vụ công trực tuyến.

Đề xuất và khuyến nghị

  1. Triển khai mô hình giám sát kép kết hợp băm mã nguồn và phân tích điểm ảnh LockBits tại 100% các cổng thông tin xổ số kiến thiết, đặt mục tiêu phát hiện sai lệch dữ liệu dưới 2 giây, hoàn thành trong quý I giai đoạn tới do Ban Kỹ thuật CNTT các công ty xổ số chủ trì.
  2. Thiết lập cơ chế chuẩn hóa quy trình lọc dữ liệu đầu vào bằng biểu thức chính quy và tường lửa ứng dụng web (WAF) nhằm triệt tiêu 99% nguy cơ tấn công SQL Injection và XSS, thực hiện định kỳ hàng tháng bởi Đội ngũ Lập trình viên phát triển hệ thống.
  3. Ban hành chính sách kiểm soát xác thực phân quyền và thay đổi mật khẩu quản trị máy chủ theo chu kỳ 90 ngày một lần, kết hợp lưu trữ nhật ký máy chủ độc lập nhằm giảm thiểu 95% rủi ro chiếm quyền phiên làm việc, do Bộ phận An toàn Thông tin phụ trách.
  4. Áp dụng giải pháp sao lưu cơ sở dữ liệu tự động với tần suất 24 giờ một lần và duy trì lưu trữ dự phòng 7 ngày gần nhất, đảm bảo chỉ số phục hồi hệ thống (RTO) đạt dưới 15 phút khi xảy ra sự cố can thiệp dữ liệu trái phép.

Đối tượng nên tham khảo luận văn

  1. Chuyên gia an toàn thông tin và kỹ sư bảo mật: Khai thác chi tiết giải thuật Rabin Fingerprint cải tiến và cơ chế phát hiện tấn công Deface để xây dựng hệ thống giám sát website tự động với độ tin cậy trên 99%.
  2. Nhà phát triển ứng dụng Web và kỹ sư phần mềm: Vận dụng phương pháp xử lý ảnh tốc độ cao bằng LockBits và thuật toán so sánh văn bản O(ND) nhằm tối ưu hóa hiệu năng ứng dụng lên đến 40% trong môi trường C# và .NET.
  3. Cán bộ quản lý và vận hành cổng thông tin doanh nghiệp nhà nước: Tham khảo mô hình kiến trúc bảo mật 3 tầng và quy trình kiểm soát rủi ro để thiết lập hệ thống cảnh báo xâm nhập thời gian thực với chu kỳ giám sát 15 phút một lần.
  4. Học viên cao học và nhà nghiên cứu công nghệ thông tin: Sử dụng luận văn như tài liệu học thuật nền tảng về kỹ thuật Web Scraping nâng cao, cấu trúc dữ liệu chuỗi con chung dài nhất (LCS) và an toàn hệ thống thông tin.

Câu hỏi thường gặp

  1. Tại sao cần kết hợp cả phương pháp so sánh mã nguồn và so sánh hình ảnh? Việc kết hợp giúp triệt tiêu 95% cảnh báo giả từ mã nguồn động và bao quát toàn diện các thay đổi hiển thị trực quan mà hacker có thể thực hiện thông qua chèn mã CSS hoặc tải ảnh đè lên giao diện gốc.

  2. Thuật toán Rabin Fingerprint cải tiến mang lại lợi ích gì so với thuật toán gốc? Thuật toán cải tiến phân chia văn bản thành các khối K cố định kích thước n, giúp giảm 38% độ phức tạp tính toán và tăng tốc độ trích xuất dấu vân tay tài liệu trên các trang web có dung lượng lớn.

  3. Kỹ thuật LockBits trong C# giải quyết vấn đề gì khi xử lý hình ảnh? LockBits truy xuất trực tiếp vào mảng bộ nhớ chứa dữ liệu điểm ảnh thay vì gọi hàm khóa mở liên tục, giúp tăng tốc độ so sánh ma trận ảnh lên 12 lần và giảm thiểu độ trễ xử lý màn hình độ phân giải cao.

  4. Khung thu thập dữ liệu Scrapy đóng vai trò gì trong mô hình nghiên cứu? Scrapy đảm nhận việc bóc tách chính xác các bảng dữ liệu kết quả theo cấu trúc DOM định sẵn, giúp giảm 75% băng thông truyền tải so với các công cụ tải toàn bộ website như HTTrack.

  5. Hệ thống thực hiện cảnh báo thay đổi dữ liệu qua những hình thức nào? Hệ thống kích hoạt đồng thời 3 cơ chế cảnh báo thời gian thực bao gồm hiển thị vùng biến đổi màu đỏ trên giao diện, phát tín hiệu âm thanh cảnh báo và gửi tin nhắn thông báo tức thì đến quản trị viên.

Kết luận

  • Đề tài đã giải quyết trọn vẹn bài toán bảo đảm tính toàn vẹn thông tin cho các trang tin kết quả xổ số kiến thiết thông qua mô hình kiểm tra đa tầng hiện đại.
  • Cải tiến thành công giải thuật băm Rabin Fingerprint và tối ưu hóa thuật toán chênh lệch văn bản Myers O(ND) giúp giảm độ trễ đối soát xuống dưới 50 mili-giây.
  • Ứng dụng đột phá kỹ thuật xử lý ảnh LockBits giúp nhận diện và khoanh vùng sai khác trực quan với độ chính xác đạt 99,4%.
  • Xây dựng hoàn chỉnh phần mềm thử nghiệm có khả năng quản lý danh sách portal, lập lịch giám sát tự động và phát cảnh báo đa kênh tức thời.
  • Hướng phát triển tiếp theo trong 12 tháng tới là tích hợp trí tuệ nhân tạo để tự động nhận dạng cấu trúc bảng số và mở rộng khả năng phòng vệ trên các nền tảng ứng dụng di động; các đơn vị vận hành cổng thông tin nên sớm áp dụng giải pháp này để nâng cao năng lực an ninh mạng.