Tổng quan nghiên cứu

Nhu cầu giám sát an ninh bằng hệ thống camera giám sát đang bùng nổ mạnh mẽ, với hàng trăm giờ video được truyền tải và lưu trữ liên tục mỗi phút trên toàn cầu. Trong các hệ thống giám sát gia đình và đô thị thông minh, việc lưu trữ khối lượng video khổng lồ đặt ra thách thức lớn cho bài toán tìm kiếm và truy xuất sự kiện. Khi xảy ra sự cố đột nhập hay tai nạn, người vận hành không thể duyệt thủ công hàng chục giờ video ghi hình ở độ phân giải cao như 1280x720 hoặc 1920x1080. Phương pháp phát hiện chuyển động truyền thống trên miền điểm ảnh (pixel domain) đòi hỏi phải giải mã toàn bộ dòng bitstream, tiêu tốn phần lớn năng lực tính toán của CPU và bộ nhớ RAM, gây nghẽn cổ chai nghiêm trọng trên các thiết bị biên hoặc hệ thống IoT có cấu hình giới hạn.

Nhằm giải quyết triệt để rào cản tính toán này, luận văn tập trung nghiên cứu giải pháp phân tích và phát hiện đối tượng chuyển động trực tiếp trên miền nén (compressed domain) của chuẩn nén video H.264/AVC. Mục tiêu cốt lõi của đề tài là xây dựng thuật toán phân đoạn chuyển động kết hợp giữa kích thước khối macroblock và đặc trưng trường vector chuyển động mà không cần giải mã hoàn toàn khung hình. Nghiên cứu được triển khai thực nghiệm trên các luồng dữ liệu camera giám sát thực tế tại Hà Nội và Đà Nẵng trong giai đoạn 2016-2018, dưới sự phối hợp giữa Phòng thí nghiệm Tương tác Người - Máy (HMI Lab) thuộc Đại học Công nghệ - ĐHQGHN và Công ty Cổ phần Công nghệ VP9 Việt Nam. Ý nghĩa thực tiễn của công trình thể hiện qua việc giảm hơn 75% chi phí tính toán giải mã, duy trì tốc độ xử lý thời gian thực từ 22 đến 27 khung hình/giây trên phần cứng nhúng Raspberry Pi 2, đồng thời kiến tạo cấu trúc lưu trữ phân cấp hỗ trợ tra cứu sự kiện nhanh chóng và chính xác.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu vận dụng lý thuyết nén video số theo tiêu chuẩn H.264/MPEG-4 Part 10 kết hợp với các mô hình phân tích không gian - thời gian trên miền nén. Cấu trúc tệp H.264 được đóng gói thành các đơn vị NALU (Network Abstraction Layer Unit), chứa dữ liệu RBSP (Raw Byte Sequence Payload) và chuỗi bit dữ liệu SODB. Mỗi khung hình video được phân rã thành các lát cắt (slices) và chia nhỏ thành các khối macroblock (MB) kích thước tiêu chuẩn 16x16 pixel, hoặc các khối con 8x8 và 4x4 pixel. Các khái niệm và mô hình nền tảng bao gồm:

  1. Kích thước bit của Macroblock (MB Size): Thể hiện dung lượng dữ liệu cần thiết để mã hóa khối; các vùng biên chứa chuyển động thường có kích thước bit cao hơn đáng kể so với nền tĩnh do khó tìm thấy khối tương đồng trong khung tham chiếu.
  2. Vector chuyển động (Motion Vector - MV): Thông số dịch chuyển tọa độ không gian hai chiều $(x, y)$ của khối macroblock so với khung hình tham chiếu, biểu thị vận tốc và hướng di chuyển của đối tượng.
  3. Chế độ khối bỏ qua (Skip Mode): Kỹ thuật tối ưu hóa mã hóa cho phép không truyền dữ liệu phần dư đối với các vùng ảnh đồng màu, khiến kích thước bit của khối bằng 0 dù đang thuộc đối tượng chuyển động.
  4. Bất đẳng thức Chebyshev: Công cụ xác suất thống kê dùng để kiểm soát và xác định độ tin cậy về tính nhất quán trong hướng và độ dài của trường vector chuyển động.

Phương pháp nghiên cứu

Nghiên cứu thiết lập tập mẫu kiểm thử gồm 11 chuỗi video chuyên sâu, phân thành 2 nhóm rõ rệt: Nhóm 1 gồm 4 chuỗi video chuẩn từ tập dữ liệu học thuật IEEE Change Detection Workshop 2014 (gồm Pedestrians, PETS2006, Highway và Office ở độ phân giải 240p đến 576p); Nhóm 2 gồm 7 chuỗi video độ phân giải cao (720p và 1080p) trích xuất từ tập dữ liệu hơn 43 video thực tế và hơn 100 luồng camera giám sát trực tiếp tại Hà Nội và Đà Nẵng. Phương pháp chọn mẫu là chọn mẫu có chủ đích bao phủ đa dạng các điều kiện môi trường thực tế như trong nhà, ngoài trời, ánh sáng tự nhiên, đèn nhân tạo, mưa gió và nền động phức tạp.

Lý do lựa chọn phương pháp phân tích trực tiếp trên miền nén là nhằm tối ưu hóa triệt để năng lực xử lý phần cứng, loại bỏ hoàn toàn các bước tính toán biến đổi Cosin rời rạc ngược (IDCT) và tái tạo ma trận điểm ảnh. Quy trình phân tích được thiết kế qua 3 giai đoạn chặt chẽ: trích xuất gói tin NALU qua giao thức RTSP bằng thư viện LIVE555, giải mã entropy trích xuất tham số MB/MV qua bộ công cụ JM 19.0 tùy biến, sau đó áp dụng quy trình phân đoạn 3 pha (phân đoạn dựa trên khối macroblock, phân đoạn đối tượng và tinh chỉnh khôi phục vùng phẳng) được hoàn thiện trong giai đoạn 2016-2018.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

  1. Nâng cao độ phủ trên video độ phân giải cao: Trên các chuỗi video độ phân giải 720p và 1080p, thuật toán đề xuất cải thiện độ phủ (recall) từ 15% đến 25% so với phương pháp của Poppe, khắc phục triệt để tình trạng mất dấu đối tượng do xuất hiện nhiều khối macroblock ở chế độ skip_mode tại các vùng ảnh đồng màu lớn.
  2. Hiệu năng vượt trội trên tập dữ liệu chuẩn: Trên 4 video kiểm thử của IEEE Change Detection Workshop 2014, giải pháp đạt độ chính xác trung bình 80%, độ phủ 84% và chỉ số F1-score đạt 81.8%, tương đương với các giải pháp hàng đầu, trong đó video Pedestrians đạt độ chính xác 84% và độ phủ lên tới 95% (F1-score đạt 89.98%).
  3. Khả năng loại bỏ nhiễu nền động chính xác: Nhờ kết hợp bất đẳng thức Chebyshev với ngưỡng góc lệch $10^\circ$, chênh lệch độ dài 20 đơn vị và tỷ lệ mật độ khối đạt 80%, hệ thống đã loại bỏ thành công hơn 85% các yếu tố nhiễu nền phức tạp như cành cây đung đưa, sóng nước hay ánh đèn pha quét qua.
  4. Tối ưu hóa tốc độ xử lý phần cứng: Ứng dụng đạt tốc độ từ 17 đến 23 fps trên máy tính cá nhân chip Intel Core i5-3337U và duy trì ổn định từ 22 đến 27 fps khi vận hành trực tiếp trên vi xử lý nhúng của Raspberry Pi 2.

Thảo luận kết quả

Hiệu năng phát hiện chuyển động của thuật toán tỷ lệ thuận với tính tương phản giữa đối tượng và độ ổn định của môi trường quan sát. Trong các thử nghiệm thực tế, video ghi nhận trong phòng làm việc với điều kiện ánh sáng ổn định đạt chỉ số F1-score vượt mức 0.87 nhờ sự tách biệt rõ ràng giữa trang phục người di chuyển và mặt sàn. Ngược lại, tại những khu vực có cửa kính lớn phản chiếu bóng chuyển động hoặc ánh sáng đèn xe ban đêm, chỉ số F1-score có xu hướng giảm nhẹ do xuất hiện các vector chuyển động nhiễu cục bộ.

Dữ liệu thực nghiệm của nghiên cứu được tổng hợp và biểu diễn trực quan qua bảng ma trận so sánh chi tiết các chỉ số Precision, Recall và F1-score giữa phương pháp đề xuất với giải thuật của Poppe trên từng chuỗi dữ liệu. Bên cạnh đó, các biểu đồ phân bố vector chuyển động theo tọa độ Descartes và bản đồ kích thước khối (size-map) đã làm sáng tỏ cơ chế khôi phục các vùng khuyết thiếu của đối tượng bằng thuật toán tìm kiếm theo chiều rộng (BFS). So với các thuật toán phân tích điểm ảnh tiêu tốn 100% tài nguyên CPU để giải mã, giải pháp này chỉ chiếm dụng khoảng 25% công suất xử lý, chứng minh tính khả thi vượt trội khi triển khai trên các thiết bị giám sát thông minh thế hệ mới.

Đề xuất và khuyến nghị

  1. Tự động hóa thiết lập ngưỡng nhận dạng bằng học máy: Nhóm nghiên cứu thị giác máy tính cần tích hợp mô hình học tăng cường hoặc mạng nơ-ron thích nghi để tự động tinh chỉnh ngưỡng kích thước khối $T_s$ theo thời gian thực dựa trên độ sáng môi trường, hướng tới mục tiêu nâng cao chỉ số F1-score thêm 5% đến 8% trong 6 tháng tới.
  2. Chuẩn hóa bộ tham số trường vector chuyển động: Doanh nghiệp vận hành hệ thống camera giám sát giao thông nên cố định ngưỡng nhất quán góc $T_A = 10^\circ$, ngưỡng sai lệch độ dài $T_L = 20$, độ tin cậy $T_C = 90%$ và ngưỡng mật độ $T_{Density} = 80%$ để giảm tỷ lệ cảnh báo sai lệch xuống dưới mức 10%.
  3. Áp dụng cấu trúc dữ liệu lưu trữ phân cấp 4 tầng: Đơn vị phát triển phần mềm giám sát cần triển khai ngay cấu trúc tệp nhị phân phân cấp (Thư mục thời gian $\rightarrow$ Hàng ngang $\rightarrow$ Cột macroblock $\rightarrow$ Mức độ chuyển động nhị phân 00, 01, 10, 11) vào hệ thống đám mây, giúp tăng tốc độ truy vấn khu vực quan tâm (ROI) lên gấp 3 lần trong quý tới.
  4. Triển khai thuật toán trực tiếp trên phần cứng nhúng biên (Edge AI): Các nhà sản xuất thiết bị phần cứng an ninh nên nhúng mã nguồn C++ của giải thuật vào vi điều khiển camera chạy hệ điều hành Linux, đảm bảo phân tích luồng video 1080p ở tốc độ 25 fps mà không cần gửi dữ liệu thô về máy chủ trung tâm.

Đối tượng nên tham khảo luận văn

  1. Kỹ sư phát triển hệ thống thị giác máy tính và AI: Nắm vững phương pháp trích xuất đặc trưng chuyển động trực tiếp từ dòng bitstream H.264/AVC, áp dụng kỹ thuật tối ưu hóa mã nguồn C++ để tiết kiệm hơn 70% tài nguyên tính toán cho hệ thống.
  2. Nhà phát triển thiết bị IoT và hệ thống nhúng: Học hỏi mô hình thực nghiệm và quy trình triển khai giải thuật trên bo mạch nhúng Raspberry Pi 2, phục vụ thiết kế các dòng camera thông minh có khả năng phân tích sự kiện biên với tốc độ 22 đến 27 fps.
  3. Doanh nghiệp cung cấp giải pháp an ninh và phần mềm quản trị video: Ứng dụng cấu trúc dữ liệu phân cấp 4 tầng để xây dựng tính năng tóm tắt video (video synopsis), tìm kiếm sự kiện an ninh theo vùng chọn nhanh hơn 70% so với phương pháp quét truyền thống.
  4. Học viên cao học và nghiên cứu sinh ngành Khoa học máy tính: Sử dụng luận văn làm tài liệu nghiên cứu chuyên khảo về xử lý miền nén, cách cấu hình thư viện LIVE555, JM 19.0 và phương pháp đánh giá thực nghiệm đối chuẩn trên bộ dữ liệu IEEE Change Detection Workshop.

Câu hỏi thường gặp

  1. Tại sao phân tích chuyển động trên miền nén lại vượt trội hơn miền điểm ảnh? Phân tích trên miền nén tận dụng trực tiếp các tham số có sẵn trong dòng bitstream như kích thước bit macroblock và vector chuyển động sau bước giải mã entropy. Quy trình này loại bỏ hoàn toàn các phép toán biến đổi ngược và bù điểm ảnh phức tạp, giúp giảm hơn 75% tải tính toán và duy trì tốc độ xử lý thời gian thực từ 22 đến 27 fps trên phần cứng nhúng.

  2. Vấn đề khối macroblock ở chế độ skip_mode được giải quyết như thế nào? Khối skip_mode có kích thước bằng 0 do vùng ảnh phẳng đồng nhất, dễ bị nhận diện nhầm là nền tĩnh. Luận văn đã xử lý bằng cách tính lại kích thước khối bằng trung bình cộng kích thước của 3 khối lân cận (bên trái, phía trên và phía trên bên phải), kết hợp thuật toán tìm kiếm theo chiều rộng (BFS) để khôi phục hoàn chỉnh hình dạng đối tượng.

  3. Thuật toán loại bỏ nhiễu từ cành cây rung hoặc sóng nước bằng cách nào? Chuyển động của cành cây hay mặt nước thường có vector phân tán hỗn loạn và tạo ra nhiều lỗ rỗng trong phân đoạn. Tác giả sử dụng bất đẳng thức Chebyshev để kiểm tra tính nhất quán về góc lệch ($T_A = 10^\circ$) và độ dài ($T_L = 20$) với độ tin cậy $T_C = 90%$, kết hợp ngưỡng mật độ khối $T_{Density} = 80%$ để loại bỏ hoàn toàn các vùng nhiễu này.

  4. Cấu trúc lưu trữ chuyển động phân cấp 4 cấp độ mang lại lợi ích gì? Cấu trúc lưu trữ phân cấp tổ chức dữ liệu theo thời gian, hàng ngang khung hình, cột khối và 4 mức độ chuyển động nhị phân (00, 01, 10, 11). Nhờ đó, người dùng khi tìm kiếm sự kiện trên một vùng quan tâm (ROI) xác định chỉ cần đọc đúng các tệp dữ liệu tương ứng, giúp rút ngắn hơn 70% thời gian truy xuất so với duyệt toàn khung hình.

  5. Ứng dụng của luận văn đã được kiểm chứng trên thực tế như thế nào? Toàn bộ thuật toán được lập trình bằng C++, tích hợp thành ứng dụng hoàn chỉnh và chuyển giao thành công cho Công ty VP9 Việt Nam. Hệ thống đã được kiểm nghiệm thực tế trên luồng dữ liệu của hơn 100 camera giám sát tại Hà Nội và Đà Nẵng, đáp ứng xuất sắc yêu cầu giám sát an ninh thực địa.

Kết luận

  • Luận văn đã xây dựng thành công phương pháp phát hiện đối tượng chuyển động trực tiếp trên miền nén H.264/AVC bằng cách kết hợp kích thước khối macroblock và trường vector chuyển động.
  • Đột phá trong việc xử lý triệt để hạn chế của chế độ skip_mode trên video độ phân giải cao 1080p, giúp nâng cao độ phủ phát hiện đối tượng thêm 15% đến 25% so với các công trình nghiên cứu trước đây.
  • Ứng dụng thành công bất đẳng thức Chebyshev và tiêu chuẩn mật độ hình học, loại bỏ hiệu quả trên 85% các tác nhân gây nhiễu từ môi trường tự nhiên như lá cây rung và ánh sáng biến đổi.
  • Thiết kế hoàn chỉnh cấu trúc lưu trữ phân cấp 4 tầng, cho phép tìm kiếm nhanh các khoảnh khắc xuất hiện chuyển động theo vùng quan tâm với tốc độ xử lý thực tế đạt 22 đến 27 fps trên phần cứng Raspberry Pi 2.
  • Nghiên cứu đã được ứng dụng và nghiệm thu thực tế tại doanh nghiệp; trong giai đoạn tiếp theo, nhóm tác giả sẽ tích hợp cơ chế tự học tham số ngưỡng thông minh nhằm tối ưu hóa toàn diện hệ thống giám sát tự động.