Tổng quan nghiên cứu

Theo báo cáo của Liên Hợp Quốc, hiện nay khoảng 54,6% dân số thế giới (tương đương 3,6 tỷ người) đang sinh sống tại các khu vực đô thị và con số này dự kiến sẽ vượt mức 70% vào năm 2050. Quá trình đô thị hóa nhanh chóng tại Việt Nam nói chung và tỉnh Bà Rịa - Vũng Tàu nói riêng đã tạo ra áp lực nặng nề lên hạ tầng giao thông. Thống kê tại tỉnh Bà Rịa - Vũng Tàu đến cuối tháng 9/2020 ghi nhận 285 vụ tai nạn giao thông, làm 120 người chết và 213 người bị thương. Mặc dù số vụ đã giảm so với cùng kỳ năm 2018 (giảm 2 vụ tai nạn và 6 người chết), tình trạng vi phạm trật tự an toàn giao thông vẫn diễn biến hết sức phức tạp do ý thức chấp hành của người tham gia giao thông còn hạn chế.

Trước yêu cầu cấp thiết về việc hiện đại hóa công tác quản trị đô thị theo tinh thần Nghị quyết số 52-NQ/TW của Bộ Chính trị về Cách mạng công nghiệp lần thứ tư và Nghị quyết số 112/NQ-HĐND tỉnh Bà Rịa - Vũng Tàu về phát triển đô thị thông minh giai đoạn 2020-2022, định hướng đến 2030, việc xây dựng hệ thống giám sát tự động là ưu tiên hàng đầu.

Luận văn tập trung giải quyết bài toán tự động phát hiện, phân tích hình ảnh và nhận dạng phương tiện vi phạm Luật giao thông đường bộ theo thời gian thực tại các nút giao thông trọng điểm. Mục tiêu cụ thể là xây dựng mô hình học máy ứng dụng thuật toán YOLOv3 nhằm nhận dạng chính xác hai hành vi vi phạm phổ biến: không đội mũ bảo hiểm khi điều khiển xe mô tô, xe gắn máy và chở quá số người quy định, kết hợp nhận diện biển số xe vi phạm.

Nghiên cứu được triển khai thực nghiệm tại nút giao lộ đường Huỳnh Minh Thạnh và đường 27/4 thuộc thị trấn Phước Bửu, huyện Xuyên Mộc, tỉnh Bà Rịa - Vũng Tàu trong giai đoạn 2020 - 2021. Kết quả nghiên cứu mang ý nghĩa thực tiễn to lớn khi hỗ trợ lực lượng chức năng phát hiện vi phạm với tốc độ xử lý đạt 45 khung hình/giây, giảm tải trên 50% khối lượng tuần tra thủ công và nâng cao tỷ lệ xử phạt chính xác dựa trên bằng chứng kỹ thuật số.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng dựa trên nền tảng của các lý thuyết xử lý ảnh và học sâu (Deep Learning) hiện đại trong lĩnh vực thị giác máy tính:

  • Mạng nơ-ron tích chập (Convolutional Neural Network - CNN): Đây là kiến trúc cốt lõi giúp tự động trích xuất các đặc trưng không gian đa cấp độ từ ảnh kỹ thuật số thông qua các lớp tích chập (Convolutional Layer) và lớp gộp (Max-pooling Layer), thay thế cho các phương pháp trích xuất thủ công truyền thống như SIFT hay HOG.
  • Thuật toán nhận dạng nhìn một lần (You Only Look Once - YOLOv3): Mô hình hồi quy không gian trực tiếp dự đoán đồng thời tọa độ khung bao (Bounding Box) và xác suất phân loại lớp đối tượng chỉ qua một lần lan truyền tiến, sử dụng mạng nền tảng Darknet-53 với 53 lớp tích chập kết hợp liên kết phần dư (Residual Connections).
  • Thuật toán phân cụm K-Means (K-Means Clustering): Ứng dụng để tự động tính toán và tối ưu hóa kích thước các khung mẫu neo (Anchor Boxes) ban đầu dựa trên tập dữ liệu thực tế, giúp tăng chỉ số giao thoa trên hợp (Intersection over Union - IoU).
  • Các khái niệm chuyên ngành cốt lõi: Quá trình nghiên cứu vận dụng sâu sắc các khái niệm về Độ chính xác trung bình (mAP), Hàm mất mát đa nhiệm (Multi-part Loss Function), Phép biến đổi hình thái học (Morphological Operations) và Nhận dạng ký tự quang học (OCR).

Phương pháp nghiên cứu

Nghiên cứu kết hợp chặt chẽ giữa phương pháp nghiên cứu lý thuyết và thực nghiệm hệ thống:

  • Nguồn dữ liệu và kích thước mẫu: Bộ dữ liệu thực nghiệm bao gồm 500 mẫu hình ảnh phương tiện giao thông thực tế được thu thập từ camera quan sát tại hiện trường để huấn luyện nhận dạng vùng biển số, cùng với 22 tập chuỗi video ghi nhận các tình huống vi phạm về mũ bảo hiểm và 10 tập mẫu tình huống chở quá số người quy định.
  • Phương pháp chọn mẫu: Tác giả áp dụng phương pháp lấy mẫu có chủ đích, bao phủ đa dạng các điều kiện góc chụp phương tiện (trong phạm vi góc dưới 40 độ), mật độ phương tiện từ thưa thớt đến đông đúc và các điều kiện thời tiết khác nhau.
  • Lý do lựa chọn phương pháp phân tích: Luận văn lựa chọn kiến trúc YOLOv3 kết hợp với thư viện OpenCV, CUDA và cuDNN trên hệ điều hành Ubuntu. Lý do chính là YOLOv3 khắc phục triệt để nhược điểm tốc độ chậm của các thuật toán hai giai đoạn như Faster R-CNN (vốn chỉ đạt 7 đến 15 khung hình/giây), đáp ứng trọn vẹn yêu cầu xử lý luồng video giám sát thời gian thực với tốc độ lên đến 45 khung hình/giây.
  • Quy trình nghiên cứu: Được thực hiện theo quy trình chuẩn từ tháng 9/2020 đến tháng 4/2021, trải qua 4 giai đoạn: khảo sát thực địa và thiết kế mô hình trụ camera; thu thập và gán nhãn tập dữ liệu chuẩn; huấn luyện mạng học sâu; kiểm thử, đánh giá độ chính xác và tích hợp phần mềm xuất biên bản vi phạm qua giao diện website.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình huấn luyện và thử nghiệm hệ thống trên tập dữ liệu giao thông thực tế đã mang lại các phát hiện khoa học và kỹ thuật nổi bật:

  • Tốc độ xử lý vượt trội trong thời gian thực: Thuật toán YOLOv3 duy trì tốc độ xử lý ổn định ở mức 30 đến 45 khung hình/giây, nhanh gấp khoảng 3 lần so với mô hình Faster R-CNN và tối ưu hóa hơn 60% thời gian xử lý so với các thuật toán trích xuất Haar Cascades kết hợp máy học truyền thống.
  • Độ chính xác cao trong nhận diện không đội mũ bảo hiểm: Trên tập mẫu 22 chuỗi ảnh vi phạm, hệ thống nhận diện chính xác người điều khiển và người ngồi sau không đội mũ bảo hiểm với tỷ lệ chính xác đạt khoảng 92,5%, phân biệt rõ ràng giữa mũ bảo hiểm đạt chuẩn với các loại mũ lưỡi trai hoặc tóc người.
  • Khả năng đếm và phân loại hành vi chở quá số người: Qua kiểm nghiệm trên 10 chuỗi dữ liệu thực nghiệm, mô hình đếm số lượng người ngồi trên cùng một khung xe máy với độ chính xác đạt trên 89%, kịp thời cảnh báo các trường hợp chở từ 3 người trở lên.
  • Hiệu quả phân vùng và nhận dạng biển số xe: Phương pháp hình thái học kết hợp mạng tích chập đạt tỷ lệ phát hiện vùng biển số đúng trên 88% đối với 500 mẫu ảnh đầu vào, đảm bảo đọc rõ các ký tự chữ và số khi góc nghiêng của camera không vượt quá 40 độ.

Thảo luận kết quả

Khả năng phân loại và nhận diện vượt trội của hệ thống xuất phát từ việc mạng Darknet-53 áp dụng các phép liên kết tắt (Shortcut Connections) tương tự như ResNet, giúp giải quyết triệt để hiện tượng suy giảm đạo hàm (Vanishing Gradient) trong quá trình huấn luyện mạng nơ-ron sâu. Hơn nữa, việc dự đoán đối tượng ở 3 tỷ lệ xích khác nhau (Feature Maps đa quy mô) giúp YOLOv3 phát hiện rất tốt các đối tượng có kích thước nhỏ như biển số xe máy và vùng đầu người tham gia giao thông.

So sánh với các nghiên cứu trước đây tại Việt Nam sử dụng SVM tuyến tính hoặc bộ lọc Haar đơn thuần, mô hình của luận văn thể hiện sự ổn định vượt bậc khi môi trường xuất hiện bóng đổ hoặc các phương tiện di chuyển đan xen sát nhau.

Dữ liệu kết quả thực nghiệm của nghiên cứu có thể được hệ thống hóa qua bảng so sánh hiệu năng và biểu đồ ma trận nhầm lẫn (Confusion Matrix):

Phương pháp nhận dạng Tốc độ xử lý (FPS) Độ chính xác nhận diện mũ bảo hiểm (%) Độ chính xác phát hiện biển số (%)
Haar Cascade + SVM 12 - 18 Khoảng 72,0% Khoảng 68,5%
Faster R-CNN 7 - 14 Khoảng 94,2% Khoảng 90,1%
YOLOv3 (Đề xuất) 30 - 45 Khoảng 92,5% Khoảng 88,0%

Biểu đồ so sánh cho thấy YOLOv3 tạo ra điểm cân bằng tối ưu nhất giữa tốc độ trích xuất khung hình và độ chính xác phân lớp đối tượng. Tuy nhiên, kết quả cũng chỉ ra một số hạn chế: độ chính xác của hệ thống giảm khoảng 15% đến 20% khi ghi hình vào ban đêm không có đèn trợ sáng hoặc khi góc nghiêng camera vượt quá 40 độ khiến biển số bị méo mó hình học.

Đề xuất và khuyến nghị

Dựa trên kết quả nghiên cứu thực nghiệm, luận văn đưa ra 4 giải pháp trọng tâm nhằm nâng cao năng lực ứng dụng công nghệ giám sát giao thông thông minh:

  • Nâng cấp phần cứng và hệ thống camera hồng ngoại chuyên dụng: Sở Giao thông Vận tải phối hợp cùng Công an tỉnh triển khai lắp đặt cụm camera độ phân giải 4K tích hợp cảm biến ban đêm và đèn flash hồng ngoại tại các nút giao trọng điểm, mục tiêu nâng tỷ lệ nhận diện vi phạm ban đêm từ 70% lên trên 90%, hoàn thành trong giai đoạn 2022-2024.
  • Tối ưu hóa thuật toán và triển khai xử lý biên (Edge AI): Nhóm kỹ sư công nghệ thông tin tiến hành nén mô hình YOLOv3 và tích hợp lên các thiết bị phần cứng nhúng đặt trực tiếp tại tủ điều khiển giao lộ, rút ngắn thời gian phản hồi cảnh báo xuống dưới 100 mili-giây, thực hiện trong vòng 6 đến 12 tháng.
  • Mở rộng bộ dữ liệu huấn luyện lên trên 10.000 mẫu đa dạng: Cơ sở nghiên cứu tiếp tục thu thập và dán nhãn thêm 10.000 hình ảnh bao quát các hình thái thời tiết cực đoan như sương mù, mưa bão và các loại biển số màu vàng, màu đỏ đặc thù tại Việt Nam, hướng đến mục tiêu đạt độ chính xác toàn diện trên 95% trước năm 2025.
  • Xây dựng cổng thông tin quản lý và tự động hóa quy trình phạt nguội: Cơ quan quản lý nhà nước đưa vào vận hành hệ thống phần mềm nền tảng web kết nối trực tiếp cơ sở dữ liệu đăng kiểm phương tiện, tự động in biên bản xử phạt trong vòng 24 giờ kể từ thời điểm phát hiện vi phạm, thí điểm trong giai đoạn 2023-2025.

Đối tượng nên tham khảo luận văn

Nội dung và giải pháp kỹ thuật của luận văn đem lại giá trị tham khảo thiết thực cho nhiều nhóm đối tượng:

  • Lực lượng Cảnh sát Giao thông và Ban Quản lý An toàn Giao thông: Nắm bắt quy trình tự động hóa giám sát giao thông, ứng dụng dữ liệu hình ảnh kỹ thuật số làm căn cứ pháp lý xử phạt chính xác, giúp giảm thiểu hơn 50% thời gian tuần tra trực tiếp trên các tuyến quốc lộ huyết mạch như QL51, QL55, QL56.
  • Kỹ sư phần mềm và chuyên gia phát triển hệ thống AI/Computer Vision: Tham khảo kiến trúc mạng Darknet, phương pháp chuẩn hóa dữ liệu, giải thuật trích xuất biển số xe máy Việt Nam và cách thức kết nối thư viện OpenCV, CUDA, cuDNN vào bài toán thực tế.
  • Học viên cao học, sinh viên ngành Công nghệ thông tin và Khoa học máy tính: Sử dụng làm tài liệu học thuật mẫu mực về cấu trúc một đề tài nghiên cứu ứng dụng học sâu trong thị giác máy tính, từ khâu xây dựng lý thuyết đến thiết kế thực nghiệm.
  • Các đơn vị tư vấn và quy hoạch đô thị thông minh: Khai thác các mô hình kết nối trạm giám sát giao lộ, kiến trúc lưu trữ đám mây và giải pháp truyền thông 3G/4G để lập đề án xây dựng Trung tâm điều hành thông minh (IOC) cấp tỉnh, thành phố.

Câu hỏi thường gặp

Tại sao luận văn lại lựa chọn thuật toán YOLOv3 thay vì mô hình Faster R-CNN?

Thuật toán YOLOv3 tiếp cận bài toán phát hiện đối tượng dưới dạng bài toán hồi quy đơn nhất, dự đoán trực tiếp tọa độ khung bao và phân lớp cùng lúc. Nhờ vậy, YOLOv3 đạt tốc độ xử lý từ 30 đến 45 khung hình/giây, hoàn toàn đáp ứng yêu cầu xử lý luồng video thời gian thực tại các giao lộ giao thông, trong khi Faster R-CNN chỉ đạt 7 đến 14 khung hình/giây.

Hệ thống xử lý như thế nào khi biển số xe bị che khuất hoặc góc quan sát bị nghiêng?

Nghiên cứu chỉ ra rằng hệ thống hoạt động ổn định nhất khi góc nghiêng của camera so với biển số xe nằm trong phạm vi dưới 40 độ. Khi góc nghiêng vượt quá 40 độ hoặc biển số bị biến dạng, tỷ lệ nhận dạng ký tự giảm sút đáng kể. Để khắc phục, hệ thống cần bổ sung thuật toán cân chỉnh phối cảnh hình học và lắp đặt camera ở độ cao tiêu chuẩn.

Quy mô tập dữ liệu được sử dụng để huấn luyện và đánh giá mô hình là bao nhiêu?

Tác giả đã xây dựng bộ dữ liệu thực nghiệm bao gồm 500 mẫu ảnh chụp phương tiện giao thông thực tế nhằm huấn luyện nhận dạng vị trí biển số, kết hợp với 22 tập mẫu ảnh tình huống vi phạm mũ bảo hiểm và 10 tập mẫu vi phạm chở quá số người quy định để kiểm thử tính năng theo dõi vi phạm động.

Giải pháp nào giúp cải thiện khả năng phát hiện phương tiện vào ban đêm?

Vào ban đêm, chất lượng ảnh chụp suy giảm do thiếu sáng và ánh đèn pha phản chiếu. Luận văn khuyến nghị giải pháp kết hợp phần cứng camera có đèn trợ sáng hồng ngoại chuyên dụng cùng các giải pháp tiền xử lý ảnh nâng cao như cân bằng lược đồ xám (Histogram Equalization) để tăng độ tương phản của vùng biển số.

Hệ thống có thể phát hiện được các lỗi vi phạm nào theo Luật giao thông đường bộ?

Hệ thống được thiết kế chuyên biệt để tự động phát hiện 2 hành vi vi phạm phổ biến của người đi xe mô tô, xe gắn máy gồm: chở quá số người quy định (từ 3 người trở lên) và không đội mũ bảo hiểm hoặc đội mũ không đúng quy cách, đồng thời tự động trích xuất biển số phương tiện vi phạm làm bằng chứng xử phạt.

Kết luận

  • Luận văn đã xây dựng thành công mô hình học sâu ứng dụng thuật toán YOLOv3 để nhận dạng phương tiện và hành vi vi phạm trật tự an toàn giao thông đường bộ theo thời gian thực tại giao lộ thực tế.
  • Tốc độ xử lý của hệ thống đạt mức 30 đến 45 khung hình/giây, hoàn toàn đáp ứng tiêu chuẩn khắt khe của hệ thống giao thông thông minh thời gian thực trên các luồng video camera độ nét cao.
  • Độ chính xác phát hiện hành vi không đội mũ bảo hiểm đạt khoảng 92,5% và nhận diện chở quá số người quy định đạt trên 89%, đồng thời trích xuất biển số xe với độ chính xác trên 88% trong điều kiện góc chụp chuẩn.
  • Đóng góp quan trọng của đề tài là việc số hóa toàn diện quy trình giám sát giao thông, tích hợp thành công phần mềm quản lý và xuất dữ liệu biên bản vi phạm trực tiếp qua giao diện website phục vụ công tác phạt nguội.
  • Để nhân rộng hệ thống ra toàn địa bàn tỉnh Bà Rịa - Vũng Tàu trong lộ trình 2025-2030, các đơn vị quản lý cần tiếp tục đầu tư mở rộng tập dữ liệu lên trên 10.000 mẫu và nâng cấp hạ tầng camera AI chuyên dụng tại tất cả các điểm đen giao thông.