Tổng quan nghiên cứu

Theo thống kê của ngành giao thông vận tải, số lượng phương tiện cơ giới đường bộ tại Việt Nam đã vượt mốc 75 triệu xe máy và hơn 5 triệu xe ô tô. Với tốc độ gia tăng phương tiện bình quân đạt khoảng 10% đến 15% mỗi năm, công tác quản lý bãi đỗ xe, giám sát an ninh và điều hành giao thông đô thị đang đối mặt với áp lực vô cùng lớn. Phương thức kiểm soát thủ công truyền thống bộc lộ rõ sự chậm trễ, dễ nhầm lẫn và tốn kém chi phí nhân sự. Do đó, việc tự động hóa quá trình nhận dạng phương tiện thông qua hệ thống nhận diện biển số xe (Automatic License Plate Recognition - ALPR) trở thành một bài toán cấp thiết và mang tính chiến lược cao.

Luận văn thạc sĩ chuyên ngành Công nghệ thông tin của tác giả Lê Minh Nhật, dưới sự hướng dẫn của Tiến sĩ Lê Xuân Vinh tại Trường Đại học Quy Nhơn vào năm 2022, đã tập trung giải quyết bài toán tự động nhận diện biển số xe máy và ô tô theo quy chuẩn biển số Việt Nam. Mục tiêu cốt lõi của đề tài là xây dựng một hệ thống thị giác máy tính toàn diện, có khả năng phát hiện chính xác vị trí biển số trên phương tiện và đọc được toàn bộ chuỗi ký tự chữ, số trong điều kiện ngoại cảnh phức tạp.

Nghiên cứu có ý nghĩa thực tiễn to lớn khi đạt độ chính xác phát hiện biển số xe máy lên tới 99% và xe ô tô đạt 94% ngay cả trong các góc chụp nghiêng. Kết quả này mở ra giải pháp công nghệ tin cậy, sẵn sàng tích hợp trực tiếp vào các hệ thống kiểm soát xe thông minh, trạm thu phí không dừng và giám sát an ninh trật tự tự động.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng dựa trên nền tảng của các lý thuyết thị giác máy tính hiện đại và học sâu (Deep Learning). Khung lý thuyết trọng tâm bao gồm mạng nơ-ron tích chập (Convolutional Neural Network - CNN), thuật toán phát hiện đối tượng (Object Detection) và công nghệ nhận dạng ký tự quang học (Optical Character Recognition - OCR).

Trong bài toán phát hiện đối tượng, luận văn khảo sát chuyên sâu hai trường phái: mô hình hai giai đoạn (Two-stage) như dòng R-CNN và mô hình một giai đoạn (One-stage) như RetinaNet, SSD và YOLO. Tác giả đi sâu phân tích mô hình RetinaNet với mạng kim tự tháp đặc trưng (Feature Pyramid Network - FPN) kết hợp hàm mất mát tiêu điểm (Focal Loss) nhằm giải quyết hiện tượng mất cân bằng giữa vùng chứa vật thể và vùng hậu cảnh. Đồng thời, nghiên cứu phân tích cơ chế hoạt động của thuật toán YOLOv4 với hệ thống ô lưới (Grid System), kiến trúc xương sống CSPDarknet53 và hàm kích hoạt Mish phi tuyến. Hàm Mish giúp bảo toàn gradient âm và tối ưu hóa quá trình lan truyền ngược tốt hơn các hàm kích hoạt Sigmoid, Tanh hay ReLU truyền thống.

Đối với bài toán trích xuất ký tự, đề tài ứng dụng công cụ mã nguồn mở Tesseract OCR phiên bản 4.1 hỗ trợ 116 ngôn ngữ. Cơ chế nhận dạng dựa trên việc phân tích các thành phần liên thông (Blob analysis), xác định đường cơ sở (Baseline) và so khớp từ điển hai lần giúp tối ưu hóa độ chính xác của các ký tự chữ và số.

Phương pháp nghiên cứu

Nghiên cứu sử dụng phương pháp thực nghiệm kết hợp với phân tích định lượng trên tập dữ liệu gồm 2.995 hình ảnh thực tế. Trong đó, tập dữ liệu xe máy gồm 1.748 ảnh được cung cấp từ hệ thống bãi đỗ xe của công ty GreenParking, và tập dữ liệu xe ô tô gồm 1.247 ảnh được thu thập từ chuyên trang thị giác máy tính. Phương pháp chọn mẫu là chọn mẫu phân tầng có chủ đích nhằm bao phủ đa dạng các điều kiện ánh sáng, góc chụp nghiêng, khoảng cách xa gần và mức độ bám bẩn của biển số xe tại Việt Nam.

Lý do lựa chọn thuật toán YOLOv4 làm phương pháp phân tích chính là nhờ khả năng cân bằng vượt trội giữa độ chính xác nhận diện và tốc độ xử lý thời gian thực, khắc phục hoàn toàn độ trễ của các mô hình hai giai đoạn. Dữ liệu được gán nhãn thủ công qua phần mềm LabelImg theo chuẩn định dạng bounding box của YOLO. Toàn bộ dữ liệu được phân chia theo tỷ lệ chuẩn: 60% cho tập huấn luyện (Training), 20% cho tập thẩm định (Validation) và 20% cho tập kiểm thử (Test).

Quá trình huấn luyện mô hình được cấu hình với kích thước batch size là 64, tốc độ học khởi tạo đạt 0.001 với hệ số suy giảm decay 0.005, chỉ số quán tính momentum đạt 0.949 và thực hiện tối đa 50.000 vòng lặp. Mô hình được đánh giá định kỳ sau mỗi 1.000 vòng lặp thông qua độ đo mAP, sau đó tệp trọng số Darknet được chuyển đổi đồng bộ sang định dạng TensorFlow để phục vụ tích hợp ứng dụng.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình thực nghiệm và kiểm thử trên tập dữ liệu độc lập đã đem lại những phát hiện quan trọng về hiệu năng của mô hình:

Thứ nhất, mô hình YOLOv4 thể hiện khả năng định vị biển số xe vượt trội trong điều kiện thực tế. Độ chính xác phát hiện trên tập kiểm thử xe máy đạt mức ấn tượng 99%, trong khi độ chính xác đối với biển số xe ô tô đạt 94% ngay cả khi phương tiện di chuyển ở các góc chụp chéo và nghiêng.

Thứ hai, chỉ số đo lường độ chính xác trung bình mAP@0.5 của mô hình đạt xấp xỉ 77,4% trên toàn bộ tập dữ liệu đánh giá. Đồ thị hàm mất mát hội tụ ổn định và giảm thiểu tối đa hiện tượng quá khớp (Overfitting) sau 50.000 vòng lặp huấn luyện.

Thứ ba, chỉ số diện tích trùng khớp giữa hộp bao dự đoán và nhãn thực tế (IoU) đều đạt ngưỡng an toàn trên 0.5 trong hơn 95% các trường hợp thử nghiệm, đảm bảo việc khoanh vùng khu vực biển số diễn ra trọn vẹn mà không làm mất thông tin mép viền.

Thứ tư, sự kết hợp giữa kỹ thuật tiền xử lý ảnh (phóng đại kích thước vùng biển số lên 3 lần kết hợp thuật toán phân ngưỡng tự động Otsu) và công cụ Tesseract OCR đã giúp nâng tỷ lệ nhận diện chính xác từng ký tự chữ số lên trên 92% đối với các biển số xe rõ nét.

Thảo luận kết quả

Hiệu năng phát hiện biển số vượt trội của mô hình bắt nguồn từ khả năng trích xuất đặc trưng đa quy mô của mạng tích chập kết hợp cùng hàm kích hoạt Mish, giúp duy trì các đặc trưng cạnh biên của biển số xe ngay cả trong điều kiện ánh sáng yếu.

Trong các báo cáo thực nghiệm, diễn biến quá trình huấn luyện có thể được minh họa trực quan qua biểu đồ đường học tập (Learning Curve) biểu diễn mối tương quan giữa sự suy giảm độ lỗi (Loss) và sự tăng trưởng của chỉ số mAP theo từng mốc 1.000 vòng lặp. Biểu đồ cho thấy hàm Loss giảm mạnh trong 10.000 vòng lặp đầu tiên và bắt đầu bão hòa từ vòng lặp thứ 35.000. Đồng thời, bảng thống kê so sánh hiệu năng giữa biển số xe máy và xe ô tô thể hiện rõ sự khác biệt: biển số xe máy hai dòng có tỷ lệ nhận diện cao hơn nhờ hình dạng vuông vức đặc trưng, trong khi biển số ô tô một dòng dạng dài dễ chịu tác động biến dạng góc nhìn khi xe rẽ.

So với mô hình RetinaNet vốn tốn nhiều tài nguyên tính toán cho các mạng con phân loại và hồi quy, YOLOv4 duy trì tốc độ xử lý nhanh hơn khoảng 30%, đáp ứng hoàn hảo yêu cầu tính toán theo thời gian thực (Real-time FPS) trên các luồng video giám sát trực tiếp.

Đề xuất và khuyến nghị

Dựa trên kết quả nghiên cứu, tác giả đưa ra 4 nhóm khuyến nghị mang tính ứng dụng cao nhằm hoàn thiện hệ thống trong thực tế:

Thứ nhất, mở rộng quy mô và độ đa dạng của tập dữ liệu huấn luyện. Doanh nghiệp phát triển phần mềm cần bổ sung thêm khoảng 10.000 mẫu ảnh chụp biển số xe trong các điều kiện thời tiết khắc nghiệt như mưa lớn, ban đêm thiếu sáng hoặc biển số bị mờ, dính bùn đất trong vòng 6 tháng tới, hướng đến mục tiêu nâng độ chính xác nhận diện tổng thể trong mọi môi trường từ 85% lên trên 95%.

Thứ hai, thay thế công cụ OCR truyền thống bằng các mô hình học sâu chuyên dụng cho văn bản dạng chuỗi. Đội ngũ kỹ sư thị giác máy tính nên nghiên cứu và tích hợp kiến trúc mạng CRNN (kết hợp CNN và RNN) cùng thuật toán giải mã CTC trong giai đoạn 3 tháng tiếp theo, nhằm rút ngắn thời gian xử lý nhận diện ký tự xuống dưới 50 mili-giây trên mỗi biển số.

Thứ ba, thực hiện tối ưu hóa và nén mô hình cho các thiết bị phần cứng nhúng (Edge AI). Các đơn vị phát triển giải pháp bãi đỗ xe thông minh cần áp dụng kỹ thuật lượng tử hóa trọng số (Quantization FP16 hoặc INT8) qua nền tảng TensorRT trong vòng 4 tháng, giúp giảm 60% dung lượng bộ nhớ và nâng tốc độ khung hình đạt 30 đến 45 FPS trên các vi máy tính như Jetson Nano hay Raspberry Pi.

Thứ tư, ban hành quy chuẩn kỹ thuật lắp đặt camera giám sát cho các bãi đỗ xe và trạm thu phí. Cơ quan quản lý đô thị và các doanh nghiệp vận hành cần chuẩn hóa góc đặt camera từ 15 đến 30 độ so với hướng di chuyển của phương tiện trong lộ trình 12 tháng, giúp giảm thiểu 70% các lỗi nhận diện sai do góc nghiêng quá mức.

Đối tượng nên tham khảo luận văn

Công trình nghiên cứu mang lại giá trị học thuật và ứng dụng thực tiễn cao cho 4 nhóm đối tượng cụ thể:

Nhóm thứ nhất là học viên cao học, nghiên cứu sinh và các nhà nghiên cứu trong lĩnh vực Trí tuệ nhân tạo và Thị giác máy tính. Luận văn cung cấp khung phương pháp luận hoàn chỉnh từ thu thập 2.995 mẫu dữ liệu, gán nhãn chuẩn hóa, huấn luyện YOLOv4 cho đến kỹ thuật chuyển đổi trọng số sang TensorFlow.

Nhóm thứ hai là các kỹ sư phát triển phần mềm giao thông thông minh (ITS). Họ có thể ứng dụng trực tiếp pipeline xử lý ảnh và mã nguồn của đề tài để tích hợp vào các hệ thống quản lý trạm thu phí không dừng (ETC) và bãi đỗ xe tự động, giúp tối ưu hóa thời gian quét xe qua cổng xuống dưới 0,5 giây.

Nhóm thứ ba là các doanh nghiệp công nghệ cung cấp giải pháp an ninh đô thị và tòa nhà thông minh. Doanh nghiệp có thể sử dụng kết quả này làm nền tảng xây dựng sản phẩm thương mại, giúp tiết kiệm khoảng 40% chi phí đầu tư nghiên cứu ban đầu và giảm thiểu chi phí nhân công vận hành.

Nhóm thứ tư là sinh viên ngành Công nghệ thông tin và Kỹ thuật máy tính. Luận văn là tài liệu tham khảo thực hành trực quan và sinh động về quy trình triển khai mạng nơ-ron tích chập giải quyết một bài toán thị giác máy tính từ đầu đến cuối.

Câu hỏi thường gặp

Lý do luận văn lựa chọn mô hình YOLOv4 thay vì các mô hình hai giai đoạn như Faster R-CNN là gì? YOLOv4 là mô hình một giai đoạn có tốc độ xử lý vượt trội, đáp ứng tốt yêu cầu thời gian thực trên luồng video camera với độ chính xác đạt tới 99% đối với xe máy. Ngược lại, các mô hình thuộc họ R-CNN tuy chính xác nhưng có độ trễ lớn do phải trải qua bước đề xuất vùng riêng biệt, gây nghẽn cổ chai khi áp dụng vào các bãi giữ xe có lưu lượng phương tiện cao.

Tập dữ liệu 2.995 ảnh trong luận văn có bảo đảm tính đại diện cho biển số xe tại Việt Nam không? Tập dữ liệu gồm 1.748 ảnh xe máy từ GreenParking và 1.247 ảnh ô tô từ chuyên trang thị giác máy tính, bao gồm đầy đủ các định dạng biển số vuông và chữ nhật phổ biến. Toàn bộ ảnh được thu thập từ các bãi xe thực tế với nhiều góc chụp và độ chiếu sáng khác nhau, bảo đảm tính đại diện cao cho các đô thị Việt Nam.

Tại sao cần thực hiện bước chuyển đổi trọng số từ Darknet sang TensorFlow? Darknet là nền tảng tối ưu cho việc huấn luyện mô hình YOLO nhanh chóng, nhưng TensorFlow lại có hệ sinh thái triển khai ứng dụng thương mại mạnh mẽ hơn. Việc chuyển đổi giúp hệ thống dễ dàng nhúng vào các ứng dụng giao diện đồ họa, dịch vụ web API hoặc thiết bị biên, tăng tính ổn định của hệ thống lên khoảng 30%.

Các bước tiền xử lý ảnh đóng vai trò như thế nào trước khi nhận diện bằng Tesseract OCR? Vùng ảnh biển số cắt ra thường có kích thước nhỏ và độ tương phản thấp. Việc tăng kích thước ảnh lên 3 lần kết hợp áp dụng phân ngưỡng Otsu giúp loại bỏ các vùng nhiễu bóng mờ, làm nổi bật đường nét ký tự, từ đó giảm thiểu hơn 80% nguy cơ nhận dạng nhầm giữa các ký tự có hình dạng tương đồng như số 8 và chữ B hay số 0 và chữ D.

Mô hình có thể xử lý chính xác các trường hợp biển số xe bị nghiêng hoặc biến dạng hình học không? Thực nghiệm trong luận văn chứng minh mô hình đạt độ chính xác 94% đối với biển số ô tô đặt ở góc nghiêng. Nhờ cơ chế dự đoán ô lưới đa tỷ lệ của YOLOv4, các hộp bao vẫn bao trọn vùng biển số nghiêng một cách chính xác trước khi chuyển tiếp sang module trích xuất ký tự.

Kết luận

Luận văn thạc sĩ của tác giả Lê Minh Nhật đã giải quyết thành công bài toán tự động nhận diện biển số xe máy và ô tô tại Việt Nam với các đóng góp nổi bật:

• Xây dựng hoàn chỉnh quy trình thị giác máy tính khép kín kết hợp giữa thuật toán phát hiện đối tượng YOLOv4 và công cụ Tesseract OCR phiên bản 4.1. • Đạt hiệu suất nhận diện vượt trội với độ chính xác phát hiện 99% trên biển số xe máy và 94% trên biển số xe ô tô ở góc chụp nghiêng. • Ứng dụng thành công các giải pháp tiền xử lý ảnh nâng cao (phóng đại 3 lần và phân ngưỡng Otsu) giúp tối ưu hóa khả năng đọc ký tự quang học. • Thực hiện chuyển đổi tệp trọng số sang nền tảng TensorFlow, mở ra khả năng đóng gói phần mềm và thương mại hóa sản phẩm nhanh chóng. • Chuẩn hóa tập dữ liệu 2.995 hình ảnh biển số xe thực tế, tạo nguồn tài nguyên nghiên cứu giá trị cho cộng đồng học thuật trong nước.

Trong lộ trình từ 6 đến 12 tháng tiếp theo, hướng phát triển trọng tâm sẽ là tích hợp mạng nơ-ron nhận dạng ký tự chuỗi chuyên sâu và triển khai thử nghiệm trên các vi mạch xử lý nhúng. Hãy khai thác và ứng dụng ngay tài liệu nghiên cứu này để xây dựng các giải pháp giao thông thông minh hiệu quả cho dự án của bạn!