Giới thiệu dự án

Sự gia tăng nhanh chóng của các phương tiện giao thông đường bộ tại Việt Nam—với hơn 65 triệu xe máy và gần 5 triệu ô tô đang lưu hành—đã đặt ra thách thức nghiêm trọng đối với công tác giám sát, điều tiết giao thông và quản lý bãi đỗ. Các phương thức kiểm soát thủ công hoặc bán tự động truyền thống bộc lộ rõ sự quá tải, độ trễ lớn và sai số do yếu tố con người. Trước thực tế đó, đề tài "Nhận dạng biển số xe" do sinh viên Vũ Minh Nguyệt (Viện Toán ứng dụng và Tin học, Trường Đại học Bách khoa Hà Nội) thực hiện dưới sự hướng dẫn của thầy Vũ Thành Nam đã nghiên cứu và phát triển giải pháp nhận dạng tự động dựa trên nền tảng thị giác máy tính và học sâu (Deep Learning).

+-----------------------------------------------------------------------------------+
|                                PROBLEM STATEMENT                                  |
|  - Biển số bị nghiêng góc lớn khi thu nhận từ camera giám sát di động             |
|  - Nhiễu nền thân xe (bodywork clutter) làm giảm độ chính xác OCR                 |
|  - Phương pháp tách ngưỡng truyền thống (Otsu/Haar) thất bại dưới ánh sáng phức tạp|
|  - Mô hình phát hiện cũ (YOLOv4/Darknet) cồng kềnh (244 MB), khó chạy trên Edge   |
+-----------------------------------------------------------------------------------+

Mục tiêu của dự án

  1. Xây dựng đường ống xử lý hoàn chỉnh (End-to-End Pipeline): Phát hiện phương tiện, định vị và nắn chỉnh biển số xe, nhận dạng ký tự quang học.
  2. Khắc phục biến dạng góc nhìn (Perspective Distortion): Tích hợp mạng WPOD (Warped Planar Object Detection) để tự động trích xuất 4 góc của biển số và thực hiện phép biến đổi affine (Affine Transformation), đưa biển số về góc nhìn trực diện chuẩn.
  3. Tối ưu hóa tài nguyên phần cứng: Huấn luyện mô hình phát hiện vật thể YOLOv5 trên framework PyTorch, giảm kích thước trọng số xuống ~27 MB (giảm 88.9% so với YOLOv4 Darknet ~244 MB), đạt tốc độ xử lý thời gian thực ($\ge 30\text{ FPS}$).
  4. Đạt độ chính xác cao trên dữ liệu biển số Việt Nam: Đảm bảo khả năng nhận diện chính xác trên cả biển số 1 dòng (ô tô) và biển số 2 dòng (xe máy, ô tô).

Phạm vi và giới hạn nghiên cứu

  • Phạm vi áp dụng: Biển số xe cơ giới dân sự tiêu chuẩn tại Việt Nam (chữ và số màu đen trên nền trắng).
  • Điều kiện biên: Biển số nguyên vẹn, không bị che khuất cơ học quá $40%$, ảnh chụp có độ tương phản đủ để phân biệt ký tự bằng mắt thường, không bị lóa sáng cực đại (over-exposure).

Phân tích và thiết kế giải pháp

Phân tích hiện trạng

Các hệ thống nhận dạng biển số xe (ALPR - Automatic License Plate Recognition) hiện nay thường gặp khó khăn khi triển khai ngoài môi trường thực tế do sự đa dạng về góc đặt camera, khoảng cách thu phóng và điều kiện chiếu sáng.

Tiêu chí so sánh Phương pháp Xử lý ảnh Cổ điển (Haar-Cascade + Otsu + Template Matching) Mô hình Two-Stage Deep Learning (Faster R-CNN + CRNN) Mô hình Đề xuất (YOLOv5 + WPOD-NET + YOLOv5 OCR)
Độ chính xác góc nghiêng $>30^\circ$ Rất thấp ($< 45%$) Trung bình ($75% - 82%$) Rất cao ($> 95%$) nhờ Affine Rectification
Tốc độ xử lý (Inference Latency) Nhanh ($10 - 20\text{ ms}$) nhưng tỷ lệ lỗi cao Chậm ($120 - 200\text{ ms/frame}$) Thời gian thực ($22 - 35\text{ ms/frame}$)
Dung lượng mô hình (Model Size) Rất nhẹ ($< 5\text{ MB}$) Rất nặng ($> 300\text{ MB}$) Nhẹ ($\approx 27\text{ MB}$)
Độ nhạy với nhiễu ánh sáng Rất cao (dễ đứt nét ký tự) Thấp Rất thấp (học đặc trưng qua CNN)
Khả năng triển khai Edge IoT Dễ nhưng không hữu dụng Rất khó, cần GPU đắt tiền Rất tốt (Jetson Nano, Raspberry Pi 4)

Phân loại yêu cầu hệ thống theo mô hình MoSCoW

  • Must Have (Bắt buộc): Phát hiện chính xác vùng xe; định vị biển số dưới góc nghiêng; nắn chỉnh về ảnh chữ nhật phẳng; đọc đúng ký tự số (0-9) và chữ cái (A-Z).
  • Should Have (Nên có): Xử lý đồng thời cả biển số 1 hàng và 2 hàng; xuất kết quả chuỗi ký tự chuẩn ASCII; thời gian đáp ứng dưới $50\text{ ms}$.
  • Could Have (Có thể có): Phân loại loại phương tiện (ô tô con, xe tải, xe máy); xuất tọa độ bounding box phục vụ lưu vết camera.
  • Won't Have (Chưa thực hiện): Nhận dạng biển số chuyên dụng quân sự/ngoại giao có màu sắc đặc thù; khôi phục biển số bị gãy vỡ biến dạng vật lý nghiêm trọng.

Thiết kế hệ thống

Kiến trúc tổng thể của hệ thống bao gồm 3 khối tính toán mạng nơ-ron tích chập (Convolutional Neural Network - CNN) hoạt động tuần tự:

graph TD
    A[Ảnh đầu vào Camera / Video Stream] --> B[Khối 1: Phát hiện Phương tiện - YOLOv5]
    B -->|Vùng ảnh xe ROI| C[Khối 2: Định vị & Căn chỉnh Biển số - WPOD-NET]
    C -->|Tọa độ 4 đỉnh đa giác| D[Phép biến đổi Affine / Perspective Warp]
    D -->|Ảnh biển số trực diện chuẩn hóa| E[Khối 3: Phân đoạn & Nhận dạng Ký tự - YOLOv5 OCR]
    E --> F[Hậu xử lý: Sắp xếp ký tự theo quy chuẩn 1/2 dòng]
    F --> G[Kết quả Text Biển số & Tọa độ Bounding Box]

Technology Stack và Thông số phiên bản

  • Ngôn ngữ lập trình: Python 3.8+
  • Deep Learning Framework: PyTorch 1.10.2 (cho YOLOv5), TensorFlow/Keras 2.6 (cho WPOD-NET)
  • Thị giác máy tính & Xử lý ảnh: OpenCV 4.5.5, NumPy 1.21
  • Mô hình kiến trúc: YOLOv5s (Small version), WPOD-NET (Warped Planar Object Detection Network)
  • Định dạng tối ưu hóa suy luận: ONNX Runtime, TensorRT (phục vụ nhúng biên)

Thiết kế An toàn thông tin và Hiệu năng

  • Bảo mật dữ liệu: Mã hóa một chiều thông tin biển số xe trong cơ sở dữ liệu nhật ký bằng chuẩn SHA-256 đối với các trường thông tin nhạy cảm; truyền tải dữ liệu qua giao thức HTTPS/gRPC.
  • Hiệu năng hệ thống: Sử dụng kiến trúc non-blocking I/O, xử lý luồng video qua RTSP Stream với bộ đệm đa luồng (multi-threaded frame buffer), tránh hiện tượng trễ khung hình (frame drop).

Methodology

Dự án áp dụng phương pháp nghiên cứu thực nghiệm lặp (Iterative Experimental Methodology) qua 4 mốc triển khai (Milestones):

  1. Giai đoạn 1 (Tuần 1 - Tuần 3): Thu thập, làm sạch và gán nhãn tập dữ liệu biển số Việt Nam (Labelling đa giác 4 điểm cho WPOD và Bounding Box cho YOLOv5).
  2. Giai đoạn 2 (Tuần 4 - Tuần 7): Huấn luyện mạng WPOD-NET với kỹ thuật Data Augmentation (xoay, kéo nghiêng, nhiễu sáng) để trích xuất ma trận biến đổi Affine.
  3. Giai đoạn 3 (Tuần 8 - Tuần 11): Fine-tuning YOLOv5 cho bài toán nhận dạng 36 lớp ký tự (10 số, 26 chữ cái), tối ưu hóa hàm mất mát và anchor box.
  4. Giai đoạn 4 (Tuần 12 - Tuần 14): Tích hợp đường ống end-to-end, đánh giá benchmark hiệu năng và đóng gói ứng dụng.

Implementation và kết quả

Development Process & Key Algorithms

1. Cơ chế tính toán Anchor Box và Không gian đặc trưng YOLOv5

YOLOv5 chia ảnh đầu vào kích thước $S \times S$ (mặc định $416 \times 416$ hoặc $608 \times 608$) thành các lưới ô (grid cells). Với đầu vào $416 \times 416$, mạng trích xuất 3 bản đồ đặc trưng (feature maps) đa tầng với hệ số giảm tỷ lệ (downsampling strides) lần lượt là 32, 16, và 8:

$$\text{Feature Maps} = \left{ \frac{416}{32} \times \frac{416}{32}, \frac{416}{16} \times \frac{416}{16}, \frac{416}{8} \times \frac{416}{8} \right} = { 13 \times 13, 26 \times 26, 52 \times 52 }$$

Tại mỗi ô trên từng feature map, mô hình áp dụng 3 anchor boxes có tỷ lệ kích thước khác nhau. Tổng số lượng bounding boxes được dự đoán đồng thời trên một bức ảnh là:

$$\text{Tổng Bounding Boxes} = (13^2 + 26^2 + 52^2) \times 3 = (169 + 676 + 2704) \times 3 = 3549 \times 3 = 10647 \text{ boxes}$$

Mỗi vector đầu ra của một bounding box có cấu trúc:

$$\mathbf{y} = \left[ t_x, t_y, t_w, t_h, P_0, P_1, P_2, \dots, P_C \right]^T$$

Trong đó: $(t_x, t_y)$ là tọa độ tâm; $(t_w, t_h)$ là độ rộng và chiều cao hộp; $P_0$ là xác suất tồn tại vật thể (Objectness score); $P_1 \dots P_C$ là phân phối xác suất của $C$ lớp nhãn ký tự.

                  +----------------------------------------------+
                  |            VECTOR ĐẦU RA YOLOV5             |
                  | [ tx | ty | tw | th | P_object | P_c1 ... P_cn ] |
                  +----------------------------------------------+
                         |     |     |     |       |          |
           Tọa độ tâm ---+-----+     |     |       |          |
           Kích thước bounding box --+-----+       |          |
           Xác suất chứa vật thể (Objectness) -----+          |
           Phân phối xác suất Class ký tự --------------------+

2. Hàm mất mát tổng hợp (Compound Loss Function)

Hàm mất mát của YOLOv5 được cấu thành từ 3 thành phần chính: Mất mát định vị tọa độ ($\mathcal{L}{box}$ dựa trên CIoU), mất mát nhận diện vật thể ($\mathcal{L}{obj}$ dựa trên BCEWithLogits), và mất mát phân loại ký tự ($\mathcal{L}_{cls}$):

$$\mathcal{L}{total} = \lambda_1 \mathcal{L}{box} + \lambda_2 \mathcal{L}{obj} + \lambda_3 \mathcal{L}{cls}$$

Hàm mất mát vị trí $\mathcal{L}_{box}$ tính theo Complete IoU (CIoU) Loss:

$$\mathcal{L}_{box} = 1 - \text{IoU} + \frac{\rho^2(b, b^{gt})}{c^2} + \alpha v$$

Trong đó $\rho(b, b^{gt})$ là khoảng cách Euclidean giữa tâm 2 bounding box, $c$ là độ dài đường chéo của hộp chữ nhật bao nhỏ nhất chứa cả 2 box, và $v$ đo lường sự nhất quán về tỷ lệ khung hình:

$$v = \frac{4}{\pi^2} \left( \arctan \frac{w^{gt}}{h^{gt}} - \arctan \frac{w}{h} \right)^2, \quad \alpha = \frac{v}{(1 - \text{IoU}) + v}$$

3. Thuật toán nắn chỉnh Affine từ WPOD-NET

Khi camera chụp chéo, biển số bị biến dạng thành hình tứ giác không đều trong không gian 2D. WPOD-NET dự đoán trực tiếp tọa độ 4 đỉnh $P_i = (x_i, y_i)$ với $i \in {1, 2, 3, 4}$. Hệ thống áp dụng phép biến đổi phối cảnh (Perspective Transform) chuyển các điểm này về một ma trận phẳng chuẩn kích thước cố định $W_{std} \times H_{std}$ (ví dụ $240 \times 80\text{ pixels}$ cho biển dài hoặc $200 \times 140\text{ pixels}$ cho biển vuông):

import cv2
import numpy as np

def unwarp_license_plate(image, pts, target_size=(240, 80)):
    """
    pts: Tọa độ 4 góc biển số [Top-Left, Top-Right, Bottom-Right, Bottom-Left]
    target_size: (Width, Height) đầu ra chuẩn hóa
    """
    rect = np.array(pts, dtype="float32")
    (w_std, h_std) = target_size
    
    # Tọa độ đích cho góc nhìn trực diện
    dst = np.array([
        [0, 0],
        [w_std - 1, 0],
        [w_std - 1, h_std - 1],
        [0, h_std - 1]
    ], dtype="float32")
    
    # Tính ma trận biến đổi phối cảnh 3x3
    M = cv2.getPerspectiveTransform(rect, dst)
    # Áp dụng Warp Perspective đưa biển số về dạng chữ nhật phẳng
    warped = cv2.warpPerspective(image, M, (w_std, h_std), flags=cv2.INTER_CUBIC)
    
    return warped

Testing và validation

Mô hình được huấn luyện và kiểm thử trên tập dữ liệu gồm 2,800 ảnh phương tiện thực tế tại Việt Nam (thu thập tại bãi xe ĐHBK Hà Nội, ngã tư giao thông Giải Phóng - Đại Cồ Việt và bộ dữ liệu mở). Tỷ lệ phân chia tập Train/Val/Test là 70/20/10.

  • Cấu hình phần cứng huấn luyện: NVIDIA RTX 3060 12GB VRAM, CPU Intel Core i7-11700K @ 3.60GHz, 32GB RAM.
  • Cấu hình suy luận kiểm thử: NVIDIA GTX 1650 (Laptop) và CPU thuần Intel Core i5.
Module chức năng Precision ($P$) Recall ($R$) mAP@0.5 Thời gian suy luận (GPU GTX 1650)
Phát hiện phương tiện (YOLOv5s) $98.6%$ $97.9%$ $98.8%$ $12.4\text{ ms}$
Định vị & Nắn biển số (WPOD-NET) $96.8%$ $95.4%$ $96.2%$ $8.6\text{ ms}$
Nhận dạng ký tự (YOLOv5 OCR) $96.1%$ $95.2%$ $95.8%$ $9.2\text{ ms}$
Toàn bộ Pipeline (End-to-End) $93.8%$ $92.6%$ $93.2%$ $30.2\text{ ms}$ ($\approx 33\text{ FPS}$)
                       ACCURACY & RECOVERY BENCHMARKS
  100% +-------------------------------------------------------+
       |   98.8%                  96.2%                95.8%   |
   80% | [Vehicle Detect]   [WPOD LP Detect]    [Char Recognition] |
   60% |                                                       |
   40% |                                                       |
   20% |                                                       |
    0% +-------------------------------------------------------+

Đổi mới và đóng góp

1. Đổi mới về kiến trúc giải thuật: Tích hợp WPOD-NET triệt tiêu nhiễu thân xe

Trong các hệ thống nhận dạng truyền thống sử dụng Bounding Box chuẩn 2 điểm (Top-Left và Bottom-Right), khi biển số bị chụp nghiêng một góc $\theta > 20^\circ$, khung chữ nhật bao quanh biển số sẽ vô tình chứa một lượng lớn chi tiết thừa của thân xe (cản xe, đèn xe, lưới tản nhiệt). Lượng nhiễu này khiến các mô hình phân đoạn ký tự truyền thống hoặc OCR bị nhầm lẫn nghiêm trọng.

Việc ứng dụng mạng nơ-ron tích chập phẳng nghiêng WPOD-NET cho phép mạng học cách dự đoán trực tiếp các phép biến đổi afin cục bộ (local affine transformations). Nhờ đó, hệ thống nắn chỉnh chính xác vùng biển số về dạng chữ nhật trực diện trước khi đưa vào bước nhận dạng ký tự, nâng cao tỷ lệ nhận dạng đúng thêm $14.3%$ so với việc chỉ dùng Bounding Box vuông thông thường.

2. Phương pháp OCR dựa trên YOLOv5 thay vì phân đoạn nhị phân rời rạc

Thay vì thực hiện chuỗi xử lý nhị phân hóa ảnh (Binarization) $\rightarrow$ Cắt từng ký tự (Segmentation) $\rightarrow$ Phân loại từng ký tự, đồ án sử dụng trực tiếp mạng YOLOv5 để phát hiện và gán nhãn đồng thời toàn bộ ký tự trong biển số. Cách tiếp cận này loại bỏ hoàn toàn các lỗi tích lũy kinh điển do ký tự bị dính liền, đứt nét bởi bóng râm hoặc rỉ sét nhẹ.

3. Tối ưu hóa mô hình phục vụ triển khai thiết bị nhúng

  • Kích thước mô hình YOLOv5s được tối ưu đạt $27.2\text{ MB}$, giảm $88.9%$ dung lượng so với kiến trúc YOLOv4 Darknet ($244\text{ MB}$).
  • Thời gian xử lý toàn chu trình đạt $30.2\text{ ms}$ trên GPU tầm trung, đáp ứng tiêu chuẩn khắt khe của các hệ thống xử lý luồng video thời gian thực ($>30\text{ FPS}$).

Ứng dụng thực tế và triển khai

Kịch bản ứng dụng trong đời sống

  1. Hệ thống Quản lý Bãi đỗ xe Thông minh (Smart Parking): Tự động mở barie khi xe tiến vào vị trí quét, lưu trữ hình ảnh và biển số vào cơ sở dữ liệu để đối soát thời gian thực khi xe ra, rút ngắn thời gian xử lý từ $15\text{ giây/xe}$ xuống dưới $1.5\text{ giây/xe}$.
  2. Trạm Thu phí Tự động Không dừng (ETC): Hỗ trợ đối chiếu biển số xe tự động với mã định danh thẻ Epass/VETC, phát hiện các trường hợp biển số giả hoặc phương tiện không khớp thông tin đăng ký.
  3. Phạt nguội và Giám sát Vi phạm Giao thông: Triển khai trên các camera giám sát cố định tại ngã tư hoặc camera hành trình gắn trên xe cảnh sát tuần tra để tự động ghi nhận phương tiện vượt đèn đỏ, đi sai làn đường.
+-------------------------------------------------------------------------------+
|                        DEPLOYMENT ARCHITECTURE AT EDGE                        |
|                                                                               |
|   [IP Camera RTSP] ---> [FastAPI / Python Service] ---> [SQLite / PostgreSQL] |
|                                |                                              |
|                      +---------+---------+                                    |
|                      |  YOLOv5 + WPOD    |                                    |
|                      |  TensorRT Engine  |                                    |
|                      +-------------------+                                    |
|                                |                                              |
|                                v                                              |
|                     [Web Dashboard / Barie IO]                                |
+-------------------------------------------------------------------------------+

Hướng dẫn triển khai hệ thống (Deployment Instructions)

1. Yêu cầu môi trường phần cứng và phần mềm

  • Phần cứng tối thiểu: CPU Intel Core i3 thế hệ 8 trở lên (hoặc NVIDIA Jetson Nano 4GB), RAM 8GB, Camera chuẩn RTSP Full HD (1080p).
  • Phần mềm: Ubuntu 20.04 LTS / Windows 10/11, Python 3.8+, CUDA Toolkit 11.3 và cuDNN 8.2 (nếu dùng GPU).

2. Quy trình cài đặt và chạy dịch vụ

# 1. Khởi tạo môi trường ảo
python3 -m venv venv
source venv/bin/activate

# 2. Cài đặt các thư viện phụ thuộc
pip install --upgrade pip
pip install torch torchvision --extra-index-url https://download.pytorch.org/whl/cu113
pip install opencv-python numpy fastapi uvicorn pillow

# 3. Chạy chương trình nhận dạng trực tiếp từ luồng RTSP / Video
python run_alpr_pipeline.py --source rtsp://admin:password@192.168.1.100:554/stream1 --weights-lp weights/wpod.pth --weights-ocr weights/yolov5s_ocr.pt --device 0

Hạn chế và hướng phát triển

Hạn chế kỹ thuật hiện tại

  • Điều kiện chiếu sáng khắc nghiệt: Tỷ lệ nhận dạng suy giảm khoảng $12.5%$ khi hoạt động trong môi trường ban đêm có đèn pha chiếu thẳng vào ống kính (hiện tượng halo lóa sáng) hoặc camera thiếu đèn hồng ngoại hỗ trợ.
  • Biển số bị che khuất vật lý lớn: Trường hợp biển số bị bùn đất che lấp hoàn toàn ký tự hoặc bị cố tình dán băng dính làm thay đổi hình dạng số (ví dụ sửa số 3 thành số 8, số 0 thành số 8), mô hình AI có thể nhận dạng sai ký tự cục bộ.
  • Tài nguyên CPU thuần: Khi chạy trên các chip CPU cấp thấp không có card đồ họa chuyên dụng, tốc độ khung hình chỉ đạt $12 - 18\text{ FPS}$, chưa đạt chuẩn Real-time mượt mà cho các luồng xe chạy tốc độ cao ($>60\text{ km/h}$).

Hướng phát triển và mở rộng

  1. Tích hợp mô hình Siêu phân giải ảnh (Super-Resolution): Áp dụng mạng Real-ESRGAN nhẹ để khôi phục chi tiết biển số có độ phân giải thấp chụp từ khoảng cách xa ($> 15\text{ mét}$).
  2. Kết hợp thuật toán theo dõi đa vật thể (Multi-Object Tracking - ByteTrack / DeepSORT): Lưu vết phương tiện qua từng frame video, cho phép tổng hợp kết quả nhận dạng từ nhiều khung hình liên tiếp thông qua cơ chế Voting, nâng độ chính xác tổng thể lên $> 99%$.
  3. Chuyển đổi mô hình sang định dạng TensorRT / OpenVINO: Tối ưu hóa lượng tử hóa số nguyên 8-bit (INT8 Quantization) để tăng tốc độ suy luận gấp 2-3 lần trên các vi xử lý nhúng giá rẻ.

Đối tượng hưởng lợi

  • Sinh viên và Học viên Cao học: Nguồn tài liệu tham khảo chi tiết về quy trình xây dựng đường ống Computer Vision hoàn chỉnh kết hợp giữa các kiến trúc mạng nơ-ron khác nhau (Object Detection + Spatial Warping).
  • Kỹ sư AI và Lập trình viên Thị giác Máy tính: Nắm bắt kỹ thuật tối ưu hóa mã nguồn PyTorch, phương pháp huấn luyện anchor box đa tỷ lệ và kỹ thuật xử lý ảnh hình học trực tiếp trên OpenCV.
  • Doanh nghiệp Quản lý Tòa nhà & Bãi xe: Cơ sở khoa học để tự chủ giải pháp công nghệ nhận dạng biển số nội địa với chi phí bản quyền bằng 0, không phụ thuộc vào các giải pháp phần mềm thương mại đắt đỏ của nước ngoài.
  • Cơ quan Quản lý Giao thông & Đô thị Thông minh: Tiền đề công nghệ phục vụ tích hợp vào các trung tâm điều hành thông minh (IOC) nhằm tự động hóa giám sát an ninh trật tự công cộng.

Câu hỏi thường gặp

1. Hệ thống cần cấu hình phần cứng tối thiểu như thế nào để nhận dạng mượt mà?

Để đạt hiệu năng thời gian thực ($30\text{ FPS}$) ở độ phân giải 1080p, hệ thống cần tối thiểu một card đồ họa rời NVIDIA GTX 1050Ti (4GB VRAM) hoặc thiết bị tính toán nhúng chuyên dụng như NVIDIA Jetson Xavier NX. Nếu chỉ cần xử lý ảnh tĩnh tại trạm gác bãi xe (thời gian xử lý $< 1\text{ giây/lượt}$), cấu hình CPU Intel Core i3 thế hệ 8 cùng 8GB RAM hoàn toàn đáp ứng tốt mà không cần GPU rời.

2. WPOD-NET có thể xử lý được biển số nghiêng tối đa bao nhiêu độ?

Qua thực nghiệm kiểm thử, mạng WPOD-NET kết hợp thuật toán biến đổi Affine có khả năng phát hiện và nắn chỉnh chính xác các biển số bị nghiêng góc ngang (Yaw) lên đến $45^\circ$ và góc dọc (Pitch) lên đến $40^\circ$. Vượt quá góc này, độ biến dạng hình học của nét chữ quá lớn khiến tỷ lệ nhận dạng OCR giảm dần.

3. Hệ thống có thể tích hợp trực tiếp vào các camera IP có sẵn trên thị trường không?

Hoàn toàn có thể. Ứng dụng hỗ trợ giao thức chuẩn RTSP (Real-Time Streaming Protocol) và ONVIF. Hệ thống có thể kết nối trực tiếp đến bất kỳ dòng camera IP công nghiệp nào (Hikvision, Dahua, KBVision, Hanwha...) thông qua đường dẫn URL stream bảo mật của mạng LAN nội bộ.

4. Chi phí triển khai và thời gian hoàn vốn (ROI) của giải pháp này ra sao?

Do toàn bộ lõi thuật toán được xây dựng trên các framework mã nguồn mở (PyTorch, OpenCV), doanh nghiệp không phải chịu phí license phần mềm hàng năm (thường dao động từ 15 - 30 triệu VNĐ/làn xe đối với phần mềm thương mại). Chi phí chủ yếu tập trung vào phần cứng camera và máy trạm. Một bãi đỗ xe quy mô 1,000 lượt xe/ngày có thể thu hồi vốn đầu tư trong vòng 3 - 6 tháng nhờ cắt giảm từ 2 - 3 nhân sự trực cổng kiểm soát.

5. Làm thế nào để hệ thống nhận diện tốt vào ban đêm hoặc trời mưa lớn?

Cần kết hợp giải pháp phần cứng: Sử dụng camera có cảm biến Starlight (nhạy sáng cao), trang bị đèn LED hồng ngoại (IR) hoặc đèn rọi bù sáng có bước sóng phù hợp để loại bỏ bóng tối trên biển số. Về mặt phần mềm, thuật toán tăng cường độ tương phản thích ứng cục bộ (CLAHE) có thể được kích hoạt tự động trước khi đưa ảnh vào mạng WPOD-NET.


Kết luận

Đồ án tốt nghiệp "Nhận dạng biển số xe" của tác giả Vũ Minh Nguyệt (Trường Đại học Bách khoa Hà Nội) đã giải quyết trọn vẹn bài toán tự động hóa đọc biển số xe trong điều kiện thực tế tại Việt Nam. Bằng việc kết hợp sáng tạo giữa mô hình nắn chỉnh hình học không gian WPOD-NET và kiến trúc phát hiện đối tượng tối tân YOLOv5, hệ thống đã khắc phục triệt để điểm yếu cố hữu về biến dạng góc chụp và nhiễu nền thân xe mà các phương pháp truyền thống gặp phải.

Với độ chính xác toàn hệ thống đạt $93.8%$, tốc độ xử lý nhanh $30.2\text{ ms/ảnh}$ và dung lượng mô hình siêu nhẹ chỉ $27.2\text{ MB}$, nghiên cứu mang giá trị thực tiễn cao, sẵn sàng phục vụ chuyển giao công nghệ cho các hệ thống bãi đỗ xe thông minh, trạm thu phí ETC và hạ tầng giao thông thông minh (ITS) trên toàn quốc.