Tổng quan nghiên cứu

Sự gia tăng nhanh chóng của các phương tiện cơ giới đường bộ với hơn 45 triệu xe máy và hàng triệu ô tô lưu hành tại Việt Nam đã đặt ra thách thức nghiêm trọng đối với công tác quản lý giao thông đô thị và an ninh trật tự. Các phương pháp giám sát thủ công truyền thống bộc lộ rõ sự quá tải, chậm trễ và dễ phát sinh sai sót. Trước thực tế đó, hệ thống nhận dạng biển số xe tự động (Automatic License Plate Recognition - ALPR) trở thành giải pháp cốt lõi trong các đô thị thông minh, bãi đỗ xe tự động và trạm thu phí không dừng.

Tuy nhiên, bài toán nhận dạng biển số xe tại Việt Nam đối mặt với nhiều rào cản phức tạp như điều kiện ánh sáng thay đổi thất thường, góc chụp nghiêng, bụi bẩn cơ học và sự đa dạng giữa các định dạng biển số một hàng hay hai hàng. Các kỹ thuật nhận dạng mẫu cổ điển thường dễ bị nhiễu và suy giảm độ chính xác nghiêm trọng khi ngoại cảnh biến động. Luận văn thạc sĩ chuyên ngành Kỹ thuật phần mềm của tác giả Lê Thị Thu Hằng, dưới sự hướng dẫn khoa học của Tiến sĩ Nguyễn Văn Vinh tại Trường Đại học Công nghệ – Đại học Quốc gia Hà Nội, tập trung giải quyết triệt để vấn đề này.

Mục tiêu trọng tâm của nghiên cứu là xây dựng mô hình mạng nơ-ron tích chập (Convolutional Neural Network - CNN) chuyên biệt cho tác vụ phân loại ký tự quang học, kết hợp với các kỹ thuật xử lý hình thái học để định vị vùng biển số xe máy và ô tô theo quy chuẩn Việt Nam. Nghiên cứu mang ý nghĩa thực tiễn to lớn khi tối ưu hóa cấu trúc tính toán, cắt giảm hơn 40 lần số lượng tham số so với các mạng truyền thẳng truyền thống, đồng thời đảm bảo hệ thống vận hành theo thời gian thực với độ chính xác nhận dạng vượt mức 98%.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng trên nền tảng của mạng nơ-ron nhân tạo (Artificial Neural Network - ANN) và bước tiến hóa vượt bậc là mạng nơ-ron tích chập (CNN). Khung lý thuyết khởi đầu từ mô hình mạng Perceptron đa tầng (Multi-Layer Perceptron - MLP) sử dụng thuật toán lan truyền ngược (Backpropagation) và hàm kích hoạt phi tuyến Sigmoid để cập nhật trọng số dựa trên cực tiểu hóa sai số trung bình bình phương (Mean Squared Error - MSE). Mặc dù MLP có khả năng xấp xỉ hàm liên tục rất tốt, mô hình này lại bộc lộ hạn chế lớn trong xử lý ảnh do không bảo toàn được cấu trúc không gian cục bộ và đòi hỏi số lượng trọng số quá lớn.

Để khắc phục điểm yếu đó, lý thuyết học sâu với kiến trúc mạng CNN được áp dụng như một trụ cột nghiên cứu. Mạng CNN vận hành dựa trên ba nguyên lý cốt lõi: trường tiếp nhận cục bộ (local receptive fields), trọng số chia sẻ (shared weights) và lớp gộp tổng hợp (pooling layer). Bằng cách trượt các ma trận bộ lọc (kernel) kích thước 5x5 điểm ảnh qua toàn bộ bức ảnh, mạng tự động trích xuất các bản đồ đặc trưng (feature maps) từ mức độ thấp như biên cạnh, góc sắc đến mức độ trừu tượng cao hơn như đường cong và hình khối ký tự. Cơ chế Max-pooling với kích thước 2x2 tiếp tục nén giảm số chiều dữ liệu, loại bỏ thông tin định vị thừa và mang lại tính bất biến đối với các phép dịch chuyển, co giãn hoặc xoay nhẹ của ảnh đầu vào.

Phương pháp nghiên cứu

Về nguồn dữ liệu và chọn mẫu, nghiên cứu sử dụng tập dữ liệu chuẩn hóa quốc tế MNIST gồm 70.000 mẫu chữ số viết tay (60.000 mẫu huấn luyện và 10.000 mẫu kiểm thử) để đánh giá khả năng phân loại tổng quát của mô hình tích chập. Đồng thời, tác giả thu thập mẫu ảnh biển số thực tế của ô tô và xe máy tại Việt Nam trong dải mức xám từ 130 đến 200 để kiểm nghiệm thuật toán phân đoạn và định vị. Phương pháp chọn mẫu bao gồm cả các trường hợp ảnh chụp góc nghiêng, điều kiện thiếu sáng và nền phức tạp nhằm đảm bảo tính bao quát thực tế.

Quy trình nghiên cứu thực nghiệm được thiết kế qua 7 bước chuẩn hóa:

  1. Thu nhận ảnh màu gốc định dạng BGR từ camera và áp dụng các bộ lọc nâng cao chất lượng ảnh.
  2. Xác định các đường bao khép kín (contour) trên toàn bộ khung hình xe.
  3. Lọc và phân loại contour dựa trên tiêu chuẩn hình học của Bộ Giao thông Vận tải: tỷ lệ chiều cao trên chiều rộng từ 0.18 đến 0.8; kích thước biển ô tô 110x470 mm hoặc 200x280 mm, biển xe máy 140x190 mm.
  4. Trích xuất chính xác vùng ứng viên chứa biển số xe.
  5. Cắt tách từng ký tự con với chiều cao ký tự chiếm 60% đến 85% chiều cao biển số đơn hàng.
  6. Đưa ảnh ký tự đã chuẩn hóa về kích thước 32x32 điểm ảnh vào mạng CNN để phân lớp.
  7. Trích xuất văn bản ký tự và hiển thị kết quả đầu ra.

Phương pháp phân tích này được lựa chọn vì nó tách biệt rõ ràng giai đoạn định vị hình thái và giai đoạn phân loại học sâu, giúp giảm thiểu độ phức tạp tính toán và tối ưu hóa tài nguyên phần cứng.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Thực nghiệm nghiên cứu đã mang lại 3 phát hiện khoa học mang tính đột phá về cả hiệu năng lẫn độ chính xác:

Thứ nhất, mô hình mạng tích chập thể hiện sự vượt trội hoàn toàn về khả năng tối ưu hóa tham số mạng. Trong khi một tầng kết nối đầy đủ (MLP) cho ảnh kích thước 28x28 điểm ảnh với 30 nơ-ron ẩn đòi hỏi tới 23.550 tham số (gồm 784x30 trọng số và 30 độ lệch bias), thì tầng tích chập CNN sử dụng 20 bản đồ đặc trưng với bộ lọc 5x5 chỉ cần đúng 520 tham số (20x26 tham số). Sự cải tiến này giúp cắt giảm hơn 97.7% dung lượng tham số, tương đương giảm tải hơn 40 lần, qua đó rút ngắn đáng kể thời gian huấn luyện và hạn chế tối đa nguy cơ quá khớp (overfitting).

Thứ hai, mô hình kiến trúc mạng CNN 6 tầng chuyên biệt (C1: 6 bản đồ đặc trưng 28x28; S2: 6 bản đồ gộp 14x14; C3: 16 bản đồ đặc trưng 10x10; S4: 16 bản đồ gộp 5x5; C5: 120 bản đồ 1x1; F6: 84 nút kết nối đầy đủ) đạt độ chính xác nhận dạng ký tự trên 98% trên tập dữ liệu kiểm thử. Các ký tự số từ 0 đến 9 được phân loại dứt khoát với độ tin cậy vượt trội.

Thứ ba, sự kết hợp giữa xử lý hình thái học và bộ lọc gradient Sobel giúp hệ thống định vị vùng biển số đạt tỷ lệ thành công xấp xỉ 98.9%, tương đương với các công bố quốc tế tiêu biểu như nghiên cứu của Chirag Paunwala với tỷ lệ 742 trên 750 ảnh (đạt 98.93%) và nghiên cứu của Choo Kar Soon tại Malaysia đạt 98% nhận dạng biển số và 95% nhận dạng ký tự.

Thảo luận kết quả

Hiệu quả vượt bậc của mô hình bắt nguồn từ khả năng tự động học các bộ lọc trích xuất đặc trưng của mạng tích chập. Thay vì phải thiết kế thủ công các đặc trưng hình thái vốn rất nhạy cảm với nhiễu quang học, các tầng tích chập C1 và C3 tự động phát hiện các cạnh viền, góc uốn lượn và đường nét riêng biệt của từng ký tự. Lớp Max-pooling giúp duy trì tính ổn định của đặc trưng ngay cả khi ký tự bị biến dạng nhẹ hoặc dịch chuyển vị trí do rung lắc camera.

Dữ liệu thực nghiệm của nghiên cứu có thể được trực quan hóa sinh động thông qua hai công cụ phân tích chuẩn mực. Thứ nhất là biểu đồ đường biểu diễn sự suy giảm của hàm mất mát MSE và tốc độ hội tụ của thuật toán lan truyền ngược qua từng chu kỳ huấn luyện (epoch). Thứ hai là ma trận nhầm lẫn (Confusion Matrix) 10x10 thể hiện chi tiết xác suất phân lớp giữa các chữ số, chỉ ra rằng các trường hợp dễ nhầm lẫn như số 8 và số 0 hay số 1 và số 7 đã được phân tách rõ ràng nhờ các bản đồ đặc trưng cục bộ ở tầng C3. So với các giải pháp truyền thống như K-Nearest Neighbors (KNN) hay Support Vector Machine (SVM), mô hình CNN chứng minh tính ổn định vượt trội trong môi trường thực nghiệm có độ nhiễu cao.

Đề xuất và khuyến nghị

Dựa trên các kết quả đạt được, luận văn đưa ra 4 nhóm giải pháp cụ thể nhằm đưa mô hình vào ứng dụng thực tiễn rộng rãi:

  1. Tối ưu hóa kiến trúc mạng và tăng cường dữ liệu: Nhóm nghiên cứu phần mềm cần áp dụng thêm kỹ thuật Dropout và mở rộng tập dữ liệu huấn luyện bằng các phép biến đổi hình học (xoay góc nghiêng từ âm 15 độ đến dương 15 độ, thay đổi độ tương phản, mô phỏng lóa sáng) nhằm nâng tỷ lệ nhận dạng ký tự thực tế đạt mức mục tiêu trên 99.5% trong vòng 3 đến 6 tháng tới.
  2. Triển khai tăng tốc phần cứng chuyên dụng: Các kỹ sư tích hợp hệ thống cần chuyển giao mô hình mạng CNN sang các nền tảng phần cứng nhúng tích hợp bộ xử lý đồ họa (GPU) chuyên dụng hoặc vi xử lý trí tuệ nhân tạo biên, hướng tới rút ngắn độ trễ xử lý xuống dưới 50 mili-giây mỗi khung hình, đáp ứng yêu cầu nhận dạng phương tiện di chuyển ở dải tốc độ 60 đến 80 km/h.
  3. Chuẩn hóa hạ tầng camera và điều kiện chiếu sáng: Ban quản lý các bãi đỗ xe thông minh và trạm thu phí cần thiết lập góc đặt camera cố định với góc nghiêng không vượt quá 15 độ so với phương ngang, đồng thời trang bị hệ thống đèn LED hồng ngoại bổ trợ để luôn duy trì mức xám của vùng biển số trong ngưỡng tối ưu từ 130 đến 200 đơn vị.
  4. Mở rộng tập nhận dạng toàn diện ký tự chữ cái và biển số đặc thù: Cơ quan quản lý giao thông và các đơn vị phát triển giải pháp cần phối hợp mở rộng mô hình phân lớp từ 10 chữ số lên 36 ký tự chữ và số (bao gồm từ A đến Z), đồng thời hoàn thiện bộ nhận diện cho các loại biển số xe quân sự, biển ngoại giao và biển số có 2 hàng ký tự trong lộ trình triển khai 12 tháng tiếp theo.

Đối tượng nên tham khảo luận văn

Luận văn là nguồn tư liệu học thuật và kỹ thuật giá trị dành cho 4 nhóm đối tượng chính:

  • Kỹ sư và Lập trình viên Thị giác máy tính (Computer Vision): Tìm thấy tài liệu thực tế về cơ chế toán học của phép toán tích chập, cách thiết lập số lượng bản đồ đặc trưng và phương pháp xây dựng pipeline xử lý ảnh hoàn chỉnh từ trích xuất contour đến mạng CNN.
  • Học viên cao học và Sinh viên ngành Công nghệ thông tin: Tiếp cận một công trình nghiên cứu mẫu mực về việc ứng dụng học sâu giải quyết bài toán thị giác máy tính, nắm bắt rõ phương pháp thực nghiệm trên tập dữ liệu chuẩn MNIST và cách tiếp cận xử lý ảnh tại Việt Nam.
  • Doanh nghiệp phát triển giải pháp Giao thông thông minh (ITS): Khai thác kiến trúc mạng nơ-ron tinh gọn với số lượng tham số chỉ 520 đơn vị ở tầng tích chập, giúp tiết kiệm chi phí đầu tư máy chủ và tối ưu hóa hệ thống kiểm soát xe tự động.
  • Cơ quan quản lý hạ tầng đô thị và đăng kiểm: Nắm bắt cơ sở khoa học để xây dựng quy chuẩn kỹ thuật cho các hệ thống giám sát an ninh trật tự, xử phạt vi phạm giao thông và quản lý phương tiện thông minh.

Câu hỏi thường gặp

Mạng nơ-ron tích chập (CNN) vượt trội hơn mạng truyền thẳng (MLP) ở những điểm nào?

Mạng CNN vượt trội nhờ khả năng bảo toàn cấu trúc không gian 2 chiều của ảnh thông qua các trường tiếp nhận cục bộ 5x5 và cơ chế chia sẻ trọng số. Trong khi mạng MLP cho ảnh 28x28 cần tới 23.550 tham số thì tầng tích chập CNN chỉ cần 520 tham số, giúp giảm tải hơn 40 lần dung lượng bộ nhớ, tăng tốc độ xử lý và hạn chế quá khớp.

Thuật toán định vị biển số trong nghiên cứu xử lý đặc thù biển số Việt Nam ra sao?

Nghiên cứu ứng dụng xử lý hình thái học dựa trên dải mức xám đặc thù từ 130 đến 200 và lọc các contour bao đóng theo tỷ lệ kích thước chuẩn của Bộ Giao thông Vận tải. Tỷ lệ chiều cao trên chiều rộng nằm trong khoảng 0.18 đến 0.8 giúp phát hiện chính xác cả biển ô tô dài, biển vuông và biển xe máy.

Lớp Max-pooling trong kiến trúc CNN đóng vai trò gì?

Lớp Max-pooling thu gọn một vùng 2x2 nơ-ron thành một giá trị kích hoạt lớn nhất, giúp nén ma trận đặc trưng từ 28x28 xuống 14x14 và từ 10x10 xuống 5x5. Thao tác này loại bỏ thông tin vị trí cục bộ không cần thiết, tạo ra tính bất biến với phép tịnh tiến và xoay nhẹ của ảnh.

Hệ thống có hoạt động chính xác trong điều kiện ánh sáng yếu hoặc ban đêm không?

Trong điều kiện thiếu sáng hoặc lóa sáng, độ chính xác có thể bị ảnh hưởng nếu mức xám lệch khỏi dải 130 đến 200. Tuy nhiên, việc kết hợp bộ lọc gradient Sobel để tìm biên cạnh và khả năng trích xuất đặc trưng trừu tượng của CNN giúp hệ thống duy trì độ ổn định cao hơn hẳn các phương pháp khớp mẫu cổ điển.

Cần làm gì để ngăn ngừa hiện tượng quá khớp (overfitting) khi huấn luyện mô hình?

Để ngăn hiện tượng quá khớp khi mạng học cả nhiễu của dữ liệu, nghiên cứu áp dụng các phương pháp: giới hạn số lượng nơ-ron ẩn, chia tách nghiêm ngặt tập mẫu huấn luyện và kiểm tra để dừng học kịp thời khi sai số kiểm thử có xu hướng tăng, đồng thời đề xuất bổ sung kỹ thuật Dropout trong các nghiên cứu mở rộng.

Kết luận

  • Luận văn đã hệ thống hóa toàn diện cơ sở lý thuyết về mạng nơ-ron nhân tạo, thuật toán lan truyền ngược và mô hình học sâu tích chập tiên tiến.
  • Chứng minh bằng thực nghiệm khả năng tối ưu hóa vượt bậc của mạng CNN khi cắt giảm số lượng tham số hơn 40 lần (từ 23.550 xuống 520 tham số) so với mạng MLP truyền thống.
  • Xây dựng thành công quy trình xử lý ảnh 7 bước kết hợp hình thái học và bộ lọc biên Sobel, tương thích hoàn hảo với tiêu chuẩn biển số xe cơ giới tại Việt Nam.
  • Thiết kế kiến trúc mạng CNN 6 tầng chuyên biệt đạt tỷ lệ nhận dạng ký tự thực nghiệm trên 98%, tương đương các công bố quốc tế tiêu biểu.
  • Cung cấp giải pháp kỹ thuật hoàn chỉnh, sẵn sàng tích hợp vào các hệ thống quản lý bãi đỗ xe tự động, trạm thu phí không dừng và giám sát an ninh trật tự đô thị.

Công trình là đóng góp học thuật và thực tiễn vững chắc cho lĩnh vực thị giác máy tính tại Việt Nam. Trong lộ trình 3 đến 12 tháng tới, việc mở rộng mô hình lên tập 36 ký tự chữ và số cùng triển khai trên phần cứng nhúng GPU sẽ hoàn thiện giải pháp nhận dạng biển số thông minh toàn diện. Hãy tham khảo toàn văn công trình nghiên cứu để nắm bắt chi tiết thuật toán và áp dụng hiệu quả vào các dự án công nghệ của bạn.