Giới thiệu dự án
Sự bùng nổ của các phương tiện tự hành (Autonomous Vehicles) và hệ thống hỗ trợ lái xe nâng cao (Advanced Driver Assistance Systems - ADAS) đang tái định hình bức tranh giao thông toàn cầu. Theo báo cáo từ MarketsandMarkets (2023), thị trường ADAS dự kiến đạt quy mô 65,1 tỷ USD vào năm 2030, với tốc độ tăng trưởng kép hàng năm (CAGR) là 11,8%. Tại Việt Nam, hệ sinh thái hạ tầng đô thị sở hữu đặc thù phức tạp với mật độ phương tiện dày đặc, hệ thống biển báo đa dạng và nhiều biến thể ngữ cảnh.
Biển báo chỉ dẫn (indication traffic signs) là nguồn cung cấp thông tin điều hướng quan trọng nhất trên các tuyến quốc lộ và cao tốc, bao gồm hướng rẽ, khoảng cách địa lý và tên các địa danh. Tuy nhiên, việc nhận diện và trích xuất ngữ nghĩa từ nhóm biển báo này đối mặt với các thách thức:
- Phông chữ tiếng Việt có dấu phức tạp, bố cục nhiều dòng không cố định.
- Nhiễu môi trường mạnh (ánh sáng gắt, bóng râm, bụi bẩn, mưa gió, rung lắc camera hành trình).
- Nhu cầu phản hồi thời gian thực (Real-time Latency) trên thiết bị biên nhúng.
+--------------------------------------------------------------------------------------------------+
| TỔNG QUAN HỆ THỐNG END-TO-END |
| |
| [ Camera/Video Input ] |
| | |
| v |
| +-------------------+ Bounding Boxes & Labels |
| | YOLOv7 Detector | --------------------------------+ |
| | (24 Classes) | | |
| +-------------------+ v |
| | +-------------------+ |
| | Crop Text Regions | Direction/Distance| |
| v | Attribute Parsing | |
| +-------------------+ +-------------------+ |
| | CRAFT Line Detect | | |
| | (VGG16 + U-Net) | | |
| +-------------------+ | |
| | Single-line Crops | |
| v v |
| +-------------------+ +-------------------+ |
| | VietOCR | --------------------> | T5 Key-to-Text | |
| | (CNN+Transformer) | Extracted Text | (Semantic Fusion) | |
| +-------------------+ +-------------------+ |
| | Natural Language |
| v |
| [ Audio/Web UI Output ] |
+--------------------------------------------------------------------------------------------------+
Đề tài khóa luận tốt nghiệp ngành Khoa học Dữ liệu tại Trường Đại học Công nghệ Thông tin (UIT - ĐHQG TP.HCM) thực hiện bởi nhóm tác giả Đỗ Văn Nam và Lê Đình Bảo Long, dưới sự hướng dẫn của TS. Đỗ Trọng Hợp và ThS. Tạ Thu Thủy, giải quyết trọn vẹn bài toán trích xuất và tổng hợp thông tin từ biển báo chỉ dẫn tại Việt Nam.
Mục tiêu cụ thể của dự án:
- Xây dựng bộ dữ liệu chuẩn hóa gồm 12.000 ảnh biển báo chỉ dẫn giao thông tại Việt Nam với hơn 60.000 bounding box được gán nhãn chi tiết cho 24 lớp đối tượng.
- Xây dựng pipeline thị giác máy tính kết hợp xử lý ngôn ngữ tự nhiên (End-to-End Multimodal Pipeline): Định vị đối tượng (YOLOv7), tách dòng văn bản (CRAFT), nhận dạng ký tự tiếng Việt (VietOCR) và tổng hợp câu ngữ nghĩa hoàn chỉnh (T5 Key-to-Text).
- Đạt độ chính xác phát hiện mAP@0.5 > 90% và tỷ lệ nhận dạng ký tự chuẩn xác (Character Accuracy) > 95% trong điều kiện vận hành thực tế.
- Tích hợp giải pháp hoàn chỉnh vào nền tảng Web UI trực quan, cung cấp đầu ra dạng Text và Audio (Text-to-Speech) phục vụ định hướng lái xe an toàn.
Phạm vi và giới hạn: Nghiên cứu tập trung vào hệ thống biển báo chỉ dẫn đường bộ theo quy chuẩn kỹ thuật quốc gia QCVN 41:2019/BGTVT tại Việt Nam, xử lý dữ liệu ảnh đơn khung hình và video stream từ camera hành trình với độ phân giải tiêu chuẩn.
Phân tích và thiết kế giải pháp
Phân tích hiện trạng
Nhiều giải pháp nhận diện biển báo giao thông đã được phát triển trong và ngoài nước, từ mô hình học máy truyền thống trích xuất đặc trưng thủ công đến các mô hình học sâu (Deep Learning).
| Tiêu chí |
Selcuk University (2020) [2] |
M. Sudha et al. (2021) [3] |
Nghiên cứu UIT (2021) [4] |
Giải pháp đề xuất (2022) |
| Kiến trúc cốt lõi |
CNN Features + Random Forest |
RGSM + CNN Classifier |
YOLOv4 / YOLOv5 |
YOLOv7 + CRAFT + VietOCR + T5 |
| Phân loại đối tượng |
Biển báo cao tốc Thổ Nhĩ Kỳ |
Biển báo hình học quốc tế |
Biển báo cấm/nguy hiểm VN |
Biển báo chỉ dẫn phức hợp VN |
| Xử lý văn bản (OCR) |
Không hỗ trợ |
Không hỗ trợ |
Không hỗ trợ |
Hỗ trợ tiếng Việt có dấu đa dòng |
| Tổng hợp ngữ nghĩa |
Không hỗ trợ |
Tín hiệu âm thanh cơ bản |
Không hỗ trợ |
T5 Sequence-to-Sequence NLP |
| Độ chính xác |
93.70% (RF Accuracy) |
91.20% (F1-score) |
88.50% (mAP) |
> 92.50% (Overall Pipeline) |
| Xử lý Real-time |
Kém (Offline mining) |
Trung bình (~15 FPS) |
Tốt (~35 FPS) |
Rất cao (> 55 FPS trên GPU) |
Yêu cầu người dùng được phân loại theo mô hình MoSCoW:
- Must Have (Bắt buộc): Phát hiện chính xác 24 lớp thành phần biển báo; bóc tách chữ tiếng Việt có dấu; xuất kết quả câu chỉ dẫn mạch lạc.
- Should Have (Nên có): Phân đoạn dòng ký tự tự động (CRAFT) cho các địa danh dài; sinh giọng nói cảnh báo (Audio Speech).
- Could Have (Có thể có): Giao diện tương tác tải video trực tiếp; hiển thị trực quan Heatmap/Bounding Box trên Web UI.
- Won't Have (Chưa hỗ trợ): Triển khai trực tiếp lên phần cứng xe tự hành cấp độ 5 (Level 5 Full Autonomy) trong giai đoạn này.
Thiết kế hệ thống
Kiến trúc hệ thống triển khai theo mô hình Modular Pipeline 4 giai đoạn độc lập nhưng liên kết chặt chẽ qua Data Contracts:
[Camera Frame 608x608]
Technology Stack & Versions:
- Deep Learning Frameworks: PyTorch 1.11.0, CUDA 11.3, cuDNN 8.2.
- Vision & Detection Models: YOLOv7 (PyTorch Implementation), CRAFT Text Detector (PyTorch), VietOCR v0.3.5 (Transformer Backbone).
- NLP & Language Generation: HuggingFace Transformers 4.20.0 (T5-base / Keytotext model).
- Data Processing & Labeling: LabelImg v1.8.6, OpenCV 4.5.5, NumPy 1.22.3, Albumentations 1.1.0.
- Application & Deployment: FastAPI / Flask 2.1.2, Gunicorn, Docker 20.10.x, React.js Frontend.
Thiết kế cấu trúc dữ liệu / Schema (JSON Data Contract giữa các module):
{
"frame_id": "frame_001024.jpg",
"detections": [
{
"class_id": 0,
"class_name": "Turn right",
"bbox": [120.5, 84.0, 180.2, 150.8],
"confidence": 0.945
},
{
"class_id": 2,
"class_name": "Right-Distance",
"bbox": [190.0, 95.0, 260.0, 140.0],
"raw_text": "13 Km",
"confidence": 0.912
},
{
"class_id": 1,
"class_name": "Right-Location",
"bbox": [270.0, 90.0, 480.0, 145.0],
"raw_text": "DT 623C",
"confidence": 0.968
}
],
"synthesized_output": {
"structured_keys": "Phải | 13Km | DT 623C",
"final_instruction": "Rẽ Phải 13Km tới DT 623C",
"audio_stream_url": "/api/v1/audio/frame_001024.mp3"
}
}
Methodology
Dự án áp dụng mô hình phát triển linh hoạt Agile-Scrum chia làm các Sprint 2 tuần với lộ trình kiểm soát rủi ro chất lượng:
- Thu thập 4.380 ảnh gốc - Huấn luyện YOLOv7 (100 eps) - Ghép nối End-to-End Pipeline - Đóng gói Docker Container
- Data Augmentation x3 - Fine-tune VietOCR (26k iters) - Tối ưu hóa Inference Latency - Xây dựng Web Dashboard
- Chuẩn hóa 24 classes - Huấn luyện T5 Key-to-Text - Đánh giá CER/WER & mAP - Tích hợp Voice Alert
Quản trị rủi ro kỹ thuật:
- Rủi ro lệch nhãn khi Auto-labeling: Áp dụng chiến lược Human-in-the-loop (Vòng 1: Pre-train trên 200 ảnh chuẩn -> Vòng 2: Auto-label + Kiểm duyệt thủ công 100%).
- Rủi ro nhận diện sai chữ viết nhiều dòng: Đặt bộ lọc CRAFT Line Detection giữa YOLOv7 và VietOCR, loại bỏ triệt để lỗi gộp dòng văn bản.
Implementation và kết quả
Development process
1. Module Object Detection (YOLOv7)
Hệ thống sử dụng YOLOv7 với chiến lược gán nhãn động SimOTA (Simplified Optimal Transport Assignment) và kiến trúc Extended Efficient Layer Aggregation Network (E-ELAN). Mô hình tối ưu hóa hàm mất mát đa thành phần kết hợp Localization Loss ($L_{box}$) và Confidence Loss ($L_{cls}$):
$$\mathcal{L}{Total} = \lambda{coord} \mathcal{L}{box} + \mathcal{L}{cls} + \lambda_{noobj} \mathcal{L}_{noobj}$$
Trong đó:
$$\mathcal{L}{box} = \lambda{coord} \sum_{i=0}^{S^2} \sum_{j=0}^B \mathbb{I}_{ij}^{obj} \left[ (x_i - \hat{x}_i)^2 + (y_i - \hat{y}_i)^2 + (\sqrt{w_i} - \sqrt{\hat{w}_i})^2 + (\sqrt{h_i} - \sqrt{\hat{h}_i})^2 \right]$$
Mô hình được huấn luyện từ pre-trained weights với cấu hình siêu tham số:
batch_size: 8
epochs: 100
input_size: 608x608x3 (RGB)
optimizer: SGD with Momentum (0.937), Weight Decay (0.0005)
learning_rate: $lr_0 = 0.01$, Cosine Annealing scheduler
# Trích xuất đoạn cấu hình huấn luyện YOLOv7 trên bộ dữ liệu biển báo
import torch
yolov7_config = {
"weights": "yolov7.pt",
"cfg": "cfg/training/yolov7-traffic-sign.yaml",
"data": "data/traffic_sign_24classes.yaml",
"hyp": "data/hyp.scratch.custom.yaml",
"epochs": 100,
"batch_size": 8,
"img_size": [608, 608],
"device": "0",
"classes": 24
}
Hệ thống quản lý 24 lớp đối tượng chi tiết:
[Nhóm Hướng Đi] : Turn right (0), Go straight (3), Turn left (6), Out1 (9), Out2 (12), Out3 (15), Slant-Right (18), Slant-Left (21)
[Nhóm Địa Danh] : Right-Location (1), Straight-Location (4), Left-Location (7), Out1-Location (10), Out2-Location (13), Out3-Location (16), Slant-Rlocation (19), Slant-Llocation (22)
[Nhóm Cự Ly] : Right-Distance (2), Straight-Distance (5), Left-Distance (8), Out1-Distance (11), Out2-Distance (14), Out3-Distance (17), Slant-Rdistance (20), Slant-LDistance (23)
2. Module Line Detection (CRAFT)
Mạng CRAFT (Character Region Awareness for Text Detection) dựa trên Backbone VGG-16 kết hợp nhánh liên kết tương tự U-Net để phân tách hộp văn bản nhiều dòng thành các dòng đơn:
link_threshold: 0.70 (ngưỡng kết nối ký tự cùng dòng).
low_text: 0.22 (ngưỡng phát hiện vùng khả năng chứa ký tự).
3. Module Text Recognition (VietOCR Transformer)
VietOCR kết hợp CNN Feature Extractor và Transformer Sequence-to-Sequence với hàm mã hóa vị trí (Positional Encoding):
$$PE_{(pos, 2i)} = \sin\left(\frac{pos}{10000^{\frac{2i}{d_{model}}}}\right), \quad PE_{(pos, 2i+1)} = \cos\left(\frac{pos}{10000^{\frac{2i}{d_{model}}}}\right)$$
Cấu hình huấn luyện trên 6.845 mẫu văn bản biển báo cắt dòng:
iters: 26.000
batch_size: 64
max_lr: 0.0003
image_height: 32px, image_min_width: 32px, image_max_width: 512px
# Pipeline tiền xử lý và suy luận văn bản tiếng Việt từ Crop Line
from PIL import Image
from vietocr.tool.config import Cfg
from vietocr.tool.predictor import Predictor
config = Cfg.load_config_from_name('vgg_transformer')
config['weights'] = 'weights/vietocr_traffic_indication.pth'
config['device'] = 'cuda:0'
config['predictor']['beamsearch'] = False
detector_ocr = Predictor(config)
def extract_vietnamese_text(cropped_image_path: str) -> str:
image = Image.open(cropped_image_path).convert('RGB')
text_output = detector_ocr.predict(image)
return text_output.strip()
4. Module Tổng hợp thông tin (T5 Key-to-Text)
Mô hình chuyển đổi chuỗi từ khóa (Keys) thành câu văn có cấu trúc ngữ nghĩa hoàn chỉnh:
- Input:
Phải | 13Km | DT 623C $\rightarrow$ Output: Rẽ Phải 13Km tới DT 623C
- Input:
Thẳng | CÔNG VIÊN BA TƠ $\rightarrow$ Output: Đi Thẳng đến CÔNG VIÊN BA TƠ
- Input:
Trái | 16 Km | CÔNG AN XÃ NGHĨA KỲ $\rightarrow$ Output: Rẽ Trái 16 Km tới CÔNG AN XÃ NGHĨA KỲ
Testing và validation
1. Chiến lược Tăng cường Dữ liệu (Data Augmentation)
Bộ dữ liệu gốc gồm 4.380 ảnh (3.732 ảnh chụp thực tế + 648 ảnh Google Street View) được mở rộng lên 12.000 ảnh chuẩn hóa:
- Blur (làm mờ đến 0.75px): Thêm 2.200 ảnh mô phỏng biển báo cũ bám bụi hoặc mờ do tốc độ di chuyển.
- Brighten / Darken ($\pm 30%$): Thêm 3.220 ảnh mô phỏng điều kiện nắng chói chang hoặc bóng râm/chập tối.
- Noise (nhiễu ngẫu nhiên 5%): Thêm 2.200 ảnh mô phỏng mưa giông, nhiễu cảm biến camera.
- Lưu ý kỹ thuật: Không sử dụng biến đổi lật ảnh (Flip) hay xoay góc lớn (Rotation) để tránh làm đảo ngược bản chất hướng rẽ (Trái/Phải).
+--------------------------------------------------------------------------------------------------+
| MA TRẬN ĐÁNH GIÁ MÔ HÌNH OBJECT DETECTION |
| |
| Tập Dữ Liệu Precision Recall mAP@0.5 F1-Score |
| -------------------------------------------------------------------------------- |
| Chưa tăng cường (Raw) 78.40% 72.10% 75.80% 75.12% |
| Đã tăng cường (Augmented) 94.60% 91.80% 93.40% 93.18% |
| -------------------------------------------------------------------------------- |
| Mức độ cải thiện +16.20% +19.70% +17.60% +18.06% |
+--------------------------------------------------------------------------------------------------+
2. Phân tích lỗi nhận dạng văn bản (CER và WER)
Độ lỗi văn bản được kiểm định nghiêm ngặt qua 2 chỉ số Character Error Rate (CER) và Word Error Rate (WER):
$$CER = \frac{S + D + I}{N_{chars}}, \quad WER = \frac{S_w + D_w + I_w}{N_{words}}$$
Trong đó $S$ là lỗi thay thế (Substitution), $D$ là lỗi xóa ký tự (Deletion), $I$ là lỗi chèn ký tự thừa (Insertion).
[Ground Truth] : S T E A M
[Substitution] : S T E A L (CER = 1/5 = 20%)
[Deletion] : - T E A M (CER = 1/5 = 20%)
[Insertion] : S T R E A M (CER = 1/5 = 20%)
Trên tập kiểm thử 6.845 mẫu chữ tiếng Việt, mô hình VietOCR sau tinh chỉnh đạt $CER < 2.8%$ và $WER < 4.5%$, đảm bảo các từ khóa địa danh không bị sai lệch dấu câu.
Kết quả đạt được
Hệ thống hoàn thành 100% các tính năng mục tiêu đã cam kết:
- Tốc độ suy luận (Inference Speed): Đạt 56 FPS trên GPU NVIDIA V100 và duy trì ~28-32 FPS trên GPU phân khúc phổ thông (GTX 1660Ti / RTX 3060).
- Độ chính xác tích hợp: Pipeline xử lý đúng 92.8% trường hợp biển báo phức tạp trong tập Test, trích xuất chuẩn xác bộ 3 thuộc tính (Hướng - Cự ly - Địa điểm).
- Giao diện Web UI: Tích hợp tính năng tải ảnh/video, hiển thị bounding box trực quan và phát âm thanh chỉ dẫn tức thì qua hệ thống Text-to-Speech.
Đổi mới và đóng góp
- Bộ dữ liệu chuẩn hóa quy mô lớn đầu tiên cho biển chỉ dẫn Việt Nam: Đóng góp 12.000 ảnh với >60.000 bounding boxes cho 24 lớp chi tiết, giải quyết sự khan hiếm tài nguyên dữ liệu thị giác giao thông trong nước.
- Kiến trúc tích hợp Multimodal (Vision-to-Language): Khác với các nghiên cứu chỉ dừng lại ở bài toán phân loại biển báo (Classification) như Selcuk (2020) hay Sudha (2021), công trình này kết nối hoàn chỉnh từ khâu định vị (Detection), phân đoạn dòng (Line Segmentation), bóc tách ký tự (OCR) đến tổng hợp ngôn ngữ tự nhiên (Natural Language Generation).
- Giải quyết triệt để vấn đề văn bản đa dòng (Multi-line text) trên biển báo: Ứng dụng đột phá của mạng CRAFT giúp giảm 84% lỗi gộp dòng văn bản so với việc đưa trực tiếp bounding box thô vào các engine OCR truyền thống.
- Hiệu năng vượt bậc nhờ YOLOv7 và SimOTA: Tối ưu hóa thời gian tính toán, tăng 120% tốc độ suy luận so với kiến trúc YOLOv4/YOLOv5 tiền nhiệm mà vẫn tăng 17.6% mAP nhờ cơ chế gán nhãn động không dùng Anchor (Anchor-free style matching).
Ứng dụng thực tế và triển khai
Use Cases thực tế
- Hệ thống hỗ trợ lái xe ADAS / Smart Car: Tích hợp trực tiếp vào camera hành trình trên các dòng xe thông minh (VinFast, Tesla, Xpeng) để thông báo biển báo từ xa bằng âm thanh, giảm tải căng thẳng quan sát cho tài xế.
- Xe tự hành (Autonomous Shuttles / Delivery Robots): Cung cấp thông tin điều hướng thời gian thực khi xe di chuyển vào khu vực mất sóng định vị GPS hoặc bản đồ số chưa kịp cập nhật.
- Số hóa dữ liệu hạ tầng giao thông: Hỗ trợ cơ quan quản lý đô thị quét video hành trình để tự động kiểm kê, đánh giá tình trạng biển báo chỉ dẫn trên các tuyến đường.
+--------------------------------------------------------------------------------------------------+
| KIẾN TRÚC TRIỂN KHAI HỆ THỐNG EDGE / CLOUD |
| |
+--------------------------------------------------------------------------------------------------+
Yêu cầu hệ thống và triển khai
Cấu hình phần cứng tối thiểu (Server Deployment):
- CPU: Intel Xeon / Core i7 thế hệ 10 trở lên (8 Cores).
- RAM: 16 GB DDR4.
- GPU: NVIDIA RTX 2060 (6GB VRAM) hoặc cao hơn (Khuyến nghị NVIDIA T4 / RTX 3090 cho Multi-stream processing).
- Lưu trữ: 50 GB SSD NVMe.
Hướng dẫn triển khai nhanh qua Docker Container:
# 1. Clone repository mã nguồn dự án
git clone https://github.com/uit-dataset/traffic-sign-information-extraction.git
cd traffic-sign-information-extraction
# 2. Tải pre-trained weights chuẩn hóa (YOLOv7, VietOCR, T5)
bash scripts/download_weights.sh
# 3. Build và khởi chạy Docker container với hỗ trợ NVIDIA GPU
docker build -t traffic-ie-app:v1.0 .
docker run --gpus all -d -p 8000:8000 --name traffic_system traffic-ie-app:v1.0
# 4. Kiểm tra endpoint kiểm thử hệ thống
curl -X POST "http://localhost:8000/api/v1/predict" \
-H "Content-Type: multipart/form-data" \
-F "file=@test_samples/bien_chi_dan_01.jpg"
Hạn chế và hướng phát triển
Hạn chế kỹ thuật
- Điều kiện thời tiết khắc nghiệt: Tỷ lệ nhận diện giảm nhẹ khi camera bị lóa đèn pha trực diện vào ban đêm hoặc trong điều kiện sương mù dày đặc che khuất > 40% diện tích biển báo.
- Biển báo biến dạng cơ học: Các biển báo bị cong vênh, rỉ sét nặng làm biến dạng hình học chữ cái khiến mô hình VietOCR dễ phát sinh lỗi Deletion.
- Chi phí tính toán đa mô hình: Việc chạy tuần tự 4 mô hình (YOLOv7 -> CRAFT -> VietOCR -> T5) tạo ra độ trễ cộng dồn (~35ms), đòi hỏi phần cứng GPU chuyên dụng để chạy trơn tru nhiều luồng.
Hướng phát triển tương lai
- Mô hình hợp nhất End-to-End Multimodal Transformer: Nghiên cứu kiến trúc Vision-Language Model (VLM) đơn nhất để vừa phát hiện vừa sinh văn bản trực tiếp, loại bỏ các bước cắt ảnh trung gian.
- Nén mô hình (Model Quantization & Pruning): Chuyển đổi mô hình sang định dạng TensorRT / ONNX INT8 để nhúng tối ưu trên các bo mạch tiêu thụ điện năng thấp như NVIDIA Jetson Orin Nano.
- Mở rộng phạm vi dữ liệu: Bổ sung tập dữ liệu biển báo các nước trong khu vực Đông Nam Á (ASEAN) có cùng chuẩn quy ước ký hiệu giao thông.
Đối tượng hưởng lợi
- Sinh viên & Học viên ngành Dữ liệu / AI: Tiếp cận mã nguồn mở, tài liệu kỹ thuật chi tiết và bộ dữ liệu chuẩn hóa phục vụ nghiên cứu thị giác máy tính và NLP tiếng Việt.
- Kỹ sư & Lập trình viên Computer Vision: Tận dụng mẫu thiết kế Pipeline kết hợp giữa Object Detection (YOLOv7), Scene Text Recognition (CRAFT + VietOCR) và Text Generation (T5) vào các bài toán bóc tách tài liệu thực tế (ID card, Hóa đơn, Biển số xe).
- Doanh nghiệp phát triển giải pháp ADAS & Giao thông thông minh: Tiết kiệm hàng ngàn giờ thu thập và gán nhãn dữ liệu; sở hữu giải pháp bóc tách biển báo đường bộ Việt Nam có tính ứng dụng cao và sẵn sàng thương mại hóa.
- Cộng đồng nghiên cứu khoa học: Cung cấp baseline benchmark thực nghiệm chuẩn mực cho bài toán Information Extraction trên ảnh đường phố tại Việt Nam.
Câu hỏi thường gặp
1. Yêu cầu phần cứng tối thiểu để hệ thống chạy thời gian thực (Real-time)?
Để đạt tốc độ xử lý video thời gian thực ($\ge 30\text{ FPS}$ ở độ phân giải 1080p), hệ thống yêu cầu GPU tối thiểu NVIDIA GTX 1660Ti (6GB VRAM) hoặc NVIDIA Jetson Xavier NX cho thiết bị biên. Nếu chạy trên CPU (Intel i7 Gen 11), tốc độ xử lý đạt khoảng 3-5 FPS (phù hợp xử lý ảnh tĩnh).
2. Tại sao cần thêm mô hình CRAFT mà không dùng trực tiếp VietOCR sau khi YOLOv7 phát hiện?
Bounding box từ YOLOv7 thường chứa toàn bộ khối địa danh bao gồm nhiều dòng (ví dụ: dòng 1 "CÔNG AN XÃ", dòng 2 "NGHĨA KỲ"). VietOCR và các mô hình OCR dạng dòng chỉ đạt độ chính xác tối ưu trên ảnh 1 dòng văn bản duy nhất. Mạng CRAFT đóng vai trò bóc tách chính xác từng dòng đơn lẻ, giúp giảm thiểu 84% lỗi tràn dòng và mất chữ.
3. T5 Key-to-Text xử lý như thế nào nếu một hướng có nhiều địa điểm khác nhau?
Dữ liệu đầu ra từ module OCR được gom nhóm theo ID của nhánh hướng. Ví dụ hướng rẽ phải có 2 địa danh: Module gán nhãn sẽ tạo cặp key Phải | 5Km | Chợ Chùa và Phải | 12Km | Nghĩa Hành. T5 được huấn luyện để sinh câu ghép tự nhiên: "Rẽ Phải 5Km tới Chợ Chùa và 12Km tới Nghĩa Hành".
4. Hệ thống có khả năng nhận diện biển báo trong điều kiện ban đêm không?
Có. Nhờ kỹ thuật Data Augmentation tăng cường 3.220 ảnh tối hóa (Darken 30%) và khử nhiễu, mô hình YOLOv7 duy trì độ chính xác phát hiện mAP đạt 89.2% trong môi trường ánh sáng yếu có đèn đường hỗ trợ.
5. Chi phí triển khai và khả năng tích hợp vào hạ tầng hiện có như thế nào?
Hệ thống được đóng gói dạng Docker Microservice với RESTful API chuẩn OpenAPI, cho phép tích hợp vào các ứng dụng Web/Mobile hoặc hệ thống Camera hành trình sẵn có chỉ trong vòng 1-2 ngày làm việc mà không làm thay đổi kiến trúc hạ tầng cũ.
Kết luận
Đề tài khóa luận "Information Extraction on the Traffic Sign of Indications in Vietnam" của nhóm tác giả Đỗ Văn Nam và Lê Đình Bảo Long (Trường Đại học Công nghệ Thông tin - ĐHQG TP.HCM) đã giải quyết trọn vẹn bài toán bóc tách thông tin ngữ nghĩa trên biển báo chỉ dẫn phức tạp tại Việt Nam. Bằng việc kết hợp sức mạnh của 4 mô hình học sâu hiện đại: YOLOv7 (Object Detection), CRAFT (Line Segmentation), VietOCR (Character Recognition) và T5 (Semantic Synthesis), công trình đã chứng minh tính khả thi vượt trội với độ chính xác cao và tốc độ vận hành thời gian thực.
Nghiên cứu không chỉ đóng góp một bộ dữ liệu quy mô 12.000 ảnh chuẩn hóa cho cộng đồng AI Việt Nam mà còn mở ra tiềm năng ứng dụng to lớn trong hệ sinh thái xe thông minh, hệ thống hỗ trợ lái xe ADAS và chuyển đổi số hạ tầng giao thông đô thị.
Bạn muốn trải nghiệm giải pháp hoặc ứng dụng kiến trúc Multimodal Pipeline này vào bài toán thị giác máy tính của doanh nghiệp? Hãy tham khảo mã nguồn và tài liệu kỹ thuật chi tiết để cùng phát triển các công nghệ giao thông thông minh trong tương lai!