Giới thiệu dự án

Nhận diện chữ viết trong ảnh tự nhiên (Scene Text Recognition - STR) là một trong những bài toán nền tảng của lĩnh vực thị giác máy tính (Computer Vision) và xử lý ngôn ngữ tự nhiên (Natural Language Processing - NLP). Theo các báo cáo nghiên cứu thị trường về công nghệ nhận dạng ký tự quang học (Optical Character Recognition - OCR), thị trường giải pháp OCR toàn cầu đạt quy mô hơn 10 tỷ USD và tiếp tục tăng trưởng trên 15% mỗi năm nhờ nhu cầu tự động hóa số hóa tài liệu, dịch thời gian thực trên camera, hệ thống giao thông thông minh và xe tự hành.

Khác với văn bản scan truyền thống vốn có nền đồng nhất và định dạng thẳng, văn bản trong ảnh cảnh thực tế thường đối mặt với các thách thức phức tạp:

  • Phông chữ đa dạng, kích thước thay đổi linh hoạt và màu sắc dễ bị hòa lẫn vào phông nền phức tạp.
  • Chữ viết bị biến dạng hình học theo nhiều hướng (uốn cong, xiên, nghiêng, xoay góc hoặc bố trí bất kỳ).
  • Nhiễu ngoại cảnh nghiêm trọng như ảnh bị nhòe mờ do chuyển động, ánh sáng yếu, bóng đổ hoặc bị vật thể che khuất một phần.
  • Đối với tiếng Việt, hệ thống chữ viết có cấu trúc thanh dấu phức tạp (sắc, huyền, hỏi, ngã, nặng) cùng các ký tự có dấu phụ đặc trưng (ă, â, ê, ô, ơ, ư, đ). Việc dự đoán sai một dấu thanh sẽ làm biến đổi hoàn toàn ngữ nghĩa của từ ngữ, đặt ra yêu cầu độ chính xác khắt khe cho mô hình.

Mục tiêu chính của đề tài bao gồm:

  1. Hệ thống hóa cơ sở lý thuyết và khảo sát toàn diện các phương pháp nhận diện văn bản cảnh tiên tiến.
  2. Nghiên cứu sâu cơ chế tập trung tự thân (Self-Attention) và các biến thể của kiến trúc Transformer (Encoder, Decoder, Hybrid) áp dụng cho bài toán STR.
  3. Xây dựng bộ dữ liệu ảnh văn bản cảnh tiếng Việt quy mô lớn với 120.000 mẫu ở cấp độ từ (word-level).
  4. Cài đặt, huấn luyện và đánh giá đối chuẩn (benchmark) các mô hình đại diện: ASTER, SCAN, ViTSTR, SSCAN, VietOCR và TransformerOCR.
  5. Triển khai ứng dụng web minh họa hoàn chỉnh phục vụ nhận diện văn bản thực tế.

Giải pháp đề xuất tập trung khai thác kiến trúc Transformer nhằm thay thế hoặc bổ trợ các mạng tích chập (Convolutional Neural Networks - CNN) và mạng hồi quy (Recurrent Neural Networks - RNN) truyền thống. Cơ chế Multi-Head Self-Attention cho phép mô hình thu nhận thông tin ngữ cảnh toàn cục của hình ảnh, loại bỏ phụ thuộc vào các bước tiền xử lý nắn thẳng hình học phức tạp hoặc phân đoạn ký tự tốn kém.

Phạm vi nghiên cứu tập trung vào văn bản in và chữ cảnh tự nhiên tiếng Việt ở cấp độ từ, được kiểm thử nghiêm ngặt trên tập dữ liệu chuẩn hóa, hướng tới mục tiêu tối ưu hóa song song giữa độ chính xác nhận diện từ (Word Accuracy) và thời gian trễ xử lý (Inference Latency).


Phân tích và thiết kế giải pháp

Phân tích hiện trạng

Trước khi Transformer được ứng dụng rộng rãi, hai hướng tiếp cận chiếm ưu thế trong bài toán nhận diện văn bản bất quy tắc là nắn thẳng văn bản (Rectification-based) và phân đoạn ký tự (Character Segmentation-based).

Phương pháp Đại diện tiêu biểu Ưu điểm Nhược điểm & Hạn chế
Nắn thẳng văn bản (Rectification) ASTER (Thin-Plate Spline + BiLSTM) Đưa văn bản cong về dạng thẳng chuẩn, dễ xử lý cho các mạng Seq2Seq cổ điển. Phụ thuộc nặng vào mạng biến đổi không gian (STN/TPS). Nếu bước nắn thẳng lỗi, toàn bộ quá trình nhận diện phía sau sẽ suy giảm độ chính xác nghiêm trọng.
Phân đoạn ký tự (Segmentation) SCAN (HRNet Backbone + FCN) Định vị chi tiết từng ký tự độc lập, không phụ thuộc vào thứ tự đọc tuần tự tuyến tính. Cần chi phí gán nhãn cực lớn ở cấp độ ký tự (character bounding box); tốc độ suy diễn chậm do xử lý hậu kỳ phức tạp.
Kiến trúc Transformer (Self-Attention) VietOCR, ViTSTR, TransformerOCR Mô hình hóa trực tiếp quan hệ giữa các vùng ảnh bất quy tắc; xử lý song song; nắm bắt ngữ nghĩa từ ngữ tiếng Việt tốt. Đòi hỏi tài nguyên tính toán lớn khi huấn luyện trên tập dữ liệu quy mô hàng trăm nghìn mẫu.

Phân tích yêu cầu hệ thống theo chuẩn MoSCoW:

  • Must have (Bắt buộc có): Pipeline xử lý ảnh đầu vào, trích xuất đặc trưng với CNN/Transformer Backbone, bộ giải mã nhận diện chuẩn xác 134 ký tự tiếng Việt (bao gồm cả chữ hoa, chữ thường, dấu thanh và ký số), hàm mất mát Cross-Entropy.
  • Should have (Nên có): Kỹ thuật giải mã Beam Search kết hợp Language Modeling để hạn chế lỗi nhầm dấu, giao diện Web trực quan để tải ảnh và hiển thị kết quả thời gian thực.
  • Could have (Có thể có): Cơ chế làm dày dữ liệu tự động (Data Augmentation) với các phép biến dạng hình học và đổi độ tương phản.
  • Won't have (Chưa thực hiện): Tích hợp module phát hiện vùng chứa văn bản (Text Detection) tự động trên ảnh cỡ lớn (ở giai đoạn này chỉ tập trung vào cropped text image recognition).

Thiết kế hệ thống

Kiến trúc tổng thể của giải pháp nhận diện văn bản cảnh tiếng Việt được thiết kế theo mô hình luồng dữ liệu chuẩn hóa:

Chi tiết các thành phần trong hệ thống:

  1. Feature Extractor: Trích xuất bản đồ đặc trưng không gian từ ảnh kích thước chuẩn $(H \times W \times C)$. Các kiến trúc sử dụng gồm VGG19-BN, ResNet-50 hoặc HRNet kết hợp nhúng vị trí (Positional Encoding).
  2. Sequence Modeling & Attention: Module Multi-Head Self-Attention biến đổi các vector đặc trưng trực quan thành không gian vector biểu diễn ngữ nghĩa, tính toán trọng số tương quan giữa mọi vị trí trong ảnh: $$\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V$$
  3. Bộ giải mã (Decoder): Sinh lần lượt từng ký tự $y_j$ dựa trên trạng thái ẩn và ngữ cảnh đã giải mã trước đó, sử dụng hàm mất mát Cross-Entropy: $$\mathcal{L} = -\sum_{j=1}^m \sum_{i=1}^V y_{j,i} \log(p_{j,i})$$

Bảng thông số cấu hình và Technology Stack:

Thành phần Công nghệ / Thư viện Phiên bản Vai trò kỹ thuật
Ngôn ngữ lập trình Python 3.8+ Môi trường phát triển cốt lõi
Deep Learning Framework PyTorch 1.9.0 / 1.10.0 Xây dựng, huấn luyện và tối ưu mạng nơ-ron
Xử lý thị giác OpenCV, Albumentations 4.5.3, 1.0.3 Xử lý ảnh số và Data Augmentation
Gán nhãn dữ liệu VGG Image Annotator (VIA) 2.0.11 Công cụ gán nhãn bounding box và transcription
Web Server / UI Flask / Streamlit 2.0.1 / 1.2.0 Xây dựng RESTful API và giao diện Web demo

Methodology

Quy trình nghiên cứu và thực nghiệm được tiến hành qua 4 giai đoạn nối tiếp:

  • Giai đoạn 1 (Thu thập & Xử lý dữ liệu): Thu thập ảnh biển hiệu, hóa đơn, bao bì từ thực tế đường phố Việt Nam; làm sạch, lọc bỏ ảnh vỡ nét không đọc được; phân chia tập Train/Test theo tỷ lệ 110.000 : 10.000.
  • Giai đoạn 2 (Hiện thực hóa mô hình): Triển khai mã nguồn PyTorch cho 6 kiến trúc đại diện. Tối ưu hóa pipeline nạp dữ liệu với PyTorch DataLoader đa luồng.
  • Giai đoạn 3 (Huấn luyện & Đánh giá): Huấn luyện đồng nhất trên hạ tầng GPU với thuật toán AdamW, learning rate khởi tạo $10^{-4}$ có scheduler giảm dần, batch size 64 hoặc 128.
  • Giai đoạn 4 (Đóng gói ứng dụng): Tích hợp trọng số tối ưu vào backend Flask, kiểm thử UAT và đo đạc thời gian đáp ứng (Response Time).

Implementation và kết quả

Development process

Một trong những module quan trọng nhất của kiến trúc Transformer áp dụng cho bài toán nhận diện chữ tiếng Việt là cơ chế giải mã tự hồi quy (Autoregressive Decoder) kết hợp cơ chế tập trung đa đầu (Multi-Head Cross-Attention).

Đoạn mã PyTorch dưới đây mô tả cấu trúc khối giải mã ký tự tiếng Việt:

import torch
import torch.nn as nn
import math

class VietnameseTransformerDecoderLayer(nn.Module):
    def __init__(self, d_model: int = 512, nhead: int = 8, dim_feedforward: int = 2048, dropout: float = 0.1):
        super(VietnameseTransformerDecoderLayer, self).__init__()
        self.self_attn = nn.MultiheadAttention(d_model, nhead, dropout=dropout, batch_first=True)
        self.multihead_attn = nn.MultiheadAttention(d_model, nhead, dropout=dropout, batch_first=True)
        
        # Feedforward network
        self.linear1 = nn.Linear(d_model, dim_feedforward)
        self.dropout = nn.Dropout(dropout)
        self.linear2 = nn.Linear(dim_feedforward, d_model)
        
        # Normalization and Dropout layers
        self.norm1 = nn.LayerNorm(d_model)
        self.norm2 = nn.LayerNorm(d_model)
        self.norm3 = nn.LayerNorm(d_model)
        self.dropout1 = nn.Dropout(dropout)
        self.dropout2 = nn.Dropout(dropout)
        self.dropout3 = nn.Dropout(dropout)
        self.activation = nn.ReLU()

    def forward(self, tgt: torch.Tensor, memory: torch.Tensor, tgt_mask: torch.Tensor = None) -> torch.Tensor:
        # Self-Attention trên chuỗi ký tự đã sinh
        tgt2 = self.self_attn(tgt, tgt, tgt, attn_mask=tgt_mask)[0]
        tgt = self.norm1(tgt + self.dropout1(tgt2))
        
        # Cross-Attention giữa chuỗi ký tự và đặc trưng ảnh trích xuất từ Encoder
        tgt2 = self.multihead_attn(tgt, memory, memory)[0]
        tgt = self.norm2(tgt + self.dropout2(tgt2))
        
        # Feedforward projection
        tgt2 = self.linear2(self.dropout(self.activation(self.linear1(tgt))))
        tgt = self.norm3(tgt + self.dropout3(tgt2))
        return tgt

Thách thức kỹ thuật lớn nhất trong quá trình triển khai là sự mất cân bằng về độ dài chuỗi ký tự và sự tương đồng cao giữa các nguyên âm có dấu (ví dụ: "a", "à", "á", "ả", "ã", "ạ"). Giải pháp được thực hiện là áp dụng Label Smoothing kết hợp bộ từ điển 134 ký tự bao phủ toàn diện bảng chữ cái tiếng Việt Unicode tiêu chuẩn.

Testing và validation

Quá trình kiểm thử được tiến hành độc lập trên tập dữ liệu kiểm thử (Test Set) gồm 10.000 ảnh chụp từ cảnh tự nhiên, hoàn toàn không xuất hiện trong quá trình huấn luyện.

Độ đo đánh giá chính xác là Word Accuracy (WAcc): Từ được coi là nhận diện chính xác 100% khi và chỉ khi toàn bộ các ký tự và dấu thanh cấu thành từ đều khớp hoàn toàn với nhãn chân lý (Ground Truth).

Bảng kết quả đối chuẩn chi tiết giữa các phương pháp trên tập dữ liệu tiếng Việt:

Phương pháp Hướng tiếp cận Kiến trúc Backbone Encoder Decoder Word Accuracy (%) Thời gian xử lý (ms/ảnh)
ASTER Nắn thẳng (Rectification) ResNet BiLSTM Attention 74.12% 24.6 ms
SCAN Phân đoạn ký tự HRNet - FCN 76.45% 45.2 ms
ViTSTR Pure Transformer Patch Embedding ViT Linear 78.80% 8.4 ms
SSCAN Hybrid Attention ResNet - 2D Transformer 79.92% 28.1 ms
VietOCR Hybrid Seq2Seq VGG / ResNet BiLSTM Transformer 81.65% 18.5 ms
TransformerOCR Full Transformer ResNet Transformer Transformer 82.35% 21.3 ms

Kết quả đạt được

  • Mô hình TransformerOCR đạt độ chính xác nhận diện từ cao nhất với 82.35%, vượt trội so với phương pháp nắn thẳng truyền thống ASTER (74.12%) và phân đoạn SCAN (76.45%).
  • Mô hình ViTSTR đạt tốc độ xử lý nhanh nhất với chỉ 8.4 ms/ảnh, mở ra tiềm năng ứng dụng trên các thiết bị nhúng và hệ thống thời gian thực.
  • Phương pháp VietOCR đạt sự cân bằng tối ưu giữa độ chính xác (81.65%) và hiệu năng tính toán, giúp nhóm tác giả xuất sắc đạt Giải Nhì tại Cuộc thi Thử thách Trí tuệ Nhân tạo TP.HCM (HCM AI Challenge 2021) với chủ đề "AI for Vietnamese Text Recognition in Scene Images".
  • Triển khai thành công ứng dụng web demo cho phép người dùng tải ảnh trực tiếp, nhận kết quả trích xuất văn bản trong vòng dưới 100 ms với giao diện trực quan.

Đổi mới và đóng góp

  1. Khảo sát hệ thống hóa toàn diện: Đây là một trong những công trình tiên phong tại Việt Nam đánh giá có cấu trúc và thực nghiệm quy mô lớn về hiệu năng của các biến thể kiến trúc Transformer (Encoder-only, Decoder-only, Full Transformer) đối với bài toán nhận diện văn bản cảnh tiếng Việt.
  2. Bộ dữ liệu chuẩn hóa 120.000 mẫu: Xây dựng và công bố tập dữ liệu 120.000 ảnh từ thực tế đời sống Việt Nam, cung cấp nguồn tài nguyên đối chuẩn giá trị cho cộng đồng nghiên cứu thị giác máy tính trong nước.
  3. Cải tiến độ chính xác nhận diện dấu thanh tiếng Việt: Bằng việc ứng dụng cơ chế Attention 2D và mô hình ngôn ngữ tích hợp trong Transformer Decoder, tỷ lệ nhầm lẫn giữa các dấu thanh tương đồng (hỏi - ngã, sắc - nặng) giảm hơn 35% so với mô hình BiLSTM-Attention truyền thống.
  4. Hiệu quả thực chiến được khẳng định: Đoạt giải thưởng cao (Giải Nhì) tại cuộc thi chuyên ngành quy mô lớn (HCM AI Challenge 2021), khẳng định tính khả thi và độ tin cậy của thuật toán trong môi trường thi đấu thực tế.

Ứng dụng thực tế và triển khai

Kịch bản ứng dụng thực tế

  • Hệ thống giao thông thông minh: Tự động nhận diện biển báo giao thông, biển tên đường, biển số xe và biển hiệu chỉ dẫn trên đường phố phục vụ định vị và dẫn đường cho xe tự hành.
  • Số hóa dữ liệu thương mại: Tự động nhận diện văn bản trên bao bì hàng hóa, bảng giá siêu thị, biển hiệu cửa hàng nhằm phục vụ quản lý chuỗi cung ứng và nghiên cứu thị trường bán lẻ.
  • Ứng dụng hỗ trợ người khiếm thị: Tích hợp vào camera kính thông minh hoặc smartphone để đọc to nội dung biển báo, thực đơn nhà hàng bằng giọng nói tiếng Việt thời gian thực.

Hướng dẫn triển khai và Cấu hình hệ thống

Yêu cầu phần cứng tối thiểu và khuyến nghị:

  • Môi trường huấn luyện: GPU NVIDIA RTX 2080Ti / Tesla V100 (tối thiểu 11GB VRAM), CPU 8 cores, 32GB RAM, ổ cứng SSD NVMe.
  • Môi trường triển khai (Production Inference): CPU Intel Core i5 thế hệ 10 hoặc card tăng tốc NVIDIA T4, 8GB RAM.

Quy trình cài đặt và chạy dịch vụ Web API:

# 1. Khởi tạo môi trường ảo và cài đặt thư viện
python -m venv venv
source venv/bin/activate
pip install torch torchvision --extra-index-url https://download.pytorch.org/whl/cu113
pip install opencv-python albumentations flask pillow pyyaml

# 2. Tải trọng số mô hình đã huấn luyện (Pretrained Weights)
# Đặt checkpoint tại: weights/transformer_ocr_vnr.pth

# 3. Khởi chạy ứng dụng Web demo
python app.py --port 5000 --device cuda

API Endpoint trích xuất văn bản:

  • Endpoint: POST /api/v1/recognize
  • Payload: multipart/form-data chứa trường image: <binary_file>
  • Response:
{
  "status": "success",
  "data": {
    "text": "BÁCH HÓA XANH",
    "confidence": 0.9842,
    "latency_ms": 21.5
  }
}

Hạn chế và hướng phát triển

Hạn chế kỹ thuật

  • Phụ thuộc vào chất lượng ảnh cắt: Mô hình hiện tại tập trung vào nhận diện ảnh vùng chữ đã được cắt sẵn; nếu vùng cắt bị mất góc hoặc lệch chữ quá nhiều, độ chính xác sẽ bị ảnh hưởng.
  • Chữ viết tay nghệ thuật: Độ chính xác đối với các kiểu chữ thư pháp cách điệu cao hoặc chữ viết tay nguệch ngoạc vẫn còn thấp hơn đáng kể so với chữ in chuẩn.
  • Kích thước mô hình: Các mô hình Transformer lớn có dung lượng bộ nhớ tương đối cao, gây khó khăn khi nhúng trực tiếp lên các vi điều khiển IoT giá rẻ.

Hướng phát triển trong tương lai

  1. Xây dựng giải pháp tích hợp trọn gói End-to-End (đồng thời phát hiện Text Detection và nhận diện Text Recognition) trong một mạng duy nhất.
  2. Ứng dụng các kỹ thuật nén mô hình như tri thức chưng cất (Knowledge Distillation), lượng tử hóa (Quantization INT8) và tỉa nhánh (Pruning) để tối ưu hóa ViTSTR và TransformerOCR cho thiết bị di động.
  3. Mở rộng tập dữ liệu đa ngôn ngữ kết hợp (tiếng Việt - tiếng Anh - tiếng Trung) xuất hiện đan xen trên biển hiệu thương mại tại Việt Nam.

Đối tượng hưởng lợi

  • Sinh viên & Học viên cao học: Tiếp cận tài liệu tổng quan bài bản, cấu trúc mã nguồn PyTorch chuẩn mực về ứng dụng Transformer ngoài phạm vi xử lý ngôn ngữ tự nhiên truyền thống.
  • Kỹ sư AI & Lập trình viên: Sở hữu bộ trọng số pretrained và pipeline xử lý dữ liệu chữ tiếng Việt tối ưu, tiết kiệm từ 3 đến 6 tháng nghiên cứu phát triển mô hình OCR thực chiến.
  • Doanh nghiệp & Startup công nghệ: Có thể tích hợp ngay giải pháp OCR tiếng Việt độ chính xác cao vào các sản phẩm quét tài liệu, trích xuất hóa đơn, tự động hóa quy trình nghiệp vụ (RPA) với chi phí bản quyền 0 đồng.
  • Cộng đồng nghiên cứu học thuật: Cung cấp bộ dữ liệu đối chuẩn 120.000 mẫu chuẩn mực để tiếp tục phát triển các thuật toán thị giác máy tính chuyên biệt cho ngôn ngữ tiếng Việt.

Câu hỏi thường gặp

1. Cần cấu hình phần cứng tối thiểu như thế nào để triển khai mô hình vào hệ thống thực tế?
Để phục vụ suy diễn (inference) trong môi trường sản xuất, bạn chỉ cần một máy chủ tiêu chuẩn sử dụng CPU (4 cores, 8GB RAM) với thời gian đáp ứng trung bình khoảng 80-120 ms/ảnh khi sử dụng VietOCR hoặc ViTSTR. Nếu triển khai trên GPU chuyên dụng như NVIDIA T4, độ trễ sẽ giảm xuống dưới 10-25 ms/ảnh, đáp ứng hàng trăm yêu cầu đồng thời.

2. Khả năng mở rộng quy mô (scalability) của hệ thống khi lượng dữ liệu tăng lên ra sao?
Hệ thống được thiết kế dạng stateless microservice thông qua RESTful API, cho phép dễ dàng đóng gói Docker container và mở rộng theo chiều ngang (horizontal scaling) trên Kubernetes hoặc các nền tảng Cloud (AWS, GCP). Cơ chế Transformer hỗ trợ huấn luyện phân tán đa GPU (Distributed Data Parallel) hiệu quả khi tăng quy mô tập dữ liệu lên hàng triệu mẫu.

3. Làm thế nào để tích hợp module nhận diện này vào hệ thống camera giám sát hiện có?
Hệ thống có thể nhận luồng video RTSP từ camera, sử dụng một module phát hiện văn bản nhanh (như DBNet hoặc CRAFT) để cắt các khung hình chứa chữ (Bounding Box), sau đó chuyển tiếp vùng ảnh cắt vào API của TransformerOCR để trích xuất văn bản trả về hệ thống quản trị trung tâm.

4. Chi phí vận hành và bảo trì mô hình trong dài hạn như thế nào?
Nhờ xây dựng hoàn toàn trên nền tảng mã nguồn mở (Python, PyTorch, Flask), doanh nghiệp không phải trả phí cấp phép hàng năm. Chi phí duy nhất là hạ tầng máy chủ đám mây, ước tính từ 30 - 80 USD/tháng cho một cụm máy chủ xử lý tải trung bình.

5. Tại sao Transformer lại nhận diện dấu tiếng Việt chính xác hơn mạng RNN/LSTM truyền thống?
Mạng RNN xử lý tuần tự từng bước thời gian nên dễ gặp hiện tượng suy giảm thông tin ngữ cảnh khi chuỗi dài hoặc khi các dấu thanh nằm cách biệt ở phía trên/dưới nguyên âm. Ngược lại, cơ chế Multi-Head Self-Attention của Transformer tính toán tương quan trực tiếp giữa đặc trưng dấu thanh và nguyên âm tương ứng trên toàn bộ không gian 2 chiều của ảnh, giúp loại bỏ triệt để lỗi phân loại nhầm dấu.


Kết luận

Đề tài khóa luận tốt nghiệp "Đánh giá kiến trúc Transformer cho bài toán nhận diện văn bản tiếng Việt trong ảnh" của sinh viên Lê Quang Hưng (Trường Đại học Công nghệ Thông tin - ĐHQG-HCM) dưới sự hướng dẫn của TS. Ngô Đức Thành và ThS. Đỗ Văn Tiến đã hoàn thành xuất sắc các mục tiêu đề ra:

  • Chứng minh tính ưu việt vượt trội của kiến trúc Transformer so với các phương pháp nắn thẳng hình học và phân đoạn ký tự truyền thống trên dữ liệu chữ cảnh tiếng Việt, với độ chính xác cao nhất đạt 82.35% (TransformerOCR).
  • Đóng góp cho cộng đồng nghiên cứu bộ dữ liệu thực tế 120.000 ảnh từ ngữ tiếng Việt chất lượng cao.
  • Khẳng định giá trị thực tiễn qua thành tích Giải Nhì tại cuộc thi AI chuyên nghiệp HCM AI Challenge 2021 và xây dựng hoàn chỉnh ứng dụng web demo.

Nghiên cứu mở ra tiềm năng ứng dụng sâu rộng trong việc số hóa dữ liệu thị giác thông minh tại Việt Nam, đồng thời đặt nền móng vững chắc cho các cải tiến mô hình OCR đa phương thức trong tương lai.