Giới thiệu dự án

Chuyển đổi số quốc gia tại Việt Nam đang diễn ra mạnh mẽ trên mọi lĩnh vực hành chính công và doanh nghiệp. Theo các thống kê từ Ủy ban Quốc gia về Chuyển đổi số, nền tảng tích hợp và chia sẻ dữ liệu quốc gia xử lý hơn 1,6 triệu giao dịch mỗi ngày; cơ sở dữ liệu bảo hiểm quốc gia đã đồng bộ, xác thực thông tin cho hơn 91 triệu người dân và dữ liệu cán bộ, công chức đạt tỷ lệ kết nối 95% trên toàn quốc. Tuy nhiên, rào cản lớn nhất trong tiến trình số hóa toàn diện hiện nay là khối lượng khổng lồ các tài liệu giấy truyền thống vẫn đang được sử dụng hàng ngày tại các cơ quan, trường học và doanh nghiệp.

Thực trạng xử lý tài liệu tại Việt Nam đối mặt với những thách thức nghiêm trọng:

  • Chi phí vận hành và lưu trữ vật lý cao: Việc in ấn, vận chuyển, lưu kho và bảo quản tài liệu giấy đòi hỏi không gian lớn cùng chi phí bảo trì định kỳ đắt đỏ.
  • Quy trình nhập liệu thủ công (Manual Data Entry): Các đơn vị tiếp nhận trung bình từ hàng trăm đến hơn 1.000 biểu mẫu phi cấu trúc mỗi ngày (như đơn từ, phiếu khảo sát, hồ sơ đăng ký, hóa đơn). Việc nhập liệu bằng tay phụ thuộc hoàn toàn vào sức người, tốc độ xử lý chậm và tỷ lệ sai sót trung bình dao động từ 3% đến 5%.
  • Sự phụ thuộc vào các giải pháp ngoại nhập đắt đỏ: Các dịch vụ Trí tuệ nhân tạo tài liệu (Document AI) thương mại quốc tế như SAP Document Information Extraction hay Google Cloud Document AI có chi phí bản quyền rất cao, hoạt động dưới dạng "hộp đen" (black box) và chưa được tối ưu hóa sâu cho đặc trưng chữ in có dấu cũng như chữ viết tay tiếng Việt.

Đồ án tốt nghiệp ngành Robot và Trí tuệ Nhân tạo tại Trường Đại học Sư phạm Kỹ thuật TP.HCM (HCMUTE), do nhóm sinh viên Huỳnh Vĩnh Phúc, Nguyễn Xuân Phi, Chu Nhật Minh Quân thực hiện dưới sự hướng dẫn của TS. Bùi Hà Đức, đã giải quyết triệt để bài toán trên thông qua đề tài: "Hệ thống AI trích xuất dữ liệu từ tài liệu in tiếng Việt" (Development of an AI System for Data Extraction from Vietnamese Printed Documents).

+------------------+      +-------------------+      +----------------------+
| Hardware Scanner | ---> | Image Acquisition | ---> | SIFT Template        |
| (ADF / Flatbed)  |      | Interface (API)   |      | Alignment & Warping  |
+------------------+      +-------------------+      +----------------------+
                                                                |
+------------------+      +-------------------+                 v
| Structured DB    | <--- | Text Recognition  | <--- +----------------------+
| & Web GUI Output |      | (VietOCR Engine)  |      | Layout Analysis      |
+------------------+      +-------------------+      | (YOLOv8 / LayoutLM)  |
                                                     +----------------------+

Mục tiêu dự án

  1. Nghiên cứu, thiết kế và phát triển giao diện lập trình ứng dụng (API) phần cứng cho phép giao tiếp trực tiếp, tự động điều khiển các dòng máy quét văn phòng hỗ trợ khay nạp tài liệu tự động (ADF - Automatic Document Feeder).
  2. Xây dựng pipeline thị giác máy tính và học sâu (Deep Learning) kết hợp phân tích bố cục tài liệu (Document Layout Analysis - DLA) và nhận dạng ký tự quang học (OCR) chuyên biệt cho tiếng Việt.
  3. Phát triển framework tự động sinh dữ liệu chữ viết tay tổng hợp (Synthetic Data Generation) dựa trên vector Glyph và font tùy biến nhằm giải quyết bài toán thiếu hụt tập dữ liệu chữ viết tay tiếng Việt.
  4. Triển khai hoàn chỉnh hệ sinh thái phần mềm bao gồm Web Server, hệ quản trị cơ sở dữ liệu quan hệ và Giao diện người dùng trực quan (GUI) cho phép định nghĩa biểu mẫu động (Template Creation) và trích xuất thông tin tự động theo thời gian thực.

Tiếp cận giải pháp và phạm vi nghiên cứu

Hệ thống kết hợp kỹ thuật nắn chỉnh hình học bằng thuật toán SIFT (Scale Invariant Feature Transform) với các mô hình học sâu hiện đại nhất: YOLOv8-Seg/LayoutLMv3 cho phân tích bố cục và VietOCR (TransformerOCR/AttentionOCR) cho nhận dạng văn bản tiếng Việt. Giải pháp đạt tốc độ xử lý trung bình dưới 1,5 giây/trang, độ chính xác nhận dạng chữ in đạt trên 96% và chữ viết tay đạt trên 88%, giảm 85% nhân lực nhập liệu thủ công. Phạm vi đồ án tập trung vào các tài liệu dạng biểu mẫu có cấu trúc và bán cấu trúc tiếng Việt scanned từ thiết bị phần cứng thực tế.


Phân tích và thiết kế giải pháp

Phân tích hiện trạng

Trước khi xây dựng hệ thống, nhóm nghiên cứu đã tiến hành đánh giá toàn diện các giải pháp OCR và Document AI hiện có trên thị trường:

Tiêu chí đánh giá Tesseract OCR (Mã nguồn mở) SAP Document AI / Google Vision Hệ thống đề xuất (HCMUTE AI)
Hỗ trợ tiếng Việt có dấu Trung bình (Dễ nhầm dấu hỏi/ngã/nặng) Rất tốt (Độ chính xác cao) Xuất sắc (Fine-tuned VietOCR chuyên sâu)
Nhận dạng chữ viết tay Rất kém (< 45% chính xác) Tốt (Cần cấu hình trả phí cao) Tốt (Đạt > 88% nhờ Synthetic Dataset)
Khả năng định nghĩa Template Không hỗ trợ (Cần code thêm) Hỗ trợ cấu hình phức tạp GUI trực quan, tạo mẫu trong 2 phút
Tích hợp phần cứng Scanner Không có (Xử lý file tĩnh) Không có API trực tiếp Có API Driver tích hợp máy quét ADF
Chi phí bản quyền Miễn phí Rất đắt (Tính tiền theo số lượng request) Tự chủ công nghệ, mã nguồn mở, chi phí 0đ
Tính minh bạch (Explainability) Mã nguồn mở Đóng kín (Black-box) Minh bạch toàn bộ pipeline kiến trúc

Yêu cầu hệ thống theo mô hình MoSCoW

  • Must-have (Bắt buộc có): Module kết nối máy quét tự động; module căn chỉnh tọa độ bằng SIFT; mô hình DLA phân đoạn tiêu đề, bảng biểu, trường nhập liệu; mô hình OCR tiếng Việt; cơ sở dữ liệu lưu trữ kết quả.
  • Should-have (Nên có): Giao diện Web GUI kéo thả chỉnh sửa bounding box; module sinh dữ liệu chữ viết tay tổng hợp; API RESTful xuất dữ liệu JSON/CSV.
  • Could-have (Có thể mở rộng): Cơ chế xác thực phân quyền nhiều người dùng (Multi-user Server); khả năng nhận dạng bảng biểu phức tạp không viền (Borderles tables).
  • Won't-have (Chưa thực hiện ở giai đoạn này): Nhận dạng tài liệu viết tay cổ (Hán Nôm) hoặc tài liệu bị rách nát trên 50% diện tích.

Thiết kế hệ thống

Kiến trúc hệ thống được xây dựng theo mô hình Module hóa 4 tầng (Layered Architecture):

+-------------------------------------------------------------------------+
|                         PRESENTATION LAYER                              |
|   - Template Creation Web GUI (React.js + Canvas API)                   |
|   - Data Extraction & Document Management Dashboard                     |
+-------------------------------------------------------------------------+
                                    | HTTP / RESTful API
+-------------------------------------------------------------------------+
|                          APPLICATION LAYER                              |
|   - Scanner Controller API (Driver SANE/TWAIN Interface)                |
|   - Template Management Engine & Dynamic Coordinate Mapper              |
|   - Task Queue & Batch Processing Pipeline (FastAPI)                    |
+-------------------------------------------------------------------------+
                                    |
+-------------------------------------------------------------------------+
|                            AI CORE LAYER                                |
|   - Preprocessing: Grayscale, Denoising, Deskewing, SIFT Homography     |
|   - Document Layout Analysis: YOLOv8x-Seg / LayoutLMv3 Multimodal       |
|   - Text Detection: DBNet (Real-time Adaptive Binarization)             |
|   - Text Recognition: VietOCR (CNN Backbone + Transformer Encoder-Dec)  |
+-------------------------------------------------------------------------+
                                    | SQL Driver
+-------------------------------------------------------------------------+
|                            DATA STORAGE LAYER                           |
|   - PostgreSQL Database (Metadata, Form Fields, Log transactions)       |
|   - Local File Storage / S3 Bucket (Scanned Images, SVG Glyphs)         |
+-------------------------------------------------------------------------+

Thiết kế cơ sở dữ liệu quan hệ

Hệ thống sử dụng PostgreSQL để lưu trữ thông tin biểu mẫu và kết quả trích xuất:

-- Bảng định nghĩa loại biểu mẫu (Template)
CREATE TABLE form_templates (
    template_id SERIAL PRIMARY KEY,
    template_name VARCHAR(255) NOT NULL,
    reference_image_path TEXT NOT NULL,
    sift_keypoints_data BYTEA,
    created_at TIMESTAMP DEFAULT CURRENT_TIMESTAMP
);

-- Bảng định nghĩa các trường dữ liệu cần trích xuất trên Template
CREATE TABLE template_fields (
    field_id SERIAL PRIMARY KEY,
    template_id INT REFERENCES form_templates(template_id) ON DELETE CASCADE,
    field_key VARCHAR(100) NOT NULL,
    field_type VARCHAR(50) DEFAULT 'typed_text', -- typed_text, handwritten, checkbox
    bbox_x INT NOT NULL,
    bbox_y INT NOT NULL,
    bbox_width INT NOT NULL,
    bbox_height INT NOT NULL
);

-- Bảng lưu trữ kết quả trích xuất từ tài liệu quét thực tế
CREATE TABLE extracted_documents (
    document_id SERIAL PRIMARY KEY,
    template_id INT REFERENCES form_templates(template_id),
    scanned_image_path TEXT NOT NULL,
    extracted_data JSONB NOT NULL,
    processing_time_ms INT,
    created_at TIMESTAMP DEFAULT CURRENT_TIMESTAMP
);

Thiết kế API Endpoints (FastAPI Backend)

  • POST /api/v1/scanner/scan: Gửi tín hiệu điều khiển phần cứng thực hiện quét ảnh từ khay ADF, trả về mảng ảnh nhị phân.
  • POST /api/v1/templates/create: Nhận ảnh mẫu và danh sách bounding box của các trường để lưu cấu trúc form.
  • POST /api/v1/extract/process: Tiếp nhận ảnh quét mới, tự động căn chỉnh template bằng SIFT, chạy OCR nhận dạng và trả về cấu trúc JSON:
{
  "status": "success",
  "template_matched": "Phieu_Dang_Ky_Nhap_Hoc_2024",
  "confidence_alignment": 0.984,
  "data": {
    "ho_va_ten": "Huỳnh Vĩnh Phúc",
    "mssv": "20134005",
    "lop": "20134",
    "so_dien_thoai": "0357642052",
    "dia_chi": "Hiệp Phú, TP Thủ Đức, TP Hồ Chí Minh"
  },
  "execution_time_seconds": 1.24
}

Methodology

Dự án được phát triển theo mô hình Agile/Scrum với các chu kỳ lặp (Sprint) 2 tuần. Toàn bộ tiến trình nghiên cứu trải qua 4 cột mốc (Milestones):

  1. Milestone 1 (Tuần 1 - 4): Nghiên cứu lý thuyết Document AI, giao thức phần cứng máy quét và thiết kế kiến trúc hệ thống.
  2. Milestone 2 (Tuần 5 - 8): Xây dựng module kết nối máy quét API, thu thập tập dữ liệu biểu mẫu tiếng Việt và xây dựng engine sinh chữ viết tay tổng hợp.
  3. Milestone 3 (Tuần 9 - 12): Huấn luyện, tinh chỉnh (fine-tuning) các mô hình YOLOv8, LayoutLMv3 và TransformerOCR; lập trình module căn chỉnh SIFT.
  4. Milestone 4 (Tuần 13 - 16): Tích hợp toàn diện phần cứng - AI - Web GUI, kiểm thử UAT và tối ưu hóa thời gian thực thi.

Implementation và kết quả

Development process

Quá trình phát triển tập trung giải quyết 3 bài toán kỹ thuật trọng tâm:

1. Thuật toán căn chỉnh biểu mẫu bằng SIFT và Homography

Khi tài liệu được nạp qua máy quét ADF, hiện tượng xoay góc lệch (skew), xê dịch biên hoặc co dãn nhẹ là không thể tránh khỏi. Nhóm nghiên cứu áp dụng kỹ thuật khớp điểm đặc trưng bất biến SIFT (Scale-Invariant Feature Transform) kết hợp thuật toán RANSAC để tìm ma trận biến đổi phối cảnh Homography $H$:

$$p_{template} = H \cdot p_{scanned}$$

$$\begin{bmatrix} x' \ y' \ 1 \end{bmatrix} = \begin{bmatrix} h_{11} & h_{12} & h_{13} \ h_{21} & h_{22} & h_{23} \ h_{31} & h_{32} & h_{33} \end{bmatrix} \begin{bmatrix} x \ y \ 1 \end{bmatrix}$$

Sau khi nắn chỉnh ảnh quét về đúng hệ quy chiếu của template gốc, tọa độ của các trường thông tin (ROI - Region of Interest) được cắt chính xác tuyệt đối mà không bị lệch dòng.

import cv2
import numpy as np

def align_scanned_document(scanned_img: np.ndarray, template_img: np.ndarray):
    """
    Can chinh anh scan ve dung he quy chieu cua Template bang SIFT va Homography
    """
    sift = cv2.SIFT_create(nfeatures=2000)
    kp1, des1 = sift.detectAndCompute(template_img, None)
    kp2, des2 = sift.detectAndCompute(scanned_img, None)

    # Su dung FLANN Matcher de tim cac diem tuong dong
    index_params = dict(algorithm=1, trees=5)
    search_params = dict(checks=50)
    flann = cv2.FlannBasedMatcher(index_params, search_params)
    matches = flann.knnMatch(des1, des2, k=2)

    # Loc match theo ti le Lowe's ratio test
    good_matches = [m for m, n in matches if m.distance < 0.7 * n.distance]

    if len(good_matches) > 10:
        src_pts = np.float32([kp1[m.queryIdx].pt for m in good_matches]).reshape(-1, 1, 2)
        dst_pts = np.float32([kp2[m.trainIdx].pt for m in good_matches]).reshape(-1, 1, 2)

        # Tim ma tran Homography bang RANSAC
        H, mask = cv2.findHomography(dst_pts, src_pts, cv2.RANSAC, 5.0)
        h, w = template_img.shape[:2]
        aligned_img = cv2.warpPerspective(scanned_img, H, (w, h))
        return aligned_img, True
    return scanned_img, False

2. Pipeline sinh dữ liệu chữ viết tay tổng hợp (Synthetic Data Generation)

Nhằm giải quyết triệt để vấn đề khan hiếm tập dữ liệu chữ viết tay tiếng Việt có dấu, nhóm đã xây dựng quy trình tự động hóa:

  • Tạo mẫu thu thập ký tự (Glyph Template) chuẩn có chứa mã QR định danh.
  • Tự động cắt tách từng ký tự mẫu sang định dạng PNG/BMP.
  • Vector hóa các ký tự ảnh thành định dạng Scalable Vector Graphics (SVG).
  • Đóng gói các ký tự SVG thành bộ font chữ viết tay hoàn chỉnh (.TTF) với các tham số khoảng cách lề (side bearings).
  • Sinh hàng chục ngàn dòng văn bản ngẫu nhiên từ từ điển tiếng Việt, áp dụng các phép biến dạng hình thái học (affine transformation, blur, noise) để huấn luyện mô hình nhận dạng.
+----------------+      +------------------+      +-------------------+
| Glyph Template | ---> | Character Images | ---> | SVG Vectorization |
| (QR Annotated) |      | (PNG / BMP Crop) |      | (Contour Tracing) |
+----------------+      +------------------+      +-------------------+
                                                            |
+----------------+      +------------------+                v
| OCR Training   | <--- | Synthetic Data   | <--- +-------------------+
| Text Dataset   |      | Generator Engine |      | Handwritten Font  |
+----------------+      +------------------+      | Package (.TTF)    |
                                                  +-------------------+

Testing và validation

Hệ thống được kiểm thử thực tế trên 1.000 mẫu biểu mẫu hành chính, bao gồm đơn đăng ký nhập học, phiếu khảo sát sinh viên và biểu mẫu kê khai thông tin cá nhân tại Trường Đại học Sư phạm Kỹ thuật TP.HCM.

Đánh giá mô hình Document Layout Analysis (DLA)

So sánh giữa kiến trúc YOLOv8-Seg và LayoutLMv3 trên tập dữ liệu kiểm thử biểu mẫu:

Mô hình DLA Backbone / Cấu trúc Precision (%) Recall (%) mAP@0.5 (%) Tốc độ xử lý (ms/trang)
Faster R-CNN ResNet-50 88.4 85.2 86.7 185 ms
LayoutLMv3 Multimodal Transformer 95.8 94.1 95.2 142 ms
YOLOv8x-Seg (Được chọn) CSPDarknet + C2f Module 96.5 95.8 96.2 38 ms

Nhận xét: YOLOv8x-Seg cho độ chính xác mAP tương đương LayoutLMv3 nhưng đạt tốc độ xử lý vượt trội gấp gần 4 lần (38ms so với 142ms), đáp ứng hoàn hảo yêu cầu xử lý thời gian thực.

Đánh giá mô hình nhận dạng ký tự quang học (OCR)

Đánh giá trên tập dữ liệu kiểm thử văn bản tiếng Việt gồm cả chữ in (Typed Text) và chữ viết tay (Handwritten Text) thông qua hai chỉ số: Tỷ lệ lỗi ký tự (Character Error Rate - CER) và Tỷ lệ lỗi từ (Word Error Rate - WER):

$$\text{CER} = \frac{S + D + I}{N} \times 100%$$

(Trong đó $S$ là số ký tự thay thế, $D$ là số ký tự bị xóa, $I$ là số ký tự chèn thêm, $N$ là tổng số ký tự gốc).

Mô hình OCR Loại văn bản CER (%) WER (%) Tốc độ nhận dạng (ms/dòng)
CRNN + CTC Loss Chữ in tiếng Việt 5.82% 11.45% 18 ms
CRNN + CTC Loss Chữ viết tay tiếng Việt 18.90% 34.20% 20 ms
VietOCR (AttentionOCR) Chữ in tiếng Việt 2.15% 4.80% 45 ms
VietOCR (AttentionOCR) Chữ viết tay tiếng Việt 9.40% 17.80% 48 ms
VietOCR (TransformerOCR - Chọn) Chữ in tiếng Việt 1.24% 2.85% 35 ms
VietOCR (TransformerOCR - Chọn) Chữ viết tay tiếng Việt 7.15% 13.60% 37 ms

Kết quả đạt được

+-------------------------------------------------------------------------+
|                    KẾT QUẢ ĐẠT ĐƯỢC CỦA ĐỒ ÁN                           |
+-------------------------------------------------------------------------+
| [✓] API Scanner Driver: Kết nối thành công 100% máy quét chuẩn TWAIN/SANE|
| [✓] Tốc độ xử lý tổng thể: 1.24 giây / trang A4 tiêu chuẩn              |
| [✓] Độ chính xác nhận dạng chữ in: 98.76% (Độ khớp trường thông tin)   |
| [✓] Độ chính xác chữ viết tay: 92.85% (Nhờ Fine-tuned Synthetic Data)  |
| [✓] Giảm thiểu thời gian nhập liệu: Tiết kiệm 85% nhân lực hành chính   |
| [✓] Web GUI: Cho phép tạo mẫu biểu mẫu mới chỉ trong 120 giây           |
+-------------------------------------------------------------------------+

Đổi mới và đóng góp

  1. Đóng góp về phần cứng và giao tiếp: Xây dựng thành công tầng trừu tượng hóa API điều khiển phần cứng máy quét (Scanner Hardware Abstraction API), hỗ trợ chế độ quét đơn và quét hàng loạt liên tục qua khay ADF, xóa bỏ rào cản phụ thuộc vào phần mềm thương mại đi kèm máy quét.
  2. Cơ chế nắn chỉnh hình học thông minh (SIFT-Homography Dynamic Alignment): Giải quyết triệt để hiện tượng lệch góc quét (skewing) và dịch chuyển vị trí thực tế của tài liệu giấy, đảm bảo các vùng ROI cắt ra luôn khớp 100% với mẫu ban đầu.
  3. Quy trình sinh dữ liệu chữ viết tay tự động (Synthetic Handwriting Pipeline): Đề xuất giải pháp biến đổi từ Glyph mẫu sang font chữ vector SVG và font TTF, tạo ra tập dữ liệu hàng chục nghìn ảnh huấn luyện chữ viết tay tiếng Việt có dấu với chi phí gần như bằng 0.
  4. Hệ thống Template Builder linh hoạt: Giao diện trực quan cho phép cán bộ quản lý tự định nghĩa các vùng dữ liệu cần trích xuất trên biểu mẫu mới bằng thao tác kéo thả chuột mà không cần đào tạo lại mô hình AI từ đầu.

Ứng dụng thực tế và triển khai

Các trường hợp ứng dụng thực tế

  • Khối Đại học và Cơ sở giáo dục: Tự động hóa quá trình nhập liệu hồ sơ nhập học của tân sinh viên, phiếu điểm rèn luyện, bài thi trắc nghiệm và phiếu khảo sát ý kiến.
  • Cơ quan hành chính một cửa: Số hóa tờ khai cấp căn cước, giấy khai sinh, hồ sơ đăng ký kinh doanh và thủ tục đất đai tại các Ủy ban Nhân dân cấp quận/huyện.
  • Doanh nghiệp tài chính, ngân hàng & bảo hiểm: Tự động trích xuất thông tin hợp đồng tín dụng, phiếu yêu cầu bồi thường bảo hiểm và chứng từ kế toán.

Yêu cầu cấu hình phần cứng triển khai

+------------------------------------------------------------------------+
|                      CẤU HÌNH HỆ THỐNG YÊU CẦU                         |
+------------------------------------------------------------------------+
| Thành phần          | Cấu hình tối thiểu       | Cấu hình khuyến nghị  |
|---------------------+--------------------------+-----------------------|
| CPU                 | Intel Core i5 (4 cores)  | Intel Core i7 / AMD 8c|
| RAM                 | 16 GB DDR4               | 32 GB DDR4/DDR5       |
| GPU                 | Không bắt buộc (CPU Mode)| NVIDIA RTX 3060 12GB+ |
| Ổ cứng              | 256 GB SSD               | 512 GB NVMe SSD       |
| Máy quét (Scanner)  | Máy quét phẳng Flatbed   | Máy quét ADF 30+ ppm  |
| Hệ điều hành        | Ubuntu 20.04 / Win 10    | Ubuntu 22.04 LTS      |
+------------------------------------------------------------------------+

Phân tích chi phí - lợi ích (ROI Analysis)

Một đơn vị hành chính tiếp nhận trung bình 1.000 hồ sơ/ngày:

  • Phương pháp thủ công: Cần 4 nhân sự nhập liệu liên tục, tổng chi phí tiền lương khoảng 40.000.000 VNĐ/tháng, rủi ro sai sót dữ liệu 4%.
  • Ứng dụng hệ thống AI: Chỉ cần 1 nhân sự vận hành máy quét và đối soát, tiết kiệm 75% chi phí nhân sự hàng tháng (khoảng 30.000.000 VNĐ/tháng). Thời gian hoàn vốn đầu tư phần cứng (ROI) đạt được chỉ sau 4 đến 6 tháng triển khai.

Hạn chế và hướng phát triển

Hạn chế hiện tại

  • Đối với các tài liệu scan bị rách nát góc, chất lượng mực in mờ nhạt nghiêm trọng hoặc độ phân giải quét dưới 150 DPI, độ chính xác của các điểm đặc trưng SIFT có thể suy giảm.
  • Chữ viết tay quá bay bướm, chữ viết dạng nghệ thuật (Calligraphy) hoặc viết liền nét không theo quy chuẩn chữ cái tiếng Việt vẫn tồn tại tỷ lệ nhận dạng nhầm lẫn ký tự nhất định.

Hướng phát triển trong tương lai

  • Tích hợp các mô hình Thị giác - Ngôn ngữ lớn đa phương thức (Multimodal Large Vision-Language Models như Qwen-VL, LayoutLLM) để thực hiện trích xuất dữ liệu dạng Zero-shot mà không cần định nghĩa trước Template biểu mẫu cố định.
  • Mở rộng hệ thống nhận dạng hỗ trợ chữ viết tay tiếng Việt cổ (chữ Nôm) phục vụ công tác số hóa tài liệu lưu trữ lịch sử quốc gia.
  • Đóng gói giải pháp thành kiến trúc Microservices với Docker và Kubernetes nhằm phục vụ xử lý tải cao trên hạ tầng đám mây phân tán.

Đối tượng hưởng lợi

  • Sinh viên & Nghiên cứu sinh: Cung cấp tài liệu tham khảo hoàn chỉnh về quy trình xây dựng ứng dụng Document AI thực chiến, phương pháp luận nghiên cứu và kỹ thuật kết hợp giữa thị giác máy tính truyền thống với mô hình học sâu.
  • Kỹ sư AI & Lập trình viên: Cung cấp mẫu thiết kế phần mềm (Design Pattern) chuẩn mực từ tầng giao tiếp phần cứng (Scanner Driver), xử lý ảnh nâng cao (SIFT Homography) đến tối ưu hóa mô hình TransformerOCR phục vụ suy luận thời gian thực.
  • Doanh nghiệp & Cơ quan Nhà nước: Tiếp cận giải pháp số hóa tài liệu mã nguồn mở hoàn toàn tự chủ về mặt công nghệ, bảo mật tuyệt đối dữ liệu nội bộ và tiết kiệm hàng trăm triệu đồng chi phí thuê dịch vụ hàng năm.

Câu hỏi thường gặp

1. Hệ thống có yêu cầu máy quét chuyên dụng đắt tiền không?

Không. Hệ thống được thiết kế với tầng API chuẩn hóa, tương thích với hầu hết các máy quét văn phòng phổ thông trên thị trường (Canon, HP, Epson, Brother) hỗ trợ giao thức TWAIN/SANE qua cổng USB hoặc mạng LAN nội bộ.

2. Khi mẫu biểu mẫu hành chính thay đổi, có cần huấn luyện lại mô hình AI không?

Hoàn toàn không cần. Người quản trị chỉ cần tải ảnh biểu mẫu mới lên Web GUI, dùng chuột kéo thả định vị các ô thông tin cần lấy (như Tên, Ngày sinh, Mã số) và lưu lại. Hệ thống sẽ tự động trích xuất theo tọa độ mới ngay lập tức.

3. Dữ liệu trích xuất có thể tích hợp vào phần mềm quản lý sẵn có của đơn vị không?

Có. Hệ thống cung cấp đầy đủ chuẩn giao tiếp RESTful API và Webhook, cho phép xuất dữ liệu theo định dạng chuẩn JSON, CSV hoặc chèn trực tiếp vào cơ sở dữ liệu quan hệ (PostgreSQL, MySQL, SQL Server, Oracle) của hệ thống hiện hữu.

4. Hệ thống xử lý thế nào khi tài liệu bị đặt nghiêng hoặc ngược chiều khi quét?

Module tiền xử lý tự động phân tích ma trận góc xoay (Orientation Detection) và sử dụng thuật toán SIFT Homography để tự động nắn thẳng (Deskew) và xoay ảnh về góc chuẩn 0 độ trước khi chuyển vào pipeline nhận dạng.

5. Chi phí bảo trì và nâng cấp hệ thống hàng năm là bao nhiêu?

Hệ thống được phát triển trên nền tảng các công nghệ mã nguồn mở (Python, PyTorch, PostgreSQL, FastAPI), không phát sinh bất kỳ chi phí bản quyền định kỳ nào. Chi phí vận hành chỉ bao gồm điện năng và bảo trì định kỳ phần cứng máy quét vật lý.


Kết luận

Đồ án tốt nghiệp "Hệ thống AI trích xuất dữ liệu từ tài liệu in tiếng Việt" của nhóm sinh viên Trường Đại học Sư phạm Kỹ thuật TP.HCM đã giải quyết xuất sắc bài toán tự động hóa số hóa tài liệu hành chính tại Việt Nam. Bằng việc kết hợp sáng tạo giữa thuật toán nắn chỉnh tọa độ SIFT, mô hình phân đoạn bố cục YOLOv8x-Seg, kiến trúc nhận dạng tiếng Việt TransformerOCR và framework sinh chữ viết tay tổng hợp độc đáo, hệ thống đã chứng minh tính khả thi vượt trội cả về mặt kỹ thuật lẫn hiệu quả kinh tế.

Đây là minh chứng rõ nét cho năng lực làm chủ công nghệ trí tuệ nhân tạo chuyên sâu của thế hệ kỹ sư trẻ Việt Nam, đóng góp thiết thực vào chiến lược chuyển đổi số quốc gia, kiến tạo mô hình văn phòng không giấy tờ và tối ưu hóa năng suất lao động cho toàn xã hội.