Giới thiệu dự án

Trong kỷ nguyên chuyển đổi số và tự động hóa quy trình nghiệp vụ (BPA), danh thiếp (Business Card) vẫn giữ vai trò thiết yếu trong việc thiết lập mạng lưới quan hệ đối tác kinh doanh. Theo thống kê từ nhật báo Nihon Keizai Shimbun, một chuyên viên kinh doanh tại các thị trường phát triển xử lý và trao đổi trung bình 20 danh thiếp mỗi ngày. Tuy nhiên, việc nhập liệu thủ công thông tin từ danh thiếp vào các hệ thống quản trị quan hệ khách hàng (CRM/ERP) tiêu tốn từ 2 đến 4 phút cho mỗi thẻ, gây lãng phí nguồn lực và tiềm ẩn tỷ lệ sai sót dữ liệu lên tới 7–12%.

Các giải pháp thương mại phổ biến như ABBYY Business Card Reader, CamCard hay xContact hoạt động hiệu quả trên tập ký tự tiếng Anh chuẩn nhưng bộc lộ nhiều hạn chế nghiêm trọng khi xử lý ngôn ngữ tiếng Việt. Điểm nghẽn cốt lõi nằm ở hệ thống dấu thanh phức tạp (sắc, huyền, hỏi, ngã, nặng), các ký tự đặc thù (ă, â, đ, ê, ô, ơ, ư), phông chữ nghệ thuật cách điệu cao, độ phân giải camera không đồng đều và bố cục phi cấu trúc. Hơn nữa, mã nguồn đóng và chi phí bản quyền định kỳ cao gây rào cản lớn cho các doanh nghiệp trong nước muốn tích hợp trực tiếp vào hạ tầng nội bộ.

Đồ án tốt nghiệp "Nghiên cứu và đánh giá một số phương pháp cho bài toán rút trích thông tin từ danh thiếp" được thực hiện tại Trường Đại học Công nghệ Thông tin – ĐHQG-HCM nhằm giải quyết triệt để bài toán này với 4 mục tiêu cụ thể:

  1. Nghiên cứu toàn diện các kỹ thuật xử lý ảnh cổ điển kết hợp mô hình học sâu (Deep Learning) chuyên dụng cho bài toán nhận dạng ký tự quang học (OCR - Optical Character Recognition).
  2. Xây dựng và chuẩn hóa bộ dữ liệu thực nghiệm danh thiếp tiếng Việt VBC-583 với nhãn ground-truth đầy đủ cho 3 giai đoạn xử lý.
  3. Huấn luyện, đo lường và đánh giá độc lập hiệu năng của các kiến trúc thị giác máy tính tiên tiến nhất.
  4. Hiện thực hóa hệ thống demo trích xuất thông tin end-to-end trên nền tảng Web với độ chính xác cao và thời gian suy diễn tối ưu.

Giải pháp lựa chọn kiến trúc xử lý tuần tự nhiều bước (Step-wise Pipeline) thay vì mô hình tích hợp nguyên khối (Integrated End-to-End). Hướng tiếp cận này mang lại tính mô-đun hóa cao, cho phép tối ưu độc lập từng thành phần: Cắt và nắn chỉnh phối cảnh thẻ $\rightarrow$ Phát hiện vùng chứa văn bản $\rightarrow$ Nhận diện ký tự tiếng Việt $\rightarrow$ Khớp mẫu thông tin ngữ nghĩa.

Phạm vi nghiên cứu tập trung vào danh thiếp sử dụng bảng chữ cái Latin/Tiếng Việt, định dạng ảnh đơn thẻ chụp từ thiết bị di động hoặc máy quét trong điều kiện ánh sáng tự nhiên.


Phân tích và thiết kế giải pháp

Phân tích hiện trạng

Khảo sát các giải pháp nhận dạng danh thiếp hiện hành cho thấy sự phân hóa rõ rệt giữa công cụ thương mại đóng và các thư viện mã nguồn mở:

Giải pháp / Tiêu chí Cơ chế xử lý chính Ưu điểm Nhược điểm Hỗ trợ tiếng Việt
ABBYY FineReader Engine Engine OCR độc quyền + Heuristic Parsing Độ chính xác cao với tài liệu chuẩn, trích xuất thực thể tốt Mã nguồn đóng, chi phí bản quyền đắt đỏ, khó tùy biến sâu Khá (dễ lỗi dấu khi phông chữ lạ)
CamCard API Mobile OCR Cloud-based Tốc độ quét nhanh, giao diện tối ưu cho thiết bị di động Phụ thuộc kết nối mạng, rủi ro bảo mật dữ liệu khách hàng Trung bình (lỗi dấu ngã/hỏi)
TesseractOCR (Google) Line-level LSTM Network + Leptonica Mã nguồn mở hoàn toàn, hỗ trợ đa nền tảng Kém chính xác trên Scene Text, nhạy cảm với nhiễu nền Kém trên danh thiếp thực tế
Hệ thống đề xuất Advanced Hough + PAN + VietOCR Mã nguồn mở, tùy biến cao, tối ưu chuyên sâu tiếng Việt, chạy offline Cần tài nguyên phần cứng GPU để đạt tốc độ cao nhất Rất tốt (được huấn luyện chuyên biệt)

Ma trận phân loại yêu cầu hệ thống theo mô hình MoSCoW:

  • Must-have (Bắt buộc): Tự động phát hiện 4 góc danh thiếp và nắn thẳng (Perspective Rectification); phát hiện chính xác các hộp văn bản đa hướng (Rotated Bounding Box); nhận diện tiếng Việt đầy đủ dấu thanh; xuất dữ liệu dạng JSON.
  • Should-have (Cần có): Giao diện Web trực quan cho phép chỉnh sửa nhanh kết quả sau nhận dạng; tự động phân loại trường thông tin (Họ tên, SĐT, Email, Địa chỉ).
  • Could-have (Có thể có): Hỗ trợ xuất danh bạ định dạng .vcf tải về điện thoại; bộ lọc khử bóng đổ và cân bằng sáng thích ứng.
  • Won't-have (Chưa thực hiện đợt này): Nhận diện danh thiếp chứa ngôn ngữ phi Latin (tiếng Trung, Nhật, Hàn, Ả Rập).

Thiết kế hệ thống

Kiến trúc hệ thống được xây dựng theo mô hình Client-Server phân tầng, tách biệt hoàn toàn giữa tầng hiển thị và tầng tính toán trí tuệ nhân tạo:

[ Web Client / Mobile UI ] 
[ REST API Gateway / Flask Server ]
[ Database / Response Payload: Name, Phone, Email, Address, Company ]

Technology Stack & Thư viện sử dụng:

  • Ngôn ngữ lập trình: Python v3.8.12
  • Khung học sâu: PyTorch v1.10.2 (CUDA 11.3, cuDNN 8.2.1)
  • Thị giác máy tính: OpenCV v4.5.5, Albumentations v1.1.0
  • Khung OCR tiếng Việt: VietOCR v0.3.8 (kiến trúc AttentionOCR và TransformerOCR)
  • Back-end Server: Flask v2.0.3, Werkzeug v2.0.3, Gunicorn v20.1.0
  • Front-end Interface: HTML5, CSS3, JavaScript ES6, Bootstrap v5.1.3

Methodology

Quy trình phát triển tuân thủ phương pháp luận Agile-Scrum kết hợp mô hình CRISP-DM cho các dự án máy học:

  • Milestone 1 (Tuần 1–4): Khảo sát tài liệu, thu thập và xây dựng bộ dữ liệu VBC-583; định dạng nhãn theo chuẩn ICDAR2015.
  • Milestone 2 (Tuần 5–8): Hiện thực hóa và đánh giá thực nghiệm các thuật toán định vị biên thẻ (Canny + Contour, Advanced Hough, U-Net).
  • Milestone 3 (Tuần 9–13): Huấn luyện và đánh giá 6 mô hình Text Detection (TextFuseNet, PMTD, CRAFT, DB, PAN, PSENet) trên GPU NVIDIA Tesla T4/RTX 3060.
  • Milestone 4 (Tuần 14–16): Tích hợp module Text Recognition (VietOCR Transformer/Attention vs TesseractOCR); đóng gói REST API và xây dựng Web Demo UI.

Implementation và kết quả

Development process

Quá trình phát triển tập trung vào việc hiện thực hóa và tối ưu 3 khối thuật toán cốt lõi:

1. Định vị thẻ bằng Advanced Hough-based Method

Thuật toán phân tách cạnh ngang và dọc thông qua Fast Hough Transform (FHT), sau đó khôi phục cạnh bị mất bằng mô hình hình học camera phối cảnh và chấm điểm bằng hàm Contour Score $T_1$:

$$T_1 = \sum_{b \in Q} w(b) \cdot c \cdot \left(1 - \frac{w'(b)}{w(b) + \epsilon}\right)$$

Trong đó $w(b)$ là cường độ cạnh nằm trên đoạn $b$, $w'(b)$ là tổng cường độ các cạnh nhiễu song song, và $c$ là mật độ điểm ảnh khác 0. Các tứ giác tiềm năng tiếp tục được tái xếp hạng thông qua khoảng cách Chi-square ($\chi^2$) của lược đồ màu RGB giữa vùng nội vi và ngoại vi.

import cv2
import numpy as np

def compute_contrast_chi_square(image: np.ndarray, quad_mask: np.ndarray) -> float:
    """Tính điểm tương phản Chi-square giữa vùng trong và ngoài tứ giác."""
    inside_mask = quad_mask
    outside_mask = cv2.bitwise_not(quad_mask)
    
    chi_square_dist = 0.0
    for channel in range(3):
        hist_in = cv2.calcHist([image], [channel], inside_mask, [32], [0, 256])
        hist_out = cv2.calcHist([image], [channel], outside_mask, [32], [0, 256])
        
        cv2.normalize(hist_in, hist_in, norm_type=cv2.NORM_L1)
        cv2.normalize(hist_out, hist_out, norm_type=cv2.NORM_L1)
        
        # Công thức Chi-square distance
        eps = 1e-10
        chi = np.sum(((hist_in - hist_out) ** 2) / (hist_in + hist_out + eps))
        chi_square_dist += chi
        
    return float(chi_square_dist / 3.0)

2. Phát hiện văn bản bằng Pixel Aggregation Network (PAN)

PAN sử dụng module tăng cường kim tự tháp đặc trưng FPEM (Feature Pyramid Enhancement Module) kết hợp module hợp nhất đặc trưng FFM (Feature Fusion Module) để trích xuất biểu diễn ngữ cảnh đa tỷ lệ với chi phí tính toán siêu nhẹ ($O(N)$).

import torch
import torch.nn as nn
import torch.nn.functional as F

class FPEM_FFM_Block(nn.Module):
    def __init__(self, in_channels: int = 128):
        super(FPEM_FFM_Block, self).__init__()
        # 3.3.1 FPEM: Tăng cường đặc trưng từ dưới lên và từ trên xuống
        self.conv_up = nn.Conv2d(in_channels, in_channels, kernel_size=3, padding=1, groups=in_channels)
        self.conv_down = nn.Conv2d(in_channels, in_channels, kernel_size=3, padding=1, groups=in_channels)
        self.proj = nn.Conv2d(in_channels, in_channels, kernel_size=1)
        
    def forward(self, py_features):
        # py_features: danh sách feature maps [C2, C3, C4, C5]
        enhanced_feats = []
        for feat in py_features:
            up_feat = self.conv_up(feat)
            down_feat = self.conv_down(up_feat)
            out = self.proj(F.relu(up_feat + down_feat))
            enhanced_feats.append(out)
        return enhanced_feats

3. Nhận diện chuỗi ký tự với VietOCR (AttentionOCR)

Kiến trúc kết hợp CNN trích xuất đặc trưng hình học của dòng văn bản, chuyển qua mạng nơ-ron tái phát LSTM 2 chiều (BiLSTM) để mã hóa chuỗi thời gian, và giải mã qua cơ chế Attention của Bahdanau nhằm tập trung vào từng ký tự tiếng Việt có dấu.

from vietocr.tool.predictor import Predictor
from vietocr.tool.config import Cfg
from PIL import Image

def init_vietocr_engine(model_name: str = 'vgg_seq2seq') -> Predictor:
    """Khởi tạo engine OCR tiếng Việt tối ưu cho nhận dạng danh thiếp."""
    config = Cfg.load_config_from_name(model_name)
    config['device'] = 'cuda:0' if torch.cuda.is_available() else 'cpu'
    config['predictor']['beamsearch'] = False
    detector = Predictor(config)
    return detector

def recognize_text_line(detector: Predictor, cropped_line_img: Image.Image) -> str:
    """Nhận diện chuỗi ký tự UTF-8 từ ảnh dòng chữ cắt ra."""
    predicted_text = detector.predict(cropped_line_img)
    return predicted_text

Testing và validation

Bộ dữ liệu thực nghiệm VBC-583 gồm 583 ảnh danh thiếp tiếng Việt độ phân giải cao, được gán nhãn thủ công trên cả 3 bài toán: Tọa độ 4 đỉnh thẻ, Hộp bao văn bản 4 điểm góc (Quadrilateral Bounding Box theo chuẩn ICDAR2015), và Nội dung chuỗi ký tự UTF-8. Tỷ lệ phân chia Train / Validation / Test là 70 / 15 / 15.

Giao thức đánh giá bao gồm: Intersection over Union (IoU) cho định vị thẻ; Precision (P), Recall (R), H-mean ($F_1$) theo giao thức TedEval cho phát hiện văn bản; Character Accuracy Rate (CAR) và Word Accuracy Rate (WAR) cho nhận diện văn bản.

Bảng 1: Đánh giá giai đoạn 1 – Xác định vị trí thẻ danh thiếp trên VBC-583

Phương pháp Loại thuật toán Precision (%) Recall (%) H-mean (%) FPS (Inference)
Canny + FindContours Xử lý ảnh cơ bản 68.2 61.5 64.6 45.2
U-Net (Semantic Seg) Deep Learning (CNN) 88.7 86.4 87.5 18.6
Advanced Hough-based Hình học camera + FHT 92.4 90.1 91.2 31.4

Bảng 2: Đánh giá giai đoạn 2 – Phát hiện văn bản (Text Detection) trên VBC-583

Mô hình Hướng tiếp cận Backbone Precision (%) Recall (%) H-mean / $F_1$ (%) Tốc độ (FPS)
TextFuseNet Top-down (RoI-based) ResNet-50-FPN 84.6 81.2 82.8 6.2
PMTD Top-down (Pyramid Mask) ResNet-50-FPN 86.3 83.5 84.8 7.8
CRAFT Bottom-up (Char-Affinity) VGG-16 87.1 85.9 86.5 11.4
DB (Diff. Binarization) Bottom-up (Seg-based) ResNet-50 88.5 86.2 87.3 22.0
PSENet Bottom-up (Progressive) ResNet-50 85.9 83.0 84.4 8.5
PAN (Pixel Aggregation) Bottom-up (FPEM+FFM) ResNet-18 89.4 87.5 88.4 28.4

Bảng 3: Đánh giá giai đoạn 3 – Nhận diện văn bản tiếng Việt trên VBC-583

Mô hình nhận diện Kiến trúc trích xuất & giải mã Word Accuracy (%) Char Accuracy (%) Thời gian/dòng (ms)
TesseractOCR v5.0 Leptonica + LSTM (vie model) 64.2 78.5 42.0
VietOCR-Transformer ResNet-50 + Transformer Decoder 91.8 96.4 68.5
VietOCR-Attention VGG-19 + BiLSTM + Attention 93.5 97.8 34.2

Kết quả đạt được

Hệ thống tích hợp thành công chuỗi mô hình tối ưu nhất: Advanced Hough-based Method $\rightarrow$ PAN (Pixel Aggregation Network) $\rightarrow$ VietOCR-AttentionOCR.

  • Tỷ lệ phát hiện đúng cấu trúc thẻ và nắn thẳng đạt IoU > 0.90 trên 91.2% tập mẫu thử nghiệm.
  • H-mean phát hiện văn bản đạt 88.4%, vượt trội hơn hẳn so với các phương pháp Top-down nặng nề (TextFuseNet chỉ đạt 82.8%).
  • Nhận diện chính xác từ tiếng Việt đạt 93.5%, loại bỏ triệt để hiện tượng mất dấu thanh (huyền, ngã, nặng) vốn là điểm yếu cố hữu của TesseractOCR (chỉ đạt 64.2%).
  • Tổng thời gian xử lý trung bình toàn bộ chu trình đạt 1.15 giây/ảnh trên GPU NVIDIA RTX 3060 và 2.85 giây/ảnh trên CPU Intel Core i7-10700.

Đổi mới và đóng góp

  1. Bộ dữ liệu chuẩn VBC-583: Đóng góp bộ dữ liệu danh thiếp tiếng Việt đầu tiên được chuẩn hóa đa tầng nhãn (vùng bao thẻ, khung bao từ đa hướng và văn bản ground-truth), mở ra tài nguyên nghiên cứu mở cho cộng đồng OCR trong nước.
  2. Giải pháp định vị thẻ hybrid chính xác: Kết hợp mô hình biến đổi hình học chiếu phối cảnh (Projective Geometry) cùng Fast Hough Transform, cho phép tái tạo chính xác biên thẻ ngay cả khi thẻ bị che khuất một góc hoặc trùng màu với nền chụp—vấn đề mà thuật toán Canny truyền thống hoàn toàn thất bại.
  3. Cấu hình pipeline cân bằng hoàn hảo giữa tốc độ và độ chính xác: Chứng minh thực nghiệm rằng mô hình phân đoạn đáy lên PAN (chỉ với backbone ResNet-18 gọn nhẹ) kết hợp module FPEM-FFM đạt tốc độ xử lý 28.4 FPS trong khi vẫn duy trì độ chính xác cao hơn các mạng nặng như PMTD/Mask R-CNN.
  4. Giải mã ký tự tiếng Việt chuyên sâu: Ứng dụng thành công cơ chế Bahdanau Attention tùy biến cho tập từ vựng tiếng Việt mở rộng, giảm tỷ lệ lỗi ký tự (CER - Character Error Rate) xuống dưới 2.2%.

Ứng dụng thực tế và triển khai

Kịch bản ứng dụng thực tế

  • Tự động hóa số hóa danh bạ doanh nghiệp: Quét hàng loạt danh thiếp từ các sự kiện kết nối thương mại (B2B Expo, Networking Event), tự động chuyển đổi thành hồ sơ khách hàng tiềm năng trên Salesforce/HubSpot.
  • Tích hợp hệ thống eKYC / Onboarding: Xác thực thông tin giới thiệu và thông tin đại diện pháp lý của đối tác trong các ứng dụng tài chính số, ngân hàng điện tử.
  • Trợ lý số cá nhân: Ứng dụng di động giúp cá nhân quét nhanh danh thiếp, tự động quay số hoặc lưu vCard vào danh bạ chỉ sau 1 chạm.

Hướng dẫn triển khai hệ thống (Deployment Guide)

Yêu cầu hệ thống tối thiểu:

  • CPU: Intel Core i5 thế hệ 8 hoặc AMD Ryzen 5 tương đương
  • RAM: 8 GB (Khuyến nghị 16 GB)
  • GPU: NVIDIA GPU từ 4GB VRAM (GTX 1650 trở lên, khuyến nghị RTX 3060 12GB) hỗ trợ CUDA 11.x
  • Ổ cứng: 10 GB dung lượng trống

Các bước triển khai máy chủ:

# 1. Khởi tạo môi trường ảo Python
conda create -n business_card_ocr python=3.8 -y
conda activate business_card_ocr

# 2. Cài đặt PyTorch và CUDA 11.3
pip install torch==1.10.2+cu113 torchvision==0.11.3+cu113 -f https://download.pytorch.org/whl/cu113/torch_stable.html

# 3. Cài đặt các gói phụ thuộc
pip install opencv-python==4.5.5.64 vietocr==0.3.8 flask==2.0.3 gunicorn==20.1.0 albumentations==1.1.0

# 4. Tải trọng số tiền huấn luyện (Pre-trained Weights)
mkdir -p weights/
wget -O weights/pan_resnet18_vbc.pth https://github.com/uit-project/vbc-ocr/releases/download/v1.0/pan_resnet18_vbc.pth
wget -O weights/vgg_seq2seq_vietocr.pth https://github.com/uit-project/vbc-ocr/releases/download/v1.0/vgg_seq2seq.pth

# 5. Khởi chạy Web Server bằng Gunicorn
gunicorn --workers 2 --bind 0.0.0.0:8080 app:app

Tài liệu Endpoint API trích xuất:

  • URL: /api/v1/extract-business-card
  • Method: POST
  • Content-Type: multipart/form-data
  • Request Body: image (File ảnh định dạng JPG/PNG)
  • Response Format:
{
  "status": "success",
  "processing_time_ms": 1145,
  "data": {
    "name": "Nguyễn Tiến Dũng",
    "job_title": "Sales Manager",
    "company": "Công ty Cổ phần Sao Việt Ô tô",
    "mobile": "+84907992616",
    "email": "tiendungva@gmail.com",
    "address": "Số 113 Trương Công Định, P.14, Q. Tân Bình, TP. HCM"
  }
}

Hạn chế và hướng phát triển

Hạn chế kỹ thuật

  1. Chất lượng ảnh chụp kém: Khi ảnh bị lóa sáng mạnh (flash glare) trực tiếp lên bề mặt bóng của danh thiếp hoặc bị rung nhòe (motion blur), module phát hiện cạnh Hough và PAN có thể trích xuất thiếu các ký tự mảnh.
  2. Ký tự nghệ thuật phi chuẩn: Các danh thiếp thuộc ngành thiết kế đồ họa sử dụng chữ viết tay hoặc font chữ thư pháp cách điệu cực đoan vẫn gây nhầm lẫn ở khâu nhận diện ký tự (WAR giảm còn ~76%).
  3. Phân loại thực thể dựa trên quy tắc: Hệ thống hiện tại sử dụng Regex kết hợp Heuristic để phân loại trường thông tin sau khi nhận diện văn bản, dễ nhầm lẫn giữa tên công ty dài và địa chỉ nếu không có từ khóa nhận diện rõ ràng.

Hướng phát triển tiếp theo

  • Tích hợp mô hình học đa phương thức như LayoutLMv3 hoặc Donut để trích xuất và phân loại thực thể trực tiếp từ tọa độ 2D kết hợp hình ảnh và văn bản mà không cần viết luật Heuristic thủ công.
  • Tối ưu hóa mô hình bằng kỹ thuật Lượng tử hóa trọng số (INT8 Quantization) và TensorRT/ONNX Runtime, giúp giảm kích thước mô hình để triển khai mượt mà trên thiết bị biên di động (Edge Computing/iOS/Android) với tốc độ < 300ms.
  • Ứng dụng kỹ thuật Super-Resolution (ESRGAN) để tự động phục hồi các danh thiếp chụp mờ hoặc có độ phân giải thấp trước khi đưa vào pipeline xử lý.

Đối tượng hưởng lợi

  • Sinh viên và học viên ngành Khoa học máy tính: Sở hữu tài liệu tham khảo chi tiết từ lý thuyết đến thực nghiệm, nắm bắt cách kết hợp giữa xử lý ảnh cổ điển (FHT, Morphology) và học sâu hiện đại; có sẵn bộ dữ liệu VBC-583 để phát triển các đề tài mở rộng.
  • Kỹ sư AI và Lập trình viên: Nhận được thiết kế kiến trúc chuẩn mực và mã nguồn mẫu của pipeline Scene Text OCR tiếng Việt đã được tinh chỉnh tối ưu; tiết kiệm hàng trăm giờ nghiên cứu và thử nghiệm mô hình.
  • Doanh nghiệp và Khởi nghiệp: Sở hữu giải pháp công nghệ số hóa danh thiếp tự chủ, chi phí bản quyền 0 đồng, bảo đảm an toàn dữ liệu nội bộ và dễ dàng nhúng vào các giải pháp CRM/ERP sẵn có.
  • Cộng đồng nghiên cứu OCR tiếng Việt: Có thêm hệ thống đánh giá chuẩn đối sánh (benchmark) minh bạch giữa các kiến trúc hàng đầu (CRAFT, DB, PAN, AttentionOCR, TransformerOCR).

Câu hỏi thường gặp

1. Hệ thống có yêu cầu bắt buộc phải có card đồ họa GPU để chạy không?

Không bắt buộc. Pipeline có thể chạy hoàn toàn trên môi trường CPU tiêu chuẩn. Tuy nhiên, thời gian xử lý trung bình trên CPU sẽ dao động trong khoảng 2.5–3.2 giây/danh thiếp. Để đạt hiệu năng thời gian thực (Real-time ~1.15s), hệ thống được khuyến nghị triển khai trên môi trường có GPU hỗ trợ CUDA (chỉ cần tối thiểu 4GB VRAM).

2. Khi danh thiếp bị chụp xoay góc 90 hoặc 180 độ, hệ thống có tự nhận diện được không?

Có. Nhờ vào thuật toán Advanced Hough-based kết hợp phân tích phân bố cực đại Fast Hough Transform và module phân tích hướng dòng văn bản, hệ thống tự động xác định góc xoay chính và thực hiện phép biến đổi phối cảnh (Perspective Transform) đưa danh thiếp về chiều đọc chuẩn trước khi phát hiện chữ.

3. Làm thế nào để tích hợp API này vào phần mềm quản lý CRM hiện có của công ty?

Hệ thống cung cấp sẵn chuẩn giao tiếp RESTful API tiêu chuẩn. Bất kỳ ngôn ngữ lập trình nào (PHP, Java, C#, NodeJS, Python) đều có thể gửi ảnh danh thiếp qua HTTP POST Multipart Request và nhận về chuỗi JSON chứa đầy đủ các trường thông tin đã bóc tách để lưu trực tiếp vào cơ sở dữ liệu.

4. Nếu danh thiếp có cả tiếng Việt lẫn tiếng Anh đan xen thì hệ thống có đọc được không?

Hoàn toàn đọc chính xác. Bộ từ vựng (Vocabulary Dictionary) của mô hình VietOCR được thiết kế bao phủ toàn bộ bảng chữ cái Latin chuẩn cùng tất cả các tổ hợp nguyên âm có dấu của tiếng Việt, cho phép nhận dạng mượt mà các nội dung song ngữ Việt – Anh.

5. Chi phí ước tính khi triển khai giải pháp này so với mua API thương mại như thế nào?

Giải pháp giúp tiết kiệm hơn 85% tổng chi phí sở hữu (TCO). Thay vì phải trả phí từ 0.05$ – 0.10$ cho mỗi lượt gọi API thương mại của nước ngoài, doanh nghiệp chỉ cần đầu tư một máy chủ trung bình (hoặc VPS Cloud ~25$/tháng) là có thể xử lý không giới hạn hàng trăm nghìn danh thiếp mỗi tháng với toàn quyền kiểm soát dữ liệu.


Kết luận

Đồ án tốt nghiệp "Nghiên cứu và đánh giá một số phương pháp cho bài toán rút trích thông tin từ danh thiếp" đã giải quyết trọn vẹn bài toán tự động hóa số hóa danh thiếp tiếng Việt thông qua chuỗi xử lý thị giác máy tính đa tầng. Bằng việc xây dựng thành công tập dữ liệu chuẩn VBC-583 và tiến hành thực nghiệm đối sánh chuyên sâu trên 8 kiến trúc mô hình hàng đầu, công trình đã chứng minh tính ưu việt vượt trội của sự kết hợp giữa thuật toán hình học camera nâng cao, mạng nơ-ron phân đoạn điểm ảnh PAN và bộ giải mã ký tự chuỗi VietOCR-AttentionOCR.

Kết quả đạt được không chỉ mang giá trị học thuật cao với độ chính xác nhận diện từ đạt 93.5% và thời gian phản hồi 1.15 giây, mà còn cung cấp một sản phẩm ứng dụng có tính thực tiễn lớn, sẵn sàng tích hợp vào hạ tầng chuyển đổi số của các doanh nghiệp Việt Nam. Hướng phát triển tích hợp mô hình Document AI đa phương thức và tối ưu hóa biên (Edge AI) hứa hẹn sẽ tiếp tục nâng tầm giải pháp, đưa công nghệ nhận dạng ký tự tiếng Việt tiệm cận các chuẩn mực công nghệ cao nhất trên thế giới.