Giới thiệu dự án

Trong kỷ nguyên công nghiệp 4.0 và tự động hóa dây chuyền sản xuất, việc kiểm soát chất lượng bao bì sản phẩm (Packaging Quality Control) đóng vai trò then chốt trong các ngành công nghiệp mũi nhọn như thực phẩm & đồ uống (F&B), dược phẩm và hóa mỹ phẩm. Theo thống kê từ Cục Quản lý Thực phẩm và Dược phẩm Hoa Kỳ (FDA), hơn 20% các vụ thu hồi sản phẩm đóng gói bắt nguồn từ lỗi in ấn thông tin nhãn mác, đặc biệt là ngày sản xuất (MFG - Manufacturing Date) và hạn sử dụng (EXP - Expiration Date). Việc sản phẩm lỗi lọt ra thị trường không chỉ gây nguy cơ nghiêm trọng đến sức khỏe người tiêu dùng mà còn khiến doanh nghiệp đối mặt với các khoản phạt pháp lý nặng nề và thiệt hại hàng triệu USD cho việc thu hồi sản phẩm.

Vấn đề cốt lõi trong thực tế sản xuất là máy in công nghiệp (như máy in phun liên tục - CIJ, máy in truyền nhiệt - TTO) thường xuyên gặp các sự cố kỹ thuật: nghẹt đầu phun, nhòe mực, dính vệt mực thừa, đứt nét ký tự hoặc lệch phôi in. Khi một ký tự ngày tháng bị in sai lệch hoặc mờ nhòe mà không được phát hiện kịp thời, toàn bộ lô hàng sản xuất hàng chục nghìn đơn vị có thể bị từ chối nhập kho và gửi trả lại. Phương pháp kiểm tra thủ công truyền thống bằng mắt thường (Manual Visual Inspection) bộc lộ hạn chế chí mạng: tốc độ chậm, phụ thuộc vào cảm tính, dễ mệt mỏi dẫn đến tỉ lệ bỏ sót lỗi (False Negative) lên tới 15–20% ở các ca làm việc kéo dài.

Nhằm giải quyết triệt để bài toán này, đề tài khóa luận tốt nghiệp "Hệ thống kiểm tra lỗi in bao bì sản phẩm dựa trên ký tự quang học" (Optical Character Recognition Based System for Checking Packaging Print Errors) do sinh viên Nguyễn Lê Thanh và Đinh Thị Diễm Sương thực hiện dưới sự hướng dẫn của TS. Đỗ Trọng Hợp tại Trường Đại học Công nghệ Thông tin – ĐHQG-HCM đã được nghiên cứu và phát triển.

+------------------+     +------------------+     +-------------------+
|  Ảnh Bao Bì Gốc  | --> | Giai Đoạn 1:     | --> | Vùng Chứa Date    |
|  (Input Image)   |     | Date Detection   |     | (Bbox Bounding)   |
+------------------+     | (YOLOv8 / PDet)  |     +-------------------+
                         +------------------+               |
                                                            v
+------------------+     +------------------+     +-------------------+
| Kết Quả Đánh Giá | <-- | Giai Đoạn 4:     | <-- | Giai Đoạn 2 & 3:  |
| Phân Loại OK/NG  |     | Logic So Khớp &  |     | OCR & Segment Lỗi |
| (Webcam/Web UI)  |     | Đưa Quyết Định   |     | (PP-OCR + U-Net)  |
+------------------+     +------------------+     +-------------------+

Mục tiêu cụ thể của dự án được xác định rõ ràng:

  1. Xây dựng module phát hiện vùng chứa thông tin hạn sử dụng (Date Detection): Tự động định vị chính xác tọa độ bounding box của cụm ngày tháng năm trên nhiều loại bề mặt bao bì phức tạp.
  2. Xây dựng module nhận diện ký tự quang học (OCR): Trích xuất và giải mã chính xác chuỗi ký tự ngày, tháng, năm, hỗ trợ 13 định dạng ngày tháng phổ biến trong công nghiệp sản xuất quốc tế.
  3. Xây dựng module phân đoạn lỗi in bề mặt (Defect Segmentation): Phát hiện và khoanh vùng các khuyết tật in ấn cục bộ như dính mực, lem mực, mất nét ở cấp độ pixel bằng Deep Learning.
  4. Tích hợp thành hệ thống kiểm tra trực quan thời gian thực (Real-time OCV System): Đóng gói toàn bộ luồng xử lý vào ứng dụng web kiểm tra tự động qua webcam/camera công nghiệp với độ trễ thấp và chi phí triển khai tối ưu cho doanh nghiệp vừa và nhỏ (SMEs).

Phương pháp tiếp cận của đề tài là xây dựng một framework 4 giai đoạn tuần tự khép kín, kết hợp sức mạnh của các kiến trúc mạng nơ-ron tích chập (Convolutional Neural Networks - CNN) và Transformer hiện đại nhất (SOTA). Kết quả đầu ra kỳ vọng của hệ thống là khả năng đưa ra quyết định kép: phân loại sản phẩm đạt chuẩn (OK) hay lỗi (NG - Not Good), đồng thời chỉ ra chính xác vị trí lỗi in và giá trị ngày tháng đã giải mã. Phạm vi nghiên cứu tập trung vào bao bì thực phẩm, đồ uống dạng chai, lon kim loại, hộp giấy và túi nhựa với các định dạng chữ in ma trận điểm (dot-matrix) và chữ in kỹ thuật số.


Phân tích và thiết kế giải pháp

Phân tích hiện trạng

Trên thị trường hiện nay, các giải pháp thị giác máy tính công nghiệp (Machine Vision) kiểm tra mã in và ký tự quang học chủ yếu được cung cấp bởi các tập đoàn lớn. Bảng phân tích so sánh dưới đây làm rõ ưu và nhược điểm của các hướng tiếp cận:

Tiêu chí Kiểm tra thủ công Hệ thống Cognex / VSTECH Giải pháp Đề xuất (AI-Based)
Công nghệ cốt lõi Mắt người & bảng mẫu Cảm biến quang học + Phần mềm OCV độc quyền Deep Learning đa tầng (YOLOv8 + PP-OCR + U-Net)
Tốc độ kiểm tra Rất chậm (1-2 sản phẩm/s) Rất nhanh (30-100 sản phẩm/s) Trung bình - Nhanh (5s/frame CPU, <100ms GPU)
Độ chính xác & Ổn định Thấp (suy giảm theo thời gian) Rất cao với điều kiện ánh sáng chuẩn Cao, thích ứng tốt với nền nhiễu & phông chữ lạ
Chi phí đầu tư Chi phí nhân công định kỳ Rất đắt ($15,000 - $40,000 bao gồm phần cứng) Rất thấp (hoạt động trên phần cứng máy tính & webcam phổ thông)
Khả năng tùy biến Không áp dụng Khó tùy biến, phụ thuộc nhà cung cấp Mã nguồn mở hoàn toàn, dễ dàng mở rộng định dạng date

Phân tích yêu cầu hệ thống theo mô hình phân loại MoSCoW:

  • Must Have (Bắt buộc có):
    • Phát hiện chính xác vùng chứa date trên ảnh bao bì đa kích thước.
    • Phân tích và nhận dạng đầy đủ 13 định dạng ngày tháng công nghiệp (DDMMYY, YYYYMMDD, MMMDDYYYY,...).
    • Khoanh vùng chính xác tọa độ điểm ảnh bị lỗi in dính mực/mất nét.
    • Đưa ra nhãn quyết định OK hoặc NG cho từng sản phẩm kiểm tra.
  • Should Have (Nên có):
    • Giao diện trực quan hiển thị bounding box phân tách màu sắc: Tím (Ngày), Xanh dương (Tháng), Xanh lá (Năm), Đỏ (Vị trí lỗi in).
    • Tối ưu hóa thời gian suy luận (Inference time) để vận hành được trên CPU tiêu chuẩn.
  • Could Have (Có thể có):
    • Hỗ trợ lưu trữ lịch sử kiểm tra và xuất báo cáo log thống kê tỉ lệ lỗi.
    • Khả năng tích hợp mở rộng giao tiếp PLC/băng chuyền qua giao thức TCP/IP.
  • Won't Have (Chưa thực hiện trong giai đoạn này):
    • Phần cứng cơ khí phân loại đẩy gạt sản phẩm tự động trên băng tải cao tốc.

Hệ thống phải vượt qua các thách thức kỹ thuật lớn: bề mặt vật liệu kim loại/nhựa gây lóa sáng (specular reflection), màu nền lon biến thiên làm giảm độ tương phản ký tự, khoảng cách in không đồng đều giữa các chữ số, và sự đa dạng phông chữ giữa các nhà sản xuất.

Thiết kế hệ thống

Kiến trúc tổng thể của hệ thống được thiết kế theo dạng Module hóa (Modular Architecture), đảm bảo tính độc lập và khả năng nâng cấp linh hoạt từng thành phần:

+-----------------------------------------------------------------------------------+
|                            HỆ THỐNG KIỂM TRA LỖI IN BAO BÌ                        |
+-----------------------------------------------------------------------------------+
|  [Module 1: Date Detection]                                                       |
|  - Input: Ảnh RGB gốc (Camera/Webcam) -> YOLOv8n / PaddleDetection (Faster R-CNN) |
|  - Output: Bounding Box tọa độ (x_min, y_min, x_max, y_max) vùng Date              |
+-----------------------------------------------------------------------------------+
                                          |
                                          v
+-----------------------------------------------------------------------------------+
|  [Module 2: Optical Character Recognition (OCR)]                                 |
|  - Text Detection: SAST Network / CRAFT (Nhận diện cụm Day, Month, Year)          |
|  - Text Recognition: VisionLAN / VietOCR Transformer (Trích xuất chuỗi ký tự)     |
|  - Date Parser Rule Engine: Chuẩn hóa và so khớp 13 định dạng ngày tháng          |
+-----------------------------------------------------------------------------------+
                                          |
                                          v
+-----------------------------------------------------------------------------------+
|  [Module 3: Defect Segmentation]                                                  |
|  - Mạng U-Net (ResNet-34 Backbone) / Mixed SegDecNet (Weakly-Supervised)          |
|  - Nhiệm vụ: Phân đoạn mặt nạ nhị phân (Binary Mask) phát hiện đốm mực/lỗi in     |
+-----------------------------------------------------------------------------------+
                                          |
                                          v
+-----------------------------------------------------------------------------------+
|  [Module 4: Decision & Presentation Layer]                                        |
|  - Logic Engine: So sánh (OCR Output == Master Data) && (Defect Mask == Empty)   |
|  - Output UI: Nhãn OK/NG + Tọa độ lỗi in + Hiển thị màu trực quan trên Web App    |
+-----------------------------------------------------------------------------------+

Danh mục công nghệ và phiên bản phần mềm (Technology Stack) được lựa chọn kỹ lưỡng:

  • Ngôn ngữ lập trình: Python 3.9
  • Deep Learning Frameworks: PyTorch 1.13.0+cu117, PaddlePaddle-GPU 2.4.2
  • Thư viện chuyên dụng:
    • PaddleOCR & PaddleDetection (v2.6): Triển khai mô hình SAST và VisionLAN.
    • Ultralytics YOLOv8 (v8.0.x): Phát hiện đối tượng tốc độ cao.
    • CRAFT-text-detector & VietOCR (v0.3.x): Pipeline phát hiện và nhận dạng ký tự tiếng Việt/ký tự Latin.
    • Segmentation Models PyTorch: Triển khai U-Net với pre-trained ResNet-34.
    • OpenCV (v4.7.0) & Pillow (v9.4.0): Tiền xử lý ma trận hình ảnh.
  • Giao diện & Triển khai: Web Dashboard tích hợp luồng video từ Webcam thời gian thực.

Yêu cầu an toàn và hiệu năng hệ thống:

  • Hệ thống hoạt động hoàn toàn offline tại môi trường biên (On-premise edge computing), đảm bảo an toàn thông tin sản xuất và không phụ thuộc đường truyền Internet.
  • Chuẩn hóa đầu vào video: Độ phân giải 720p (1280x720) với tần số lấy mẫu 30 FPS.

Methodology

Quy trình nghiên cứu và phát triển được tiến hành theo mô hình phát triển phần mềm lặp (Iterative Agile) kết hợp chuẩn mực kiểm thử ML/DL:

  • Milestone 1 (Tuần 1 - 3): Khảo sát lý thuyết, thu thập và xây dựng các bộ dữ liệu huấn luyện tổng hợp và thực tế (Products-Real, Products-Synth, Date-Synth, Date-Defect).
  • Milestone 2 (Tuần 4 - 7): Xây dựng, huấn luyện và đánh giá độc lập từng mô hình: Date Detection, Text OCR, Defect Segmentation.
  • Milestone 3 (Tuần 8 - 10): Tích hợp 3 Pipeline thử nghiệm tổng thể; đánh giá thời gian suy luận và độ chính xác tổng hợp.
  • Milestone 4 (Tuần 11 - 13): Lựa chọn pipeline tối ưu, thiết kế giao diện web kiểm tra OCV và đóng gói giải pháp.
  • Milestone 5 (Tuần 14): Kiểm thử toàn diện hệ thống với webcam thực tế và hoàn thiện báo cáo khóa luận.

Bảng đánh giá rủi ro kỹ thuật và giải pháp xử lý (Risk Assessment & Mitigation):

Rủi ro kỹ thuật Mức độ Biện pháp giảm thiểu
Thiếu dữ liệu lỗi in thực tế Cao Tự động sinh dữ liệu nhân tạo (Synthetic Data) và dùng công cụ tạo lỗi mực dính (Date-Defect) kết hợp dán nhãn CVAT
Lóa sáng bề mặt lon kim loại Trung bình Áp dụng kỹ thuật tiền xử lý cân bằng độ sáng, tăng cường dữ liệu biến đổi màu (Color Distort, Random Lighting)
Quá tải tài nguyên khi chạy 3 mô hình Cao Chuyển đổi mô hình sang các nhánh siêu nhẹ (Lightweight Head, SAST, VisionLAN 13.4MB), tối ưu hóa luồng suy luận

Implementation và kết quả

Development process

Quá trình tiền xử lý và chuẩn hóa nhãn dữ liệu là bước mang tính quyết định. Đối với tác vụ phát hiện vùng Date bằng YOLOv8, các tọa độ điểm ban đầu $(x_{min}, y_{min}, x_{max}, y_{max})$ từ bộ dữ liệu ExpDate được chuyển đổi sang chuẩn tọa độ tương đối $(x_{center}, y_{center}, w, h)$:

$$x = \frac{x_{min} + x_{max}}{2 \times W_{img}}, \quad y = \frac{y_{min} + y_{max}}{2 \times H_{img}}$$ $$width = \frac{x_{max} - x_{min}}{W_{img}}, \quad height = \frac{y_{max} - y_{min}}{H_{img}}$$

Đoạn mã tiền xử lý dữ liệu và cấu hình suy luận tích hợp được xây dựng chuẩn mực như sau:

import cv2
import numpy as np
import torch

def convert_bbox_to_yolo(xmin, ymin, xmax, ymax, img_w, img_h):
    """
    Chuyen doi toa do bounding box sang chuan YOLO format
    """
    x_center = (xmin + xmax) / (2.0 * img_w)
    y_center = (ymin + ymax) / (2.0 * img_h)
    width = (xmax - xmin) / float(img_w)
    height = (ymax - ymin) / float(img_h)
    return x_center, y_center, width, height

class OCVVerificationPipeline:
    def __init__(self, date_detector, ocr_engine, defect_segmenter):
        self.detector = date_detector
        self.ocr = ocr_engine
        self.segmenter = defect_segmenter

    def verify_product(self, frame, master_date_str):
        # Giai doan 1: Phat hien vung chua Date
        bbox = self.detector.predict(frame)
        if bbox is None:
            return "NG", {"error": "Date region not found", "coords": None}

        xmin, ymin, xmax, ymax = bbox
        date_crop = frame[ymin:ymax, xmin:xmax]

        # Giai doan 2: Nhan dien OCR cac cum ngay thang nam
        ocr_result = self.ocr.extract_text(date_crop)
        
        # Giai doan 3: Phat hien khuyet tat in bang U-Net
        defect_mask, defect_score = self.segmenter.segment(date_crop)
        has_defect = defect_score > 0.5

        # Giai doan 4: Logic danh gia quyet dinh
        is_date_correct = (ocr_result == master_date_str)
        if is_date_correct and not has_defect:
            status = "OK"
        else:
            status = "NG"

        return status, {
            "ocr_text": ocr_result,
            "has_defect": has_defect,
            "crop_coords": (xmin, ymin, xmax, ymax)
        }

Các siêu tham số (Hyperparameters) trong quá trình huấn luyện được thiết lập nghiêm ngặt:

  • YOLOv8: 70 Epochs, Learning rate $0.001$, Optimizer Adam, Batch size 16.
  • Mixed SegDecNet: 50 Epochs, Learning rate $1.0$, Optimizer Adam, Batch size 1.
  • PaddleOCR (SAST + VisionLAN): Pre-trained MobileNetV3 / VisionLAN backbone, Cosine Learning Rate Decay, Light Head optimization.

Testing và validation

Nghiên cứu sử dụng các bộ dữ liệu tiêu chuẩn kết hợp bộ dữ liệu tự tạo phục vụ kiểm thử:

  • Products-Real: 1,767 ảnh thực tế (1,102 ảnh train, 665 ảnh test) chụp từ các sản phẩm thực phẩm, đồ uống và dược phẩm trong điều kiện ánh sáng thực.
  • Products-Synth: 12,000 ảnh tổng hợp dùng để tăng cường khả năng tổng quát hóa của mô hình phát hiện đối tượng.
  • Date-Synth: 128,000 ảnh ngày tháng tổng hợp với đa dạng phông chữ, hỗ trợ đào tạo mạng tách DMY.
  • Date-Defect & PRDF: 1,767 ảnh bao gồm các mẫu lỗi in dính mực, mất nét được gán nhãn pixel mask qua công cụ CVAT.

Kết quả đánh giá từng mô hình độc lập qua các chỉ số mAP, Precision, Recall, F1-Score và AUC:

1. Đánh giá mô hình Phát hiện vùng Date (Date Detection)

Mô hình Precision Recall mAP@50 Thời gian huấn luyện Thời gian suy luận CPU
YOLOv8 0.9206 0.8501 0.9023 14 giờ 39 phút 182.1 ms
PaddleDetection (Faster R-CNN ResNet50) 0.9650 0.9580 0.9613 13 giờ 34 phút (tổng 6 fold) 450.0 ms

2. Đánh giá mô hình Nhận diện ký tự quang học (OCR)

Mô hình Nhiệm vụ Precision Recall F1-Score Dung lượng / Thời gian CPU
CRAFT + VietOCR Text Det + Rec 0.9364 (mAP) 0.8920 0.9136 Model nặng, 5h 22m train
PaddleOCR (SAST + VisionLAN) Text Det + Rec 0.8333 0.8333 0.8333 13.4 MB / 18 ms (VisionLAN)

3. Đánh giá mô hình Phát hiện lỗi in sai (Defect Segmentation)

Mô hình Chỉ số chính Precision Recall F1-Score Thời gian suy luận CPU
U-Net (ResNet-34 Backbone) IoU / F1 0.4435 0.6238 0.5184 20.0 ms
Mixed SegDecNet AUC = 0.5980, AP = 0.5412 0.5120 0.6380 0.5678 85.0 ms

Kết quả đạt được

Đề tài đã tiến hành tích hợp và thử nghiệm 3 Pipeline hoàn chỉnh để so sánh hiệu năng tổng thể trên phần cứng CPU tiêu chuẩn:

Cấu hình Pipeline Thành phần tích hợp Tổng thời gian suy luận (CPU) Đánh giá tính khả thi
Pipeline 1 YOLOv8 + (CRAFT + VietOCR) + U-Net ~10 giây / ảnh Chậm, tốn tài nguyên tính toán
Pipeline 2 (Được chọn) YOLOv8 + PaddleOCR + U-Net ~5 giây / ảnh Nhanh nhất, cân bằng tối ưu giữa độ chính xác và tốc độ
Pipeline 3 PaddleDet + PaddleOCR + Mixed SegDecNet ~15 giây / ảnh Quá nặng do kiến trúc SegDecNet phức tạp

Pipeline 2 (YOLOv8 + PaddleOCR + U-Net) chứng minh tính vượt trội khi rút ngắn thời gian xử lý xuống chỉ còn 5 giây trên CPU (và đạt dưới 80ms khi tăng tốc trên GPU NVIDIA T4/A100).

Hệ thống giao diện web đã được triển khai thành công, kết nối trực tiếp với webcam máy tính để kiểm tra sản phẩm thời gian thực. Hệ thống hiển thị trực quan:

  • Bounding box màu Tím: Vùng chứa Ngày (Day)
  • Bounding box màu Xanh dương: Vùng chứa Tháng (Month)
  • Bounding box màu Xanh lá: Vùng chứa Năm (Year)
  • Bounding box/Mask màu Đỏ: Khoanh vùng chính xác tọa độ vị trí lỗi in dính mực.
  • Bảng thông tin OCR Result & Error Coordinates hiển thị trực tiếp giá trị số và kết luận trạng thái OK/NG rõ ràng.

Đổi mới và đóng góp

Nghiên cứu mang lại những giá trị học thuật và ứng dụng thực tiễn đáng kể:

                  +----------------------------------------------+
                  |           ĐÓNG GÓP ĐỔI MỚI CỦA ĐỀ TÀI        |
                  +----------------------------------------------+
                                         |
     +-----------------------------------+-----------------------------------+
     |                                   |                                   |
     v                                   v                                   v
[Đổi Mới Kiến Trúc]             [Xử Lý Đa Định Dạng]            [Hiệu Quả Kinh Tế]
Kết hợp song song OCR ngữ       Bộ chuẩn hóa tự động 13          Giải pháp thuần phần mềm,
nghĩa và Phân đoạn khuyết       định dạng Date công nghiệp       giảm 90% chi phí đầu tư
tật pixel-level (U-Net).        (khắc phục nhập nhằng YYMMDD).   so với Cognex / VSTECH.
  • Đổi mới về kiến trúc tích hợp: Thay vì chỉ dựa vào kiểm tra ký tự quang học (OCR) đơn thuần hoặc xử lý ảnh hình thái học truyền thống (Morphological filtering), hệ thống kết hợp song song giữa việc nhận dạng ngữ nghĩa ký tự (Text Semantics) và phân đoạn khuyết tật bề mặt ở cấp độ điểm ảnh (Pixel-level Defect Segmentation). Điều này giúp phát hiện được cả những lỗi in vi mô (như đốm mực nhỏ làm mờ nét chữ) mà mô hình OCR thông thường có thể bỏ qua hoặc đoán mò sai lệch.
  • Xử lý triệt để 13 định dạng ngày tháng công nghiệp: Hệ thống xây dựng một hàm phân tích logic linh hoạt, giải quyết trọn vẹn bài toán nhập nhằng giữa ngày và năm (đặc biệt là định dạng YYMMDD quy ước chuyển về DDMMYY), cho phép nhận dạng chính xác kể cả khi phông chữ bị co giãn hoặc khoảng cách giữa các ký tự không đồng đều.
  • Tối ưu hóa hiệu năng vượt trội: Bằng việc tinh chỉnh và kết hợp các kiến trúc gọn nhẹ (YOLOv8 kết hợp SAST và VisionLAN 13.4MB), hệ thống giảm tới 66.7% thời gian xử lý so với Pipeline sử dụng SegDecNet (từ 15 giây xuống còn 5 giây trên CPU), mở ra khả năng triển khai thực tế trên các thiết bị máy tính công nghiệp giá rẻ.
  • Đóng góp bộ dữ liệu Date-Defect & PRDF: Xây dựng thành công bộ dữ liệu chuẩn hóa gồm 1,767 ảnh lỗi in dính mực với đầy đủ nhãn phân đoạn phân cấp, cung cấp tài nguyên quý giá cho cộng đồng nghiên cứu thị giác máy tính ứng dụng trong công nghiệp tại Việt Nam.

Ứng dụng thực tế và triển khai

Kịch bản ứng dụng thực tế (Real-world Use Cases)

  • Dây chuyền đóng gói thực phẩm & nước giải khát (F&B): Kiểm tra thông tin hạn sử dụng in dưới đáy lon nhôm, thân chai nhựa PET hoặc nhãn dán hộp sữa tươi với tốc độ cao.
  • Ngành dược phẩm đóng vỉ: Kiểm tra số lô sản xuất và hạn dùng dập nổi hoặc in mực trên vỉ thuốc tây, hộp thuốc y tế, đảm bảo 100% sản phẩm đạt tiêu chuẩn GMP-WHO trước khi xuất xưởng.
  • Nhà máy sản xuất bao bì & in ấn thương mại: Đóng vai trò là trạm kiểm soát chất lượng (QC Station) kiểm tra tờ in thành phẩm sau máy in phun, kịp thời cảnh báo khi đầu phun bị nghẹt mực.

Chiến lược triển khai và yêu cầu hệ thống

+---------------------+      HTTP POST / Frame       +-------------------------+
|  Camera / Webcam    | ---------------------------> |   FastAPI / TorchServe  |
|  (RTSP / USB 3.0)   | <--------------------------- |   (YOLOv8 + OCR + U-Net)|
+---------------------+       JSON Response:         +-------------------------+
                              {Status: OK/NG,                     |
                               Bbox: [...],                       v
                               Defect: [...]}        +-------------------------+
                                                     |   Web Dashboard Monitor |
                                                     |   (Real-time Visual UI) |
                                                     +-------------------------+

Yêu cầu cấu hình triển khai (System Requirements):

  • Phần cứng tối thiểu (Edge CPU): CPU Intel Core i5 thế hệ 8 trở lên (hoặc AMD Ryzen 5), 8GB RAM, Webcam HD 720p.
  • Phần cứng khuyến nghị (Tăng tốc thời gian thực): CPU Intel Core i7, 16GB RAM, GPU NVIDIA RTX 3060 12GB (hoặc NVIDIA Jetson Orin Nano cho thiết bị nhúng), Camera công nghiệp chuẩn GigE/USB 3.0.
  • Môi trường phần mềm: Ubuntu 20.04/22.04 LTS hoặc Windows 10/11 Pro, Docker Engine 24.0+, NVIDIA Container Toolkit.

Phân tích hiệu quả kinh tế (Cost-Benefit & ROI)

Một dây chuyền sản xuất quy mô vừa thông thường cần 2 nhân sự kiểm tra bao bì thủ công mỗi ca (tổng 4 nhân sự/ngày cho 2 ca), chi phí nhân công ước tính khoảng 240 - 320 triệu VNĐ/năm. Đầu tư một hệ sinh thái Vision đóng gói sẵn của nước ngoài (như Cognex) tiêu tốn từ 400 - 800 triệu VNĐ/dây chuyền.

Trong khi đó, giải pháp phần mềm AI đề xuất có thể tận dụng hạ tầng máy tính sẵn có, với tổng chi phí đầu tư ban đầu (bao gồm camera công nghiệp và máy tính trạm) chỉ dưới 30 - 50 triệu VNĐ. Doanh nghiệp có thể đạt điểm hòa vốn (ROI) trong vòng dưới 3 tháng vận hành, đồng thời loại bỏ hoàn toàn rủi ro bị phạt hoặc trả hàng do lỗi in ấn bao bì.


Hạn chế và hướng phát triển

Hạn chế kỹ thuật hiện tại

  • Độ trễ trên CPU: Thời gian xử lý ~5 giây/ảnh trên CPU đơn thuần chưa đáp ứng được yêu cầu của các băng chuyền siêu tốc (yêu cầu <50ms/sản phẩm). Để vận hành thời gian thực, hệ thống bắt buộc cần cấu hình GPU chuyên dụng.
  • Hiện tượng phản xạ ánh sáng: Độ chính xác của module Date Detection suy giảm nhẹ khi gặp bề mặt lon nhôm có độ bóng cao dưới ánh đèn huỳnh quang công nghiệp cường độ mạnh.
  • Bộ dữ liệu lỗi in nhân tạo: Bộ dữ liệu Date-Defect chủ yếu mô phỏng dạng lỗi dính mực/lem mực; các dạng lỗi vật lý khác như xước rách bao bì, mất ký tự ngẫu nhiên cần được bổ sung mẫu thực tế nhiều hơn.

Hướng phát triển trong tương lai

  • Tối ưu hóa mô hình với TensorRT & OpenVINO: Chuyển đổi toàn bộ pipeline sang định dạng ONNX và tối ưu lượng tử hóa FP16/INT8 qua TensorRT, nhằm đạt tốc độ suy luận dưới 30 ms/ảnh trên thiết bị nhúng NVIDIA Jetson.
  • Mở rộng kiến trúc mạng phát hiện lỗi: Nghiên cứu áp dụng các kiến trúc Vision Transformer (ViT) và mô hình phân đoạn nhanh như Fast Segment Anything (FastSAM) để nâng cao độ chính xác phân đoạn khuyết tật.
  • Tích hợp phần cứng điều khiển PLC: Lập trình giao tiếp tín hiệu I/O công nghiệp thông qua chuẩn Modbus TCP/IP, điều khiển trực tiếp tay gạt khí nén để tự động loại bỏ sản phẩm NG trên băng tải.

Đối tượng hưởng lợi

+---------------------------------------------------------------------------------------+
|                                  ĐỐI TƯỢNG HƯỞNG LỢI                                  |
+---------------------------------------------------------------------------------------+
|  [Sinh Viên & Người Học]     -> Tài liệu tham khảo toàn diện về tích hợp Multi-Model   |
|  [Kỹ Sư & Developers]        -> Pipeline mẫu tối ưu hóa OCR và Segmentation trong CV  |
|  [Doanh Nghiệp & Nhà Máy]    -> Giải pháp tự động hóa QC tiết kiệm 90% chi phí đầu tư  |
|  [Nhà Nghiên Cứu Học Thuật]  -> Bộ dữ liệu Date-Defect & Benchmark 13 định dạng Date   |
+---------------------------------------------------------------------------------------+
  • Sinh viên & Người học ngành CNTT/AI: Có được tài liệu tham khảo thực tế về quy trình xây dựng một hệ thống thị giác máy tính hoàn chỉnh từ khâu thu thập dữ liệu, gán nhãn, tiền xử lý, huấn luyện multi-model đến triển khai ứng dụng web trực quan.
  • Kỹ sư & Lập trình viên AI/Computer Vision: Nắm bắt kiến trúc tích hợp kết hợp giữa Object Detection (YOLOv8), Text OCR (PaddleOCR) và Defect Segmentation (U-Net), cùng mã nguồn xử lý định dạng hộp giới hạn và logic so khớp dữ liệu.
  • Doanh nghiệp sản xuất bao bì & SMEs: Tiếp cận một giải pháp công nghệ cao, khả thi, chi phí thấp, giúp nâng cao năng suất đóng gói, giảm thiểu chi phí nhân công kiểm thử và bảo vệ uy tín thương hiệu.
  • Các nhà nghiên cứu ứng dụng: Khai thác phương pháp kết hợp giám sát yếu và bán giám sát trong bài toán phân đoạn lỗi bề mặt công nghiệp, làm tiền đề phát triển các thuật toán OCV thế hệ mới.

Câu hỏi thường gặp

1. Yêu cầu phần cứng tối thiểu để triển khai hệ thống trong nhà máy là gì?

Để chạy thử nghiệm hoặc kiểm tra offline, hệ thống chỉ cần máy tính văn phòng trang bị CPU Intel Core i5 (hoặc tương đương), 8GB RAM và webcam chuẩn HD 720p. Đối với dây chuyền sản xuất công nghiệp yêu cầu kiểm tra liên tục thời gian thực (Real-time Inline Inspection), khuyến nghị sử dụng máy tính nhúng công nghiệp trang bị GPU tối thiểu như NVIDIA GTX 1650 / RTX 3050 hoặc bo mạch nhúng NVIDIA Jetson Orin Nano, kết hợp camera công nghiệp giao tiếp GigE để đảm bảo độ trễ suy luận dưới 100ms.

2. Hệ thống xử lý như thế nào khi bao bì bị xoay nghiêng hoặc ngược hướng?

Module PaddleOCR tích hợp sẵn một mạng phân loại hướng văn bản (Text Direction Classifier) siêu nhẹ. Khi vùng Date được cắt ra từ YOLOv8, bộ phân loại hướng sẽ tự động xác định góc xoay (0 độ, 90 độ, 180 độ, 270 độ) và xoay ảnh về chiều chuẩn nằm ngang trước khi đưa vào mô hình nhận dạng ký tự (VisionLAN), đảm bảo hệ thống nhận diện chính xác mà không phụ thuộc vào góc đặt sản phẩm trên băng chuyền.

3. Làm thế nào để tích hợp hệ thống với cơ sở dữ liệu sản xuất (MES/ERP) sẵn có?

Hệ thống được thiết kế theo kiến trúc hướng dịch vụ (Service-Oriented Architecture). Module kiểm tra cung cấp các cổng API chuẩn RESTful (thông qua FastAPI/Flask). Trước mỗi ca sản xuất, hệ thống nhận mã định danh lô hàng (Batch Code) và giá trị Master Date từ hệ thống quản lý điều hành sản xuất (MES). Quá trình kiểm tra OCV sẽ tự động so khớp chuỗi ký tự nhận diện với dữ liệu gốc này và gửi kết quả log dạng JSON lưu trữ trực tiếp vào cơ sở dữ liệu trung tâm.

4. Hệ thống có phát hiện được lỗi in khi phông chữ bị đứt nét hoặc mất hẳn một chữ số không?

Có. Hệ thống sở hữu cơ chế bảo vệ kép:

  1. Nếu một chữ số bị mất hoặc đứt nét nghiêm trọng dẫn đến việc giải mã sai chuỗi ngày tháng (ví dụ: ngày 29 bị đọc thành 2 hoặc 2.), chuỗi kết quả OCR sẽ không khớp với dữ liệu gốc -> Đánh giá NG.
  2. Nếu ký tự bị đứt nét nhưng OCR vẫn nhận diện được theo xác suất, mô hình phân đoạn U-Net với ngưỡng nhạy cao sẽ phát hiện sự bất thường về mật độ điểm ảnh/hình thái ký tự -> Gán nhãn lỗi và đánh giá NG.

5. Chi phí bảo trì và nâng cấp thuật toán cho sản phẩm mới như thế nào?

Nhờ cấu trúc module độc lập, khi doanh nghiệp bổ sung mẫu bao bì mới hoặc thay đổi phông chữ in, kỹ sư chỉ cần thu thập thêm 100-200 mẫu ảnh sản phẩm mới và tiến hành Fine-tuning (tinh chỉnh) lại mô hình YOLOv8 hoặc U-Net trong vòng 1-2 giờ mà không cần lập trình lại toàn bộ hệ thống. Chi phí duy trì phần mềm định kỳ gần như bằng không do hệ thống hoàn toàn dựa trên các nền tảng mã nguồn mở chuẩn công nghiệp.


Kết luận

Khóa luận tốt nghiệp "Hệ thống kiểm tra lỗi in bao bì sản phẩm dựa trên ký tự quang học" của nhóm tác giả Nguyễn Lê Thanh và Đinh Thị Diễm Sương (Đại học Công nghệ Thông tin - ĐHQG-HCM) đã giải quyết thành công một bài toán mang tính thời sự và cấp thiết trong tự động hóa công nghiệp. Bằng việc đề xuất và hiện thực hóa pipeline tối ưu kết hợp YOLOv8 + PaddleOCR (SAST & VisionLAN) + U-Net, nghiên cứu đã chứng minh tính khả thi vượt trội trong việc tự động phát hiện, nhận dạng chuẩn xác 13 định dạng ngày tháng và khoanh vùng khuyết tật in ấn bao bì với độ tin cậy cao.

Giải pháp mở ra hướng đi đầy tiềm năng cho các doanh nghiệp vừa và nhỏ tại Việt Nam trong việc tiếp cận công nghệ thị giác máy tính tiên tiến với chi phí đầu tư chỉ bằng một phần nhỏ so với các hệ thống ngoại nhập đắt đỏ.

Bạn đang tìm kiếm giải pháp nâng cấp dây chuyền kiểm soát chất lượng bao bì hoặc muốn tham khảo chi tiết kiến trúc mã nguồn và bộ dữ liệu nghiên cứu? Hãy kết nối với cộng đồng nghiên cứu Trí tuệ Nhân tạo và Thị giác Máy tính tại Trường Đại học Công nghệ Thông tin - ĐHQG-HCM để cùng trao đổi, phát triển và chuyển giao công nghệ vào thực tiễn sản xuất!