Tổng quan nghiên cứu

Theo ước tính của ngành công nghệ thông tin, hơn 80% dữ liệu doanh nghiệp tại Việt Nam vẫn đang tồn tại dưới dạng hồ sơ giấy hoặc các tệp tin hình ảnh phân tán, gây lãng phí tới 40% thời gian lao động thủ công của nhân viên văn phòng cho việc tìm kiếm và xử lý văn bản. Thực trạng nhập liệu truyền thống đòi hỏi chi phí nhân sự lớn, dễ xảy ra sai sót và đặc biệt gặp khó khăn khi tài liệu bị cũ mờ, ẩm mốc theo thời gian. Việc chỉ chuyển đổi định dạng tệp đơn thuần chưa giải quyết được bài toán quản trị tập trung, bảo mật và truy xuất dữ liệu theo ngữ cảnh. Luận văn tập trung thiết kế và hiện thực hóa một hệ thống số hóa hồ sơ doanh nghiệp toàn diện với kiến trúc dịch vụ phân tán, tích hợp công nghệ Nhận dạng ký tự quang học (OCR) và công cụ tìm kiếm toàn văn Elasticsearch nhằm tự động hóa quy trình quét, bóc tách và tra cứu văn bản. Nghiên cứu được thực hiện tại Trường Đại học Bách Khoa – Đại học Quốc gia Thành phố Hồ Chí Minh, hoàn thành vào tháng 1 năm 2023, với phạm vi ứng dụng thử nghiệm thực tế tại Công ty Cổ phần Thực phẩm Cholimex. Hệ thống được thiết kế hướng tới việc cắt giảm 70% thời gian nhập liệu thủ công, đáp ứng quy chuẩn trải nghiệm người dùng không quá 3 thao tác (3-clicks rule) và duy trì khả năng chịu tải ổn định cho tối thiểu 100 người dùng truy cập đồng thời trong cùng một thời điểm.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Mô hình phát triển phần mềm được xây dựng dựa trên mẫu thiết kế Model-View-Controller (MVC) kết hợp kiến trúc ứng dụng đơn trang (Single-page Application - SPA) và mô hình đa dịch vụ (Multi-service Architecture). Hệ thống phân tách rõ ràng tầng xử lý giao diện người dùng và tầng máy chủ trung tâm thông qua các chuẩn giao tiếp RESTful API trên nền tảng giao thức HTTP.

Ba khái niệm kỹ thuật cốt lõi định hình năng lực xử lý của hệ thống bao gồm:

Thứ nhất, Nhận dạng ký tự quang học (OCR) với trọng tâm là giải thuật bóc tách văn bản từ tệp ảnh hoặc PDF đa trang sang định dạng ký tự số hóa chuẩn. Nghiên cứu khai thác nền tảng VietOCR phát triển trên lõi Tesseract-OCR của Google, mang lại khả năng xử lý tiếng Việt có dấu với độ chuẩn xác cao.

Thứ hai, Công cụ tìm kiếm phân tán Elasticsearch vận hành trên cơ chế chỉ mục đảo (Inverted Index). Cấu trúc này chia nhỏ tài liệu thành các đơn vị Document và lưu trữ trên các Shard phân tán trong Cluster, cho phép thực thi đồng thời các truy vấn cấu trúc (Structured Search) và tìm kiếm toàn văn (Full-Text Search) ở quy mô hàng triệu bản ghi.

Thứ ba, Hàng đợi thông điệp RabbitMQ áp dụng cơ chế Work Queues và thuật toán điều phối Round-robin. RabbitMQ thiết lập thông số Message Durability và cơ chế phản hồi Message Acknowledgment với ngưỡng thời gian chờ mặc định 30 giây, giúp hệ thống không bị thất thoát thông điệp khi xảy ra sự cố ngắt kết nối mạng hoặc quá tải bộ xử lý. Ngoài ra, Redis đóng vai trò bộ nhớ đệm RAM tốc độ cao và MongoDB lưu trữ tài liệu phi quan hệ linh hoạt.

Phương pháp nghiên cứu

Nghiên cứu sử dụng phương pháp thực nghiệm kết hợp phát triển phần mềm theo quy trình tích hợp và chuyển giao liên tục (CI/CD). Nguồn dữ liệu kiểm thử được thu thập từ 500 bộ tài liệu thực tế bao gồm hóa đơn, hợp đồng thương mại, biên bản bàn giao và công văn hành chính lưu trữ qua các thời kỳ.

Phương pháp chọn mẫu là lấy mẫu ngẫu nhiên phân tầng dựa trên chất lượng tài liệu vật lý (tài liệu mới đạt chuẩn scan 300 DPI, tài liệu photo mờ độ phân giải 200 DPI và tài liệu lưu kho lâu năm có vết ố vàng). Cỡ mẫu 500 tài liệu được phân chia thành tập huấn luyện và kiểm thử nhằm đánh giá khách quan năng lực nhận dạng quang học.

Lý do lựa chọn phương pháp phân tích định lượng dựa trên thời gian đáp ứng (Response Time) và độ chính xác nhận dạng (Accuracy Rate) là vì hệ thống hướng tới môi trường doanh nghiệp thực tế, nơi hiệu năng bóc tách và tốc độ truy vấn là tiêu chuẩn then chốt. Quá trình kiểm thử tự động được thực hiện thông qua khung Jest Testing và kiểm tra cú pháp ESLint, kết nối trực tiếp với hệ thống thông báo trạng thái qua Telegram Bot nhằm giám sát chất lượng mã nguồn liên tục trong suốt tiến độ nghiên cứu kéo dài 6 tháng từ giữa năm 2022 đến đầu năm 2023.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình thử nghiệm và triển khai thực tế hệ thống đã ghi nhận 4 phát hiện kỹ thuật quan trọng mang tính đột phá:

Thứ nhất, mô hình nhận dạng VietOCR trên nền tảng Tesseract-OCR đạt độ chính xác nhận dạng ký tự tiếng Việt lên đến 95.8% đối với tài liệu quét chuẩn 300 DPI, vượt trội hơn mức 78.4% của mô hình PaddleOCR khi chưa được tinh chỉnh dữ liệu tiếng Việt chuyên sâu. Điều này giúp loại bỏ gần như hoàn toàn nhu cầu hiệu chỉnh thủ công sau khi quét.

Thứ hai, công cụ tìm kiếm Elasticsearch kết hợp cấu trúc Inverted Index đã giảm thời gian tìm kiếm tài liệu từ trung bình 15 giây khi tìm kiếm thủ công trong cơ sở dữ liệu quan hệ xuống còn dưới 0.22 giây cho một truy vấn toàn văn phức tạp, tăng tốc độ truy xuất thông tin lên hơn 98.5%.

Thứ ba, việc triển khai hàng đợi RabbitMQ với cơ chế Round-robin và phân phối tải Fair Dispatch đã đảm bảo khả năng xử lý song song 100 tác vụ bóc tách tài liệu cùng lúc mà không xảy ra tình trạng tràn bộ nhớ hay nghẽn cổ chai, giữ tỷ lệ thất thoát dữ liệu ở mức 0%.

Thứ tư, giao diện người dùng ReactJS kết hợp Redux Store và Agent quan sát thư mục máy in tự động hóa quy trình tải tệp qua cổng mạng nội bộ 5800, giúp giảm 65% số lần nhấp chuột và rút ngắn 75% tổng thời gian thực hiện thao tác tải tệp lên máy chủ so với các cổng thông tin truyền thống.

Thảo luận kết quả

Hiệu năng vượt trội của hệ thống xuất phát từ sự kết hợp chặt chẽ giữa kiến trúc phân tán Multi-service và cơ chế bất đồng bộ của NodeJS V8 Engine. Thay vì thực hiện xử lý tuần tự toàn bộ tệp tài liệu dung lượng lớn, dịch vụ split-service phân tách tệp PDF thành từng trang riêng biệt, giúp ocr-service xử lý song song trên nhiều worker trong cluster.

Khi dữ liệu thử nghiệm được mô tả qua bảng so sánh độ trễ giữa hệ thống truyền thống và kiến trúc mới, sự chênh lệch thể hiện rõ nét ở khả năng mở rộng. Trên biểu đồ phân phối thời gian phản hồi theo số lượng người dùng đồng thời từ 10 đến 100 người, đường biểu diễn của hệ thống sử dụng Redis và Elasticsearch duy trì độ trễ ổn định ở mức dưới 250 mili giây, trong khi phương thức truy vấn SQL truyền thống tăng vọt lên hơn 4500 mili giây khi vượt mốc 50 kết nối. Bảng thống kê tỷ lệ bóc tách quang học cũng chỉ rõ sự vượt trội khi độ phân giải đạt chuẩn 300 DPI với tỷ lệ nhận dạng thành công các ký tự có dấu phức tạp đạt mức 96.2%.

So sánh với các nghiên cứu trước đây vốn phụ thuộc vào các giải pháp phần mềm độc lập cài đặt cục bộ, hệ thống này tạo ra một hệ sinh thái khép kín từ máy quét ngoại vi đến kho lưu trữ đám mây. Việc đóng gói ứng dụng bằng Docker Container giải quyết triệt để rào cản tương thích môi trường trên các hệ điều hành khác nhau, mang lại tính linh hoạt cao trong ứng dụng thực tế.

Đề xuất và khuyến nghị

Dựa trên kết quả nghiên cứu và thực nghiệm tại doanh nghiệp, luận văn đề xuất 4 nhóm giải pháp kỹ thuật và vận hành cụ thể:

Thứ nhất, nâng cấp mô hình bóc tách dữ liệu thông minh bằng cách tích hợp mạng nơ-ron học sâu chuyên biệt cho tài liệu tiếng Việt cổ hoặc chữ viết tay. Ban công nghệ thông tin doanh nghiệp cần triển khai kế hoạch gắn nhãn dữ liệu bổ sung 10000 mẫu văn bản thực tế trong quý 2 năm 2023 nhằm nâng cao độ chính xác bóc tách tài liệu mờ lên trên 98%.

Thứ hai, tối ưu hóa hạ tầng phân tán và cân bằng tải tự động cho cụm máy chủ xử lý OCR. Đội ngũ kỹ sư hệ thống cần cấu hình mở rộng tự động (Auto-scaling) trên nền tảng Kubernetes cho ocr-service, đặt mục tiêu duy trì thời gian phản hồi dưới 2 giây cho các tệp PDF vượt quá 50 trang trong giai đoạn cao điểm cuối năm.

Thứ ba, ban hành quy trình chuẩn hóa số hóa tài liệu nội bộ và đào tạo nhân sự. Ban giám đốc doanh nghiệp cùng bộ phận văn thư cần áp dụng quy chuẩn quét tài liệu ở độ phân giải tối thiểu 300 DPI với định dạng màu Grayscale hoặc Black & White, đồng thời hoàn thành khóa tập huấn sử dụng giao diện web-client mới cho 100% nhân viên nhập liệu trong vòng 30 ngày kể từ khi bàn giao.

Thứ tư, tăng cường chính sách bảo mật và mã hóa dữ liệu đầu cuối. Nhóm quản trị hệ thống cần thiết lập phân quyền người dùng theo 3 cấp độ (đọc, ghi, xóa), mã hóa dữ liệu lưu trữ theo chuẩn AES-256 trên MongoDB và triển khai chứng chỉ SSL/TLS cho toàn bộ kết nối RESTful API trước tháng 6 năm 2023.

Đối tượng nên tham khảo luận văn

Luận văn mang lại giá trị học thuật và thực tiễn phong phú cho 4 nhóm đối tượng trọng tâm sau:

Thứ nhất, các nhà quản lý doanh nghiệp và giám đốc chuyển đổi số (CDO). Tài liệu cung cấp bức tranh toàn cảnh về mô hình chuyển đổi số hồ sơ thực tế, giúp doanh nghiệp tiết kiệm đến 50% ngân sách đầu tư ban đầu nhờ ứng dụng các giải pháp mã nguồn mở tối ưu thay vì mua bản quyền phần mềm đóng gói đắt đỏ.

Thứ hai, kỹ sư phần mềm và kiến trúc sư hệ thống. Người đọc có thể tham khảo thiết kế chi tiết về kiến trúc Multi-service, cách thức tích hợp Elasticsearch với cơ sở dữ liệu NoSQL MongoDB, cấu hình hàng đợi RabbitMQ và quy trình triển khai ứng dụng qua Docker Container với cổng kết nối 5800.

Thứ ba, nhà nghiên cứu và sinh viên ngành Khoa học máy tính, Công nghệ thông tin. Công trình là tài liệu tham khảo giá trị về kỹ thuật xử lý ảnh số, đánh giá so sánh giữa các công cụ OCR tiếng Việt (VietOCR, VnDOCR 4.0, PaddleOCR) và phương pháp xây dựng pipeline CI/CD tích hợp Jest testing cùng Telegram Bot.

Thứ tư, cán bộ văn thư lưu trữ tại các cơ quan hành chính nhà nước, bệnh viện, trường học. Nghiên cứu mang đến hướng dẫn trực quan để chuyển đổi kho tài liệu giấy hàng chục nghìn trang sang hệ thống số hóa tra cứu theo từ khóa, giúp rút ngắn thời gian tìm kiếm từ nhiều giờ xuống dưới 1 giây.

Câu hỏi thường gặp

Hệ thống xử lý như thế nào đối với các tài liệu scan bị nghiêng, mờ hoặc ố vàng? Hệ thống tích hợp mô-đun tiền xử lý ảnh trước khi đưa vào nhận dạng OCR, tự động căn chỉnh góc xoay và khử nhiễu nền. Thử nghiệm trên 500 mẫu tài liệu cho thấy tỷ lệ nhận dạng chính xác vẫn duy trì trên 88.5% đối với tài liệu cũ có độ phân giải 200 DPI.

Hàng đợi RabbitMQ đóng vai trò gì khi có hàng trăm tài liệu được quét cùng một lúc? RabbitMQ đóng vai trò điều phối thông điệp đệm, áp dụng thuật toán Round-robin và phân phối Fair Dispatch để chia đều các tác vụ bóc tách cho các worker trong cụm cluster. Cơ chế này ngăn ngừa quá tải bộ nhớ và đảm bảo 100% dữ liệu không bị thất lạc trong thời gian xử lý 30 giây mặc định.

Tại sao luận văn lại kết hợp Elasticsearch cùng với cơ sở dữ liệu MongoDB? MongoDB đảm nhận lưu trữ an toàn các tài liệu JSON và dữ liệu cấu trúc lớn, trong khi Elasticsearch chuyên trách đánh chỉ mục Inverted Index phục vụ tìm kiếm toàn văn. Sự kết hợp này tối ưu hóa tài nguyên máy chủ, giúp tốc độ phản hồi truy vấn đạt dưới 0.25 giây trên tập dữ liệu hàng chục nghìn văn bản.

Người dùng không am hiểu công nghệ có gặp khó khăn khi sử dụng giao diện web-client không? Giao diện được thiết kế trên ReactJS tuân thủ nghiêm ngặt nguyên tắc 3 cú nhấp chuột (3-clicks rule), đi kèm Agent tự động đồng bộ hóa thư mục máy in. Nhân viên chỉ cần quét tài liệu và hệ thống sẽ tự động đăng tải lên máy chủ mà không cần thực hiện thêm thao tác phức tạp nào.

Quy trình kiểm thử và triển khai tự động CI/CD trong luận văn được thiết lập ra sao? Luận văn xây dựng pipeline CI/CD tự động kiểm tra cú pháp với ESLint và kiểm thử chức năng bằng Jest testing cho 100% các hàm nghiệp vụ chính. Mọi kết quả thực thi thành công hay thất bại đều được bot tự động thông báo tức thời qua ứng dụng Telegram trong vòng chưa đầy 60 giây.

Kết luận

Luận văn đã hoàn thành xuất sắc các mục tiêu nghiên cứu và hiện thực hóa công nghệ số hóa hồ sơ doanh nghiệp thông qua 5 kết quả cốt lõi:

  • Xây dựng hoàn chỉnh kiến trúc phân tán Multi-service kết nối liền mạch giữa Agent máy khách và máy chủ trung tâm.
  • Tích hợp thành công VietOCR cho phép nhận dạng ký tự tiếng Việt với độ chính xác vượt 95% trên các tệp văn bản PDF đa trang.
  • Ứng dụng Elasticsearch thiết lập hệ thống tìm kiếm toàn văn tốc độ cao với độ trễ phản hồi dưới 0.25 giây.
  • Thiết kế giao diện ReactJS trực quan, tối ưu trải nghiệm người dùng theo tiêu chuẩn 3 cú nhấp chuột và tích hợp quản trị phân quyền đa cấp.
  • Đóng gói toàn bộ hệ thống bằng Docker Container và chuẩn hóa quy trình phát triển thông qua pipeline CI/CD kiểm thử tự động.

Đóng góp chính của công trình là giải quyết toàn diện bài toán từ thu thập, bóc tách, lưu trữ đến truy xuất tài liệu cho doanh nghiệp Việt Nam với chi phí tối ưu. Trong giai đoạn tiếp theo của năm 2023, hệ thống sẽ được mở rộng nghiên cứu mô hình bóc tách hóa đơn điện tử tự động và triển khai trên cụm máy chủ quy mô lớn. Hãy liên hệ tác giả hoặc bộ môn Khoa học Máy tính tại Trường Đại học Bách Khoa để cùng hợp tác phát triển và chuyển giao giải pháp chuyển đổi số này vào thực tiễn tổ chức của bạn.