Chương 1. Mục tiêu đề tài 1. Mục tiêu tổng quan Thực hiện tìm hiểu, nghiên cứu các mô hình, công cụ áp dụng trong xứ lý hình ảnh: với mục đích phát triển mô hình máy học hiện tại có với khả năng xử lý, rút trích thông tin từ hóa đơn thanh toán. Từ đó cải thiện độ chính xác và hiệu suất.
Xây dựng ứng dụng: hiện thực ứng dụng tự động hóa thực hiện hiện xử lý và rút trích thông tin từ hóa đơn thanh toán hiệu quả. Mục tiêu cụ thể © _ Thực hiện nghiên cứu các công nghệ liên quan tới trích xuất thông tin từ hình ảnh, cụ thể là thông tin từ hình ảnh hóa đơn thanh toán. e Tìm hiểu mô hình máy học YOLO trong việc phát hiện đối tượng chứa thông tin từ ảnh hóa đơn thanh toán [6, 7]. Về tốc độ, YOLO - một trong những mô hình nhanh nhất hiện nay cho việc phát hiện đối tượng, với cấu trúc đơn giản và dễ triển khai.
Mặt khác, so sánh với các mô hình tương tự, việc ứng dụng phát hiện nhiều đối tượng đồng thời và có kích thước nhỏ trên ảnh có hiệu suất tốt hơn. Có thể YOLO cho. thấy độ chính xác, hiệu suất không quá ưu việt nhưng YOLO cho thấy độ hài hòa giữa tốc độ và độ chính xác trong ứng dụng thời gian thực, với việc phát hiện đối tượng trong một lần quét qua ảnh [6]. e Phương pháp rút trích văn bản hiệu qua Scene Text Recognition (STR) [5].
Với mục đích rút trích các nội dung chính trên hóa đơn như: tên của tổ chức, ngày, địa chỉ, mã số hóa đơn, tổng tiền, thông tin chỉ tiết các mặt hàng. Giới hạn phạm vi dé tài là thực hiện việc rút trích thông tin trên ảnh chụp hóa đơn có định dạng theo tiêu chuẩn được in từ máy tính tiền. Tập dữ liệu ảnh chụp các hóa đơn được in từ máy tính tiền SROIE (Scanned Receipts OCR and Information Extraction). ¢ _ Nghiên cứu phương pháp, kỹ thuật với mục đích kết hợp mô hình máy học YOLO và Tesseract OCR với mục đích đảm tăng cường độ chính xác trong việc rút trích thông tin.
e Xử lý tập dữ liệu: o_ Tiền xử lý dữ liệu nhằm phù hợp cho việc huấn luyện mô hình. Tổng quan o Tập dữ liệu sau đó được phân chia cho việc huấn luyện, thấm định va kiểm thử. Thực nghiệm và tiến hành đánh giá mô hình với các tiêu chí bao gồm: sự chính xác (accuracy), độ chính xác (precision), độ phủ (recall), Fl-score, và hiệu suất của mô hình xây dựng. Nghiên cứu và hiện thực ứng dụng thực nghiệm cho việc rút trích dữ liệu từ hình ảnh của hóa đơn thanh toán.
Đối tượng và phạm vi đề tài 1. Đối tượng nghiên cứu Nghiên cứu các mô hình máy học YOLO cho việc phát hiện vùng thông tin từ hóa đơn thanh toán, cùng với phương pháp phục vụ cho xử lý hình ảnh và rút trích văn bản hiệu quả Tesseract. Giới hạn đề tài Trong bối cảnh thời gian có giới hạn, việc hiện thực hệ thống hoàn thành các tiêu chí dé ra song trong quá trình phát triển, nhưng vẫn còn một vài hạn chế cần được tiếp tục phát triển. Phương pháp thực hiện Tìm hiểu bài toán, các nghiên cứu và công nghệ có liên quan.
Tìm hiểu và áp dụng các công cụ xử lý ảnh, mô hình máy học YOLO và Tesseract OCR. Thuc hiện đánh giá và chon mô hình tối ưu. Kết hợp mô hình máy học YOLOv8 (phát hiện các vùng thông tin) và công cụ trích xuất ký tự quang học Tesseract OCR (trích xuất nội dung). Phân tích thiết kế hệ thống.
Xây dựng ứng dụng, thực nghiệm và đánh giá. Ý nghĩa của đề tài Tinh ứng dụng: Triển khai ứng dụng này đóng góp vào việc giảm thiéu thời gian, nguồn lực cho quá trình xử lý hóa đơn giúp cá nhân, tổ chức doanh nghiệp cân nhắc với việc tối ưu hóa quản lý tài chính. Tính khoa học: Không chỉ nghiên cứu trên các mô hình, công nghệ hiện tại mà còn từ đó hiện thực phương pháp, khả năng ứng dụng, kết hợp của các mô hình máy học và công cụ liên quan. Tính cấp thiết: Với thị trường cạnh tranh, giảm thời gian xử lý rút trích thông tin từ hóa đơn thanh toán là cấp thiết với mục đích tăng hiệu suất và giảm thiểu sai sot.
Tính mới: Đề tài này tiếp cận bài toán từ một góc độ mới, kết hop mô hình máy học cho tác vụ phát hiện va công nghệ trích xuất thông tin quang học. Các nghiên cứu và công nghệ liên quan Chương 2 CÁC NGHIÊN CỨU VÀ CÔNG NGHỆ LIÊN QUAN Trong chương nay, tổng quan về những nghiên cứu hiện tại trên thé giới và tại Việt Nam. Cung cấp cái nhìn chỉ tiết liên quan tới tiến bộ công nghệ và nghiên cứu được vận dụng nhằm quyết những thách thức, từ đó định hình nền tảng lý thuyết và hướng tiếp cận mà đề tài này sẽ theo đuổi. Xu hướng và các công nghệ nghiên cứu trên thế giới Xử lý hóa đơn vẫn là vấn đề quan trọng và đầy thách thức, khó khăn trong việc xử lý thủ công do mắt nhiều thời giờ và dễ mắc phải lỗi.
Phần lớn các đội ngũ kế toán gặp phải sự chậm trễ liên quan tới quy trình không hiệu quả. Mặt khác, Công nghệ OCR truyền thống không hiệu quả với các hóa đơn phức tạp và đa dạng về định dạng. OCR hữu ích cho các tài liệu đồng nhất nhưng không linh hoạt cho các loại hóa đơn khác nhau [16]. Các nghiên cứu đây vận dung trí tuệ nhân tạo cho xử lý rút trích thông tin từ hóa đơn [17].
Các mô hình máy học, học sâu được phát triển và ứng dụng phổ biến. Trong đó, YOLO đã được biến đổi qua nhiều phiên bản, từ YOLOv1 đến YOLOv8 mới nhất, cho thấy sự ưu viét về tô. Cùng với đó, công nghệ OCR, đặc biệt là Tesseract, được cải tiên xử lý nhằm đáp ứng các thách thức như chất lượng hình ảnh kém và phông nền phức tạp [4, 5]. Xu hướng và các công nghệ nghiên cứu tại Việt Nam Các nghiên cứu đây mạnh việc tùy chỉnh và cải thiện các công nghệ nhằm phục vụ cho đặc thù thị của trường nội địa.
Các thách thức chính bao gồm việc xử lý hóa đơn với nhiều kiểu chữ và ngôn ngữ khác nhau, cũng như các định dạng hóa đơn không chuẩn. Nghiên cứu và phát triển giải pháp với mục đích tích hợp với hệ thong hiện hành của tốt chức, qua đó cải thiện hiệu suất xử lý trong công việc [1, 2]. Các nghiên cứu và công nghệ liên quan 2. Cơ sở lý thuyết và hướng tiếp cận đề tài 2.
Bài toán Scene Text Recognition Nhận dạng văn bản trong cảnh (Scene Text Recognition - STR) là một lĩnh vực nghiên cứu quan trọng trong thị giác máy tính và xử lý ngôn ngữ tự nhiên. Nhiệm vụ chính của STR là trích xuất và nhận dang văn ban xuất hiện trong hình ảnh chụp tir môi trường thực tế như biển quảng cáo, tạp chí, biển số xe, các tài liệu giấy tờ [18]. Các phương pháp truyền thống làm rõ và tách biệt văn bản khỏi nền, bao gồm các giai đoạn: ©_ Lọc và ngưỡng: Chuyên đồi hình ảnh sang dạng nhị phân dé phân đoạn văn bản ra khỏi nên. e Phat hiện cạnh: Sử dụng các bộ lọc như Sobel hoặc Canny để tìm kiếm các cạnh của ký tự trong hình ảnh.
© - Xác định vùng quan tâm (ROI): xác định các vùng có khả năng chứa văn bản trước khi áp dụng OCR bằng kỹ thuật nhận dạng mẫu. Các mô hình học sâu đã chứng minh hiệu quả vượt trội nhờ khả năng học đặc trưng mạnh mẽ và khả năng tông quát hóa tốt, bao gồm: ® YOLO: Phát hiện các vùng chứa văn bản chính xác và nhanh chóng. ¢ Tesseract OCR: Trích xuất văn ban từ các vùng đã được phát hiện. Việc kết hợp mô hình học sâu với OCR mang lại độ chính xác cao, cũng như việc hiệu suất được cải thiện: ¢ D6 chính xác: Giúp phát hiện chính xác các vùng văn bản, giảm nhiễu và cải thiện chất lượng đầu vào cho OCR.
© _ Hiệu suất: Tăng tốc độ xử lý và giảm lỗi nhận dạng. ° Ứng dụng thực tế: Có thể áp dụng trong nhiều lĩnh vực như nhận dạng biển số xe, tự động hóa kiểm tra tài liệu và trích xuất thông tin từ biển quảng cáo. Một số hạn chế: © D6 phức tạp: Kết hợp nhiều mô hình làm tăng độ phức tạp của hệ thống. Các nghiên cứu và công nghệ liên quan e _ Yêu cầu tài nguyên: Mô hình học sâu yêu cầu phần cứng mạnh và thời gian đào tạo dài.
e _ Xử lý trường hợp khó: Văn bản mờ, cong vênh hoặc có nền phức tạp vẫn là thách thức lớn. Sử dụng mô hình học sâu kết hợp với OCR mang lại kết quả ấn tượng trong nhận dạng văn bản trong cảnh, mở ra nhiều cơ hội ứng dụng thực tế. Tuy nhiên, vẫn còn nhiều thách thức cần giải quyết và hướng phát triển dé cải thiện và mở rộng công nghệ này. Các mô hình máy học cho việc phát hiện đối tượng Trong lĩnh vực máy học phát hiện đối tượng hiện nay, hai mô hình nổi bật là Faster R-CNN và YOLO, đại diện cho hai kiểu mô hình tiêu biểu, trong đó Faster R- CNN thuộc loại nhận diện hai bước (two-stage detection), trong khi YOLO là nhận điện một bước (one-stage detection).
Mặc dù Faster R-CNN đạt độ chính xác cao hơn một chút. Tuy nhiên, sự phức tạp trong việc suy luận do phải qua hai giai đoạn phức tạp [15]. Trong khi đó, YOLO, với cấu trúc đơn giản hơn, có thể phát hiện đối tượng chỉ với một lần quét. YOLO không chỉ nhanh mà còn hài hòa được tốc độ và độ chính xác, nhờ thế nên ưu tiên được lựa chọn cho các ứng dụng cần phản hồi thời gian thực [15].
Do đó, lựa chọn YOLO cho nghiên cứu này với nhiệm vụ phát hiện đối tượng. YOLO là mô hình tiên phong trong lĩnh vực phát hiện đối tượng. YOLO đặc biệt nồi bật với tốc độ cao trong thời gian thực bằng cách chỉ xem qua một lần toàn bộ hình ảnh dé dự đoán cùng lúc vị trí cộng với việc phân loại các đối tượng [6, 7]. YOLOvIl, ra mắt vào năm 201 5, đã đưa ra khái niệm phát hiện đối tượng theo.
kiêu hội tụ với việc dùng một mạng thần kinh (neural) duy nhất nhằm thực hiện dự đoán cùng lúc nhiều hộp giới hạn (bounding box) và xác suất cho mỗi hộp, thay vì dùng các hệ thống gợi ý vùng như các mô hình trước đó. Điều này làm giảm đáng kể độ phức tạp trong các hệ thông phát hiện đối tượng và tăng cường tốc độ.