MỞ ĐẦU 1.1 Đặt van đề Văn bản là phương tiện để con người lưu trữ thông tin và trong cuộc cách mạng 4.0 khối lượng lưu trữ trên internet của loại dữ liệu này đã tăng trưởng rất mạnh. Văn bản được lưu trữ với rất nhiều định dạng khác nhau, và chúng là loại dữ liệu không có cau trúc nên việc số hoá loại dữ liệu này tốn rất nhiều chi phí, tài nguyên cũng như nhân lực. Chính vì vậy các nhà nghiên cứu cũng như các doanh nghiệp, công ty công nghệ hàng đầu đang cố gắng tìm cách tự động hoá quá trình trên và hệ thống Trích xuất thông tin quan trọng từ hình ảnh văn bản đã được ra đời để phục vụ mục đích này. Mô tả bài toán trích xuất thông tin từ hình ảnh văn bản: « Ta sẽ định nghĩa trước các trường thông tin mà ta cần rút trích (information field) « Đầu vào bài toán: là ảnh văn bản mà ta muốn rút trích thông tin (Hình 1.1) * Đầu ra của bài toán: là các trường thông tin mà ta cần rút trích trong ảnh (Hình 1.
Mở dau gửi về Ban KH&CN — ĐHQG-HCM, phường Lin Văn bản gópý của Quý đơn vị gửi về Ban KH&CN — ĐHQG-HCM, phường Linh thoại 0837 242 16 hoại 0837 243 160 hủ Đức; điện edu.vn trước ngày 09/11/2021 đi (Thứ. Ba) trước ngây 09/11/2021 (Thi la) ơn sự quan tim và phối hợp thực hiện của Quy đơn vị Trân trọng cám om sự quan tâm và phối hợp thực hiện của Quý đơn Xi nhịn TL. GIÁM ĐÓC Noi nhan TL. GIAM BOC Nhớ tên TRUONG BAN BAN KH&CN TRƯỜNG BAN BAN KH&CN Oe @ 1y #/Á / aif › = REF Tâm Quảng Vinh A ) , Thông ` ` thu được Hình 1.1: Ví dụ về hình ảnh đầu vào (Trái) và kết quả trả về (Phải) Dựa trên sự hiểu biết có hạn của nhóm trong thời gian khảo sát, nhóm nhận thấy việc xử lý rút trích thông tin quan trọng từ hình ảnh văn bản tiếng Việt hiện tại ở Việt Nam không có nhiều công bố khoa học.
Hiện nay có một số dịch vụ nổi bật của nước ngoài đã được triển khai để giải quyết bài toán này như SAP!, ở Việt Nam thì có computervision.vn’, tuy nhiên các dịch vụ này đều là dịch vụ thương mại và công nghệ sử dụng trong đó vẫn là một hộp đen mà người ngoài không biết được. Để giảm bớt chi phí sử dụng, nắm bắt công nghệ, và góp một phần sức lực cho việc số hóa văn bản của trường Đại học Công nghệ Thông tin. Nhóm đã quyết định nghiên cứu và xây dựng hệ thống trích xuất thông tin văn bản. Hệ thống tập trung giải quyết việc rút trích thông tin từ các văn bản được scan, hoặc ảnh chụp văn bản chính diện.
Với hệ thống này, chúng ta có thể rút trích các thông tin mà ta mong muốn trong hình ảnh. Việc này sẽ làm giảm bớt sức lao động của con người, tự động hóa được quá trình số hóa văn bản nhằm 'https://www.com/solutions/44901/Document-Information-Extraction/ ?https://demo.vn/ocr/?type=hoa-don-full > 1. Mở dau phục vụ cho các mục đích lưu trữ, truy vấn, quản lý được dễ dàng hơn. Những năm gan đây, lượng dif liệu xuất hiện trên internet ngày càng nhiễu, điều này góp phần cho học sâu (deep learning - DL) phát triển nhanh chóng và dần trở thành một xu hướng với tốc độ tính toán cũng như độ chính xác ngày càng được cải tiến.
Các phương pháp và thuật toán áp dung DL đa số đều đạt được kết quả tốt hơn so với phương pháp tiếp cận sử dụng đặc trưng chuyên gia (hand-crafted feature). Chính vì thế mà hướng tiếp cận DL được cộng đồng nghiên cứu rất quan tâm. Cho nên trong quá trình nghiên cứu phát triển DL, số lượng các thuật toán, phương pháp từ đó xuất hiện ngày càng phong phú và đa dạng. Để biết được đâu là thuật toán phù hợp với mục đích sử dụng trong hệ thống này, nhóm đã tiền hành khảo sát đánh giá trên nhiều phương pháp để chọn ra phương pháp phù hợp nhất cho từng bước.
Từ đó áp dụng các phương pháp này xây dựng nên hệ thống. Thách thức: » Về dữ liệu: — Quá trình rút trích thông tin sẽ có một số trường thông tin bị nhập nhằng với nhau gây ra khó khăn cho các mô hình học sâu về rút trích thông tin. — Các văn bản hành chính ở trường Dai học Công nghệ Thông tin thường rất đa dạng về cách trình bày, kiểu chữ, và vì là dữ liệu trên giấy in và được quét sau đó đưa lên mạng nên chất lượng hình ảnh của các văn bản mà nhóm có được là tương đối thấp, gây rất nhiều khó khăn cho việc gán nhãn, huấn luyện cũng như là chạy thử các mô hình của nhóm. — Các dữ liệu dưới dạng văn bản hành chính thường có nền khá phức tạp khi các dấu mộc hiện nay được đóng trực tiếp và đè lên các nội > 1.
Mở dau dung khác bên trong văn bản. — Trong các văn bản hành chính của trường Đại học Công nghệ Thông tin không chỉ có những ký tự chữ in đánh máy mà còn có rất nhiều chữ viết tay. * Về phương pháp: - Luồng xử lý của hệ thống rút trích thông tin từ hình ảnh văn bản thường được phân thành ba mô-đun chính là phát hiện văn bản, nhận diện và cuối cùng là rút trích thông tin, với mỗi mô-đun sẽ có rất nhiều các phương pháp và mô hình cần phải tìm hiểu, thử nghiệm và đánh giá. Chính vì vậy việc cân bằng giữa thời gian xử lý cũng như là độ chính xác cũng là một thách thức lớn đối với hệ thống.
« VỀ tài nguyên: — Các mô hình cũng như là phương pháp phục vụ cho bài toán rút trích thông tin từ văn bản thường là những mô hình học sâu, chính vì vậy chúng đòi hỏi một lượng tài nguyên về phần cứng đủ lớn để có thể huấn luyện, đánh giá và triển khai thành một ứng dụng thức tế.2 Mục tiêu và phạm vi 1.21 Mục tiêu Nhóm tập trung giải quyết bài toán rút trích thông tin trong hình ảnh. Để hoàn thành công việc, nhóm đã dé ra mục tiêu cụ thé sau: « Tìm hiểu tổng quan về bài toán trích xuất thông tin từ hình ảnh văn bản, các hướng tiếp cận. Mở dau « Xây dựng bộ dữ liệu phục vụ cho việc trích xuất thông tin văn bản tiếng Việt. « Thử nghiệm các phương pháp tiên tiến cho bài toán rút trích thông tin từ văn bản.
» Xây dựng một hệ thống hỗ trợ việc rút trích thông tin từ văn bản tiếng Việt.2 Phạm vi Trong khuôn khổ giới hạn của khóa luận, nhóm tập trung thực hiện hoàn thành các công việc sau: * Tìm hiểu tổng quan về bài toán trích xuất thông tin từ hình ảnh văn bản, các hướng tiếp cận. « Xây dựng bộ dữ liệu tiếng Việt về văn bản hành chính của trường Dai học Công nghệ Thông tin. ¢ Thử nghiệm các phương pháp PANet[1], FCENet[2], DGGR[3] cho qua trình phát hiện dòng văn bản, VietOCR!, STARNet[4] cho quá trình nhận diện dòng văn bản, SDMGR[6], PICK[5] cho quá trình trích xuất thông tin từ văn bản trên tập dữ liệu tiếng Việt được xây dựng. » Xây dựng một ứng dụng minh hoa cho khoá luận của nhóm.
¢ Các trường thông tin mà nhóm sẽ tập trung rút trích trong dữ liệu được minh họa ở Hình 1.com/pbcquoc/vietocr > 1. Mở dau BO KHOA HOC [VA CONG NGHỆ CONG HOA XÃ HOI CHU NGHĨA VIET NAM > Số kế hoạch cuc SỞ HỮU TRÍ TUỆ Độc lập - Tự do - Hạnh phúc.srr] Tà Nội, ngày 20 tháng O1 năm 2017 } > Ngày kế hoạch : TRƯỜNG ĐẠI HỌC ; > SỐ CONG NGHỆ THONG THN| = |pẾN Ngày .C2 2, Vé việc chấp nhận đơn hợp lệ > Ngay gửi | = CUC TRUONG CỤC SỞ HỮUTRÍ TUỆ Can cứ Điều lệ Tổ chức và Hoạt động của Cục Sở hữutrí tuệ ban hành theo Quyết định số 69/QĐ-BKHCN ngày 15/01/2014 của Bộ trưởng Bộ Khoa học và Cong nghệ: 2 và điểm 13.b của Thông tư số 01/2007/TT-BKHCN ngày 14.2007 của BO Khoa học và Công nghệ hướng dẫn thi hành Nghị định số 103/2006/NĐ-CP; Can cứ kết quả thẩm định hình thức đơn đăng ký giải pháp hữu ích: Số đơn: 2-2016-00434 QUYẾT ĐỊNH: Điều 1. Chấp nhận đơn hợp lệ với những ghi nhận sau đây: Ngày nộp đơn: 09/12/2016 Chủ đơn(*): Trường Đại học Công nghệ Thông tin (VN) Dia chỉ: Khu phố 6, phường Linh Trung, quận Thủ Đức, thành phố Hồ Chí Minh “Tên giải pháp hữu ích: Phương pháp phát hiện biển báo giao thông sử dụng kết hợp đa đặc trưng Điều 2. Công bố đơn trên Công báo sở hữu công nghiệp và thẩm định nội dung trong trường hop có yêu cầu theo quy định tại điểm 25.1 của Thông tư số 01/2007/TT-BKHCN.
Chánh Văn phòng, Trưởng phòng Đăng ky, Trưởng phòng Thông tin chịu trách nhiệm thi hành Quyết định này. CỤC TRUONG Noi nhận: ING ANG CHẾ SỐ 1 [Chis don/ đại điện của chủ đơn: Luu: VT, HT > Noi nhan > Người ky Hình 1.2: Các trường thông tin được rut trích 1.3 Đóng góp của khóa luận Sau đây là một số đóng góp mà nhóm thực hiện có được sau quá trình thực hiện khóa luận: » Hệ thống lại các kiến thức, hướng tiếp cận và giải quyết bài toán rút trích thông tin từ trong hình ảnh văn bản tiếng Việt. « Đánh giá một số phương pháp tiên tiến ứng với từng mô-đun của bài toán - Đối với bài toán phát hiện dòng văn bản là PANet[1], FCENet[2], DGGR[3]. Trong đó PANet cho kết quả và hiệu năng tốt nhất với F1-score là 94.6% với tốc độ xử lý 14.
— Đối với bài toán nhận diện dòng văn bản là Starnet[4] và VietOCR!. Trong đó VietOCR kết quả và hiệu năng tốt nhất với Precision-full- sequence là 87.49% và tốc độ xử lý là 27fps.com/pbcquoc/vietocr > 1. Mở dau — Đối với bài toán rút trích thông tin là PICK[5], SDMGR[6] trong đó SDMGR có hiệu năng tốt nhất với f1-score là 98. » Xây dựng được mot tập dữ liệu tiếng Việt để phục vụ cho bài toán rút trích thông tin từ trong hình ảnh văn bản tiếng Việt (cho cả 3 giai đoạn bao gồm phát hiện dòng văn bản, nhận diện dòng văn bản và rút trích thông tin từ văn bản).
» Xây dựng chương trình minh họa cho phép người dùng sử dụng để nhận diện, rút trích thông tin có trong hình ảnh.4 Cấu trúc khóa luận Chương 1: Giới thiệu tổng quan đề tài. Chương 2: Trình bày tổng quát các hướng tiếp cận có thể giải quyết bài toán rút trích thông tin quan trọng từ hình ảnh văn bản. Chương 3: Trình bày các kiến thức cơ bản về Transformer, Attention, Graph Neural Networks và các mô hình mang Deep Learning được áp dụng cho bài toán.