Chương 1 TỔNG QUAN 1.1 Đặt van đề Nhận dạng chữ viết tay là một bài toán nhận được rất nhiều sự quan tâm của cộng đồng thị giác máy tính từ trước đến nay bởi vì tính hữu dụng của nó với các ứng dụng có thể được kể tới như đọc văn bản viết tay từ hóa đơn, từ các cuốn ghi chép, giấy khai sinh. và chuyển chúng thành dữ liệu số để lưu trữ, xử lý và tìm kiếm dễ dàng hơn, gọi chung là số hóa thông tin. Bài toán nhận dạng chữ viết tay được phát biểu như sau: "Với đầu vào là ảnh kí tự hoặc từ viết tay cần nhận dạng và đầu ra là nội dung văn bản trong ảnh" (xem hình 1. * Đầu vào (input): Ảnh chứa vùng văn bản cần nhận dạng.
Đây thực sự là một bài toán với nhiều thách thức do có rất nhiều phong cách viết, màu sắc chữ, viết nhanh làm mất chữ hoặc viết tắt, viết nguệch ngoạc,. làm cho việc nhận dạng cực kỳ khó khăn (xem hình 1. Nhận dạng chữ viết tay được nghiên cứu nhiều, tuy nhiên chủ yếu là trên tiếng Anh, trong khi đó tiếng Việt vẫn còn khá hạn chế. Ngoài việc ít được quan tâm nghiên cứu thì chữ viết tay tiếng Việt lại phức tạp hơn tiếng Anh khi số ký 1.
Tổng quan PF ỳ Sách Dau vào Dầu ra Hình 1.1: Đầu vào và đầu ra của bài toán nhận dạng chữ viết tay tiếng Việt bier! BY ry woe Phony Lig Ga hố, y2 ^„oO. / feyChữ viết bị thiếu nét (b) Sự phức tạp về vị trí đặt dấu (c) Các nét chồng lên nhau N we ll Beat fine. a xe (d) Nhiễu từ bề mặt viết (e) Da dang phong cach viét (f) Chữ xiên, veo Hình 1.2: Một số thách thức của chữ viết tay nói chung và chữ viết tay tiếng Việt nói riêng tự của tiếng Việt nhiều hơn han tiếng Anh, trong khi tiếng Anh chi gồm 96 ký tự (bao gồm ký tự chữ viết hoa, viết thường, số và ký tự dấu câu) thì với tiếng Việt đã có tới 224 ký tự (bao gồm ký tự chữ viết hoa, viết thường, số, ký tự dấu câu) - nhiều gấp hơn hai lần so với Tiếng Anh. Số lượng ký tự tiếng Việt nhiều hơn rất nhiều là bởi tiếng Việt có các dấu thanh bao gồm 5 dấu (’ ` ? ~.
Tổng quan dấu này khi kết hợp với các nguyên âm (u e 0 a i) sẽ tạo ra các biến thể (ủ ũ Wud.) ngoài ra các ký tự mà tiếng Anh không có (4 â ê đ ơ 6) khi kết hợp +*® / vu Ge g với dau cũng tao ra một ký tự mới (4444 a.) dẫn đến số lượng ký tự cần dự ay đoán nhiều hơn rất nhiều. Bên cạnh khó khăn về số lượng ky tự can nhận dạng thì chữ viết tay tiếng Việt còn gặp thử thách lớn về vị trí đặt các dấu thanh do các dau của Tiếng Việt không dính liền với ký tự chữ cái nên khi viết có thé các dấu được đặt ở vị trí không tương ứng với ký tự chữ cái chứa dấu đó (xem hình 1.2 (b)), cùng một từ khi đặt dấu thanh khác nhau sẽ dẫn đến kết quả nhận dạng khác nhau làm cho ý nghĩa của từ bị sai. Một lý do nữa làm cho bài toán nhận diện chữ viết tay Tiếng Việt ít được quan tâm là do thiếu dữ liệu phục vụ cho việc nghiên cứu. Theo khảo sát của nhóm, đến thời điểm hiện tại dữ liệu cho nhận dạng chữ viết tay tiếng Việt còn hạn chế khi chỉ có hai bộ dữ liệu là VNOnDB [1] và UIT-HWDB [2] (quan sát hình 1.
Trong đó bộ dữ liệu VNOnDB [1] là dữ liệu cho bài toán nhận diện chữ viết tay online (dif liệu được ghi nhận trong thời gian thực bằng các thiết bị cảm ứng như là bút và bảng điện tử) và được các nghiên cứu trước đây chuyển về dang offline (ảnh chụp chứa chữ) và bộ UIT-HWDB [2] là dữ liệu tổng hợp dùng bộ VNOnDB [1] xây dựng nên. Do đó 2 bộ dữ liệu này thiếu mất các tính chất đặc trưng của dữ liệu thực tế như là nhiễu nền, bị mờ do thiết bị và môi trường chụp ảnh,. Theo như nghiên cứu của Yang và cộng sự [4], Singh và cộng sự [6] hay trong nghiên cứu của Bautista va Atienza [5] cho thấy sử dụng dữ liệu thực tế để huấn luyện mô hình giúp cải thiện độ chính xác. Hơn nữa trong nghiên cứu của Baek và cộng sự [3] đã khám phá tác động của dữ liệu thực tế đến hiệu suất của các mô hình Scene Text Recognition (STR).
Cùng là nhận dạng văn bản tuy nhiên ở bài toán nhận dạng văn bản cảnh (Scene Text Recognition) lại đạt được khá nhiều thành công khi liên tục có rất nhiều mô hình, kiến trúc mới được công bồ (ViTSTR [9], ABINet [10], PARSeq [5], CLIP4STR [11], SVTR-CPPD [12]-[13], .) giúp cải thiện kết quả nhận 1. Tổng quan dạng. Chúng tôi mong muốn thực nghiệm và đánh giá các phương pháp đó trên dữ liệu chữ viết tay, từ đó có thể đưa ra nhận định và cải thiện trên dữ liệu chữ viết tay. Từ những lý do trên, chúng tôi sẽ xây dựng một bộ dữ liệu chữ viết tay thực tế mức độ từ cho tiếng Việt.
Sau đó sẽ đánh giá các phương pháp nhận dạng văn bản cảnh tiên tiến hiện nay cho bài toán nhận dạng chữ viết tay Tiếng Việt ở mức độ từ. Sau cùng chúng tôi xây dựng một ứng dụng trên nền tảng web để minh họa cho nghiên cứu của chúng tôi. (a) VNONDB dataset give (b) UITATIWDB dataset Hình 1.3: Một số anh trong bộ dữ liệu VNOnDB (a) và UIT-HWDB (b) mnie \ ~ (a) VNOnDB dataset (b) UIT-HWDB dataset (c) Dữ liệu tir thực tế Hình 1.4: Sự khác nhau giữa dữ liệu từ bộ VNOnDB (a), UIT-HWDB (b) và dữ liệu từ thực tế (c) 1.2 Mục tiêu và phạm vi 1.21 Mục tiêu Để thực hiện bai dé tài khóa luận "Đánh Giá Một Só Phương Pháp Nhận Dạng Văn Bản Trên Tập Dit Liệu Chữ Viết Tay Tiếng Việt Cấp Độ Từ", nhóm thực hiện khóa luận đặt ra những mục tiêu như sau: « Tìm hiểu tổng quan về bài toán và các hướng tiếp cận tiên tiến hiện nay với bài toán này. * Xây dựng một bộ dữ liệu chữ viết tay tiếng Việt thực tế bằng cách thu thập và gán nhãn dữ liệu.
Nguồn dữ liệu bao gồm dữ liệu từ tài liệu thực tế là học ba sinh viên và dữ liệu được công bố từ các cuộc thi. « Đánh giá một số phương pháp nhận dạng để đánh giá, so sánh, phân tích ưu và nhược điểm của từng phương pháp, từ đó thấy được sự cải tiến của từng phương pháp. « Xây dựng hệ thống minh họa.2 Phạm vi Dựa trên những mục đã đề xuất tại nội dung 1.1, trong khuôn khổ của khóa luận, chúng tôi sẽ tập trung hoàn thành các nội dung sau đây: * Nghiên cứu tổng quan về bài toán, bao gồm tìm hiểu về các thách thức va cơ sở lý thuyết của một số phương pháp hiện đại: ViTSTR [9], ABINet [10], PARSeq [5], CLIP4STR [1 1], SVTR-CPPD ([12]-[13]), để tim được các phương pháp phù hợp cho bài toán này. * Xây dựng tập dữ liệu chữ viết tay tiếng Việt bằng cách cắt và gan nhãn từ dữ liệu chúng tôi tự thu thập từ học bạ sinh viên và từ các bộ dữ liệu thực 1.
Tổng quan té từ các cuộc thi như Cinamon dataset [8] và BKAI-OCR [7]. « Đánh giá và so sánh các phương pháp nhận dạng tiên tiến trên tập dif liệu chữ viết tay tiếng Việt. * Xây dựng hệ thống minh họa cho dé tài trên nền tang web.3 Dong góp của khóa luận Sau đây là một số đóng góp mà chúng tôi đã đạt được trong quá trình thực hiện khóa luận: « Xây dựng được một tài liệu tổng quan về bài toán này cũng như các thách thức và các cách tiếp cận phổ biến hiện nay giúp giải quyết bài toán, và tài liệu mô tả lý thuyết, cách hoạt động của một số phương pháp nhận dạng chữ tiên tiến. « Xây dựng được một bộ dữ liệu chữ viết tay tiếng Việt cấp độ từ đa dạng với 190.685 ảnh, nhiều hơn gần gấp đôi so với 2 bộ dữ liệu hiện có là VNOnDB [1] (110.746 ảnh) và UIT-HWDB [2] (110.745 ảnh), và chứa các tính chất của chữ viết tay trong thực tế mà 2 bộ VNOnDB và UIT- HWDB không có như là nhiễu nền từ bé mặt viết, màu sắc đa dạng từ màu mực, ảnh hưởng của môi trường và thiết bị chụp khiến ảnh bị mờ và phân bổ màu sắc không đều.
Xây dựng được một tài liệu mô tả thông tin thu được khi phân tích bộ dữ liệu và cách thức để đánh giá trên bộ dữ liệu này. « Tổng kết các kết quả thu được khi đánh giá các phương pháp nhận diện tiên tiến được chọn, phân tích ưu nhược điểm của chúng. Khi huấn luyện các mô hình sử dụng dữ liệu thực tế thì độ lỗi nhận dạng trung bình giảm hơn một nửa so với sử dụng bộ dữ liệu UIT-HWDB [2] và giảm khoảng 3 lần so với bộ VNOnDB [1] (15-30% và 15-40% giảm xuống còn 5-10%). Tổng quan đó rút ra được kết luận rằng đối với bài toán nhận diện chữ viết tay Tiếng Việt thì sử dụng dữ liệu thực tế sẽ tốt hơn so với dữ liệu tổng hợp.
Đồng thời, 3 phương pháp ABINet[10], PARSeq[5] và CLIP4STR[1 1] có độ lỗi kí tự trung bình thấp nhất lần lượt là 7. Qua đó có thể thấy hướng tiếp cận kết hợp sử dụng mô hình ngôn ngữ và cơ chế sửa nhãn dự đoán giúp các mô hình nhận dạng tốt hơn, chính xác hơn. Điều này sẽ giúp ích cho việc xây dựng và cải tiền các phương pháp cho bài toán nhận diện chữ viết tay tiếng Việt. » Tổng kết các kết quả thành một bài báo khoa học (được đính kèm ở sau cuốn khóa luận).
« Xây dựng hệ thống minh hoa cho đề tài.4 Cấu trúc khóa luận Chương 1: Giới thiệu tổng quan về bài toán nhận dang chữ viết tay tiếng Việt, Chương 2: Trình bày về cơ sở lý thuyết và các nghiên cứu liên quan đến bài toán nhận dạng chữ viết tay tiếng Việt. Chương 3: Trình bày về các phương pháp nhận dạng văn bản sử dụng để thực nghiệm. Chương 4: Trình bày cách xây dựng bộ dữ liệu, phân tích dữ liệu, cách thức đánh giá và so sánh kết quả của các mô hình trên bộ dữ liệu đã xây dựng. Chương 5: Trình bày về cách xây dựng ứng dụng minh họa Chương 6: Kết luận về khóa luận tốt nghiệp và hướng phát triển trong tương lai.