Mở đầu Để hiểu nắm bắt các khái niệm trong bài toán Scene Text Recognition (STR) và việc áp dụng module graph neural network (GNN) vào trong thuật toán, chúng ta cần làm rõ các vấn đề liên quan dén bài toán STR, cũng như là các hướng tiếp cận, giải quyết bài toán. Đồng thời, chúng ta cũng cần đi tìm hiểu về các ứng dụng và phân tích và nêu ra ưu điểm cũng như là nhược điểm của các phương pháp ấy. Giới thiệu bài toán nhận diện văn bản trong hình ảnh 2.1 Một số khái niệm cơ bản Ảnh: Ảnh là khái niệm đầu tiên trong bài toán về STR. Trong máy tính, ảnh được biểu diễn bằng là một ma trận số học dưới góc nhìn của thị giác máy tính.
Bài toán nhận diện chữ viết trong hình ảnh và các kiến thức liên quan Ảnh được hình thành từ tập hợp những điểm nhỏ, còn được gọi là điểm ảnh(pixel). What Computer Sees 204 Hình 2.1: Hình ảnh dưới góc nhìn của thị giác máy tính. Nguồn coursera! Điểm ảnh (Pixel): La đơn vị nhỏ nhất có thể hiển thị được để cấu thành nên một tắm ảnh. Mỗi tắm ảnh là một tập hợp các điểm ảnh.
Đối với ảnh kỹ thuật số, hình ảnh thực chất được lưu trữ dưới dạng ma trận các giá trị về vị trí của pixel và cường độ tại mỗi pixel. Cách biểu diễn ảnh: Ảnh có thể được lưu và biểu diễn dưới nhiều định dạng khác nhau, nhưng phổ biến nhất là các kiểu sau: + Ảnh trắng den hay còn có tên gọi là ảnh nhị phân - tat cả các giá trị của điểm ảnh trong một tam ảnh đều được lưu dưới dạng nhị phân (0, 1) hay 1 bit. Khi biểu điễn trên màn hình máy tính, màu đen được biểu diễn bằng số !https://www.org/learn/machine-learning. Bài toán nhận diện chữ viết trong hình ảnh và các kiến thức liên quan 0 còn màu trắng được biểu diễn bằng số 1.
Hình ảnh trắng đen có thể biểu diễn dưới dạng ma trận hai chiêu. + Ảnh xám: là ảnh biểu diễn bởi 8 bit để hiển thi các sắc thái khác nhau của màu xám, màu sắc nằm giữa trắng và đen. Theo định nghĩa, ảnh xám sẽ dùng số 0 để biểu thị màu đen và dùng số 255 để biểu thị cho màu trắng biểu, màu xám là màu biểu thị nằm trong khoảng (0, 255) (Hình 2. + Ảnh màu: được biểu diễn dưới dạng 8-bit, 15-bit - gọi là high color, 24-bit 'https://en.org/wiki/Grayscale 2.
Bài toán nhận diện chữ viết trong hình ảnh và các kiến thức liên quan - gọi là true color hoặc 30-bit gọi là high color. Nhưng trên máy tinh và các thiết bị di động, ta thường dùng nhất là ảnh có định dạng .jpg với 24-bit vì số lượng này đã đủ để biểu diễn rất nhiều màu sắc khác nhau : 16. Các điểm ảnh được hiển thị bởi ba màu sắc chính là đỏ, xanh lá, xanh dương Nếu ta sử dụng định dạng .png thì sẽ có thêm kênh màu alpha. Mỗi một trong những màu này có cường độ điểm ảnh của riêng nó dưới dạng các kênh riêng biệt.
Có thể hiểu là mỗi màu thì sẽ được biểu diễn ở một ma trận màu riêng biệt. Theo đó, mỗi tắm ảnh màu sẽ được hiển thị bởi 3 ma trận màu kết hợp lại với nhau trong thị giác máy tính.2 Bài toán nhận văn bản Tiếng Việt Hiểu về nội dung ảnh là một trong những bài toán được cộng đồng nghiên cứu trên toàn thế giới quan tâm. Giải pháp cho bài toán này được áp dụng trong hàng loạt các ứng dụng trong thế giới thực, bao gồm các hệ thống hỗ trợ thông minh và công cụ tìm kiếm và truy vấn như Google Image Search. Ảnh là một trong những phương tiện súc tích nhất vì nó không chỉ chứa thông tin về phong cảnh mà còn truyền đạt cho người nhìn thông tin văn bản.
Như vậy, đi kèm với thông tin thị giác, thông tin văn bản đóng một vai trò quan trọng trong giúp ta hiểu nội dung ảnh một cách tự nhiên hơn. Đặc biệt là khi ta xử lý các bài toán mà thành phần chính yếu là văn bản, chẳng hạn như các vấn đề liên quan đến văn bản cảnh, thông tin văn bản có thể giúp hiểu hình ảnh ở cấp độ ngữ nghĩa cao hơn so với chỉ sử dụng thông tin thị giác. Ví dụ trong bài toán truy vấn thông tin cửa hàng: các thông tin trên bảng quảng cáo như tên cửa hàng, địa chỉ , số điện thoại,. rất quan trọng trong quá trình tìm kiếm một cửa hàng.
Các thông tin này sẽ giúp người tìm kiếm một cửa hàng một cách nhanh chóng và tiện lợi hơn. Trong quá trình survey, nhóm nghiên cứu chỉ thấy có bộ dữ liệu ShopSign[3] là bộ dữ liệu có liên quan đến bảng quảng cáo. Tuy vậy, tác giả của bộ dữ liệu 10 2. Bài toán nhận diện chữ viết trong hình ảnh và các kiến thức liên quan chỉ hướng tới việc giải quyết bài toán nhận diện văn bản trong ngôn ngữ Trung Quốc.
Về phần chữ Latin - chiếm phần lớn các bộ dữ liệu chuẩn hiện nay - lại có số lượng hình ảnh bảng hiệu vẫn không đáng kể. Ví dụ: ICDAR15[4] chỉ bao gồm hai hình ảnh bảng hiệu, trong khi chỉ có một phần ba Total-Text[5] đáp ứng điều kiện này Table 4. Điều này đòi hỏi các đội ngũ nghiên cứu phải tạo ra một bộ dữ liệu bảng hiệu trong văn bản Latin. Theo đó, trong nghiên cứu này, nhóm nghiên cứu xây dựng một bộ dữ liệu bảng hiệu, SignboardText, trong đó ngôn ngữ chính được sử dụng là tiếng Việt - một ngôn ngữ Latin cho cộng đồng nghiên cứu trên thé giớii.
SignboardText là một bộ dữ liệu bao gồm các hình ảnh bảng quảng cáo với sự đa dạng cao hơn rất nhiều các bộ dữ liệu chuẩn khác, đặc biệt là trong các điều kiện môi trường phức tạp - hình ảnh thu thấp từ camera hành trình của xe, điện thoại thông minh của người đi bộ, video,. Bài toán nhận diện chữ viết tiếng Việt sẽ được chia thành hai giai đoạn chính là: » Phát hiện chữ (Text Detection): Trong giai đoạn này, đầu vào của giai đoạn phát hiện chữ là các hình ảnh chứa nội dung văn bản bằng tiếng Việt, với mỗi hình ảnh có thể chứa một hoặc nhiều băn vản và với các biến dạng khác nhau như về màu sắc, độ cong, font chữ, điều kiện sáng. Va đầu ra của giai đoạn phát hiện chữ này sẽ là những hình chữ nhật nhỏ được cắt từ hình ảnh đầu vào, với mỗi hình chứa một đối tượng văn bản được gọi là bouding box. * Nhận diện chữ (Text Recognition): Đầu vào của giai đoạn nhận diện chữ chính là đầu ra của giai đoạn phát hiện chữ, như vậy, ảnh đầu vào giai đoạn này chỉ chứa một đối tượng văn bản.
Dau ra sẽ là những chữ nhận diện được từ những hình ảnh mang đầu vào nói trên. Từ pipeline đề cập ở trên, để giải quyết bài toán nhận diện văn bản tiếng Việt trong hình ảnh, chúng ta đi giải quyết riêng biệt từng bài toán con là phát hiện 11 2. Bài toán nhận diện chữ viết trong hình ảnh và các kiến thức liên quan văn bản và nhận diện văn bản. Với mỗi bài toán con chúng ta sử dụng một thuật toán riêng biệt và đồng thời sẽ có quá trình huấn luyện riêng biệt.
Như vậy, sau khi có mô hình đã huấn luyện, chúng ta đi ghép hai mô hình vào hệ thông để giải quyết bài toán lớn. Ta tóm tắt mô hình kiến trúc tổng quan bài toán nhận văn bản {coors: (20, 186, 271,214, 266, 267, 14, 238] transcription: BÁNH SU KEM {eoors:[82, 245, 341,271, 336, 365, 23, 329] transcription: NGỌC THẢO}, {coors:J9, 444, 259, 461, 259, 509, 3, 492] transcription: TIỆM CŨ 215 DỜI 2.3: Tổng quan bài toán nhận diện chữ viết trong hình anh. Một số phương pháp tiếp cận phổ biến Các hướng tiếp cận để trích xuất đặc trưng là các phương pháp được dùng trong bước trích xuất đặc trưng của mô hình. Trong phần này sẽ thống kê lại các phương pháp trích xuất đặc trưng đã được sử dụng trước đến nay đối với hai bài toán con là phát hiện chữ và nhận diện chữ.
Bài toán nhận diện chữ viết trong hình ảnh và các kiến thức liên quan 2.1 Giai đoạn phát hiện chữ (Text Detection) 2.1 Hướng tiếp cận top down Differentiable Binarization (DB): Thuật toán dé xuất ở hội nghị AAAI 2020,tính tới thời điểm hiện tại, DB là thuật toán phát hiện text theo hướng segmentation nhanh nhất. Để đạt được ưu điểm về tốc độ, thuật toán DB làm đơn giản hóa quá trình hậu xử lý bằng cách áp dụng một module với tên gọi Differentiable Binarization (cũng chính là tên của thuật oán). Lợi thế của module chính chính là tính khả vi, giúp mô hình có thể học được qua quá trình lan truyền ngược. Ngoài ra, tác giả của thuật toán sử dụng mang backbone ResnetI8/50[6] cùng với ki thuật FPN để trích xuất đặc trưng trong thực nghiệm của minh.2 Hướng tiếp cận bottom up TextSnake: Trong thuật toán TextSnake[1], các đối tượng text được biểu diễn dưới các dĩa tròn nằm giao nhau.
Với mỗi diễn tròn này, thuật toán miêu tả được thông tin quan trọng như bán kính và hướng để miêu tả thành phần cục bộ của đối tượng text. Đẻ làm được điều này, TextSnake, thông qua mạng kiến trúc mạng FCN (với backbone là VGG16/19[7]), sẽ học và dự đoán các thông tin về hình học như cos/sin và 2 thông tin khác là Text Region (TR) và Text Central Line (TCL). Trong quá trình dự đoán kết quả, thuật toán TextSnake sẽ hậu xử lý thông tin TCL bằng thuật toán dé xuất. Thuật toán này gồm 3 action: (a) Centralizing, (b) Striding và cuối cùng là (c) Sliding.
* Chọn | khởi điểm bat kì trên TCL. * (a) Bước centralizing: Từ điểm trên, sử dụng thông tin về sin/cos đã dự đoán trên để vẽ đường tiếp tuyến (biểu diễn bằng đường đứt gãy trong bước 1 trong hình 2.4), từ đó ta có thể suy ra đường vuông góc (biểu diễn bằng đường vẽ liền). Trung điểm của đoạn (giới hạn trong TCL) liền này là 13 2. Bài toán nhận diện chữ viết trong hình ảnh và các kiến thức liên quan điểm ta cần tìm.
Trong trường hợp điểm nằm ngoài vùng TCL, ta sẽ giảm dần cho đến khi 2 điểm đó nằm hoàn toàn bên trong. * Lặp lại bước (b) và (a) cho đến khi ta gặp điểm cuối cùng của TCL ta sẽ có được tập hợp các điểm gọi có thứ tự ordered list) (gọi là tập hợp L và chuyển qua bước (c). * (c) Bước sliding:, để dự đoán vùng chứa đối tượng text, ta sử dụng 1 dia tròn để trượt (sliding) với tâm thuộc L, vùng mà dia tròn quét qua sẽ cho ta kết quả cuối cùng của thuật toán. Segmented TCL Prediction Expanding to Ends Act(c) .