Áp Dụng Mạng Chú Ý Đồ Thị Cho Bài Toán Nhận Dạng Văn Bản Tiếng Việt

Khóa luận tốt nghiệp nghiên cứu tốt nghiệp khoa học máy tính áp dụng graph attention network cho bài toán nhận dạng văn bản tiếng, vận dụng lý thuyết vào thực tế, đề xuất giải

Chuyên ngành

Khoa học máy tính

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2022

88
3
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: TỔNG QUAN

1.1. Đặt vấn đề

1.2. Phạm vi và mục tiêu

1.3. Đóng góp của khóa luận

1.4. Cấu trúc khóa luận

2. CHƯƠNG 2: BÀI TOÁN NHẬN DIỆN VĂN BẢN TRONG HÌNH ẢNH VÀ CÁC KIẾN THỨC LIÊN QUAN

2.1. Mở đầu

2.2. Giới thiệu bài toán nhận diện văn bản trong hình ảnh

2.3. Một số khái niệm cơ bản

2.4. Bài toán nhận văn bản Tiếng Việt

2.5. Một số phương pháp tiếp cận phổ biến

2.5.1. Giai đoạn phát hiện chữ (Text Detection)

2.5.2. Hướng tiếp cận bottom-up

2.5.3. Nhận xét một số phương pháp tiếp cận

2.5.4. Giai đoạn nhận diện chữ (Text Recognition)

2.5.5. Nhận xét một số phương pháp tiếp cận

3. CHƯƠNG 3: ÁP DỤNG GRAPH ATTENTION TRONG BÀI TOÁN NHẬN DIỆN VĂN BẢN

3.1. Tổng quan về Deep Learning

3.1.1. Các khái niệm cơ bản

3.1.2. Khái niệm Deep Learning

3.1.3. Các kiến trúc mạng học sâu nổi tiếng

3.1.3.1. FCN: Fully Convolutional Network
3.1.3.2. FPN: Feature Pyramid Network

3.2. Các khái niệm cơ bản về graph

3.2.1. Thế nào là một đồ thị

3.2.2. Các bài toán trên dữ liệu graph

3.2.2.1. Dự đoán trên cấp độ đỉnh
3.2.2.2. Dự đoán trên cấp độ cạnh
3.2.2.3. Dự đoán trên cấp độ đồ thị

3.2.3. Các thuật toán học sâu trên graph

3.3. Áp dụng Deep Learning vào bài toán nhận diện chữ viết tiếng Việt

4. CHƯƠNG 4: THỰC NGHIỆM VÀ ĐÁNH GIÁ

4.1. Mở đầu

4.2. So sánh với các bộ dữ liệu liên quan

4.3. Xây dựng tập dữ liệu SignboardText

4.3.1. Giai đoạn thu thập dữ liệu

4.3.2. Giai đoạn gán nhãn dữ liệu

4.3.3. Một số độ đo đánh giá

4.4. Một số khái niệm cơ bản

4.4.1. Giai đoạn phát hiện chữ (Text Detection)

4.4.2. Giai đoạn nhận diện chữ (Text Recognition)

5. CHƯƠNG 5: XÂY DỰNG ỨNG DỤNG MINH HỌA THỰC NGHIỆM

5.1. Mở đầu

5.2. Ứng dụng trực quan hóa kết quả dự đoán của mô hình

5.2.1. Định dạng để visual lên trên web demo

5.2.2. Các giao diện chính của web trực quan hóa kết quả trả về

6. CHƯƠNG 6: KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

6.1. Kết luận

6.2. Hướng phát triển

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng Quan Về Áp Dụng Mạng Chú Ý Đồ Thị Trong Nhận Dạng Văn Bản Tiếng Việt

Mạng chú ý đồ thị (Graph Attention Network - GAT) đã trở thành một công cụ mạnh mẽ trong lĩnh vực nhận diện văn bản tiếng Việt. Công nghệ này cho phép xử lý và phân tích dữ liệu văn bản một cách hiệu quả hơn. Việc áp dụng GAT trong nhận diện văn bản không chỉ giúp cải thiện độ chính xác mà còn tăng cường khả năng hiểu ngữ nghĩa của văn bản. Nghiên cứu này sẽ đi sâu vào các khía cạnh của GAT và ứng dụng của nó trong nhận diện văn bản tiếng Việt.

1.1. Khái Niệm Về Mạng Chú Ý Đồ Thị

Mạng chú ý đồ thị là một kiến trúc học sâu cho phép mô hình hóa mối quan hệ giữa các nút trong đồ thị. Nó sử dụng cơ chế chú ý để xác định tầm quan trọng của các nút lân cận trong quá trình học. Điều này giúp cải thiện khả năng nhận diện văn bản trong các bối cảnh phức tạp.

1.2. Tầm Quan Trọng Của Nhận Dạng Văn Bản Tiếng Việt

Nhận diện văn bản tiếng Việt là một thách thức lớn do sự đa dạng về ngữ pháp và từ vựng. Việc áp dụng GAT giúp giải quyết các vấn đề này bằng cách tối ưu hóa quá trình phân tích ngữ nghĩa và cấu trúc của văn bản.

II. Vấn Đề Trong Nhận Dạng Văn Bản Tiếng Việt

Nhận diện văn bản tiếng Việt gặp nhiều khó khăn do sự phong phú và đa dạng của ngôn ngữ. Các vấn đề như độ chính xác thấp trong việc nhận diện các ký tự đặc biệt và sự biến đổi của font chữ là những thách thức lớn. Hơn nữa, việc thiếu hụt dữ liệu huấn luyện chất lượng cao cũng là một yếu tố cản trở sự phát triển của các mô hình nhận diện văn bản.

2.1. Thách Thức Về Dữ Liệu Huấn Luyện

Dữ liệu huấn luyện cho nhận diện văn bản tiếng Việt còn hạn chế, đặc biệt là trong các tình huống thực tế. Việc xây dựng bộ dữ liệu phong phú và đa dạng là cần thiết để cải thiện độ chính xác của các mô hình.

2.2. Khó Khăn Trong Việc Nhận Diện Ký Tự Đặc Biệt

Các ký tự đặc biệt trong tiếng Việt thường bị nhận diện sai do sự tương đồng với các ký tự khác. Điều này đòi hỏi các mô hình phải được tối ưu hóa để xử lý các trường hợp này một cách hiệu quả.

III. Phương Pháp Áp Dụng Mạng Chú Ý Đồ Thị Trong Nhận Dạng Văn Bản

Phương pháp áp dụng mạng chú ý đồ thị trong nhận diện văn bản tiếng Việt bao gồm việc sử dụng các mô hình học sâu để tối ưu hóa quá trình nhận diện. Các bước chính bao gồm thu thập dữ liệu, tiền xử lý, và huấn luyện mô hình. Việc áp dụng GAT giúp cải thiện khả năng nhận diện và phân tích ngữ nghĩa của văn bản.

3.1. Quy Trình Huấn Luyện Mô Hình

Quy trình huấn luyện mô hình bao gồm các bước như thu thập dữ liệu, tiền xử lý và tối ưu hóa mô hình. Việc sử dụng GAT trong quy trình này giúp cải thiện độ chính xác và khả năng nhận diện văn bản.

3.2. Tối Ưu Hóa Mô Hình Nhận Dạng

Tối ưu hóa mô hình nhận diện văn bản là một bước quan trọng để nâng cao hiệu suất. Việc điều chỉnh các tham số và cấu trúc của mô hình GAT có thể giúp cải thiện đáng kể kết quả nhận diện.

IV. Ứng Dụng Thực Tiễn Của Mạng Chú Ý Đồ Thị Trong Nhận Dạng Văn Bản

Mạng chú ý đồ thị đã được áp dụng trong nhiều lĩnh vực khác nhau, từ nhận diện văn bản trong hình ảnh đến phân tích ngữ nghĩa. Các ứng dụng này không chỉ giúp cải thiện độ chính xác mà còn mở ra nhiều cơ hội mới trong việc phát triển các công nghệ nhận diện văn bản tiếng Việt.

4.1. Ứng Dụng Trong Thương Mại Điện Tử

Trong thương mại điện tử, việc nhận diện văn bản trên các biển quảng cáo và sản phẩm giúp cải thiện trải nghiệm người dùng. GAT có thể giúp nhận diện và phân tích thông tin một cách nhanh chóng và chính xác.

4.2. Ứng Dụng Trong Giáo Dục

Trong giáo dục, việc nhận diện văn bản từ tài liệu học tập giúp hỗ trợ việc học tập và nghiên cứu. GAT có thể giúp tự động hóa quá trình này, tiết kiệm thời gian và công sức cho người học.

V. Kết Luận Và Hướng Phát Triển Tương Lai

Mạng chú ý đồ thị đã chứng minh được tiềm năng trong việc nhận diện văn bản tiếng Việt. Tuy nhiên, vẫn còn nhiều thách thức cần phải vượt qua. Hướng phát triển tương lai bao gồm việc cải thiện chất lượng dữ liệu, tối ưu hóa mô hình và mở rộng ứng dụng của GAT trong các lĩnh vực khác nhau.

5.1. Cải Thiện Chất Lượng Dữ Liệu

Cải thiện chất lượng dữ liệu huấn luyện là một yếu tố quan trọng để nâng cao độ chính xác của mô hình. Việc xây dựng các bộ dữ liệu phong phú và đa dạng sẽ giúp cải thiện hiệu suất nhận diện.

5.2. Mở Rộng Ứng Dụng Của GAT

Mở rộng ứng dụng của GAT trong các lĩnh vực khác nhau sẽ giúp khai thác tối đa tiềm năng của công nghệ này. Các nghiên cứu tiếp theo có thể tập trung vào việc áp dụng GAT trong các lĩnh vực như y tế, giao thông và truyền thông.

10/07/2025
Khóa luận tốt nghiệp khoa học máy tính áp dụng graph attention network cho bài toán nhận dạng văn bản tiếng việt trong ảnh

Trích đoạn nội dung tài liệu

Mở đầu Để hiểu nắm bắt các khái niệm trong bài toán Scene Text Recognition (STR) và việc áp dụng module graph neural network (GNN) vào trong thuật toán, chúng ta cần làm rõ các vấn đề liên quan dén bài toán STR, cũng như là các hướng tiếp cận, giải quyết bài toán. Đồng thời, chúng ta cũng cần đi tìm hiểu về các ứng dụng và phân tích và nêu ra ưu điểm cũng như là nhược điểm của các phương pháp ấy. Giới thiệu bài toán nhận diện văn bản trong hình ảnh 2.1 Một số khái niệm cơ bản Ảnh: Ảnh là khái niệm đầu tiên trong bài toán về STR. Trong máy tính, ảnh được biểu diễn bằng là một ma trận số học dưới góc nhìn của thị giác máy tính.

Bài toán nhận diện chữ viết trong hình ảnh và các kiến thức liên quan Ảnh được hình thành từ tập hợp những điểm nhỏ, còn được gọi là điểm ảnh(pixel). What Computer Sees 204 Hình 2.1: Hình ảnh dưới góc nhìn của thị giác máy tính. Nguồn coursera! Điểm ảnh (Pixel): La đơn vị nhỏ nhất có thể hiển thị được để cấu thành nên một tắm ảnh. Mỗi tắm ảnh là một tập hợp các điểm ảnh.

Đối với ảnh kỹ thuật số, hình ảnh thực chất được lưu trữ dưới dạng ma trận các giá trị về vị trí của pixel và cường độ tại mỗi pixel. Cách biểu diễn ảnh: Ảnh có thể được lưu và biểu diễn dưới nhiều định dạng khác nhau, nhưng phổ biến nhất là các kiểu sau: + Ảnh trắng den hay còn có tên gọi là ảnh nhị phân - tat cả các giá trị của điểm ảnh trong một tam ảnh đều được lưu dưới dạng nhị phân (0, 1) hay 1 bit. Khi biểu điễn trên màn hình máy tính, màu đen được biểu diễn bằng số !https://www.org/learn/machine-learning. Bài toán nhận diện chữ viết trong hình ảnh và các kiến thức liên quan 0 còn màu trắng được biểu diễn bằng số 1.

Hình ảnh trắng đen có thể biểu diễn dưới dạng ma trận hai chiêu. + Ảnh xám: là ảnh biểu diễn bởi 8 bit để hiển thi các sắc thái khác nhau của màu xám, màu sắc nằm giữa trắng và đen. Theo định nghĩa, ảnh xám sẽ dùng số 0 để biểu thị màu đen và dùng số 255 để biểu thị cho màu trắng biểu, màu xám là màu biểu thị nằm trong khoảng (0, 255) (Hình 2. + Ảnh màu: được biểu diễn dưới dạng 8-bit, 15-bit - gọi là high color, 24-bit 'https://en.org/wiki/Grayscale 2.

Bài toán nhận diện chữ viết trong hình ảnh và các kiến thức liên quan - gọi là true color hoặc 30-bit gọi là high color. Nhưng trên máy tinh và các thiết bị di động, ta thường dùng nhất là ảnh có định dạng .jpg với 24-bit vì số lượng này đã đủ để biểu diễn rất nhiều màu sắc khác nhau : 16. Các điểm ảnh được hiển thị bởi ba màu sắc chính là đỏ, xanh lá, xanh dương Nếu ta sử dụng định dạng .png thì sẽ có thêm kênh màu alpha. Mỗi một trong những màu này có cường độ điểm ảnh của riêng nó dưới dạng các kênh riêng biệt.

Có thể hiểu là mỗi màu thì sẽ được biểu diễn ở một ma trận màu riêng biệt. Theo đó, mỗi tắm ảnh màu sẽ được hiển thị bởi 3 ma trận màu kết hợp lại với nhau trong thị giác máy tính.2 Bài toán nhận văn bản Tiếng Việt Hiểu về nội dung ảnh là một trong những bài toán được cộng đồng nghiên cứu trên toàn thế giới quan tâm. Giải pháp cho bài toán này được áp dụng trong hàng loạt các ứng dụng trong thế giới thực, bao gồm các hệ thống hỗ trợ thông minh và công cụ tìm kiếm và truy vấn như Google Image Search. Ảnh là một trong những phương tiện súc tích nhất vì nó không chỉ chứa thông tin về phong cảnh mà còn truyền đạt cho người nhìn thông tin văn bản.

Như vậy, đi kèm với thông tin thị giác, thông tin văn bản đóng một vai trò quan trọng trong giúp ta hiểu nội dung ảnh một cách tự nhiên hơn. Đặc biệt là khi ta xử lý các bài toán mà thành phần chính yếu là văn bản, chẳng hạn như các vấn đề liên quan đến văn bản cảnh, thông tin văn bản có thể giúp hiểu hình ảnh ở cấp độ ngữ nghĩa cao hơn so với chỉ sử dụng thông tin thị giác. Ví dụ trong bài toán truy vấn thông tin cửa hàng: các thông tin trên bảng quảng cáo như tên cửa hàng, địa chỉ , số điện thoại,. rất quan trọng trong quá trình tìm kiếm một cửa hàng.

Các thông tin này sẽ giúp người tìm kiếm một cửa hàng một cách nhanh chóng và tiện lợi hơn. Trong quá trình survey, nhóm nghiên cứu chỉ thấy có bộ dữ liệu ShopSign[3] là bộ dữ liệu có liên quan đến bảng quảng cáo. Tuy vậy, tác giả của bộ dữ liệu 10 2. Bài toán nhận diện chữ viết trong hình ảnh và các kiến thức liên quan chỉ hướng tới việc giải quyết bài toán nhận diện văn bản trong ngôn ngữ Trung Quốc.

Về phần chữ Latin - chiếm phần lớn các bộ dữ liệu chuẩn hiện nay - lại có số lượng hình ảnh bảng hiệu vẫn không đáng kể. Ví dụ: ICDAR15[4] chỉ bao gồm hai hình ảnh bảng hiệu, trong khi chỉ có một phần ba Total-Text[5] đáp ứng điều kiện này Table 4. Điều này đòi hỏi các đội ngũ nghiên cứu phải tạo ra một bộ dữ liệu bảng hiệu trong văn bản Latin. Theo đó, trong nghiên cứu này, nhóm nghiên cứu xây dựng một bộ dữ liệu bảng hiệu, SignboardText, trong đó ngôn ngữ chính được sử dụng là tiếng Việt - một ngôn ngữ Latin cho cộng đồng nghiên cứu trên thé giớii.

SignboardText là một bộ dữ liệu bao gồm các hình ảnh bảng quảng cáo với sự đa dạng cao hơn rất nhiều các bộ dữ liệu chuẩn khác, đặc biệt là trong các điều kiện môi trường phức tạp - hình ảnh thu thấp từ camera hành trình của xe, điện thoại thông minh của người đi bộ, video,. Bài toán nhận diện chữ viết tiếng Việt sẽ được chia thành hai giai đoạn chính là: » Phát hiện chữ (Text Detection): Trong giai đoạn này, đầu vào của giai đoạn phát hiện chữ là các hình ảnh chứa nội dung văn bản bằng tiếng Việt, với mỗi hình ảnh có thể chứa một hoặc nhiều băn vản và với các biến dạng khác nhau như về màu sắc, độ cong, font chữ, điều kiện sáng. Va đầu ra của giai đoạn phát hiện chữ này sẽ là những hình chữ nhật nhỏ được cắt từ hình ảnh đầu vào, với mỗi hình chứa một đối tượng văn bản được gọi là bouding box. * Nhận diện chữ (Text Recognition): Đầu vào của giai đoạn nhận diện chữ chính là đầu ra của giai đoạn phát hiện chữ, như vậy, ảnh đầu vào giai đoạn này chỉ chứa một đối tượng văn bản.

Dau ra sẽ là những chữ nhận diện được từ những hình ảnh mang đầu vào nói trên. Từ pipeline đề cập ở trên, để giải quyết bài toán nhận diện văn bản tiếng Việt trong hình ảnh, chúng ta đi giải quyết riêng biệt từng bài toán con là phát hiện 11 2. Bài toán nhận diện chữ viết trong hình ảnh và các kiến thức liên quan văn bản và nhận diện văn bản. Với mỗi bài toán con chúng ta sử dụng một thuật toán riêng biệt và đồng thời sẽ có quá trình huấn luyện riêng biệt.

Như vậy, sau khi có mô hình đã huấn luyện, chúng ta đi ghép hai mô hình vào hệ thông để giải quyết bài toán lớn. Ta tóm tắt mô hình kiến trúc tổng quan bài toán nhận văn bản {coors: (20, 186, 271,214, 266, 267, 14, 238] transcription: BÁNH SU KEM {eoors:[82, 245, 341,271, 336, 365, 23, 329] transcription: NGỌC THẢO}, {coors:J9, 444, 259, 461, 259, 509, 3, 492] transcription: TIỆM CŨ 215 DỜI 2.3: Tổng quan bài toán nhận diện chữ viết trong hình anh. Một số phương pháp tiếp cận phổ biến Các hướng tiếp cận để trích xuất đặc trưng là các phương pháp được dùng trong bước trích xuất đặc trưng của mô hình. Trong phần này sẽ thống kê lại các phương pháp trích xuất đặc trưng đã được sử dụng trước đến nay đối với hai bài toán con là phát hiện chữ và nhận diện chữ.

Bài toán nhận diện chữ viết trong hình ảnh và các kiến thức liên quan 2.1 Giai đoạn phát hiện chữ (Text Detection) 2.1 Hướng tiếp cận top down Differentiable Binarization (DB): Thuật toán dé xuất ở hội nghị AAAI 2020,tính tới thời điểm hiện tại, DB là thuật toán phát hiện text theo hướng segmentation nhanh nhất. Để đạt được ưu điểm về tốc độ, thuật toán DB làm đơn giản hóa quá trình hậu xử lý bằng cách áp dụng một module với tên gọi Differentiable Binarization (cũng chính là tên của thuật oán). Lợi thế của module chính chính là tính khả vi, giúp mô hình có thể học được qua quá trình lan truyền ngược. Ngoài ra, tác giả của thuật toán sử dụng mang backbone ResnetI8/50[6] cùng với ki thuật FPN để trích xuất đặc trưng trong thực nghiệm của minh.2 Hướng tiếp cận bottom up TextSnake: Trong thuật toán TextSnake[1], các đối tượng text được biểu diễn dưới các dĩa tròn nằm giao nhau.

Với mỗi diễn tròn này, thuật toán miêu tả được thông tin quan trọng như bán kính và hướng để miêu tả thành phần cục bộ của đối tượng text. Đẻ làm được điều này, TextSnake, thông qua mạng kiến trúc mạng FCN (với backbone là VGG16/19[7]), sẽ học và dự đoán các thông tin về hình học như cos/sin và 2 thông tin khác là Text Region (TR) và Text Central Line (TCL). Trong quá trình dự đoán kết quả, thuật toán TextSnake sẽ hậu xử lý thông tin TCL bằng thuật toán dé xuất. Thuật toán này gồm 3 action: (a) Centralizing, (b) Striding và cuối cùng là (c) Sliding.

* Chọn | khởi điểm bat kì trên TCL. * (a) Bước centralizing: Từ điểm trên, sử dụng thông tin về sin/cos đã dự đoán trên để vẽ đường tiếp tuyến (biểu diễn bằng đường đứt gãy trong bước 1 trong hình 2.4), từ đó ta có thể suy ra đường vuông góc (biểu diễn bằng đường vẽ liền). Trung điểm của đoạn (giới hạn trong TCL) liền này là 13 2. Bài toán nhận diện chữ viết trong hình ảnh và các kiến thức liên quan điểm ta cần tìm.

Trong trường hợp điểm nằm ngoài vùng TCL, ta sẽ giảm dần cho đến khi 2 điểm đó nằm hoàn toàn bên trong. * Lặp lại bước (b) và (a) cho đến khi ta gặp điểm cuối cùng của TCL ta sẽ có được tập hợp các điểm gọi có thứ tự ordered list) (gọi là tập hợp L và chuyển qua bước (c). * (c) Bước sliding:, để dự đoán vùng chứa đối tượng text, ta sử dụng 1 dia tròn để trượt (sliding) với tâm thuộc L, vùng mà dia tròn quét qua sẽ cho ta kết quả cuối cùng của thuật toán. Segmented TCL Prediction Expanding to Ends Act(c) .

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ