Khóa Luận Tốt Nghiệp: Nhận Dạng Ký Tự Hán-Nôm Sử Dụng Học Sâu

Khóa luận tốt nghiệp nghiên cứu ứng dụng deep learning trong nhận diện ký tự Hán Nôm, góp phần phát triển khoa học dữ liệu tại Việt Nam.

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2022

123
1
0

Phí lưu trữ

35 Point

Mục lục chi tiết

LỜI CAM ĐOAN

LỜI CẢM ƠN

1. CHƯƠNG 1: MỞ ĐẦU

1.1. Đặt vấn đề

1.2. Lý do chọn đề tài. Mục tiêu khóa luận. Đối tượng và phạm vi nghiên cứu. Các nội dung chính

2. CHƯƠNG 2: TỔNG QUAN

2.1. Giới thiệu đề tài. Tính ứng dụng của đề tài. NGHIÊN CỨU LIÊN QUAN. Tình hình nghiên cứu trên thế giới. Tình hình nghiên cứu trong nước

4. CHƯƠNG 4: NHẬN DẠNG KÝ TỰ QUANG HỌC (OCR)

4.1. Các khái niệm cơ bản. Phân loại hình ảnh chứa văn bản. OCR và HỌC

4.2. Các bước triển khai chính. Một số dataset cho văn bản phi cấu trúc. Một số công cụ mã nguồn mở. Các thành phần tính toán chính

4.3. Mạng Nơ-ron Tích chập (CNN). Các khái niệm cơ bản. Phân vùng ảnh (Image Segmentation). Các khái niệm cơ bản. Ý tưởng từ mạng FCN

4.4. Mạng Nơ-ron Hồi tiếp (RNN). Các khái niệm cơ bản. Nút Hồi tiếp có Cổng (GRU). Mạng Nơ-ron Hồi tiếp 2 chiều

4.5. Mô hình chuỗi sang chuỗi (Seq2Seq). Cơ chế Tập trung (Attention Mechanism). Các tính toán chính. Seq2Seq sử dụng Cơ chế Tập trung. Tự tập trung (Self-Attention). Kiến trúc Transformer

5. CHƯƠNG 5: BỘ DỮ LIỆU NOMNAOCR

5.1. Khai quát chung. Thu thập dữ liệu. Xây dựng hướng dẫn (Guideline). Gán nhãn tự động (Auto annotation). Quy trình đánh giá. Triển khai thực tế. Các khó khăn cùng hướng xử lý. Phân tích và chia dữ liệu. Bộ dữ liệu Synthetic Nom String

6. CHƯƠNG 6: CÁC PHƯƠNG PHÁP TIẾP CẬN

6.1. Khởi nguồn và lý do tiếp cận bằng Học sâu. Phát hiện văn bản (Text Detection). Tiếp cận theo Regression-based với EAST. Tiếp cận theo Segmentation-based với DBNet. Nhận dạng văn bản (Text Recognition). Tiếp cận theo hướng sinh mô tả cho ảnh. Kiến trúc Injection và Merging. Kiến trúc dựa trên Cơ chế Tập trung. Mạng Nơ-ron Hồi tiếp Tích chập (CRNN). Tiếp cận theo hướng Seq2Seq trong dịch máy. Các mô hình TransformerOCR

7. CHƯƠNG 7: CÀI ĐẶT THỬ NGHIỆM

7.1. Triển khai cho bài toán Text Detection. Triển khai cho bài toán Text Recognition. Các giai đoạn huấn luyện. Cài đặt phần Xử lý ngôn ngữ. Thuật toán tối ưu (Optimizer). Các thông số khác. Thử nghiệm với các Kết nối tắt

8. CHƯƠNG 8: ĐÁNH GIÁ VÀ KẾT QUẢ

8.1. Phương pháp đánh giá. Metrics đánh giá Text Detection và End-to-End. Metrics đánh giá với riêng Text Recognition. Kết quả thử nghiệm. Kết quả bài toán Text Detection. Kết quả tổng quan. Kết quả theo từng tác phẩm. Kết quả bài toán Text Recognition. Kết quả giai đoạn Pre-training. Kết quả Fine-tuning và Retraining. Kết quả các ngưỡng

8.2. Kết quả End-to-End. Kết quả trên toàn bộ ảnh. Kết quả chi tiết trên thơ và văn xuôi. Phân tích lỗi. Phân tích lỗi cho bài toán Text Detection

8.3. Phân tích lỗi cho bài toán Text Recognition

KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng quan về Nhận Dạng Ký Tự Hán Nôm Sử Dụng Học Sâu

Nhận dạng ký tự Hán-Nôm là một lĩnh vực nghiên cứu quan trọng trong việc bảo tồn di sản văn hóa Việt Nam. Với sự phát triển của công nghệ học sâu, việc áp dụng các phương pháp như mạng nơ-ron tích chập (CNN) và mạng nơ-ron hồi tiếp (RNN) đã mở ra nhiều cơ hội mới. Nghiên cứu này không chỉ giúp số hóa các tài liệu cổ mà còn tạo điều kiện cho việc nghiên cứu và giảng dạy về văn hóa Hán-Nôm.

1.1. Khái niệm về Nhận Dạng Ký Tự Hán Nôm

Nhận dạng ký tự Hán-Nôm là quá trình chuyển đổi hình ảnh chứa ký tự thành dạng văn bản có thể đọc được. Điều này giúp bảo tồn và phát huy giá trị của các tài liệu cổ.

1.2. Tầm quan trọng của Học Sâu trong Nhận Dạng Ký Tự

Học sâu cung cấp các phương pháp mạnh mẽ để cải thiện độ chính xác trong nhận dạng ký tự. Các mô hình như CNN và RNN đã chứng minh hiệu quả trong việc xử lý hình ảnh và ngữ nghĩa.

II. Vấn đề và Thách thức trong Nhận Dạng Ký Tự Hán Nôm

Mặc dù có nhiều tiến bộ, nhưng việc nhận dạng ký tự Hán-Nôm vẫn gặp phải nhiều thách thức. Các vấn đề như độ chính xác thấp, sự đa dạng trong cách viết và chất lượng hình ảnh là những yếu tố cần được giải quyết. Việc thiếu dữ liệu huấn luyện chất lượng cũng là một rào cản lớn.

2.1. Độ chính xác và độ tin cậy của mô hình

Độ chính xác của các mô hình nhận dạng ký tự Hán-Nôm thường không đạt yêu cầu. Cần có các phương pháp cải thiện để nâng cao độ tin cậy.

2.2. Sự đa dạng trong cách viết ký tự

Ký tự Hán-Nôm có nhiều biến thể và cách viết khác nhau, điều này gây khó khăn cho việc nhận dạng chính xác. Cần có các phương pháp để xử lý sự đa dạng này.

III. Phương pháp Học Sâu trong Nhận Dạng Ký Tự Hán Nôm

Các phương pháp học sâu như CNN và RNN đã được áp dụng để giải quyết bài toán nhận dạng ký tự Hán-Nôm. Những mô hình này giúp cải thiện đáng kể độ chính xác và hiệu suất của hệ thống nhận dạng. Việc sử dụng mạng nơ-ron hồi tiếp tích chập (CRNN) cũng đã cho thấy kết quả khả quan.

3.1. Mạng Nơ ron Tích chập CNN

CNN là một trong những phương pháp hiệu quả nhất trong nhận dạng hình ảnh. Nó giúp phát hiện các đặc trưng quan trọng của ký tự Hán-Nôm.

3.2. Mạng Nơ ron Hồi tiếp RNN

RNN cho phép xử lý dữ liệu theo chuỗi, rất hữu ích trong việc nhận dạng các ký tự liên tiếp trong văn bản Hán-Nôm.

3.3. Kết hợp CNN và RNN

Sự kết hợp giữa CNN và RNN tạo ra mô hình CRNN, giúp cải thiện đáng kể độ chính xác trong nhận dạng ký tự Hán-Nôm.

IV. Ứng dụng thực tiễn của Nhận Dạng Ký Tự Hán Nôm

Nhận dạng ký tự Hán-Nôm có nhiều ứng dụng thực tiễn trong việc bảo tồn văn hóa và lịch sử. Các hệ thống nhận dạng có thể được sử dụng để số hóa tài liệu cổ, giúp cho việc nghiên cứu và giảng dạy trở nên dễ dàng hơn. Ngoài ra, việc số hóa cũng giúp bảo tồn các tài liệu quý giá cho thế hệ tương lai.

4.1. Số hóa tài liệu cổ

Việc số hóa tài liệu cổ giúp bảo tồn và phát huy giá trị văn hóa. Các tài liệu này có thể được truy cập dễ dàng hơn qua internet.

4.2. Hỗ trợ nghiên cứu và giảng dạy

Các hệ thống nhận dạng ký tự Hán-Nôm giúp các nhà nghiên cứu và giảng viên dễ dàng truy cập và sử dụng tài liệu cổ trong giảng dạy và nghiên cứu.

V. Kết luận và Tương lai của Nhận Dạng Ký Tự Hán Nôm

Nhận dạng ký tự Hán-Nôm sử dụng học sâu đang mở ra nhiều cơ hội mới cho việc bảo tồn văn hóa. Tuy nhiên, cần tiếp tục nghiên cứu và phát triển các phương pháp mới để cải thiện độ chính xác và hiệu suất. Tương lai của lĩnh vực này hứa hẹn sẽ có nhiều tiến bộ, góp phần quan trọng vào việc bảo tồn di sản văn hóa Việt Nam.

5.1. Tiềm năng phát triển trong nghiên cứu

Nghiên cứu về nhận dạng ký tự Hán-Nôm có tiềm năng lớn trong việc phát triển các công nghệ mới, giúp cải thiện độ chính xác và hiệu suất.

5.2. Tầm quan trọng của việc bảo tồn văn hóa

Việc bảo tồn văn hóa thông qua nhận dạng ký tự Hán-Nôm là rất quan trọng, giúp giữ gìn di sản cho các thế hệ sau.

10/07/2025
Khóa luận tốt nghiệp khoa học dữ liệu nhận diện ký tự hán nôm sử dụng deep learning

Trích đoạn nội dung tài liệu

Chương 1. Mở dau: đặt ra các van dé, trình bày lý do thực hiện luận văn này để giải quyết các vấn đề được nêu. Tiếp đến là thiết lập các mục tiêu cần đạt được. Cuối cùng, giới thiệu sơ lược nội dung của từng chương trong luận văn.

Tổng quan: giới thiệu về đề tài số hóa các văn bản cũ được viết tay bằng chữ Hán Nôm. Đặc biệt là tính ứng dụng thực tế của đề tài này trong việc lữu trữ tài liệu lịch sử. Nghiên cứu liên quan: giới thiệu các công trình nghiên cứu trong và ngoài nước liên quan đến quy trình xây dựng dữ liệu, các phương pháp được sử dụng để giải quyết bài toán phát hiện và nhận dạng chữ viết tay trong các văn bản cũ. Cơ sở lý thuyết: trình bày các kiến thức nền tảng mà chúng tôi áp dụng dé xây dựng các phương pháp tiếp cận nhằm mục đích giải quyết các bài toán đã đặt ra trong đề tài này.

Bộ dữ liệu NomNaOCR: trình bày quy trình xây dựng bộ dữ liệu đạt chuẩn và có chất lượng tốt cũng như thực hiện thông kê chỉ tiết và phân tích các đặc điểm của dữ liệu, từ đó làm tiền dé dé phát triển các phương pháp cho bài toán đã đặt ra trên bộ dữ liệu này. Các phương pháp tiếp cận: trình bày các hướng tiếp cận mà chúng tôi đã nghiên cứu và áp dụng trên bộ dữ liệu NomNaOCR cho bài toán phát hiện và nhận dạng các ký tự Hán Nôm viết tay trong các văn bản cũ. Cài đặt thử nghiệm: trình bày các bước thiết lập cùng cài đặt chi tiết cho các siêu tham số và thiết bị dùng dé huấn luyện các mô hình. Đánh giá và kết quả: trình bày các kết quả mà chúng tôi đã thu được đồng thời thực hiện đánh giá, giải thích các kết qua đạt được đó và phân tích các lỗi của mô hình tốt nhất khi dự đoán trên bộ dữ liệu NomNaOCR.

Kết luận và hướng phát triển: tông kết các thành qua đã đạt được va đề xuất các phương pháp trong tương lai dé cải thiện hiệu suất của mô hình. Giới thiệu đề tài Sự cần thiết của việc số hóa đang tăng lên nhanh chóng trong thời kỳ hiện đại. Do sự phát triển của thông tin, các công nghệ kết nối và sự sẵn có rộng rãi của các thiết bị cầm tay, mọi người thường thích nội dung số hóa hơn các tài liệu in, bao gồm cả sách và báo. Ngoài ra, việc tổ chức dữ liệu số hóa và phân tích chúng cho các mục đích khác nhau cũng trở nên dễ dàng hơn nhờ các kỹ thuật tiên tiến như trí tuệ nhân tạo,.

Vì vậy, dé theo kịp với bối cảnh công nghệ hiện nay, cần phải chuyển đổi tất cả các thông tin hiện tại từ định dạng 1n sang định dạng số hóa. Thật vậy, việc số hóa các tài liệu ở định dạng giấy là vô cùng quan trọng, đặc biệt là các tài liệu lịch sử có ý nghĩa rất lớn đối với việc bảo tồn di sản văn hóa. Vì thế, nhận thức được tầm quan trọng và tính cấp bách của việc số hóa các tài liệu lịch sử trên thế giới đã và đang nhận được sự quan tâm và thu hút của nhiều nhà nghiên cứu. Tại Hàn Quốc, Kim và cộng sự đã phát triển một hệ thống số hóa hơn 10 triệu tài liệu Hanja viết tay - một loại chữ viết phô biến ở Hàn Quốc cho đến cuối thế kỷ thứ 9 [2].

Tại Trung Quốc, công ty Digital Heritage Publishing Ltd.000 tập tương đương 4,7 triệu trang của Tứ khó toàn thư - bộ sách lớn nhất do 361 học gia thoi Can Long biên soạn [3]. Tại Việt Nam, từ thé kỷ 10 đến thế ky 20, một số lượng rat lớn các tài liệu đều được ghi chép bằng chữ Nôm - một hệ thống chữ viết cũ của Việt Nam và vẫn đang được lưu trữ trong các đình, chùa, và thư viện. Hiện tại, các tác phẩm lịch sử vô giá này đang có nguy cơ bị mai một, khó dé tiếp cận đến được các thé hệ sau và đang dần bị xuống cấp, hầu hết chưa được số hóa. Bên cạnh đó, số học giả hiểu biết và doc được các văn bản này ngày cũng ít dần.

Vì vậy, tại Việt Nam cũng đã có một số công trình nghiên cứu như [4] hay [5] nhằm mục đích giải quyết các vấn đề trên nhưng vẫn còn nhiều hạn chế. Đặc biệt là chưa có công trình nao cung cấp được một bộ dữ liệu đủ tốt đề phục vụ cho cả 2 bài toán phát hiện và nhận dạng các ký tự Hán Nôm việt tay nhăm sô hóa các tài liệu lịch sử ở Việt Nam. Bài toán phát hiện và nhận dạng các ký tự Hán Nôm trong các văn bản lịch sử cũ là một nhiệm vụ đầy thách thúc, có sự thu hút với giới học thuật. Trong khóa luận này, chúng tôi sẽ tập trung giải quyết cả 2 nhiệm vụ trên.

Như vậy, với một trường hợp cụ thể là một trang giấy viết tay bằng chữ Hán Nôm, các nhiệm vụ sẽ được định nghĩa như sau: e au vào: Ảnh quét của trang văn bản viết tay bang các ký tự Hán Nôm. e Đầu ra: Các chuỗi ký tự Hán-Nôm tương ứng có trong ảnh đầu vào đó dưới dạng kỹ thuật SỐ. Tính ứng dụng của đề tài Các tài liệu lịch sử ghi lại nhiều thăng trầm và biến động hay cả những bài học quý giá của cha ông trải dài trong quá khứ đều được chép lại bằng chữ Hán Nôm. Vì vậy, việc số hóa các văn bản cũ đó còn là trách nhiệm, góp phần bảo tồn và gìn giữ những giá trị nước nhà.

Nhưng hiện nay, các văn bản này vẫn còn đang được lưu trữ chủ yếu ở định dạng giấy, và đang ngày càng xuống cấp. Dé số hóa được chúng, cần các tổ chức bảo tồn thực hiện nhập liệu một cách thủ công, nhưng sức người thì lại có hạn và số lượng người có thé hiệu dé mà viết được thì lại càng hạn chế. Dẫn đến chi phí cho việc bảo tồn các văn bản này là rất cao hay xa hơn nữa là khiến sự tiếp cận của những người yêu thích chữ Hán-Nôm nói riêng và lịch sử Việt Nam nói chung sẽ bị hạn chế, kéo theo việc những người hiểu biết về loại chữ này đã ít nay còn ít hơn. Vì vậy, cần có một công cụ có thé trợ giúp các tổ chức chuyển đổi từ việc số hóa thủ công sang số hóa một cách tự động, từ đó giúp tiết kiệm được phần lớn thời gian và công sức.

Do đó, tính ứng dụng của đề tài này là cấp thiết, nên chúng tôi tập trung vào cả 2 nhiệm vụ phát hiện và nhận dang các ky tự Hán Nôm viết tay, có thé hiểu đơn giản là khi ảnh quét của một trang văn bản cũ chứa các ký tự Hán Nôm được đưa ra, phương pháp của chúng tôi sẽ chỉ ra các vị trí cụ thể của các văn bản trong hình và trích xuất các ký tự Hán Nôm trong đó một cách tự động dưới dạng kỹ thuật số. Thách thức Nhìn chung, các bài toán về phát hiện và nhận dạng các ký tự Hán Nôm có rất nhiều vấn đề khó khăn và thách thức. Trong phần phát hiện, các vùng ảnh có văn bản thì các đối tượng cần phát hiện là các ký tự có kích thước nhỏ dẫn đến khó phát hiện hơn các bài toán phát hiện đối tượng đơn thuần. Các trang sách cũ viết bằng hệ thống chữ viết Hán Nôm có cấu trúc các câu được viết theo chiều dọc nhưng trong một cột có thể 2 hai cột nhỏ khác bên trong và năm rất sát nhau dẫn đến khá khó khăn trong việc phát hiện ranh giới giữa các vùng ảnh chứa văn bản.

Khác với bài toán phát hiện đối tượng thông thường, mật độ của các đối tượng trong ảnh khá thưa nhưng đối với các ảnh trong đề tài này thì có mật độ văn bản khá dày đặc, đây cũng là một thách thức không nhỏ cho việc phát hiện. Với bài toán nhận dạng các ký tự Hán Nôm, do các ảnh đã khá cũ nên các ký tự cũng bị phai mực theo thời gian, chất lượng giấy xuống cấp và 6 vàng, bi rách hay bị lem mực cũng là những vấn đề nan giải cho việc nhận dạng. Bên cạnh đó, giống với các hệ thống chữ viết khác của các nước như Trung Quốc, Hàn, Nhật thì chữ Nôm cũng là chữ tượng hình vì thế các nét trong mỗi ký tự là vô cùng quan trọng, việc thiếu dù chỉ một nét nhỏ cũng có thé dẫn đến một nghĩa khác hoặc thậm chí không tồn tại. Cuối cùng, để tạo ra được một bộ dữ liệu chuẩn và tốt là không hề đơn giản, đặc biệt là bộ dữ liệu dành cho cả 2 bài toán nêu trên, vì các thành viên trong nhóm không được học về chữ Hán Nôm nên không thể đánh máy cũng như là viết được các chữ này.

Bênh cạnh đó, chi phi cho việc gán nhãn trực tiếp các ký tự vào các vùng ảnh chứa văn bản là quá lớn và tôn nhiêu thời gian. NGHIÊN CỨU LIÊN QUAN 3. Tình hình nghiên cứu trên thế giới Những năm gần đây, công việc chuyên đổi số đang rất được quan tâm trên toàn thế giới. Trong đó, công cuộc số hóa văn bản giấy đang được đây mạng và phát triển không ngừng.

Cùng với sự bức phá về các kỹ thuật học máy và học sâu, việc số hóa văn bản đã va dang đạt được những thành tựu nhất định, góp phần day mạnh nhanh chóng công việc chuyền đổi số. Vì vậy, 2 bài toán phát hiện (Detection) và nhận dạng (Recognition) văn bản đang thu hút rất lớn các nhà nghiên cứu và doanh nghiệp. Tuy nhiên, sự kết hợp cho cả 2 bài toán này là một nhiệm vụ đầy thách thức và đóng vai trong quan trọng trong nhiều lĩnh vực. Vì thế, nhiều công trình liên quan đến chủ đề này đã được công bó.

Đối với riêng các hình ảnh tài liệu lịch sử, việc số hóa có ý nghĩa rất quan trọng đối cho mục đích bảo tồn di sản văn hóa. Hơn nữa, việc thu được các ký tự kỹ thuật số từ hình ảnh văn bản trong quá trình số hóa là cần thiết để cung cấp khả năng truy cập thông tin hiệu quả vào nội dung của các tài liệu này. Nhận dạng văn bản viết tay đã trở thành một chủ đề nghiên cứu quan trọng trong các lĩnh vực xử lý hình ảnh và ngôn ngữ. Vì thế với việc xây dựng các bộ dữ liệu và phát triển các mô hình, trên thế giới cũng đã có một số nghiên cứu tiêu biểu cho chủ đề này.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ