Chương 1. Mở dau: đặt ra các van dé, trình bày lý do thực hiện luận văn này để giải quyết các vấn đề được nêu. Tiếp đến là thiết lập các mục tiêu cần đạt được. Cuối cùng, giới thiệu sơ lược nội dung của từng chương trong luận văn.
Tổng quan: giới thiệu về đề tài số hóa các văn bản cũ được viết tay bằng chữ Hán Nôm. Đặc biệt là tính ứng dụng thực tế của đề tài này trong việc lữu trữ tài liệu lịch sử. Nghiên cứu liên quan: giới thiệu các công trình nghiên cứu trong và ngoài nước liên quan đến quy trình xây dựng dữ liệu, các phương pháp được sử dụng để giải quyết bài toán phát hiện và nhận dạng chữ viết tay trong các văn bản cũ. Cơ sở lý thuyết: trình bày các kiến thức nền tảng mà chúng tôi áp dụng dé xây dựng các phương pháp tiếp cận nhằm mục đích giải quyết các bài toán đã đặt ra trong đề tài này.
Bộ dữ liệu NomNaOCR: trình bày quy trình xây dựng bộ dữ liệu đạt chuẩn và có chất lượng tốt cũng như thực hiện thông kê chỉ tiết và phân tích các đặc điểm của dữ liệu, từ đó làm tiền dé dé phát triển các phương pháp cho bài toán đã đặt ra trên bộ dữ liệu này. Các phương pháp tiếp cận: trình bày các hướng tiếp cận mà chúng tôi đã nghiên cứu và áp dụng trên bộ dữ liệu NomNaOCR cho bài toán phát hiện và nhận dạng các ký tự Hán Nôm viết tay trong các văn bản cũ. Cài đặt thử nghiệm: trình bày các bước thiết lập cùng cài đặt chi tiết cho các siêu tham số và thiết bị dùng dé huấn luyện các mô hình. Đánh giá và kết quả: trình bày các kết quả mà chúng tôi đã thu được đồng thời thực hiện đánh giá, giải thích các kết qua đạt được đó và phân tích các lỗi của mô hình tốt nhất khi dự đoán trên bộ dữ liệu NomNaOCR.
Kết luận và hướng phát triển: tông kết các thành qua đã đạt được va đề xuất các phương pháp trong tương lai dé cải thiện hiệu suất của mô hình. Giới thiệu đề tài Sự cần thiết của việc số hóa đang tăng lên nhanh chóng trong thời kỳ hiện đại. Do sự phát triển của thông tin, các công nghệ kết nối và sự sẵn có rộng rãi của các thiết bị cầm tay, mọi người thường thích nội dung số hóa hơn các tài liệu in, bao gồm cả sách và báo. Ngoài ra, việc tổ chức dữ liệu số hóa và phân tích chúng cho các mục đích khác nhau cũng trở nên dễ dàng hơn nhờ các kỹ thuật tiên tiến như trí tuệ nhân tạo,.
Vì vậy, dé theo kịp với bối cảnh công nghệ hiện nay, cần phải chuyển đổi tất cả các thông tin hiện tại từ định dạng 1n sang định dạng số hóa. Thật vậy, việc số hóa các tài liệu ở định dạng giấy là vô cùng quan trọng, đặc biệt là các tài liệu lịch sử có ý nghĩa rất lớn đối với việc bảo tồn di sản văn hóa. Vì thế, nhận thức được tầm quan trọng và tính cấp bách của việc số hóa các tài liệu lịch sử trên thế giới đã và đang nhận được sự quan tâm và thu hút của nhiều nhà nghiên cứu. Tại Hàn Quốc, Kim và cộng sự đã phát triển một hệ thống số hóa hơn 10 triệu tài liệu Hanja viết tay - một loại chữ viết phô biến ở Hàn Quốc cho đến cuối thế kỷ thứ 9 [2].
Tại Trung Quốc, công ty Digital Heritage Publishing Ltd.000 tập tương đương 4,7 triệu trang của Tứ khó toàn thư - bộ sách lớn nhất do 361 học gia thoi Can Long biên soạn [3]. Tại Việt Nam, từ thé kỷ 10 đến thế ky 20, một số lượng rat lớn các tài liệu đều được ghi chép bằng chữ Nôm - một hệ thống chữ viết cũ của Việt Nam và vẫn đang được lưu trữ trong các đình, chùa, và thư viện. Hiện tại, các tác phẩm lịch sử vô giá này đang có nguy cơ bị mai một, khó dé tiếp cận đến được các thé hệ sau và đang dần bị xuống cấp, hầu hết chưa được số hóa. Bên cạnh đó, số học giả hiểu biết và doc được các văn bản này ngày cũng ít dần.
Vì vậy, tại Việt Nam cũng đã có một số công trình nghiên cứu như [4] hay [5] nhằm mục đích giải quyết các vấn đề trên nhưng vẫn còn nhiều hạn chế. Đặc biệt là chưa có công trình nao cung cấp được một bộ dữ liệu đủ tốt đề phục vụ cho cả 2 bài toán phát hiện và nhận dạng các ký tự Hán Nôm việt tay nhăm sô hóa các tài liệu lịch sử ở Việt Nam. Bài toán phát hiện và nhận dạng các ký tự Hán Nôm trong các văn bản lịch sử cũ là một nhiệm vụ đầy thách thúc, có sự thu hút với giới học thuật. Trong khóa luận này, chúng tôi sẽ tập trung giải quyết cả 2 nhiệm vụ trên.
Như vậy, với một trường hợp cụ thể là một trang giấy viết tay bằng chữ Hán Nôm, các nhiệm vụ sẽ được định nghĩa như sau: e au vào: Ảnh quét của trang văn bản viết tay bang các ký tự Hán Nôm. e Đầu ra: Các chuỗi ký tự Hán-Nôm tương ứng có trong ảnh đầu vào đó dưới dạng kỹ thuật SỐ. Tính ứng dụng của đề tài Các tài liệu lịch sử ghi lại nhiều thăng trầm và biến động hay cả những bài học quý giá của cha ông trải dài trong quá khứ đều được chép lại bằng chữ Hán Nôm. Vì vậy, việc số hóa các văn bản cũ đó còn là trách nhiệm, góp phần bảo tồn và gìn giữ những giá trị nước nhà.
Nhưng hiện nay, các văn bản này vẫn còn đang được lưu trữ chủ yếu ở định dạng giấy, và đang ngày càng xuống cấp. Dé số hóa được chúng, cần các tổ chức bảo tồn thực hiện nhập liệu một cách thủ công, nhưng sức người thì lại có hạn và số lượng người có thé hiệu dé mà viết được thì lại càng hạn chế. Dẫn đến chi phí cho việc bảo tồn các văn bản này là rất cao hay xa hơn nữa là khiến sự tiếp cận của những người yêu thích chữ Hán-Nôm nói riêng và lịch sử Việt Nam nói chung sẽ bị hạn chế, kéo theo việc những người hiểu biết về loại chữ này đã ít nay còn ít hơn. Vì vậy, cần có một công cụ có thé trợ giúp các tổ chức chuyển đổi từ việc số hóa thủ công sang số hóa một cách tự động, từ đó giúp tiết kiệm được phần lớn thời gian và công sức.
Do đó, tính ứng dụng của đề tài này là cấp thiết, nên chúng tôi tập trung vào cả 2 nhiệm vụ phát hiện và nhận dang các ky tự Hán Nôm viết tay, có thé hiểu đơn giản là khi ảnh quét của một trang văn bản cũ chứa các ký tự Hán Nôm được đưa ra, phương pháp của chúng tôi sẽ chỉ ra các vị trí cụ thể của các văn bản trong hình và trích xuất các ký tự Hán Nôm trong đó một cách tự động dưới dạng kỹ thuật số. Thách thức Nhìn chung, các bài toán về phát hiện và nhận dạng các ký tự Hán Nôm có rất nhiều vấn đề khó khăn và thách thức. Trong phần phát hiện, các vùng ảnh có văn bản thì các đối tượng cần phát hiện là các ký tự có kích thước nhỏ dẫn đến khó phát hiện hơn các bài toán phát hiện đối tượng đơn thuần. Các trang sách cũ viết bằng hệ thống chữ viết Hán Nôm có cấu trúc các câu được viết theo chiều dọc nhưng trong một cột có thể 2 hai cột nhỏ khác bên trong và năm rất sát nhau dẫn đến khá khó khăn trong việc phát hiện ranh giới giữa các vùng ảnh chứa văn bản.
Khác với bài toán phát hiện đối tượng thông thường, mật độ của các đối tượng trong ảnh khá thưa nhưng đối với các ảnh trong đề tài này thì có mật độ văn bản khá dày đặc, đây cũng là một thách thức không nhỏ cho việc phát hiện. Với bài toán nhận dạng các ký tự Hán Nôm, do các ảnh đã khá cũ nên các ký tự cũng bị phai mực theo thời gian, chất lượng giấy xuống cấp và 6 vàng, bi rách hay bị lem mực cũng là những vấn đề nan giải cho việc nhận dạng. Bên cạnh đó, giống với các hệ thống chữ viết khác của các nước như Trung Quốc, Hàn, Nhật thì chữ Nôm cũng là chữ tượng hình vì thế các nét trong mỗi ký tự là vô cùng quan trọng, việc thiếu dù chỉ một nét nhỏ cũng có thé dẫn đến một nghĩa khác hoặc thậm chí không tồn tại. Cuối cùng, để tạo ra được một bộ dữ liệu chuẩn và tốt là không hề đơn giản, đặc biệt là bộ dữ liệu dành cho cả 2 bài toán nêu trên, vì các thành viên trong nhóm không được học về chữ Hán Nôm nên không thể đánh máy cũng như là viết được các chữ này.
Bênh cạnh đó, chi phi cho việc gán nhãn trực tiếp các ký tự vào các vùng ảnh chứa văn bản là quá lớn và tôn nhiêu thời gian. NGHIÊN CỨU LIÊN QUAN 3. Tình hình nghiên cứu trên thế giới Những năm gần đây, công việc chuyên đổi số đang rất được quan tâm trên toàn thế giới. Trong đó, công cuộc số hóa văn bản giấy đang được đây mạng và phát triển không ngừng.
Cùng với sự bức phá về các kỹ thuật học máy và học sâu, việc số hóa văn bản đã va dang đạt được những thành tựu nhất định, góp phần day mạnh nhanh chóng công việc chuyền đổi số. Vì vậy, 2 bài toán phát hiện (Detection) và nhận dạng (Recognition) văn bản đang thu hút rất lớn các nhà nghiên cứu và doanh nghiệp. Tuy nhiên, sự kết hợp cho cả 2 bài toán này là một nhiệm vụ đầy thách thức và đóng vai trong quan trọng trong nhiều lĩnh vực. Vì thế, nhiều công trình liên quan đến chủ đề này đã được công bó.
Đối với riêng các hình ảnh tài liệu lịch sử, việc số hóa có ý nghĩa rất quan trọng đối cho mục đích bảo tồn di sản văn hóa. Hơn nữa, việc thu được các ký tự kỹ thuật số từ hình ảnh văn bản trong quá trình số hóa là cần thiết để cung cấp khả năng truy cập thông tin hiệu quả vào nội dung của các tài liệu này. Nhận dạng văn bản viết tay đã trở thành một chủ đề nghiên cứu quan trọng trong các lĩnh vực xử lý hình ảnh và ngôn ngữ. Vì thế với việc xây dựng các bộ dữ liệu và phát triển các mô hình, trên thế giới cũng đã có một số nghiên cứu tiêu biểu cho chủ đề này.