Tổng quan nghiên cứu
Chữ Nôm là di sản văn hóa thiêng liêng ghi lại lịch sử hàng nghìn năm của dân tộc Việt Nam, với cứ liệu khắc chữ Nôm sớm nhất được ghi nhận trên văn bia quả chuông Vân Bản từ năm 1076. Trong hệ thống chuẩn quốc tế Unicode và ISO 10646, kho tàng văn tự Nôm đã được xác lập vị trí với 5.067 ký tự trùng hình với chữ Hán, 4.232 chữ thuần Nôm cùng hơn 2.200 chữ đang tiếp tục được đề xuất chuẩn hóa. Tuy nhiên, phần lớn thế hệ hiện đại gặp rào cản lớn trong việc tiếp cận và đọc hiểu các văn bản cổ này. Sự phát triển vượt bậc của công nghệ nhận dạng ký tự quang học (OCR) trên thiết bị di động mở ra giải pháp bảo tồn và diễn giải di sản văn hóa một cách trực quan, nhanh chóng.
Trước đây, các công cụ nhận dạng chữ Nôm của nhóm nghiên cứu LES thuộc Trường Đại học Công nghệ - Đại học Quốc gia Hà Nội mới chỉ vận hành trên máy tính để bàn (PC) với bộ dữ liệu NOM-DB0 gồm 495 ký tự, đạt độ chính xác khoảng 96% nhưng đòi hỏi đầu vào là ảnh đơn ký tự đã qua nhị phân hóa hoàn hảo. Khi đưa bài toán này lên điện thoại thông minh, ảnh chụp thực tế bằng camera thường xuyên chịu tác động tiêu cực từ góc chụp nghiêng, ánh sáng không đồng đều và độ phân giải không đồng nhất.
Nghiên cứu của tác giả Nguyễn Văn Bách tập trung giải quyết triệt để khâu tiền xử lý ảnh chữ Nôm trên nền tảng Android. Luận văn hướng đến mục tiêu xây dựng một chuỗi thuật toán hoàn chỉnh bao gồm nhị phân hóa tự động, phát hiện và hiệu chỉnh góc nghiêng, cùng kỹ thuật phân đoạn tách ký tự chính xác. Hệ thống tiền xử lý được tích hợp trong mô hình Client-Server thời gian thực, cho phép người dùng chỉ cần chụp ảnh tài liệu trên điện thoại là có thể trích xuất chính xác từng khối chữ và hiển thị nghĩa tiếng Việt tương ứng ngay trên màn hình.
Cơ sở lý thuyết và phương pháp nghiên cứu
Khung lý thuyết áp dụng
Nghiên cứu vận dụng quy trình nhận dạng ký tự quang học tiêu chuẩn gồm 4 giai đoạn nền tảng: tiền xử lý ảnh, trích chọn đặc trưng, phân loại nhận dạng và hậu xử lý kết quả. Trọng tâm của đề tài đặt vào giai đoạn tiền xử lý với việc phối hợp các lý thuyết xử lý ảnh số và hình thái học:
- Lý thuyết nhị phân hóa ngưỡng toàn cục: Ứng dụng giải thuật phân ngưỡng Otsu nhằm tối ưu hóa việc phân tách điểm ảnh nội dung (foreground) và nền (background). Thuật toán duyệt qua 256 mức xám (từ mức 0 đến 255) để tìm giá trị ngưỡng tối ưu giúp tối thiểu hóa phương sai trong lớp và tối đa hóa phương sai giữa các lớp.
- Lý thuyết phân đoạn ảnh qua phép chiếu Histogram: Dựa trên đặc thù hình thái của chữ Nôm là chữ tượng hình khối vuông, được viết theo quy tắc gióng hàng dọc và hàng ngang đồng đều. Phép chiếu biểu đồ tần suất mức xám theo trục hoành và trục tung được sử dụng để xác định các điểm thung lũng (minima), từ đó vạch ra các đường bao phân cách giữa các ký tự.
- Lý thuyết biến đổi hình thái học số: Tích hợp các toán tử cơ bản như xói mòn (erosion), giãn nở (dilation), mở (opening), đóng (closing) và trích xuất khung xương (skeletonization) với các mặt nạ ma trận kích thước 3x3 nhằm khử nhiễu đốm và làm mịn nét chữ.
- Kiến trúc phần mềm phân tán: Mô hình Client-Server kết hợp mẫu thiết kế Model-View-Controller (MVC) trên hệ điều hành Android, truyền nhận dữ liệu qua giao thức web service SOAP 1.1.
Phương pháp nghiên cứu
Nghiên cứu sử dụng phương pháp thực nghiệm kết hợp định lượng để đánh giá hiệu năng của từng thuật toán:
- Nguồn dữ liệu và cỡ mẫu: Đề tài xây dựng tập mẫu kiểm thử gồm 150 kịch bản thực nghiệm từ 5 tập ảnh văn bản chữ Nôm đại diện. Dữ liệu nhận dạng phía máy chủ được kết nối với cơ sở dữ liệu NOM-DB0 gồm 495 ký tự mẫu chuẩn đã được huấn luyện.
- Phương pháp chọn mẫu: Tác giả áp dụng phương pháp chọn mẫu thực nghiệm phân tầng có chủ đích (purposive stratified sampling). Mẫu bao gồm các dạng văn bản in rõ nét trên nền trắng chuẩn, tài liệu in trên nền xám mô phỏng giấy cũ mục nát, cùng các tập ảnh được xoay nhân tạo ở 18 cấp độ góc nghiêng khác nhau từ 1 độ đến 30 độ về cả hai phía trái và phải.
- Lý do lựa chọn phương pháp phân tích: Thuật toán Otsu và phép chiếu histogram ngang dọc được lựa chọn vì có độ phức tạp thuật toán thấp, chỉ ở mức O(n^2), giúp tiết kiệm tài nguyên vi xử lý và bộ nhớ RAM trên thiết bị di động thời điểm thực hiện nghiên cứu. Đồng thời, giải thuật phát hiện góc nghiêng đề xuất tận dụng điểm đen biên trái ngoài cùng I(x,y) giúp tối ưu hóa thời gian xử lý cục bộ trên điện thoại trước khi truyền ảnh lên máy chủ.
Kết quả nghiên cứu và thảo luận
Những phát hiện chính
Quá trình thực nghiệm diện rộng trên ứng dụng Android đã mang lại những kết quả định lượng cụ thể:
- Độ chính xác phát hiện và chỉnh nghiêng vượt trội: Trong tổng số 150 ca kiểm thử góc nghiêng (từ 1 độ đến 30 độ), thuật toán đề xuất đạt độ chính xác 96%, tương ứng với 144 trường hợp phát hiện và căn chỉnh góc xoay với sai số dưới 1 độ.
- Xác định nguyên nhân gây sai số biên: Phân tích 6 trường hợp phát hiện sai góc nghiêng cho thấy có tới 5 trường hợp (chiếm 83,33% tổng số ca lỗi) bắt nguồn từ ảnh đầu vào có quá ít hàng chữ (dưới 3 hàng), khiến giải thuật thiếu các điểm tựa biên trái để tính toán vector góc dốc chính xác.
- Hiệu năng phân đoạn và truyền tải tối ưu: Phép chiếu histogram ngang dọc phân tách thành công 100% các ký tự đối với các khối văn bản được chụp thẳng hàng và giữ khoảng cách nét rõ ràng. Quá trình tiền xử lý trực tiếp tại thiết bị di động giúp giảm hơn 70% dung lượng dữ liệu cần tải lên máy chủ thông qua giao thức SOAP 1.1 so với việc gửi toàn bộ ảnh màu độ phân giải cao ban đầu.
Thảo luận kết quả
Thuật toán phân ngưỡng Otsu chứng minh tính ổn định cao khi xử lý ảnh chữ Nôm trên nền xám phức tạp. Ngưỡng phân tách tự động thích ứng chính xác theo biểu đồ histogram phân bố mức xám hai đỉnh, giữ trọn vẹn các nét thanh, nét đậm của chữ Nôm mà không làm đứt gãy cấu trúc nét viết.
Dữ liệu thực nghiệm có thể được tổng hợp trực quan qua biểu đồ cột thể hiện tỷ lệ nhận dạng thành công theo từng dải góc nghiêng từ 1 độ đến 30 độ và bảng ma trận phương sai Otsu phân tách rõ nét giữa vùng nền và vùng ký tự. Khi so sánh với thuật toán gốc của Wojciech Bieniecki vốn được thiết kế cho hệ chữ Latinh liên tục, giải thuật cải tiến của luận văn đã khắc phục hiệu quả hiện tượng trôi điểm biên khi khoảng cách dòng dx biến thiên lớn.
Tuy nhiên, giới hạn của phương pháp xuất hiện khi chữ Nôm được viết dính nét hoặc khoảng cách giữa các hàng quá sát nhau. Khi đó, biểu đồ histogram không tạo ra các điểm đáy phân cách rõ rệt, dẫn đến việc phân đoạn bị dính cụm từ. Đây là bài toán tiền đề cần tiếp tục kết hợp các kỹ thuật phân vùng thích nghi cục bộ và phân tích thành phần liên thông trong các giai đoạn phát triển tiếp theo.
Đề xuất và khuyến nghị
Dựa trên kết quả nghiên cứu thực nghiệm, luận văn đưa ra 4 giải pháp trọng tâm nhằm hoàn thiện hệ thống nhận dạng chữ Nôm di động:
- Tích hợp động cơ nhận dạng ngoại tuyến (Offline Engine) trực tiếp trên điện thoại: Nhóm kỹ sư phần mềm cần chuyển đổi mô hình mạng nơ-ron sang các định dạng nhúng tối ưu hóa, loại bỏ hoàn toàn sự phụ thuộc vào đường truyền Internet, rút ngắn thời gian phản hồi xuống dưới 200 mili-giây trong quý 2 năm tới.
- Nâng cấp thuật toán chỉnh méo phối cảnh 3D (Perspective Correction): Nhóm nghiên cứu xử lý ảnh cần tích hợp thêm phép biến đổi Hough và phân tích đường viền bao (Contour Analysis) nhằm nâng tỷ lệ nhận diện góc nghiêng cho văn bản dưới 3 dòng từ mức 96% lên trên 99% trong vòng 6 tháng.
- Bổ sung bộ lọc thích nghi xử lý tài liệu Hán Nôm cổ: Các viện nghiên cứu ngôn ngữ và công nghệ thông tin cần hợp tác chuẩn hóa bộ lọc Gaussian đa tầng kết hợp lọc trung vị thích nghi, hướng tới mục tiêu nâng tỷ lệ tách nét tài liệu ố vàng, mủn rách lên trên 95% trong lộ trình 1 năm.
- Mở rộng kho ngữ liệu nhận dạng toàn diện: Nhóm phát triển cần tiến hành số hóa và gán nhãn toàn bộ hơn 9.200 ký tự Nôm theo chuẩn Unicode thay vì giới hạn ở mức 495 ký tự của kho mẫu hiện tại, hoàn thành trong giai đoạn 18 tháng.
Đối tượng nên tham khảo luận văn
Công trình nghiên cứu mang giá trị tham khảo chuyên sâu và ứng dụng thực tiễn cao cho 4 nhóm đối tượng:
- Sinh viên và học viên cao học ngành Công nghệ Thông tin, Kỹ thuật Phần mềm: Nắm vững kiến trúc triển khai ứng dụng xử lý ảnh thực tế trên Android kết hợp Web Service phân tán, cùng cách tiếp cận thiết kế mẫu MVC chuẩn mực.
- Kỹ sư phát triển ứng dụng di động và Thị giác máy tính: Tham khảo mã nguồn thiết kế các bộ lọc nhị phân hóa Otsu, kỹ thuật chiếu histogram phân đoạn văn bản và phương pháp kiểm thử đơn vị tự động trên thiết bị di động.
- Các nhà nghiên cứu Hán Nôm học và Bảo tồn di sản: Tìm kiếm giải pháp công nghệ tiếp cận nhanh chóng các văn bản cổ, phục vụ công tác điền dã, dịch thuật bia ký và gia phả dòng họ ngay tại thực địa.
- Đơn vị quản lý văn hóa, bảo tàng và thư viện số: Định hình quy trình số hóa hiện đại hóa tài liệu lịch sử, xây dựng các trạm tra cứu thông tin di sản tự động phục vụ cộng đồng và du khách quốc tế.
Câu hỏi thường gặp
-
Tại sao bước tiền xử lý lại đóng vai trò quyết định trong nhận dạng ký tự chữ Nôm? Theo phân tích học thuật, có đến 4 trong 6 nhân tố chính ảnh hưởng đến chất lượng OCR (độ phân giải scan, chất lượng giấy, độ tương phản và nhiễu môi trường) hoàn toàn có thể được khắc phục tại bước tiền xử lý. Tiền xử lý tốt giúp chuẩn hóa nét chữ, loại bỏ bóng mờ và giúp bộ nhận dạng phía sau đạt độ chính xác tối ưu.
-
Thuật toán Otsu xử lý việc nhị phân hóa ảnh chữ Nôm như thế nào? Giải thuật Otsu tự động phân tích biểu đồ histogram 256 mức xám của bức ảnh, tính toán phương sai giữa các lớp điểm ảnh nền và ký tự. Ngưỡng nhị phân được chọn tại điểm có phương sai giữa hai lớp là lớn nhất, giúp tách hoàn toàn chữ Nôm màu đen nổi bật trên nền giấy xám hoặc trắng.
-
Thuật toán chỉnh nghiêng đề xuất có điểm gì cải tiến so với phương pháp của Wojciech Bieniecki? Phương pháp của Wojciech Bieniecki thường gặp sai số lớn khi văn bản có khoảng cách dòng rộng hoặc bố cục chữ thưa thớt. Luận văn đã cải tiến bằng cách chỉ xác định điểm đen ngoài cùng phía bên trái I(x,y), nhận diện hướng nghiêng nửa trên hoặc nửa dưới, sau đó quét dải điểm biên trái để xác định góc dốc chính xác nhất.
-
Vì sao hệ thống lựa chọn kiến trúc Client-Server thay vì xử lý toàn bộ trên điện thoại? Vào thời điểm nghiên cứu, động cơ nhận dạng chữ Nôm của nhóm LES được tối ưu trên nền tảng PC với độ chính xác cao. Việc sử dụng Web Service qua giao thức SOAP 1.1 giúp giảm tải tính toán cho chip di động, tiết kiệm pin, đồng thời cho phép cập nhật thuật toán nhận dạng độc lập mà không cần nâng cấp ứng dụng client.
-
Ứng dụng xử lý thế nào khi ảnh chữ Nôm chụp có nền xám hoặc bị nhiễu? Chương trình tích hợp bộ lọc trung vị (Median Filter) để loại bỏ nhiễu hạt muối tiêu, kết hợp cùng thuật toán Otsu toàn cục để chuyển ảnh xám về ảnh nhị phân sắc nét. Thực nghiệm cho thấy các mẫu chữ in trên nền xám nhân tạo vẫn đạt tỷ lệ nhị phân hóa và bóc tách ký tự chính xác.
Kết luận
- Luận văn đã giải quyết trọn vẹn chuỗi bài toán tiền xử lý ảnh chữ Nôm trên thiết bị di động Android bao gồm nhị phân hóa Otsu, phát hiện chỉnh nghiêng và phân đoạn ký tự.
- Đề xuất thành công thuật toán phát hiện và hiệu chỉnh góc nghiêng chuyên biệt cho chữ Nôm với độ chính xác thực nghiệm đạt 96% trên 150 ca thử nghiệm.
- Xây dựng hoàn chỉnh kiến trúc Client-Server dựa trên mô hình MVC, kết nối mượt mà giữa ứng dụng di động và Web Service nhận dạng chữ Nôm.
- Đóng góp giải pháp kỹ thuật có độ phức tạp thuật toán thấp O(n^2), vận hành tối ưu trên thiết bị phần cứng có tài nguyên giới hạn.
- Mở ra hướng nghiên cứu mới về việc đưa các công nghệ bảo tồn di sản Hán Nôm lên nền tảng di động trong lộ trình mở rộng cơ sở dữ liệu từ 12 đến 24 tháng tới.
Học viên, lập trình viên và các nhà nghiên cứu quan tâm đến lĩnh vực thị giác máy tính và bảo tồn văn hóa có thể kế thừa trực tiếp mô hình này để phát triển các ứng dụng dịch thuật di sản thông minh trong tương lai.