Tổng quan nghiên cứu
Trong bối cảnh chuyển đổi số toàn diện, công nghệ nhận dạng ký tự quang học đối với văn bản in tiếng Việt đã đạt độ chính xác ấn tượng trên 98% thông qua các giải pháp như phần mềm VnDocr 4.0 và 99% trên các hệ thống quốc tế như OmniPage. Tuy nhiên, đối với văn bản viết tay, bài toán nhận dạng vẫn gặp rào cản lớn khi độ chính xác phân đoạn thực tế thường sụt giảm xuống dưới mức 60%. Nguyên nhân chính bắt nguồn từ tính đa dạng trong nét viết tự do của con người, hiện tượng các ký tự viết liền dính nét liên tục và sự xuất hiện dày đặc của hệ thống dấu thanh phụ âm tiếng Việt.
Luận văn thạc sĩ khoa học máy tính với đề tài nghiên cứu phương pháp cắt chữ dính viết tay tiếng Việt của tác giả Đào Minh Thắng, dưới sự hướng dẫn khoa học của Phó Giáo sư Tiến sĩ Ngô Quốc Tạo, tập trung giải quyết triệt để mắt xích khó khăn nhất trong quy trình nhận dạng chữ viết tay: phân đoạn chính xác các ký tự bị dính liền. Mục tiêu trọng tâm của đề tài là khảo sát đặc trưng ngữ âm học và cấu trúc chữ Quốc ngữ, phân tích các thuật toán xử lý ảnh hình thái học, từ đó đề xuất giải pháp phân tách ký tự dính dựa trên cấu trúc nét và khung xương ảnh mà không làm biến dạng hình học của ký tự gốc.
Nghiên cứu được triển khai và hoàn thành vào năm 2016 tại Trường Đại học Công nghệ Thông tin và Truyền thông thuộc Đại học Thái Nguyên, phục vụ trực tiếp cho đề tài phát triển hệ thống thiết bị đeo tay hỗ trợ đọc sách tiếng Việt dành cho người khiếm thị mang mã số VAST01. Kết quả của luận văn mang lại giá trị học thuật và ứng dụng to lớn, giúp nâng cao hơn 30% hiệu quả phân đoạn tiền xử lý, tạo tiền đề vững chắc để cải thiện tỷ lệ nhận dạng ký tự quang học viết tay tiếng Việt trong thực tế.
Cơ sở lý thuyết và phương pháp nghiên cứu
Khung lý thuyết áp dụng
Nghiên cứu xây dựng trên nền tảng ba trụ cột lý thuyết chuyên sâu:
Thứ nhất là lý thuyết ngôn ngữ học và cấu trúc âm tiết chữ Quốc ngữ. Tiếng Việt là ngôn ngữ đơn lập với kho ngữ liệu thống kê gồm 6.178 âm tiết cơ bản, trong đó có 1.536 âm tiết Hán-Việt chiếm tỷ lệ khoảng 23%. Chữ Quốc ngữ sử dụng bộ ký tự Latinh kết hợp hệ thống 5 dấu thanh và các dấu phụ phức tạp, khiến việc phân bố mật độ điểm ảnh theo chiều ngang và chiều dọc có sự đan xen cao, dễ gây nhiễu khi xác định biên giới từ.
Thứ hai là mô hình nhận dạng mẫu đa tầng trong công nghệ thị giác máy tính. Chu trình xử lý tài liệu tiêu chuẩn gồm 5 giai đoạn liên hoàn: Quét và thu nhận ảnh đầu vào, Tiền xử lý (khử nhiễu, nhị phân hóa, chỉnh nghiêng), Phân đoạn tách chữ (Segmentation), Trích chọn véc-tơ đặc trưng, và Nhận dạng bằng các mô hình máy học như véc-tơ hỗ trợ SVM, mạng nơ-ron hoặc mô hình Markov ẩn HMM kết hợp Hậu xử lý từ điển. Trong đó, khâu phân đoạn tách chữ dính đóng vai trò then chốt quyết định chất lượng của toàn bộ hệ thống.
Thứ ba là lý thuyết xử lý ảnh hình thái học và làm mảnh song song. Đề tài vận dụng thuật toán làm mảnh song song Zhang-Suen để rút gọn độ dày nét chữ về khung xương có kích thước đúng 1 pixel, đồng thời bảo toàn toàn vẹn tính liên thông tô-pô của các nét ký tự.
Phương pháp nghiên cứu
Nguồn dữ liệu thực nghiệm được thu thập từ hơn 500 mẫu quét tài liệu chữ viết tay tiếng Việt tự nhiên và chữ viết tay hạn chế trên các biểu mẫu khảo sát thực tế. Phương pháp chọn mẫu tập trung vào các trường hợp xuất hiện tổ hợp ký tự dính phức tạp như chuỗi ký tự o-a, u-n, c-h, đồng thời khảo sát tập trung 575 âm tiết chứa cặp phụ âm đầu đối lập ch và tr (gồm 343 âm tiết chứa phụ âm ch và 232 âm tiết chứa phụ âm tr) để đánh giá khả năng phân tách ranh giới ngữ nghĩa.
Phương pháp phân tích kết hợp giữa phân tích lược đồ hình chiếu dọc và hình chiếu ngang (Projection Profile) với phép biến đổi Hough (Hough Transform) nhằm phát hiện và hiệu chỉnh góc nghiêng văn bản với độ lệch sai số dưới 0,5 độ. Tiếp theo, hệ thống tiến hành trích xuất các điểm nối biên liên kết (junction points), phân tích vùng trắng hình học và thiết lập thuật toán cắt nét theo đường gấp khúc phi tuyến tính. Toàn bộ giải thuật được lập trình và cài đặt trên môi trường Microsoft Visual Studio bằng ngôn ngữ C++. Toàn bộ quá trình nghiên cứu, xây dựng thuật toán và kiểm thử thực nghiệm được thực hiện liên tục trong khung thời gian từ năm 2015 đến năm 2016.
Kết quả nghiên cứu và thảo luận
Những phát hiện chính
Quá trình kiểm nghiệm mô hình trên tập dữ liệu ảnh thực tế mang lại ba phát hiện quan trọng:
Thứ nhất, việc kết hợp thuật toán biến đổi Hough với phân tích lược đồ hình chiếu ngang và dọc giúp tự động phát hiện chính xác góc nghiêng dòng chữ với tỷ lệ thành công đạt 94,8%, vượt trội hơn 15,3% so với phương pháp phân tích hình chiếu truyền thống khi chưa hiệu chỉnh góc nghiêng.
Thứ hai, thuật toán làm mảnh song song Zhang-Suen chứng minh hiệu năng xử lý vượt trội khi rút gọn khung xương ký tự với thời gian trung bình chỉ 42 mili-giây trên mỗi mẫu ảnh chữ, đồng thời bảo toàn được 98,2% các đặc tính tô-pô hình học cốt lõi, loại bỏ hoàn toàn các điểm pixel dư thừa mà không gây đứt gãy nét viết.
Thứ ba, giải pháp xác định điểm nối liên kết kết hợp đường cắt gấp khúc đã tách thành công 88,6% các trường hợp chữ dính phức tạp, tiêu biểu như các cặp ký tự liền nét o-a hoặc d-a. Tỷ lệ cắt phạm làm tổn hại thân ký tự chính giảm mạnh xuống dưới 7,4%, thấp hơn đáng kể so với mức sai số 28,5% khi áp dụng phương pháp cắt bằng đường thẳng đứng cố định.
Thảo luận kết quả
Nguyên nhân tạo nên sự vượt trội của phương pháp nằm ở tính linh hoạt của đường cắt gấp khúc. Khác với đường cắt thẳng đứng vốn dễ cắt đôi thân các chữ cái có độ cong lớn như o, c, e, đường cắt gấp khúc bám sát theo cấu trúc hình học của khung xương sau khi làm mảnh, len lỏi qua các vùng nối mỏng giữa hai ký tự và men theo các vùng trắng tự nhiên.
Khi so sánh với các công bố học thuật trong nước và quốc tế, các công cụ thương mại như VnDocr hay OmniPage đạt độ chính xác từ 98% đến 99% trên văn bản in nhưng giảm sút nghiêm trọng khi tiếp cận chữ viết tay dính nét. Giải pháp đề xuất trong luận văn này đã giải quyết hiệu quả điểm nghẽn phân đoạn, tạo ra đầu vào chuẩn xác cho các bộ phân lớp nhận dạng tiếp theo.
Trong thực tế nghiên cứu, toàn bộ kết quả phân đoạn có thể được trực quan hóa qua biểu đồ cột so sánh tỷ lệ tách chữ thành công giữa đường cắt thẳng và đường cắt gấp khúc, kết hợp bảng số liệu ma trận thống kê thời gian làm mảnh ảnh trước và sau khi tối ưu hóa bộ nhớ đệm.
Đề xuất và khuyến nghị
Dựa trên kết quả nghiên cứu thực nghiệm, luận văn đề xuất 4 giải pháp trọng tâm nhằm hoàn thiện và phát triển ứng dụng:
Một là, nâng cấp mô hình phân đoạn bằng cách tích hợp mạng nơ-ron tích chập sâu kết hợp mạng hồi quy hai chiều BiLSTM, hướng tới mục tiêu tự động hóa hoàn toàn việc phát hiện điểm nối phức tạp và nâng tỷ lệ cắt chữ chính xác lên trên 96% trong lộ trình 12 tháng tới, do các nhóm nghiên cứu thị giác máy tính và trí tuệ nhân tạo đảm nhiệm.
Hai là, chuẩn hóa và mở rộng bộ dữ liệu mẫu chữ viết tay tiếng Việt quy mô lớn với hơn 10.000 mẫu chữ quét đa dạng độ tuổi, nghề nghiệp và kiểu chữ, nhằm tạo lập tập dữ liệu chuẩn cho cộng đồng nghiên cứu OCR trong nước, do Viện Công nghệ Thông tin phối hợp cùng các trường đại học triển khai trong vòng 6 tháng.
Ba là, tối ưu hóa mã nguồn thuật toán để nhúng trực tiếp vào vi điều khiển phần cứng của thiết bị đeo tay hỗ trợ người khiếm thị VAST01, đặt mục tiêu giảm độ trễ xử lý toàn chu trình xuống dưới 150 mili-giây trong thời hạn 9 tháng, do nhóm kỹ sư hệ thống nhúng phụ trách.
Bốn là, xây dựng mô-đun hậu xử lý ngôn ngữ học dựa trên kho ngữ liệu 6.178 âm tiết và mô hình xác suất n-gram, nhằm tự động phát hiện và hiệu chỉnh các lỗi chính tả ngữ cảnh sau khi tách chữ, thực hiện trong vòng 3 tháng bởi các chuyên viên xử lý ngôn ngữ tự nhiên.
Đối tượng nên tham khảo luận văn
Nội dung và kết quả của luận văn mang lại giá trị thiết thực cho 4 nhóm đối tượng chuyên môn:
Nhóm 1: Kỹ sư thị giác máy tính và lập trình viên trí tuệ nhân tạo. Luận văn cung cấp chi tiết thuật toán làm mảnh, cách tính toán ma trận điểm nối và mã nguồn xử lý ảnh, hỗ trợ trực tiếp cho việc xây dựng các công cụ OCR nhận dạng biểu mẫu viết tay tự động.
Nhóm 2: Học viên cao học và nghiên cứu sinh chuyên ngành Khoa học máy tính, Công nghệ thông tin. Tài liệu đóng vai trò là công trình tham khảo nền tảng về phương pháp luận xử lý ảnh hình thái học và kỹ thuật phân đoạn mẫu ký tự tiếng Việt.
Nhóm 3: Các đơn vị cung cấp giải pháp số hóa văn bản hành chính, ngân hàng và bảo hiểm. Nghiên cứu giúp nâng cao hiệu quả bóc tách dữ liệu tự động từ các hóa đơn, tờ khai y tế và hồ sơ viết tay, giảm thiểu 50% thời gian nhập liệu thủ công.
Nhóm 4: Các nhóm phát triển sản phẩm công nghệ hỗ trợ người yếu thế và cộng đồng người khiếm thị. Kiến trúc thuật toán có thể được tích hợp vào các thiết bị camera thông minh, giúp chuyển đổi nhanh chóng văn bản viết tay thành giọng nói với độ chính xác cao.
Câu hỏi thường gặp
Tại sao việc phân đoạn chữ viết tay tiếng Việt dính nét lại phức tạp hơn nhiều so với tiếng Anh?
Tiếng Việt sở hữu hệ thống dấu thanh và dấu phụ phong phú đặt phía trên hoặc phía dưới ký tự chính. Trong văn bản viết tay, các dấu này thường dính liền vào thân chữ cái hoặc chữ cái của dòng trên, tạo ra các liên kết giả mạo làm sai lệch nghiêm trọng thuật toán phân đoạn hình chiếu truyền thống.
Thuật toán làm mảnh song song Zhang-Suen đóng vai trò gì trong giải pháp của luận văn?
Thuật toán Zhang-Suen giúp loại bỏ các lớp pixel biên dư thừa, rút gọn nét chữ viết tay có độ dày không đồng đều về dạng khung xương mảnh có kích thước đúng 1 pixel trong thời gian chỉ 42 mili-giây, giúp việc xác định tọa độ các điểm nối giao nhau trở nên đơn giản và chính xác.
Làm thế nào để hệ thống phân biệt được điểm nối giữa hai ký tự dính với các nét uốn lượn tự nhiên của chữ cái?
Hệ thống kết hợp phân tích số lượng điểm lân cận trong cửa sổ ma trận làm mảnh, đối chiếu với lược đồ hình chiếu dọc và tính toán diện tích các vùng trắng bao bọc. Các điểm có mật độ liên kết vượt ngưỡng quy định nằm gần đáy nét lõm mới được xác thực là điểm cắt hợp lệ.
Phương pháp cắt chữ bằng đường gấp khúc mang lại ưu thế vượt trội nào so với đường cắt thẳng đứng?
Đường cắt thẳng đứng cố định thường làm đứt rời các phần cong của thân ký tự như chữ o, c, a, gây mất thông tin nhận dạng. Ngược lại, đường cắt gấp khúc di chuyển linh hoạt theo đường phân chia tự nhiên giữa hai nét chữ, giảm thiểu tỷ lệ tổn hại thân ký tự xuống dưới 7,4%.
Thuật toán của luận văn có thể tích hợp trực tiếp vào các ứng dụng thương mại hiện nay không?
Hoàn toàn có thể. Do được xây dựng bằng ngôn ngữ C++ với cấu trúc tối ưu hóa bộ nhớ và tốc độ xử lý nhanh, thuật toán dễ dàng được đóng gói thành các thư viện động để nhúng vào phần mềm số hóa tài liệu hoặc các thiết bị di động thông minh.
Kết luận
Năm đóng góp cốt lõi của công trình nghiên cứu bao gồm:
- Hệ thống hóa toàn diện cơ sở ngôn ngữ học chữ Quốc ngữ với 6.178 âm tiết và các thách thức đặc thù trong bài toán phân đoạn ký tự viết tay.
- Ứng dụng thành công thuật toán biến đổi Hough giúp nâng cao độ chính xác hiệu chỉnh góc nghiêng văn bản lên 94,8%.
- Tối ưu hóa thuật toán làm mảnh song song Zhang-Suen với thời gian xử lý nhanh 42 mili-giây và độ bảo toàn cấu trúc tô-pô đạt 98,2%.
- Đề xuất giải pháp phân tách chữ dính bằng đường cắt gấp khúc dựa trên cấu trúc điểm nối, đạt độ chính xác phân đoạn 88,6%.
- Đóng góp trực tiếp vào mô-đun tiền xử lý của đề tài thiết bị đeo tay đọc sách hỗ trợ người khiếm thị VAST01.
Kế hoạch phát triển tiếp theo tập trung vào việc kết hợp mạng nơ-ron học sâu và tích hợp từ điển ngữ nghĩa tiếng Việt trong 12 tháng tới. Hãy liên hệ với tác giả và nhóm nghiên cứu để cùng hợp tác phát triển và ứng dụng giải pháp này vào các hệ thống số hóa văn bản thực tế.