Tổng quan nghiên cứu

Trong kỷ nguyên số hóa giáo dục, việc chuyển đổi tài liệu khoa học kỹ thuật sang định dạng số có thể chỉnh sửa đang đối mặt với rào cản lớn khi hơn 80% tư liệu học thuật cũ vẫn lưu trữ dưới dạng bản in hoặc tệp ảnh tĩnh. Trở ngại lớn nhất nằm ở hàng nghìn biểu thức toán học phức tạp đan xen trong văn bản. Nhiệm vụ nhận dạng ảnh công thức toán học và chuyển thành mã LaTeX (Image-to-LaTeX) đóng vai trò then chốt nhằm tự động hóa quy trình biên tập, tái sử dụng và chia sẻ tri thức. Luận văn thạc sĩ ngành Khoa học máy tính của tác giả Lê Thị Giang, dưới sự hướng dẫn của Tiến sĩ Đàm Thanh Phương tại Đại học Thái Nguyên năm 2023, giải quyết trực tiếp thách thức này bằng công nghệ học sâu.

Mục tiêu cụ thể của đề tài là xây dựng mô hình mạng nơ-ron nhận dạng chính xác cấu trúc không gian hai chiều của công thức toán, giúp giảm 75% thời gian nhập liệu thủ công cho các nhà khoa học. Tác giả đã cải tiến mô hình chuỗi sang chuỗi bằng cách tích hợp mạng tích chập kết nối dày đặc (DenseNet) cho bộ mã hóa và cơ chế chú ý theo kênh - không gian (C-S Attention) cho bộ giải mã. Đề tài thực nghiệm trên tập dữ liệu chuẩn gồm 100.000 ảnh công thức trích xuất từ các ấn phẩm khoa học. Đóng góp này mang ý nghĩa thực tiễn sâu sắc, nâng tỷ lệ nhận dạng toàn vẹn lên trên 85%, thúc đẩy quá trình chuyển đổi số học thuật tại các trường đại học và viện nghiên cứu.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Đề tài kế thừa nền tảng lý luận từ bài toán nhận dạng ký tự quang học (OCR) và mô hình chuỗi sang chuỗi (Sequence-to-Sequence). Kiến trúc tổng thể gồm hai khối chính: bộ mã hóa trích xuất đặc trưng thị giác và bộ giải mã tạo chuỗi mã LaTeX đích. Luận văn áp dụng ba mô hình học sâu cốt lõi gồm: Mạng nơ-ron tích chập kết nối dày đặc (DenseNet), Mạng trí nhớ ngắn-dài hạn (LSTM) và Cơ chế chú ý kênh - không gian (C-S Attention).

Kiến trúc DenseNet thiết lập 3 khối dày đặc với tốc độ tăng trưởng 32 kênh mỗi tầng, giải quyết triệt để hiện tượng tiêu biến đạo hàm nhờ kết nối trực tiếp tất cả các tầng trước vào tầng sau. Bộ giải mã LSTM vận hành linh hoạt với 4 tầng cổng tương tác (gồm 3 cổng sigmoid và 1 cổng tanh) nhằm duy trì trạng thái ngữ cảnh dài hạn khi dự đoán từng từ mã. Ba khái niệm chuyên ngành nền tảng được phân tích sâu gồm: Bản đồ đặc trưng (Feature Map) phản ánh cấu trúc hình thái ký tự, Vùng nhận thức (Receptive Field) xác định phạm vi quan sát của bộ lọc tích chập, và Vector ngữ cảnh (Context Vector) kết hợp trọng số chú ý tại từng bước thời gian giải mã.

Phương pháp nghiên cứu

Nghiên cứu sử dụng nguồn dữ liệu thực nghiệm tiêu chuẩn quốc tế gồm 100.000 ảnh công thức toán học từ kho tài liệu khoa học mở. Cỡ mẫu nghiên cứu được ấn định ở mức 100.000 mẫu nhằm bảo đảm độ bao phủ toàn diện cho nhiều dạng biểu thức từ đơn giản đến phức tạp như tích phân, căn thức hay ma trận nhiều chiều. Phương pháp chọn mẫu phân tầng ngẫu nhiên được áp dụng để phân chia dữ liệu thành ba tập tách biệt: 80.000 mẫu huấn luyện (chiếm 80%), 10.000 mẫu kiểm định tham số (chiếm 10%) và 10.000 mẫu kiểm thử độc lập (chiếm 10%).

Lý do lựa chọn phương pháp phân tích định lượng bắt nguồn từ nhu cầu đánh giá toàn diện mô hình qua ba độ đo chuẩn mực: Tỷ lệ khớp chính xác (Exact Match), Điểm tương đồng ngữ nghĩa cú pháp (BLEU score) và Khoảng cách chỉnh sửa (Edit Distance). Bộ chỉ số này giúp đo lường đồng thời tính toàn vẹn cấu trúc vĩ mô lẫn sai lệch ký tự vi mô. Quá trình thực nghiệm được triển khai liên tục trong 12 tháng, từ tháng 8 năm 2022 đến tháng 8 năm 2023 tại Đại học Công nghệ Thông tin và Truyền thông - Đại học Thái Nguyên.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình thử nghiệm và so sánh giữa 4 mô hình thực nghiệm đã mang lại những kết quả định lượng nổi bật:

Thứ nhất, mô hình cải tiến kết hợp DenseNet và cơ chế chú ý C-S đạt điểm số BLEU ở mức 88,45%, tăng 4,15% so với mô hình cơ sở dùng mạng CNN 6 tầng tích chập (đạt 84,30%).

Thứ hai, độ đo khớp chính xác hoàn toàn (Exact Match) đạt 76,82%, cao hơn 6,52% so với mô hình cơ sở (đạt 70,30%), chứng minh khả năng tái tạo trọn vẹn cú pháp của các công thức nhiều tầng.

Thứ ba, khoảng cách chỉnh sửa trung bình (Edit Distance) giảm từ 15,20% xuống còn 10,45%, tương đương mức cải thiện độ chính xác ký tự đạt 31,25%, hạn chế tối đa sai lệch tại các vị trí chỉ số trên và chỉ số dưới.

Thứ tư, tốc độ xử lý đạt trung bình 0,18 giây cho mỗi ảnh công thức phức tạp, đồng thời giảm 25% số lượng tham số tính toán nhờ cơ chế tái sử dụng đặc trưng hiệu quả của mạng DenseNet.

Thảo luận kết quả

Hiệu quả vượt trội của mô hình xuất phát từ hai cải tiến then chốt. Cấu trúc kết nối dày đặc trong DenseNet bảo toàn các đường truyền đạo hàm và tái sử dụng đặc trưng liên tục, giúp mô hình phân biệt rõ nét các ký hiệu toán học kích thước nhỏ hoặc nét mảnh như dấu phẩy, dấu tích phân và ký tự Hy Lạp. Đồng thời, cơ chế chú ý C-S kết hợp song song giữa chú ý theo không gian và chú ý theo kênh, cho phép bộ giải mã tập trung chính xác vào vùng ảnh chứa ký tự mục tiêu tại mỗi bước thời gian.

So với các nghiên cứu công bố giai đoạn 2017 đến 2021 sử dụng mạng tích chập thông thường, kiến trúc cải tiến thể hiện năng lực vượt trội khi xử lý các biểu thức dài trên 50 ký tự. Về mặt trình bày trực quan, các dữ liệu thực nghiệm được minh họa rõ nét qua biểu đồ cột so sánh tương quan ba chỉ số EM, BLEU và khoảng cách chỉnh sửa giữa 4 mô hình nghiên cứu. Bên cạnh đó, một bảng thống kê chi tiết các siêu tham số huấn luyện (kích thước batch 32, tốc độ học 0,001) cùng hình ảnh kiểm thử thực tế trên các phương trình phức tạp như phương trình sóng và phương trình Navier-Stokes đã chứng minh độ tin cậy và khả năng ứng dụng thực tế cao của đề tài.

Đề xuất và khuyến nghị

Dựa trên kết quả nghiên cứu, tác giả đưa ra 4 giải pháp thiết thực nhằm đưa mô hình nhận dạng ký hiệu toán học vào ứng dụng thực tiễn:

Một là, nâng cấp hệ thống máy chủ tính toán chuyên dụng. Ban Giám hiệu nhà trường phối hợp cùng Trung tâm Công nghệ Thông tin cần đầu tư hệ thống máy chủ trang bị tối thiểu 4 cụm xử lý đồ họa GPU hiệu năng cao trong quý 1 năm 2024, nhằm rút ngắn thời gian huấn luyện mô hình từ 48 giờ xuống dưới 12 giờ.

Hai là, mở rộng quy mô dữ liệu công thức chữ viết tay. Nhóm nghiên cứu Khoa Công nghệ Thông tin cần tổ chức thu thập và gán nhãn bổ sung khoảng 50.000 mẫu công thức viết tay thực tế, hướng đến mục tiêu nâng tỷ lệ nhận dạng chính xác chữ viết tay đạt trên 82% trước tháng 9 năm 2024.

Ba là, phát triển công cụ tiện ích tích hợp trực tiếp vào phần mềm soạn thảo văn bản. Đội ngũ kỹ sư phần mềm của trường cần xây dựng plugin nhận diện một chạm trên nền tảng web và Microsoft Word, giúp cắt giảm thời gian số hóa bài giảng của giảng viên xuống dưới 5 giây mỗi trang tài liệu trong quý 4 năm 2024.

Bốn là, chuẩn hóa quy trình số hóa tư liệu học thuật cấp cơ sở. Phòng Đào tạo cùng Trung tâm Thư viện cần ban hành quy chế chuyển đổi số tài liệu, phấn đấu hoàn thành số hóa 100% kho giáo trình và bài giảng khoa học kỹ thuật sang định dạng LaTeX chuẩn trong giai đoạn 2024 đến 2026.

Đối tượng nên tham khảo luận văn

Kết quả nghiên cứu của luận văn mang lại giá trị tham khảo và ứng dụng thiết thực cho 4 nhóm đối tượng cụ thể:

Thứ nhất, giảng viên và nhà nghiên cứu trong lĩnh vực khoa học cơ bản. Nhóm đối tượng này có thể sử dụng mô hình để chuyển đổi nhanh các đề thi, bài tập và tài liệu PDF cũ sang mã nguồn LaTeX, giúp tiết kiệm tới 80% thời gian nhập liệu thủ công.

Thứ hai, sinh viên và học viên cao học ngành Khoa học máy tính hoặc Trí tuệ nhân tạo. Luận văn cung cấp tài liệu kỹ thuật chi tiết về cách kết hợp mạng DenseNet và cơ chế chú ý C-S, hỗ trợ phát triển các đề tài thị giác máy tính với khả năng tái sử dụng trên 70% cấu trúc mô hình.

Thứ ba, các trung tâm thư viện số và nhà xuất bản giáo dục. Đơn vị xuất bản có thể ứng dụng giải pháp để tự động hóa quy trình xử lý hàng nghìn trang giáo trình mỗi ngày, giảm 65% chi phí thuê nhân công biên tập công thức toán học.

Thứ tư, kỹ sư phát triển ứng dụng công nghệ giáo dục (EdTech). Các công ty phần mềm có thể tích hợp module này vào các ứng dụng giải toán thông minh qua camera, phục vụ nhu cầu học tập của hơn 100.000 học sinh, sinh viên trên cả nước.

Câu hỏi thường gặp

Bài toán Image2Latex khác biệt gì so với nhận dạng ký tự quang học truyền thống?

OCR truyền thống chỉ xử lý văn bản một chiều theo dòng ngang với các ký tự nối tiếp đơn giản. Ngược lại, Image2Latex phải nhận dạng cấu trúc không gian hai chiều phức tạp với nhiều tầng lồng nhau như phân số, ma trận và tích phân. Mô hình phải hiểu ngữ nghĩa toán học để sinh mã LaTeX với độ chính xác cú pháp đạt 100%.

Tại sao kiến trúc DenseNet lại tối ưu hơn mạng CNN 6 tầng cơ sở?

DenseNet kết nối trực tiếp tất cả các tầng qua 3 khối dày đặc với 32 kênh tăng trưởng mỗi tầng. Thiết kế này giúp bảo toàn gradient truyền ngược và giữ lại đặc trưng của các ký hiệu toán học kích thước nhỏ hoặc nét mảnh, khắc phục triệt để hiện tượng mất chi tiết mà mạng CNN 6 tầng cơ sở thường gặp phải.

Cơ chế chú ý C-S đóng vai trò gì trong việc nâng cao độ chính xác?

Cơ chế C-S kết hợp đồng thời sự chú ý theo không gian hai chiều và chú ý theo từng kênh đặc trưng. Nhờ đó, bộ giải mã LSTM định vị chính xác vùng ảnh tương ứng với từng ký hiệu tại mỗi bước thời gian, giúp tăng 4,15% điểm BLEU và giảm hơn 31% lỗi sai lệch ký tự đối với công thức phức tạp.

Mô hình trong luận văn có thể nhận dạng tốt công thức toán viết tay không?

Mô hình đạt độ chính xác trên 76% đối với các công thức in ấn chuẩn trong 100.000 mẫu thử nghiệm. Đối với chữ viết tay có độ biến thiên cao, độ chính xác có thể giảm khoảng 15%. Do đó, việc bổ sung 50.000 mẫu viết tay là giải pháp cần thiết để mở rộng ứng dụng trong thực tế.

Cấu hình phần cứng tối thiểu để triển khai ứng dụng mô hình là gì?

Quá trình huấn luyện mô hình trên 100.000 ảnh yêu cầu tối thiểu 1 GPU chuyên dụng với bộ nhớ VRAM từ 8 GB trở lên. Tuy nhiên, khi triển khai suy luận thực tế trên máy chủ, hệ thống chỉ cần 2 GB RAM và có thể chuyển đổi mỗi công thức trong thời gian chỉ 0,18 giây.

Kết luận

Luận văn thạc sĩ của học viên Lê Thị Giang đã giải quyết thành công bài toán chuyển đổi hình ảnh công thức toán học sang mã LaTeX với các đóng góp cốt lõi:

  • Hệ thống hóa toàn diện cơ sở lý thuyết về OCR và các kỹ thuật học sâu ứng dụng trong số hóa tài liệu khoa học.
  • Cải tiến thành công bộ mã hóa bằng kiến trúc DenseNet 3 khối dày đặc, giải quyết triệt để sự cố suy giảm đạo hàm.
  • Ứng dụng cơ chế chú ý kênh - không gian C-S, nâng điểm số BLEU lên 88,45% và tỷ lệ khớp chính xác đạt 76,82%.
  • Thực nghiệm toàn diện trên 100.000 mẫu dữ liệu chuẩn, kiểm chứng độ tin cậy trên các phương trình vật lý và toán học phức tạp.
  • Đề xuất lộ trình công nghệ khả thi giai đoạn 2024 đến 2026 nhằm đưa giải pháp vào ứng dụng giảng dạy và nghiên cứu thực tế.

Trong giai đoạn tiếp theo từ quý 2 năm 2024, nhóm nghiên cứu sẽ mở rộng tập dữ liệu cho chữ viết tay và hoàn thiện phần mềm ứng dụng. Các trường đại học, viện nghiên cứu và nhà xuất bản hãy liên hệ hợp tác ngay hôm nay để ứng dụng giải pháp chuyển đổi số tài liệu khoa học tiên tiến này.