Tổng quan về luận án

Quá trình số hóa tài liệu khoa học lịch sử và hiện đại đóng vai trò thiết yếu trong việc bảo tồn tri thức nhân loại và nâng cao hiệu quả truy vấn thông tin học thuật. Tuy nhiên, trong khi quá trình nhận dạng văn bản thông thường (standard text OCR) đã đạt mức độ hoàn thiện cao, việc xử lý tự động các công thức toán học (Mathematical Expressions - MEs) trong ảnh tài liệu vẫn là thách thức phức tạp chưa có lời giải triệt để. Khác với văn bản thông thường vốn tuân theo bố cục tuyến tính một chiều, công thức toán học sở hữu cấu trúc không gian phi tuyến tính đa chiều (nonlinear spatial layout) bao gồm chỉ số trên (superscript), chỉ số dưới (subscript), phân số (fractions), căn thức và dạng lưới (matrices), cùng với tập ký hiệu vượt hơn 500 ký tự toán học chuyên biệt.

Khoảng trống nghiên cứu (research gap) cốt lõi xuất phát từ việc các phương pháp truyền thống phụ thuộc nặng nề vào các quy tắc thủ công (rule-based heuristics), phân tích bố cục nhiều giai đoạn (multi-stage layout analysis) hoặc yêu cầu nhận dạng ký tự trước (OCR-dependent), dẫn đến hiện tượng tích lũy sai số dây chuyền (error propagation). Đặc biệt, việc phát hiện các công thức toán nằm xen kẽ trong dòng văn bản (inline MEs) thường bị nhầm lẫn với các ký tự in nghiêng, từ đơn hoặc dấu câu do kích thước biến thiên cực lớn và ranh giới không rõ ràng.

Luận án tiến sĩ chuyên ngành Khoa học máy tính (Mã số: 9480101) của nghiên cứu sinh Bùi Hải Phong, dưới sự hướng dẫn của PGS.TS. Hoàng Mạnh Thắng và PGS.TS. Lê Thị Lan tại Viện Nghiên cứu Quốc tế MICA, Trường Đại học Bách khoa Hà Nội (2021), mang tiêu đề "Enhancing Performance of Mathematical Expression Detection in Scientific Document Images", đã giải quyết trực diện bài toán này thông qua việc thiết lập các câu hỏi và giả thuyết nghiên cứu cụ thể:

  • Câu hỏi nghiên cứu 1 (RQ1): Làm thế nào để trích xuất và kết hợp tối ưu giữa đặc trưng thị giác truyền thống và đặc trưng học sâu nhằm phân biệt chính xác công thức toán học với văn bản thông thường mà không cần nhận dạng ký tự trước?
  • Câu hỏi nghiên cứu 2 (RQ2): Liệu có thể xây dựng một mô hình học sâu đầu-cuối (end-to-end framework) có khả năng định vị chính xác cả công thức toán độc lập (isolated/displayed MEs) và công thức toán xen dòng (inline MEs) dựa trên biểu diễn hình thái học không gian mà không phụ thuộc vào khâu tiền xử lý phân tách dòng phức tạp?
  • Câu hỏi nghiên cứu 3 (RQ3): Mô hình kết hợp phát hiện và nhận dạng toàn diện (integrated detection-recognition) chuyển đổi trực tiếp ảnh tài liệu sang mã nguồn LaTeX đạt hiệu năng và độ chính xác thực tế như thế nào?

Các giả thuyết nghiên cứu tương ứng:

  • Giả thuyết 1 (H1): Việc dung hợp trễ (late fusion) giữa đặc trưng phổ tần số Fourier (FFT), thông số phân phối Gauss từ biểu đồ chiếu (Projection Profile) với mạng nơ-ron tích chập (CNN) sẽ triệt tiêu đáng kể tỷ lệ nhận diện sai công thức xen dòng.
  • Giả thuyết 2 (H2): Biến đổi khoảng cách (Distance Transform) kết hợp với mạng Faster R-CNN tối ưu hóa kích thước hộp neo (anchor boxes) sẽ mô hình hóa vượt trội cấu trúc không gian phi tuyến của công thức toán, cho phép phát hiện end-to-end chính xác hơn các phương pháp phân đoạn truyền thống.
  • Giả thuyết 3 (H3): Kiến trúc giải mã Watcher-Attend-Parser (WAP) tích hợp cơ chế vector bao phủ (coverage vector) sẽ khắc phục triệt để hiện tượng dịch lặp (over-translation) và bỏ sót ký tự (under-translation) khi sinh chuỗi LaTeX từ ảnh công thức.

Khung lý thuyết của luận án được xây dựng dựa trên lý thuyết học biểu diễn (Representation Learning Theory), lý thuyết phân tích hình thái học ảnh tài liệu (Document Image Morphology), lý thuyết phát hiện đối tượng dựa trên vùng đề xuất (Region Proposal Object Detection) và mô hình dịch chuỗi sang chuỗi hướng sự chú ý (Attention-based Sequence-to-Sequence Modeling). Phạm vi thực nghiệm của luận án tập trung trên hai bộ cơ sở dữ liệu chuẩn quốc tế là Marmot (Viện Khoa học Máy tính & Công nghệ, Đại học Bắc Kinh) và GTDB (Đại học Washington), minh chứng tính đột phá với độ chính xác phát hiện công thức độc lập đạt 92,90% trên tập Marmot, đồng thời rút ngắn thời gian xử lý trung bình xuống còn 1,2 giây/trang.

Literature Review và Positioning

Lịch sử phát triển của các kỹ thuật xử lý công thức toán học trong tài liệu số trải qua ba giai đoạn tiến hóa chính:

[Tiếp cận theo luật (Rule-based Methods)]
[Trích xuất đặc trưng thủ công & Bộ phân lớp (Handcrafted ML)]
[Học sâu & Mô hình đầu-cuối (Deep Learning & End-to-End)]

Giai đoạn đầu tiên tập trung vào các hệ thống dựa trên luật (rule-based heuristics) và phân tích thành phần liên thông (connected components). Fateman và cộng sự (1996) cùng Toumit và cộng sự (1999) đã khai thác các đặc điểm hình học như tỷ lệ khung hình (aspect ratio), khoảng thụt đầu dòng và danh mục ký tự đặc biệt để nhận diện công thức độc lập. Tuy nhiên, phương pháp này thất bại nghiêm trọng khi cấu trúc trang tài liệu trở nên phức tạp hoặc khi công thức xen kẽ mật thiết trong dòng chữ.

Giai đoạn thứ hai đánh dấu sự xuất hiện của các phương pháp trích xuất đặc trưng thủ công kết hợp thuật toán học máy phân loại. Khattab và cộng sự (2008), Drake và Baird (2005) đã sử dụng các đặc trưng hình học tính toán (computational geometry), độ biến thiên tâm ký tự và mật độ điểm đen (black pixel density) đưa vào bộ phân loại Support Vector Machine (SVM) hoặc Random Forest. Mặc dù cải thiện độ chính xác cho công thức độc lập, độ nhạy (recall) phát hiện công thức xen dòng vẫn ở mức rất thấp (chỉ đạt xấp xỉ 48% trong nghiên cứu của Lin et al., 2011) do không thể bao quát toàn bộ sự biến thiên ngữ cảnh.

Giai đoạn thứ ba là sự bùng nổ của mạng nơ-ron học sâu (Deep Neural Networks - DNNs). Các nghiên cứu quốc tế tiêu biểu bao gồm mô hình U-Net của Gao và cộng sự (2019) áp dụng trên tập dữ liệu GTDB-2 và mô hình SSD-512/YOLO v3 của Saha và cộng sự (2019) tại cuộc thi ICDAR 2019 CROHME/TFD. Nghiên cứu của Gao et al. đạt độ chính xác phát hiện ký tự đơn lẻ cao (Precision 95,2%, Recall 94,8%) nhưng lại bộc lộ hạn chế chí mạng: không giải quyết được bài toán phân tích bố cục để ghép nối các ký tự thành một công thức hoàn chỉnh, đồng thời đòi hỏi chi phí gán nhãn thủ công khổng lồ cho hơn 115.400 ký tự toán học. Trong khi đó, mô hình SSD của Saha et al. (2019) đạt F-score 0,796 trên tập TFD-ICDAR2019v2 nhưng phụ thuộc vào thuật toán cửa sổ trượt (sliding window) phức tạp và giai đoạn hậu xử lý nặng nề.

Positioning của luận án định vị tại giao điểm tiên phong: Luận án không đi theo lối mòn phân đoạn dòng văn bản truyền thống (vốn thường xuyên cắt đôi công thức lớn thành nhiều dòng sai lệch) mà đề xuất giải pháp kép: (1) Phương pháp dung hợp trễ đa tầng giữa đặc trưng biến đổi Fourier nhanh (FFT), phân phối Gauss với mạng ResNet-18; và (2) Khung nhận diện đầu-cuối thuần túy kết hợp Phép biến đổi khoảng cách (Distance Transform) và Faster R-CNN với mạng đề xuất vùng (RPN) được cấu hình hộp neo tối ưu chuyên biệt. Khi đặt cạnh hai hệ thống thương mại và mã nguồn mở tiêu biểu là Tesseract OCR v4 (Smith, 2007) và InftyReader v3.2 (Suzuki et al., 2003), giải pháp của luận án vượt trội về khả năng phân tách ranh giới công thức phi tuyến và không bị suy giảm hiệu năng do nhận diện sai ký tự bước đầu.

Đóng góp lý thuyết và khung phân tích

Đóng góp cho lý thuyết

Luận án mang lại những đóng góp nền tảng cho lý thuyết Thị giác máy tính (Computer Vision) và Xử lý tài liệu số (Document Document Analysis):

  1. Mở rộng lý thuyết Học biểu diễn thị giác (Visual Representation Learning): Luận án chứng minh rằng các đặc trưng miền tần số không gian (spatial frequency domain) thông qua biến đổi Fourier (FFT) có tính trực giao và bổ trợ hoàn hảo cho các đặc trưng trừu tượng phi tuyến tính được học bởi Mạng nơ-ron tích chập (CNN - AlexNet/ResNet). Điều này chứng minh rằng việc kết hợp thông tin phổ năng lượng (Power Spectrum) giúp phân biệt rõ rệt cấu trúc chu kỳ của văn bản thẳng hàng với tính bất đối xứng của công thức toán học.
  2. Hình thức hóa cấu trúc không gian phi tuyến bằng Lý thuyết trường khoảng cách (Distance Field Theory): Luận án chuyển dịch mô hình phát hiện công thức từ không gian nhị phân rời rạc (binary pixel grid) sang không gian liên tục gradient thông qua Phép biến đổi khoảng cách Euclidean (Euclidean Distance Transform). Phát hiện này thách thức quan điểm truyền thống cho rằng phân tích bố cục tài liệu bắt buộc phải dựa trên phân tích thành phần liên thông (Connected Component Analysis).
  3. Mô hình hóa chuỗi hướng ngữ cảnh với Cơ chế triệt tiêu mất mát căn chỉnh (Alignment Coverage Formulation): Mở rộng lý thuyết Sequence-to-Sequence có cơ chế tập trung (Attention Mechanism) của Bahdanau et al. (2014) vào bài toán biểu diễn công thức toán học, luận án chứng minh về mặt toán học rằng việc tích lũy lịch sử chú ý (sum of past attention probabilities) tạo ra vector bao phủ (coverage vector), giải quyết triệt để nghịch lý dịch thiếu/thừa ký tự trong cấu trúc lồng nhau của LaTeX.

Khung phân tích độc đáo

Khung phân tích của luận án tích hợp liên ngành ba cấu trúc lý thuyết:

  • Biến đổi Fourier 2 chiều (2D Discrete Fourier Transform): Dùng để phân tích hàm mật độ quang phổ của dòng văn bản. Trong khi dòng văn bản thông thường tạo ra phổ tần số tập trung theo các trục nhất định, công thức toán học độc lập phân tán năng lượng đồng đều trên toàn bộ phổ pha (Phase) và độ lớn (Magnitude).
  • Mạng đề xuất vùng tối ưu hóa hình học (Geometry-optimized Region Proposal Network): Thay vì sử dụng các kích thước anchor box mặc định của Ren et al. (2015) vốn thiết kế cho đối tượng tự nhiên (tỷ lệ 1:1, 1:2, 2:1), khung phân tích của luận án tái thiết kế không gian neo: thiết lập 15 anchor boxes chuyên biệt cho isolated MEs (thiên về chiều rộng và chiều cao lớn) và 12 anchor boxes cho inline MEs (thiên về tỷ lệ dẹt, siêu hẹp).
  • Kiến trúc Watcher-Attend-Parser (WAP): Tích hợp mạng tích chập toàn phần (Fully Convolutional Network - FCN) gồm 4 khối tích chập đóng vai trò "Watcher" trích xuất vector đặc trưng $D$-chiều, kết hợp mạng Gated Recurrent Unit (GRU) đóng vai trò "Parser" sinh mã LaTeX với hàm mục tiêu tối đa hóa xác suất có điều kiện.

Phương pháp nghiên cứu tiên tiến

Thiết kế nghiên cứu

Nghiên cứu theo đuổi trường phái nhận thức luận Thực chứng hậu hiện đại (Post-positivism / Empirical Experimentalism), dựa trên việc đo lường định lượng chính xác, kiểm chứng giả thuyết thông qua các chỉ số thống kê khách quan và đánh giá lặp (iterative benchmarking). Thiết kế thực nghiệm đa cấp độ (multi-level design) được triển khai qua hai luồng tiếp cận độc lập nhằm đối sánh:

Luồng 1 (Multi-stage Hybrid System): Triển khai phân đoạn tài liệu từ trên xuống (top-down) và từ dưới lên (bottom-up), sau đó áp dụng phép chiếu dọc (Vertical Projection Profile - VPP) và chiếu ngang (Horizontal Projection Profile - HPP). Tại cấp độ dòng, áp dụng FFT và trích xuất 5 tham số Gauss của biểu đồ chiếu; tại cấp độ từ, trích xuất đặc trưng hình thái ký tự nghiêng (italic) và đưa vào các mạng AlexNet, ResNet-18 đã tinh chỉnh (fine-tuned transfer learning).

Luồng 2 (End-to-end Distance Transform Faster R-CNN): Loại bỏ toàn bộ các bước phân đoạn trung gian. Ảnh nhị phân đầu vào $I$ được chuyển đổi thành ảnh khoảng cách cấp xám hoặc chuyển đổi 3 kênh RGB thông qua ba hàm khoảng cách: $$\text{Euclidean: } d_E(p, q) = \sqrt{(x_p - x_q)^2 + (y_p - y_q)^2}$$ $$\text{City Block: } d_{CB}(p, q) = |x_p - x_q| + |y_p - y_q|$$ $$\text{Chessboard: } d_{Ch}(p, q) = \max(|x_p - x_q|, |y_p - y_q|)$$

Quy trình nghiên cứu rigorous

Quy trình nghiên cứu tuân thủ nghiêm ngặt chuẩn mực khoa học quốc tế:

  • Tập dữ liệu chuẩn: Sử dụng bộ dữ liệu Marmot (gồm hàng trăm trang tài liệu cấu trúc phức tạp với nhãn XML chi tiết vị trí và nội dung ký tự) và bộ dữ liệu GTDB (chứa hơn 115.400 biểu tượng toán học trong các bài báo khoa học chuẩn).
  • Kiểm định độ tin cậy và phân tầng dữ liệu: Dữ liệu được chia tách nghiêm ngặt thành các tập huấn luyện (training), kiểm chuẩn (validation) và kiểm thử (testing). Mô hình Faster R-CNN và WAP được tối ưu hóa qua 200.000 vòng lặp (iterations) với hàm mất mát Cross-Entropy và thuật toán tối ưu hóa Adam, tốc độ học ban đầu $\text{lr} = 1.0$ và giảm dần theo hàm bước: $$\text{lr} = \frac{1.0}{\sqrt{\text{iteration}}}$$
  • Độ đo đánh giá chuẩn hóa: Sử dụng độ đo Intersection over Union (IoU) với ngưỡng chồng lấp $\text{IoU} \ge 0.5$ để xác định phát hiện đúng (Correct), phát hiện một phần (Partial), bỏ sót (Missed) và nhận diện sai (False). Đánh giá khâu nhận dạng bằng hai chỉ số: Tỷ lệ lỗi từ (Word Error Rate - WER) và Tỷ lệ lỗi công thức (Expression Error Rate - ExpRate): $$\text{WER} = \frac{N^{\text{sub}} + N^{\text{del}} + N^{\text{ins}}}{N^{\text{ref}}}$$

Data và phân tích

Mẫu dữ liệu thực nghiệm phản ánh trung thực phân phối thực tế của tài liệu học thuật đa cột và đơn cột. Các kỹ thuật trực quan hóa chiều dữ liệu cao như t-SNE (t-Distributed Stochastic Neighbor Embedding) kết hợp với khoảng cách Mahalanobis và Cosine được ứng dụng triệt để để minh chứng tính phân tách rõ ràng (separability) giữa cụm đặc trưng công thức toán học và văn bản thường trong không gian vector của ResNet-50.

Mạng WAP được xây dựng trên nền tảng ngôn ngữ Python 3, framework TensorFlow, huấn luyện trên máy trạm GPU NVIDIA GeForce GTX 1080 (11GB VRAM). Khâu giải mã thử nghiệm áp dụng thuật toán tìm kiếm chùm (Beam Search Algorithm) với tham số $k$-top dự đoán tối ưu thay vì giải mã tham lam (greedy search), giúp cải thiện rõ rệt việc bảo toàn tính đúng đắn của ngữ pháp LaTeX.

Phát hiện đột phá và implications

Những phát hiện then chốt

  1. Hiệu ứng biến đổi khoảng cách (Distance Transform Superiority): Biến đổi khoảng cách Euclidean vượt trội hơn hẳn so với City Block và Chessboard. Dữ liệu thực nghiệm chứng minh rằng ma trận khoảng cách Euclidean biến đổi ranh giới nhị phân thành các vùng suy giảm gradient mịn, giúp mạng Faster R-CNN nắm bắt được mối quan hệ không gian giữa các thành phần rời rạc trong công thức (ví dụ dấu gạch ngang phân số với tử số và mẫu số) mà không làm dính liền chúng về mặt quang học.
  2. Đột phá từ việc tối ưu hóa Anchor Boxes: Khi thay thế 9 anchor boxes mặc định bằng bộ 15 hộp neo chuyên biệt cho isolated MEs và 12 hộp neo cho inline MEs (dựa trên biểu đồ phân bố chiều rộng/chiều cao thực tế trên tập Marmot), độ chính xác phát hiện công thức tăng vọt, giảm tỷ lệ phát hiện một phần (Partial detection) từ 18,4% xuống dưới 4,2%.
  3. Ưu thế của chiến lược Dung hợp trễ (Late Fusion): Kết hợp xác suất đầu ra (prediction scores) giữa bộ phân loại SVM/Random Forest từ đặc trưng thủ công (FFT, VPP Gaussian) và mạng học sâu (ResNet-18) cho kết quả vượt trội so với dung hợp sớm (early feature concatenation), triệt tiêu hiện tượng bù trừ sai lệch giữa các miền không gian đặc trưng khác bản chất.
  4. Hiệu chỉnh mất mát chú ý nhờ Coverage Vector: Phân tích lỗi chỉ ra rằng 68% lỗi nhận dạng trong các hệ thống Seq2Seq truyền thống bắt nguồn từ việc lặp lại toán tử hoặc bỏ qua các dấu ngoặc đóng mở trong công thức nhiều tầng. Việc tích hợp vector bao phủ trong WAP đã giảm tỷ lệ lỗi này xuống dưới 12%.

(Nguồn trích dẫn trực tiếp từ dữ liệu thực nghiệm Chương 4 của luận án)

Implications đa chiều

  • Về mặt học thuật và lý thuyết: Xác lập một mô thức mới chứng minh rằng việc xử lý tài liệu phi tuyến tính có thể thực hiện hiệu quả bằng cách chuyển hóa cấu trúc hình học thành trường liên tục (continuous spatial fields) thay vì cố gắng ép cấu trúc vào các mô hình ngôn ngữ tuyến tính một chiều.
  • Về mặt phương pháp luận: Cung cấp bộ quy trình thực nghiệm chuẩn mực cho việc tối ưu hóa các mạng phát hiện đối tượng phổ quát (Faster R-CNN, Mask R-CNN) cho các bài toán nhận dạng tài liệu chuyên biệt có tỷ lệ khung hình cực trị.
  • Về mặt ứng dụng thực tiễn: Tạo tiền đề trực tiếp để xây dựng các công cụ số hóa tự động chuyển đổi kho lưu trữ PDF/sách scan lịch sử sang cơ sở dữ liệu số chuẩn XML/LaTeX có thể lập chỉ mục (indexable) và tìm kiếm ngữ nghĩa (semantic math search).
  • Về mặt hỗ trợ xã hội: Tích hợp trực tiếp vào các thiết bị hỗ trợ người khiếm thị (Text-to-Speech for visually impaired students), giúp đọc chính xác các tài liệu toán học và kỹ thuật chuyên sâu (STEM) – vốn là rào cản lớn nhất của các phần mềm đọc màn hình hiện nay.

Limitations và Future Research

Luận án đã thẳng thắn chỉ ra 4 giới hạn nghiên cứu cụ thể:

  1. Giả định về chất lượng ảnh tài liệu: Mô hình hiện tại hoạt động tối ưu trên các ảnh tài liệu quét ở độ phân giải cao (300 - 500 dpi) và không bị nghiêng lệch (non-skewed). Khi độ phân giải giảm xuống 150 dpi hoặc ảnh bị méo do góc chụp camera, độ chính xác phát hiện công thức xen dòng sụt giảm rõ rệt.
  2. Hiện tượng nén mất mát thông tin đối với công thức lớn (Large MEs Degradation): Do yêu cầu kích thước đầu vào cố định của mạng WAP, các công thức toán nhiều dòng hoặc phân số phức hợp nhiều tầng khi bị co giãn (resizing) sẽ mất đi các chi tiết nét mảnh (dấu phẩy, dấu chấm, chỉ số phụ), dẫn đến việc bỏ sót ký tự trong chuỗi LaTeX đầu ra.
  3. Kích thước tập dữ liệu huấn luyện WAP: Tập ký hiệu huấn luyện giới hạn ở 110 nhãn toán học cơ bản. Một số ký hiệu cổ, ký tự Hy Lạp hiếm hoặc ký hiệu toán học đặc thù của các ngành chuyên sâu chưa được bao phủ đầy đủ.
  4. Thời gian thực thi của mô hình học sâu: Mặc dù đạt 1,2 giây/trang, tốc độ này vẫn chậm hơn các thuật toán xử lý ảnh truyền thống dựa trên luật (như Tesseract v4), gây thách thức cho các bài toán xử lý thời gian thực trên thiết bị biên di động.

Chương trình nghiên cứu tương lai (Future Research Agenda):

  • Phát triển module tiền xử lý tự động xoay và nắn chỉnh độ nghiêng (adaptive deskewing/dewarping).
  • Tích hợp kiến trúc Transformer thị giác đa tỷ lệ (Multi-scale Vision Transformer / Swin Transformer) làm backbone thay thế cho FCN trong module Watcher.
  • Mở rộng tập từ điển ký hiệu toán học lên hơn 500 ký tự chuẩn Unicode.
  • Nghiên cứu mô hình nén mạng (knowledge distillation, pruning) để triển khai trực tiếp trên ứng dụng di động hỗ trợ giáo dục.

Tác động và ảnh hưởng

Nghiên cứu mang lại những tác động sâu rộng trên nhiều bình diện:

  • Tác động học thuật (Academic Impact): Đóng góp trực tiếp 4 công trình khoa học chất lượng cao, bao gồm 1 bài báo trên tạp chí quốc tế danh giá ISI Q1 (IEEE Access, 2020), 2 bài báo trên các tạp chí chuyên ngành quốc tế (International Journal of Computational Vision and Robotics, Expert Systems, 2021) và các báo cáo tại hội nghị khoa học quốc tế uy tín (NAFOSTED NICS, KICS, ACIIDS).
  • Chuyển đổi công nghiệp xuất bản và thư viện số: Cung cấp công nghệ lõi cho các nhà xuất bản khoa học, trung tâm dữ liệu trường đại học để tự động chuyển đổi hàng triệu trang tài liệu học thuật từ định dạng raster sang cơ sở dữ liệu số có cấu trúc.
  • Lợi ích kinh tế - xã hội: Giảm thiểu hơn 85% chi phí và thời gian nhập liệu thủ công tài liệu toán học, đồng thời mở ra cánh cửa tiếp cận giáo dục STEM bình đẳng cho cộng đồng người yếu thế thông qua các ứng dụng chuyển đổi toán học sang giọng nói.

Đối tượng hưởng lợi

  • Nghiên cứu sinh & Nhà khoa học Thị giác máy tính: Tiếp cận một phương pháp luận chuẩn xác về việc kết hợp hình thái học cổ điển với mạng nơ-ron học sâu để giải quyết các bài toán biên phức tạp trong xử lý ảnh tài liệu.
  • Kỹ sư R&D trong ngành OCR & AI: Nhận được thiết kế kiến trúc hoàn chỉnh từ khâu cấu hình anchor box của RPN đến cơ chế coverage vector trong GRU có thể tái sử dụng ngay trong các sản phẩm thương mại.
  • Các tổ chức giáo dục & Thư viện quốc gia: Sở hữu giải pháp công nghệ khả thi để tự động hóa toàn diện quy trình số hóa kho sách và giáo trình toán học lưu trữ.
  • Sinh viên và nhà nghiên cứu khiếm thị: Hưởng lợi từ sự phát triển của các công cụ hỗ trợ đọc công thức khoa học chuẩn xác theo thời gian thực.

Câu hỏi chuyên sâu

1. Đóng góp lý thuyết độc đáo nhất của luận án là gì và nó mở rộng lý thuyết nền tảng nào?
Trả lời: Đóng góp lý thuyết độc đáo nhất là việc mở rộng Lý thuyết biểu diễn không gian hình thái học tài liệu thông qua việc chứng minh Phép biến đổi khoảng cách Euclidean (Distance Transform) có khả năng chuyển đổi các thành phần toán học rời rạc thành một trường gradient liên tục. Điều này cho phép mạng nơ-ron tích chập (Faster R-CNN) học được các đặc trưng ngữ cảnh không gian 2 chiều của công thức toán mà hoàn toàn không cần trải qua bước phân đoạn dòng hoặc nhận dạng ký tự trước.

2. Đột phá phương pháp luận của luận án so với ít nhất 2 nghiên cứu quốc tế trước đó thể hiện ở điểm nào?
Trả lời: So với nghiên cứu của Gao et al. (2019) (dùng U-Net chỉ phát hiện ký tự đơn lẻ mà bất lực trong việc cấu trúc hóa thành công thức hoàn chỉnh) và nghiên cứu của Saha et al. (2019) (dùng SSD-512 phụ thuộc cửa sổ trượt và hậu xử lý phức tạp), luận án đã tạo đột phá khi thiết kế kiến trúc RPN tối ưu hóa kích thước hộp neo (15 anchor cho isolated, 12 anchor cho inline) kết hợp biến đổi khoảng cách, đạt quy trình phát hiện đầu-cuối thuần túy với độ chính xác 92,90% trên tập Marmot mà không cần các giải thuật hậu xử lý nặng nề.

3. Phát hiện bất ngờ nhất trong quá trình thực nghiệm có sự hỗ trợ của dữ liệu là gì?
Trả lời: Phát hiện bất ngờ nhất là việc các đặc trưng quang phổ tần số cao trích xuất từ biến đổi Fourier (FFT) có khả năng tách biệt hoàn toàn các dòng công thức độc lập khỏi các dòng văn bản thông thường với độ chính xác phân loại vượt trên 90% khi dùng SVM đơn giản. Dữ liệu t-SNE chứng minh phổ pha và phổ biên độ của công thức toán học có dạng phân tán đẳng hướng, hoàn toàn đối lập với tính tập trung định hướng chặt chẽ của các dòng chữ Latinh.

4. Luận án có cung cấp quy trình tái lập (Replication Protocol) hoàn chỉnh không?
Trả lời: Có. Luận án cung cấp chi tiết toàn bộ siêu tham số (hyperparameters), cấu trúc từng tầng mạng của AlexNet, ResNet-18, ResNet-50 và WAP (số kênh, kích thước kernel, stride, padding trong Bảng 1.5, 1.6, 2.3, 2.4, 3.3), tập dữ liệu công khai (Marmot, GTDB), cùng mã nguồn công thức toán học và giao diện phần mềm hoàn chỉnh viết trên nền tảng Python, TensorFlow và Matlab R2019a.

5. Lộ trình nghiên cứu 10 năm tới được phác thảo trong luận án tập trung vào những hướng đi nào?
Trả lời: Lộ trình tập trung vào 3 hướng chiến lược: (1) Tích hợp các kiến trúc Attention đa hướng và Vision Transformers tự giám sát để xử lý tài liệu đa ngôn ngữ; (2) Xây dựng hệ thống nhận dạng công thức tương tác thời gian thực kết hợp giữa chữ viết tay và chữ in trên thiết bị di động; (3) Mở rộng hệ thống nhận dạng biểu đồ, bảng biểu và công thức hóa học lồng ghép trong tài liệu khoa học phức hợp.

Kết luận

Luận án tiến sĩ của tác giả Bùi Hải Phong đã đạt được những thành tựu khoa học xuất sắc với 5 đóng góp cụ thể:

  1. Thiết lập phương pháp lai hai giai đoạn (Two-stage Hybrid Framework) kết hợp sáng tạo giữa trích xuất đặc trưng thủ công (FFT, tham số Gauss của biểu đồ chiếu) và học chuyển giao mạng CNN (AlexNet, ResNet-18) thông qua cơ chế dung hợp trễ (Late Fusion).
  2. Tiên phong đề xuất khung phát hiện công thức toán đầu-cuối (End-to-end Framework) kết hợp Phép biến đổi khoảng cách (Distance Transform) và Faster R-CNN, loại bỏ hoàn toàn sự phụ thuộc vào các module OCR truyền thống.
  3. Tối ưu hóa hình học mạng đề xuất vùng (RPN Optimization) thông qua việc thiết lập bộ 12 và 15 hộp neo chuyên biệt, giải quyết triệt để bài toán phát hiện công thức toán có tỷ lệ khung hình biến thiên cực đoan.
  4. Xây dựng hệ thống tích hợp hoàn chỉnh (Integrated End-to-End System) kết nối module phát hiện với mạng Watcher-Attend-Parser (WAP) tích hợp cơ chế vector bao phủ, cho phép chuyển đổi trực tiếp ảnh tài liệu sang mã nguồn LaTeX với hiệu năng vượt trội so với Tesseract và InftyReader.
  5. Chứng thực thực nghiệm nghiêm ngặt trên các bộ dữ liệu chuẩn quốc tế Marmot và GTDB, đóng góp vào kho tàng khoa học 4 công trình nghiên cứu uy tín và mở ra hướng ứng dụng thực tiễn rộng lớn cho công cuộc số hóa tri thức khoa học toàn cầu.