Tổng quan nghiên cứu
Trong kỷ nguyên số hóa và hội nhập quốc tế, nhu cầu giao thương, hợp tác giáo dục giữa Việt Nam và Lào ngày càng mở rộng, kéo theo sự gia tăng hơn 80% nhu cầu tra cứu và dịch thuật ngôn ngữ song phương tại các tỉnh biên giới cũng như các cơ sở đào tạo đại học. Tuy nhiên, xử lý ngôn ngữ tự nhiên cho tiếng Lào hiện vẫn là một lĩnh vực gặp nhiều thách thức do tính chất của một ngôn ngữ nghèo tài nguyên số (low-resource language). Khác với các ngôn ngữ phương Tây, tiếng Lào thuộc loại hình ngôn ngữ đơn lập, các từ không được phân định bằng dấu khoảng trắng mà chỉ dùng dấu cách để ngăn cách giữa các mệnh đề hoặc câu, tạo ra sự nhập nhằng ranh giới từ vô cùng phức tạp khi đưa vào hệ thống máy tính.
Mục tiêu trọng tâm của đề tài là nghiên cứu chuyên sâu các giải pháp tách từ tự động (Word Segmentation) phù hợp với cấu trúc ngữ pháp và hình thái học tiếng Lào, đồng thời thiết kế và xây dựng một phần mềm ứng dụng hoàn chỉnh hỗ trợ tra cứu từ mới song ngữ Lào - Việt tích hợp dữ liệu phát âm chuẩn. Phạm vi nghiên cứu được triển khai tại Trường Đại học Công nghệ Thông tin và Truyền thông thuộc Đại học Thái Nguyên, hoàn thành nghiệm thu vào tháng 5 năm 2019 với kho ngữ liệu thực nghiệm bước đầu gồm 808 cặp từ vựng đối chiếu.
Nghiên cứu mang lại ý nghĩa học thuật và ứng dụng thực tiễn to lớn khi cung cấp giải pháp giảm thiểu khoảng 65% thời gian tra cứu từ mới cho người học, hỗ trợ nâng cao độ chính xác trong phân tách ngữ pháp đạt mức trên 90%, đồng thời đặt nền móng kỹ thuật vững chắc cho các bài toán xử lý ngôn ngữ tự nhiên chuyên sâu tiếp theo như dịch máy tự động, nhận dạng tiếng nói và khai phá dữ liệu văn bản tiếng Lào.
Cơ sở lý thuyết và phương pháp nghiên cứu
Khung lý thuyết áp dụng
Nghiên cứu dựa trên nền tảng kết hợp giữa ngôn ngữ học đối chiếu và các mô hình toán học trong xử lý ngôn ngữ tự nhiên:
- Mô hình ngôn ngữ N-gram: Ứng dụng xấp xỉ Markov bậc n để ước lượng xác suất xuất hiện của chuỗi từ thông qua phân bố xác suất tần số cực đại, giúp lượng hóa cấu trúc ngữ pháp và dự đoán liên kết giữa các âm tiết liền kề.
- Mô hình học máy phân lớp điểm (Pointwise approach) kết hợp Support Vector Machine (SVM): Khung phân loại nhị phân độc lập tại từng vị trí ranh giới âm tiết, không phụ thuộc vào chuỗi chuyển trạng thái như các mô hình tuần tự truyền thống, giảm thiểu tối đa hiện tượng sai lệch dây chuyền.
- Hệ thống 4 khái niệm hình thái học then chốt:
- Loại hình ngôn ngữ đơn lập (Isolating Language) với sự liên kết chặt chẽ giữa các âm tiết và hiện tượng không biến đổi hình thái từ.
- Ranh giới từ và bài toán gán nhãn chuỗi nhị phân (Binary Sequence Labeling).
- Cửa sổ ngữ cảnh âm tiết với kích thước độ dài W=3 bao quát các âm tiết lân cận.
- Bộ đặc trưng từ điển gồm 3 trạng thái vị trí: Đầu bên trái (L), Đầu bên phải (R) và Nằm bên trong (I).
Phương pháp nghiên cứu
Nguồn dữ liệu của luận văn được tổng hợp từ các tài liệu ngữ pháp chuẩn, sách giáo khoa tiếng Lào và kết quả khảo sát từ 6 hệ thống từ điển trực tuyến uy tín gồm Vietlao, Glosbe, Google Translate, Laban, Tracau và một số cổng dịch thuật song ngữ chuyên dụng. Cỡ mẫu thực nghiệm ban đầu bao gồm 808 cặp từ đối chiếu Việt - Lào, trong đó 100 cặp từ vựng tiêu biểu đại diện cho nhiều chủ đề đời sống, hành chính và học thuật được trích xuất để phân tích định tính và kiểm thử chức năng. Phương pháp chọn mẫu là chọn mẫu có chủ đích kết hợp phân tầng theo tần suất xuất hiện và cấu trúc âm tiết, đảm bảo độ bao phủ các từ ghép 2 âm tiết, 3 âm tiết và các từ mượn tiếng Phạn - Pali.
Về phương pháp phân tích, luận văn lựa chọn kỹ thuật phân lớp độc lập Pointwise dựa trên SVM thay vì mô hình Markov ẩn (HMM) hay Trường ngẫu nhiên có điều kiện (CRF). Lý do lựa chọn là vì phương pháp Pointwise không đòi hỏi bộ dữ liệu huấn luyện quy mô khổng lồ từ 100.000 đến 150.000 từ như trong tiếng Nhật hay tiếng Trung, đồng thời có khả năng học tập hiệu quả trên tập dữ liệu gán nhãn không đầy đủ (partially annotated data), xử lý vượt trội các từ mới xuất hiện ngoài từ điển (OOV). Toàn bộ quy trình thu thập dữ liệu, phân tích đặc trưng và lập trình ứng dụng được tiến hành liên tục theo mốc thời gian từ năm 2018 đến tháng 5 năm 2019.
Kết quả nghiên cứu và thảo luận
Những phát hiện chính
Quá trình phân tích thực nghiệm và xây dựng ứng dụng đã mang lại 4 phát hiện quan trọng:
- Tỷ lệ phân bố hình thái âm tiết: Thống kê cấu trúc từ vựng cho thấy có khoảng 70% các từ phức trong ngôn ngữ đối chiếu được cấu tạo bởi 2 âm tiết, 14% cấu tạo từ 3 âm tiết và khoảng 16% là từ đơn hoặc từ đa âm tiết mở rộng. Đây là căn cứ khoa học trực tiếp để xác định độ dài cửa sổ trượt W=3 và bậc n-gram từ 1 đến 2 nhằm tối ưu hóa độ chính xác mô hình học máy.
- Khả năng xử lý từ mới của giải thuật Pointwise: Khi so sánh với phương pháp ghép cực đại (Maximum Matching) truyền thống vốn chỉ đạt độ chính xác khoảng 75% trên ngữ cảnh thực tế do lỗi nhận diện từ vựng ngoài hệ thống, mô hình Pointwise SVM giúp nâng cao hiệu suất phân loại độc lập, khử triệt để sự nhập nhằng ranh giới giữa các cụm âm tiết liền kề.
- Mức độ tương đồng ngữ âm và cấu trúc: Tiếng Lào và tiếng Thái có độ tương đồng về thanh điệu và phát âm lên tới hơn 80% (cùng sở hữu hệ thống 5 thanh điệu cơ bản và quy tắc trật tự từ nói xuôi). Điều này cho phép tái sử dụng hiệu quả các kỹ thuật gán nhãn đồ thị và giải thuật tìm đường đi ngắn nhất Viterbi với độ phức tạp thuật toán O(n) đã thành công trên tiếng Nhật và tiếng Thái để ứng dụng cho tiếng Lào.
- Chuẩn hóa hệ thống cơ sở dữ liệu đa phương tiện: Xây dựng thành công ứng dụng tra cứu hoàn chỉnh trên nền tảng Visual Studio và SQLite với 808 cặp từ đối sánh chuẩn xác 100%, tích hợp 2 thư mục chứa hàng trăm tệp âm thanh giọng đọc bản ngữ tương ứng, đạt tốc độ phản hồi truy vấn dưới 0,5 giây trên mỗi lượt tìm kiếm.
Thảo luận kết quả
Hiệu năng vượt trội của phương pháp Pointwise bắt nguồn từ cơ chế đánh giá các điểm phân tách từ hoàn toàn độc lập, chỉ dựa vào các thông tin ngữ cảnh cục bộ trong cửa sổ trượt như n-gram âm tiết và 4 chủng loại âm tiết (chữ hoa, chữ thường, chữ số và ký tự đặc biệt). Khác với các thuật toán phụ thuộc chuỗi như CRF (vốn đạt độ chính xác lý thuyết 94% đến 95% nhưng suy giảm mạnh khi thiếu kho ngữ liệu huấn luyện lớn), Pointwise giúp loại bỏ tình trạng một nhãn gán sai kéo theo sai lệch toàn bộ câu văn phía sau.
Về mặt trực quan hóa, toàn bộ phân bố hình thái âm tiết (70% từ 2 âm tiết, 14% từ 3 âm tiết) có thể được biểu diễn rõ nét qua biểu đồ tròn (Pie Chart) thể hiện cấu trúc ngữ liệu. Bên cạnh đó, hiệu quả khử nhập nhằng của thuật toán Pointwise so với phương pháp ghép từ dài nhất được minh họa rõ ràng thông qua biểu đồ cột so sánh độ chính xác nhận diện từ mới (F1-Score), kết hợp cùng bảng ma trận nhầm lẫn (Confusion Matrix) thể hiện hiệu suất gán nhãn chính xác tại từng vị trí phân tách từ. Ứng dụng tra cứu từ điển xây dựng thành công đã giải quyết bài toán giao diện trực quan với 3 khối chức năng chính: khung nhập liệu từ khóa linh hoạt, vùng hiển thị kết quả dịch nghĩa kèm từ đồng nghĩa và nút kích hoạt âm thanh phát âm trung thực cho cả hai ngôn ngữ.
Đề xuất và khuyến nghị
Để phát triển hoàn thiện các giải pháp công nghệ xử lý ngôn ngữ tự nhiên tiếng Lào trong giai đoạn tiếp theo, luận văn đề xuất 4 nhóm giải pháp cụ thể:
- Mở rộng kho ngữ liệu song ngữ: Tổ chức thu thập và số hóa bổ sung ít nhất 5.000 cặp từ vựng chuyên ngành kinh tế, kỹ thuật, y tế và pháp luật trong vòng 12 tháng tới. Nhiệm vụ này cần được chủ trì bởi nhóm nghiên cứu công nghệ thông tin phối hợp cùng các chuyên gia ngôn ngữ học tại các trường đại học song phương.
- Nâng cấp mô hình phân tách từ bằng học sâu: Nghiên cứu tích hợp các kiến trúc mạng nơ-ron hồi tiếp BiLSTM-CRF và mô hình Transformer tự chú ý (Self-Attention) nhằm nâng target metric độ chính xác tách từ câu phức lên mức trên 98%, hoàn thành thử nghiệm trước quý IV năm 2020 do đội ngũ kỹ sư xử lý ngôn ngữ tự nhiên thực hiện.
- Phát triển ứng dụng trên nền tảng di động: Chuyển đổi phần mềm tra cứu từ phiên bản máy tính sang ứng dụng đa nền tảng (iOS và Android) với mục tiêu đạt mốc 10.000 lượt tải trong 6 tháng đầu ra mắt, do các kỹ sư phát triển phần mềm ứng dụng triển khai.
- Ứng dụng công nghệ tổng hợp giọng nói tự động: Tích hợp công nghệ Text-to-Speech (TTS) tự động nhận diện và đọc văn bản tiếng Lào thay thế cho các tệp âm thanh ghi âm tĩnh, giúp phát âm chính xác 100% các từ vựng mới phát sinh trong lộ trình 9 tháng, do bộ phận nghiên cứu công nghệ âm thanh phụ trách.
Đối tượng nên tham khảo luận văn
Công trình nghiên cứu cung cấp cơ sở lý thuyết và ứng dụng thực tiễn giá trị cho 4 nhóm đối tượng chính:
- Giảng viên và sinh viên ngành Công nghệ thông tin: Tiếp cận tài liệu tham khảo chất lượng cao về phương pháp xử lý ngôn ngữ tự nhiên cho các ngôn ngữ nghèo tài nguyên; ứng dụng trực tiếp kiến trúc thuật toán Pointwise SVM và kỹ thuật trích xuất đặc trưng cửa sổ trượt vào các đồ án tốt nghiệp, đề tài nghiên cứu khoa học chuyên ngành.
- Lưu học sinh Lào và sinh viên Việt Nam học tiếng Lào: Sử dụng phần mềm như một công cụ tra cứu từ vựng đối chiếu tiện lợi, kết hợp luyện tập phát âm chuẩn xác thông qua hệ thống âm thanh song ngữ, phục vụ trực tiếp cho quá trình học tập, dịch thuật giáo trình và nghiên cứu văn bản.
- Kỹ sư phát triển phần mềm và chuyên gia NLP: Khảo sát mô hình thiết kế cơ sở dữ liệu SQLite tối ưu cho ứng dụng từ điển, tham khảo mã nguồn xử lý giao diện tra cứu trên Visual Studio để tích hợp vào các hệ thống dịch máy, trợ lý ảo hoặc công cụ hỗ trợ gõ tiếng Lào.
- Cán bộ đối ngoại và doanh nghiệp thương mại Việt - Lào: Nắm bắt các đặc thù ngữ pháp so sánh đối chiếu giữa tiếng Lào và tiếng Việt (hệ thống 5 thanh điệu, quy tắc trật tự từ nói xuôi), từ đó nâng cao hiệu quả biên dịch hợp đồng kinh tế, văn bản hành chính và xúc tiến hoạt động đầu tư thương mại song phương.
Câu hỏi thường gặp
Tại sao bài toán tách từ tiếng Lào lại phức tạp hơn các ngôn ngữ châu Âu?
Tiếng Lào là ngôn ngữ đơn lập, không sử dụng khoảng trắng để phân tách giữa các từ như tiếng Anh hay tiếng Pháp mà chỉ dùng khoảng trắng để ngăn cách câu hoặc mệnh đề. Bên cạnh đó, một từ tiếng Lào có thể được cấu tạo từ 1, 2 hoặc nhiều âm tiết gắn kết chặt chẽ, tạo ra hiện tượng nhập nhằng ranh giới từ đòi hỏi máy tính phải sử dụng các thuật toán máy học chuyên sâu để nhận diện.
Thuật toán Pointwise SVM có ưu thế gì so với mô hình chuỗi HMM hay CRF?
Phương pháp Pointwise biến bài toán tách từ thành các bài toán phân loại nhị phân độc lập tại từng vị trí âm tiết mà không phụ thuộc vào trạng thái nhãn phía trước. Điều này giúp mô hình triệt tiêu hoàn toàn hiện tượng lan truyền sai số, vận hành hiệu quả trên dữ liệu huấn luyện không đầy đủ và không đòi hỏi từ điển quy mô hàng trăm nghìn từ như các mô hình chuỗi truyền thống.
Ngữ liệu 808 cặp từ trong luận văn được xử lý và lưu trữ như thế nào?
Cơ sở dữ liệu được tổ chức dưới dạng bảng lưu trữ trong hệ quản trị SQLite gồm 3 trường thông tin: MaCaptu (khóa chính tự tăng), TiengViet (từ ngữ tiếng Việt) và TiengLao (từ ngữ tiếng Lào tương ứng). Song song với dữ liệu văn bản, hệ thống lưu trữ hàng trăm tệp âm thanh đọc chuẩn cho từng từ khóa, cho phép phần mềm truy xuất tức thì nghĩa và giọng đọc bản ngữ.
Mức độ tương đồng 80% giữa tiếng Lào và tiếng Thái đóng vai trò gì trong nghiên cứu?
Sự tương đồng trên 80% về phát âm, thanh điệu và cấu trúc ngữ pháp giữa tiếng Lào và tiếng Thái mở ra khả năng kế thừa các thành tựu xử lý ngôn ngữ tự nhiên sẵn có của tiếng Thái. Nghiên cứu có thể tận dụng các giải thuật đồ thị, trọng số Viterbi và tập luật ngữ pháp đã hoàn thiện của tiếng Thái để tinh chỉnh cho tiếng Lào, giúp rút ngắn đáng kể thời gian thử nghiệm.
Ứng dụng từ điển xây dựng trong luận văn có thể mở rộng tính năng gì trong tương lai?
Ứng dụng có thể mở rộng tích hợp công nghệ trí tuệ nhân tạo nhận dạng ký tự quang học (OCR) để dịch trực tiếp từ hình ảnh, bổ sung module tổng hợp giọng nói tự động Text-to-Speech đa ngữ điệu và phát triển API dịch tự động kết nối trực tiếp với các dịch vụ điện toán đám mây phục vụ hàng triệu người dùng trực tuyến.
Kết luận
- Luận văn đã phân tích toàn diện các đặc trưng ngữ âm, bảng chữ cái và ngữ pháp tiếng Lào, chỉ ra những điểm tương đồng sâu sắc với tiếng Việt như trật tự từ nói xuôi và hệ thống thanh điệu.
- Làm rõ cơ sở lý thuyết xử lý ngôn ngữ tự nhiên và đề xuất giải pháp tách từ tiếng Lào hiệu quả dựa trên phương pháp Pointwise kết hợp thuật toán phân lớp Support Vector Machine (SVM).
- Xác định cấu trúc hình thái then chốt với hơn 70% từ ghép cấu tạo từ 2 âm tiết, giúp thiết lập cửa sổ đặc trưng ngữ cảnh W=3 tối ưu cho quá trình nhận diện ranh giới từ.
- Xây dựng thành công ứng dụng tra cứu từ điển song ngữ Lào - Việt trên Visual Studio và SQLite, tích hợp 808 cặp từ vựng chuẩn hóa cùng hệ thống âm thanh phát âm bản ngữ trực quan.
- Lộ trình 6 đến 12 tháng tới sẽ tập trung nâng cấp kho ngữ liệu lên trên 10.000 mục từ và đóng gói bộ công cụ SDK cho các nhà phát triển di động. Các nhà nghiên cứu và lập trình viên hãy cùng khai thác, mở rộng nguồn tài nguyên này để thúc đẩy sự phát triển của công nghệ xử lý ngôn ngữ tự nhiên cho cộng đồng các nước Đông Dương.