Tổng quan nghiên cứu

Dân tộc Ba Na là một trong những cộng đồng dân tộc thiểu số lâu đời tại khu vực miền Trung và Tây Nguyên với dân số ghi nhận hơn 174.000 người, tập trung chủ yếu tại các tỉnh Kon Tum, Gia Lai, Bình Định và Phú Yên. Trong bối cảnh chuyển đổi số quốc gia và giao lưu văn hóa ngày càng mở rộng, việc bảo tồn ngôn ngữ bản địa cũng như phổ biến các chủ trương, chính sách hành chính từ tiếng Việt sang tiếng Ba Na đang đối mặt với rào cản lớn do thiếu hụt đội ngũ phiên dịch viên chuyên trách. Để giải quyết bài toán cấp thiết này, đề tài nghiên cứu đã tập trung xây dựng hệ thống dịch máy tự động nơ-ron (Neural Machine Translation - NMT) từ tiếng Việt sang tiếng Ba Na Kriêm, triển khai thực hiện trong khung thời gian từ ngày 22/02/2021 đến ngày 13/06/2021 tại Trường Đại học Bách Khoa – Đại học Quốc gia Thành phố Hồ Chí Minh.

Mục tiêu trọng tâm của nghiên cứu là ứng dụng kiến trúc học sâu hiện đại dựa trên mô hình Sequence to Sequence kết hợp cơ chế tập trung (Attention Mechanism) nhằm tối ưu hóa khả năng chuyển ngữ tự động với độ chính xác cao. Nghiên cứu khai thác nguồn dữ liệu thực tế thu thập trong 12 tháng (từ tháng 07/2019 đến tháng 06/2020) từ hệ thống bản tin phát thanh huyện Vĩnh Thạnh, tỉnh Bình Định cùng kho từ điển tiếng Ba Na Kriêm chuẩn hóa. Kết quả của luận văn mang ý nghĩa khoa học và thực tiễn sâu sắc khi giải quyết triệt để bài toán xử lý ngôn ngữ tự nhiên cho ngôn ngữ có nguồn tài nguyên số cực kỳ khan hiếm (low-resource language). Hệ thống giúp cắt giảm khoảng 70% thời gian biên soạn văn bản hành chính song ngữ tại địa phương, tạo tiền đề vững chắc cho việc bảo tồn di sản văn hóa phi vật thể và nâng cao hiệu quả truyền thông chính sách đến đồng bào thiểu số.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng trên nền tảng của các lý thuyết xử lý ngôn ngữ tự nhiên hiện đại, nổi bật là mô hình Dịch máy nơ-ron (NMT) và kiến trúc Transformer với cơ chế tự chú ý (Self-Attention). Trước đây, phương pháp dịch máy thống kê (SMT) dựa trên phân bố xác suất của các cặp câu song ngữ thường gặp giới hạn lớn về khả năng xử lý ngữ cảnh dài và hiện tượng thưa thớt dữ liệu. Để vượt qua nhược điểm này, luận văn áp dụng mô hình Transformer gồm 2 thành phần chính: bộ mã hóa (Encoder) và bộ giải mã (Decoder). Kiến trúc này loại bỏ hoàn toàn các tầng hồi tiếp tuần tự của mạng nơ-ron hồi quy (RNN) và mạng bộ nhớ dài - ngắn (LSTM), từ đó cho phép xử lý dữ liệu song song trên toàn bộ câu đầu vào.

Hệ thống tích hợp các khái niệm cốt lõi bao gồm biểu diễn từ đa chiều (Word Embedding) giúp ánh xạ ngữ nghĩa từ vựng vào không gian vector liên tục với độ dài d_model bằng 512 chiều, kết hợp kỹ thuật mã hóa vị trí (Positional Encoding) để bảo toàn trật tự từ trong chuỗi. Cơ chế chú ý đa đầu (Multi-Head Attention) với 8 đầu chú ý độc lập cho phép mô hình đồng thời học nhiều mối quan hệ ngữ nghĩa và cú pháp phức tạp giữa câu nguồn tiếng Việt và câu đích tiếng Ba Na. Ngoài ra, kỹ thuật kết nối tắt (Residual Connection) và tầng chuẩn hóa (Layer Normalization) được tích hợp xuyên suốt 6 tầng mã hóa và 6 tầng giải mã nhằm chống hiện tượng triệt tiêu gradient (vanishing gradient), giúp quá trình huấn luyện mạng sâu đạt trạng thái hội tụ nhanh chóng và ổn định.

Phương pháp nghiên cứu

Nghiên cứu sử dụng phương pháp thực nghiệm định lượng kết hợp kỹ thuật tiền xử lý dữ liệu chuyên biệt cho ngôn ngữ ít tài nguyên. Nguồn dữ liệu sơ cấp được trích xuất từ 2 nguồn chính: cuốn từ điển tiếng Ba Na Kriêm dạng hình ảnh do Sở Khoa học và Công nghệ tỉnh Bình Định phối hợp Viện Ngôn ngữ học biên soạn, và tập tài liệu phát thanh bản tin song ngữ huyện Vĩnh Thạnh thu thập liên tục trong 12 tháng. Cỡ mẫu gốc bao gồm 2.962 mục từ vựng, 465 cụm từ ngắn, 1.216 câu hội thoại thường nhật và 2.381 câu văn bản phát thanh radio chuyên đề.

Do văn bản tiếng Ba Na có hệ thống ngữ âm đặc thù với các ký tự và dấu phụ như dấu vành trăng khuyết và dấu phẩy trên, tác giả áp dụng công cụ Tesseract OCR kết hợp hệ thống quy tắc giải thuật heuristic để trích xuất văn bản từ tệp hình ảnh PDF và chuyển đổi bảng mã từ VNI-Times sang Unicode chuẩn. Nhằm khắc phục tình trạng thiếu hụt dữ liệu huấn luyện, phương pháp làm giàu dữ liệu (Data Augmentation) bằng cách phân tách câu đơn và thay thế từ đồng nghĩa, cùng từ loại đã được triển khai, tạo thêm 7.245 cặp câu mới. Tập dữ liệu sau khi tiền xử lý được phân chia thành tập huấn luyện (training set) với hệ số nhân tần suất từ 5 đến 10 lần cho các mẫu ngắn, và tập kiểm thử độc lập (test set) với hơn 11.000 đơn vị câu và từ để đánh giá khách quan hiệu năng mô hình.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình thực nghiệm đã chứng minh tính hiệu quả vượt trội của mô hình học sâu đề xuất trong việc xử lý cặp ngôn ngữ Việt – Ba Na:

  • Xây dựng thành công bộ ngữ liệu song ngữ chuẩn hóa đầu tiên cho phương ngữ Ba Na Kriêm với quy mô hơn 28.000 mẫu dữ liệu sau khi tăng cường, kết hợp tập kiểm thử độc lập vượt mốc 11.000 câu và từ vựng phong phú.
  • Tối ưu hóa cấu hình huấn luyện trên kiến trúc Transformer với 6 tầng mã hóa, 6 tầng giải mã, 8 đầu chú ý, kích thước batch size 512 và tốc độ học khởi tạo 0.1 sử dụng thuật toán tối ưu Adam. Mô hình đạt trạng thái hội tụ lý tưởng chỉ sau 10 epoch huấn luyện.
  • Thời gian hoàn tất quá trình huấn luyện toàn diện chỉ mất 3 giờ trên hạ tầng máy chủ trang bị GPU Nvidia Tesla P100 và bộ nhớ RAM 12GB, chứng minh tính khả thi cao khi triển khai trên các hệ thống phần cứng tầm trung.
  • Đánh giá chất lượng bản dịch tự động bằng độ đo tiêu chuẩn BLEU cho thấy mô hình đạt độ chính xác cao đối với các mẫu câu giao tiếp phổ thông, danh từ chỉ thực thể và văn bản hành chính ngắn, giảm thiểu đáng kể các lỗi sai lệch ngữ nghĩa so với phương pháp dịch từ đối từ truyền thống.

Thảo luận kết quả

Kết quả dịch thuật đạt được phản ánh chính xác các đặc trưng ngôn ngữ học của tiếng Ba Na. Khác với các ngôn ngữ phương Tây, tiếng Ba Na không có hệ thống biến đổi hình thái phức tạp, không chia thì quá khứ, hiện tại hay tương lai và không sử dụng cấu trúc câu bị động. Tuy nhiên, ngôn ngữ này sở hữu nhiều từ mượn gốc Việt đã được lược bỏ các dấu thanh điệu (sắc, huyền, hỏi, ngã, nặng) cùng hệ thống phụ âm kép đặc thù như br, kl, kr, hngl. Cơ chế Self-Attention trong Transformer đã học hiệu quả các quy luật tương quan vị trí giữa từ đơn tiếng Việt và từ mượn biến thể trong tiếng Ba Na Kriêm, ví dụ như cặp chuyển đổi ngữ cảnh từ câu "Tôi đi học" sang "Inh năm hok".

Để phân tích chuyên sâu hiệu năng giải mã, kết quả thực nghiệm có thể được biểu diễn trực quan qua biểu đồ ma trận trọng số Attention Matrix thể hiện mức độ liên kết giữa các cặp từ nguồn và đích. Bên cạnh đó, bảng so sánh giữa hai thuật toán tìm kiếm ngôn ngữ đích là Greedy Search (độ rộng beam bằng 1) và Beam Search (độ rộng beam từ 3 đến 5) cho thấy Beam Search cải thiện độ mượt mà của câu dịch lên khoảng 12% đến 18% nhưng tiêu tốn tài nguyên bộ nhớ gấp 3 lần. Kỹ thuật làm giàu dữ liệu đã chứng minh vai trò then chốt khi giúp tỷ lệ nhận diện từ vựng mới tăng hơn 200%, giải quyết căn bản điểm nghẽn thiếu dữ liệu huấn luyện thường gặp ở các ngôn ngữ thiểu số.

Đề xuất và khuyến nghị

Dựa trên kết quả nghiên cứu và những hạn chế thực tế về nguồn tài nguyên ngôn ngữ, 4 nhóm giải pháp chiến lược được đề xuất nhằm nâng cao chất lượng hệ thống dịch máy trong tương lai:

  1. Tích hợp mô hình ngôn ngữ tiền huấn luyện chuyên sâu: Triển khai tích hợp các bộ mã hóa đã được huấn luyện trước dành riêng cho tiếng Việt như PhoBERT vào tầng Encoder của mô hình dịch máy. Giải pháp này do nhóm nghiên cứu xử lý ngôn ngữ tự nhiên thực hiện trong vòng 6 đến 12 tháng tới, hướng tới mục tiêu nâng cao điểm số chất lượng dịch BLEU thêm 15% đến 20% và giảm thiểu lỗi ngữ nghĩa ở các câu ghép phức tạp.
  2. Mở rộng và số hóa kho ngữ liệu song ngữ đa phương ngữ: Thu thập, biên dịch và chuẩn hóa thêm khoảng 50.000 cặp câu song ngữ chất lượng cao bao gồm cả các nhánh phương ngữ Ba Na Kon Tum, Ba Na Gia Lai (An Khê) và Ba Na Tơ Lô. Hoạt động này do Sở Khoa học và Công nghệ phối hợp với Viện Ngôn ngữ học triển khai theo lộ trình 2 năm (2022 - 2024).
  3. Phát triển ứng dụng dịch tự động đa nền tảng cho cán bộ cơ sở: Thiết kế cổng thông tin dịch thuật trực tuyến và ứng dụng di động hỗ trợ dịch giọng nói sang văn bản, phục vụ trực tiếp cho hơn 1.000 cán bộ, công chức công tác tại vùng đồng bào dân tộc thiểu số Tây Nguyên. Đơn vị phát triển phần mềm cần tối ưu thời gian phản hồi dưới 500 mili-giây cho mỗi đoạn văn bản hành chính.
  4. Tối ưu hóa thuật toán tiền xử lý ngữ âm và từ vựng chuyên ngành: Xây dựng module tự động nhận diện và sửa lỗi chính tả cho các ký tự ngữ âm đặc thù của tiếng Ba Na, đồng thời cập nhật từ điển thuật ngữ kinh tế - xã hội định kỳ 6 tháng một lần nhằm giảm tỷ lệ từ chưa biết (Out of Vocabulary - OOV) xuống mức dưới 3%.

Đối tượng nên tham khảo luận văn

Công trình nghiên cứu mang lại giá trị tham khảo thiết thực cho nhiều nhóm đối tượng chuyên môn và quản lý xã hội:

  • Các nhà nghiên cứu và học viên cao học chuyên ngành Khoa học Máy tính, Trí tuệ Nhân tạo: Tiếp cận phương pháp luận hoàn chỉnh về xử lý ngôn ngữ tự nhiên cho ngôn ngữ ít tài nguyên, phương pháp tăng cường dữ liệu và quy trình cài đặt mô hình Transformer 6 tầng trên phần cứng GPU 12GB RAM.
  • Cán bộ, công chức, viên chức công tác tại các cơ quan quản lý nhà nước vùng Tây Nguyên: Ứng dụng công cụ dịch thuật tự động để nhanh chóng chuyển hóa các nghị quyết, văn bản tuyên truyền pháp luật sang tiếng mẹ đẻ của hơn 174.000 đồng bào Ba Na, nâng cao hiệu quả công tác dân vận.
  • Các nhà ngôn ngữ học và chuyên gia văn hóa dân gian: Khai thác kho ngữ liệu số hóa và các phân tích ngữ âm, từ vựng đối chiếu Việt – Ba Na Kriêm phục vụ công tác bảo tồn ngôn ngữ và biên soạn tài liệu giảng dạy song ngữ chuẩn quốc gia.
  • Các kỹ sư phát triển phần mềm và doanh nghiệp công nghệ xã hội: Tái sử dụng mã nguồn và quy trình xử lý dữ liệu để xây dựng các giải pháp trợ lý ảo, phần mềm giáo dục cộng đồng và hệ thống thông tin phục vụ phát triển kinh tế vùng sâu, vùng xa.

Câu hỏi thường gặp

  1. Tại sao luận văn lựa chọn kiến trúc Transformer thay vì mạng nơ-ron hồi quy RNN hoặc LSTM? Kiến trúc Transformer với cơ chế Multi-Head Attention cho phép xử lý toàn bộ chuỗi văn bản song song thay vì tuần tự từng từ như RNN/LSTM. Điều này giúp loại bỏ triệt để hiện tượng mất mát thông tin ngữ cảnh xa (vanishing gradient) và rút ngắn thời gian huấn luyện xuống còn 3 giờ trên GPU Tesla P100.

  2. Thách thức lớn nhất khi thu thập dữ liệu tiếng Ba Na Kriêm là gì và tác giả đã giải quyết như thế nào? Thách thức lớn nhất là dữ liệu từ điển nằm ở dạng tệp hình ảnh PDF và văn bản radio dùng bảng mã cũ VNI-Times với nhiều ký tự ngữ âm đặc thù. Tác giả đã kết hợp thư viện Tesseract OCR với các thuật toán heuristic chuyên biệt để nhận dạng chuẩn xác các dấu vành trăng khuyết và dấu phẩy trên.

  3. Kỹ thuật làm giàu dữ liệu trong nghiên cứu đã tạo ra bao nhiêu mẫu câu mới? Thông qua kỹ thuật tách câu đơn từ các đoạn hội thoại mẫu và thay thế các cặp từ đồng nghĩa, cùng từ loại từ kho từ điển tiếng Ba Na, tác giả đã tạo ra thêm 7.245 cặp câu song ngữ mới, nâng tổng quy mô tập dữ liệu huấn luyện lên hơn 28.000 mẫu sau khi nhân hệ số.

  4. Cấu hình phần cứng và siêu tham số huấn luyện của mô hình được thiết lập như thế nào? Mô hình được huấn luyện trên hệ điều hành Linux với GPU Nvidia Tesla P100 và 12GB RAM. Các siêu tham số tối ưu gồm 6 tầng mã hóa, 6 tầng giải mã, 8 đầu chú ý, kích thước vector biểu diễn d_model 512, batch size 512, tối ưu hóa bằng thuật toán Adam trong 10 epoch.

  5. Độ đo BLEU được áp dụng trong luận văn đánh giá chất lượng bản dịch dựa trên nguyên lý nào? Độ đo BLEU tính toán mức độ trùng khớp của các cụm n-gram (từ 1-gram đến 4-gram) giữa bản dịch máy và bản dịch chuẩn của con người, kết hợp chỉ số phạt độ dài Brevity Penalty. Giá trị BLEU tiệm cận 1 chứng minh bản dịch máy đạt độ chính xác cao về ngữ nghĩa và cú pháp.

Kết luận

  • Luận văn đã thiết kế và hiện thực hóa thành công hệ thống dịch máy nơ-ron tự động từ tiếng Việt sang tiếng Ba Na Kriêm đầu tiên ứng dụng trọn vẹn kiến trúc Transformer hiện đại.
  • Xây dựng quy trình xử lý và làm giàu dữ liệu chuẩn hóa, mở rộng kho ngữ liệu huấn luyện lên hơn 28.000 mẫu và thiết lập tập kiểm thử độc lập với hơn 11.000 đơn vị từ và câu.
  • Tối ưu hóa mô hình với 6 tầng mã hóa, 6 tầng giải mã và 8 đầu chú ý, đạt tốc độ huấn luyện nhanh trong vòng 3 giờ trên hệ thống GPU Tesla P100 12GB RAM.
  • Đánh giá định lượng qua độ đo BLEU khẳng định khả năng dịch thuật chính xác, mượt mà các cấu trúc câu giao tiếp và văn bản hành chính thông dụng.
  • Đóng góp giải pháp công nghệ mang tính đột phá, mở ra hướng đi bền vững cho công tác bảo tồn ngôn ngữ dân tộc thiểu số và thu hẹp khoảng cách tiếp cận thông tin số tại Việt Nam.

Kế hoạch nghiên cứu tiếp theo sẽ tập trung tích hợp mô hình ngôn ngữ tiền huấn luyện PhoBERT cho bộ mã hóa và thu thập thêm 50.000 mẫu câu song ngữ đa phương ngữ trong giai đoạn 2022 - 2024. Độc giả quan tâm và các cơ quan chuyên môn có thể tiếp tục kế thừa khung kiến trúc này để mở rộng ứng dụng dịch máy cho các ngôn ngữ dân tộc bản địa khác trên khắp cả nước.