Chương 1 giới thiệu khái quát về đề tài. Chương 2 giới thiệu các công trình nghiên cứu liên quan về dịch máy, tìm hiểu ngôn ngữ tiếng Ba Na, các hướng giải quyết cho bài toán, Chương 3 cung cấp một số cơ sở lý thuyết đặt nền móng cho các mô hình được đề xuất trong chương 4. Chương 5 là các kết quả thực nghiệm các chỉ tiêu đánh giá, kết quả đánh giá của các phương pháp và phân 2 tích, nhận xét các kết quả đó. Phần cuối cùng là phần kết luận về luận văn và trình bày hướng phát triển trong tương lai.
3 CHƯƠNG 2: CÔNG TRÌNH LIÊN QUAN Luận văn nghiên cứu các công trình hiện nay về các mô hình dịch máy, đặc trưng của ngôn ngữ Ba Na để xác phương pháp ứng dụng cho đề tài.1 Các mô hình dịch máy Hiện nay, dịch máy được phân chia thành một số phương pháp như: dịch máy trên cơ sở luật, dịch máy thống kê (Statistical Machine Translation – SMT), dịch máy trên cơ sở ví dụ và dịch máy bằng nơ-ron (Neural Machine Translation). Do những khác biệt về ngữ hệ, khác biệt về văn hóa và thiếu vắng nguồn tài nguyên nên chất lượng cũng như phạm vi ứng dụng còn nhiều hạn chế.1 Dịch máy trên cơ sở luật Phương pháp dịch máy trên cơ sở luật cần phải xây dựng hệ thống luật cú pháp, ngữ nghĩa và phải có một từ điển khá đầy đủ thông tin cho các mục từ như ngữ nghĩa, ngữ dụng,. Để thực hiện phương pháp dịch máy dựa trên cơ sở luật, người ta cần nhiều thời gian và tiền bạc nhưng sản phẩm dịch vẫn không đạt độ chính xác như mong đợi.2 Dịch máy thống kê (SMT) SMT là một phương pháp dịch máy, trong đó các bản dịch được tạo ra trên cơ sở các mô hình thống kê có các tham số được bắt nguồn từ việc phân tích các cặp câu song ngữ. Các phương pháp tiếp cận thống kê tương phản với các phương pháp tiếp cận dựa trên luật trong dịch máy cũng như với dịch máy dựa trên ví dụ.
Ý tưởng đằng sau dịch máy thống kê đến từ lý thuyết thông tin. Tài liệu được dịch theo phân bố xác suất p(e|f) trong đó e là ngôn ngữ đích (ví dụ, Tiếng Việt) dịch từ f là ngôn ngữ nguồn (ví dụ, Tiếng Anh). Ưu điểm vượt trội của phương pháp này là thay vì xây dựng các từ điển, các quy luật chuyển đổi bằng tay, hệ dịch tự động thiết lập các từ điển, các quy luật dựa trên kết quả thống kê có được từ các kho ngữ liệu. Chính vì vậy, dịch máy dựa vào thống kê có tính khả chuyển cao áp dụng được cho bất kỳ cặp ngôn ngữ nào.
Dịch máy thống kê hiện nay đi theo 3 hướng tiếp cận chính, đó là dịch máy thống kê dựa trên đơn vị từ; dựa trên đơn vị cụm từ và dựa trên cú pháp. Trong đó dịch máy thống kê dựa trên đơn vị cụm từ hiện đang là cách tiếp cận thu hút được nhiều sự quan tâm nhất của giới nghiên cứu dịch máy. 4 Tuy nhiên, cách tiếp cận thống kê nói chung vẫn phải đối mặt với những hạn chế do sự thiếu hụt về thông tin ngôn ngữ. Mô hình dịch thống kê vẫn chưa giải quyết được một số vấn đề cơ bản của dịch máy như trật tự từ, khả năng lựa chọn cụm từ phù hợp, và vấn đề về dữ liệu thưa.
Các cải tiến làm tăng chất lượng dịch bằng cách tích hợp các thông tin ngôn ngữ vào các bước tiền xử lý, hậu xử lý hay tích hợp trực tiếp vào mô hình dịch đã được đề xuất [7]. Với sự xuất hiện của phương pháp dịch máy thống kê kết hợp thông tin ngôn ngữ, những hạn chế trên đã được cải thiện đáng kể.3 Dịch máy nơ-ron (NMT) Đây là phương pháp dịch sử dụng mạng nơ-ron nhân tạo và học sâu – deep learning. Với cách dịch thông thường, các câu được chia nhỏ và dịch thành từng phần, nhưng bằng cách sử dụng NMT, việc dịch sử dụng cách thức học mạng nơ-ron để chuyển đổi từ ngôn ngữ nguồn → diễn đạt trung gian → ngôn ngữ kết quả dựa trên toàn bộ câu nguồn, nên kết quả dịch tự nhiên hơn. Đây được coi là một hệ dịch cho chất lượng dịch vượt trội so với các phương pháp truyền thống trước đây.
Hiện tại, Google Dịch đang sử dụng phương pháp này. Thông thường, hệ dịch được huấn luyện trên lượng lớn dữ liệu song ngữ và dữ liệu đơn ngữ của ngôn ngữ đích đối với dịch máy thống kê và dữ liệu song ngữ đối với dịch máy nơ-ron, trong bản thân những dữ liệu huấn luyện này có thể bao gồm các chủ đề đồng nhất hoặc không đồng nhất và thường thì mỗi chủ đề đó sẽ có tập các từ thuật ngữ riêng biệt. Chất lượng của bản dịch phụ thuộc rất lớn vào dữ liệu huấn luyện, nếu miền dữ liệu huấn luyện và miền thử nghiệm giống nhau hoặc có sự tương đồng càng lớn thì chất lượng bản dịch thu được sẽ càng tốt so với việc miền dữ liệu dùng để huấn luyện và miền thử nghiệm đặc biệt khác nhau hoặc có ít sự tương đồng hơn. Với phương pháp này, người ta chỉ cần huấn luyện một hệ thống duy nhất trên tập văn bản nguồn và văn bản đích (end-to-end system), không cần phải xây dựng một pipeline gồm các hệt thống chuyên biệt giống như SMT, không cần phải có nhiều kiến thức chuyên môn về ngôn ngữ, nhờ vậy mà có thể áp dụng cho các cặp ngôn ngữ khác nhau khá dễ dàng.
5 Các mô hình dịch máy nơ-ron thường là bộ mã hóa – giải mã (encoders – decoders), mã hóa một câu đầu vào thành một vector có chiều dài cố định mà từ đó bộ giải mã tạo ra một bản dịch. Trước khi Google công bố bài báo về Transformers (Attention Is All You Need), hầu hết các tác vụ xử lý ngôn ngữ tự nhiên, đặc biệt là dịch máy (Machine Translation) sử dụng kiến trúc Recurrent Neural Networks (RNNs). Điểm yếu của phương pháp này là rất khó bắt được sự phụ thuộc xa giữa các từ trong câu và tốc độ huấn luyện chậm do phải xử lý input tuần tự. Transformers sinh ra để giải quyết 2 vấn đề này; và các biến thể của nó như BERT, GPT-2 tạo ra state-of-the-art mới cho các tác vụ liên quan đến NLP.
Các bài báo nghiên cứu về NMT gần đây càng nhiều [9] chứng tỏ sự mới mẻ, quan tâm cũng như hiệu quả của dịch máy nơ-ron đã thu hút các nhà khoa học là khá lớn. Cùng với sự phát triển của khoa học kỹ thuật, các máy tính với cấu hình phần cứng mạnh mẽ ra đời ngày càng nhiều thì vấn đề phần cứng cũng phần nào được giải quyết, cũng bởi vì không cần nhiều kiến thức chuyên sâu về ngôn ngữ nhiều, chúng tôi quyết định chọn mô hình dịch máy nơ-ron với các phương pháp kỹ thuật Transformer để áp dụng vào bài toán dịch máy từ tiếng Việt và tiếng Ba Na.2 Ngôn ngữ Ba Na Người Ba Na cư trú ở các tỉnh Kon Tum, Gia Lai, Bình Ðịnh và Phú Yên với tổng dân số là 174. Tại Kontum, người Ba Na cư trú tập trung tại 15 làng xung quanh thị xã Kontum như Kon Hơ ngo, Kon Rơ Bang, Kon Rơ Pắt, Kon Rơ Hai, Kon Kơ Lo. Ở Gia Lai, người Ba Na tập trung tại Măng Giang, An Khê (Kơ Bang), Giang Trung, Giang Nam, Bơ Goong.
Tại tỉnh Bình Ðịnh, người Ba Na cư trú tập trung tại các xã huyện Vĩnh Thạnh và một số xã thuộc huyện Vân Canh, An Lão và Hoài Ân [2]. Người Ba Na thuộc nhóm Môn Khơ me. Về mặt dân tộc học, người Ba Na phân thành các nhánh Gơ la, Tơ Lô, Giơ Lâng, Kon Kơđeh, A La Kông, Kơ Pơng Kông, Kriêm. Về mặt ngôn ngữ, tiếng Ba Na về cơ bản thống nhất trong cơ cấu ngữ âm, ngữ pháp.
Tuy nhiên, do quá trình biến đổi lịch sử, do tiếp xúc với các ngôn ngữ khác nhau, tiếng nói của mỗi nhóm địa phương có sự khác biệt về cách phát âm, và một số về từ vựng. Các phương ngữ chính tiếng Ba Na gồm: Ba Na Kon Tum, Ba Na An Khê, và Ba Na Tơ lo, Ba Na Kon Kơ Ðeh, Ba Na Kriêm; giữa các phương ngữ trên, tìm thấy sự khác biệt rõ rệt giữa Ba Na Kon tum, Ba Na Gia lai (An Khê) và Ba Na 6 Bình Ðịnh (Ba Na Kriêm). Người Ba Na ở Vĩnh Thạnh còn giữ được nhiều nét văn hoá tộc người đặc thù hơn cả. Người Ba Na ở Vĩnh Thạnh, An Lão, một số xã ở Hoài Ân, thuộc nhóm Ba Na Kriêm.
Theo đồng bào Ba Na ở Vĩnh Thạnh, tên gọi Kriêm, ban đầu là tên con sông Ðăc Kriêm; người Ba Na Kriêm – người Ba Na sống quanh con sông Kriêm, ở vùng thấp. Người dân Ba Na Kriêm cũng cho rằng, về nguồn gốc, Ba Na Kriêm vốn từ khu vực Gia Lai chuyển đến [2]. Từ những nguồn trên, nghiên cứu xoay quanh ngôn ngữ Ba Na Kriêm gồm từ điển, các câu hội thoại cũng như nội dung phát thanh của truyền hình Vĩnh Thạnh.1 Từ điển Ba Na Kriem Hình 2.1: Bảng chữ cái tiếng Ba Na Kriem Dấu: “'” – (dấu “phẩy trên”) và dấu “ ̆ ” (dấu “vành trăng khuyết”) Cách ghi các nguyên âm: a, ă, e, ĕ, ê, ê̆, i, ĭ, o, ŏ, ô, ô̆, ơ, ơ̆, u, ŭ, ư, ư̆, ươ Cách ghi các phụ âm đơn: b, 'b, ch, d, đ, g, h, i, j, k, kh, l, m, n, nh, ng, p, ph, r, s, t, th, u, w, y. Cách ghi các phụ âm kép: hm, hnh, 'm, 'n, 'ng, hk, kl, kr, br, li, pi, su, pu, ih, hngl, hri, 'ng, Các nguyên âm đôi: ia, iă, ie, iĕ, iô, iô̆, ua, uă, ue, uĕ, uê, uê̆ 7 Tiếng Ba Na còn hạn chế khi chưa có nhiều từ vựng, nên khi dịch từ tiếng Việt sang, với những từ không có trong từ điển tiếng Ba Na sẽ mượn từ tiếng Việt, bỏ các dấu không có trong tiếng Ba Na như sắc, hỏi, ngã, nặng.2 Một số quy luật của tiếng Ba Na Theo nghiên cứu của chúng tôi ở các đoạn hội thoại từ cuốn từ điển Ba Na Kriem, tiếng Ba Na không có các thể bị động, chia các thì quá khứ, hiện tại hay tương lai như tiếng Anh.3 Kiến trúc Transformer Được đề xuất ở bài báo “Attention is all you need” [5], sử dụng cơ chế tập trung.
Kiến trúc này song song hóa bằng cách học chuỗi hồi tiếp với cơ chế tập trung, đồng thời mã hóa vị trí của từng phần tử trong chuỗi. Kết quả là ta có một mô hình tương thích với thời gian huấn luyện ngắn hơn đáng kể. Tương tự như mô hình Sequence to sequence (seq2seq), Transformer cũng dựa trên kiến trúc mã hóa-giải mã.