Chương 1. Tổng quan vé van đề nghiên cứu 11 1.2 được tác giả Bernard Vauquois [124] trình bày, mô tả các phương pháp dịch máy. phân tích sinh Chuyển đổi —— Dịch trực tiếp nguồn Hình 1.2 : Tam giác Vauquois mô tả các phương pháp dịch Hình 1.2 mô tả quá trình dịch văn bản từ ngôn ngữ nguồn sang ngôn ngữ đích theo ba phương pháp khác nhau: 1. Phương pháp dịch trực tiếp, hệ thống sẽ dịch bằng cách thay thế đơn giản những từ hoặc cụm từ trong ngôn ngữ nguồn bằng những từ hoặc cụm từ tương ứng trong ngôn ngữ đích.
Phương pháp dịch chuyển đổi, hệ thống thực hiện theo ba bước, đầu tiên là chuyển đổi văn bản ở ngôn ngữ nguồn thành một dạng biểu diễn trung gian (thường là cây phân tích cú pháp), sau đó thực hiện chuyển các biểu diễn trung gian này thành dạng văn bản tương ứng trong ngôn ngữ đích, cuối cùng là sinh ra văn bản ở ngôn ngữ đích. Phương pháp dịch liên ngữ, hệ thống thực hiện chuyển đổi văn bản từ ngôn ngữ nguồn sang văn ban 6 ngôn ngữ trung gian trước Chương 1. Tổng quan vé van đề nghiên cứu 12 khi thực hiện chuyển văn bản từ ngôn ngữ trung gian thành văn bản ở ngôn ngữ đích. Đầu năm 1990, một bước ngoặt lớn là có sự quan tâm nhiều hơn của nhiều nhà nghiên cứu trong dịch máy dựa vào dit liệu.
Với sự phát triển mạnh mẽ của Internet, nhu cầu trao đổi thông tin bùng no cùng với sự tích lũy kiến thức về mặt ngôn ngữ, sức mạnh của máy tính tăng lên và có nhiều kết quả mới về mặt lý thuyết, cho nên việc phát triển các mô hình dịch tự động trở nên rất cần thiết. Dịch dựa trên ví dụ là một trong những phương pháp tiếp cận sớm được đưa ra trong dịch máy theo hướng dữ liệu [107]. Nó cỗ gắng tim một câu tương tự với đầu vào đã cho trong ví dụ được dịch trước đó. Sau đó, tạo ra những thay đổi thích hợp cho bản dịch được lựa chọn.
Phương pháp này nhanh hơn dựa trên luật nhưng không đảm bảo bản dịch tốt hơn. Do sự gia tăng sức mạnh tính toán và khả năng tiếp cận các dữ liệu lớn, phương pháp thống kê đã được đề xuất để thực hiện phân tích sâu hơn so với các phương pháp tiếp cận dựa trên ví dụ. Năm 1990, Brown và cộng sự đã trình bày mô hình toán học của dịch máy thống kê [97], tới năm 1993 thì các tác giả giới thiệu năm mô hình thống kê được gọi là mô hình IBM và đưa ra các thuật toán để ước lượng các tham số của mô hình [S]. Mặc dù nhóm tác giả nghiên cứu trên một nền tảng toán học vững chắc nhưng vẫn chưa có nhiều nghiên cứu tập trung cho dịch máy.
Năm 1999, nhiều nhà nghiên cứu đã cùng nhau cài đặt lại các mô hình IBM tại hội thao mùa hè tại Dai học Johns Hopkins, nhóm tác giả Al-Onaizan và cộng sự trong sáu tuần tại hội thảo đã cài đặt công cụ dịch máy thống kê (SMT) (gọi là EGYPT) [3] và công cụ GIZA [90] Chương 1. Tổng quan vé van đề nghiên cứu 13 được đề cập trong báo cáo kỹ thuật cho việc gióng từ. Franz Och sau đó mở rộng các công cụ gióng từ thành GIZA++ [57], bổ sung thêm nhiều tính năng cho việc học mô hình dịch thống kê từ dữ liệu văn bản va được cài đặt như trong mô tả của Brown và cộng sự năm 1993 [8], của Vogel và cộng sự năm 1996 [125] và của Och năm 2000 [90, 91]. Từ năm 2013, dịch máy phát triển sang một giai đoạn mới, bắt đầu từ đề xuất kiến trúc mã hóa - giải mã (Encoder - Decoder) cho mô hình dịch máy mạng nơ-ron [59], hiện nay kiến trúc Transformer [123] được đánh giá là hiện đại, tiên tiến nhất (State-Of-The-Art).
Với các phương pháp dịch dựa trên mạng nơ-ron, kỹ thuật khai phá tri thức từ kho ngữ liệu được thực hiện nhờ khả năng tính toán và lưu trữ của máy tính, điều này đã làm thay đổi hoàn toàn các phương pháp dịch truyền thống, mang lại chất lượng cao cho các mô hình dịch. Một số hệ dịch đã được ứng dụng phổ biến, tiêu biểu như hệ dịch tự động Google translate!, Bing Microsoft Translator 2.2 Dịch máy thống kê Dịch máy thống kê (SMT- Statistical Machine Translation) là một phương pháp tiếp cận của dịch máy dựa trên phân tích thống kê tập dữ liệu các cặp câu từ hai ngôn ngữ (ngữ liệu song ngữ). Các phương pháp tiếp cận thống kê tương phản với các phương pháp tiếp cận dựa trên luật trong dịch máy. Thay vì xây dựng các từ điển, các quy luật chuyển đổi bằng tay, hay ghi nhớ các đoạn giống nhau từ kho ngữ liệu, dịch máy thống kê tự động xây dựng các từ điển, các quy luật dựa trên kết quả thống kê có được từ các kho ngữ 1.com/translator Chương 1.
Tổng quan vé van đề nghiên cứu 14 liệu. Chính vì vậy, dịch máy dựa vào thống kê có tính linh hoạt cao, áp dụng được cho bất kỳ cặp ngôn ngữ nào.1 Cơ sở toán hoc Cơ sở toán học của dịch máy thống kê được Brown và cộng sự đề xuất năm 1990 [97], hoạt động được mô tả như Hình 1. Kho ngữ liệu song ngữ đơn ngữ _ Phân tích thống kê - Mô hình dich Mô hình ngôn ngữ Văn bản Bộ giải mã nguồn |: Hệ thông dịch máy thông kê Hình 1.3 : Kiến trúc cơ bản của mô hình dịch máy thống kê Bài toán dịch máy thống kê có thể được mô tả như sau: gọi 5 là câu trong ngôn ngữ nguồn và T là câu trong ngôn ngữ dich, cặp (S, 7) là cặp câu tương đương dịch. Ứng với mỗi câu S$ được cho bat kỳ, ta đi tìm câu 7' hợp lý nhất (là câu được dịch gần đúng nhất của câu nguồn sang câu đích), nghĩa là ta phải đi tìm xác suất P(S, 7) cực đại.
Vì S$ và 7' phụ thuộc lẫn nhau nên theo lý thuyết xác suất có điều kiện: P(S,T) = P(S) + P(T | S) (1. Tổng quan vé van đề nghiên cứu 15 Khi đó bai toán dịch trở thành: argmaxP(S, 7) = argmaxP(S) « P(7 | S) (1.3) P(S) Trong công thức 1.3, mau số không phụ thuộc vào T, do đó bài toán dịch máy trở thành tìm 7 để P(T)P(S | T) đạt giá trị lớn nhất. Gọi P(T) là xác suất mô hình ngôn ngữ và P( | 7) là xác suất mô hình dịch, khi đó một hệ thống dịch máy thống kê đòi hỏi một phương pháp tính toán xác suất mô hình ngôn ngữ, một phương pháp tính toán xác suất mô hình dịch và một phương pháp tìm kiếm câu đích 7 mà có giá trị P(T)P(S | 7) là lớn nhất.2 Dich máy thống kê dựa vào từ Những năm 1990, IBM [8] đã đề xuất giải thuật cho năm mô hình dịch thống kê dựa vào từ (word-based) là IBM1, IBM2, IBM3, IBM4, IBM5. Các mô hình này được sử dụng rộng rãi trong các công trình nghiên cứu về dịch máy thống kê sau này.
Phương pháp này, đơn vị cơ sở được dịch là các từ. Số từ trong câu được dịch là khác nhau phụ thuộc vào các từ ghép, hình thái từ và thành ngữ. Tuy nhiên, tùy vào đặc điểm của ngôn ngữ, như cặp ngôn ngữ Anh-Việt cũng giống với cặp ngôn ngữ Anh-Trung, Anh-Nhật,., hệ dịch phải đối mặt với khó Chương 1. Tổng quan vé van đề nghiên cứu 16 khăn trong quá trình sắp xếp trật tự của các từ tiếng Anh tương ứng khi dịch sang câu tiếng Việt.
Trong quá trình dịch, kết nối từ tiếng Anh tương ứng với từ tiếng Việt có thể là 1-1, 1-không, 1-nhiều, nhiéu-1 hoặc nhiều-nhiều. Mô hình dịch dựa trên đơn vị từ không cho kết quả tốt trong trường hợp kết nối nhiều-1, 1-nhiều hoặc nhiều-nhiều với trật từ các từ trong câu tương ứng là khác nhau. Khi đó, phân tích dựa trên đơn vị cụm từ (phrase-based) được đề xuất để giải quyết vấn đề này. Dịch máy thống kê dựa vào cum từ Mô hình này là mở rộng của mô hình dịch máy trên cơ sở từ, nhằm giải quyết những hạn chế của mô hình dịch máy thống kê trên cơ sở từ bang cách dịch các cum từ (phrase-based) [63].
Trong đó độ dài các cụm từ nguồn và cụm từ đích có thể khác nhau. Khái niệm cụm từ ở đây khác với cụm từ trong ngôn ngữ học, nó là một chuỗi các từ liền nhau, được xác định bằng cách sử dụng các phương pháp thống kê để trích rút từ các cặp câu song ngữ. Trong [63], Koehn đã mô tả một cách khái quát quá trình dịch thống kê dựa trên cụm từ như sau: — Câu nguồn được tách thành các cụm từ. — Mỗi cum từ được dịch sang ngôn ngữ đích.
— Các cụm từ đã dịch được sắp xếp theo một thứ tự phù hợp.4 minh họa quá trình dịch thống kê dựa trên đơn vị cụm từ. Ở đây, đầu vào là một câu tiếng Anh được tách thành các cụm từ riêng biệt, mỗi cụm từ này sau đó được dịch lần lượt sang ngôn ngữ đích (ở day là tiếng Việt), các cum từ này có độ dài có thể khác Chương 1. Tổng quan vé van đề nghiên cứu 17 nhau, sau đó thứ tự các cụm từ ở phía ngôn ngữ đích được sắp xếp lại (reorder) cho phù hợp. Input sentence | am living in a peaceful country Output sentence | Tôi đang sống tại một thanh_ bình đất nước Sentence is reordered | = Tdi dang sống tai một đất nước thanh_bình Hình 1.4 : Ví dụ minh họa quá trình dịch dựa vào cụm ttt Trước khi dịch máy mạng nơ-ron [69, 76, 80, 106, 116] phát triển, phương pháp dịch máy thống kê dựa vào cụm từ đã cho thấy đây là phương pháp dịch máy tốt nhất được biết đến, chiếm ưu thế trong nghiên cứu cũng như trong thương mại vì hiệu quả của nó.
Mặc dù chất lượng tốt hơn phương pháp dịch thống kê dựa trên đơn vị từ nhưng phương pháp dịch thống kê dựa trên cụm từ vẫn chưa giải quyết được một số vấn đề như ngữ pháp, khả năng lựa chọn cụm từ với tính chính xác cao, dịch tên riêng, từ vựng có hạn [100].3 Dịch máy mạng nơ-ron Dịch máy mạng no-ron (Neural Machine Translation - NMT) là phương pháp sử dụng mang nơ-ron nhân tao (Artificial Neural Network - NN) để giải quyết bài toán dịch máy (Machine Translation - MT). Như trình bay ở trên, phương pháp dich theo cụm từ (phrase-based) hoạt động theo cách chia nhỏ câu thành các cụm từ riêng biệt và tiến hành dịch từng cụm từ một, sau đó các cụm từ này được ghép lại thành một câu hoàn chỉnh, phương pháp này cho kết quả còn nhiều hạn chế do cách tiếp cận không thực sự giống với cách mà con người sử dụng Chương 1.