phần mở đầu, kết luận, danh mục các công trình đã công bố của tác giả và tài liệu tham khảo. Tổng quan về các vấn đề liên quan đến luận án Chương này trình bày tổng quan các kiến thức cơ sở như các định nghĩa, phân loại về dịch máy thống kê, các bước xây dựng một hệ thống dịch máy, các độ đo thường được áp dụng. Tổng hợp, phân tích và đánh giá các kỹ thuật nâng cao chất lượng hệ thống dịch máy thống kê trong phạm vi nghiên cứu của luận án, từ đó nêu ra một số vấn đề còn tồn tại mà luận án sẽ tập trung giải quyết. Tăng cường dữ liệu huấn luyện dịch máy thống kê cặp ngôn ngữ Việt – Anh bằng kỹ thuật dịch ngược.
Nội dung chương này trình bày đóng góp của luận án nhằm tăng cường dữ liệu huấn luyện bằng kỹ thuật dịch ngược, kết hợp sử dụng độ đo thích nghi để lựa chọn dữ liệu. Trong chương này, luận án thực hiện thực nghiệm để chỉ ra rằng việc không lựa chọn dữ liệu tăng cường có thể khiến cho hệ thống dịch máy trở nên kém đi, từ đó đề xuất phép đo độ thích nghi để lựa chọn dữ liệu tăng cường cho hệ thống dịch. Cải tiến mô hình gióng hàng từ trong hệ thống dịch máy thống kê cặp ngôn ngữ Việt – Anh với kỹ thuật chia nhỏ từ Nội dung Chương 3 tập trung giải quyết bài toán gióng hàng từ cho cặp ngôn ngữ có tài nguyên hạn chế bằng cách gia tăng tần suất xuất hiện của các từ trong ngữ liệu huấn luyện. Trong chương này, luận án trình bày đề xuất áp dụng các phương pháp chia nhỏ từ đang được sử dụng cho dịch máy nơ -ron nhằm biểu diễn từ và phương pháp chia nhỏ từ dựa trên đặc điểm hình thái từ tiếng Anh, đề xuất cải tiến mô hình gióng hàng từ cho phù hợp với việc chia nhỏ từ trong tiền xử lý dữ liệu huấn luyện.
TỔNG QUAN VỀ C ÁC VẤN ĐỀ LI Ê N QUAN LUẬN ÁN Chương này trình bày tổng quan về các vấn đề nghiên cứu trong luận án, bao gồm: dịch máy, dịch máy thống kê, dịch máy nơ-ron, các phương pháp tăng cường dữ liệu cho dịch máy, gióng hàng từ trong dịch máy thống kê; Đưa ra phân tích, đánh giá các công trình nghiên cứu liên quan, đề xuất và xác định những nội dung luận án sẽ tập trung giải quyết. Tổng quan về dịch máy Dịch máy là quá trình tự động chuyển nghĩa của từ hoặc văn bản từ ngôn ngữ này sang ngôn ngữ khác. Nó liên quan đến việc giải mã nghĩa của ngôn ngữ nguồn và sau đó mã hóa lại theo nghĩa vào ngôn ngữ đích. Quá trình này liên quan đến một loạt hoạt động phức tạp, đòi hỏi kiến thức đầy đủ về ngôn ngữ bao gồm: hình thái học, cú pháp, ngữ nghĩa và ngữ cảnh như trong nghiên cứu của Jurafsky và Martin [53].
Ngữ cảnh xung quanh văn bản dịch được xem như là độc lập có thể có nghĩa khác nhau. Nó cũng đòi hỏi có kiến thức sâu phía các ngôn ngữ đích để mã hóa lại nghĩa. Dịch máy là một trong những ứng dụng quan trọng trong xử lý ngôn ngữ tự nhiên. Nhu cầu về một hệ thống dịch tự động là rất lớn.
Các hoạt động mang tính toàn cầu đều có nhu cầu dịch các văn bản từ ngôn ngữ này sang ngôn ngữ khác. Trong thực tiễn, dịch máy hay các hệ thống song ngữ đang được ứng dụng rộng rãi trong nhiều lĩnh vực đặc biệt là trong dịch thuật và giáo dục. Các từ điển song ngữ điện tử (một dạng dịch đơn giản nhất) được phát triển rộng rãi trên nhiều nền tảng như web, di động, giúp người sử dụng có thể dễ dàng tra cứu trong công việc, cũng như học tập. Các hệ thống dịch máy lớn như Google Translate với ưu thế về ngữ liệu, có khả năng dịch nhiều cặp ngôn ngữ cũng đang hỗ trợ đáng kể cho vấn đề dịch thuật.
Dịch máy là một trong những vấn đề khó và lâu đời trong lĩnh vực trí tuệ nhân tạo [48],[53]. Các phần mềm dịch máy đã đạt được các kết quả ngày càng tốt lên, tuy nhiên những kết quả này vẫn chưa so sánh được với khả năng dịch của con người. Việc dịch thuật có liên quan đến nhiều ngôn ngữ và liên quan đến văn hóa là các vấn đề khó. 7 Liên ngữ Phân tích Chuyển đổi Sinh Dịch trực tiếp Văn bản Văn bản nguồn đích Hình 1.
Tháp Vauquois thể hiện quá trình dịch theo các phương pháp khác nhau Trước những năm 1990, cách tiếp cận dựa trên luật là chủ yếu. Các luật khác nhau được thiết kế cho phân tích cú pháp, dịch chuyển từ vựng, hình thái học. Ban đầu, ba loại mô hình chính được đưa ra là: mô hình dịch trực tiếp, mô hình chuyển đổi và mô hình liên ngữ. Các mô hình này được bắt nguồn từ việc phân tích cách các ngôn ngữ được hình thành.
Bernard Vauquois [126] đưa ra sơ đồ hình kim tự tháp trình bày các cấp độ của các hệ thống dịch máy như Hình 1. Nhiều nhà nghiên cứu tập trung vào các hệ thống sử dụng các ngôn ngữ đại diện trung gian về nghĩa. Liên ngữ [37],[75] là một trường hợp của hệ thống hướng ngữ nghĩa. Nó sử dụng một ngôn ngữ quốc tế đại diện cho nghĩa trừu tượng, độc lập của một ngôn ngữ cụ thể.
Vấn đề thu hút sự quan tâm của các nhà nghiên cứu nhưng được xem là một thách thức lớn trong trí tuệ nhân tạo.1 thể hiện quá trình dịch từ ngôn ngữ nguồn sang ngôn ngữ đích theo ba phương pháp khác nhau. Dịch trực tiếp mà không cần bất kỳ phân tích văn bản do từ được dịch theo nghĩa đen với các luật cơ bản [55]. Dịch chuyển đổi sử dụng phân tích hình thái và cú pháp [43]. Dịch liên ngữ sử dụng một ngôn ngữ đại diện cho nghĩa trừu tượng của văn bản [76].2 minh họa các phương pháp dịch máy dựa trên luật khác nhau trên tháp Vanquois.
Ở cấp thấp nhất (dưới cùng) là mô hình dịch trực tiếp, mô hình này dịch trực tiếp từ cấu trúc từ của văn bản nguồn sang văn bản đích. Hai mô hình tiếp theo là hai 8 mô hình chuyển đổi cú pháp và chuyển đổi ngữ nghĩa. Mô hình chuyển đổi cú pháp phân tích cấu trúc cú pháp của văn bản nguồn sau đó chuyển đổi cú pháp sang cấu trúc cú pháp của văn bản đích, và lần lượt sinh cấu trúc từ, hình thái từ để có văn bản đích. Mô hình chuyển đổi ngữ nghĩa thực hiện chuyển đổi ở cấp cao hơn là mức cấu trúc ngữ nghĩa.
Mô hình dịch ở cấp cao nhất là mô hình liên ngữ, biến đổi văn bản nguồn sang dạng liên ngữ, sau đó lần lượt sinh cấu trúc ngữ nghĩa, cấu trúc cú pháp, cấu trúc từ, hình thái từ cho văn bản đích. Liên ngữ Cấu trúc Chuyển đổi Cấu trúc ngữ nghĩa ngữ nghĩa ngữ nghĩa Phân tích Sinh ngữ nghĩa ngữ nghĩa Cấu trúc Chuyển đổi Cấu trúc cú pháp cú pháp cú pháp Phân tích Sinh cú pháp cú pháp Cấu trúc Trực tiếp Cấu trúc từ từ Phân tích Sinh hình thái hình thái Văn bản nguồn Văn bản đích Hình 1. Tháp Vauquois thể hiện các phương pháp khác nhau của dịch dựa trên luật Đầu năm 1990, một bước ngoặt lớn là có sự quan tâm nhiều hơn của nhiều nhà nghiên cứu trong dịch máy dựa vào dữ liệu, còn được gọi là dựa trên kho ngữ liệu, dựa trên độ tương tự, dựa trên bộ nhớ hoặc dịch hướng dẫn có kinh nghiệm. Dịch dựa trên ví dụ là một trong những phương pháp tiếp cận sớm được đưa ra trong dịch máy theo hướng dữ liệu [80], [101].
Nó cố gắng tìm một câu tương tự với đầu vào đã cho trong ví dụ được dịch trước đó. Sau đó, tạo ra 9 những thay đổi thích hợp cho bản dịch được lựa chọn. Phương pháp này nhanh hơn dựa trên luật nhưng không đảm bảo bản dịch tốt hơn. Do sự gia tăng sức mạnh tính toán và khả năng tiếp cận các dữ liệu lớn, phương pháp thống kê đã được đề xuất để thực hiện phân tích sâu hơn so với các phương pháp tiếp cận dựa trên ví dụ.
Năm 1990, Brown và cộng sự đã trình bày mô hình toán học của dịch máy thống kê [11]. Tiếp đó, năm 1993, Brown và cộng sự đã giới thiệu năm mô hình thống kê được gọi là mô hình IBM và đưa ra các thuật toán để ước lượng các tham số của mô hình [13]. Dù họ nghiên cứu dịch máy trên một nền tảng toán học vững chắc nhưng chưa có nhiều nghiên cứu tập trung cho dịch máy. Năm 1999, nhiều nhà nghiên cứu đã cùng nhau cài đặt lại các mô hình IBM tại hội thảo mùa hè tại Đại học Johns Hopkins.
Al -Onaizan và cộng sự, trong sáu tuần tại hội thảo đã cài đặt công cụ dịch máy thống kê (SMT) (gọi là EGYPT) [1] và công cụ GIZA [85] được đề cập trong báo cáo kỹ thuật cho việc gióng từ. Franz Och sau đó mở rộng các công cụ gióng từ thành GIZA++ [86], bổ sung thêm nhiều tính năng cho việc học mô hình dịch thống kê từ dữ liệu văn bản và được cài đặt như mô tả trong các công bố [13], [87], [127]. Công cụ này trở thành một trong các khối chính trong các hệ thống SMT. Các hệ thống dịch máy sử dụng phương pháp đánh giá tự động với chi phí thấp, hiệu quả cao.
Một số phương pháp đánh giá tự động chất lượng dịch như BLEU [91], NIST [32], TER [107]. Phương pháp phổ biến là phương pháp BLEU được đề xuất tại hội nghị ACL năm 2002. Ý tưởng chính của phương pháp này là so sánh kết quả bản dịch tự động bằng máy với các bản dịch mẫu của con người, bản dịch nào càng giống với bản dịch mẫu của con người thì bản dịch đó càng chính xác. Dịch máy thống kê là một phương pháp dịch máy, trong đó các bản dịch được tạo ra trên cơ sở các mô hình thống kê có các tham số được bắt nguồn từ việc phân tích các cặp câu song ngữ.
Các phương pháp tiếp cận thống kê tương phản với các phương pháp tiếp cận dựa trên luật trong dịch máy cũng như với dịch máy dựa trên ví dụ. Những ý tưởng đầu tiên của dịch máy thống kê đã được giới thiệu bởi Warren Weaver vào năm 1949 [129], bao gồm cả những ý tưởng của việc áp dụng lý thuyết thông tin của Claude Shannon. Dịch máy 10 thống kê được tái giới thiệu vào năm 1991 bởi các nhà nghiên cứu làm việc tại Trung tâm nghiên cứu Thomas J. Watson của IBM [13] và đã góp phần đáng kể trong sự hồi sinh việc quan tâm đến dịch máy trong những năm gần đây.
Shaffer told CNN on Saturday .