Chương I: Tổng quan nghiên cứu Chương này giới thiệu tổng quan trình hình nghiên cứu trong lĩnh vực địch máy, giới thiệu về các tập dữ liệu tiêu chuẩn đang được các nhà nghiên cứu sử dụng, trình bảy các. phương pháp học sâu vả những công trình tiêu biễu tương ứng với tìng phương pháp Chương 2: Cơ sở lí thuyết Chương này chúng lôi sẽ trình bảy lẫn lượt tổng quan các phương pháp dịch máy Đồng thời trong từng phương pháp, chúng tôi cũng nêu ra khái niệm cũng như tu-khuyẾt điểm về một số thuật toán, kiến trúc mô hình tiêu biểu để làm cơ sở chọn lựa mô hình phù hợp với Chương 3: Phương pháp đề xuất Trình bây chỉ iết phương pháp mà chúng tôi sử dụng trong dịch máy Anh: Việt Phương pháp chính là tich hợp đồ thịt thức vào mô hình dịch máy mang neural Chương 4: Thực nghiệm và đánh giá. Chương này so sánh và đánh giá kết quảđạt được khi thục hiện chương trình với một số pre-trained model trên tập ngữ liệu Anh-Việt và các tập ngữ liệu song ngữ khác. Chương 5: Kết luận và hướng phát triển “Tổng kết lại kết quả đã đạt được và chưa đạt được sau quá trình nghiên cứu, tiền hành.
Từ đó nêu lên những hướng nghiên cứu và phát triển tiếp theo trong tương lai 48 nâng cao hiệu suất địch thuật cũng như để khắc phục các hạn chế hiện ti. CHƯƠNG ‘ONG QUAN NGHIEN 1-1 Tổng quan a tit Dịch may (Machine Translation) li mt bai ton quan trong trong lĩnh vực xử lý ngôn ngữ tự nhiên (NLP), với nhiệm vụ chính là đạy cho máy tính có khả năng học và địch tự động một văn bản từ ngôn ngữ nguồn sang ngôn ngữ dịch mà không cần sự can thiệp của con người vào quá trình dịch. Đây là một thách thức lớn bởi sự đa dạng của các ngôn ngữ: tên thể giới, Hiện nay có hơn 7000 ngôn ngữ khe nhau đang được sử đụng, ngôn ngữ đều có cấu trúc ngữ pháp, ngữ nghĩa và cách biểu đạt riêng biệt. Khả năng dich thuật giữa sắc ngôn ngữ này một cách chính xác và tồi chảy là mục tiêu then chốt của dịch mấy.
Đạt được điều này sẽ tạo nên những đột phá to lớn, giúp con người vượt qua ào củn ngôn ngữ, thie day sy giao lưu văn hỏa và hợp tác trên phạm vỉ toàn cầu. Ngoài ra, địch máy còn mở. xa nhiều ứng dụng thực ế quan trọng khác như dịch tài liệu, phụ đề phim, website đa ngôn ngũ, hỗ trợ giao tiếp qua biên dịch giọng nói, Do tim quan trọng to lớn đó, dịch mấy luôn được coi là một trong những lĩnh vực nghiên cứu trọng điểm và được đầu tư mạnh mẽ nhân lực cũng như tài chinh trong NLP. "Nhiễu phương pháp tiếp cặn khác nhau đã được đề xuất và phát iển qua các th kỹ khác nhau, từ dịch mấy dựa trên quy tắc (RBMT), dịch máy thống kế (SMT) đến dịch may mang eural (NMT) phổ biết ngày nay, 12 Cúc phương pháp tếp cận địch máy Mặc dù địch máy đã được nghiên cứu và ra đờ năm thập niên 50 của thể kỹ trước, nhưng ban đầu các nhà nghiên cứu đã tận dụng từ điễn và sử dụn: Wy được tạo ra bởi chuyên gia để sắc định nghĩa chính xác của các t.
Tuy nhiễn, cách tiếp cận nảy gặp hạn chế li không thể phát triển một hệ thông luật hoàn chinh cho tắt cả các ngôn ngữ có sẵn. Đến những năm 1990 mô hình địch máy thống kê xuất hiện, mô hình này sử đụng một kho ngữ liệu song ngữ được thu thập bởi các chuyên gia ngôn ngữ trong quá trình huần luyện. Tuy nhiên, hiệu suất của các hệ thống địch máy thống kẻ đòi hỏi nhiễu vào cặp ngôn ngữ cu thế mã chúng được áp dụng [3], [4] RBMT SMT NMT | ! h 1.1 Quá trình phát triển địch máy 1.1 Dịch máy dựa trên quy tắc Dịch máy dựa trên quy tắc (RBMT) là hệ thống địch máy đâu tiên và dựa trên thông tin ngôn ngữ về ngôn ngữ nguồn và ngôn ngữ đích về cơ bản được lẫy từ từ điển và ngữ pháp bao gồm các quy tắc về ngữ nghĩa, hình thấi và củ pháp chính của từng ngôn ngữ tương ứng [5]. Nguyên lý hoạt động của nó dựa trên việc sử dụng các quy tắc ngôn ngữ học sự thể để bigu diễn kiến thức về ngôn ngữ nguồn và ngôn ngữ địch.
Quả trình dịch máy RBMT diễn ra theo từng bước sau: + Phân tích ngôn ngờ nguồn: Quá tình này bắt đầu với một văn bản đầu vào, được tiền xử lý bằng cách tích từ, ấn nhân từ loại và phân đoạn câu. Sau đó, vấn bản được phân tích cú pháp đẻ xác định các thành phần câu và mỗi quan hệ cú pháp giữa chúng, dựa trên suy ắc ngữ pháp của ngôn ngữ nguồn. Tiếp theo, phân ích ngữ nghĩa được thực hiện để xác định ý nghĩa của các từ và cụm từ, dựa trên từ điển ngữ nghĩa và quy tắc ngữ nghĩa của ngôn ngữ nguồn. Kết qua là một biều diễn ngữ nghĩa-cú pháp độc lập với ngôn ngữ nguồn.
+ Chuyén tai (Transfer): Bigu didn gtr nghia-ci phap của ngôn ngữ nguồn được chuyên đổi sang biểu diễn trung gian không phụ thuộc ngôn ngữ bằng cách áp dụng quy túc chuyỂn tải ngữ nghĩa và cả pháp, Quy tắc chuyển tả này xử lý các hiện tượng ngôn ngữ khác nhau giữa ngôn ngữ nguồn và ngôn ngữ đích như trật tự từ, đảo ngữ, số [sổ nhu, + Tổng hợp ngôn ngữ đích (Target Language Generaion): Từ biễu diễn trung gian, suy tắc ngữ pháp và ngữ nghĩa của ngôn ngữ đích được ấp dụng để ạo ra biểu diễn ngữ nghĩa-cú pháp của ngôn ngữ đích. Biểu diễn này sau đó được sử dụng để tổng hợp văn bản đầu m bằng ngôn ngữ đích thông qua các bước như xây dựng cụm từ và diễn ngữ hoá các thành phần đầu ra cuối cũng 'Có ba phương pháp tiếp cận dịch máy dựa trên quy tắc sau: phương pháp trực tiếp. (Đirset Method), phương pháp chuyển đổi (Transisr Method) và phương pháp Inleringua Phương pháp trực tiếp: Là phương pháp dịch từng từ rong văn bản nguồn thành rõ rằng nhưngcl cần một từ trong văn bản đích. Nó đòi hỏi phân tích hình thái một cách chút phân tích củ pháp và ngữ nghĩa Phương pháp chuyển đối: Đây là phương pháp phỏ biến nhất trong RBMT, Trong phương phip này, ngôn ngữ nguồn được chuyển đổi thành một biểu diễn trừu tượng, ít ngôn ngữ cụ thể hơn, Văn bản được phân ích ở cấp độ ngữ pháp và ngữ nghĩa tong ngôn "ngữ nguồn, sau đó được chuyỂn đổi sang một biểu diễn trung gian không phụ thuộc ngôn neữ.
Cuỗi cùng, một biễu diễn tương đương được tạo ra cho ngôn ngữ đích bằng cách sử cđụng từ điễn song ngữ và các quy tắc ngữ pháp, Phương pháp Iterlingua: Trong ngôn ngữ nguồn Intedingua được chuyển đổi thành ngôn ngữ trung gian, độc lập với bat ky ngôn ngữ nảo liên quan đến dịch thuật. Bán dịch được địch cho ngôn ngữ đích sau đô được lấy từ ngôn ngữ trung giam Phương pháp dịch máy dựa trên luật (RBMT) có một số ưu điểm đáng kể, Nếu bộ luật được xây dựng tốt, RBMT có thể tạo ra ban dich chính xác và trung thực về mặt ngữ pháp. Phương pháp này cũng phủ hợp để dịch những văn bản có cấu trúc và từ vựng giới hạn như hướng dẫn sử dụng, tải liệu ky thugt (A Survey of Current Paradigms in Machine Translation). Dng thoi, RBMT cho phép kiểm soát tốt quả tình dịch, điều chỉnh và bổ sung luật một cách linh hoạt.
"uy nhiên, RBMT cũng có những hạn chế nhất định. Việc xây dựng một hệ thống RBMT hoàn chỉnh đòi hỏi thời gian đài, các quy tắc thường do nhà ngôn ngữ học phát triển Do vậy hạn chế chính của phương pháp nảy là nó đỏi hỏi rắt nhiều nguồn lực về chuyên mmôn/ chuyên gia (có thểrắt tốn kém) để xây dựng rất ắt nhiều quy tắc và ngoại lẽ, đồng thời nó không khái quất được cho những ngôn ngữ khácj6]. Hệ thẳng chỉ có th dịch tốt những mẫu câu và từ vựng nằm trong tập luật. Những câu quá dài, phức tạp sẽ dễ bị dịch sai, khó xử lý tốt các, óa, ngữ cảnh, ảm ý trong giao tiếp ngôn ngữ.
Chỉ phí xây dựng và duy trì hệ thống cũng cao. Mỗi cặp ngôn ngữ cẳn có một hệ thống luật riêng. Dịch máy dựa trên ví dụ Dịch máy dựa trên ví dụ (Example-Based Machine Translation - EBMT) là một phương pháp địch máy được giới thiệu lần đầu tiên vào năm 1984 bởi Makoto Nagao từ ai học Kyoto, Nhật Bản [7]. Dịch máy dựa trên ví dụ (EBMT) là một phương pháp dịch máy đồi hỏi nhiều công đoạn tiền xử lý đữ liệu như làm sạch, chuẩn hóa vả gắn nhãn thông tin ngữ pháp cho các cặp câu trong cơ sở dữ liệu song ngữ.
Điều này giúp cải thiện hiệu “quả tìm kiếm và chuyển đổi trong quá trình dịch, Có nhiều phương pháp tìm kiếm các ví cdụ tương tự như sử dụng độ đo tương tự chị +okhốp mẫu, hoặc kết hợp với các kỹ thật ích xuất đặc trưng ngôn ngữ. Bên cạnh đó, việc chuyển đổi vả tá tạo câu địch cũng đồi hỏi phải giải quyết các ấn để như điều chỉnh thứ tự từ, thay đổi hình thai từ và đảm báo. tính đúng đắn ngữ pháp bằng các kỹ thuật như quy tắc chuyển đổi, mô h th ngôn ngũ, và các thuật toán tối ưu hóa. Ý tưởng cốt lõi của EBMT là sử dụng một cơ sở dữ liệu song ngữ: gằm các cặp câu đã được dịch trước đó để dịch một câu mới chư từng gặp.
Cách tiếp cận của EBMT gồm ba bước chính: ~ So khớp (Matching): Trong bước so khớp, hệ thống EBMT sẽ ign hành tìm kiểm trong cơ sở dữ liệu song ngữ để xác định những cặp câu có độ trơng tự cao nhất với câu cẩn dịch. Quá trình tìm kiểm này dựa trên việc so sánh các đặc trưng ngôn ngữ như tử vựng, cm từ và cẫu trúc cú pháp giữa câu đầu vào và các câu rong cơ sở dữ liệu. Hệ thẳng sẽ sử dụng các thuật toán đo độ tương tự, chẳng hạn như độ đo cosin hoặc khoảng cách Levenshiein, để tỉnh toán mức độ trùng khớp giữa các câu. Kết quả của bước này là một tập hợp các cặp câu song ngữ có liên quan và tương tự nhất với câu edn địch.
~ Chuyển đổi (Alignment): 6 bude nay he théng EBMT sẽ phân ích và xác định sự tương ứng giữa cúc cụm từ, thành phần trong câu nguồn và câu đích của các cặp ví dụ đã tim được ở bước trước. Quả trình này nhằm thiết lập một ánh xạ giữa các phần tử của hai "ngôn ngữ, cho phép hệ thống hiểu được cách các cụm từ và thành phần trong câu nguồn được biễu đạt tương ứng trong câu địch.