Luận án tiến sĩ phát triển một số kỹ thuật trong dịch máy thống kê với tài nguyên song ngữ hạn chế cho cặp ngôn ngữ việt anh

Luận án tiến sĩ kỹ thuật phân tích phát triển một số kỹ thuật trong dịch máy thống kê với tài nguyên song ngữ hạn chế cho cặp ngôn ngữ, xây dựng cơ sở lý luận, kiểm chứng thực

Người đăng

Ẩn danh

Thể loại

luận án tiến sĩ

2022

127
4
0

Phí lưu trữ

35 Point

Tóm tắt

I. Kỹ thuật dịch máy thống kê và tài nguyên hạn chế

Kỹ thuật dịch máy thống kê là một phương pháp quan trọng trong xử lý ngôn ngữ tự nhiên, đặc biệt khi áp dụng cho cặp ngôn ngữ tiếng Việt - tiếng Anh. Với tài nguyên hạn chế, việc phát triển các hệ thống dịch máy hiệu quả đòi hỏi sự tối ưu hóa các mô hình ngôn ngữthuật toán dịch. Luận án tập trung vào việc cải thiện chất lượng dịch thông qua việc tăng cường dữ liệu huấn luyện và cải tiến các kỹ thuật gióng hàng từ. Các phương pháp như dịch ngượcchia nhỏ từ được đề xuất để giải quyết các thách thức trong việc xử lý ngôn ngữ có tài nguyên hạn chế.

1.1. Tăng cường dữ liệu huấn luyện

Tăng cường dữ liệu huấn luyện là một trong những phương pháp chính để cải thiện chất lượng của hệ thống dịch máy thống kê. Luận án đề xuất sử dụng kỹ thuật dịch ngược (Back-Translation) để tạo ra dữ liệu giả lập từ các nguồn đơn ngữ. Phương pháp này giúp bổ sung thêm dữ liệu song ngữ, đặc biệt hữu ích khi tài nguyên song ngữ hạn chế. Các độ đo thích nghi được áp dụng để lựa chọn dữ liệu giả lập phù hợp, đảm bảo chất lượng của dữ liệu tăng cường. Kết quả thử nghiệm cho thấy việc lựa chọn dữ liệu thích nghi giúp cải thiện đáng kể hiệu suất của hệ thống dịch.

1.2. Ứng dụng dịch ngược với ngôn ngữ trung gian

Luận án đề xuất sử dụng ngôn ngữ trung gian như tiếng Đức trong quá trình dịch ngược để tăng cường dữ liệu huấn luyện. Phương pháp này giúp tận dụng các mô hình dịch chất lượng cao sẵn có cho các cặp ngôn ngữ khác. Kết quả thử nghiệm cho thấy việc sử dụng ngôn ngữ trung gian giúp tạo ra dữ liệu giả lập chất lượng cao, góp phần cải thiện hiệu suất của hệ thống dịch máy cho cặp ngôn ngữ tiếng Việt - tiếng Anh.

II. Cải tiến mô hình gióng hàng từ

Gióng hàng từ là một bước quan trọng trong quá trình dịch máy, đặc biệt khi xử lý các cặp ngôn ngữ có cấu trúc khác biệt như tiếng Việt - tiếng Anh. Luận án đề xuất các kỹ thuật chia nhỏ từ để cải thiện chất lượng gióng hàng. Các phương pháp như BPE (Byte Pair Encoding) và Unigram Language Model được áp dụng để chia nhỏ từ tiếng Anh, giúp tăng tần suất xuất hiện của các từ hiếm và cải thiện độ chính xác của quá trình gióng hàng.

2.1. Chia nhỏ từ với thuật toán BPE

Thuật toán BPE được sử dụng để chia nhỏ từ tiếng Anh thành các đơn vị nhỏ hơn, giúp tăng tần suất xuất hiện của các từ hiếm trong dữ liệu huấn luyện. Phương pháp này giúp cải thiện chất lượng của bảng gióng hàng từ, đặc biệt khi xử lý các từ không xuất hiện thường xuyên trong ngữ liệu. Kết quả thử nghiệm cho thấy việc áp dụng BPE giúp cải thiện đáng kể hiệu suất của hệ thống dịch máy.

2.2. Cải tiến bảng gióng hàng từ

Luận án đề xuất cải tiến bảng gióng hàng từ bằng cách sử dụng thuật toán chuẩn hóa bảng gióng hàng A*. Phương pháp này giúp tối ưu hóa quá trình gióng hàng từ, đặc biệt khi kết hợp với các kỹ thuật chia nhỏ từ. Kết quả thử nghiệm cho thấy việc cải tiến bảng gióng hàng từ giúp nâng cao độ chính xác của quá trình dịch máy, đặc biệt khi xử lý các cặp câu phức tạp.

III. Kết hợp dịch ngược và chia nhỏ từ

Luận án đề xuất kết hợp hai phương pháp dịch ngượcchia nhỏ từ để tối ưu hóa hiệu suất của hệ thống dịch máy. Phương pháp này giúp tận dụng ưu điểm của cả hai kỹ thuật, từ đó cải thiện chất lượng dịch máy cho cặp ngôn ngữ tiếng Việt - tiếng Anh. Kết quả thử nghiệm cho thấy việc kết hợp hai phương pháp này giúp nâng cao đáng kể hiệu suất của hệ thống dịch máy, đặc biệt khi xử lý các cặp câu phức tạp và các từ hiếm.

3.1. Thử nghiệm kết hợp

Luận án thực hiện thử nghiệm kết hợp dịch ngượcchia nhỏ từ trên bộ dữ liệu IWSLT2015. Kết quả cho thấy việc kết hợp hai phương pháp này giúp cải thiện đáng kể hiệu suất của hệ thống dịch máy, đặc biệt khi xử lý các cặp câu phức tạp và các từ hiếm. Phương pháp này cũng giúp tối ưu hóa quá trình huấn luyện và nâng cao độ chính xác của quá trình dịch máy.

3.2. Đánh giá hiệu quả

Luận án sử dụng độ đo BLEU để đánh giá hiệu quả của phương pháp kết hợp. Kết quả cho thấy việc kết hợp dịch ngượcchia nhỏ từ giúp nâng cao đáng kể điểm BLEU, chứng tỏ hiệu quả của phương pháp này trong việc cải thiện chất lượng dịch máy cho cặp ngôn ngữ tiếng Việt - tiếng Anh.

01/03/2025
Luận án tiến sĩ phát triển một số kỹ thuật trong dịch máy thống kê với tài nguyên song ngữ hạn chế cho cặp ngôn ngữ việt anh

Trích đoạn nội dung tài liệu

phần mở đầu, kết luận, danh mục các công trình đã công bố của tác giả và tài liệu tham khảo. Tổng quan về các vấn đề liên quan đến luận án Chương này trình bày tổng quan các kiến thức cơ sở như các định nghĩa, phân loại về dịch máy thống kê, các bước xây dựng một hệ thống dịch máy, các độ đo thường được áp dụng. Tổng hợp, phân tích và đánh giá các kỹ thuật nâng cao chất lượng hệ thống dịch máy thống kê trong phạm vi nghiên cứu của luận án, từ đó nêu ra một số vấn đề còn tồn tại mà luận án sẽ tập trung giải quyết. Tăng cường dữ liệu huấn luyện dịch máy thống kê cặp ngôn ngữ Việt – Anh bằng kỹ thuật dịch ngược.

Nội dung chương này trình bày đóng góp của luận án nhằm tăng cường dữ liệu huấn luyện bằng kỹ thuật dịch ngược, kết hợp sử dụng độ đo thích nghi để lựa chọn dữ liệu. Trong chương này, luận án thực hiện thực nghiệm để chỉ ra rằng việc không lựa chọn dữ liệu tăng cường có thể khiến cho hệ thống dịch máy trở nên kém đi, từ đó đề xuất phép đo độ thích nghi để lựa chọn dữ liệu tăng cường cho hệ thống dịch. Cải tiến mô hình gióng hàng từ trong hệ thống dịch máy thống kê cặp ngôn ngữ Việt – Anh với kỹ thuật chia nhỏ từ Nội dung Chương 3 tập trung giải quyết bài toán gióng hàng từ cho cặp ngôn ngữ có tài nguyên hạn chế bằng cách gia tăng tần suất xuất hiện của các từ trong ngữ liệu huấn luyện. Trong chương này, luận án trình bày đề xuất áp dụng các phương pháp chia nhỏ từ đang được sử dụng cho dịch máy nơ -ron nhằm biểu diễn từ và phương pháp chia nhỏ từ dựa trên đặc điểm hình thái từ tiếng Anh, đề xuất cải tiến mô hình gióng hàng từ cho phù hợp với việc chia nhỏ từ trong tiền xử lý dữ liệu huấn luyện.

TỔNG QUAN VỀ C ÁC VẤN ĐỀ LI Ê N QUAN LUẬN ÁN Chương này trình bày tổng quan về các vấn đề nghiên cứu trong luận án, bao gồm: dịch máy, dịch máy thống kê, dịch máy nơ-ron, các phương pháp tăng cường dữ liệu cho dịch máy, gióng hàng từ trong dịch máy thống kê; Đưa ra phân tích, đánh giá các công trình nghiên cứu liên quan, đề xuất và xác định những nội dung luận án sẽ tập trung giải quyết. Tổng quan về dịch máy Dịch máy là quá trình tự động chuyển nghĩa của từ hoặc văn bản từ ngôn ngữ này sang ngôn ngữ khác. Nó liên quan đến việc giải mã nghĩa của ngôn ngữ nguồn và sau đó mã hóa lại theo nghĩa vào ngôn ngữ đích. Quá trình này liên quan đến một loạt hoạt động phức tạp, đòi hỏi kiến thức đầy đủ về ngôn ngữ bao gồm: hình thái học, cú pháp, ngữ nghĩa và ngữ cảnh như trong nghiên cứu của Jurafsky và Martin [53].

Ngữ cảnh xung quanh văn bản dịch được xem như là độc lập có thể có nghĩa khác nhau. Nó cũng đòi hỏi có kiến thức sâu phía các ngôn ngữ đích để mã hóa lại nghĩa. Dịch máy là một trong những ứng dụng quan trọng trong xử lý ngôn ngữ tự nhiên. Nhu cầu về một hệ thống dịch tự động là rất lớn.

Các hoạt động mang tính toàn cầu đều có nhu cầu dịch các văn bản từ ngôn ngữ này sang ngôn ngữ khác. Trong thực tiễn, dịch máy hay các hệ thống song ngữ đang được ứng dụng rộng rãi trong nhiều lĩnh vực đặc biệt là trong dịch thuật và giáo dục. Các từ điển song ngữ điện tử (một dạng dịch đơn giản nhất) được phát triển rộng rãi trên nhiều nền tảng như web, di động, giúp người sử dụng có thể dễ dàng tra cứu trong công việc, cũng như học tập. Các hệ thống dịch máy lớn như Google Translate với ưu thế về ngữ liệu, có khả năng dịch nhiều cặp ngôn ngữ cũng đang hỗ trợ đáng kể cho vấn đề dịch thuật.

Dịch máy là một trong những vấn đề khó và lâu đời trong lĩnh vực trí tuệ nhân tạo [48],[53]. Các phần mềm dịch máy đã đạt được các kết quả ngày càng tốt lên, tuy nhiên những kết quả này vẫn chưa so sánh được với khả năng dịch của con người. Việc dịch thuật có liên quan đến nhiều ngôn ngữ và liên quan đến văn hóa là các vấn đề khó. 7 Liên ngữ Phân tích Chuyển đổi Sinh Dịch trực tiếp Văn bản Văn bản nguồn đích Hình 1.

Tháp Vauquois thể hiện quá trình dịch theo các phương pháp khác nhau Trước những năm 1990, cách tiếp cận dựa trên luật là chủ yếu. Các luật khác nhau được thiết kế cho phân tích cú pháp, dịch chuyển từ vựng, hình thái học. Ban đầu, ba loại mô hình chính được đưa ra là: mô hình dịch trực tiếp, mô hình chuyển đổi và mô hình liên ngữ. Các mô hình này được bắt nguồn từ việc phân tích cách các ngôn ngữ được hình thành.

Bernard Vauquois [126] đưa ra sơ đồ hình kim tự tháp trình bày các cấp độ của các hệ thống dịch máy như Hình 1. Nhiều nhà nghiên cứu tập trung vào các hệ thống sử dụng các ngôn ngữ đại diện trung gian về nghĩa. Liên ngữ [37],[75] là một trường hợp của hệ thống hướng ngữ nghĩa. Nó sử dụng một ngôn ngữ quốc tế đại diện cho nghĩa trừu tượng, độc lập của một ngôn ngữ cụ thể.

Vấn đề thu hút sự quan tâm của các nhà nghiên cứu nhưng được xem là một thách thức lớn trong trí tuệ nhân tạo.1 thể hiện quá trình dịch từ ngôn ngữ nguồn sang ngôn ngữ đích theo ba phương pháp khác nhau. Dịch trực tiếp mà không cần bất kỳ phân tích văn bản do từ được dịch theo nghĩa đen với các luật cơ bản [55]. Dịch chuyển đổi sử dụng phân tích hình thái và cú pháp [43]. Dịch liên ngữ sử dụng một ngôn ngữ đại diện cho nghĩa trừu tượng của văn bản [76].2 minh họa các phương pháp dịch máy dựa trên luật khác nhau trên tháp Vanquois.

Ở cấp thấp nhất (dưới cùng) là mô hình dịch trực tiếp, mô hình này dịch trực tiếp từ cấu trúc từ của văn bản nguồn sang văn bản đích. Hai mô hình tiếp theo là hai 8 mô hình chuyển đổi cú pháp và chuyển đổi ngữ nghĩa. Mô hình chuyển đổi cú pháp phân tích cấu trúc cú pháp của văn bản nguồn sau đó chuyển đổi cú pháp sang cấu trúc cú pháp của văn bản đích, và lần lượt sinh cấu trúc từ, hình thái từ để có văn bản đích. Mô hình chuyển đổi ngữ nghĩa thực hiện chuyển đổi ở cấp cao hơn là mức cấu trúc ngữ nghĩa.

Mô hình dịch ở cấp cao nhất là mô hình liên ngữ, biến đổi văn bản nguồn sang dạng liên ngữ, sau đó lần lượt sinh cấu trúc ngữ nghĩa, cấu trúc cú pháp, cấu trúc từ, hình thái từ cho văn bản đích. Liên ngữ Cấu trúc Chuyển đổi Cấu trúc ngữ nghĩa ngữ nghĩa ngữ nghĩa Phân tích Sinh ngữ nghĩa ngữ nghĩa Cấu trúc Chuyển đổi Cấu trúc cú pháp cú pháp cú pháp Phân tích Sinh cú pháp cú pháp Cấu trúc Trực tiếp Cấu trúc từ từ Phân tích Sinh hình thái hình thái Văn bản nguồn Văn bản đích Hình 1. Tháp Vauquois thể hiện các phương pháp khác nhau của dịch dựa trên luật Đầu năm 1990, một bước ngoặt lớn là có sự quan tâm nhiều hơn của nhiều nhà nghiên cứu trong dịch máy dựa vào dữ liệu, còn được gọi là dựa trên kho ngữ liệu, dựa trên độ tương tự, dựa trên bộ nhớ hoặc dịch hướng dẫn có kinh nghiệm. Dịch dựa trên ví dụ là một trong những phương pháp tiếp cận sớm được đưa ra trong dịch máy theo hướng dữ liệu [80], [101].

Nó cố gắng tìm một câu tương tự với đầu vào đã cho trong ví dụ được dịch trước đó. Sau đó, tạo ra 9 những thay đổi thích hợp cho bản dịch được lựa chọn. Phương pháp này nhanh hơn dựa trên luật nhưng không đảm bảo bản dịch tốt hơn. Do sự gia tăng sức mạnh tính toán và khả năng tiếp cận các dữ liệu lớn, phương pháp thống kê đã được đề xuất để thực hiện phân tích sâu hơn so với các phương pháp tiếp cận dựa trên ví dụ.

Năm 1990, Brown và cộng sự đã trình bày mô hình toán học của dịch máy thống kê [11]. Tiếp đó, năm 1993, Brown và cộng sự đã giới thiệu năm mô hình thống kê được gọi là mô hình IBM và đưa ra các thuật toán để ước lượng các tham số của mô hình [13]. Dù họ nghiên cứu dịch máy trên một nền tảng toán học vững chắc nhưng chưa có nhiều nghiên cứu tập trung cho dịch máy. Năm 1999, nhiều nhà nghiên cứu đã cùng nhau cài đặt lại các mô hình IBM tại hội thảo mùa hè tại Đại học Johns Hopkins.

Al -Onaizan và cộng sự, trong sáu tuần tại hội thảo đã cài đặt công cụ dịch máy thống kê (SMT) (gọi là EGYPT) [1] và công cụ GIZA [85] được đề cập trong báo cáo kỹ thuật cho việc gióng từ. Franz Och sau đó mở rộng các công cụ gióng từ thành GIZA++ [86], bổ sung thêm nhiều tính năng cho việc học mô hình dịch thống kê từ dữ liệu văn bản và được cài đặt như mô tả trong các công bố [13], [87], [127]. Công cụ này trở thành một trong các khối chính trong các hệ thống SMT. Các hệ thống dịch máy sử dụng phương pháp đánh giá tự động với chi phí thấp, hiệu quả cao.

Một số phương pháp đánh giá tự động chất lượng dịch như BLEU [91], NIST [32], TER [107]. Phương pháp phổ biến là phương pháp BLEU được đề xuất tại hội nghị ACL năm 2002. Ý tưởng chính của phương pháp này là so sánh kết quả bản dịch tự động bằng máy với các bản dịch mẫu của con người, bản dịch nào càng giống với bản dịch mẫu của con người thì bản dịch đó càng chính xác. Dịch máy thống kê là một phương pháp dịch máy, trong đó các bản dịch được tạo ra trên cơ sở các mô hình thống kê có các tham số được bắt nguồn từ việc phân tích các cặp câu song ngữ.

Các phương pháp tiếp cận thống kê tương phản với các phương pháp tiếp cận dựa trên luật trong dịch máy cũng như với dịch máy dựa trên ví dụ. Những ý tưởng đầu tiên của dịch máy thống kê đã được giới thiệu bởi Warren Weaver vào năm 1949 [129], bao gồm cả những ý tưởng của việc áp dụng lý thuyết thông tin của Claude Shannon. Dịch máy 10 thống kê được tái giới thiệu vào năm 1991 bởi các nhà nghiên cứu làm việc tại Trung tâm nghiên cứu Thomas J. Watson của IBM [13] và đã góp phần đáng kể trong sự hồi sinh việc quan tâm đến dịch máy trong những năm gần đây.

Shaffer told CNN on Saturday .

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu "Phát Triển Kỹ Thuật Dịch Máy Thống Kê Cho Tiếng Việt - Anh Với Tài Nguyên Hạn Chế" tập trung vào việc nghiên cứu và phát triển các phương pháp dịch máy thống kê hiệu quả trong điều kiện tài nguyên hạn chế, đặc biệt là cho cặp ngôn ngữ Việt - Anh. Nội dung chính bao gồm việc tối ưu hóa các mô hình dịch máy, sử dụng dữ liệu ít ỏi một cách thông minh, và đề xuất các giải pháp để cải thiện chất lượng dịch thuật. Tài liệu này mang lại lợi ích lớn cho các nhà nghiên cứu, lập trình viên, và những người quan tâm đến công nghệ ngôn ngữ, giúp họ hiểu rõ hơn về cách khắc phục thách thức trong dịch máy với nguồn lực hạn chế.

Để mở rộng kiến thức về các phương pháp nghiên cứu và ứng dụng công nghệ thông tin, bạn có thể tham khảo thêm Luận văn thạc sĩ phương pháp phân cụm tài liệu web và áp dụng vào máy tìm kiếm. Nếu quan tâm đến các nghiên cứu liên quan đến xử lý văn bản, Luận văn thạc sĩ nghiên cứu văn bản tính lý tiết yếu là một tài liệu đáng đọc. Ngoài ra, để hiểu sâu hơn về các mô hình thống kê và ứng dụng thực tiễn, bạn có thể khám phá Luận văn thạc sĩ nghiên cứu bộ ba bất khả thi ở Việt Nam. Mỗi liên kết là cơ hội để bạn khám phá thêm những góc nhìn mới và chuyên sâu về chủ đề này.