Nghiên Cứu Tài Nguyên Song Ngữ Việt-Anh Ứng Dụng Cho Dịch Máy

Chuyên khảo kỹ thuật phân tích Nghiên cứu xây dựng tài nguyên song ngữ việt anh ứng dụng cho dịch máy theo miền, đánh giá các khía cạnh quan trọng, đề xuất hướng nghiên cứu tiếp

Trường đại học

Đại học Quốc gia Hà Nội

Người đăng

Ẩn danh

Thể loại

Luận án tiến sĩ

2020

157
5
0

Phí lưu trữ

45 Point

Mục lục chi tiết

LỜI CAM ĐOAN

LỜI CẢM ƠN

1. CHƯƠNG 1: TỔNG QUAN VỀ DỊCH MÁY VÀ TÀI NGUYÊN NGÔN NGỮ

1.1. Tổng quan về dịch máy

1.1.1. Lịch sử về dịch máy

1.1.2. Kiến trúc của hệ thống dịch máy

1.1.3. Các phương pháp dịch máy

1.1.4. Các hệ thống dịch máy có thể sử dụng để thực nghiệm

1.1.5. Đánh giá các hệ thống dịch máy

1.2. Tài nguyên ngôn ngữ cho hệ thống dịch máy

1.2.1. Tài nguyên đa ngữ cho dịch máy

1.2.2. Tài nguyên song ngữ Việt-Anh

1.2.3. Thích ứng miền trong dịch máy

1.2.4. Các công cụ tiền xử lý văn bản

1.2.5. Kết luận chương

2. CHƯƠNG 2: XÂY DỰNG KHO NGỮ LIỆU SONG NGỮ VIỆT - ANH DÓNG HÀNG MỨC CÂU THEO MIỀN

2.1. Xây dựng kho ngữ liệu song ngữ Việt-Anh theo miền

2.1.1. Phương pháp thu thập ngữ liệu song ngữ và dóng hàng câu

2.2. Xây dựng kho ngữ liệu song ngữ Việt - Anh miền du lịch

2.2.1. Dóng hàng văn bản song ngữ Việt-Anh

2.2.1.1. Phương pháp dóng hàng văn bản song ngữ mức câu
2.2.1.2. Cải tiến công cụ dóng hàng câu XAlign

2.2.2. Ứng dụng kho ngữ liệu du lịch song ngữ Việt-Anh cho hệ thống dịch máy

2.2.2.1. Kết quả thực nghiệm
2.2.2.2. Một số lỗi của hệ thống dịch

2.2.3. Kết luận chương

3. CHƯƠNG 3: XÂY DỰNG KHO NGỮ LIỆU TỪ, CỤM TỪ SONG NGỮ VIỆT-ANH

3.1. Xây dựng tự động kho từ vựng song ngữ Việt - Anh

3.1.1. Xây dựng kho từ vựng song ngữ

3.1.2. Phương pháp xây dựng tự động từ vựng song ngữ Việt-Anh

3.1.3. Phương pháp xây dựng tự động từ vựng song ngữ Việt- Anh miền du lịch

3.1.4. Thực nghiệm và kết quả

3.2. Trích rút thuật ngữ song ngữ Việt-Anh từ văn bản đơn ngữ tiếng Việt dựa vào tập luật

3.2.1. Các công trình nghiên cứu có liên quan

3.2.2. Phương pháp trích rút thuật ngữ song ngữ Việt-Anh từ văn bản đơn ngữ tiếng Việt

3.2.3. Kết luận chương

4. CHƯƠNG 4: KHAI THÁC KHO NGỮ LIỆU SONG NGỮ VIỆT-ANH CHO DỊCH MÁY

4.1. Tiền xử lý dữ liệu huấn luyện trong dịch máy nơ-ron

4.1.1. Phương pháp tiền xử lý câu dài trong dịch máy nơ-ron

4.1.2. Phương pháp trích rút cụm từ ExtPhrase

4.1.3. Thực nghiệm và kết quả

4.2. Phương pháp sinh tự động chú giải tiếng Việt cho hình ảnh

4.2.1. Các công trình có liên quan đến sinh chú giải cho ảnh

4.2.2. Đề xuất quy trình xây dựng hệ thống sinh chú giải tiếng Việt cho ảnh

4.2.3. Kết luận chương

KẾT LUẬN

DANH MỤC CÔNG TRÌNH KHOA HỌC CỦA TÁC GIẢ LIÊN QUAN ĐẾN LUẬN ÁN

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng Quan Về Nghiên Cứu Tài Nguyên Song Ngữ Việt Anh

Nghiên cứu tài nguyên song ngữ Việt-Anh cho dịch máy là một lĩnh vực quan trọng trong công nghệ dịch thuật hiện đại. Tài nguyên này không chỉ giúp cải thiện chất lượng dịch mà còn hỗ trợ việc phát triển các hệ thống dịch máy hiệu quả hơn. Việc xây dựng kho ngữ liệu song ngữ chất lượng cao là cần thiết để đáp ứng nhu cầu ngày càng tăng về dịch thuật trong bối cảnh hội nhập quốc tế.

1.1. Khái Niệm Về Tài Nguyên Song Ngữ

Tài nguyên song ngữ là tập hợp các văn bản được dịch từ ngôn ngữ này sang ngôn ngữ khác. Chúng bao gồm các cặp câu, từ vựng và cụm từ, giúp hệ thống dịch máy học hỏi và cải thiện khả năng dịch thuật.

1.2. Vai Trò Của Tài Nguyên Trong Dịch Máy

Tài nguyên song ngữ đóng vai trò quan trọng trong việc huấn luyện các mô hình dịch máy. Chúng cung cấp dữ liệu cần thiết để cải thiện độ chính xác và độ tự nhiên của bản dịch.

II. Thách Thức Trong Nghiên Cứu Tài Nguyên Song Ngữ Việt Anh

Mặc dù có nhiều tiến bộ trong nghiên cứu tài nguyên song ngữ, nhưng vẫn tồn tại nhiều thách thức. Việc thiếu hụt dữ liệu chất lượng cao và sự đa dạng trong ngữ cảnh dịch thuật là những vấn đề lớn. Ngoài ra, việc thu thập và xử lý dữ liệu song ngữ cũng gặp nhiều khó khăn do sự khác biệt về ngữ pháp và văn hóa giữa hai ngôn ngữ.

2.1. Thiếu Dữ Liệu Chất Lượng Cao

Nhiều kho ngữ liệu hiện có không đủ lớn hoặc không đủ đa dạng để phục vụ cho việc huấn luyện các mô hình dịch máy. Điều này dẫn đến chất lượng dịch không đạt yêu cầu.

2.2. Khó Khăn Trong Việc Dóng Hàng Câu

Việc dóng hàng câu giữa hai ngôn ngữ khác nhau là một thách thức lớn. Sự khác biệt về cấu trúc ngữ pháp và cách diễn đạt có thể gây khó khăn trong việc tìm kiếm các cặp câu tương ứng.

III. Phương Pháp Xây Dựng Tài Nguyên Song Ngữ Việt Anh

Để xây dựng tài nguyên song ngữ hiệu quả, cần áp dụng các phương pháp thu thập và xử lý dữ liệu hiện đại. Các công nghệ như học máy và xử lý ngôn ngữ tự nhiên có thể được sử dụng để cải thiện quy trình này. Việc sử dụng các công cụ tự động hóa cũng giúp tiết kiệm thời gian và nguồn lực.

3.1. Phương Pháp Thu Thập Dữ Liệu

Dữ liệu có thể được thu thập từ nhiều nguồn khác nhau như trang web, tài liệu học thuật và các cơ sở dữ liệu công cộng. Việc lựa chọn nguồn dữ liệu phù hợp là rất quan trọng.

3.2. Cải Tiến Công Cụ Dóng Hàng

Cải tiến các công cụ dóng hàng như XAlign giúp nâng cao độ chính xác trong việc khớp các câu song ngữ. Điều này rất cần thiết để xây dựng kho ngữ liệu chất lượng.

IV. Ứng Dụng Tài Nguyên Song Ngữ Trong Dịch Máy

Tài nguyên song ngữ Việt-Anh có thể được ứng dụng trong nhiều lĩnh vực khác nhau như du lịch, y tế và giáo dục. Việc sử dụng tài nguyên này giúp cải thiện chất lượng dịch và đáp ứng nhu cầu của người dùng. Các hệ thống dịch máy hiện nay đã bắt đầu tích hợp tài nguyên này để nâng cao hiệu suất.

4.1. Ứng Dụng Trong Lĩnh Vực Du Lịch

Trong ngành du lịch, tài nguyên song ngữ giúp dịch các thông tin liên quan đến điểm đến, dịch vụ và văn hóa. Điều này hỗ trợ du khách trong việc tìm hiểu và trải nghiệm.

4.2. Ứng Dụng Trong Lĩnh Vực Y Tế

Tài nguyên song ngữ cũng rất quan trọng trong lĩnh vực y tế, giúp dịch các tài liệu y khoa và thông tin sức khỏe. Điều này đảm bảo rằng người bệnh có thể hiểu rõ thông tin cần thiết.

V. Kết Luận Về Tương Lai Của Tài Nguyên Song Ngữ Việt Anh

Tương lai của tài nguyên song ngữ Việt-Anh trong dịch máy rất hứa hẹn. Với sự phát triển của công nghệ và nhu cầu ngày càng tăng về dịch thuật, việc xây dựng và cải thiện tài nguyên này sẽ tiếp tục được chú trọng. Các nghiên cứu và ứng dụng mới sẽ giúp nâng cao chất lượng dịch và mở rộng khả năng của các hệ thống dịch máy.

5.1. Xu Hướng Nghiên Cứu Mới

Các xu hướng nghiên cứu mới trong lĩnh vực tài nguyên song ngữ sẽ tập trung vào việc cải thiện chất lượng dữ liệu và phát triển các mô hình dịch máy thông minh hơn.

5.2. Tầm Quan Trọng Của Hợp Tác Quốc Tế

Hợp tác quốc tế trong việc chia sẻ tài nguyên và công nghệ sẽ đóng vai trò quan trọng trong việc phát triển tài nguyên song ngữ Việt-Anh.

08/07/2025
Nghiên cứu xây dựng tài nguyên song ngữ việt anh ứng dụng cho dịch máy theo miền

Trích đoạn nội dung tài liệu

Chương 1 Tổng quan về dịch máy và tài nguyên ngôn ngữ Chương này trình bày tổng quan về dịch máy và tài nguyên ngôn ngữ được sử dụng trong dịch máy: lịch sử về dịch máy; kiến trúc của hệ thống dịch máy; các hướng tiếp cận của dịch máy; đánh giá hệ thống dịch máy; tài nguyên ngôn ngữ và tài nguyên ngôn ngữ cho các hệ thống dịch máy; thích ứng miền trong dịch máy và các công cụ tiền xử lý văn bản tiếng Việt. Chúng tôi phân tích, đánh giá các công trình nghiên cứu liên quan, đưa ra vấn đề còn tồn tại mà luận án sẽ giải quyết.1 Tổng quan về dịch máy Dịch máy là gì? Dịch máy là một hệ thống sử dụng máy tính để chuyển đổi văn bản được viết trong ngôn ngữ tự nhiên này thành bản dịch tương đương trong ngôn ngữ khác. Ngôn ngữ của văn bản cần dịch còn gọi là ngôn ngữ nguồn, ngôn ngữ của bản dịch được gọi là ngôn ngữ đích.1 Lịch sử về dịch máy Mơ ước về việc có thể hiểu ngôn ngữ của dân tộc khác của con người đã có từ rất lâu, từ thế kỷ 17 nhiều nhà nghiên cứu đã có những nỗ lực đầu tiên trong việc xây dựng một cách biểu diễn chung cho tất cả các ngôn ngữ. Năm 1933 có hai phát minh được cấp bằng sáng chế liên quan đến việc xây dựng các thiết bị dịch ngôn ngữ [48]: 1.

Tác giả George Artsrouni đã thiết kế một thiết bị lưu trữ có thể tìm kiếm nhanh chóng các cặp từ - giải nghĩa của hai cặp ngôn ngữ bất kỳ. Tác giả Petr Smirnov Troyanskii đã thiết kế một thiết bị dịch máy gồm 3 công đoạn: Phân tích câu nguồn, chuyển đổi từ ngữ và sinh câu đích. Thiết kế của Troyanskii tuy chưa bao giờ trở thành hiện thực nhưng nó là ý tưởng cơ bản cho nhiều loại máy dịch được thiết kế sau này. Đến cuối năm 1940 khi máy tính được phát minh và ứng dụng thành công trong việc giải mật mã, nhiều người đã nghĩ đến khả năng ứng dụng máy tính trong việc dịch với quan điểm coi việc dịch từ một ngôn ngữ bất kỳ sang tiếng Anh tương tự như việc giải mã một văn bản tiếng Anh được viết bằng một loại mật mã nào đó.

Vấn đề dịch máy được Warren Weaver đưa ra năm 1949 [110]. Những chương trình dịch tự động đầu tiên đơn giản chỉ sử dụng phương pháp dịch từ sang từ đã cho những kết quả còn hạn chế vì từ ngữ có nghĩa khác nhau trong những ngữ cảnh khác nhau. Năm 1966 tại Hoa Kỳ, Hội đồng cố vấn xử lý ngôn ngữ tự động ALPAC (Automatic Language Processing Advisory Committee) đã soạn một báo cáo nhận định rằng không thể xây dựng một hệ thống dịch tự động có hiệu quả [49]. Sau báo cáo này, các chính phủ đã không còn trợ cấp cho các chương trình nghiên cứu về dịch máy và các chương trình này cũng chấm dứt.

Việc nghiên cứu và phát triển dịch máy chỉ với một vài hoạt động của các cá nhân và tổ chức 16 nhỏ bên ngoài nước Hoa Kỳ. Tuy nhiên các đầu tư cho dịch máy trong lĩnh vực quân sự vẫn được tiếp tục như hệ thống dịch Nga-Anh của không lực Hoa Kỳ, hệ Mark II được phát triển từ năm 1964. Đến đầu những năm 1970, sau một số thành công trong nghiên cứu về lý thuyết xử lý ngôn ngữ tự nhiên và sức mạnh của máy tính cũng tăng lên đáng kể, nhiều trung tâm nghiên cứu bắt đầu quay lại đầu tư vào dịch máy. Năm 1979 [117], Yorick Wilks giới thiệu một hệ thống dịch tự động Anh-Pháp cho kết quả khá tốt.

Để đạt được thành quả này, hệ thống của Wilks đã sử dụng các tri thức có tính “khái niệm” trong việc dịch thuật. Ví dụ: Từ “drink” không đơn thuần là động từ “uống”, trong hệ thống của Wilks, từ “drink” gồm những khái niệm như “động từ có tính hoạt động”, “có liên hệ đến những chất lỏng”,. Những tri thức như vậy giúp cho hệ thống của Wilks biết được mối liên hệ giữa các từ trong câu và từ đó xác định được nghĩa chính xác hơn, phù hợp với ngữ cảnh hơn. Đến năm 1990, với sự phát triển mạnh mẽ của Internet, nhu cầu trao đổi thông tin bùng nổ cùng với sự tích lũy kiến thức về mặt ngôn ngữ, sức mạnh của máy tính tăng lên và có nhiều kết quả mới về mặt lý thuyết, cho nên việc phát triển các hệ thống dịch tự động trở nên rất cần thiết.

Dịch máy đã bước sang một giai đoạn phát triển mới, đạt được nhiều thành tựu. Các phương pháp dịch áp dụng các kỹ thuật khai phá tri thức từ kho ngữ liệu, điều mà trước kia chưa thể thực hiện được do khả năng hạn chế của máy tính, điều này đã làm thay đổi hoàn toàn các phương pháp dịch truyền thống và mang lại chất lượng cho các hệ thống dịch. Trong giai đoạn này, xuất hiện một số hệ thống dịch máy có chất lượng: • Năm 2005: Xuất hiện trang Web dịch tự động đầu tiên của Google.1 • Năm 2006: Hệ thống dịch máy METIS-II được sử dụng, đó là hệ thống dịch 1 https://translate.vn/ 17 máy kết hợp các ưu điểm giữa dịch máy thống kê, dựa vào ví dụ và dựa trên tập luật [109]. Đến ngày nay, chất lượng của nhiều hệ thống dịch đã ở mức chấp nhận được và một số các ứng dụng dịch tự động đã đi vào cuộc sống.

Theo ước tính của John Hutchins, vào năm 2001, có khoảng 1.000 phần mềm dịch tự động các ngôn ngữ được bán trên thị trường. Tiêu biểu nhất trong thời điểm hiện nay là các máy chủ dịch tự động trên Internet: Google Translate1 , Bing Microsoft Translator2 Ở Việt Nam, đã có một số nhóm nghiên cứu xây dựng hệ thống dịch máy trên các cặp ngôn ngữ khác nhau. Điển hình là một số nghiên cứu sau: • Dự án nghiên cứu về việc học luật chuyển đổi từ ngữ liệu song ngữ của nhóm nghiên cứu của Đinh Điền Trường Đại học Khoa học Tự nhiên - Đại học Quốc gia thành phố Hồ Chí Minh, năm 2005. • Đề tài nghiên cứu phương pháp phân tích cú pháp có xác suất để dịch văn bản Anh-Việt, Việt-Anh của nhóm nghiên cứu của PGS.TS Phan Thị Tươi, trường Đại học Bách khoa Hồ Chí Minh.

• Dự án ERIM của trường Đại học Bách khoa Đà Nẵng kết hợp với GETA - Đại học Bách khoa Grenoble về nghiên cứu thử nghiệm hệ dịch máy Anh- Việt, Pháp-Việt của Đoàn Nguyên Hải tại LATL. • Nhóm nghiên cứu của TS. Lê Khánh Hùng - Viện nghiên cứu ứng dụng công nghệ, Bộ khoa học công nghệ, năm 2005. Hệ thống dịch máy này đã được đưa thành sản phẩm thương mại với tên ban đầu của hệ thống là EVTRAN.

Hiện nay hệ thống có tên là EV-shuttle 4. • Đề tài nghiên cứu xây dựng hệ dịch tự động văn bản tiếng Việt ra tiếng nói tiếng Mường, hướng đến áp dụng cho các ngôn ngữ dân tộc thiểu số chưa có 2 https://www.com/translator 18 chữ viết ở Việt Nam của TS. Mạc Đăng Khoa tại Viện Nghiên cứu quốc tế về Thông tin đa phương tiện, Truyền thông và Ứng dụng (MICA), Trường Đại Học Bách Khoa Hà Nội, năm 2017. Hiện nay, các nghiên cứu để nâng cao chất lượng hệ thống dịch máy vẫn đang được các nhóm nghiên cứu tiến hành.

Trong đó phương pháp dịch máy dựa trên mạng nơ-ron là một hướng tiếp cận được xem là có ưu thế hơn hẳn so với các hướng tiếp cận dịch máy khác.2 Kiến trúc của hệ thống dịch máy Có ba hướng tiếp cận cơ bản được sử dụng để phát triển các hệ thống dịch máy: 1. Dịch trực tiếp; 2. Dịch chuyển đổi; 3. Dịch qua ngôn ngữ trung gian.

Mỗi phương pháp có ưu và nhược điểm riêng.1 là sơ đồ của Bernard Vauquois [13] tóm tắt kiến trúc của các hệ thống dịch máy theo ba hướng tiếp cận trên.1 Dịch trực tiếp Theo hướng tiếp cận này, hệ thống sẽ dịch bằng cách thay thế một cách đơn giản những từ hoặc cụm từ trong ngôn ngữ nguồn bằng những từ hoặc cụm từ tương ứng trong ngôn ngữ đích. Đặc điểm của hướng tiếp cận dịch này là đơn giản, nhanh, không cần phân tích cú pháp sâu, thích hợp cho những văn bản dịch có khối lượng từ vựng nhỏ và số dạng câu giới hạn. Nó thích hợp đối với các ngôn ngữ cùng loại hình, có sự tương ứng 1-1 về từ vựng, ngữ pháp,. chẳng hạn như: tiếng Pháp và tiếng Anh.

Nhưng chúng gặp phải khó khăn khi dịch 19 Hình 1.1: Tam giác Vauquois cặp ngôn ngữ khác nhau về loại hình, như: tiếng Anh (loại hình biến cách: Từ biến đổi hình thái) và tiếng Việt (loại hình đơn lập: Từ không biến đổi hình thái). Mô hình dịch theo hướng tiếp cận dịch này được thể hiện trong Hình1.2 Dịch chuyển đổi Tiếp cận theo hướng dịch chuyển đổi được thực hiện theo 3 bước: • Bước 1: Chuyển văn bản ở ngôn ngữ nguồn thành một dạng biểu diễn trung gian, thường là cây phân tích cú pháp. • Bước 2: Chuyển các biểu diễn trung gian này, thành dạng văn bản tương ứng trong ngôn ngữ đích. • Bước 3: Sinh ra văn bản ở ngôn ngữ đích.

Trong hướng tiếp cận dịch chuyển đổi, văn bản nguồn được phân tích thành một dạng biểu diễn nào đó, mà vẫn mang đầy đủ các đặc tính của nó. Biểu diễn này có thể nằm trong phạm vi từ cú pháp đến ngữ nghĩa.2: Mô hình dịch trực tiếp 1.3 Dịch qua ngôn ngữ trung gian Theo hướng tiếp cận này, hệ thống sẽ chuyển đổi văn bản từ ngôn ngữ nguồn thành văn bản ở ngôn ngữ trung gian hay còn gọi là liên ngôn ngữ, sau đó thực hiện việc chuyển văn bản từ ngôn ngữ trung gian thành văn bản ở ngôn ngữ đích. Mô hình của hướng tiếp cận này được thể hiện trong hình 1. Một liên ngôn ngữ lý tưởng phải là một sự biểu diễn độc lập với mọi ngôn ngữ tự nhiên và biểu diễn được mọi sự khác biệt về ý nghĩa đến mức tinh tế nhất của mọi ngôn ngữ có trong hệ dịch đó.

Ví dụ: tiếng Việt phân biệt các từ: lúa, thóc, gạo, cơm,. còn tiếng Anh thì không. Tương tự, tiếng Anh thì phân biệt các từ : remember, miss,. còn tiếng Việt thì chỉ dùng từ nhớ.

Chính vì vậy, việc xây dựng một hệ liên ngôn ngữ đủ mạnh để biểu diễn tất cả các thông tin của mọi ngôn ngữ có thể có, cùng với bộ phân giải và bộ tạo sinh thích hợp là một việc vô cùng phức tạp mà đến nay vẫn chưa thực hiện được. Các phương pháp dịch máy hiện nay chủ yếu được xây dựng theo kiến trúc dịch chuyển đổi.3: Mô hình dịch qua ngôn ngữ trung gian 1.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ