Chương 1 Tổng quan về dịch máy và tài nguyên ngôn ngữ Chương này trình bày tổng quan về dịch máy và tài nguyên ngôn ngữ được sử dụng trong dịch máy: lịch sử về dịch máy; kiến trúc của hệ thống dịch máy; các hướng tiếp cận của dịch máy; đánh giá hệ thống dịch máy; tài nguyên ngôn ngữ và tài nguyên ngôn ngữ cho các hệ thống dịch máy; thích ứng miền trong dịch máy và các công cụ tiền xử lý văn bản tiếng Việt. Chúng tôi phân tích, đánh giá các công trình nghiên cứu liên quan, đưa ra vấn đề còn tồn tại mà luận án sẽ giải quyết.1 Tổng quan về dịch máy Dịch máy là gì? Dịch máy là một hệ thống sử dụng máy tính để chuyển đổi văn bản được viết trong ngôn ngữ tự nhiên này thành bản dịch tương đương trong ngôn ngữ khác. Ngôn ngữ của văn bản cần dịch còn gọi là ngôn ngữ nguồn, ngôn ngữ của bản dịch được gọi là ngôn ngữ đích.1 Lịch sử về dịch máy Mơ ước về việc có thể hiểu ngôn ngữ của dân tộc khác của con người đã có từ rất lâu, từ thế kỷ 17 nhiều nhà nghiên cứu đã có những nỗ lực đầu tiên trong việc xây dựng một cách biểu diễn chung cho tất cả các ngôn ngữ. Năm 1933 có hai phát minh được cấp bằng sáng chế liên quan đến việc xây dựng các thiết bị dịch ngôn ngữ [48]: 1.
Tác giả George Artsrouni đã thiết kế một thiết bị lưu trữ có thể tìm kiếm nhanh chóng các cặp từ - giải nghĩa của hai cặp ngôn ngữ bất kỳ. Tác giả Petr Smirnov Troyanskii đã thiết kế một thiết bị dịch máy gồm 3 công đoạn: Phân tích câu nguồn, chuyển đổi từ ngữ và sinh câu đích. Thiết kế của Troyanskii tuy chưa bao giờ trở thành hiện thực nhưng nó là ý tưởng cơ bản cho nhiều loại máy dịch được thiết kế sau này. Đến cuối năm 1940 khi máy tính được phát minh và ứng dụng thành công trong việc giải mật mã, nhiều người đã nghĩ đến khả năng ứng dụng máy tính trong việc dịch với quan điểm coi việc dịch từ một ngôn ngữ bất kỳ sang tiếng Anh tương tự như việc giải mã một văn bản tiếng Anh được viết bằng một loại mật mã nào đó.
Vấn đề dịch máy được Warren Weaver đưa ra năm 1949 [110]. Những chương trình dịch tự động đầu tiên đơn giản chỉ sử dụng phương pháp dịch từ sang từ đã cho những kết quả còn hạn chế vì từ ngữ có nghĩa khác nhau trong những ngữ cảnh khác nhau. Năm 1966 tại Hoa Kỳ, Hội đồng cố vấn xử lý ngôn ngữ tự động ALPAC (Automatic Language Processing Advisory Committee) đã soạn một báo cáo nhận định rằng không thể xây dựng một hệ thống dịch tự động có hiệu quả [49]. Sau báo cáo này, các chính phủ đã không còn trợ cấp cho các chương trình nghiên cứu về dịch máy và các chương trình này cũng chấm dứt.
Việc nghiên cứu và phát triển dịch máy chỉ với một vài hoạt động của các cá nhân và tổ chức 16 nhỏ bên ngoài nước Hoa Kỳ. Tuy nhiên các đầu tư cho dịch máy trong lĩnh vực quân sự vẫn được tiếp tục như hệ thống dịch Nga-Anh của không lực Hoa Kỳ, hệ Mark II được phát triển từ năm 1964. Đến đầu những năm 1970, sau một số thành công trong nghiên cứu về lý thuyết xử lý ngôn ngữ tự nhiên và sức mạnh của máy tính cũng tăng lên đáng kể, nhiều trung tâm nghiên cứu bắt đầu quay lại đầu tư vào dịch máy. Năm 1979 [117], Yorick Wilks giới thiệu một hệ thống dịch tự động Anh-Pháp cho kết quả khá tốt.
Để đạt được thành quả này, hệ thống của Wilks đã sử dụng các tri thức có tính “khái niệm” trong việc dịch thuật. Ví dụ: Từ “drink” không đơn thuần là động từ “uống”, trong hệ thống của Wilks, từ “drink” gồm những khái niệm như “động từ có tính hoạt động”, “có liên hệ đến những chất lỏng”,. Những tri thức như vậy giúp cho hệ thống của Wilks biết được mối liên hệ giữa các từ trong câu và từ đó xác định được nghĩa chính xác hơn, phù hợp với ngữ cảnh hơn. Đến năm 1990, với sự phát triển mạnh mẽ của Internet, nhu cầu trao đổi thông tin bùng nổ cùng với sự tích lũy kiến thức về mặt ngôn ngữ, sức mạnh của máy tính tăng lên và có nhiều kết quả mới về mặt lý thuyết, cho nên việc phát triển các hệ thống dịch tự động trở nên rất cần thiết.
Dịch máy đã bước sang một giai đoạn phát triển mới, đạt được nhiều thành tựu. Các phương pháp dịch áp dụng các kỹ thuật khai phá tri thức từ kho ngữ liệu, điều mà trước kia chưa thể thực hiện được do khả năng hạn chế của máy tính, điều này đã làm thay đổi hoàn toàn các phương pháp dịch truyền thống và mang lại chất lượng cho các hệ thống dịch. Trong giai đoạn này, xuất hiện một số hệ thống dịch máy có chất lượng: • Năm 2005: Xuất hiện trang Web dịch tự động đầu tiên của Google.1 • Năm 2006: Hệ thống dịch máy METIS-II được sử dụng, đó là hệ thống dịch 1 https://translate.vn/ 17 máy kết hợp các ưu điểm giữa dịch máy thống kê, dựa vào ví dụ và dựa trên tập luật [109]. Đến ngày nay, chất lượng của nhiều hệ thống dịch đã ở mức chấp nhận được và một số các ứng dụng dịch tự động đã đi vào cuộc sống.
Theo ước tính của John Hutchins, vào năm 2001, có khoảng 1.000 phần mềm dịch tự động các ngôn ngữ được bán trên thị trường. Tiêu biểu nhất trong thời điểm hiện nay là các máy chủ dịch tự động trên Internet: Google Translate1 , Bing Microsoft Translator2 Ở Việt Nam, đã có một số nhóm nghiên cứu xây dựng hệ thống dịch máy trên các cặp ngôn ngữ khác nhau. Điển hình là một số nghiên cứu sau: • Dự án nghiên cứu về việc học luật chuyển đổi từ ngữ liệu song ngữ của nhóm nghiên cứu của Đinh Điền Trường Đại học Khoa học Tự nhiên - Đại học Quốc gia thành phố Hồ Chí Minh, năm 2005. • Đề tài nghiên cứu phương pháp phân tích cú pháp có xác suất để dịch văn bản Anh-Việt, Việt-Anh của nhóm nghiên cứu của PGS.TS Phan Thị Tươi, trường Đại học Bách khoa Hồ Chí Minh.
• Dự án ERIM của trường Đại học Bách khoa Đà Nẵng kết hợp với GETA - Đại học Bách khoa Grenoble về nghiên cứu thử nghiệm hệ dịch máy Anh- Việt, Pháp-Việt của Đoàn Nguyên Hải tại LATL. • Nhóm nghiên cứu của TS. Lê Khánh Hùng - Viện nghiên cứu ứng dụng công nghệ, Bộ khoa học công nghệ, năm 2005. Hệ thống dịch máy này đã được đưa thành sản phẩm thương mại với tên ban đầu của hệ thống là EVTRAN.
Hiện nay hệ thống có tên là EV-shuttle 4. • Đề tài nghiên cứu xây dựng hệ dịch tự động văn bản tiếng Việt ra tiếng nói tiếng Mường, hướng đến áp dụng cho các ngôn ngữ dân tộc thiểu số chưa có 2 https://www.com/translator 18 chữ viết ở Việt Nam của TS. Mạc Đăng Khoa tại Viện Nghiên cứu quốc tế về Thông tin đa phương tiện, Truyền thông và Ứng dụng (MICA), Trường Đại Học Bách Khoa Hà Nội, năm 2017. Hiện nay, các nghiên cứu để nâng cao chất lượng hệ thống dịch máy vẫn đang được các nhóm nghiên cứu tiến hành.
Trong đó phương pháp dịch máy dựa trên mạng nơ-ron là một hướng tiếp cận được xem là có ưu thế hơn hẳn so với các hướng tiếp cận dịch máy khác.2 Kiến trúc của hệ thống dịch máy Có ba hướng tiếp cận cơ bản được sử dụng để phát triển các hệ thống dịch máy: 1. Dịch trực tiếp; 2. Dịch chuyển đổi; 3. Dịch qua ngôn ngữ trung gian.
Mỗi phương pháp có ưu và nhược điểm riêng.1 là sơ đồ của Bernard Vauquois [13] tóm tắt kiến trúc của các hệ thống dịch máy theo ba hướng tiếp cận trên.1 Dịch trực tiếp Theo hướng tiếp cận này, hệ thống sẽ dịch bằng cách thay thế một cách đơn giản những từ hoặc cụm từ trong ngôn ngữ nguồn bằng những từ hoặc cụm từ tương ứng trong ngôn ngữ đích. Đặc điểm của hướng tiếp cận dịch này là đơn giản, nhanh, không cần phân tích cú pháp sâu, thích hợp cho những văn bản dịch có khối lượng từ vựng nhỏ và số dạng câu giới hạn. Nó thích hợp đối với các ngôn ngữ cùng loại hình, có sự tương ứng 1-1 về từ vựng, ngữ pháp,. chẳng hạn như: tiếng Pháp và tiếng Anh.
Nhưng chúng gặp phải khó khăn khi dịch 19 Hình 1.1: Tam giác Vauquois cặp ngôn ngữ khác nhau về loại hình, như: tiếng Anh (loại hình biến cách: Từ biến đổi hình thái) và tiếng Việt (loại hình đơn lập: Từ không biến đổi hình thái). Mô hình dịch theo hướng tiếp cận dịch này được thể hiện trong Hình1.2 Dịch chuyển đổi Tiếp cận theo hướng dịch chuyển đổi được thực hiện theo 3 bước: • Bước 1: Chuyển văn bản ở ngôn ngữ nguồn thành một dạng biểu diễn trung gian, thường là cây phân tích cú pháp. • Bước 2: Chuyển các biểu diễn trung gian này, thành dạng văn bản tương ứng trong ngôn ngữ đích. • Bước 3: Sinh ra văn bản ở ngôn ngữ đích.
Trong hướng tiếp cận dịch chuyển đổi, văn bản nguồn được phân tích thành một dạng biểu diễn nào đó, mà vẫn mang đầy đủ các đặc tính của nó. Biểu diễn này có thể nằm trong phạm vi từ cú pháp đến ngữ nghĩa.2: Mô hình dịch trực tiếp 1.3 Dịch qua ngôn ngữ trung gian Theo hướng tiếp cận này, hệ thống sẽ chuyển đổi văn bản từ ngôn ngữ nguồn thành văn bản ở ngôn ngữ trung gian hay còn gọi là liên ngôn ngữ, sau đó thực hiện việc chuyển văn bản từ ngôn ngữ trung gian thành văn bản ở ngôn ngữ đích. Mô hình của hướng tiếp cận này được thể hiện trong hình 1. Một liên ngôn ngữ lý tưởng phải là một sự biểu diễn độc lập với mọi ngôn ngữ tự nhiên và biểu diễn được mọi sự khác biệt về ý nghĩa đến mức tinh tế nhất của mọi ngôn ngữ có trong hệ dịch đó.
Ví dụ: tiếng Việt phân biệt các từ: lúa, thóc, gạo, cơm,. còn tiếng Anh thì không. Tương tự, tiếng Anh thì phân biệt các từ : remember, miss,. còn tiếng Việt thì chỉ dùng từ nhớ.
Chính vì vậy, việc xây dựng một hệ liên ngôn ngữ đủ mạnh để biểu diễn tất cả các thông tin của mọi ngôn ngữ có thể có, cùng với bộ phân giải và bộ tạo sinh thích hợp là một việc vô cùng phức tạp mà đến nay vẫn chưa thực hiện được. Các phương pháp dịch máy hiện nay chủ yếu được xây dựng theo kiến trúc dịch chuyển đổi.3: Mô hình dịch qua ngôn ngữ trung gian 1.