CHƯƠNG 1: CƠ SỞ LÝ THUYET 1. Khái niệm về dịch thuật Dịch thuật "là hoạt động diễn đạt ý nghĩa của những gì đã được nói hoặc viết bằng một ngôn ngữ khác" (Ji Xian Lin 2007), và nhiệm vụ của người dịch hoặc máy tính là "giải quyết mối quan hệ giữa hai ngôn ngữ (ngôn ngữ nguồn và ngôn ngữ đích)". Trên thế giới nói chung và Trung Quốc nói riêng có ba nguyên tắc kinh điển của ông Yan Fu - một nhà tư tưởng và dich giả nổi tiếng ở Trung Quốc hiện đại trong dịch thuật là “tín, đạt, nhã”. “Tin” là trung thành với nguyên tác, biểu đạt chính xác, rõ ràng những nội dung, tư tưởng của tác phẩm hoặc gọi là ngôn ngữ nguồn, “dat” có nghĩa là chú trọng sự mạch lạc của bản dịch, trong bản dịch không có sự cứng nhắc, lủng củng, rườm rà; “nhã” là tiêu chuẩn cao nhất, là sự chú trọng tư tưởng trong hoạt động phiên dịch, phong cách của bản dịch giống như phong cách của ngôn ngữ nguồn, có đi theo với nguyên tắc nhã, ngôn ngữ đích phải hợp với phong cách ngôn ngữ, phong cách dân tộc.
của ngôn ngữ nguồn. Nhưng đối với máy tính, tiêu chuẩn “nhã” là tiêu chuẩn khó đạt được, với sự hạn chế của khoa học kỹ thuật dịch máy, dịch máy nếu đạt được tiêu chuẩn “tín” và “đạt” thì đã là khá tốt. Nên ở gian đoạn hiện nay, chúng ta chỉ yêu cầu bản dịch của máy tính có thể hợp với tính chính xác và hợp với quy tắc ngữ pháp là đã chấp nhận được rồi. Khái niệm về lỗi và lỗi dịch máy 1.
Khái niệm về lỗi Khái niệm “lỗi” trong “Từ điển tiếng Việt” của Hoàng Phê (2013) , NXB Đà Nẵng, Hà Nội được giải thích là chỗ sai sót không thực hiện đúng quy tắc. Ngôn ngữ là một hệ thống tín hiệu có quy luật phát triển nội tại của mình và cũng có những quy tắc về cú pháp, ngữ pháp, ngữ nghĩa, v. Cho nên những từ trong câu và lời nói có những chỗ không thực hiện đúng quy tắc và không theo thói quen của người nói và những câu không theo đúng cú pháp gọi là lỗi trong ngôn ngữ. Khái niệm về lỗi dịch máy Hiện nay vẫn chưa có quy chế nào nói về cách phân loại các lỗi dịch máy trong ban dịch máy Hán — Việt trên thế giới, chúng tôi tham khảo tiêu chuẩn phân loại lỗi trong cuốn "Xây dựng và nghiên cứu khối liệu tiếng Anh của trường đại học Trung Quốc chuyên ngành ngoại ngữ về khối liệu đa ngôn ngữ "(Zou Shen, 2011) và “ Phân tích lỗi trong văn bản dịch may” (Luo Ji Mei, Li Mei, 2012), “Phân tích lỗi dich máy trong văn bản Quản lý học” (Zhou Qi Li, 2014) , “Khảo sát lỗi biên dich của sinh viên năm thứ ba trường Đại học Ngoại ngữ - Đại học Quốc gia Hà Nội” (Đỗ Thúy Hang 2017).
Lỗi dịch máy thường chỉ là các từ, ngữ đoạn, câu, cú pháp, ngữ pháp không tuân theo quy tắc ngôn ngữ và thói quen người nói trong văn bản dịch máy. Khái niệm về dịch máy Dịch máy (machine translation) là một hướng ứng dụng trí tuệ nhân tạo, nó là sự kết hợp giữa ngôn ngữ, dịch thuật và khoa học máy tính. Dịch máy thực hiện dịch một ngôn ngữ nảy (gọi là ngôn ngữ nguồn) sang một hoặc nhiều ngôn ngữ khác (gọi là ngôn ngữ đích) một cách tự động, không có sự can thiệp của con người trong quá trình dịch. Vào đầu những năm 1930, người Pháp G.
Artsouni lần đầu tiên đề xuất ý tưởng sử dụng kỹ thuật dịch máy. Với sự ra đời của máy tính, công nghệ dịch máy dan trở thành một điểm nóng trong giới nghiên cứu. Sự nổi lên đầu tiên là cách tiếp cận dịch máy dựa trên luật (rule-based). Nhưng bởi hạn chế của các quy luật không thé mô tả được sự phức tap của ngôn ngữ, và với sự tăng thêm của các quy luật ngôn ngữ, mâu thuẫn giữa các quy luật cũng bắt đầu ngày càng tăng lên.
Chính vì vậy, cách tiếp cận dịch máy dựa trên luật dẫn thoát khỏi vũ đài nghiên cứu. Bắt đầu từ những năm 90 thế kỷ XX, cách tiếp cận dịch máy dựa trên khối liệu (corpus-based) đã dan trở thành xu hướng chính trong giới nghiên cứu dịch máy. Cách tiếp cận dựa trên khối liệu được chia thành ba loại chính: dựa trên cụm từ (phrase-based), dựa trên thống kê (statistics-based) và dua trên mang nơ-ron mới nồi trong những năm gần đây. Những các tiếp cận dịch máy đều có những ưu điểm và nhược điểm riêng: các quy luật ngôn ngữ với tính đơn giản khó có thể bao quát được các hiện tượng ngôn ngữ.
Còn có một điểm quan trọng là mỗi ngôn ngữ có tính đặc trưng riêng, có kho từ vựng, kho ngữ liệu riêng và khác nhau. Còn quá trình xây dựng kho từ vựng, kho quy luật ngữ pháp, kho quy luật ngữ nghĩa mat nhiều chi phi. Mặc dù các cách tiếp cận dịch máy dựa trên khối liệu (corpus-based) có thé bao quát được phan lớn hiện tượng ngôn ngữ dựa vào văn bản thực tế có quy mô lớn, nhưng có một vấn đề là tiếng Việt là ngôn ngữ phi thông dụng rất khó dé có thé tìm được kho ngữ liệu có chất lượng cao và quy mô lớn. Ngoài ra có một van dé là mô hình trong kho có khả năng chuyển nhượng kém.
Do đó, trong thực tế, chúng ta thường kết hợp các cách tiếp cận dịch máy dựa trên quy luật và cách tiếp cận dịch máy được căn cứ vào khối liệu dé cải thiện hiệu quả dịch thuật. Nguyên lý cơ bản của các cách tiếp cận dịch máy 1. Tiếp cận dịch máy dựa trên chuyển đổi Nói một cách khái quát, một quá trình dịch máy điển hình dựa trên sự chuyền đổi có thé được mô tả như một phương pháp "phân tích độc lập - tao sinh độc lập - chuyên đổi liên quan". Còn toàn bộ quá trình dich máy có thé được chia thành sáu bước: (1) phân tích từ vựng của ngôn ngữ nguồn (2) phân tích cú pháp của ngôn ngữ nguồn (3) chuyền đổi từ vựng từ ngôn ngữ nguồn sang ngôn ngữ đích (4) chuyền đổi cau trúc câu từ ngôn ngữ nguồn sang ngôn ngữ đích.
(Š) tạo cú pháp của ngôn ngữ đích. (6) tạo hình thái và nghĩa của ngôn ngữ đích. Các cách tiếp cận dịch máy dựa trên chuyển đôi khác nhau có độ sâu khác nhau của ngôn ngữ học khi tiến hành sáu bước trên, và do đó cũng tạo ra các loại phương pháp dịch máy khác nhau. Trong đó, phương pháp dịch trực tiếp bỏ qua những thông tin về cú pháp, ngữ nghĩa và ngữ cảnh, lại trực tiếp dịch ngôn ngữ nguồn sang ngôn ngữ đích thông qua từ điển.
Phương pháp dịch máy 10 nay không cân nhắc cú pháp và ngữ nghĩa của câu, nó chỉ dựa vào từ điển nên độ chính xác và khả năng mở rộng của nó hơi kém và phạm vi sử dụng của đó tương đối hẹp. Cách tiếp cận dich máy dựa trên chuyên đổi bậc sâu sẽ phân tích ngôn ngữ nguồn ở cấp độ cú pháp, thậm chí cả cấp độ ngữ nghĩa, làm như thê khiến cho văn bản dịch máy chính xác hơn. Phương pháp này chuyền đổi câu ngôn ngữ nguồn thành một hình thái của ngôn ngữ nguồn ở bước một, sau đó chuyền đổi hình thái bên trong của ngôn ngữ nguồn thành hình thái bên trong của ngôn ngữ đích, và cuối cùng tạo ngôn ngữ đích theo hình thái và nghĩa của ngôn ngữ đích. Toàn bộ quá trình chuyên đổi yêu cầu phân tích từ vựng, phân tích cú pháp, phân tích ngữ nghĩa, phân tích diễn ngôn của câu, v.
Các bước dịch cụ thé được trình bày như sau: Tạo hình thái Từ điên song ngữ &nghĩa Bảng 1.1: Bảng sơ đồ về các bước dich 1. Tiếp cận dịch máy dựa trên ngôn ngữ trung gian (dịch liên ngữ) Sự khác biệt giữa phương pháp dựa trên ngôn ngữ trung gian và phương pháp dựa trên biến đồi là dịch liên ngữ là chuyên ngôn ngữ nguồn thành một biểu thức trung gian của một ngôn ngữ mới (khi dịch tiếng Hán sang tiếng Việt, ngôn ngữ trung gian thường là tiếng Anh). Sau đó chuyên ngôn ngữ trung gian thành ngôn ngữ đích. Ngôn ngữ trung gian này không có định và mang tính linh hoạt có thể sử 11 dụng trong các hệ thống khác nhau.
Nó đóng một vai trò quan trọng trong việc nâng cao hiệu quả của dịch thuật đa ngôn ngữ, đồng thời cải thiện chất lượng của bản dịch, sơ đồ được trình bày như sau: ——+» | Ngôn ngữ B (ngôn |———> Ngôn ngữ A : Ngôn ngữ C ngu trung gian) Bảng 1.2: Bảng sơ đồ về cải thiện chất lượng bản dịch 1. Tiếp cận dịch máy dựa trên khối liệu truyền thong Phương pháp dịch máy dựa trên thống kê được Weaver đề xuất lần đầu tiên vào năm 1949. Nó chủ yếu dụng ý tưởng của luận thông tin và coi quá trình dịch thuật như một quá trình mã hóa và giải mã. Bằng phương thức thống kê hiện tượng ngôn ngữ trong kho ngữ liệu song ngữ có quy mô lớn, sau đó nhận được xác suất dịch trong quá trình từ ngôn ngữ nguồn sang ngôn ngữ đích, đây chính là mô hình dịch.
Sau đó, chọn một mô hình ngôn ngữ cụ thé dé huấn luyện thích hợp với ngôn ngữ đích. Cuối cùng, chúng ta tinh toán kết hợp mô hình dịch và mô hình ngôn ngữ, nhằm sàng lọc ra bản dịch phù hợp nhất. Phương pháp dịch dựa trên mẫu ví dụ là nhập các mẫu ví dụ Song ngữ vào kho mẫu ví dụ. Khi nhập một câu ngôn ngữ nguồn, hệ thống sẽ tự động tìm kiếm trong kho mau vi dụ dé lay câu ngôn ngữ nguồn giống nhất với câu đầu vào và tìm bản dịch tương ứng của nó.
Sau đó điều chỉnh câu đã dịch theo câu nhập vào đề xuất ra kết quả dịch cuối cùng. Điểm mau chốt của phương pháp dịch máy dựa trên mẫu ví dụ là tính toán độ giống giữa câu nhập vào và câu ngôn ngữ nguồn trong kho mẫu ví dụ, từ đó dé tìm được câu ngôn ngữ nguồn giống nhất với câu nhập vào. Hiện nay, các phương pháp dịch máy dựa trên mẫu ví dụ đã được sử dụng trong các hệ thống "dịch máy do con người hỗ trợ" một cách rộng rãi. Hai phương pháp này đều có ưu điểm và nhược điểm riêng.
Đối với phương pháp dựa trên thống kê, việc huấn luyện các mô hình ngôn ngữ và mô 12 hình dịch đòi hỏi có các kho ngữ liệu song ngữ chất lượng cao với số lượng to dé hỗ trợ. Dù phương pháp dịch dựa trên mẫu vi dụ sử dụng các kho mẫu có chất lượng cao, dịch thuật đa ngôn ngữ, đa lĩnh vực cần có kho mẫu ví dụ quy mô lớn.