MỞ ĐẦU Theo bản điều tra báo cáo của UNESCO Liên Hiệp Quốc thì trên thế giới hiện có 2750 thứ tiếng. Với nhu cầu trao đổi thông tin thƣờng xuyên và liên tục, con ngƣời gặp phải không ít khó khăn do bất đồng ngôn ngữ. Ngƣời ta đã phải dùng đến một đội ngũ phiên dịch khổng lồ, để dịch các văn bản, tài liệu, lời nói từ tiếng nƣớc này sang tiếng nƣớc khác. Để khắc phục những nhƣợc điểm trên con ngƣời đã nghĩ đến việc thiết kế một mô hình dịch tự động.
Công việc đƣa ra mô hình dịch tự động đã và đang đƣợc phát triển và trở thành đề tài nghiên cứu đƣợc rất nhiều nhà khoa học quan tâm. Trên thế giới đã có rất nhiều nƣớc công bố nghiên cứu về mô hình ngôn ngữ áp dụng cho ngôn ngữ của họ nhƣng ở Việt Nam, việc nghiên cứu và xây dựng một mô hình ngôn ngữ chuẩn cho tiếng Việt vẫn còn mới mẻ và gặp nhiều khó khăn Mô hình dịch là một thành phần quan trọng trong các hệ thống dịch máy. Cải thiện mô hình dịch có thể tăng hiệu quả rất lớn đối với các hệ thống dịch máy. Vì vậy, trên thế giới đã có nhiều nghiên cứu đƣợc công bố về các mô hình dịch đem lại những hiệu quả rất tích cực.
Ở Việt Nam, dịch máy cũng đã trở thành đề tài đƣợc một số nhóm tập trung nghiên cứu tuy nhiên chất lƣợng cũng nhƣ phạm vi ứng dụng của các hệ dịch đó vẫn còn nhiều hạn chế. Những khó khăn đến từ cách thức tiếp cận, về cấu trúc ngữ pháp và sự nhập nhằng ngữ nghĩa của tiếng Việt. Dịch máy dựa trên cụm từ hiện nay đang là mô hình dịch đem lại hiệu quả cao và đang đƣợc sử dụng rộng rãi (Google, Bing,. Mặc dù vậy, dịch trên cụm từ vẫn còn có những hạn chế khi mà dịch trên cụm từ thông thƣờng không đem lại kết quả cao khi trong dữ liệu huấn luyện chứa các thành phần dịch mà không nằm cạnh nhau nhƣng lại có liên kết tới nhau.
Khi đó các thành phần này sẽ bị dịch riêng rẽ và đƣa ra kết quả không chính xác. Chính điều này đã gợi ý và thúc z đẩy tôi lựa chọn và tập trung nghiên cứu về vấn đề này. Dựa vào bài báo của Michel Galley and Christopher D. Manning [3], tôi tiến hành nghiên cứu đề tài “Áp dụng mô hình dịch dựa vào cụm từ không liên tục cho cặp ngôn ngữ Anh Việt”.
Tôi tin là nếu đề tài này đƣợc nghiên cứu thành công, kết quả của đề tài có thể ứng dụng rất tốt phục vụ trong công tác giảng dạy cũng nhƣ áp dụng thực tiễn để xây dựng hệ thống dịch tự động. Bố cục luận văn gồm 3 chƣơng: Chƣơng 1: Giới thiệu tổng quan. Nội dung chính của chƣơng này là giới thiệu tổng quan về bài toán dịch tự động, các hệ thống dịch máy, dịch máy thống kê. Chƣơng này cũng giới thiệu về nguyên lý hoạt động, các thành phần và phƣơng pháp đánh giá về một hệ thống dịch máy thống kê.
Chƣơng 2: Mô hình dịch dựa vào cụm từ không liên tục Nội dung chính của chƣơng này là giới thiệu về mô hình dịch máy dựa trên cụm từ không liên tục. Trong chƣơng này, chúng tôi đã giới thiệu về mô hình dịch máy, phân loại các mô hình dịch máy hiện nay. Cùng với đó, chúng tôi đã trình bày cách tiếp cận, đi sâu vào mô hình dịch máy dựa trên cụm từ không liên tục. Chƣơng 3: Áp dụng mô hình dịch dựa vào cụm từ không liên tục cho cặp ngôn ngữ Anh-Việt Nội dung chính của chƣơng này là mô tả việc áp dụng mô hình học máy dựa trên cụm từ không liên tục cho bài toán dịch máy.
Chƣơng tày cũng sẽ mô tả về công cụ Phrasal cùng các thực nghiệm sử dụng công cụ này, đƣa ra các kết quả thu đƣợc và đánh giá. Cuối chƣơng sẽ đƣa ra hƣớng nghiên cứu tiếp theo của đề tài. z CHƢƠNG 1: GIỚI THIỆU TỔNG QUAN Nội dung chính của chương này là giới thiệu tổng quan về bài toán dịch tự động, các hệ thống dịch máy, dịch máy thống kê. Chương này cũng giới thiệu về nguyên lý hoạt động, các thành phần và phương pháp đánh giá về một hệ thống dịch máy thống kê.
Dịch máy Các hệ dịch máy (machine translation system-MT) là các hệ thống sử dụng máy tính để dịch từ một thứ tiếng (trong ngôn ngữ tự nhiên) sang một hoặc vài thứ tiếng khác. Đầu vào của một hệ dịch máy là một văn bản viết trong ngôn ngữ nguồn. Văn bản này có thể thu đƣợc từ một hệ soạn thảo hay một hệ nhận dạng chữ viết, lời nói. Sau đó văn bản có thể đƣợc chỉnh sửa lại nhờ khối soạn thảo, kiểm tra chính tả, trƣớc khi đƣa vào máy dịch.
Phần dịch máy sẽ chuyển văn bản nguồn thành văn bản viết trên ngôn ngữ đích. Và cũng qua một bộ chỉnh ra để cuối cùng thu đƣợc một văn bản tƣơng đối hoàn chỉnh. Dịch máy có lịch sử lâu đời từ thập kỷ 50 và đƣợc phát triển mạnh mẽ từ thập kỷ 80 cho đến nay. Hiện tại, trên thế giới có rất nhiều hệ dịch máy thƣơng mại nổi tiếng trên thế giới nhƣ Systrans, Kant, … hay những hệ dịch máy mở tiêu biểu là hệ dịch của Google, hỗ trợ hàng chục cặp ngôn ngữ phổ biến nhƣ Anh- Pháp, Anh-Trung, Anh-Nhật, Hoa-Nhật,… Các cách tiếp cận dịch máy chủ yếu dựa vào luật chuyển đổi, dịch liên ngữ và dịch dựa vào dữ liệu.
Các hệ dịch máy này đã đạt đƣợc kết quả khá tốt với những cặp ngôn ngữ tƣơng đồng nhau về cú pháp nhƣ các cặp ngôn ngữ AnhPháp, Anh-Tây Ban Nha, … và còn gặp nhiều hạn chế đối với các cặp ngôn ngữ có cú pháp khác nhau nhƣ Anh-Trung, Anh- 10 z Nhật, … Và ở Việt Nam, dịch Anh-Việt, Việt-Anh cũng vấp phải những khó khăn tƣơng tự do sự khác biệt về mặt cấu trúc ngữ pháp và tính nhập nhằng của ngữ nghĩa. hệ thống dịch Anh-Việt dựa trên luật chuyển đổi đƣợc thƣơng mại hóa đầu tiên ở Việt Nam là EVTran, MTD Lạc Việt. Hiện nay, nhiều nghiên cứu với mong muốn tăng chất lƣợng dịch vẫn đang đƣợc thực hiện thích nghi với đặc điểm của các cặp ngôn ngữ khác nhau. Hiện nay, các nghiên cứu để làm tăng chất lƣợng hệ dịch vẫn đang đƣợc tiến hành phù hợp với đặc điểm của các cặp ngôn ngữ.
Trong đó, phương pháp dịch dựa trên thống kê là một hƣớng tiếp cận đang đƣợc phát triển mạnh từ những năm của thập kỷ 90, đang đƣợc xem là cách tiếp cận khả thi và hiệu quả của việc dịch tự động với nhiều bƣớc đột phá. Dịch máy thống kê a) Giới thiệu tổng quan Dịch máy thống kê (SMT) là một phƣơng pháp dịch máy, trong đó các bản dịch đƣợc tạo ra trên cơ sở các mô hình thống kê có các tham số đƣợc bắt nguồn từ việc phân tích các cặp câu song ngữ. Các phƣơng pháp tiếp cận thống kê tƣơng phản với các phƣơng pháp tiếp cận dựa trên luật trong dịch máy cũng nhƣ với dịch máy dựa trên ví dụ. Những ý tƣởng đầu tiên của dịch máy thống kê đã đƣợc giới thiệu bởi Warren Weaver vào năm 1949, bao gồm cả những ý tƣởng của việc áp dụng lý thuyết thông tin của Claude Shannon.
Dịch máy thống kê đƣợc tái giới thiệu vào năm 1991 bởi các nhà nghiên cứu làm việc tại Trung tâm nghiên cứu Thomas J. Watson của IBM và đã góp phần đáng kể trong sự hồi sinh việc quan 11 z tâm đến dịch máy trong những năm gần đây. Ngày nay nó là phƣơng pháp dịch máy đƣợc nghiên cứu nhiều nhất. Để thực hiện dịch máy, chúng ta nhất thiết phải kết hợp nhiều nguồn trí thức.
Trong khi đối với dịch thống kê, chúng ta dựa vào toán học để thực hiện kết hợp tối ƣu của các nguồn trí thức. Trong dịch máy thống kê, trí thức dịch đƣợc học một cách tự động từ dữ liệu huấn luyện. Với kết quả nhƣ vậy, việc phát triển một hệ dịch dựa vào thống kê sẽ rất nhanh so với hệ dịch dựa vào luật. Thật vậy, việc đƣa ra khái niệm “chính xác” của mối quan hệ ngữ pháp, ngữ nghĩa, văn phong là rất khó khăn hơn rất nhiều nếu không nói là không thể.
Thay vào đó, trong cách tiếp cận thống kê, các giả định mô hình đƣợc kiểm định bằng thực nghiệm dựa vào dữ liệu huấn luyện. Một ƣu điểm khác của dịch máy thống kê đó là phƣơng pháp này khá phù hợp với ứng dụng nhúng mà ở đây dịch máy là một phần của ứng dụng lớn hơn. Dịch máy dựa trên phƣơng pháp thống kê sẽ tìm câu ngôn ngữ đích e phù hợp nhất (có xác suất cao nhất) khi cho trƣớc câu ngôn ngữ nguồn f. Một hệ dịch máy dựa trên phƣơng pháp thống kê có thể đƣợc mô hình hoá nhƣ hình sau: 12 z Hình 0.1: Mô hình hóa hệ dịch máy Dịch máy thống kê lần đầu tiên đƣợc đề cập trong bài báo với phƣơng pháp sử dụng là mô hình Kênh nhiễu (Noisy Channel Model).
Mô hình kênh nhiễu đƣợc Brown áp dụng trong bài toán dịch máy nhƣ sau: Cho câu tiếng Pháp f1J = f1 … f j … f J cần dịch sang câu tiếng Anh e1I = e1 …ei …eI. Brown dựng lên mô hình kênh nhiễu với e là đầu vào bộ mã hoá (Encoder), qua kênh nhiễu đƣợc chuyển hoá thành f và sau đó, gửi f đến bộ giải mã (Decoder). Nhƣ vậy, trong các câu tiếng Anh, ta chọn câu sao cho xác suất hậu nghiệm Pr (e1I | f1J ) là lớn nhất, theo luật quyết định Bayes : { eˆ1I = arg max Pr(e1I | f1 J ) } = arg max{Pr(e ).Pr( f | e )} 1 1 1 13 z Nhƣ vậy, ta có thể xây dựng mô hình chung của hệ dịch máy bằng phƣơng pháp thống kê thông thƣờng sẽ bao gồm 3 thành phần: - Mô hình ngôn ngữ: Tính toán đƣợc xác suất của câu ngôn ngữ nguồn. - Mô hình dịch: Cho biết xác suất của câu ngôn ngữ nguồn là bản dịch từ câu ngôn ngữ đích.
- Bộ giải mã: Tìm kiếm tất cả các câu ngôn ngữ đích e có thể có từ câu ngôn ngữ nguồn f. Mô hình dịch từ tiếng Anh sang tiếng Việt có thể hình dung thông qua biểu đồ dƣới đây: Hình 0.2: Mô hình dịch máy thống kê từ tiếng Anh sang tiếng Việt Mô hình dịch của mô hình ngôn ngữ sẽ đƣợc trình bày ở chƣơng sau của luận văn. Ở phần này, luận văn chỉ đề cập đến hai thành phần còn lại của mô hình dịch máy thống kê. 14 z b) Mô hình ngôn ngữ Mô hình ngôn ngữ là một phân bố xác suất trên các tập văn bản.