Mô Hình Tích Hợp Tri Thức Ngôn Ngữ Trong Dịch Máy Neural Anh-Việt

Luận án tiến sĩ kỹ thuật phân tích máy tính xây dựng mô hình tích hợp tri thức ngôn ngữ trong dịch máy mạng neural anh việt, xây dựng cơ sở lý luận, kiểm chứng thực nghiệm, đóng

Trường đại học

Đại học Quốc gia TP. HCM

Chuyên ngành

Khoa học máy tính

Người đăng

Ẩn danh

Thể loại

Doctoral Thesis

2023

60
1
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CAM ĐOAN

LỜI CẢM ƠN

TRANG THÔNG TIN LUẬN ÁN TIẾNG VIỆT

TRANG THÔNG TIN LUẬN ÁN TIẾNG ANH

DANH MỤC CÁC HÌNH, BIỂU ĐỒ

DANH MỤC CÁC BẢNG SỐ LIỆU

DANH MỤC CÁC KÝ HIỆU, CÁC CHỮ VIẾT TẮT

BẢNG CHÚ THÍCH THUẬT NGỮ

1. CHƯƠNG 1: GIỚI THIỆU

1.1. Động cơ nghiên cứu

1.2. Ngữ nghĩa Ngôn ngữ

2. CHƯƠNG 2

2.1. Tổng quan dịch máy

2.2. Khảo sát các phương pháp dịch máy

2.3. Đánh giá chất lượng dịch máy

2.4. Các mô hình dịch máy mạng neural

2.4.1. Mô hình Seq2Seq

2.4.2. Mô hình Seq2Seq với cơ chế chú ý

2.4.3. Mô hình ConvSeq2Seq

2.4.4. Mô hình Transformer

2.5. Các tri thức ngôn ngữ ảnh hưởng đến dịch máy

2.5.1. Tri thức từ vựng

2.5.2. Tri thức ngữ pháp

2.6. Kết chương

3. CHƯƠNG 3

3.1. Phân đoạn cụm từ

3.2. Mạng Capsule cụm từ chính (PPC)

3.3. Cơ chế chú ý vị trí động (DSA)

3.4. Kết nối đến các lớp tự chú ý

5. CHƯƠNG 5: MÔ HÌNH TÍCH HỢP TRI THỨC NGỮ NGHĨA

5.1. Tích hợp tri thức ngữ nghĩa trừu tượng

5.2. Mô hình đề xuất

5.3. Công trình liên quan

5.4. Kết chương

6. CHƯƠNG 6: MÔ HÌNH TÍCH HỢP TRI THỨC TỔNG QUÁT

6.1. Cơ chế so khớp mô men

6.2. Công trình liên quan

6.3. Đặc trưng đề xuất

6.3.1. Đặc trưng so sánh văn bản

6.3.2. Đặc trưng khoảng cách vector

6.4. Thiết lập thực nghiệm

6.4.1. Phân tích lỗi dịch

6.4.2. Phân tích thời gian dịch

6.5. Kết chương

7. CHƯƠNG 7

7.1. Kết quả đạt được

7.2. Hướng phát triển

DANH MỤC CÔNG TRÌNH CỦA TÁC GIẢ

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng Quan Mô Hình Tích Hợp Tri Thức Ngôn Ngữ Anh Việt

Dịch máy Neural (NMT) đã chứng minh hiệu quả vượt trội, thu hút sự chú ý lớn. Trong thực tế, hệ thống NMT thường nhận đầu vào là các câu, trong đó mỗi từ được biểu diễn bằng một vector riêng lẻ. Tuy nhiên, không gian vector này thiếu sự kết nối giữa các từ, như quan hệ ngữ pháp hay ngữ nghĩa. Nghiên cứu gần đây nhấn mạnh tầm quan trọng của tri thức ngôn ngữ bổ sung để tạo ra các bản dịch chính xác và phù hợp. Luận án này tập trung vào việc khảo sát, phân tích và ứng dụng thông tin tri thức ngôn ngữ vào các mô hình NMT một cách toàn diện. Nghiên cứu này xuất phát từ nhu cầu cải thiện khả năng của dịch máy thần kinh trong việc xử lý các khía cạnh phức tạp của ngôn ngữ.

1.1. Tại Sao Cần Tích Hợp Tri Thức Ngôn Ngữ Cho NMT

Các mô hình dịch máy Neural hiện tại xem quá trình dịch là một tác vụ end-to-end, biểu diễn một chuỗi từ từ ngôn ngữ này sang ngôn ngữ khác. Ngay cả khi được tích hợp các đặc trưng ngôn ngữ như từ loại, hình thái từ, các đặc trưng ngôn ngữ cũng mới chỉ được tích hợp vào biểu diễn trên bề mặt từ mà không can thiệp vào bên trong mô hình dịch (11). Do đó, việc tích hợp tri thức ngôn ngữ vào mô hình dịch máy Neural mang lại rất nhiều lợi ích, giúp mô hình biểu diễn nhiều tri thức ngôn ngữ hơn.

1.2. Lịch Sử Phát Triển Dịch Máy và Vai Trò Tri Thức

Theo tầm nhìn trong lĩnh vực dịch máy đã được đề xuất bởi Vauquois vào năm 1968, mục tiêu chính của dịch máy là phân tích một câu nguồn thành một dạng biểu diễn trung gian, tốt nhất là thành một biểu diễn ý nghĩa độc lập ngôn ngữ (gọi là liên ngôn ngữ) và sau đó phát sinh câu đích từ biểu diễn liên ngôn ngữ này. Chiến lược nghiên cứu hướng tới mục tiêu liên ngôn ngữ được bắt đầu với các mô hình dịch từ vựng đơn giản, sau đó chuyển sang các biểu diễn trung gian phức tạp hơn ở cấp độ cú pháp và ngữ nghĩa phụ thuộc vào ngôn ngữ.

II. Vấn Đề Thách Thức Trong Dịch Máy Neural Anh Việt

Mặc dù dịch máy Neural đã có những tiến bộ đáng kể, vẫn còn nhiều thách thức cần giải quyết, đặc biệt là trong việc tích hợp tri thức ngôn ngữ. Các mô hình hiện tại thường gặp khó khăn trong việc xử lý ngữ liệu thưa, tức là khi gặp các từ hoặc cấu trúc ít xuất hiện trong dữ liệu huấn luyện. Bên cạnh đó, nhập nhằng ngôn ngữ, hiện tượng một từ hoặc cụm từ có nhiều nghĩa, cũng là một vấn đề lớn. Các mô hình dịch máy cần có khả năng hiểu và xử lý các sắc thái khác nhau của nghĩa để tạo ra bản dịch chính xác. Việc thiếu tích hợp tường minh tri thức ngôn ngữ từ bên ngoài cũng là một hạn chế lớn, đặc biệt khi huấn luyện trên các ngôn ngữ ít tài nguyên.

2.1. Khó Khăn Với Ngữ Liệu Thưa Trong Dịch Máy Anh Việt

Hiện nay, chúng ta chưa thể thu thập được ngữ liệu song ngữ có thể huấn luyện cho mô hình đạt kết quả dịch cho nhiều ngôn ngữ, nhất là song ngữ liên quan đến ngôn ngữ ít tài nguyên. Ví dụ, nếu trong tiếng Việt có khoảng 40.000 từ và mỗi câu tiếng Việt có độ dài trung bình 20 từ/câu, theo lý thuyết chúng ta sẽ có 40.000^20 = 10^90 câu ứng cử viên (số lượng rất lớn hơn cả số lượng hạt cát trên thế giới ~ 10^17). Do đó mô hình cần có tri thức về ngôn ngữ để có thể suy luận các trường hợp sử dụng đúng của ngôn ngữ.

2.2. Vấn Đề Nhập Nhằng Ngôn Ngữ Thách Thức Lớn Trong NLP

Vấn đề nhập nhằng ngôn ngữ là bản chất của ngôn ngữ cho dù ngôn ngữ đó có ít hay nhiều tài nguyên thì vấn đề vẫn tồn tại cần phải giải quyết. Các hệ thống dịch máy cần có tri thức về ngôn ngữ để có thể suy luận các trường hợp sử dụng đúng của ngôn ngữ. Việc thiếu tích hợp tri thức ngôn ngữ từ bên ngoài cũng là một hạn chế lớn, đặc biệt khi huấn luyện trên các ngôn ngữ ít tài nguyên.

III. Cách Tích Hợp Tri Thức Ngôn Ngữ Phương Pháp Nghiên Cứu

Luận án này tập trung vào việc sử dụng tri thức ngôn ngữ bổ sung để cải thiện các mô hình NMT hiện nay. Nghiên cứu đề xuất sử dụng nhiều loại tri thức ngôn ngữ ở các cấp độ từ vựng, ngữ pháp và ngữ nghĩa nhằm đưa ra các phương pháp tiếp cận phù hợp để tích hợp tri thức ngôn ngữ vào cả giai đoạn huấn luyện và suy luận của các mô hình NMT phổ biến hiện nay gồm Seq2Seq, ConvSeq2SeqTransformer. Cụ thể, luận án nghiên cứu hai phương pháp tích hợp: (1) mô hình tích hợp tri thức ngôn ngữ ở các cấp độ từ vựng, ngữ pháp và ngữ nghĩa cả trong giai đoạn huấn luyện và suy luận; và (2) mô hình tích hợp tri thức ngôn ngữ ở mức tổng quát vào chỉ giai đoạn huấn luyện.

3.1. Tích Hợp Tri Thức Từ Vựng Ngữ Pháp Ngữ Nghĩa

Phương pháp này tập trung vào việc tích hợp tri thức ngôn ngữ ở nhiều cấp độ khác nhau: từ vựng (thông tin về từ, nghĩa của từ), ngữ pháp (cấu trúc câu, quan hệ giữa các từ) và ngữ nghĩa (ý nghĩa của câu, ngữ cảnh sử dụng). Mục tiêu là cung cấp cho mô hình dịch máy thần kinh một cái nhìn toàn diện về ngôn ngữ, giúp nó hiểu sâu hơn về ý nghĩa của câu nguồn và tạo ra bản dịch chính xác hơn.

3.2. Tích Hợp Tri Thức Tổng Quát Trong Giai Đoạn Huấn Luyện

Phương pháp này tập trung vào việc cung cấp cho mô hình dịch máy một lượng lớn tri thức ngôn ngữ tổng quát trong giai đoạn huấn luyện. Điều này có thể được thực hiện bằng cách sử dụng các nguồn dữ liệu bổ sung, chẳng hạn như từ điển, ontology, hoặc các bộ dữ liệu lớn về ngôn ngữ. Mục tiêu là giúp mô hình học được các quy tắc và cấu trúc chung của ngôn ngữ, giúp nó có thể xử lý tốt hơn các trường hợp chưa từng gặp trong dữ liệu huấn luyện.

IV. Tích Hợp Tri Thức Cụm Từ Giải Pháp Chi Tiết Cho Dịch Máy

Việc tích hợp tri thức cụm từ vào mô hình dịch máy có thể cải thiện đáng kể hiệu suất dịch. Các mô hình đề xuất sử dụng các kỹ thuật như phân đoạn cụm từ và cơ chế chú ý vị trí động để nắm bắt mối quan hệ giữa các cụm từ trong câu. Ví dụ, mô hình PhraseAttn sử dụng thông tin về các cụm từ để hướng dẫn quá trình dịch. Nghiên cứu cũng chỉ ra rằng việc tích hợp tri thức cụm từ có thể giúp mô hình xử lý tốt hơn các câu dài và phức tạp.

4.1. Phân Đoạn Cụm Từ Xác Định Đơn Vị Dịch Hiệu Quả

Phân đoạn cụm từ là quá trình chia một câu thành các đơn vị có nghĩa, thường là các cụm từ. Điều này giúp mô hình dịch máy tập trung vào việc dịch các cụm từ thay vì từng từ riêng lẻ, giúp cải thiện tính mạch lạc và tự nhiên của bản dịch. Kỹ thuật này đặc biệt hữu ích trong việc xử lý các thành ngữ hoặc các cụm từ có nghĩa đặc biệt.

4.2. Cơ Chế Chú Ý Vị Trí Động DSA Tập Trung vào Cụm Từ Quan Trọng

Cơ chế chú ý vị trí động (DSA) cho phép mô hình dịch máy tập trung vào các cụm từ quan trọng trong câu nguồn. Bằng cách tự động xác định các vị trí quan trọng trong câu, DSA giúp mô hình dịch chính xác hơn và hiệu quả hơn. DSA có thể được tích hợp vào các kiến trúc dịch máy thần kinh hiện có, như Transformer, để cải thiện hiệu suất dịch.

V. Tri Thức Từ Loại và Ngữ Nghĩa Cải Thiện Độ Chính Xác

Nghiên cứu cũng tập trung vào việc tích hợp tri thức từ loạitri thức ngữ nghĩa vào mô hình dịch máy. Bằng cách sử dụng thông tin về vai trò ngữ pháp của các từ và ý nghĩa của chúng, mô hình có thể hiểu sâu hơn về câu nguồn và tạo ra bản dịch chính xác hơn. Ví dụ, thông tin về từ loại có thể giúp mô hình phân biệt giữa các nghĩa khác nhau của một từ, trong khi tri thức ngữ nghĩa có thể giúp mô hình hiểu được ngữ cảnh sử dụng của từ.

5.1. Tích Hợp Tri Thức Từ Loại Nâng Cao Chất Lượng Dịch

Việc tích hợp tri thức từ loại giúp mô hình dịch máy hiểu rõ hơn về vai trò ngữ pháp của các từ trong câu. Điều này có thể cải thiện đáng kể độ chính xác của bản dịch, đặc biệt là trong các ngôn ngữ có cấu trúc ngữ pháp phức tạp như tiếng Việt. Các mô hình đề xuất sử dụng các kỹ thuật gán nhãn từ loại để cung cấp thông tin về vai trò ngữ pháp của các từ cho mô hình dịch máy thần kinh.

5.2. Tích Hợp Tri Thức Ngữ Nghĩa Trừu Tượng Hướng Đi Mới

Việc tích hợp tri thức ngữ nghĩa trừu tượng, như thông tin về các khái niệm và mối quan hệ giữa chúng, có thể giúp mô hình dịch máy hiểu sâu hơn về ý nghĩa của câu. Điều này có thể dẫn đến các bản dịch chính xác hơn và phù hợp hơn với ngữ cảnh. Các mô hình đề xuất sử dụng các kỹ thuật biểu diễn tri thức dựa trên đồ thị để cung cấp thông tin về ngữ nghĩa cho mô hình dịch máy thần kinh.

VI. Mô Hình Tích Hợp Tri Thức Tổng Quát Hiệu Quả Huấn Luyện

Nghiên cứu cũng khám phá các phương pháp tích hợp tri thức tổng quát vào mô hình dịch máy, tập trung vào giai đoạn huấn luyện. Cơ chế so khớp mô men và các đặc trưng so sánh văn bản được sử dụng để cung cấp thông tin bổ sung cho mô hình trong quá trình học. Kết quả cho thấy rằng việc tích hợp tri thức tổng quát có thể cải thiện hiệu quả huấn luyện và hiệu suất dịch, đặc biệt là trong các trường hợp ngữ liệu thưa.

6.1. Cơ Chế So Khớp Mô Men Tăng Cường Khả Năng Tổng Quát Hóa

Cơ chế so khớp mô men giúp mô hình dịch máy học được các mẫu chung trong dữ liệu huấn luyện. Bằng cách so khớp các mô men của câu nguồn và câu đích, mô hình có thể cải thiện khả năng tổng quát hóa và tạo ra các bản dịch chính xác hơn cho các trường hợp chưa từng gặp.

6.2. Đặc Trưng So Sánh Văn Bản Cung Cấp Thông Tin Bổ Sung

Các đặc trưng so sánh văn bản, như độ tương đồng về ngữ nghĩa và cấu trúc, có thể cung cấp thông tin bổ sung cho mô hình dịch máy trong quá trình huấn luyện. Bằng cách sử dụng các đặc trưng này, mô hình có thể học được các mối quan hệ giữa câu nguồn và câu đích, giúp cải thiện hiệu suất dịch.

VII. Kết Quả Hướng Phát Triển Dịch Máy Neural Anh Việt

Nghiên cứu này đã chứng minh rằng việc tích hợp tri thức ngôn ngữ vào mô hình dịch máy Neural có thể cải thiện đáng kể hiệu suất dịch. Các mô hình đề xuất, sử dụng tri thức cụm từ, từ loại, ngữ nghĩatri thức tổng quát, đã đạt được kết quả tốt trên nhiều cặp ngôn ngữ, bao gồm Anh-Việt. Hướng phát triển trong tương lai bao gồm việc nghiên cứu các tri thức sâu hơn của ngôn ngữ, mở rộng dịch ở cấp độ câu sang cấp độ văn bản, và tăng số lượng ngôn ngữ trong mô hình dịch.

7.1. Tổng Kết Kết Quả Đạt Được Trong Nghiên Cứu

Nghiên cứu đã đánh giá các mô hình đề xuất trên bốn cặp ngôn ngữ, bao gồm Anh - Việt (cặp ngôn ngữ chính), Anh - Đức, Anh - Pháp và Anh - Sóc. Kết quả thực nghiệm trên các cặp ngôn ngữ khác nhau chứng minh rằng các mô hình NMT có tích hợp tri thức ngôn ngữ cho chất lượng dịch tự động tốt hơn nhờ khả năng mô hình hóa một cách tường minh các khía cạnh ngữ pháp và ngữ nghĩa của ngôn ngữ.

7.2. Hướng Phát Triển Tiềm Năng Cho Dịch Máy Neural

Các hướng phát triển trong tương lai của luận án bao gồm: nghiên cứu các tri thức sâu hơn của ngôn ngữ, mở rộng dịch ở cấp độ câu sang cấp độ văn bản (dịch máy cấp độ văn bản), mở rộng số lượng ngôn ngữ trong mô hình dịch (dịch máy đa ngữ).

27/05/2025
Luận án tiến sĩ khoa học máy tính xây dựng mô hình tích hợp tri thức ngôn ngữ trong dịch máy mạng neural anh việt

Trích đoạn nội dung tài liệu

CHƯƠNG 1 GIỚI THIEU Chương một trình bày tổng quát về động cơ nghiên cứu, tóm tắt về các vấn đề tồn tại trong việc tích hợp tri thức vào dịch máy mạng neural, đề ra các mục tiêu/phạm vi nghiên cứu cũng như các đóng góp của luận án và bố cục của luận án.1 Động cơ nghiên cứu Các mạng neural đã rất nhanh chóng trở thành hướng tiếp cận thống trị cho hầu hết các tác vụ trong lĩnh vực trí tuệ nhân tạo, bao gồm cả dịch máy. So với các hướng tiếp cận truyền thống trước đây, các mô hình dịch máy mạng neural được huấn luyện theo kiểu end2end sử dụng một cơ chế đơn giản nhưng hiệu quả. Tuy nhiên, sự đơn giản này gây ra rất nhiều khó khăn khi cần phải can thiệp vào bên trong mô hình dịch. Không giống như các hệ thống dịch máy truyền thống được chia ra thành các mô-đun chuyên biệt phục vụ cho một tac vụ con cụ thể, các hệ thống dịch máy mạng neural huấn luyện trên các mạng neural rất lớn được tối ưu trên toàn bộ tác vụ dịch máy.

Ví dụ, các hệ thống dịch 1 máy thống kê có các thành phần phụ để xử lý sự lưu loát |2| (còn gọi là mô hành ngôn ngữ), phát sinh từ [3] (còn gọi là mô hành dich), sắp xếp từ HÌ. hình thái từ và tích hợp đặc trưng để mô hình hóa các hiện tượng ngôn ngữ khác nhau l6]: Trên khía cạnh khác, các hệ thống dịch máy mạng neural chỉ bao gồm một mô hình đơn dựa trên kiến trúc mã hóa-giải mã và cơ chế chú ý. Mặc dù có cấu tạo đơn giản hơn, các hệ thống dịch máy mạng neural đã vượt qua các hệ thống dịch máy thống kê chỉ sau một vài năm phát triển (7). Đánh giá của con người và phân tích kết quả dịch cho thấy rằng sự vượt trội có được nhờ vào việc các hệ thống dịch máy mang neural cho ra kết quả trôi chảy hơn các hệ dịch may thống kê (3).

Theo tầm nhìn trong lĩnh vực dich máy đã được đề xuất bởi Vauquois vào năm 1968 (Hình 1.1), mục tiêu chính của dịch máy là phân tích một câu nguồn thành một dạng biểu diễn trung gian, tốt nhất là thành một biểu diễn ý nghĩa độc lập ngôn ngữ (gọi là liên ngôn ngữ) và sau đó phát sinh câu đích từ biểu diễn liên ngôn ngữ này. Chiến lược nghiên cứu hướng tới mục tiêu liên ngôn ngữ được bắt đầu với các mô hình dịch từ vựng đơn giản, sau đó chuyển sang các biểu diễn trung gian phức tạp hơn ở cấp độ cú pháp và ngữ nghĩa phụ thuộc vào ngôn ngữ. Trước khi có dịch máy mạng neural, lĩnh vực dịch máy thống kê đã đạt được rất nhiều thành tựu với hướng phát triển được đề xuất bởi Vauquois với các mô hình có tích hợp tri thức ngôn ngữ. Các tác giả Koehn va Hoang |ð| đã trình bay một mô hình dịch được gia tố với các yêu tố tri thức ngôn ngữ dựa trên mô hình dịch máy thống kê truyền thống (3).

Các mô hình dịch máy cần phải dat được hai mục tiêu lớn: giải quyết vấn đề ngữ liệu thưa, đặc biệt có hiệu quả khi xử lý các từ không có trong tập từ vựng (các từ có tần số xuất hiện thấp); và giải quyết vấn đề nhập nhằng ngôn ngữ, qua đó làm tăng khả năng tổng quát hóa của mô hình. Trong các vấn đề trên, vấn đề về ngữ liệu thưa 2 Ngữ nghĩa Ngôn ngữ Ngôn ngữ nguon dich Hình 1.1: Các cấp độ tri thức ngôn ngữ. có thể được xem là vấn đề đơn giản hơn chỉ xuất hiện trong các ngôn ngữ ít tài nguyên và theo lý thuyết có thể được giải quyết khi có nguồn ngữ liệu lớn. Tuy nhiên, vấn đề nhập nhằng ngôn ngữ là bản chất của ngôn ngữ cho dù ngôn ngữ đó có ít hay nhiều tài nguyên thì vấn đề vẫn tồn tại cần phải giải quyết.

Các hệ thống dịch máy thống kê tốt nhất hiện nay cho các cặp ngôn ngữ phổ biến như Anh-Hoa và Anh-Đức đều là mô hình dựa trên cú pháp [i0]. Đối với các mô hình dựa trên cú pháp, trong quá trình dịch, mô hình cũng sẽ xây dựng các cấu trúc cú pháp của câu kết quả. Do sự thành công của các mô hình dịch dựa trên cú pháp, đã có rất nhiều nỗ lực để xây dựng các mô hình dịch có thể mô hình hóa sâu hơn các thông tin ngữ nghĩa của ngôn ngữ. Mặc dù tốt hơn hắn so với các hệ thống dịch máy thống kê, các hệ thống dịch máy mạng neural lại không có khả năng tích hợp tri thức ngôn ngữ một cách tường minh từ bên ngoài dẫn đến việc mô hình các tri thức ngôn ngữ không được tốt khi mô hình được huấn luyện trên các ngôn ngữ ít tài nguyên.

Các hệ dich mấy mang neural xem quá trình dịch như là một tác vụ dịch end2end nhằm biểu diễn một chuỗi từ trong 3 ngôn ngữ này sang ngôn ngữ khác. Ngay cả khi được tích hợp các đặc trưng ngôn ngữ như từ loại, hình thái từ., các đặc trưng ngôn ngữ cũng mới chỉ được tích hợp vào biểu diễn trên bề mặt từ mà không can thiệp vào bên trong mô hình dịch (11). Tuy nhiên, với sự thành công của dịch máy thống kê trong quá trình tích hợp tri thức ngôn ngữ, dịch máy mạng neural hiện đang chỉ xử lý trên bề mặt từ sẽ sớm tiến đến xử lý ở cấp độ cụm từ và cao hơn nữa là cấp độ cú pháp và ngữ nghĩa bằng cách tích hợp các tri thức ngôn ngữ vào mô hình dịch (12). Việc tích hợp tri thức ngôn ngữ vào mô hình dịch máy mang neural mang lại rất nhiều lợi ích: 1.

Tích hợp tri thúc giúp mô hành biếu diễn được nhiều tri thức ngôn ngữ: Ngoài việc nhận định các mô hình dịch sẽ sớm tiến đến xử lý ở cấp độ cụm từ và cao hơn nữa là cấp độ cú pháp và ngữ nghĩa bằng cách tích hợp các tri thức ngôn ngữ vào mô hình dịch [I2]. Philipp Koehn cũng nhận định rằng tầm nhìn lâu dài cho nghiên cứu dịch máy là phát triển các phương pháp sử dụng các biểu diễn ngôn ngữ sâu hơn cho các giai đoạn xử lý. Tích hợp tri thúc giúp giải quyét van đề ngữ liệu thưa: Hiện nay, chúng ta chưa thể thu thập được ngữ liệu song ngữ có thể huấn luyện cho mô hình đạt kết quả dịch cho nhiều ngôn ngữ, nhất là song ngữ liên quan đến ngôn ngữ ít tài nguyên. Ví dụ, nếu trong tiếng Việt có khoảng 40.000 từ và mỗi câu tiếng Việt có độ dài trung bình 20 từ/câu, theo lý thuyết chúng ta sẽ có 40.0002 = 10% câu ứng cử viên (số lượng rất lớn hơn cả số lượng hat cát trên thế giới ~ 107").

Các câu ứng cử viên này sẽ được chọn lọc lại thông qua các tri thức về ngôn ngữ (ví dụ, các câu đúng ngữ pháp). Số lượng các câu này là cực kỳ lớn ( 10*°) do đó chúng ta sẽ không thể thu thập được tất cả các câu cần thiết để huấn luyện mô hình mạng 4 neural sâu. Ngoài ra, có cả những câu đúng ngữ pháp nhưng lại chưa được sử dụng phổ biến tại thời điểm thu thập (bản chất ngôn ngữ luôn thay đổi), do đó mô hình dịch cần có tri thức về ngôn ngữ để có thể suy luận các trường hợp sử dụng đúng của ngôn ngữ. Tích hợp trì thúc giúp giải quyét van đề nhập nhằng ngôn ngữ: Vấn đề ngữ liệu thưa về lý thuyết có thể được xử lý thông qua việc tăng cường thu thập ngữ liệu, nhưng vấn đề nhập nhằng ngôn ngữ là bản chất của ngôn ngữ cho dù lượng ngữ liệu có thu thập được nhiều bao nhiêu thì vấn đề nhập nhằng vẫn tồn tại.

Nếu mô hình có các thông tin bổ sung của ngôn ngữ như nhãn từ loại, quan hệ cú pháp hay ngữ nghĩa, mô hình có thể dựa trên các thông tin này để lựa chọn từ phù hợp trong quá trình dịch. Qua khảo sát các hướng nghiên cứu, sự phát triển của dịch mấy mạng neural và lợi ích của việc tích hợp tri thức ngôn ngữ vào dịch máy, luận án nhận thấy rất cần thiết để có các công trình nghiên cứu xây dựng mô hình tích hợp tri thức ngôn ngữ cho dịch mấy mạng neural.2 Van đề của dịch máy mang neural Thử thách lớn nhất của các mô hình dịch máy là giải quyết vấn đề nhập nhằng của ngôn ngữ H. Thông thường, ngôn ngữ tự nhiên có sự nhập nhằng ở mỗi cấp độ: nghĩa của từ, cụm từ, vai trò cú pháp và mối quan hệ ngữ nghĩa giữa các thành phần khác nhau trong văn ban. Con người có thể giải quyết phần nào sự mơ hồ này bằng cách xem xét bối cảnh rộng hơn và kết hợp với kiến thức nền tảng, nhưng ngay cả con người cũng có khi không hiểu rõ vấn đề văn bản đang đề cập.21 Van đề nhập nhằng ở cấp độ từ O cấp độ từ, vấn đề nhập nhằng ngôn ngữ xảy ra khi một số từ có những ý nghĩa khác nhau nếu được sử dụng trong ngữ cảnh khác nhau.

Hãy xem xét các câu ví dụ bằng tiếng Anh sau: e He deposited money in a bank account with a high interest rate. e Sitting on the bank of the Mississippi, a passing ship piqued his interest. Cac từ bank va interest có các ý nghĩa khác nhau trong hai câu trên. Từ bank có thể có nghĩa là bờ của một con sông hoặc một tổ chức tai chính, trong khi interest có nghĩa là sự tò mò hoặc là một khoản phí được tính cho một khoản vay (ý nghĩa về tài chính).

Để phân biệt được nghĩa của các từ đa nghĩa, con người hoặc máy tính đều phải xem xét các từ xung quanh (ngữ cảnh) và ý nghĩa toàn bộ câu. Trong các ví dụ trên, từ rate theo sau từ interest là một dấu hiệu rất rõ ràng trong ngữ cảnh đang xét.2 Van đề nhập nhằng ở cấp độ cụm từ GO cấp độ cụm từ, vấn đề nhập nhằng ngôn ngữ xảy ra khi có những từ không thể hiện được đúng ý nghĩa khi ở cạnh những từ đặc biệt khác. Hay nói cách khác, nghĩa của từ khi được đặt trong một cụm từ đặc biệt, phải được dịch khác với nghĩa thông thường (nghĩa đen). Ví dụ rõ ràng nhất cho điều này là các cụm từ thành ngữ như thành ngữ tiếng Anh “It’s raining cats and dogs” sẽ không được dịch đúng nghĩa nếu dịch theo kiểu dịch từng từ.

Xét câu tiếng Việt “Có tiền mua tiên cũng được” 6 cũng không thể được dịch từng từ một “Money can even buy a fairy” nhưng phải được dịch theo một nghĩa có thể hiểu được là “Money can make many things”.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu có tiêu đề Mô Hình Tích Hợp Tri Thức Ngôn Ngữ Trong Dịch Máy Neural Anh-Việt trình bày một phương pháp tiên tiến trong lĩnh vực dịch máy, đặc biệt là giữa tiếng Anh và tiếng Việt. Mô hình này không chỉ sử dụng các kỹ thuật học sâu mà còn tích hợp tri thức ngôn ngữ để cải thiện độ chính xác và tính tự nhiên của bản dịch. Một trong những điểm nổi bật của nghiên cứu là khả năng xử lý ngữ nghĩa và ngữ cảnh, giúp cho việc dịch trở nên mượt mà hơn và gần gũi với người dùng.

Độc giả sẽ tìm thấy nhiều lợi ích từ tài liệu này, bao gồm việc hiểu rõ hơn về cách mà các mô hình dịch máy hiện đại hoạt động và cách chúng có thể được cải thiện thông qua việc tích hợp tri thức ngôn ngữ. Để mở rộng thêm kiến thức, bạn có thể tham khảo tài liệu liên quan như Luận văn thạc sĩ khoa học máy tính ứng dụng học sâu vào dịch từ vựng mà không cần dữ liệu song ngữ, nơi cung cấp cái nhìn sâu sắc về ứng dụng của học sâu trong dịch thuật mà không cần dữ liệu song ngữ. Những tài liệu này sẽ giúp bạn có cái nhìn toàn diện hơn về các xu hướng và công nghệ trong lĩnh vực dịch máy.