Luận văn thạc sĩ: Phân tách cụm danh từ cơ sở tiếng Việt sử dụng mô hình CRFs

Luận văn thạc sĩ VNU UET phân tách cụm danh từ cơ sở tiếng Việt bằng mô hình CRFs, nghiên cứu và ứng dụng trong xử lý ngôn ngữ tự nhiên.

Trường đại học

Trường Đại học Công nghệ

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

Luận văn thạc sĩ

2010

55
3
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

TÓM TẮT NỘI DUNG

LỜI CAM ĐOAN

DANH MỤC BẢNG SỐ LIỆU

DANH MỤC HÌNH VẼ

LỜI MỞ ĐẦU

1. CHƯƠNG 1: KHÁI QUÁT VỀ BÀI TOÁN PHÂN TÁCH CỤM DANH TỪ CƠ SỞ

1.1. Giới thiệu bài toán

1.2. Một số nghiên cứu về bài toán phân tách cụm danh từ cơ sở

1.3. Một số phương pháp biểu diễn dữ liệu

1.4. Một số phương pháp giải quyết bài toán

2. CHƯƠNG 2: MÔ HÌNH TRƯỜNG NGẪU NHIÊN CÓ ĐIỀU KIỆN

2.1. Mô hình đồ thị

2.2. Mô hình đồ thị vô hướng

2.3. Mô hình trường ngẫu nhiên có điều kiện

2.4. Ước lượng tham số và suy diễn CRFs

2.5. Ước lượng tham số cho CRFs

2.6. Suy diễn CRFs

3. CHƯƠNG 3: ĐẶC ĐIỂM CỤM DANH TỪ TIẾNG VIỆT VÀ PHƯƠNG PHÁP XÂY DỰNG TẬP DỮ LIỆU

3.1. Đặc điểm cụm danh từ tiếng Việt

3.2. Phương pháp xây dựng tập dữ liệu

3.3. Phương pháp xây dựng tập dữ liệu tiếng Anh

3.4. Phương pháp xây dựng tập dữ liệu Tiếng Việt

4. CHƯƠNG 4: BÀI TOÁN PHÂN TÁCH CỤM DANH TỪ TIẾNG VIỆT SỬ DỤNG MÔ HÌNH CRFs

4.1. Phân tách cụm từ tiếng Việt sử dụng mô hình CRFs

4.2. Dữ liệu và chương trình

4.3. Kết quả thử nghiệm

4.3.1. Thực nghiệm 1: Đánh giá sự phục thuộc tập thuộc tính

4.3.2. Đánh giá sự phụ thuộc của kích thước tập dữ liệu huấn luyện

4.3.3. Đánh giá và phân tích lỗi

TÀI LIỆU THAM KHẢO

PHỤ LỤC: TẬP NHÃN TỪ LOẠI VÀ NHÃN CÚ PHÁP TRONG VIET TREEBANK

Phụ lục 1. Tập nhãn từ loại

Phụ lục 2. Tập nhãn cú pháp

Phụ lục 3. Tập nhãn mệnh đề

Phụ lục 4. Tập nhãn chức năng cú pháp

Tóm tắt

I. Tổng quan về phân tách cụm danh từ cơ sở tiếng Việt

Phân tách cụm danh từ cơ sở tiếng Việt là một trong những bài toán quan trọng trong lĩnh vực xử lý ngôn ngữ tự nhiên. Bài toán này không chỉ giúp cải thiện khả năng hiểu ngôn ngữ của máy tính mà còn hỗ trợ nhiều ứng dụng thực tiễn như dịch máy, tìm kiếm thông tin và phân tích cú pháp. Việc phân tách cụm danh từ giúp xác định các cụm từ có liên quan trong câu, từ đó nâng cao độ chính xác trong các ứng dụng xử lý ngôn ngữ.

1.1. Định nghĩa và vai trò của cụm danh từ

Cụm danh từ là một nhóm từ có chức năng như một danh từ trong câu. Chúng thường bao gồm một danh từ chính và các từ bổ nghĩa. Việc phân tách cụm danh từ giúp nhận diện các thành phần ngữ pháp, từ đó hỗ trợ cho các ứng dụng như dịch máy và phân tích cú pháp.

1.2. Tình hình nghiên cứu hiện tại

Hiện nay, nghiên cứu về phân tách cụm danh từ cơ sở tiếng Việt còn hạn chế. Hầu hết các nghiên cứu tập trung vào tách từ và gán nhãn từ loại. Việc phát triển các phương pháp phân tách cụm danh từ vẫn đang trong giai đoạn thử nghiệm và chưa có nhiều công trình công bố rộng rãi.

II. Thách thức trong phân tách cụm danh từ tiếng Việt

Phân tách cụm danh từ tiếng Việt gặp nhiều thách thức do đặc điểm ngôn ngữ. Tiếng Việt có cấu trúc ngữ pháp phức tạp và tính không gian ngữ nghĩa cao. Điều này làm cho việc xác định các cụm danh từ trở nên khó khăn hơn so với các ngôn ngữ khác như tiếng Anh.

2.1. Đặc điểm ngôn ngữ tiếng Việt

Tiếng Việt là ngôn ngữ đơn lập, nghĩa là các từ không thay đổi hình thức để biểu thị ngữ pháp. Điều này dẫn đến việc các cụm danh từ có thể không rõ ràng, gây khó khăn trong việc phân tách.

2.2. Khó khăn trong việc xây dựng tập dữ liệu

Việc xây dựng tập dữ liệu cho bài toán phân tách cụm danh từ tiếng Việt gặp khó khăn do thiếu nguồn dữ liệu chuẩn. Các nghiên cứu hiện tại chủ yếu dựa vào dữ liệu tự tạo, điều này ảnh hưởng đến độ chính xác của các mô hình.

III. Phương pháp sử dụng mô hình CRFs trong phân tách cụm danh từ

Mô hình CRFs (Conditional Random Fields) là một trong những phương pháp hiệu quả nhất cho bài toán phân tách cụm danh từ. Mô hình này cho phép học từ dữ liệu và đưa ra dự đoán chính xác hơn về các cụm danh từ trong câu.

3.1. Nguyên lý hoạt động của mô hình CRFs

Mô hình CRFs hoạt động dựa trên nguyên lý xác suất có điều kiện, cho phép mô hình hóa mối quan hệ giữa các từ trong câu. Điều này giúp cải thiện độ chính xác trong việc phân tách các cụm danh từ.

3.2. Lợi ích của việc sử dụng CRFs

Sử dụng mô hình CRFs giúp giảm thiểu lỗi trong việc phân tách cụm danh từ. Mô hình này có khả năng học từ các đặc điểm ngữ nghĩa và ngữ pháp của tiếng Việt, từ đó nâng cao hiệu quả phân tách.

IV. Ứng dụng thực tiễn của phân tách cụm danh từ cơ sở

Phân tách cụm danh từ cơ sở có nhiều ứng dụng thực tiễn trong các lĩnh vực như tìm kiếm thông tin, dịch máy và phân tích cú pháp. Việc áp dụng các phương pháp phân tách cụm danh từ giúp cải thiện độ chính xác và hiệu quả của các hệ thống xử lý ngôn ngữ tự nhiên.

4.1. Ứng dụng trong tìm kiếm thông tin

Trong hệ thống tìm kiếm thông tin, việc phân tách cụm danh từ giúp cải thiện khả năng tìm kiếm tài liệu chính xác hơn. Hệ thống có thể tìm kiếm dựa trên các cụm từ thay vì từ đơn lẻ.

4.2. Ứng dụng trong dịch máy

Phân tách cụm danh từ cũng rất quan trọng trong dịch máy. Các cụm danh từ được phân tách chính xác sẽ giúp hệ thống dịch máy hiểu rõ hơn về ngữ nghĩa của câu, từ đó cải thiện chất lượng bản dịch.

V. Kết luận và triển vọng tương lai của nghiên cứu

Nghiên cứu về phân tách cụm danh từ cơ sở tiếng Việt sử dụng mô hình CRFs đang mở ra nhiều triển vọng mới. Việc phát triển các công cụ và tập dữ liệu chuẩn sẽ giúp nâng cao độ chính xác và hiệu quả của các hệ thống xử lý ngôn ngữ tự nhiên trong tương lai.

5.1. Tương lai của nghiên cứu phân tách cụm danh từ

Trong tương lai, cần tiếp tục nghiên cứu và phát triển các phương pháp mới để cải thiện độ chính xác trong phân tách cụm danh từ. Việc xây dựng bộ dữ liệu chuẩn cũng là một yếu tố quan trọng.

5.2. Định hướng phát triển công nghệ

Công nghệ xử lý ngôn ngữ tự nhiên sẽ tiếp tục phát triển, mở ra nhiều cơ hội mới cho việc ứng dụng trong các lĩnh vực khác nhau. Việc áp dụng các mô hình học máy tiên tiến sẽ giúp nâng cao hiệu quả trong phân tách cụm danh từ.

22/07/2025
Luận văn thạc sĩ vnu uet phân tách cụm danh từ cơ sở tiếng việt sử dụng mô hình crfs

Trích đoạn nội dung tài liệu

Chương 1: Khái quát về bài toán phân tách cụm danh từ cơ sở 1. Giới thiệu bài toán Trong những năm gần đây, nhiều ứng dụng xử lý ngôn ngữ tự nhiên như trích chọn thông tin, tóm tắt văn bản, hỏi đáp và dịch máy phát triển mạnh mẽ đem lại nhiều lợi ích thiết thực. Trong các ứng dụng này, cụm danh từ cơ sở đóng một vai trò quan trọng. Chính vì vậy, ngay từ những năm 1990, đã có nhiều nghiên cứu liên quan đến lĩnh vực này trên tiếng Anh và cho đến nay các nghiên cứu đó vẫn liên tục được cải tiến và đã đạt được một số kết quả khả quan nhất định.

Các ngôn ngữ khác như tiếng Trung, tiếng Hàn Quốc, tiếng Ấn Độ … cũng rất được quan tâm và nghiên cứu khá nhiều. Nhiều công trình nghiên cứu và bài báo khoa học liên quan đến vấn đề này đã được công bố, điển hình phải kể đến hai hội nghị: Hội nghị về xử lý ngôn ngữ tự nhiên CoNLL1 năm 2000 với chủ đề chính là phân tách cụm từ và phân tách cụm danh từ; Hội nghị về phân tích sơ bộ các ngôn ngữ Nam Á SPSAL 2007 2. Đối với tiếng Việt, hiện nay hầu hết các nhà nghiên cứu mới chỉ tập trung vào bài toán tách từ và gán nhãn từ loại. Phân tách cum danh từ cơ sở tiếng Việt vẫn còn là bài toán mở.

Các nghiên cứu về bài toán này rất ít và mới chỉ dừng ở mức thử nghiệm quy mô nhỏ, chưa được công bố rộng rãi. Phân tách các cụm từ là bài toán chia một câu thành các cụm sao cho các từ trong cùng một cụm có liên quan với nhau về mặt cú pháp. Các cụm này không chồng lên nhau (non-overlapping) theo nghĩa một từ chỉ được phép thuộc một cụm duy nhất. Ví dụ câu tiếng Anh dưới đây sẽ được tách thành các cụm như sau: [NP He] [VP reckons] [NP the current account deficit] [VP will narrow] [PP to] [NP only £ 1.8 billion] Hoặc một câu tiếng Việt sẽ được tách thành các cụm như sau: [NP Cô ấy] [VP học] [PP ở] [NP trường Đại học Công nghệ] Ở đây, các cụm được biểu diễn như một nhóm các từ liền kề nhau nằm giữa hai dấu ngoặc vuông: Dấu ngoặc vuông mở biểu thị bắt đầu một cụm; Dấu ngoặc vuông đóng biểu thị kết thúc một cụm.

Các chữ viết hoa liền sau dấu ngoặc vuông mở là kí hiệu viết tắt biểu thị loại của các cụm, ví dụ NP là cụm danh từ, VP là cụm động từ, PP là cụm giới từ. Trong các loại cụm thì cụm danh từ chiếm tỷ lệ lớn nhất, tập dữ liệu 1 http://www.be/conll2000/ 2 http://shiva.in/SPSAL2007/ LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 4 tiếng Anh WSJ 15-18 có tới 51% là cụm danh từ [12]. Hơn nữa, trong nhiều ứng dụng xử lý ngôn ngữ tự nhiên, việc tách các cụm danh từ là bước trung gian quan trọng để xử lý các bước tiếp theo. Vì vậy, phân tách cụm danh từ cũng đóng vai trò quan trọng trong xử lý ngôn ngữ tự nhiên.

Phân tách cụm danh từ là một phần của bài toán phân tách cụm từ, giải quyết việc nhận biết các cụm danh từ không đệ quy (non-recursive noun phrase) hay cụm danh từ không chồng nhau (non-overlappling noun phrase) trong câu. Các cụm danh từ được phân tách ở đây là các cụm danh từ đơn giản, hay cụm danh từ cơ sở. Đó là các cụm danh từ không đệ quy, tức là không chứa một cụm danh từ khác bên trong nó và không chứa thành phần bổ nghĩa là một cụm danh từ. Trong khuôn khổ luận văn này, tôi chỉ tập trung giải quyết bài toán tách cụm danh từ cơ sở tiếng Việt.

Tuy nhiên, do các đặc trưng ngôn ngữ của tiếng Việt nên cấu trúc của cụm danh từ cơ sở tiếng Việt sẽ khác cấu trúc cụm danh từ đơn giản trong các xử lý trích cụm danh từ tiếng Anh. Đặc trưng và cấu trúc cụm danh từ cơ sở tiếng Việt sẽ được trình bày kỹ ở Chương 3. Một hệ thống phân tách cụm danh từ cơ sở tốt có thể được áp dụng trong nhiều bài toán như:  Trong hệ thống tìm kiếm thông tin, thay vì tìm kiếm tài liệu chứa các từ riêng lẻ, hệ thống sẽ tìm kiếm dựa vào các cụm từ. Khi đó một số cụm từ và danh từ riêng sẽ rất hữu ích cho mục đích tìm kiếm tài liệu.

Phân tách các cụm từ cũng rất hữu ích cho các bài toán trích chọn thông tin, máy hỏi-đáp.  Hệ thống dịch máy dựa vào thống kê có thể gồm các hệ con có nhiệm vụ dịch các cụm như cụm danh từ, cụm động từ, cụm giới từ,… như một tác vụ nhỏ trong quá trình dịch. Hệ dịch con có thể được huấn luyện trên tập dữ liệu học là các cụm danh từ, cụm động từ, cụm giới từ,… Với hệ dịch máy sử dụng tập dữ liệu huấn luyện song song, các cụm danh từ cũng được sử dụng để gióng hàng văn bản. Các câu trong tập dữ liệu song song được gióng hàng bằng cách sử dụng các thông tin cụm từ và liên kết cụm ở ngôn ngữ nguồn với cụm ở ngôn ngữ đích.

 Phân tách cụm danh từ có thể được sử dụng như một bước tiền xử lý trước khi phân tích cả câu. Vì ngôn ngữ tự nhiên có tính nhập nhằng cao nên việc phân tích một câu có thể trở nên rất phức tạp. Trong những trường hợp này, phân tách cụm từ có thể được sử dụng như một bước tiền xử lý giải quyết những nhập nhằng này. LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 5  Xác định đồng tham chiếu là bài toán xác định các cụm danh từ cùng tham chiếu tới một thực thể nào đó.

Xác định đồng tham chiếu là một trong những nghiên cứu cốt lõi trong xử lý ngôn ngữ tự nhiên, đóng vai trò quan trọng trong các lĩnh vực như máy hỏi-đáp, dịch tự động, tóm tắt văn bản. Để giải quyết bài toán phải qua nhiều bước, nhưng bước quan trọng đầu tiên là phải xác định được các cụm danh từ trong từng câu. Vì vậy, phân tách cụm danh từ là bài toán cơ sở để xác định tham chiếu trong văn bản.  Trong hệ thống tự động sinh chỉ mục các thuật ngữ cho một cuốn sách, bước đầu tiên là phải xác định được các thuật ngữ để đánh chỉ mục.

Các thuật ngữ này thường là danh từ hoặc cụm danh từ. Do đó, bài toán phát hiện và phân tách cụm danh từ sẽ là một bước quan trọng trong quá trình sinh chỉ mục tự động. Một số nghiên cứu về bài toán phân tách cụm danh từ cơ sở Năm 1991, Stenven Abney đã đề xuất bài toán phân tích một câu đầu vào thành các cụm từ trong đó các từ trong cùng một cụm tương liên với nhau [7]. Nghiên cứu của tác giả dựa vào kết quả nghiên cứu của hai nhà tâm lý học Gee và Grojean (1983), theo đó các cụm là những quãng ngắt khi đọc một câu.

Giả sử khi đọc một câu, ta không đọc liền mạch cả câu đó mà sẽ ngắt ra thành các cụm như sau: [I begin] [with an intuition] : [when I read] [a sentence], [I read it] [a chunk] [at a time] Những cụm này được gọi là cụm . Cụm  điển hình gồm một từ nội dung, xung quanh là các từ chức năng. Từ chức năng (function word) là những từ chứa ít nghĩa từ vựng hoặc nhập nhằng về ngữ nghĩa nhưng nó diễn tả quan hệ ngữ pháp với các từ khác trong một câu như giới từ, đại từ, …); Những từ không phải là từ chức năng được gọi là từ nội dung (content word). Sau Abney, một số nghiên cứu khác tập trung chủ yếu vào phát hiện các cụm danh từ ở mức thấp, thường là trích chọn các thuật ngữ (Bourigault 1992, Voutilainen 1993) (theo [19]) bằng cách sử dụng văn phạm.

Phải đến năm 1995 khi Lance Ramshaw và Mitch Marcus đề xuất phương pháp phân tách cụm từ bằng phương pháp học máy thì bài toán này mới được biết đến rộng rãi và được nhiều nhà khoa học quan tâm. Phương pháp học máy dựa vào biến đổi (Transformation-Based Learning - TBL) được Ramshaw và Marcus sử dụng và đem lại kết quả khả quan với F1 bằng 92. Hai tác giả cũng xây dựng bộ dữ liệu chuẩn tiếng Anh mà hầu hết các nghiên cứu sau này thường sử dụng để so sánh, đánh giá kết quả. Ba nhà nghiên cứu Abney, Ramshaw, Marcus được coi là những người đi tiên phong trong vấn đề này.

LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 6 Sau nghiên cứu của Ramshaw và Marcus, nhiều nhà nghiên cứu khác đã đi sâu tìm hiểu, giải quyết bài toán, trong đó phải kể tới hội nghị CONLL-2000 tập trung về phân tách cụm danh từ và các loại cụm từ khác. Nhiều phương pháp học máy khác nhau đã được sử dụng để thử nghiệm và thu được kết quả khá tốt. Có thể được chia thành bốn nhóm phương pháp: phương pháp học dựa vào luật, học dựa vào bộ nhớ, học thống kê và các hệ thống kết hợp. Một số kỹ thuật mới được phát triển gần đây như mô hình trường ngẫu nhiên có điều kiện (Conditional Random Fields, CRFs), phương pháp học cấu trúc, học bán giám sát,… cũng đã được áp dụng, phát triển.

Mặc dù đã được nghiên cứu trong gần hai mươi năm qua nhưng đến nay nhiều nhà nghiên cứu vẫn quan tâm và tìm cách cải tiến. Điều này chứng tỏ sự cần thiết và tầm quan trọng của một hệ thống phân tách cụm từ danh từ nói riêng và các cụm từ nói chung. Một số kết quả tốt nhất cho bài toán phân tách cụm danh từ cơ sở tiếng Anh được biểu diễn trong bảng 1. Bảng 1: Một số kết quả bài toán phân tách cụm danh từ cơ sở tiếng Anh Tác giả Phương pháp F1 Hieu, Minh 2006 [25] Trường ngẫu nhiên có điều kiện 96.74 Kudo, Matsumoto 2001 [34] Máy vector hỗ trợ 95.77 Sang 2000 [13] Kết hợp các phương pháp 94.90 Sha, Pereira 2003 [31] Trường ngẫu nhiên có điều kiện 94.38 Với các ngôn ngữ khác, hầu hết kết quả tách cụm danh từ thấp hơn khá nhiều so với tiếng Anh, do mỗi ngôn ngữ có những đặc trưng và khó khăn riêng.

Ngôn ngữ Trung Quốc đạt kết quả cao khi sử dụng phương pháp máy vector hỗ trợ và mô hình trường ngẫu nhiên có điều kiện [15]. Ba ngôn ngữ của Ấn Độ là Bengali, Hindi và Telugu đạt kết quả phân tách cụm từ cao nhất khi sử dụng phương pháp CRFs [10]. Ngôn ngữ Hàn Quốc cũng đạt kết quả rất cao với CRFs khi phân tách cụm danh từ cơ sở. Một số kết quả phân tách cụm danh từ của các ngôn ngữ khác được biểu diễn trong bảng 2.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ