Luận Văn Thạc Sĩ: Ứng Dụng AdaBoost Cho Bài Toán Gán Nhãn Ngữ Nghĩa Nông

Luận văn thạc sĩ VNU UET nghiên cứu ứng dụng Adaboost trong bài toán gán nhãn ngữ nghĩa nông, mang lại giải pháp hiệu quả cho xử lý ngôn ngữ.

Chuyên ngành

Công Nghệ Thông Tin

Người đăng

Ẩn danh

Thể loại

Luận Văn Thạc Sĩ

2015

66
2
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CAM ĐOAN

LỜI CẢM ƠN

1. CHƯƠNG 1: TỔNG QUAN VỀ GÁN NHÃN VAI TRÒ NGỮ NGHĨA

1.1. Các phương pháp tiếp cận bài toán gán nhãn vai trò ngữ nghĩa

1.1.1. Tiếp cận theo luật

1.1.2. Tiếp cận theo phương pháp thống kê

1.2. Tổng quan về hệ thống gán nhãn vai trò ngữ nghĩa

1.2.1. Định nghĩa gán nhãn vai trò ngữ nghĩa nông

1.2.2. Kho ngữ liệu PropBank

1.2.3. Kiến trúc tổng quát của hệ thống gán nhãn vai trò ngữ nghĩa

1.2.4. Ứng dụng của gán nhãn vai trò ngữ nghĩa trong xử lý ngôn ngữ tự nhiên

1.2.4.1. Trích rút thông tin
1.2.4.2. Hệ thống hỏi đáp

1.2.5. Kết luận chương 1

2. CHƯƠNG 2: PHƯƠNG PHÁP HỌC MÁY ADABOOST

2.1. Tổng quan về bài toán phân loại

2.2. Bài toán phân loại

2.3. Một số phương pháp phân loại nổi tiếng

2.4. Phương pháp mô hình AdaBoost

2.4.1. Phương pháp Boosting

2.4.2. Phương pháp Adaboost

2.5. Kết luận chương 2

3. CHƯƠNG 3: ỨNG DỤNG PHƯƠNG PHÁP ADABOOST CHO BÀI TOÁN GÁN NHÃN VAI TRÒ NGỮ NGHĨA

3.1. Mô tả bài toán gán nhãn vai trò ngữ nghĩa nông

3.2. Thu thập và chuẩn bị dữ liệu

3.3. Công cụ Swirl

3.4. Huấn luyện và Kiểm tra

3.5. Kết quả và thảo luận

3.6. Kết luận chương 3

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng quan về ứng dụng AdaBoost trong gán nhãn ngữ nghĩa nông

Gán nhãn ngữ nghĩa nông là một trong những bài toán quan trọng trong lĩnh vực xử lý ngôn ngữ tự nhiên. Phương pháp AdaBoost đã được áp dụng để cải thiện độ chính xác trong việc gán nhãn vai trò ngữ nghĩa. Bài viết này sẽ khám phá cách mà AdaBoost có thể được sử dụng để giải quyết các thách thức trong gán nhãn ngữ nghĩa nông.

1.1. Khái niệm gán nhãn ngữ nghĩa nông và vai trò của AdaBoost

Gán nhãn ngữ nghĩa nông (Semantic Role Labeling - SRL) là quá trình xác định và gán nhãn các vai trò ngữ nghĩa cho các thành phần trong câu. AdaBoost, một phương pháp học máy mạnh mẽ, giúp cải thiện độ chính xác của các mô hình gán nhãn bằng cách kết hợp nhiều mô hình yếu thành một mô hình mạnh.

1.2. Lịch sử và phát triển của phương pháp AdaBoost trong SRL

AdaBoost được giới thiệu lần đầu vào năm 1995 và đã nhanh chóng trở thành một trong những phương pháp phổ biến trong học máy. Trong lĩnh vực gán nhãn ngữ nghĩa, AdaBoost đã được áp dụng để cải thiện độ chính xác của các mô hình phân loại, đặc biệt là trong các bài toán gán nhãn chuỗi.

II. Thách thức trong gán nhãn ngữ nghĩa nông và giải pháp từ AdaBoost

Gán nhãn ngữ nghĩa nông gặp nhiều thách thức, bao gồm sự đa dạng của ngữ cảnh và độ phức tạp của ngôn ngữ tự nhiên. AdaBoost cung cấp một giải pháp hiệu quả để vượt qua những thách thức này thông qua việc tối ưu hóa thuật toán học máy.

2.1. Các thách thức chính trong gán nhãn ngữ nghĩa nông

Một trong những thách thức lớn nhất trong gán nhãn ngữ nghĩa nông là sự đa dạng của các cấu trúc ngữ pháp và ngữ nghĩa. Điều này đòi hỏi các mô hình phải có khả năng học hỏi từ một lượng lớn dữ liệu và xử lý các biến thể ngữ nghĩa khác nhau.

2.2. Giải pháp của AdaBoost cho các thách thức này

AdaBoost giúp cải thiện độ chính xác của các mô hình gán nhãn bằng cách kết hợp nhiều mô hình yếu thành một mô hình mạnh. Phương pháp này cho phép tối ưu hóa các đặc trưng và giảm thiểu sai số trong quá trình gán nhãn.

III. Phương pháp áp dụng AdaBoost trong gán nhãn ngữ nghĩa nông

Phương pháp AdaBoost có thể được áp dụng trong gán nhãn ngữ nghĩa nông thông qua việc xây dựng các mô hình học máy mạnh mẽ. Bài viết này sẽ trình bày chi tiết về cách thức hoạt động của AdaBoost trong bối cảnh này.

3.1. Cách thức hoạt động của AdaBoost trong SRL

AdaBoost hoạt động bằng cách tạo ra một chuỗi các mô hình học máy, mỗi mô hình sẽ học từ các sai sót của mô hình trước đó. Điều này giúp cải thiện độ chính xác của các dự đoán trong gán nhãn ngữ nghĩa nông.

3.2. Các bước triển khai AdaBoost trong gán nhãn ngữ nghĩa

Quá trình triển khai AdaBoost bao gồm việc thu thập dữ liệu, chuẩn bị đặc trưng, huấn luyện mô hình và đánh giá kết quả. Mỗi bước đều quan trọng để đảm bảo rằng mô hình hoạt động hiệu quả trong việc gán nhãn ngữ nghĩa.

IV. Kết quả nghiên cứu và ứng dụng thực tiễn của AdaBoost trong SRL

Nghiên cứu đã chỉ ra rằng việc áp dụng AdaBoost trong gán nhãn ngữ nghĩa nông mang lại kết quả khả quan. Các ứng dụng thực tiễn của phương pháp này sẽ được trình bày trong phần này.

4.1. Kết quả thực nghiệm từ việc áp dụng AdaBoost

Các kết quả thực nghiệm cho thấy rằng mô hình sử dụng AdaBoost có độ chính xác cao hơn so với các mô hình truyền thống. Điều này chứng tỏ rằng AdaBoost là một công cụ mạnh mẽ trong gán nhãn ngữ nghĩa nông.

4.2. Ứng dụng thực tiễn của gán nhãn ngữ nghĩa nông

Gán nhãn ngữ nghĩa nông có nhiều ứng dụng trong các lĩnh vực như trích rút thông tin, hệ thống hỏi đáp và phân tích cảm xúc. Việc áp dụng AdaBoost trong các ứng dụng này giúp cải thiện độ chính xác và hiệu quả.

V. Kết luận và triển vọng tương lai của ứng dụng AdaBoost trong SRL

Kết luận về những lợi ích của việc áp dụng AdaBoost trong gán nhãn ngữ nghĩa nông và triển vọng tương lai của nghiên cứu này sẽ được trình bày trong phần này.

5.1. Tóm tắt những lợi ích của AdaBoost trong SRL

AdaBoost đã chứng minh được hiệu quả trong việc cải thiện độ chính xác của các mô hình gán nhãn ngữ nghĩa nông. Những lợi ích này mở ra nhiều cơ hội cho các nghiên cứu tiếp theo.

5.2. Triển vọng tương lai của nghiên cứu gán nhãn ngữ nghĩa nông

Nghiên cứu về gán nhãn ngữ nghĩa nông sẽ tiếp tục phát triển, với sự hỗ trợ của các công nghệ học máy tiên tiến như AdaBoost. Điều này hứa hẹn sẽ mang lại những bước tiến mới trong lĩnh vực xử lý ngôn ngữ tự nhiên.

22/07/2025
Luận văn thạc sĩ vnu uet ứng dụng adaboost cho bài toán gán nhãn ngữ nghĩa nông 04

Trích đoạn nội dung tài liệu

CHƯƠNG 1: TỔNG QUAN VỀ GÁN NHÃN VAI TRÒ NGỮ NGHĨA Nội dung chính của chương là giới thiệu bài toán gán nhãn vai trò ngữ nghĩa theo các hướng tiếp cận khác nhau, đưa ra mô hình tổng quát của hệ thống gán nhãn vai trò ngữ nghĩa, ứng dụng của hệ thống trong xử lý ngôn ngữ tự nhiên.1 Giới thiệu Thông thường, gán nhãn vai trò ngữ nghĩa là quá trình gán một cấu trúc đơn giản: WHO did WHAT to WHOM, WHEN, WHERE, WHY, HOW,. cho một câu trong văn bản. (Ai? đã làm gì? với ai? khi nào? ở đâu? tại sao? như thếnào?. Ví dụ: (i) Mary hit Jack with a ball yesterday.

(ii) Jack was hit by Mary yesterday with a ball. Ta có thể thấy rằng “Mary, Jack, a ball, yesterday” đóng các vai trò ngữ nghĩa sau: “Người đánh, vật bị đánh, dụng cụ, thời gian” trong cả hai câu. Nhiệm vụ của gán nhãn vai trò ngữ nghĩa là gán các nhãn ngữ nghĩa đã được xác định trước cho những cụm từ này mà không quan tâm tới sự xuất hiện của chúng trong các nhận dạng cú pháp khác nhau. Lớp thông tin này rất cần thiết để hiểu một cách đầy đủ ý nghĩa của cả hai câu.

Tổng quát hơn, ví dụ trong nghiên cứu của (Levin 1993 [2]) đã minh họa hiện tượng thay thế một lớp động từ. Phép thay thế này trong nhận dạng cú pháp của argument ngữ nghĩa có phạm vi trải rộng, ảnh hưởng tới hầu hết các động từ trong tiếng Anh, và các thành phần được biểu thị bởi các động từ cụ thể, khá đa dạng. Trong những năm gần đây, những tiến bộ vượt bậc của các kỹ thuật phân tích cú pháp đã có ảnh hưởng LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com không nhỏ đến các ứng dụng trong xử lý ngôn ngữ tự nhiên, tuy vậy, việc đi từ phân tích cú pháp tới hiểu đầy đủ ý nghĩa của một câu vẫn còn là một chặng đường dài để nghiên cứu. Điều này đã thôi thúc các nhà nghiên cứu phát triển một kỹ thuật tự động và chính xác cho vấn đề phân tích cú pháp lớp ngữ nghĩa, và đặt một bước tiến quan trọng hướng tới mục đích hiểu ngôn ngữ.

Gán nhãn vai trò ngữ nghĩa là một bài toán đã được định nghĩa tốt trong nhiều framework khác nhau, thu hút sự quan tâm của nhiều nhà nghiên cứu. Gán nhãn vai trò ngữ nghĩa hướng tới việc xác định và gán nhãn tất cả argument (hoặc vai trò ngữ nghĩa) cho mỗi vị tố xuất hiện trong câu. Cụ thể hơn, nhiệm vụ này bao gồm việc xác định các thành phần biểu diễn các argument của vị tố và gán nhãn các vai trò ngữ nghĩa cho các thành phần đó. Sau đây là một số ví dụ về các nhãn vai trò ngữ nghĩa: (i) [Agent Mary]hit [Theme Jack][Instrument with a ball][Temporal yesterday].

Trong các ví dụ này, thông tin được mô tả biễu diễn các nhãn vai trò ngữ nghĩa mà được gán cho các argument của vị tố (in nghiêng). Hai ví dụ đầu được phân tích sử dụng chú thích FrameNet, hai ví dụ còn lại được phân tích sử dụng kho ngữ liệu PropBank.2 Các phương pháp tiếp cận bài toán gán nhãn vai trò ngữ nghĩa 1.1 Tiếp cận theo luật Đây là cách tiếp cận truyền thống xuất phát từ cách làm của các hệ luật phát sinh trong hệ chuyên gia trong lĩnh vực trí tuệ nhân tạo (AI = Artificial Intelligence). Thông thường các hệ luật này được xây dựng bằng tay bởi các chuyên gia xử lý ngôn ngữ tự nhiên. LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Nhiều nghiên cứu trước đó được thực hiện bởi Hirst (1987) [17] sử dụng một phép phân tích cú pháp dựa trên luật và biểu diễn tri thức dựa trên frame, tương tự như nghiên cứu của Fillmore (1976) [14], Hirst đã sử dụng phương pháp ánh xạ để kết nối các thành phần cú pháp tới các vị trí frame tương ứng của chúng và biểu diễn ngữ nghĩa của câu được xây dựng lần lượt từng thành phần.

Các nhóm tác giả Pustejovsky (1995) [30], Copestake và Flickinger (2000) [10] cũng đã có những nghiên cứu tương tự về các lớp từ vựng và ngữ pháp được xây dựng thủ công. Những nghiên cứu trước đây tập trung vào việc xác định các cấu trúc argument danh nghĩa sử dụng các cách tiếp cận tương tự như trên. Ví dụ, Dahl và cộng sự (1987) [3] đã sử dụng tập các quy tắc kết hợp các thành phần cú pháp với các vai trò ngữ nghĩa cho các vị tố danh nghĩa. Xét ví dụ sau của Dahl và cộng sự: Investigation revealed [Instrument metal] [Predicate contamination] in [Theme the filter].

Hệ thống tạo bởi Dahl và cộng sự sử dụng các luật sau để xác định các chất gây ô nhiễm (metal) và thực thể bị ô nhiễm (the filter): 1. Instrument là danh từ đứng trước vị tố contamination. Theme là đối tượng của cụm giới từ theo sau contamination. Các luật được định nghĩa trên cho phép hệ thống xác định đúng các lớp vai trò ngữ nghĩa trong ví dụ trên.

Hệ thống này không được đánh giá một cách chính thức nhưng hoàn toàn có cơ sở tin rằng các quy tắc trên có thể đúng khi được áp dụng. Các quy tắc trong nghiên cứu của Dahl và cộng sự đã cho thấy những ưu điểm và hạn chế thường gặp đối với các hệ thống gán nhãn ngữ nghĩa dựa trên hệ luật. Một mặt, nếu một luật chính xác cho ra một dự đoán, thì dự đoán đó gần như là đúng (ví dụ như việc xác định các nhãn Instrument và Theme bên trên). Hơn nữa, các hệ luật được xây dựng đầy đủ vì bất cứ một phép suy diễn nào LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com cũng đều có thể được giải thích theo các luật đã tạo ra nó.

Tuy nhiên, các hệ thống được mô tả như trên có xu hướng dễ dàng bị phá vỡ đặc biệt khi được áp dụng trong các loại văn bản mà chưa được dự đoán trước. Đây là kết quả của bản chất “all or nothing” của việc giải thích ngữ nghĩa và cú pháp dựa trên hệ luật. Với tính linh hoạt, đa dạng của ngôn ngữ, chúng ta không ngạc nhiên, trong nhiều trường hợp, một tập giới hạn các quy tắc (luật) gặp thất bại khi áp dụng vào một câu trong ngôn ngữ tự nhiên. Vấn đề thực sự nảy sinh khi các nghiên cứu đòi hỏi cần mở rộng quy mô để bao quát hết các hiện tượng của ngôn ngữ.

Ban đầu, người ta cho rằng để mở rộng quy mô của hệ khử nhập nhằng ngữ nghĩa thì ta cứ việc thêm nhiều luật vào, nhưng thực tế đã cho thấy khi số luật tăng lên thì bản thân người thiết kế sẽ khó mà kiểm soát được tính hợp lý và tương thích của các bộ luật do mình đưa vào vì thế, sẽ xuất hiện nhiều luật mâu thuẫn nhau. Việc xây dựng một hệ luật như thế đòi hỏi công sức rất lớn và thường không bao quát hết mọi trường hợp, mặc dù, trong một số miền hẹp thì chúng tỏ ra hiệu quả. Kết quả là những hệ thống gán nhãn ngữ nghĩa được xây dựng trên luật sẽ có nguy cơ bị sụp đổ bởi chính sức nặng của chúng.2 Tiếp cận theo phương pháp thống kê Sự ra đời của các kho ngữ liệu lớn như FrameNet và PropBank đã cải tiến việc xử lý ngữ nghĩa dựa trên hệ luật sang phương pháp hướng ngữ liệu. Nghiên cứu của Gildea và Jurafsky (2002) [15] đã giải quyết bài toán SRL như một bài toán học máy có giám sát và sử dụng kho ngữ liệu FrameNet làm dữ liệu huấn luyện.

Gildea và Jurafsky đã sử dụng phương pháp thống kê cực đại hóa likelihood cho các đặc trưng cú pháp và từ vựng khác nhau để vừa phân biệt được các biên của phần tử frame bên trong văn bản vừa gán các nhãn vai trò ngữ nghĩa cho các phần tử được xác định. Mỗi ví dụ huấn luyện được phân tích thành một cây cú pháp sử dụng bộ phân tích cú pháp Collin (Collin, 1997 [9]) và một tập các đặc trưng cú pháp và từ vựng, như loại cụm từ của mỗi thành phần, LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com vị trí của nó,. được trích rút. Những đặc trưng này được kết hợp với các tri thức về vị tố, cũng như các thông tin về xác suất ưu tiên của các cách kết hợp khác nhau của vai trò ngữ nghĩa.

Nghiên cứu này đã đặt nền móng cho các hệ thống gán nhãn vai trò ngữ nghĩa tự động hiện nay. Gán nhãn ngữ nghĩa là một nhiệm vụ khá phức tạp, được phân tách thành các bài toán nhỏ hơn với các chiến lược gán nhãn khác nhau để có thể áp dụng được các phương pháp học máy. Vấn đề đầu tiên phải kể đến đó là việc chú thích cho các mệnh đề trong câu. Hầu hết các nhóm nghiên cứu tham dự CoNLL 2004 đều xác định việc chú thích vai trò ngữ nghĩa cho mỗi động từ vị ngữ trong câu là một nhiệm vụ độc lập.

Tuy nhiên hệ thống của Carreras và cộng sự (2004) [4] thực hiện chú thích đồng thời cho tất cả các mệnh đề. Do vậy, nhóm đầu tiên coi bài toán SRL tương tự với việc nhận dạng các cấu trúc dạng chuỗi (ví dụ bài toán chunking), trong khi đó, nhóm còn lại chỉ ra một cấu trúc phân cấp được hình thành bởi các argument của tất cả các mệnh đề. Các nghiên cứu này cũng đã chỉ ra ba chiến lược gán nhãn chủ yếu được sử dụng. Chiến lược đầu tiên xác định các ai trò một cách trực tiếp dựa vào việc gán nhãn chuỗi có định dạng BIO.

Chiến lược thứ hai bao gồm việc chia bài toán thành hai giai đoạn độc lập: giai đoạn nhận dạng (identification) các argument và giai đoạn gán nhãn (labelling). Chiến lược thứ ba cũng tiến hành dựa trên hai quá trình: quá trình lọc (filtering) quyết định tập argument và quá trình gán nhãn (labeling), trong đó, tập các argument tối ưu được rút ra từ tập ban đầu. Tốc độ phát triển nhanh chóng của các kỹ thuật học máy đã có nhiều đóng góp trong việc giải quyết bài toán gán nhãn vai trò ngữ nghĩa. Hacioglu và cộng sự tại hội nghị CoNLL 2004 [16] đã lựa chọn SVMs để thực hiện phân lớp vai trò ngữ nghĩa.

Động cơ khi chọn bộ phân lớp này là khả năng xử lý một số lượng cực lớn các đặc trưng tương tác hoặc đặc trưng chồng chéo với tính khái quát hóa cao. Cùng giải quyết bài toán này, Lim và cộng sự [21] đã đề xuất phương pháp gán nhãn sử dụng mô hình entropy cực đại (Maximum Entropy). LUAN VAN CHAT LUONG download : add luanvanchat@agmail.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ