Luận Văn: Tóm Tắt Đa Văn Bản Tiếng Việt Dựa Trên Trích Xuất Câu (ĐH Bách Khoa HN)

Luận văn về tóm tắt đa văn bản tiếng Việt sử dụng phương pháp trích xuất câu. Tìm hiểu kỹ thuật hiệu quả để tạo bản tóm tắt tự động, cô đọng thông tin chính xác.

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

Luận văn thạc sĩ

2014

75
1
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CAM ĐOAN

LỜI CẢM ƠN

TÓM TẮT NỘI DUNG LUẬN VĂN TỐT NGHIỆP

ABSTRACT OF THE THESIS

MỤC LỤC

DANH MỤC BẢNG VÀ HÌNH VẼ

MỞ ĐẦU

1. CHƯƠNG 1: GIỚI THIỆU BÀI TOÁN TÓM TẮT ĐA VĂN BẢN

1.1. Khái quát bài toán tóm tắt

1.2. Giới thiệu bài toán tóm tắt đa văn bản

1.3. Những thách thức đối với tóm tắt đa văn bản

1.4. Ứng dụng của tóm tắt đa văn bản

1.5. Phương pháp đánh giá tóm tắt đa văn bản

2. CHƯƠNG 2: TÓM TẮT ĐA VĂN BẢN DỰA TRÊN TRÍCH XUẤT CÂU

2.1. Tóm tắt đa văn bản dựa trên trích xuất câu

2.2. Hướng tiếp cận trích xuất câu dựa trên xếp hạng đồ thị

2.3. Một số công trình tóm tắt văn bản trong tiếng Việt

2.4. Đánh giá và lựa chọn phương pháp phù hợp cho tiếng Việt

3. CHƯƠNG 3: MÔ HÌNH TÓM TẮT ĐA VĂN BẢN TIẾNG VIỆT DỰA TRÊN TRÍCH XUẤT CÂU

3.1. Mô hình tóm tắt đa văn bản tiếng Việt dựa trên trích xuất câu

3.2. Tiền xử lý dữ liệu

3.3. Xây dựng đồ thị từ và xếp hạng đồ thị

4. CHƯƠNG 4: THỰC NGHIỆM VÀ ĐÁNH GIÁ

4.1. Dữ liệu đánh giá mô hình tóm tắt đa văn bản

4.2. Công cụ thực nghiệm

4.3. Kết quả xếp hạng từ vựng dựa vào đồ

4.4. Thực nghiệm tóm tắt đa văn bản tiếng Việt và đánh giá

4.5. Một ví dụ kết quả tóm tắt đa văn bản tiếng Việt

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng quan về Tóm tắt Đa văn bản Tiếng Việt Khái niệm

Bài toán tóm tắt đa văn bản (Multi-Document Summarization - MDS) trở nên ngày càng quan trọng trong bối cảnh lượng thông tin trực tuyến tăng trưởng chóng mặt. Nhu cầu nắm bắt thông tin một cách nhanh chóng, hiệu quả, và đầy đủ là động lực thúc đẩy sự phát triển của lĩnh vực này. Đặc biệt, khi nhiều tài liệu trùng lặp về nội dung, việc tự động hóa quá trình tóm tắt trở nên thiết yếu. Tuy nhiên, tóm tắt đa văn bản là một bài toán phức tạp hơn nhiều so với tóm tắt đơn văn bản. Đầu vào của bài toán này là một tập hợp các văn bản liên quan đến cùng một chủ đề, sự kiện. Sự phức tạp nảy sinh từ sự trùng lặp, mâu thuẫn, và khác biệt về trình tự thời gian trình bày giữa các văn bản. Do đó, mục tiêu của tóm tắt đa văn bản là tạo ra một bản tóm tắt duy nhất, mạch lạc, bao quát và đại diện cho toàn bộ nội dung của tập văn bản đầu vào. Bài toán tóm tắt đa văn bản tiếng Việt càng trở nên thách thức hơn do đặc thù ngôn ngữ, sự thiếu hụt các công cụ và tài nguyên xử lý ngôn ngữ tự nhiên, cũng như số lượng các nghiên cứu liên quan còn hạn chế. Theo nghiên cứu, một mô hình tóm tắt đa văn bản tiếng Việt sử dụng phương pháp xếp hạng từ vựng dựa trên đồ thị có thể đạt độ đo F1 khoảng 52%. Điều này cho thấy hướng đi đúng đắn và hiệu quả trong việc xây dựng mô hình tóm tắt đa văn bản cho tiếng Việt.

1.1. Ưu điểm và Ứng dụng của Tóm tắt Đa văn bản

Tóm tắt đa văn bản giúp người dùng tiết kiệm thời gian đọc, nhanh chóng nắm bắt thông tin chính từ nhiều nguồn khác nhau. Ứng dụng của nó rất đa dạng, từ tổng hợp tin tức, hỗ trợ nghiên cứu khoa học, đến phân tích dữ liệu lớn. Một số hệ thống tóm tắt văn bản tự động đã được đề xuất, dựa trên hướng tiếp cận thống kê như MEAD, LexRank, Microsoft Autosummarize. Nhiều ứng dụng nổi tiếng áp dụng kỹ thuật tóm tắt văn bản để giải quyết yêu cầu công việc như: UMinmlc Research Assistant, iResearch Reporter Newsblaster, Newslnlissence. Các hội nghị nổi tiếng về xử lý ngôn ngữ tự nhiên như DUC, TAC, AI cũng trình bày nhiều công trình nghiên cứu liên quan đến tóm tắt văn bản.

1.2. Thách thức trong Tóm tắt Đa văn bản Tiếng Việt

Bài toán tóm tắt đa văn bản tiếng Việt đối mặt với nhiều thách thức do tính phức tạp của ngôn ngữ. Sự đa dạng trong cách diễn đạt, ngữ cảnh, và văn phong giữa các văn bản đòi hỏi các mô hình phải có khả năng hiểu và xử lý thông tin một cách linh hoạt. Bên cạnh đó, sự khan hiếm về dữ liệu huấn luyện và các công cụ xử lý ngôn ngữ tự nhiên tiếng Việt là một rào cản lớn. Ngoài ra, việc đánh giá chất lượng của bản tóm tắt cũng là một vấn đề nan giải, vì tính chủ quan và sự đa dạng trong tiêu chí đánh giá. Nghiên cứu và phát triển các phương pháp đánh giá khách quan và đáng tin cậy là rất quan trọng.

II. Cách tiếp cận trích xuất câu cho Tóm tắt Đa văn bản

Một trong những cách tiếp cận phổ biến để giải quyết bài toán tóm tắt đa văn bản là trích xuất câu. Phương pháp này dựa trên việc xác định và lựa chọn các câu quan trọng nhất từ tập văn bản đầu vào để tạo thành bản tóm tắt. Các câu này thường được lựa chọn dựa trên các tiêu chí như tần suất xuất hiện của từ khóa, vị trí của câu trong văn bản, và mối quan hệ ngữ nghĩa với các câu khác. Trích xuất câu có ưu điểm là đơn giản, dễ thực hiện và không đòi hỏi nhiều tài nguyên tính toán. Tuy nhiên, nó cũng có nhược điểm là có thể dẫn đến bản tóm tắt thiếu mạch lạc, không tự nhiên và không phản ánh đầy đủ ý nghĩa của văn bản gốc. Các câu được trích xuất có thể không liên kết chặt chẽ với nhau, gây khó khăn cho người đọc trong việc hiểu nội dung. Theo nghiên cứu, việc sử dụng đồ thị để biểu diễn mối quan hệ giữa các câu và từ vựng có thể cải thiện đáng kể hiệu quả của phương pháp trích xuất câu.

2.1. Xếp hạng đồ thị và Trích xuất câu

Hướng tiếp cận trích xuất câu dựa trên xếp hạng đồ thị là một phương pháp hiệu quả để cải thiện tính mạch lạc và bao quát của bản tóm tắt. Trong phương pháp này, các câu và từ vựng được biểu diễn dưới dạng các nút trong một đồ thị, và các cạnh biểu diễn mối quan hệ giữa chúng. Các thuật toán xếp hạng đồ thị như PageRank hoặc HITS được sử dụng để xác định độ quan trọng của mỗi nút, từ đó lựa chọn các câu quan trọng nhất để đưa vào bản tóm tắt. Phương pháp này có ưu điểm là có thể tận dụng được thông tin về cấu trúc và ngữ nghĩa của văn bản, giúp tạo ra bản tóm tắt mạch lạc và bao quát hơn. Hình 2-1 trong tài liệu gốc minh họa đồ thị trích xuất câu.

2.2. Ứng dụng các công trình Tóm tắt văn bản Tiếng Việt

Một số công trình tóm tắt văn bản tiếng Việt đã được phát triển dựa trên phương pháp trích xuất câuxếp hạng đồ thị. Các công trình này thường sử dụng các kỹ thuật xử lý ngôn ngữ tự nhiên như tách từ, gán nhãn từ loại, và phân tích cú pháp để xây dựng đồ thị biểu diễn văn bản. Sau đó, các thuật toán xếp hạng đồ thị được áp dụng để xác định độ quan trọng của các câu và từ vựng, từ đó lựa chọn các câu quan trọng nhất để tạo thành bản tóm tắt. Việc đánh giá và lựa chọn phương pháp phù hợp cho tiếng Việt là rất quan trọng để đạt được hiệu quả tốt nhất.

III. Mô hình Tóm tắt Đa văn bản Tiếng Việt dựa trên câu

Luận văn đề xuất một mô hình tóm tắt đa văn bản tiếng Việt dựa trên trích xuất câu, sử dụng phương pháp xếp hạng từ vựng dựa trên đồ thị. Mô hình này bao gồm các bước chính sau: tiền xử lý dữ liệu, xây dựng đồ thị từ vựng và xếp hạng đồ thị, trích xuất câu và sinh văn bản tóm tắt. Trong giai đoạn tiền xử lý dữ liệu, các văn bản đầu vào được làm sạch, tách từ, gán nhãn từ loại và loại bỏ các từ dừng. Sau đó, một đồ thị từ vựng được xây dựng, trong đó các nút biểu diễn các từ vựng và các cạnh biểu diễn mối quan hệ giữa chúng. Các thuật toán xếp hạng đồ thị được sử dụng để xác định độ quan trọng của các từ vựng, từ đó lựa chọn các từ khóa quan trọng nhất. Cuối cùng, các câu chứa nhiều từ khóa quan trọng được lựa chọn để đưa vào bản tóm tắt.

3.1. Tiền xử lý dữ liệu hiệu quả

Giai đoạn tiền xử lý dữ liệu đóng vai trò quan trọng trong việc nâng cao hiệu quả của mô hình. Các kỹ thuật như loại bỏ ký tự đặc biệt, chuyển đổi chữ hoa thành chữ thường, và chuẩn hóa cách viết giúp giảm nhiễu và tăng độ chính xác của quá trình xử lý ngôn ngữ tự nhiên. Việc sử dụng các bộ từ điển và quy tắc chính tả tiếng Việt cũng giúp cải thiện độ chính xác của việc tách từ và gán nhãn từ loại.

3.2. Xây dựng đồ thị từ vựng và xếp hạng đồ thị

Việc xây dựng đồ thị từ vựng một cách chính xác và hiệu quả là rất quan trọng để đảm bảo chất lượng của bản tóm tắt. Các mối quan hệ giữa các từ vựng có thể được xác định dựa trên các tiêu chí như tần suất xuất hiện cùng nhau trong văn bản, mối quan hệ ngữ nghĩa, và cấu trúc cú pháp. Các thuật toán xếp hạng đồ thị như PageRank hoặc HITS có thể được sử dụng để xác định độ quan trọng của các từ vựng. Chương trình gắn nhãn từ loại được minh họa trong hình 3-3 của tài liệu gốc.

3.3. Trích xuất câu và sinh văn bản tóm tắt

Quá trình trích xuất câu dựa trên trọng số và xếp hạng câu theo độ quan trọng. Sau khi tính trọng số cho từng câu, các câu có trọng số cao nhất sẽ được chọn để đưa vào bản tóm tắt. Tuy nhiên, cần đảm bảo rằng bản tóm tắt có tính mạch lạc, tự nhiên và phản ánh đầy đủ ý nghĩa của văn bản gốc. Các câu được lựa chọn phải liên kết chặt chẽ với nhau, tạo thành một đoạn văn mạch lạc và dễ hiểu.

IV. Thực nghiệm Đánh giá Mô hình Tóm tắt Đa văn bản TV

Để đánh giá hiệu quả của mô hình, các thử nghiệm đã được thực hiện trên một tập dữ liệu gồm các văn bản tiếng Việt thuộc nhiều chủ đề khác nhau. Các kết quả thực nghiệm cho thấy rằng mô hình có khả năng tạo ra các bản tóm tắt có chất lượng tương đối tốt, với độ đo F1 đạt khoảng 52%. Tuy nhiên, vẫn còn nhiều điểm cần cải thiện, đặc biệt là trong việc xử lý các câu phức tạp và đảm bảo tính mạch lạc của bản tóm tắt. Bảng 4-1 trong tài liệu gốc mô tả môi trường thực nghiệm.

4.1. Dữ liệu và Công cụ thực nghiệm

Dữ liệu đánh giá mô hình bao gồm 200 cụm dữ liệu và 160 cụm dữ liệu. Công cụ thực nghiệm bao gồm chương trình gắn nhãn từ loại và các thành phần chức năng được cài đặt. Việc lựa chọn dữ liệu đánh giá phù hợp và sử dụng các công cụ thực nghiệm chính xác là rất quan trọng để đảm bảo tính khách quan và đáng tin cậy của kết quả đánh giá.

4.2. Kết quả và Phân tích

Kết quả xếp hạng từ vựng dựa vào đồ thị được đánh giá trên hai tài liệu. Các thử nghiệm tóm tắt đa văn bản tiếng Việt được thực hiện và đánh giá. Một ví dụ kết quả tóm tắt đa văn bản tiếng Việt được trình bày trong tài liệu. Bảng 4-2, 4-3 và 4-4 trình bày kết quả đánh giá chất lượng xếp hạng từ vựng trên hai tài liệu, đánh giá trên tập 200 cụm dữ liệu và 160 cụm dữ liệu.

V. Kết luận Hướng phát triển Tóm tắt Đa văn bản TV

Luận văn đã trình bày một mô hình tóm tắt đa văn bản tiếng Việt dựa trên trích xuất câu, sử dụng phương pháp xếp hạng từ vựng dựa trên đồ thị. Mô hình này có khả năng tạo ra các bản tóm tắt có chất lượng tương đối tốt, nhưng vẫn còn nhiều điểm cần cải thiện. Trong tương lai, có thể tập trung vào việc phát triển các kỹ thuật xử lý ngôn ngữ tự nhiên tiếng Việt tiên tiến hơn, cải thiện khả năng hiểu và xử lý các câu phức tạp, và đảm bảo tính mạch lạc và bao quát của bản tóm tắt. Ngoài ra, việc nghiên cứu và phát triển các phương pháp đánh giá khách quan và đáng tin cậy cũng là rất quan trọng.

5.1. Tổng kết những đóng góp chính của nghiên cứu

Nghiên cứu này đã đóng góp vào việc phát triển các phương pháp tóm tắt đa văn bản tiếng Việt bằng cách đề xuất một mô hình mới dựa trên trích xuất câuxếp hạng đồ thị. Mô hình này có khả năng tạo ra các bản tóm tắt có chất lượng tương đối tốt, và có thể được sử dụng trong nhiều ứng dụng khác nhau.

5.2. Đề xuất các hướng nghiên cứu tiếp theo tiềm năng

Trong tương lai, có thể tập trung vào việc phát triển các kỹ thuật xử lý ngôn ngữ tự nhiên tiếng Việt tiên tiến hơn, cải thiện khả năng hiểu và xử lý các câu phức tạp, và đảm bảo tính mạch lạc và bao quát của bản tóm tắt. Ngoài ra, việc nghiên cứu và phát triển các phương pháp đánh giá khách quan và đáng tin cậy cũng là rất quan trọng.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI từ nội dung tài liệu gốc; tài liệu do người dùng đóng góp và được kiểm duyệt trước khi xuất bản. Báo lỗi nội dung.

11/09/2025
Luận văn tóm tắt đa văn bản tiếng việt dựa vào trích xuất câu

Trích đoạn nội dung tài liệu

BỘ GIÁO DỤC VÀ ĐÀO TẠO 'TRƯỜNG ĐẠI HỌC BÁCH KHOA HÀ NỘI. NGUYEN THE NU TOM TAT DA VAN BAN TIENG VIET DU'A VAO TRICI. XUAT CAU Chuyên ngành : Công nghệ thông tin LUẬN VĂN THẠC SĨ KỸ THUẬT Công nghệ thông tin NGƯỜI HƯỚNG DAN KHOA HOC PGS. Lê Thanh Hương Hà Nội — Nam 2014 Tôm tắt da vẫn bản tiếng việt dựa vào trích xuất câu LỜI CAM ĐOAN To va tén hoe vién: Neuyén Thi Nu SITIV: CB120102.

Chuyên ngành: Công nghệ thông tin Láp: CH20125 Người hướng dẫn: PGS. Lê Thanh Hương Đón vị: Viện Công nghệ Thông tín - Truyền thông, Tên dé tai: Tom tat đa văn bản tiếng việt dựa vào trích xuất câu Tôi — Aiguyễn Thị Mục Cam kết Luận vẫn là công trình nghiên cửu của bản thân tôi dưới sự hướng dẫn của PGS. Lê Thanh [long Các kết quâ nên trong Luận là trung thực, không phải là sao chép toàn văn của bất kỷ công trinh nao khác. Hà Nội ngày tháng năm2014 ‘Tac gia Luan vin Nguyễn Thị Nụ 1 Hạc viên thực hiện: Nguyễn Thị Nụ - CBI20102 — 12BCNTT2 Tom tat da van bản tiếng việt dựa vào trích xuất cầu LOT CAM ON Lài dẫu tiên, em xin được gửi loi cd on chan ihimh ii cae thay câ giáa thuộc trường Đại học Bách Khoa Hà Nội, những người đã tận tình chi day tắt cô kiểu thức chuyên ngành cho em trong suất quá trình học tập và nghiên cứu tại trường.

Trong quá trình thực biện Luận văn tốt nghiệp em đã bạc hỏi được thêm rất nhiều điều, đó cũng là cơ hội đồ em tông kết những kiễn thức đã được học, đồng thải rút ra những kinh nghiệm quý báu. lâm xin chân thành cảm ơn những hướng dẫn tận tình cña cô giáo, PƠS. TS, Lê Thanh Hương- bộ môn Hệ thống thông tin — Viện Câng Nghệ Thông Ti và Truyễn Thông - trường Đại học Bách Khoa Hà Nội. Luận văn được hoàn thành ở một mức độ nhất định.

Tên cạnh những kế! quả để đạt được, chấo chan em sẽ không tránh khỏi những thiểu sôi và hạn chế. Sự phê bình, nhận xét của thầy cô là những bài học quý báu cho công việc và nghiÊn cứu của em sau nay. Em cũng xin được gửi lời cảm ơn sâu sắc đến gia đình, bạn bè đã luôn ở bên, ủng hộ, động viên tình thân cho em trong suốt quá trình thực hiện đồ án. in kính chúc quý thây cô mạnh khỏe, hạnh phúc, tếp tục đạt được nhiều thành công trong nghiên cứu khoa học cũng như trong sự nghiệp trồng người.

Hà Nội, tháng năm 2014 Sinh viên thực hiện Nguyễn Thị Nụ 3 Hạc viên thực hiện: Nguyễn Thị Nụ - CB120109— I2BCNTT2 Tom tat da van bản tiếng việt dựa vào trích xuất cầu 3.1 Trích xuất từ khỏa quan trong - - - 233 3.2 Xây dựng đã thị lừ vựng.3 Xếp hạng đỗ n từ vựng 34 3.4 Một ví dụ cụ thể vẻ đỗ thị từ vụng.4 Trích xuất râu và sinh văn bản 16m (at.1 'Tính trọng số chơ từng, câu.2 Xếp hạng câu theo độ quan trọng.3 Sinh văn bản tóm ĐẾT,. cuc neneeeeiereiieesooroo,3Đ CHƯƠNG 4: THỰC NGIIỆM VÀ DÁNH GIÁ.1 Dữ liệu đánh giá mô kình tóm tắt đa văn bản. 42 Công cụ thực nghiệm.1 Mỗi trường thục nghiệm.2 Các thành phân chức năng được cài đặt - - 42 4. Kết quá xếp hạng từ vựng dựa vào đồ 44 Thực nghiệm tám (ắt đa văn bản tiếng Việt và đánh giá.5 Một ví dụ kết quả tom tắt da văn bản tiếng Việt.

- 51 TÀI LIỆU THAM KHẢO.S 6 Hạc viên thực hiện: Nguyễn Thị Nụ - CB120109— I2BCNTT2 Tom tat da van bản tiếng việt dựa vào trích xuất cầu ABSTRACT OF THE THESIS Along, with the rapid growth of online information is the need to summarize documents automatically. Tl aims to caplure information completely, efficiently and quickly, especially when many documents are likely to repeat much the same content, Therefore, multi-document summarization has altracted allention [rom the Natural Language Processing community. There is a difficult problem because the ambiguity of ths input. content has posed several challenges.

This thesis proposes 4 new method for multi-document summarization on Vietnamese by using a graph representation for text. As a result, a model was built to extract sentences based on the lexical ranking algorithm. Kepwords: multi-document summarication, lexical ranking, automotically, 4 Hạc viên thực hiện: Nguyễn Thị Nụ -CBI20102 — 12BCNTT2 Tom tat da van bản tiếng việt dựa vào trích xuất cầu TOM TAT NOI DUNG LUAN VAN TOT NGHIỆP Cũng với sự táng trưởng không ngùng lượng dữ liệu trực tuyển có sẵn là nhu cầu tôm tắt văn bản tự động nhằm nắm bắt thông tim một cách đầy đủ, hiệu quả, như. chóng, nhất là khi nhiều tải liệu trùng lặp nhau về nội dưng.

Do đó, bài toán tóm tất đa văn bản nhận đuợc sự quan tâm đặc biệt của công đẳng xử lý ngôn ngữ tự nhiên bởi tính ứng dụng thực tiễn quan trọng của nó. Tuy nhiên, đây là bai toán khỏ do đặc thù đầu vào là các văn bản nhập nh ng mặt nội dụng, trình lự thời gian trình bay siữa chúng khác nhau. ải toán tóm tắt đa văn bản trên tiếng Việt còn gặp khỏ khăn hơn rất nhiều bởi tỉnh phúc tạpcủa miễn ngôn ngữ. Bên cạnh đó, các công trình nghiên cứu liên quan còn hạn chế về cá số lượng lần chất lượng.

V vậy, luận văn khảo sát, nghiên cửu và để xuất một mô hình tóm tắt đa văn bản tiếng Việt sử dụng phương pháp xếp hạng, từ vựng dựa trên đồ thị. Việc trên hành thực nghiệm chơ kết quả khả quan, với dộ do F1 dạt khoảng 52%. Từ da cho thay hung đi đúng đắn, hiệu quả trang việc xây đựng mô hình tóm tắt đa văn bản tong Việt mài luận văn di dura ra. Từ khỏa: tóm tắt da văn bản, xếp hạng từ vựng, tiếng Việt, tự động 3 Hạc viên thực hiện: Nguyễn Thị Nụ - CB120109— I2BCNTT2 Tom tat da van bản tiếng việt dựa vào trích xuất cầu 3.1 Trích xuất từ khỏa quan trong - - - 233 3.2 Xây dựng đã thị lừ vựng.3 Xếp hạng đỗ n từ vựng 34 3.4 Một ví dụ cụ thể vẻ đỗ thị từ vụng.4 Trích xuất râu và sinh văn bản 16m (at.1 'Tính trọng số chơ từng, câu.2 Xếp hạng câu theo độ quan trọng.3 Sinh văn bản tóm ĐẾT,.

cuc neneeeeiereiieesooroo,3Đ CHƯƠNG 4: THỰC NGIIỆM VÀ DÁNH GIÁ.1 Dữ liệu đánh giá mô kình tóm tắt đa văn bản. 42 Công cụ thực nghiệm.1 Mỗi trường thục nghiệm.2 Các thành phân chức năng được cài đặt - - 42 4. Kết quá xếp hạng từ vựng dựa vào đồ 44 Thực nghiệm tám (ắt đa văn bản tiếng Việt và đánh giá.5 Một ví dụ kết quả tom tắt da văn bản tiếng Việt. - 51 TÀI LIỆU THAM KHẢO.S 6 Hạc viên thực hiện: Nguyễn Thị Nụ - CB120109— I2BCNTT2 Tom tat da van bản tiếng việt dựa vào trích xuất cầu TOM TAT NOI DUNG LUAN VAN TOT NGHIỆP Cũng với sự táng trưởng không ngùng lượng dữ liệu trực tuyển có sẵn là nhu cầu tôm tắt văn bản tự động nhằm nắm bắt thông tim một cách đầy đủ, hiệu quả, như.

chóng, nhất là khi nhiều tải liệu trùng lặp nhau về nội dưng. Do đó, bài toán tóm tất đa văn bản nhận đuợc sự quan tâm đặc biệt của công đẳng xử lý ngôn ngữ tự nhiên bởi tính ứng dụng thực tiễn quan trọng của nó. Tuy nhiên, đây là bai toán khỏ do đặc thù đầu vào là các văn bản nhập nh ng mặt nội dụng, trình lự thời gian trình bay siữa chúng khác nhau. ải toán tóm tắt đa văn bản trên tiếng Việt còn gặp khỏ khăn hơn rất nhiều bởi tỉnh phúc tạpcủa miễn ngôn ngữ.

Bên cạnh đó, các công trình nghiên cứu liên quan còn hạn chế về cá số lượng lần chất lượng. V vậy, luận văn khảo sát, nghiên cửu và để xuất một mô hình tóm tắt đa văn bản tiếng Việt sử dụng phương pháp xếp hạng, từ vựng dựa trên đồ thị. Việc trên hành thực nghiệm chơ kết quả khả quan, với dộ do F1 dạt khoảng 52%. Từ da cho thay hung đi đúng đắn, hiệu quả trang việc xây đựng mô hình tóm tắt đa văn bản tong Việt mài luận văn di dura ra.

Từ khỏa: tóm tắt da văn bản, xếp hạng từ vựng, tiếng Việt, tự động 3 Hạc viên thực hiện: Nguyễn Thị Nụ - CB120109— I2BCNTT2 Tom tat da van bản tiếng việt dựa vào trích xuất cầu 3.1 Trích xuất từ khỏa quan trong - - - 233 3.2 Xây dựng đã thị lừ vựng.3 Xếp hạng đỗ n từ vựng 34 3.4 Một ví dụ cụ thể vẻ đỗ thị từ vụng.4 Trích xuất râu và sinh văn bản 16m (at.1 'Tính trọng số chơ từng, câu.2 Xếp hạng câu theo độ quan trọng.3 Sinh văn bản tóm ĐẾT,. cuc neneeeeiereiieesooroo,3Đ CHƯƠNG 4: THỰC NGIIỆM VÀ DÁNH GIÁ.1 Dữ liệu đánh giá mô kình tóm tắt đa văn bản. 42 Công cụ thực nghiệm.1 Mỗi trường thục nghiệm.2 Các thành phân chức năng được cài đặt - - 42 4. Kết quá xếp hạng từ vựng dựa vào đồ 44 Thực nghiệm tám (ắt đa văn bản tiếng Việt và đánh giá.5 Một ví dụ kết quả tom tắt da văn bản tiếng Việt.

- 51 TÀI LIỆU THAM KHẢO.S 6 Hạc viên thực hiện: Nguyễn Thị Nụ - CB120109— I2BCNTT2 Tom tat da van bản tiếng việt dựa vào trích xuất cầu ABSTRACT OF THE THESIS Along, with the rapid growth of online information is the need to summarize documents automatically. Tl aims to caplure information completely, efficiently and quickly, especially when many documents are likely to repeat much the same content, Therefore, multi-document summarization has altracted allention [rom the Natural Language Processing community. There is a difficult problem because the ambiguity of ths input. content has posed several challenges.

This thesis proposes 4 new method for multi-document summarization on Vietnamese by using a graph representation for text. As a result, a model was built to extract sentences based on the lexical ranking algorithm. Kepwords: multi-document summarication, lexical ranking, automotically, 4 Hạc viên thực hiện: Nguyễn Thị Nụ -CBI20102 — 12BCNTT2 Tom tat da van bản tiếng việt dựa vào trích xuất cầu MO PAU 1. Ly do chon dé tai Trong hai mươi năm trở lại đầy, các nghiền cửu về tom tt van bản tụ động phát triển mạnh mẽ trong rniền xử lý ngôn ngữ tự nhiền.

Những thông lim đôi dào sẵn có về khoa học, công nghệ trên Iniernet như bải báo, hội nghị, tin tức đã thu hút sự quan tâm các nhóm nghiên cứu khác nhau. Các nhóm nghiên cứu nảy cùng làm về tóm tắt văn bản như các nhà ngôn ngữ học, nhá sinh vật học, nhà nghiền cứu về cơ sở dữ liều, chuyên gia khôi phục thông tin,. Tuy nhiên, bởi các đữ liệu trên web này quá lớn nên việc đọc và tóm tốt thủ công toàn bộ lượng thông tin này là không thể.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ