Nghiên Cứu Phát Triển Phương Pháp Tóm Tắt Văn Bản Bằng Kỹ Thuật Học Sâu

Luận án tiến sĩ phân tích nghiên cứu phát triển một số phương pháp tóm tắt văn bản sử dụng kĩ thuật học sâu, xây dựng cơ sở lý luận, kiểm chứng thực nghiệm, đóng góp tri thức mới

Chuyên ngành

Hệ thống thông tin

Người đăng

Ẩn danh

Thể loại

luận án tiến sĩ

2022

195
5
0

Phí lưu trữ

45 Point

Mục lục chi tiết

LỜI CAM ĐOAN

LỜI CẢM ƠN

DANH MỤC CÁC KÝ HIỆU VÀ CHỮ VIẾT TẮT

DANH MỤC CÁC BẢNG

DANH MỤC CÁC HÌNH VẼ, ĐỒ THỊ

DANH MỤC KÝ HIỆU TOÁN HỌC

1. CHƯƠNG 1: MỞ ĐẦU

1.1. Bối cảnh nghiên cứu

2. CHƯƠNG 2: CÁC KIẾN THỨC NỀN TẢNG

3. CHƯƠNG 3: PHÁT TRIỂN CÁC PHƯƠNG PHÁP TÓM TẮT ĐƠN VĂN BẢN HƯỚNG TRÍCH RÚT

4. CHƯƠNG 4: PHÁT TRIỂN PHƯƠNG PHÁP TÓM TẮT ĐƠN VĂN BẢN HƯỚNG TÓM LƯỢC

5. CHƯƠNG 5: PHÁT TRIỂN CÁC PHƯƠNG PHÁP TÓM TẮT ĐA VĂN BẢN

DANH MỤC CÁC CÔNG TRÌNH ĐÃ CÔNG BỐ

TÀI LIỆU THAM KHẢO

Phụ lục A: Văn bản nguồn của các văn bản tóm tắt ví dụ

Phụ lục B: Biểu đồ phân bố của các bộ dữ liệu thử nghiệm

Phụ lục C: Văn bản nguồn của các mẫu tóm tắt thử nghiệm

Tóm tắt

I. Phương pháp tóm tắt văn bản

Phương pháp tóm tắt văn bản là một lĩnh vực quan trọng trong xử lý ngôn ngữ tự nhiên (NLP), đặc biệt trong bối cảnh thông tin số hóa phát triển mạnh mẽ. Các phương pháp này nhằm tạo ra bản tóm tắt từ một hoặc nhiều văn bản, giúp người dùng nắm bắt thông tin nhanh chóng. Kỹ thuật học sâu đã trở thành công cụ chính trong việc phát triển các mô hình tóm tắt tự động, mang lại hiệu quả cao hơn so với các phương pháp truyền thống. Luận án tiến sĩ của Lưu Minh Tuấn tập trung vào việc áp dụng các mô hình học sâu như BERT, Transformer, và mạng nơ ron tích chập (CNN) để cải thiện độ chính xác và hiệu suất của các hệ thống tóm tắt văn bản.

1.1. Tóm tắt nội dung

Tóm tắt nội dung là quá trình trích xuất các thông tin quan trọng từ văn bản gốc để tạo ra bản tóm tắt ngắn gọn. Trong luận án tiến sĩ, các phương pháp tóm tắt được chia thành hai hướng chính: tóm tắt trích rúttóm tắt tóm lược. Tóm tắt trích rút tập trung vào việc chọn lọc các câu quan trọng từ văn bản gốc, trong khi tóm tắt tóm lược sử dụng các kỹ thuật tạo văn bản mới để diễn đạt lại nội dung. Các mô hình học sâu như BERTTransformer được áp dụng để cải thiện độ chính xác và tự nhiên của bản tóm tắt.

1.2. Xử lý ngôn ngữ tự nhiên

Xử lý ngôn ngữ tự nhiên (NLP) là nền tảng quan trọng trong việc phát triển các hệ thống tóm tắt văn bản. Các kỹ thuật NLP như mã hóa từ (Word Embedding), phân tích ngữ nghĩa, và mô hình ngôn ngữ được sử dụng để hiểu và xử lý văn bản. Trong luận án tiến sĩ, các mô hình như BERTPhoBERT được áp dụng để tối ưu hóa quá trình xử lý ngôn ngữ, đặc biệt là với tiếng Việt. Các kỹ thuật này giúp cải thiện khả năng hiểu và tóm tắt văn bản một cách tự nhiên và chính xác.

II. Kỹ thuật học sâu trong tóm tắt văn bản

Kỹ thuật học sâu đã cách mạng hóa lĩnh vực tóm tắt văn bản bằng cách cung cấp các mô hình có khả năng học và hiểu ngôn ngữ tự nhiên một cách sâu sắc. Trong luận án tiến sĩ, các mô hình như BERT, Transformer, và mạng nơ ron tích chập (CNN) được sử dụng để phát triển các hệ thống tóm tắt tự động. Các mô hình này không chỉ cải thiện độ chính xác mà còn tăng cường khả năng xử lý các văn bản phức tạp và đa dạng.

2.1. Mô hình học sâu

Các mô hình học sâu như BERTTransformer đã trở thành tiêu chuẩn trong lĩnh vực tóm tắt văn bản. BERT là mô hình ngôn ngữ hai chiều, cho phép hiểu ngữ cảnh của từ trong cả hai hướng, giúp cải thiện độ chính xác của bản tóm tắt. Transformer sử dụng cơ chế tự chú ý (Self-Attention) để xử lý các đoạn văn bản dài và phức tạp. Trong luận án tiến sĩ, các mô hình này được tối ưu hóa để phù hợp với tiếng Việt, mang lại hiệu quả cao trong việc tóm tắt văn bản.

2.2. Ứng dụng học sâu trong tóm tắt

Ứng dụng học sâu trong tóm tắt đã mang lại nhiều cải tiến đáng kể trong việc tạo ra các bản tóm tắt tự động. Các mô hình như BERTTransformer không chỉ giúp tăng độ chính xác mà còn cải thiện tính tự nhiên của bản tóm tắt. Trong luận án tiến sĩ, các mô hình này được áp dụng để phát triển các hệ thống tóm tắt đơn văn bản và đa văn bản, mang lại hiệu quả cao trong việc xử lý các nguồn thông tin đa dạng.

III. Nghiên cứu luận án và ứng dụng thực tiễn

Nghiên cứu luận án của Lưu Minh Tuấn không chỉ tập trung vào việc phát triển các mô hình tóm tắt văn bản mà còn đánh giá hiệu quả của chúng trong thực tế. Các kết quả nghiên cứu cho thấy các mô hình đề xuất có khả năng tóm tắt văn bản một cách chính xác và hiệu quả, đặc biệt là với tiếng Việt. Các ứng dụng thực tiễn của nghiên cứu này bao gồm việc phát triển các hệ thống tóm tắt tự động cho các nền tảng tin tức, tài liệu khoa học, và các nguồn thông tin khác.

3.1. Đánh giá hiệu quả

Các mô hình tóm tắt văn bản được đề xuất trong luận án tiến sĩ đã được đánh giá trên các bộ dữ liệu tiếng Anh và tiếng Việt. Kết quả cho thấy các mô hình này đạt được độ chính xác cao và thời gian xử lý nhanh chóng. Các phương pháp đánh giá như ROUGEBLEU được sử dụng để đo lường hiệu quả của các bản tóm tắt, cho thấy sự vượt trội của các mô hình đề xuất so với các phương pháp truyền thống.

3.2. Ứng dụng thực tiễn

Các kết quả nghiên cứu trong luận án tiến sĩ có tiềm năng ứng dụng rộng rãi trong thực tế. Các hệ thống tóm tắt tự động có thể được tích hợp vào các nền tảng tin tức, tài liệu khoa học, và các hệ thống quản lý thông tin. Việc áp dụng các kỹ thuật học sâu trong tóm tắt văn bản không chỉ giúp tiết kiệm thời gian mà còn cải thiện chất lượng thông tin được cung cấp cho người dùng.

01/03/2025
Luận án tiến sĩ nghiên cứu phát triển một số phương pháp tóm tắt văn bản sử dụng kĩ thuật học sâu

Trích đoạn nội dung tài liệu

MỞ ĐẦU 1. Bối cảnh nghiên cứu Trong kỷ nguyên số và mạng Internet phát triển mạnh mẽ như hiện nay, các tài nguyên trên internet như các trang web, đánh giá của người dùng, tin tức, blog, mạng xã hội,. là những nguồn dữ liệu văn bản to lớn. Bên cạnh đó, có một khối lượng nội dung văn bản phong phú khác trên các kho lưu trữ như các bài báo tin tức, tiểu thuyết, sách, văn bản pháp luật, tài liệu y sinh, bài báo khoa học,.

Các nội dung văn bản này tăng lên theo cấp số nhân hàng ngày. Do đó, người dùng mất rất nhiều thời gian để tìm kiếm thông tin mà mình mong muốn. Kết quả là người dùng thậm chí không thể đọc và hiểu hết được tất cả nội dung văn bản kết quả tìm kiếm. Có nhiều thông tin bị lặp lại hoặc không quan trọng trong các văn bản kết quả tìm kiếm.

Do đó, việc tóm tắt và cô đọng các nguồn văn bản trở nên cấp thiết và quan trọng hơn rất nhiều. Tóm tắt văn bản thủ công là một nhiệm vụ tốn kém và tiêu tốn nhiều thời gian và công sức của con người. Trên thực tế, con người cũng rất khó tóm tắt thủ công với lượng dữ liệu văn bản khổng lồ này [1]. Để giải quyết các vấn đề này, các phương pháp tóm tắt văn bản tự động được quan tâm nghiên cứu để phát triển các hệ thống tóm tắt văn bản tự động.

Mục tiêu chính của các hệ thống tóm tắt văn bản tự động là tạo ra bản tóm tắt bao gồm các ý chính của một văn bản hoặc nhiều văn bản đầu vào và thông tin lặp lại ít nhất [2,3]. Các hệ thống tóm tắt văn bản tự động sinh ra các bản tóm tắt giúp người dùng nắm được những điểm chính của văn bản gốc mà không cần phải đọc toàn bộ văn bản. Người dùng sẽ được hưởng lợi từ các bản tóm tắt được sinh ra tự động, tiết kiệm được nhiều thời gian và công sức. Các hệ thống tóm tắt văn bản tự động hiện nay có thể được chia thành hai loại là tóm tắt đơn văn bản và tóm tắt đa văn bản.

Tóm tắt đơn văn bản sinh ra bản tóm tắt từ một văn bản đầu vào, trong khi tóm tắt đa văn bản sinh ra bản tóm tắt từ một tập các văn bản đầu vào. Các hệ thống tóm tắt văn bản tự động này được phát triển bằng việc áp dụng một trong các phương pháp tiếp cận chủ yếu là tóm tắt văn bản hướng trích rút và tóm tắt văn bản hướng tóm lược.  Tóm tắt văn bản hướng trích rút: Là phương pháp lựa chọn những câu quan trọng nhất trong một văn bản nguồn (hoặc một tập văn bản nguồn) và sử dụng các câu này để sinh bản tóm tắt. Phương pháp này bao gồm các nhiệm vụ xử lý chính như: Tạo một biểu diễn thích hợp cho văn bản đầu vào, cho điểm các câu, trích rút các câu có điểm cao.

Các hệ thống tóm tắt văn bản hướng trích rút có thể chia thành các phương pháp chủ yếu sau:  Phương pháp dựa trên thống kê: Trích rút các câu và các từ quan trọng từ văn bản nguồn dựa trên phân tích thống kê của tập các đặc trưng. Các hệ thống dựa trên phương pháp thống kê [4,5] thực hiện cho điểm câu bằng cách chọn và tính toán một số đặc trưng thống kê, sau đó gán các trọng số cho chúng và gán điểm cuối cùng cho mỗi câu trong văn bản được xác định bởi biểu thức trọng số - đặc trưng (nghĩa là tất cả điểm của các đặc trưng đã chọn được tính toán và tính tổng để thu 1 được điểm của mỗi câu). Bên cạnh đó, hệ thống Lead [6] chọn các câu đưa vào bản tóm tắt dựa vào trình tự thời gian đã cho kết quả khá cao.  Phương pháp dựa trên khái niệm: Trích xuất các khái niệm từ một đoạn văn bản từ các cơ sở tri thức bên ngoài như WordNet [7], Wikipedia,.

Sau đó, độ quan trọng của các câu được xác định dựa trên các khái niệm được lấy từ cơ sở tri thức bên ngoài thay vì các từ. Các hệ thống này thực hiện cho điểm các câu bằng cách trích xuất các khái niệm của một văn bản từ cơ sở tri thức bên ngoài, xây dựng một véc tơ khái niệm hoặc mô hình đồ thị để chỉ ra mối quan hệ giữa khái niệm và câu rồi áp dụng một thuật toán xếp hạng để cho điểm các câu như trong [8].  Phương pháp dựa trên chủ đề: Phương pháp này dựa vào việc xác định chủ đề chính của văn bản. Có một số phương pháp biểu diễn chủ đề phổ biến là phương pháp dựa trên từ chủ đề, tần suất xuất hiện của từ (TF), trọng số thể hiện mức độ quan trọng của từ (TF-IDF), chuỗi từ vựng [9,10].

Các bước xử lý chung của các hệ thống tóm tắt trích rút dựa trên chủ đề bao gồm chuyển đổi văn bản đầu vào thành một biểu diễn trung gian, nắm bắt các chủ đề đã đề cập trong văn bản đầu vào và gán điểm mức độ quan trọng cho mỗi câu trong văn bản đầu vào theo biểu diễn của nó.  Phương pháp dựa trên trọng tâm hay phân cụm câu: Trong phương pháp này, hệ thống tóm tắt trích rút đa văn bản xác định các câu trọng tâm và quan trọng nhất trong một cụm sao cho chúng chứa các thông tin quan trọng liên quan đến cụm chủ đề chính [11,12,13]. Trọng tâm của câu được xác định bằng cách sử dụng trọng tâm của các từ. Cách phổ biến để xác định trọng tâm của từ là tìm tâm của cụm văn bản trong không gian véc tơ.

Trọng tâm của một cụm bao gồm các từ có điểm trọng số TF-IDF lớn hơn một giá trị ngưỡng xác định trước.  Phương pháp dựa trên đồ thị: Phương pháp này sử dụng đồ thị dựa trên câu để biểu diễn một văn bản hoặc cụm văn bản. Phương pháp biểu diễn này đã được sử dụng phổ biến cho các hệ thống tóm tắt trích rút như: LexRank [11], TextRank [14]. Trong hệ thống LexRank [11], các câu được cho điểm bằng cách biểu diễn các câu của văn bản sử dụng một đồ thị vô hướng sao cho mỗi nút trong đồ thị biểu diễn một câu từ văn bản đầu vào, trọng số của cạnh kết nối là độ tương tự ngữ nghĩa giữa hai câu tương ứng (sử dụng độ tương tự cosine) và sử dụng một thuật toán xếp hạng để xác định độ quan trọng của từng câu.

Các câu được xếp hạng dựa trên điểm LexRank giống như thuật toán PageRank [15] chỉ khác là đồ thị LexRank là đồ thị vô hướng.  Phương pháp dựa trên ngữ nghĩa: Phân tích ngữ nghĩa tiềm ẩn (LSA - Latent Semantic Analysis) là kỹ thuật học không giám sát biểu diễn ngữ nghĩa của văn bản dựa trên sự đồng xuất hiện của các từ được quan sát. Các bước cho điểm câu của các hệ thống tóm tắt trích rút dựa trên LSA [16,17] bao gồm: tạo ma trận đầu vào (ma trận từ - câu) và áp dụng phương pháp phân tích giá trị suy biến (SVD - Singular Value Decomposition) cho ma trận đầu vào để xác định mối quan hệ giữa các từ và các câu.  Phương pháp dựa trên học máy: Phương pháp này chuyển bài toán tóm tắt văn bản thành bài toán phân loại văn bản có giám sát.

Hệ thống học bởi các mẫu học để phân loại một câu của văn bản đánh giá thuộc về lớp “được chọn” hoặc lớp “không được chọn” sử dụng một tập các văn bản huấn luyện (tập các văn bản và các bản tóm tắt tham chiếu tương ứng do con người tạo ra). Trong các hệ thống tóm tắt dựa 2 trên học máy [18,19,20], các bước thực hiện cho điểm câu bao gồm: trích xuất các đặc trưng từ văn bản đã tiền xử lý và đưa các đặc trưng đã trích xuất vào một mạng nơ ron để nhận được điểm đầu ra.  Phương pháp dựa trên học sâu: Trong [21], Kobayashi và cộng sự đề xuất một hệ thống tóm tắt sử dụng độ tương tự mức văn bản dựa trên các mã hóa từ (nghĩa là các biểu diễn phân bố của từ). Mã hóa của một từ biểu diễn ý nghĩa của nó.

Một văn bản được coi như một “túi câu” và một câu được coi như một “túi từ”. Nhiệm vụ được cụ thể hóa như bài toán tối đa hóa một hàm được xác định bởi tổng âm của các khoảng cách lân cận gần nhất trên các phân bố mã hóa (tức là một tập các mã hóa từ trong một văn bản). Kobayashi và cộng sự chỉ ra rằng độ tương tự mức văn bản có thể xác định những nghĩa phức tạp hơn độ tương tự mức câu. Chen và Nguyen [22] đã đề xuất một hệ thống tóm tắt văn bản tự động sử dụng kỹ thuật học tăng cường và mô hình chuỗi sang chuỗi với kiến trúc bộ mã hóa - giải mã sử dụng mạng nơ ron hồi quy.

Các đặc trưng quan trọng được chọn bằng kỹ thuật mã hóa mức câu sau đó các câu tóm tắt được trích rút. Bên cạnh đó, phải kể đến một số hệ thống như [23,24,25,26,27], các hệ thống này đã sử dụng các kỹ thuật học sâu hiệu quả để tạo bản tóm tắt cuối cùng. Các hệ thống tóm tắt hướng trích rút này có ưu điểm là thực thi đơn giản, nhanh và cho độ chính xác cao vì phương pháp này thực hiện trích rút trực tiếp các câu để người đọc có thể đọc bản tóm tắt với các thuật ngữ chính xác có trong văn bản gốc. Tuy nhiên, phương pháp cận này có những hạn chế cần cần quan tâm như: Vấn đề dư thừa thông tin trong một số câu tóm tắt, các câu được trích rút có thể dài hơn mức trung bình, vấn đề xung đột về thời gian trong bài toán tóm tắt đa văn bản vì các bản tóm tắt trích rút được chọn từ nhiều văn bản đầu vào khác nhau, thiếu ngữ nghĩa và tính liên kết trong các câu tóm tắt vì liên kết không chính xác giữa các câu.

 Tóm tắt văn bản hướng tóm lược: Phương pháp tiếp cận này biểu diễn văn bản đầu vào ở dạng trung gian, sau đó sinh bản tóm tắt với các từ và câu khác với các câu trong văn bản nguồn [28]. Các hệ thống tóm tắt hướng tóm lược sinh ra bản tóm tắt bằng cách hiểu các khái niệm chính trong văn bản đầu vào sử dụng các phương pháp xử lý ngôn ngữ tự nhiên, sau đó diễn giải văn bản để diễn đạt các khái niệm đó với số từ ít hơn và sử dụng ngôn ngữ rõ ràng [29,30].

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu "Phương Pháp Tóm Tắt Văn Bản Sử Dụng Kỹ Thuật Học Sâu Trong Luận Án Tiến Sĩ" trình bày các phương pháp tóm tắt văn bản hiệu quả bằng cách áp dụng các kỹ thuật học sâu. Tài liệu này không chỉ giúp người đọc hiểu rõ hơn về cách thức tóm tắt thông tin một cách chính xác và nhanh chóng, mà còn cung cấp những lợi ích thiết thực trong việc nghiên cứu và viết luận án tiến sĩ. Việc áp dụng các kỹ thuật học sâu sẽ giúp nâng cao chất lượng tóm tắt, từ đó cải thiện khả năng truyền đạt thông tin và giảm thiểu thời gian nghiên cứu.

Nếu bạn quan tâm đến các khía cạnh khác trong lĩnh vực nghiên cứu và luận án tiến sĩ, bạn có thể tham khảo thêm tài liệu Luận án tiến sĩ ngôn ngữ họ ngôn ngữ thơ Nguyễn Bính dựa trên cứ liệu trước 1945, nơi khám phá ngôn ngữ và văn học trong bối cảnh lịch sử. Bên cạnh đó, tài liệu Luận án tiến sĩ hợp đồng dịch vụ logistics theo pháp luật Việt Nam hiện nay sẽ cung cấp cái nhìn sâu sắc về các khía cạnh pháp lý trong lĩnh vực logistics. Cuối cùng, bạn cũng có thể tìm hiểu về Luận án tiến sĩ báo chí học phong cách tản văn báo chí của Ngô Tất Tố, giúp bạn mở rộng kiến thức về phong cách viết trong báo chí. Những tài liệu này sẽ là cơ hội tuyệt vời để bạn đào sâu hơn vào các chủ đề liên quan.