Chương 1 Giới thiệu 1 Giới thiệu đề tài Ngày nay, thế giới đã và đang chứng kiến sự phát triển nhanh chóng của mạng xã hội, nơi mọi người tìm thấy một kênh thuận tiện để bày tỏ ý tưởng, quan điểm và cảm xúc của mình. Có một số blog, bài đăng và bình luận được thực hiện bởi những người dùng phổ thông rất thú vị và thu hút nhiều sự chú ý của khán giả. Những bài viết đó nhiều lần được các biên tập viên lựa chọn để xuất bản thành những bài báo chất lượng cao. Tuy nhiên, vì là những người viết không chuyên nghiệp, người dùng thường không viết phần tóm tắt và đặt tiêu đề cho bài viết của họ mà thay vào đó các biên tập viên sẽ đảm nhận công việc này.
Nhiệm vụ này rất quan trọng vì phần tóm tắt và tiêu đề không chỉ giúp bài viết trở nên chuyên nghiệp hơn mà còn giúp người đọc nắm bắt thông tin nhanh chóng và đầy đủ hơn. Hình 1 là ví dụ minh hoạ giao diện trang chủ của các trang báo điện tử thường hiện thị phần tóm tắt và tiêu đề các bài báo giúp người đọc nắm bắt nhanh thông tin và lựa chọn bài viết phù hợp với nhu cầu của mình. Tuy nhu cầu thực tế là vậy nhưng với số lượng bài viết khổng lồ, công việc tóm tắt bài viết và đặt tiêu đề này làm tiêu tốn tương đối nhiều thời gian và sức lực để xử lý. Đồng thời, vì không phải là tác giả của bài viết, người biên tập thường khó nắm bắt hết quan điểm và nội dung người viết muốn truyền tải làm cho nội dung phần tóm tắt và tiêu đề không bám sát bài viết gốc.
Hình 1: Ví dụ minh hoạ giao diện trang chủ báo điện tử Từ nhu cầu thực tế đó cùng với sự phát triển vượt bậc của các kỹ thuật trí tuệ nhân tạo, tôi tập trung nghiên cưú để xây dựng 1 mô hình tự động tóm tắt bài viết tối ưu, ứng dụng cụ thể giải quyết nhu cầu tạo tiêu đề cho bài viết. Với mô hình này, tiêu đề bài viết sẽ được tạo ra tự động trong thời gian ngắn mà vẫn đảm bảo độ dài và văn phạm hợp lý, đồng thời tiêu đề tự động cũng truyền tải được nội dung trọng tâm của văn bản gốc. 1 2 Lý do chọn đề tài Các bất cập và nhu cầu thực tế đã đề cập bên trên vô tình xuất hiện khi tôi nghiên cứu các bài toán xử lý ngôn ngữ tự nhiên áp dụng trên dữ liệu báo chí. Việc thiếu sót tiêu đề cho các bài báo không chỉ gây khó khăn và tốn thời gian cho việc đọc hiểu dữ liệu mà còn dẫn đến việc thiếu dữ liệu, khó khăn, làm giảm độ hiệu quả của các bài phân tích, tổng hợp.
Tôi nhận thấy nhu cầu tóm tắt văn bản nhằm tạo tiêu đề tự động không chỉ cần thiết cho người đọc mà còn hỗ trợ được rất nhiều cho các bài toán, hệ thống xử lý ngôn ngữ tự nhiên như : phân loại văn bản, rút trích thông tin, tìm kiếm nội dung, chọn lọc tài liệu, hỗ trợ hệ thống trả lời câu hỏi. Từ những vấn đề trên, tôi quyết định xây dựng mô hình tóm tắt văn bản ứng dụng giải quyết bài toán tự động đặt tiêu đề cho các bài viết. Đầu tiên là trên tập dữ liệu các bài viết đánh giá thực phẩm của Amazon - một tập dữ liệu tiếng anh phổ biến có sẳn với chất lượng đảm bảo. Sau đó, tôi muốn phát triển mô hình này thành hệ thống tổng quan có thể áp dụng trên tất cả các loại bài viết, cho cả tiếng việt và tiếng anh.
Khi áp dụng mô hình này, tiêu đề tự động được tạo ra giúp tự động hoá quá trình đặt tiêu đề thủ công của biên tập viên. Đồng thời, hệ thống này cũng giúp bổ sung dữ liệu tiêu đề tóm tắt, là đầu vào chất lượng cho các bài phân tích, thống kê, xử lý ngôn ngữ tự nhiên. 3 Phạm vi đề tài Để tập trung giải quyết các vấn đề thực tiễn được nêu lên ở trên, phạm vi đề tài được giới hạn như sau: • Xây dựng một mô hình tóm tắt văn bản cải tiến, ứng dụng vào giải quyết bài toán tự động tạo tiêu đề từ văn bản gốc. • Văn bản sử dụng là các bài bình luận về thực phẩm trên trang web Amazon đã được thu thập và công khai trên diễn đàn Kaggle.
• Đánh giá được mô hình về mức độ hoàn thiện, độ chính xác và tính ứng dụng của kết quả. • Tổng hợp, trình bày và bảo vệ kết quả đề tài như một công trình nghiên cứu khoa học hoàn thiện. 4 Quá trình thực hiện Quá trình thực hiện luận văn này trải qua 4 giai đoạn: Giai đoạn 1: Tìm hiểu những công trình nghiên cứu liên quan đến bài toán tóm tắt văn bản và tự động tạo tiêu đề. Công việc đầu tiên là tìm hiểu các công trình liên quan, các phương pháp trước đây để giải quyết bài toán tóm tắt văn bản.
Sau đó tập trung vào các công trình, mô hình nhằm mục đích tối ưu kết quả tóm tắt văn bản, hướng đến giải quyết nhu cầu tạo tiêu đề tự động. 2 Giai đoạn 2: Xây dựng hệ thống tự động tạo tiêu đề từ kiến thức đã thu thập được theo yêu cầu đã đặt ra. Hệ thống xây dựng phải vừa giải quyết được yêu cầu đã đặt ra, khắc phục các hạn chế của các công trình trước đây, vừa phải có đặc tính nổi bật hơn và tạo ra kết quả tốt hơn, hiệu quả và có tính ứng dụng cao hơn các công trình đã nghiên cứu. Giai đoạn 3: Đây là giai đoạn thu thập dữ liệu để huấn luyện.
Nhằm mục đích xây dựng và đo đạc độ chính xác cũng như tính ứng dụng của mô hình tự động đặt tiêu đề, tôi đã tiến hành tìm kiếm và thu thập một tập dữ liệu đầy đủ, đúng với nhu cầu của bài toán để huấn luyện và để đánh giá mô hình. Giai đoạn 4: Đây là giai đoạn đánh giá kết quả. Sau khi xây dựng mô hình, tôi đánh giá mô hình của mình bằng cả phương pháp tự động và đánh giá thủ công của các tình nguyện viên, qua đó đánh giá được độ chính xác, tính khả quan và thực nghiệm của kết quả mô hình cũng như rút ra được ưu, nhược điểm và định hướng cải thiện, phát triển mô hình này trong tương lai. 3 Chương 2 Công trình liên quan 1 Các công trình liên quan Như đã đề cập ở trên, tôi tập trung tìm hiểu các công trình hướng tới giải quyết bài toán tóm tắt văn bản và các phương pháp cải tiến các công trình này phù hợp với ứng dụng tự động tạo tiêu đề.
Thực tế hiện tại, thông qua tìm kiếm tôi cũng nhận thấy không có dự án nghiên cứu cụ thể nào giải quyết chính xác vấn đề tự động tạo tiêu đề của một bài viết mặc dù nhu cầu này rất cần thiết. Nhìn chung, nhiệm vụ tự động tạo tiêu đề có thể được coi là một trường hợp cụ thể của bài toán tóm tắt văn bản. Cụ thể, một bản tóm tắt văn bản được định nghĩa là một đoạn văn được tạo ra từ một hoặc nhiều văn bản, truyền tải thông tin quan trọng và tổng quát của văn bản gốc và ngắn hơn đáng kể so với văn bản gốc, thường có độ dài không quá một nữa độ dài văn bản gốc. Tự động tóm tắt văn bản là nhiệm vụ tạo ra một bản tóm tắt ngắn gọn và trôi chảy trong khi vẫn giữ được nội dung thông tin chính và ý nghĩa tổng thể của văn bản gốc.
Vào năm 1958, Luhn của IBM đã trình bày phương pháp tóm tắt tự động đầu tiên cho các bài báo kĩ thuật sử dụng phương pháp thống kê thông qua tần suất và phân bố của các từ trong văn bản [3]. Trong suốt hơn 60 năm phát triển của tóm tắt văn bản, cùng với tốc độ phát triển vũ bão của ngành khoa học máy tính đã có rất nhiều các phương pháp được đề xuất nhằm mục đích xây dựng các hệ thống tóm tắt văn bản tự động với độ chính xác tăng dần, đạt được những thành tựu nhất định, ứng dụng trong nhiều lĩnh vực đời sống [4] [5]. Các nghiên cứu về tóm tắt văn bản tập trung vào hai phương pháp tiếp cận chính là phương pháp dựa trên trích xuất 1 và phương pháp dựa trên tóm lược 2 , với nhiều công trình đạt được kết quả khả quan mà tôi đã tìm hiểu và sẽ trình bày dưới đây.1 Phương pháp tóm tắt văn bản dựa trên trích xuất [1] Trong 2 cách tiếp cận, cách tiếp cận dựa trên trích xuất phổ biến hơn, bởi độ phức tạp không quá lớn và vẫn đảm bảo được yêu cầu của một văn bản tóm tắt cần đạt được. Cách tiếp cận này chọn ra các câu văn, cụm từ mang ý nghĩa chính và quan trọng nhất của văn bản gốc, sau đó tổng hợp lại tạo ra một bản tóm tắt.
Nó sẽ cân nhắc độ quan trọng của các câu văn, cụm từ và xếp hạng chúng dựa trên mức độ quan trọng và tương đồng lẫn nhau. Từ đó lựa ra các câu văn, cụm từ quan trọng nhất dựa trên điểm đánh giá và tổng hợp thành bản tóm tắt mà không thay đổi hay thêm bớt bất kì từ ngữ nào của văn bản gốc. Có nhiều phương pháp xây dựng công thức tính điểm cho mỗi câu trong văn bản gốc. Một số nghiên cứu giai đoạn đầu thường sử dụng các đặc trưng như vị trí của câu trong văn bản, tần số xuất hiện của từ ngữ hay sử dụng các cụm từ khóa để tính toán trọng số của mỗi câu, qua đó chọn ra các câu có trọng số cao nhất cho văn bản tóm tắt [6].
Các kỹ thuật tóm tắt gần đây hơn sử dụng các phương pháp học máy và xử 1 Extraction-based 2 Ábstraction-based 4 lý ngôn ngữ tự nhiên nhằm phân tích để tìm ra các thành phần quan trọng của văn bản. Các công trình tiêu biểu có thể kể đến phương pháp của Kupiec,Penderson and Chen năm 1995 sử dụng phân lớp Bayes để kết hợp các đặc trưng lại với nhau [7], công trình nghiên cứu của Lin và Hovy năm 1997 áp dụng phương pháp học máy nhằm xác định vị trí của các câu quan trọng trong văn bản [8] và phương pháp áp dụng các phân tích ngôn ngữ tự nhiên như sử dụng mạng từ Wordnet của Barzilay và Elhadad vào năm 1997 [9].