CHƯƠNG 1: BÀI TOÁN TÓM TẮT TIN TỨC TIẾNG VIỆT 1.1 Giới thiệu bài toán tóm tắt văn bản tiếng Việt Sự ra đời của internet đã kéo theo sự bùng nổ về dữ liệu, đặc biệt là các tin tức, bài báo trực tuyến, nhờ vậy mọi người đều có thể cập nhật thông tin từ khắp nơi trên thế giới với tốc độ tính bằng giây. Lượng thông tin khổng lồ này, mặc dù mang lại nhiều lợi ích, nhưng lại là thách thức đối với những cá nhân muốn cập nhật thông tin mà không tốn quá nhiều thời gian để đọc các tài liệu dài, như những nhà nghiên cứu thị trường, những nhà đầu tư, ngoài ra cũng là bài toán lớn cho các hệ thống thông tin khác như hệ thống phân tích hoặc dự đoán thói quen của người dùng, cần xử lý lượng lớn dữ liệu để nắm bắt được các thay đổi của thế giới. Lĩnh vực Xử lý ngôn ngữ tự nhiên (NLP) giải quyết thách thức này thông qua việc phát triển các kỹ thuật tóm tắt văn bản, nhằm mục đích cô đọng các văn bản dài thành những bản tóm tắt ngắn gọn. Những bản tóm tắt này cố gắng duy trì thông điệp cốt lõi và mục đích của văn bản gốc đồng thời giảm đáng kể thời gian dành cho người đọc.
Tóm tắt văn bản nói chung được chia thành hai phương pháp chính: tóm tắt trích xuất (extractive summarization) và tóm tắt tóm lược (abstractive summarization) [5]. Tóm tắt trích xuất bao gồm việc chọn các cụm từ hoặc câu chính từ văn bản gốc và biên soạn chúng để tạo thành một bản tóm tắt. Ngược lại, tóm tắt tóm lược đòi hỏi phải hiểu các ý chính trong văn bản và tạo ra các câu mới với cùng ngữ nghĩa với văn bản gốc, đòi hỏi phải hiểu sâu hơn về ngôn ngữ và mối liên hệ của các từ. Ví dụ một đoạn tin tức về thị trường cổ phiếu: “Thị trường chứng khoán Việt Nam hôm nay chứng kiến sự sôi động không ngừng với hàng loạt cổ phiếu tăng giá mạnh.
Trong số đó, cổ phiếu của các công ty công nghệ và bất động sản được giao dịch nhiều nhất, thu hút sự quan tâm lớn từ phía nhà đầu tư. Các chuyên gia kinh tế nhận định, sự tăng trưởng này phản ánh niềm tin mạnh mẽ vào tiềm năng tăng trưởng kinh tế của Việt Nam trong thời gian tới. Họ cũng lưu ý rằng, bên cạnh cơ hội, thị trường cũng đang đối mặt với không ít thách thức, bao gồm lạm phát và sự biến động của thị trường quốc tế.” Tóm tắt trích xuất: 5 “Thị trường chứng khoán Việt Nam hôm nay chứng kiến sự sôi động với cổ phiếu công nghệ và bất động sản được giao dịch nhiều nhất. Các chuyên gia kinh tế nhận định, sự tăng trưởng phản ánh niềm tin vào tiềm năng kinh tế của Việt Nam, họ cũng lưu ý những thách thức bao gồm lạm phát và sự biến động của thị trường quốc tế.” Trong bản tóm tắt trích xuất này, các câu chính từ văn bản gốc được chọn lọc và biên soạn để tạo thành một bản tóm tắt ngắn gọn, nắm bắt được các điểm chính: hoạt động của thị trường chứng khoán, trọng tâm là cổ phiếu công nghệ và bất động sản, cũng như quan điểm của các chuyên gia kinh tế về tiềm năng tăng trưởng và những thách thức.
Tóm tắt tóm lược: “Hôm nay, thị trường chứng khoán Việt Nam sôi động với sự nổi bật của cổ phiếu công nghệ và bất động sản, cho thấy niềm tin vào tăng trưởng kinh tế dù đối mặt thách thức từ lạm phát và ảnh hưởng từ thị trường quốc tế.” Ở mặt khác, tóm tắt tóm lược diễn đạt lại và cô đọng văn bản gốc thành một dạng mới, tóm tắt những điểm chính mà không sao chép trực tiếp cả câu. Nó đề cập đến sự sôi động của thị trường chứng khoán, các lĩnh vực được quan tâm, triển vọng lạc quan về tăng trưởng kinh tế và thừa nhận những thách thức tiềm ẩn, tất cả đều được trình bày ngắn gọn, tổng hợp. Ví dụ này minh họa sự khác biệt giữa tóm tắt trích xuất và tóm lược: cách đầu tiên chọn các phần của văn bản gốc, trong khi cách sau dùng một cách diễn đạt khác cho nội dung thành một dạng mới, ngắn hơn, cả hai đều nhằm mục đích chuyển văn bản gốc thành dạng mới đơn giản hơn nhưng không làm mất nội dung và ý nghĩa. Bài toán tóm tắt văn bản [13]: Cho văn bản nguồn 𝑋 = {𝑥! , 𝑥" , 𝑥# ,.
𝑙 là độ dài của văn bản nguồn và 𝑥 thuộc bộ từ vựng 𝑉%. Mục tiêu là tạo ra bản tóm tắt 𝑌′ = {𝑦′! , 𝑦′" , 𝑦′# , … , 𝑦′& }. 𝑚 là độ dài của bản tóm tắt 𝑦′ thuộc bộ từ vựng 𝑉'. 𝑚 ≪ 𝑙 để đảm bảo bản tóm tắt sẽ ngắn hơn văn bản nguồn.
6 ● Nếu 𝑌′ ⊆ 𝑋 bản tóm tắt được coi là dạng trích xuất, các thành phần của bản tóm tắt được lấy trực tiếp từ văn bản nguồn. ● Nếu 𝑌′ ⊈ 𝑋 bản tóm tắt là dạng tóm lược, có thành phần của bản tóm tắt không xuất hiện trong văn bản nguồn. Áp dụng bài toán tóm tắt văn bản vào tóm tắt tin tức tiếng Việt đặt ra những thách thức đặc biệt do tính chất ngữ điệu, cấu trúc cú pháp phức tạp và hình thái phong phú của ngôn ngữ Tiếng Việt. Những yếu tố này đòi hỏi sự hiểu biết nâng cao về ngữ nghĩa và sắc thái Tiếng Việt để đảm bảo rằng các bản tóm tắt vừa chính xác đầy đủ vừa mạch lạc về mặt ngôn ngữ, chính tả.
Các mô hình NLP truyền thống, thường được phát triển tập trung vào tiếng Anh, có thể không hoạt động hiệu quả với văn bản tiếng Việt, điều này làm nổi bật sự cần thiết của các phương pháp tiếp cận chuyên biệt. Sự khan hiếm các bộ dữ liệu toàn diện được xử lý dành cho tiếng Việt càng làm phức tạp thêm việc phát triển và đánh giá các mô hình tóm tắt. Đề án này nhằm mục đích khám phá và ứng dụng các kỹ thuật NLP tiên tiến, đặc biệt là mô hình BERT, nhằm giải quyết bài toán tóm tắt văn bản tin tức Tiếng Việt, nâng cao hiệu quả và độ chính xác của các công cụ tóm tắt tiếng Việt.2 Các nghiên cứu liên quan 1.1 Thảo luận các nghiên cứu về tóm tắt văn bản trên thế giới Tóm tắt văn bản là một nhiệm vụ quan trọng trong lĩnh vực Xử lý ngôn ngữ tự nhiên (NLP), đã chứng kiến những tiến bộ đáng kể nhờ nỗ lực của các nhà nghiên cứu trên toàn thế giới. Những nỗ lực nghiên cứu này kéo dài trong nhiều thập kỷ, các phương pháp đã chuyển đổi từ các hệ thống dựa trên quy tắc sang các phương pháp học máy và học sâu phức tạp.
Phần này cung cấp cái nhìn tổng quan về những phát triển này, nhấn mạnh các nghiên cứu then chốt, những đột phá về công nghệ và bối cảnh phát triển của lĩnh vực tóm tắt văn bản trên thế giới. Cách tiếp cận dựa trên quy tắc trong những ngày khởi đầu Bước đột phá đầu tiên trong lĩnh vực tóm tắt văn bản được đánh dấu bằng các hệ thống dựa trên quy tắc vào cuối thế kỷ 20. Các hệ thống này dựa trên các quy tắc 7 ngôn ngữ được xác định trước để xác định các câu hoặc cụm từ chính để đưa vào bản tóm tắt. Một công trình quan trọng trong giai đoạn này là của Luhn (1958), người đã đề xuất một phương pháp dựa trên tần suất của các từ quan trọng [15], đặt nền móng cho việc tóm tắt văn bản tự động.
Đột phá với học máy Sự ra đời của học máy đã mang lại sự thay đổi lớn trong nghiên cứu ở lĩnh vực tóm tắt văn bản. Các kỹ thuật như Máy vectơ hỗ trợ (SVM) và cây quyết định đã được sử dụng để phân loại các câu dựa trên khả năng chúng được đưa vào bản tóm tắt. Công trình của Kupiec, Pedersen và Chen (1995) về một thuật toán tóm tắt văn bản có thể huấn luyện được [12] đã đánh dấu cột mốc quan trọng, cho thấy tiềm năng của học máy trong việc tự động hóa quá trình tóm tắt. Cuộc cách mạng học sâu Thập kỷ vừa qua đã có nhiều thay đổi nhờ cuộc cách mạng học sâu.
Sự ra đời của các mô hình khung tuần tự (seq2seq) của Sutskever, Vinyals và Le (2014) [18] cũng như sự phát triển của các cơ chế chú ý (attention) và mô hình biến đổi (Transformer) sau đó đã cải thiện đáng kể chất lượng trong cả bài toán tóm tắt trích xuất và tóm tắt tóm lược. Đáng chú ý là mô hình BERT của Devlin et al. (2018) [10] và GPT của OpenAI đã thiết lập ra các tiêu chuẩn mới trong việc tạo các bản tóm tắt mạch lạc và phù hợp với ngữ cảnh. Sự xuất hiện của mã hoá ngữ cảnh (Contextual Embeddings) và các mô hình biến đổi (Transformer) Khái niệm mã hoá ngữ cảnh, được giới thiệu bởi các mô hình như BERT (Devlin và cộng sự, 2018) [10] và ELMo (Peters và cộng sự, 2018) [16], đã thay đổi cách tiếp cận trong việc hiểu các sắc thái ngữ nghĩa của văn bản, mang lại lợi ích đáng kể cho các nhiệm vụ tóm tắt tóm lược nói riêng và Xử lý ngôn ngữ tự Nhiên nói chung.
Các mô hình biến đổi (Transformer), với cơ chế tự chú ý (self-attention), đã cải tiến hơn nữa khả năng nắm bắt bản chất của văn bản qua các chuỗi dài, khiến chúng đặc biệt phù hợp để ứng dụng trong tóm tắt các văn bản phức tạp. Lĩnh vực tóm tắt văn bản đã được nghiên cứu từ lâu trên thế giới, đi từ việc sử 8 dụng các cách xử lý dựa trên quy tắc, tới sự phát triển các mô hình học máy tiên tiến ngày nay, đã cho thấy sự phát triển mạnh mẽ và tầm quan trọng của lĩnh vực này.2 Thảo luận một số nghiên cứu về tóm tắt văn bản tại Việt Nam Tại Việt Nam, lĩnh vực tóm tắt văn bản cũng nhận được nhiều chú ý trong thời gian gần đây. Các nghiên cứu mới nhất tập trung vào việc áp dụng các kỹ thuật NLP tiên tiến vào giải quyết bài toán. Phần này nêu bật những nghiên cứu chính ở Việt Nam đã góp phần đáng kể vào sự tiến bộ của công nghệ tóm tắt văn bản Tiếng Việt.
Sử dụng các mô hình khung tuần tự Trong nghiên cứu “Tóm tắt văn bản tiếng Việt tự động với mô hình Sequence- to-Sequence” của Lâm Quang Tường, Phạm Thế Phi và Đỗ Đức Hào, các nhà nghiên cứu đã sử dụng phương pháp học sâu để tự động hóa việc tóm tắt văn bản cho Tiếng Việt [5].