Đồ án xây dựng chương trình tóm tắt văn bản tiếng Việt - ĐH Việt Hàn

Tiểu luận đồ án chuyên ngành 2 nghiên cứu xây dựng chương trình tóm tắt văn bản tiếng Việt tự động, phân tích thuật toán xử lý ngôn ngữ tự nhiên.

Chuyên ngành

Khoa học máy tính

Tác giả

Ẩn danh

Người đăng

Ẩn danh

Thể loại

Đồ án chuyên ngành

2022

51
0
0

Phí lưu trữ

30 Point

Tóm tắt

I. Tổng quan nghiên cứu tóm tắt văn bản tiếng Việt tự động

Tóm tắt văn bản tự động là nhánh nghiên cứu quan trọng trong lĩnh vực khai thác văn bản và xử lý ngôn ngữ tự nhiên. Khối lượng tài liệu số bằng tiếng Việt đang bùng nổ mạnh mẽ mỗi ngày. Việc đọc hiểu và sàng lọc thông tin thủ công tiêu tốn nhiều thời gian cùng nhân lực. Do đó, đồ án xây dựng chương trình tóm tắt văn bản tiếng Việt cung cấp công cụ đắc lực hỗ trợ người dùng tiếp cận tri thức nhanh chóng. Hệ thống tóm tắt vận hành dựa trên hai tiếp cận chủ đạo: tóm tắt rút trích và tóm tắt trừu tượng. Tiếp cận rút trích thực hiện quét, đánh giá và chọn lọc các câu quan trọng nhất từ văn bản gốc. Tiếp cận trừu tượng tạo lập các câu mới nhằm diễn đạt nội dung cốt lõi của bài viết. Trong giai đoạn hiện nay, giải pháp rút trích được ưu tiên phát triển nhờ tính ổn định và bảo toàn ngữ nghĩa tốt. Đồ án tập trung nghiên cứu kiến trúc hệ thống xử lý hoàn chỉnh. Mô hình bao gồm ba khâu chính: tiền xử lý văn bản tiếng Việt, tính toán trọng số nội dung và sinh bản tóm tắt hoàn chỉnh.

1.1. Khái niệm và mục tiêu của bài toán tóm tắt tự động

Tóm tắt văn bản tự động là quá trình chuyển đổi văn bản dài thành phiên bản rút gọn có chọn lọc. Bản tóm tắt phải truyền tải đầy đủ các thông điệp chính yếu của văn bản nguồn ban đầu. Mục tiêu hàng đầu của đồ án là giảm tải độ dài tài liệu mà không làm sai lệch ngữ nghĩa gốc. Hệ thống tự động phân loại, loại bỏ thông tin dư thừa và bảo tồn tính mạch lạc văn bản. Việc này hỗ trợ tối ưu hóa quy trình tra cứu tài liệu chuyên ngành, bài báo học thuật và tin tức báo chí. Người đọc nắm bắt nhanh nội dung trọng tâm chỉ trong thời gian ngắn.

1.2. Phân loại hai phương pháp tóm tắt văn bản chính

Công nghệ tóm tắt văn bản chia thành hai nhánh kỹ thuật căn bản: rút trích và trừu tượng. Phương pháp rút trích xác định các câu nguyên văn có giá trị thông tin cao nhất trong văn bản để ghép thành bản tóm tắt. Kỹ thuật này giữ nguyên câu từ tác giả, đảm bảo tính xác thực và hạn chế lỗi ngữ pháp. Ngược lại, phương pháp trừu tượng mô phỏng quá trình tư duy của con người. Hệ thống đọc hiểu ngữ cảnh, phân tích cấu trúc sâu và tạo ra các câu văn mới hoàn toàn. Đồ án ưu tiên triển khai mô hình rút trích kết hợp học máy nhằm đạt độ chính xác tối ưu trên kho ngữ liệu tiếng Việt.

II. Phân tích các thách thức khi tóm tắt văn bản tiếng Việt

Xây dựng chương trình tóm tắt văn bản tiếng Việt đối mặt với nhiều rào cản đặc thù về mặt ngôn ngữ học. Tiếng Việt thuộc loại hình ngôn ngữ đơn lập, không biến đổi hình thái từ. Khoảng trắng trong văn bản tiếng Việt không đóng vai trò phân tách ranh giới từ vựng như tiếng Anh. Một từ tiếng Việt có thể bao gồm một hoặc nhiều tiếng kết hợp. Việc phân tách từ không chính xác sẽ dẫn tới sai lệch trong các bước phân tích tiếp theo. Thêm vào đó, quan hệ liên kết câu và cấu trúc ngữ nghĩa tiếng Việt rất đa dạng. Các hiện tượng đa nghĩa, đồng nghĩa và phép thế diễn ra phổ biến trong các văn bản đời sống. Thuật toán tóm tắt cần nhận diện chính xác các chuỗi từ vựng và mối liên kết ngữ nghĩa ngầm ẩn giữa các đoạn văn. Hiện tượng dư thừa thông tin cũng gây khó khăn lớn cho việc chọn lọc câu. Nhiều câu văn chứa các từ nối mang tính chất tu từ nhưng không mang giá trị thông tin cốt lõi. Do đó, việc xây dựng bộ tiêu chí đặc trưng rõ ràng là yêu cầu bắt buộc để đánh giá đúng tầm quan trọng của từng câu.

2.1. Đặc thù phức tạp trong cấu trúc từ vựng tiếng Việt

Cấu trúc từ ghép và từ láy trong tiếng Việt đặt ra thách thức lớn cho bài toán phân tích tự động. Một âm tiết có thể đứng độc lập hoặc kết hợp thành từ đa âm tiết mang ý nghĩa hoàn toàn khác biệt. Nếu quá trình tách từ thất bại, mô hình toán học sẽ hiểu sai toàn bộ ngữ cảnh câu văn. Ngoài ra, danh sách từ dừng trong tiếng Việt phong phú và thay đổi theo từng thể loại văn bản. Việc loại bỏ các từ chức năng không mang nội dung đòi hỏi bộ từ điển từ dừng chuẩn xác. Quá trình này giúp mô hình tập trung tính toán vào các từ vựng mang trọng số thông tin cao.

2.2. Vấn đề liên kết ngữ nghĩa và sự dư thừa thông tin

Tính liên kết ngữ nghĩa thể hiện mối quan hệ mạch lạc giữa các câu trong toàn bộ văn bản. Khi thực hiện tóm tắt rút trích thuần túy, các câu được chọn có thể rời rạc và thiếu sự liền mạch. Người đọc dễ gặp khó khăn khi tiếp nhận văn bản nếu trật tự câu bị xáo trộn. Bên cạnh đó, hiện tượng trùng lặp thông tin giữa các đoạn văn cũng thường xuyên xuất hiện. Nhiều câu diễn đạt cùng một ý tưởng bằng các cấu trúc ngữ pháp khác nhau. Nếu không sử dụng thuật toán khử trùng lặp như MMR, bản tóm tắt sẽ chứa nhiều nội dung thừa thãi, làm giảm chất lượng bản tóm tắt đầu ra.

III. Phương pháp xây dựng chương trình tóm tắt văn bản tiếng Việt

Quy trình xây dựng chương trình tóm tắt văn bản tiếng Việt gồm ba giai đoạn kỹ thuật cốt lõi: tiền xử lý, xử lý đặc trưng và sinh kết quả. Giai đoạn tiền xử lý thực hiện chuẩn hóa văn bản, tách từ tiếng Việt và loại bỏ từ dừng. Bước này giúp chuyển đổi văn bản thô thành các vector dữ liệu số học sạch. Tiếp theo, hệ thống áp dụng các mô hình nhúng từ như Word2Vec kết hợp giải thuật gom cụm đoạn văn. Phương pháp này phân nhóm các phần có nội dung tương đồng để đảm bảo độ bao phủ thông tin toàn diện. Hệ thống trích xuất các đặc trưng then chốt của câu như độ dài câu, vị trí xuất hiện và mối tương quan với tiêu đề bài viết. Các câu mở đầu hoặc kết đoạn thường mang trọng số ưu tiên cao. Thuật toán học máy tổng hợp các đặc trưng này để chấm điểm trọng số cho từng câu đơn lẻ. Cuối cùng, giai đoạn sinh kết quả sử dụng giải thuật MMR nhằm tái sắp xếp các câu có điểm số cao nhất. Cách làm này vừa giữ trọn ý chính vừa loại trừ triệt để sự lặp lại ngữ nghĩa.

3.1. Kỹ thuật tiền xử lý và mô hình hóa không gian vector

Tiền xử lý là bước nền tảng quyết định độ chính xác của toàn bộ chương trình tóm tắt. Văn bản đầu vào được phân tách thành từng câu và từng từ đơn vị thông qua công cụ tách từ tiếng Việt chuyên biệt. Dữ liệu tiếp tục được lọc sạch bằng cách xóa bỏ các ký tự đặc biệt và danh sách từ dừng phổ biến. Sau đó, mô hình Word2Vec chuyển đổi các từ vựng thành vector số học trong không gian nhiều chiều. Kỹ thuật này giúp máy tính nắm bắt chính xác mối quan hệ tương đồng ngữ nghĩa giữa các từ. Không gian vector hóa tạo điều kiện thuận lợi cho việc phân cụm nội dung và tính toán khoảng cách ngữ nghĩa giữa các đoạn văn.

3.2. Thuật toán trích chọn đặc trưng và xếp hạng câu quan trọng

Mỗi câu trong văn bản được lượng hóa thông qua tập hợp các đặc trưng tóm tắt đa dạng. Đặc trưng vị trí ưu tiên các câu nằm ở đầu đoạn văn hoặc phần mở bài của tài liệu. Đặc trưng tiêu đề cộng điểm cho những câu chứa từ khóa xuất hiện trong đề mục chính. Ngoài ra, chuỗi từ vựng và liên kết cấu trúc giúp đánh giá tính mạch lạc của câu văn trong toàn văn. Thuật toán học máy tổng hợp tất cả điểm số đặc trưng nhằm xếp hạng thứ tự ưu tiên của từng câu. Cuối cùng, phương pháp MMR lựa chọn các câu điểm cao nhất đồng thời loại bỏ các câu trùng lặp ý nghĩa.

IV. Kết luận và ứng dụng thực tiễn của tóm tắt văn bản tiếng Việt

Đồ án xây dựng chương trình tóm tắt văn bản tiếng Việt mang lại giải pháp công nghệ thiết thực cho thời đại bùng nổ thông tin. Chương trình tự động hóa hoàn toàn quy trình rút trích thông tin cốt lõi từ các văn bản dài. Hệ thống đạt độ chính xác cao nhờ sự kết hợp chặt chẽ giữa xử lý ngôn ngữ tự nhiên và các giải thuật học máy hiện đại. Kết quả thử nghiệm cho thấy bản tóm tắt giữ được mạch văn tự nhiên và các luận điểm chính yếu của tác giả. Tiềm năng ứng dụng của chương trình trải rộng trên nhiều lĩnh vực thực tế khác nhau. Các hệ thống tin tức trực tuyến có thể tích hợp mô hình để tạo nhanh các bản tóm tắt tin hàng ngày. Trong lĩnh vực giáo dục và nghiên cứu, công cụ hỗ trợ sinh viên cùng chuyên gia duyệt nhanh hàng trăm tài liệu tham khảo. Ngoài ra, việc kết hợp mô hình với các công cụ tìm kiếm tiếng Việt sẽ tối ưu hóa hiển thị kết quả truy vấn. Đây là tiền đề quan trọng để tiếp tục phát triển các mô hình tóm tắt trừu tượng chuyên sâu hơn trong tương lai.

4.1. Ứng dụng trong hệ thống tìm kiếm và xử lý dữ liệu lớn

Tích hợp chương trình tóm tắt vào công cụ tìm kiếm giúp nâng cấp trải nghiệm tra cứu thông tin trực tuyến. Hệ thống trích xuất ngay đoạn mô tả súc tích cho từng kết quả tìm kiếm thay vì chỉ hiển thị các đoạn trích ngẫu nhiên. Người dùng nắm bắt nhanh nội dung trang web trước khi quyết định truy cập chi tiết. Trong môi trường dữ liệu lớn, công nghệ này hỗ trợ phân loại và quản lý tự động hàng triệu văn bản số. Các doanh nghiệp dễ dàng tổng hợp báo cáo tài chính, tài liệu hành chính và phản hồi khách hàng trong thời gian cực ngắn.

4.2. Hướng phát triển hoàn thiện mô hình tóm tắt trừu tượng

Mặc dù phương pháp rút trích đạt hiệu quả thực tế cao, hướng tiếp cận trừu tượng vẫn là đích đến lý tưởng của xử lý ngôn ngữ. Việc phát triển các mạng nơ-ron sâu như Transformer và mô hình sinh ngôn ngữ tự nhiên sẽ nâng tầm chất lượng tóm tắt tiếng Việt. Hệ thống trong tương lai có khả năng tự động diễn đạt lại câu chữ linh hoạt và mượt mà hơn. Ngoài ra, việc mở rộng kho ngữ liệu huấn luyện tiếng Việt chuẩn hóa sẽ giúp mô hình thích nghi tốt với nhiều chuyên ngành đặc thù như y tế, luật pháp và kỹ thuật công nghệ cao.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI. Nếu bạn thấy nội dung không chính xác hoặc có vấn đề, vui lòng Báo lỗi nội dung.

18/08/2026
Tiểu luận đồ án chuyên ngành 2 đề tài xây dựng chương trình tóm tắt văn bản tiếng việt

Trích đoạn nội dung tài liệu

MỞ ĐẦU Ông Bửu Khánh – Nguyễn Ngọc Anh Khoa Trang 6 1.1 Khai thác văn bản.1 Khai thác văn bản là gì ? Với sự phát triển vượt bậc của khoa học công nghệ đặc biệt là CNTT, ngày nay lượng thông tin tồn tại trên các phương tiện truyền thông (internet, TV, news, email.) phát triển một cách nhanh chóng. Mỗi một ngày lại có vô số thông tin mới được tạo ra từ nhiều nguồn khác nhau. Chúng đòi hỏi phải được lưu trữ để truy cập và sử dụng khi cần thiết. Đi từ nhu cầu thực tế đó, lĩnh vực khai thác dữ liệu (Data Mining - DM) mà cụ thể là khai thác văn bản (Text Mining - TM) đặt ra nhiều yêu cầu nghiên cứu khác nhau liên quan phục vụ cho việc quản lý và khai thác nguồn dữ liệu khổng lồ này.

Vậy thế nào là khai thác dữ liệu văn bản ? Khai thác dữ liệu là các phương pháp trích chọn, sàng lọc để tìm ra các thông tin cần thiết từ một kho dữ liệu ban đầu. Các thông tin này chưa được biết trước, có giá trị và tiềm năng sử dụng. Văn bản (Text) là một kiểu dữ liệu, cụ thể : là một tập hợp các từ đi liền nhau nhằm diễn đạt một nội dung nào đó. Do vậy văn bản là loại dữ liệu không có cấu trúc hoặc bán cấu trúc.

Khai thác văn bản, còn được biết đến như phân tích văn bản thông minh (inteligent text analysis), khai thác dữ liệu văn bản (text data mining) hoặc khám phá tri thức văn bản (knowledge-discovery in text - KDT) liên quan đến quá trình trích lọc các thông tin, tri thức cần thiết chưa được khai phá và có giá trị sử dụng từ các kho văn bản. Khai thác văn bản là một lĩnh vực kết hợp nhiều lĩnh vực nghiên cứu khác liên quan : tìm kiếm thông tin (information retrieval), khai thác dữ liệu (data mining), học máy (machine learning), ngôn ngữ học máy tính (computer linguistics). Với hơn 80% thông tin dữ liệu đang được lưu trữ dưới dạng văn bản (theo thống kê của Bách khoa toàn thư WIKIPEDIA), khai thác văn bản có tiềm năng ứng dụng rất lớn và ngày càng trở nên quan trọng hơn.2 Một số bài toán tiêu biểu trong Khai thác văn bản Có thể nêu ra một số bài toán có ứng dụng quan trọng trong lĩnh vực khai thác văn bản sau : - Phân loại văn bản (Text Categorization - Text Classification): Cho một tập các văn bản đã được phân loại theo các chủ đề cho trước (VD: kinh tế, triết học, thể thao, văn hoá, …. Xuất hiện một văn bản mới chưa được phân loại, vấn đề đặt ra là xác định văn bản đó thuộc loại - chủ đề nào.

Ông Bửu Khánh – Nguyễn Ngọc Anh Khoa Trang 7 - Lập nhóm văn bản (Text Clustering) : Từ một tập hợp văn bản bất kỳ, cần lập ra các nhóm văn bản căn cứ theo độ tương tự về nội dung của chúng. Số nhóm này có thể do người dùng chỉ định hoặc hệ thống lựa chọn số nhóm thích hợp. - Tóm tắt văn bản (Text Summarization) : Cho một văn bản bất kỳ, cần đưa ra một thể hiện nội dung ngắn gọn cho văn bản đó. - Tìm kiếm thông tin (Information Retrievel) : Từ một tập hợp dữ liệu (ở đây, dữ liệu được hiểu là các văn bản) ban đầu, người dùng đưa ra một truy vấn về thông tin cần tìm kiếm.

Hệ thống sẽ cung cấp một danh sách dữ liệu được xếp loại thoả mãn yêu cầu thông tin đó.2 Bài toán TTVB - Automatic Text Summarization (ATS) Trước tiên phải hiểu định nghĩa cụ thể cho bài toán TTVB.1 Tóm tắt văn bản (TTVB) TTVB là quá trình thực hiện giảm đi độ dài, sự phức tạp của một văn bản trong khi vẫn giữ lại được các nội dung có giá trị của nó. TTVB nhằm đưa ra thể thể hiện về nội dung một cách ngắn gọn của văn bản. Có thể phát biểu bài toán TTVB như sau: Đầu vào: Một văn bản hoặc một tập hợp văn bản Đầu ra: Nội dung ngắn gọn(tóm tắt) hoặc một tập các nội dung ngắn gọn của chúng. Hình 1: Định nghĩa bài toán TTVB Thực ra TTVB đã xuất hiện từ rất lâu, nhưng chúng thường được thực hiện một cách truyền thống do con người.

Tác dụng chính của những tóm tắt kiểu này là để giúp đỡ cho người đọc có cái nhìn tổng quát về nội dung chính sẽ được trình bày trong tài liệu. Trong hầu hết các trường hợp, người đọc trước khi quyết định xem có nên đọc một văn bản nào đó không thường thích nhìn vào tóm tắt của văn bản đó để xem nội dung của nó có thoả mãn nhu cầu về thông tin của mình hay không.2 Ứng dụng của TTVB TTVB có rất nhiều ứng dụng thực tế. Có thể nêu ra một số ứng dụng chính như: Tóm tắt phục vụ máy tìm kiếm (Search engine hits): tóm tắt các thư viện dữ liệu khổng lồ để phục vụ cho mục đích tìm kiếm thông tin. Với tài nguyên dữ liệu lớn, mỗi lần thực hiện tìm kiếm nếu chỉ rà soát thông tin trên danh mục các tóm tắt Ông Bửu Khánh – Nguyễn Ngọc Anh Khoa Trang 8 của dữ liệu sẽ tiết kiệm thời gian và giảm độ phức tạp của bài toán tìm kiếm.

Hiện một số địa chỉ tìm kiếm nổi tiếng như Google, Altavista. đều đã ứng dụng rất tốt TTVB vào hệ thống của mình. Tóm tắt tin tức (Multimedia news summaries): có ứng dụng rất lớn trong thương mại. Giá trị của thông tin trong thương mại là rất quan trọng.

Song với lượng thông tin lớn được xuất bản mỗi ngày, doanh nghiệp không thể tiếp nhận và xử lý hết chúng. Tóm tắt tin tức có thể giúp cho thu thập đủ các thông tin cần thiết từ nguồn dữ liệu này. Đã có nhiều công ty (kể cả ở Việt Nam) khai thác giá trị thương mại này, bằng cách cung cấp cho khách hàng những thông tin được xuất bản trong ngày có nội dung liên quan đến một lĩnh vực được “đặt hàng” trước nào đó. Hỗ trợ tìm kiếm đa ngôn ngữ: Giả sử người dùng cần tìm các tài liệu về một vấn đề nào đó.

Nhưng các tài liệu này lại tồn tại dưới dạng các ngôn ngữ khác nhau. Trưóc hết tóm tắt nội dung của tài liệu, sau đó áp dụng hệ thống dịch tự động đưa chúng về ngôn ngữ của người đọc. Nếu tài liệu này thoả mãn yêu cầu người dùng, nó sẽ được người dùng tìm cách dịch và sử dụng. Tóm tắt còn có thể sử dụng để xây dựng thông tin cho các thiết bị cầm tay (máy tính bỏ túi, điện thoại di động).

Với khả năng hiển thị hạn chế của các thiết bị này, việc cô đọng thông tin để phù hợp với kích thước sử dụng là cần thiết. Một số ứng dụng khác của TTVB như: hỗ trợ người khiếm thị: cô đọng nội dung và đọc lại cho người dùng; giúp đỡ điều trị bệnh nhân: tóm tắt và so sánh sự điều trị cần thiết cho mỗi bệnh nhân; thu thập thông minh: tự động xây dựng một tiểu sử 500 từ về chủ tịch Hồ Chí Minh; ….3 Giải quyết bài toán TTVB Trên thế giới, bài toán TTVB đã xuất hiện từ rất lâu. Những kỹ thuật đầu tiên áp dụng để TTVB xuất hiện từ những năm 50 của thế ký trước (như nghiên cứu của Luhn năm 1959. Sau đó, chúng tiếp tục được nghiên cứu và đạt nhiều kết quả ngày càng tốt hơn, cho nhiều loại ngôn ngữ như tiếng Anh, tiếng Pháp, tiếng Nhật, tiếng Trung… (các nghiên cứu này sẽ được trình bày trong chương tiếp theo của báo cáo).

Ở Việt Nam bước đầu cũng đã có một số nghiên cứu giải quyết bài toán cho ngôn ngữ tiếng Việt nhưng số lượng cũng như chất lượng con thấp do đây là một vấn đề còn khá mới mẻ.3 Mục đích lựa chọn đề tài Những năm gần đây là khoảng thời gian Internet có sự phát triển mạnh mẽ tại Việt Nam. Cách đây khoảng 7,8 năm nếu như Internet còn khá xa lạ thì hiện nay hiện tượng người dùng truy nhập và sử dụng các thông tin tiếng Việt trên Internet Ông Bửu Khánh – Nguyễn Ngọc Anh Khoa Trang 9 đã trở nên phổ biến. Xuất phát từ sự thay đổi đó rất nhiều các bài toán thuộc lĩnh vực khai thác văn bản cho tiếng Việt đã được nghiên cứu và ban đầu có một số ứng dụng thực tế (ví dụ ứng dụng trong hệ thống tìm kiếm thông tin trang Web tiếng Việt như Vinaseek, Panvietnam. Bài toán TTVB rõ ràng có một vai trò khá quan trọng trong lĩnh vực khai thác dữ liệu nói chung và khai thác văn bản nói riêng.

Nhưng đáng ngạc nhiên là số lượng các nghiên cứu giải quyết bài toán đối với tiếng Việt lại rất ít. Bởi vậy tác giả đã mạnh dạn chọn TTVB tiếng Việt làm nội dung nghiên cứu cho đề tài tốt nghiệp. Qua việc nghiên cứu các phương pháp, kỹ thuật có thể ứng dụng để giải quyết bài toán, tác giả hy vọng có thể tiếp cận với nhiều kỹ thuật tiên tiến và mở rộng kiến thức của mình, đặc biệt trong lĩnh vực Khai thác dữ liệu.4 Các mục tiêu cụ thể trong đồ án Khi lựa chọn đề tài này, em mong rằng có thể đưa ra và thực hiện phương án giải quyết cụ thể cho bài toán TTVB tiếng Việt. Vì đây là vấn đề còn khá mới mẻ ở Việt Nam, em đặt mục tiêu nghiên cứu nền tảng cơ sở của bài toán và hy vọng nó có thể làm cơ sở để nghiên cứu phát triển cao hơn sau này.

Chính vì vậy, các mục tiêu cụ thể được đưa ra trong đồ án: - Nghiên cứu tổng quan bài toán TTVB. - Nghiên cứu và trình bày các phương pháp đã có trên thế giới cho kết quả tốt đối với bài toán TTVB. - Áp dụng các phương pháp đã nghiên cứu để thực hiện xây dựng cụ thế một hệ thống TTVB tiếng Việt. Cụ thể trong đồ án này phương pháp được lựa chọn là kỹ thuật Word2Vec và K-mean Cluster.

Ông Bửu Khánh – Nguyễn Ngọc Anh Khoa Trang 10 CHƯƠNG II CÁC PHƯƠNG ÁN GIẢI QUYẾT BÀI TOÁN TÓM TẮT VĂN BẢN Ông Bửu Khánh – Nguyễn Ngọc Anh Khoa Trang 11 Trước khi đi vào phân tích cụ thể một số phương pháp thực hiện TTVB, cần tìm hiểu qua một số khái niệm cơ bản, ví dụ như: giải quyết bài toán TTVB nhằm thực hiện mục đích gì, thực hiện thế nào, bao gồm các bước nào… 2.1 Một số khái niệm cơ bản về TTVB 2.1 Mô hình một hệ thống TTVB.1 Các loại TTVB Tóm tắt của một văn bản là một thể hiện ngắn gọn nội dung của văn bản đó. Tuy vậy không phải mỗi văn bản đều chỉ có thể có một tóm tắt duy nhất cho nó.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Cách trích dẫn tài liệu này

Chuẩn Việt Nam
Ông Bửu Khánh, Nguyễn Ngọc Anh Khoa (2022), Xây dựng chương trình tóm tắt văn bản tiếng Việt, Đồ án chuyên ngành, Trường Đại học Công nghệ Thông tin & Truyền thông Việt Hàn, Đà Nẵng.
APA 7
Ông, B. K., & Nguyễn, N. A. K. (2022). Xây dựng chương trình tóm tắt văn bản tiếng Việt [Đồ án chuyên ngành, Trường Đại học Công nghệ Thông tin & Truyền thông Việt Hàn]. vn-document.net. https://vn-document.net/document/tieu-luan-do-an-chuyen-nganh-2-de-tai-xay-dung-chuong-trinh-tom-tat-van-ban-tieng-viet/9443568467
IEEE
B. K. Ông and N. A. K. Nguyễn, "Xây dựng chương trình tóm tắt văn bản tiếng Việt," Đồ án chuyên ngành, Trường Đại học Công nghệ Thông tin & Truyền thông Việt Hàn, Đà Nẵng, 2022. [Online]. Available: https://vn-document.net/document/tieu-luan-do-an-chuyen-nganh-2-de-tai-xay-dung-chuong-trinh-tom-tat-van-ban-tieng-viet/9443568467

Tạo trích dẫn cho tài liệu khác