Luận Án Về Đánh Giá Mức Độ Giống Nhau Của Văn Bản Tiếng Việt

Chuyên khảo phân tích Luận án đánh giá mức độ giống nhau của văn bản tiếng việt, đánh giá các khía cạnh quan trọng, đề xuất hướng nghiên cứu tiếp theo.

Trường đại học

Đại học Đà Nẵng

Chuyên ngành

Kỹ thuật

Người đăng

Ẩn danh

Thể loại

luận án
147
1
0

Phí lưu trữ

35 Point

Mục lục chi tiết

LỜI CAM ĐOAN

LỜI MỞ ĐẦU

Mục tiêu nghiên cứu

Đối tượng và phạm vi nghiên cứu

Phương pháp nghiên cứu

Nhiệm vụ nghiên cứu và kết quả đạt được

Bố cục của luận án

Đóng góp chính của luận án

1. CHƯƠNG 1: TỔNG QUAN TÌNH HÌNH NGHIÊN CỨU

1.1. Một số khái niệm sử dụng trong luận án

1.2. Một số đặc điểm của ngôn ngữ tiếng Việt

1.3. Một số khó khăn và nhập nhằng trong xử lý văn bản tiếng Việt

1.4. Mô hình biểu diễn văn bản

1.4.1. Mô hình biểu diễn văn bản

1.4.2. Nhận xét và đánh giá

1.5. Các phương pháp tính độ tương tự văn bản

1.5.1. Hướng tiếp cận

1.5.2. Bài toán so khớp chuỗi

1.5.3. So sánh văn bản và ứng dụng trong phát hiện sao chép

1.5.4. Các vấn đề liên quan về sao chép

1.5.5. Phát hiện sao chép tại PAN

1.6. Kết luận Chương 1

2. CHƯƠNG 2: SO SÁNH VĂN BẢN DỰA TRÊN MÔ HÌNH VECTOR

2.1. Tính độ tương tự văn bản trong mô hình vector

2.2. Biểu diễn văn bản theo mô hình vector

2.3. Phương pháp tính trọng số từ chỉ mục

2.4. Phương pháp tính độ tương tự

2.5. Một số phương pháp so sánh văn bản dựa trên mô hình vector

2.6. Mô hình vector hóa văn bản

2.7. Phương pháp cải tiến sử dụng độ đo Cosine

2.8. Đánh giá các phương pháp dựa trên mô hình vector

2.9. Tạo bộ dữ liệu để đánh giá các thuật toán

2.10. Đánh giá các thuật toán dựa trên mô hình vector

2.11. Kết luận Chương 2

3. CHƯƠNG 3: PHÁT HIỆN SAO CHÉP VĂN BẢN DỰA TRÊN BIẾN ĐỔI WAVELET RỜI RẠC

3.1. Phát biểu bài toán

3.2. Cơ sở lý thuyết về DWT và bộ lọc Haar

3.2.1. Cơ sở lý thuyết về DWT

3.2.2. Bộ lọc Haar

3.3. Đề xuất mô hình hệ thống phát hiện sao chép

3.4. Đề xuất mô hình hệ thống áp dụng cho phương pháp dựa trên DWT

3.5. Đề xuất quy trình chuyển đổi dữ liệu

3.6. Đề xuất phương pháp và giải thuật xử lý

3.6.1. Tiền xử lý dữ liệu

3.6.2. Quy trình số hóa

3.6.3. Giải thuật cho bộ lọc Haar

3.7. Tổ chức dữ liệu cho bộ DNA nguồn

3.8. Đề xuất thuật toán phát hiện sự giống nhau

3.9. Mã hóa dữ liệu và tính DNA của văn bản đánh giá

3.10. So sánh và đưa ra quyết định

3.11. Độ phức tạp của thuật toán phát hiện sự giống nhau

3.12. Kết quả thử nghiệm phương pháp dựa trên DWT

3.12.1. Dữ liệu thử nghiệm

3.12.2. Kết quả thử nghiệm

3.13. Kết luận Chương 3

4. CHƯƠNG 4: PHÁT TRIỂN HỆ THỐNG PHÁT HIỆN SAO CHÉP VĂN BẢN TIẾNG VIỆT

4.1. Mô tả hệ thống

4.2. Các đối tượng sử dụng

4.3. Mô hình tổng quát

4.4. Xây dựng kho dữ liệu văn bản tiếng Việt

4.5. Kiến trúc hệ thống kho dữ liệu

4.6. Giải pháp xây dựng kho dữ liệu

4.7. Đánh giá về kho dữ liệu

4.8. Triển khai hệ thống phát hiện sao chép văn bản

4.9. Đề xuất hướng phát triển để xử lý dữ liệu lớn

4.10. Đề xuất giải pháp xử lý

4.11. Đề xuất phương pháp biểu diễn DNA bằng Tensor

4.12. Kết luận Chương 4

KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

Hướng phát triển

DANH MỤC CÁC CÔNG TRÌNH KHOA HỌC ĐÃ CÔNG BỐ

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Đặt vấn đề

Trong bối cảnh phát triển của Internet, việc chia sẻ tài liệu trở nên phổ biến, dẫn đến tình trạng sao chép nội dung. Để giải quyết vấn đề này, việc đánh giá văn bản và xác định mức độ giống nhau giữa các văn bản là rất cần thiết. Nghiên cứu về mức độ tương đồng trong văn bản tiếng Việt còn hạn chế, trong khi các hệ thống phát hiện sao chép hiện tại chủ yếu tập trung vào tiếng Anh. Do đó, việc phát triển các phương pháp và hệ thống phù hợp cho tiếng Việt là một thách thức lớn. Các nghiên cứu hiện tại chưa đáp ứng được nhu cầu thực tiễn, đặc biệt trong việc phát hiện nội dung sao chép. Luận án này nhằm mục tiêu phát triển các phương pháp mới để đánh giá mức độ giống nhau của văn bản tiếng Việt, từ đó góp phần vào việc phát hiện sao chép hiệu quả.

1.1. Mục tiêu nghiên cứu

Mục tiêu chính của luận án là tìm ra các giải pháp hiệu quả để biểu diễnđánh giá mức độ giống nhau của các văn bản tiếng Việt. Các mục tiêu cụ thể bao gồm đề xuất phương pháp biểu diễn văn bản, cải thiện tốc độ và độ chính xác trong phát hiện sao chép, và xây dựng hệ thống phát hiện sao chép văn bản tiếng Việt. Việc đạt được những mục tiêu này sẽ giúp nâng cao khả năng phát hiện sao chép và giảm thiểu tình trạng đạo văn trong các tài liệu học thuật và nghiên cứu.

II. Tổng quan tình hình nghiên cứu

Chương này trình bày cơ sở lý thuyết và kết quả nghiên cứu tổng quan về các vấn đề liên quan đến đánh giá văn bản. Các công trình nghiên cứu trước đây đã chỉ ra rằng việc phát hiện sao chép văn bản gặp nhiều khó khăn do đặc thù ngôn ngữ và phương pháp xử lý. Nghiên cứu về độ tương tự văn bản trong tiếng Việt còn hạn chế, và các phương pháp hiện tại chưa đáp ứng được yêu cầu thực tiễn. Việc phân tích các công trình nghiên cứu liên quan giúp xác định những hạn chế và định hướng cho các nội dung nghiên cứu tiếp theo. Điều này cũng nhấn mạnh tầm quan trọng của việc phát triển các phương pháp mới để so sánh văn bản và phát hiện nội dung sao chép.

2.1. Một số khái niệm sử dụng trong luận án

Trong nghiên cứu này, một số khái niệm quan trọng được sử dụng bao gồm văn bản, độ tương tự văn bản, và phát hiện sao chép. Văn bản được định nghĩa là các tài liệu chứa thông tin, trong khi độ tương tự văn bản đề cập đến mức độ giống nhau giữa các văn bản khác nhau. Phát hiện sao chép là quá trình xác định nội dung giống nhau trong các văn bản, từ đó giúp ngăn chặn tình trạng đạo văn. Việc hiểu rõ các khái niệm này là cần thiết để xây dựng các phương pháp và hệ thống hiệu quả trong việc đánh giá mức độ giống nhau của văn bản tiếng Việt.

III. Phương pháp nghiên cứu

Phương pháp nghiên cứu trong luận án bao gồm việc phân tích tài liệu và thực nghiệm. Phân tích tài liệu giúp hiểu rõ các phương pháp hiện có trong xử lý ngôn ngữ tự nhiênđánh giá văn bản. Thực nghiệm được thực hiện để đánh giá hiệu quả của các phương pháp đề xuất trong việc phát hiện sao chép. Các phương pháp này bao gồm mô hình vector và biến đổi Wavelet rời rạc, nhằm cải thiện độ chính xác và tốc độ trong việc phát hiện nội dung sao chép. Việc áp dụng các phương pháp này sẽ giúp xây dựng một hệ thống phát hiện sao chép văn bản tiếng Việt hiệu quả.

3.1. Nhiệm vụ nghiên cứu

Nhiệm vụ nghiên cứu bao gồm việc phân tích các phương pháp biểu diễn văn bản, khảo sát nguồn dữ liệu cần thiết, và đề xuất giải pháp tổ chức lưu trữ. Nghiên cứu cũng tập trung vào việc phát hiện nội dung sao chép và xây dựng bộ dữ liệu tiếng Việt thử nghiệm. Các nhiệm vụ này sẽ giúp xác định các phương pháp hiệu quả trong việc đánh giá mức độ giống nhau của văn bản và phát hiện sao chép, từ đó góp phần nâng cao chất lượng nghiên cứu và học thuật trong nước.

25/01/2025

Trích đoạn nội dung tài liệu

Chương 1. Tổng quan tình hình nghiên cứu. Chương này trình bày cơ sở lý thuyết, kết quả nghiên cứu tổng quan về các vấn đề nghiên cứu trong luận án; phân tích, đánh giá các công trình nghiên cứu liên quan và chỉ ra một số hạn chế trong lĩnh vực nghiên cứu (phát hiện sao chép hay trùng lặp nội dung văn bản). Trên cơ sở các phân tích, đánh giá sẽ định hướng, đề xuất và xác định các nội dung nghiên cứu sẽ được triển khai.

So sánh văn bản dựa trên mô hình vector. Chương này giới thiệu tổng quan về bài toán so sánh văn bản, trình bày phương pháp tính trọng số các đặc trưng của văn bản biểu diễn trên mô hình vector; giới thiệu bài toán và thực nghiệm -6- một số phương pháp so sánh văn bản dựa trên mô hình vector để chứng minh mô hình biểu diễn văn bản dựa trên vector là thông dụng và có thể ứng dụng trong phát hiện sao chép văn bản tiếng Việt. Trên cơ sở phân tích, đánh giá cách tính trọng số, các phương pháp đo độ tương tự văn bản được dùng phổ biến, luận án đề xuất thuật toán thử nghiệm để đánh giá sự tương tự của văn bản tiếng Việt dựa trên mô hình vector. Phát hiện sao chép văn bản dựa trên biến đổi Wavelet rời rạc.

Hạn chế của mô hình vector là không gian lưu trữ với số chiều rất lớn, đối với kho dữ liệu lớn thì chi phí xử lý, tính toán cao. Chương này giới thiệu kết quả nghiên cứu, phân tích và đề xuất hướng tiếp cận mới để giải quyết bài toán so sánh văn bản dựa trên phép biến đổi Wavelet rời rạc và sử dụng bộ lọc Haar. Nội dung trình bày tập trung vào hướng tiếp cận và các vấn đề mới đối với xử lý văn bản, đó là biến đổi Wavelet rời rạc và bộ lọc Haar; phương pháp đề xuất để giải quyết bài toán. Thực nghiệm, so sánh và đánh giá kết quả đạt được để chứng minh hiệu quả của phương pháp đề xuất.

Phát triển hệ thống phát hiện sao chép văn bản tiếng Việt. Trình bày kết quả giải pháp xây dựng kho dữ liệu văn bản tiếng Việt và phát triển hệ thống phát hiện sao chép văn bản dựa trên các kết quả nghiên cứu đạt được về mô hình vector và phương pháp DWT. Chương này cũng trình bày kết quả triển khai thử nghiệm tại ĐHĐN và một số đánh giá. Cuối cùng là đề xuất hướng phát triển để xử lý dữ liệu lớn với giải pháp triển khai dựa trên mô hình MapReduce và phương pháp biểu diễn DNA bằng Tensor.

Đóng góp chính của luận án Luận án đã góp phần giải quyết bài toán đánh giá mức độ giống nhau của văn bản ứng dụng trong phát hiện nội dung giống nhau của văn bản nhằm phát hiện sao chép. Dưới đây là những đóng góp chính của luận án: - Đề xuất cải tiến mô hình vector để tính toán độ tương tự văn bản dựa trên đơn vị từ và câu. Nghiên cứu và triển khai thực nghiệm phương pháp so sánh văn bản dựa trên mô hình vector với tập dữ liệu tiếng Việt và cho kết quả khả quan để chứng minh phương pháp dựa trên mô hình vector và sử dụng độ đo Cosine là phương pháp thông dụng có thể giải quyết được bài toán đánh giá mức độ giống nhau của văn bản. -7- - Đề xuất được cách tiếp cận mới để đánh giá mức độ giống nhau của văn bản gồm phương pháp biểu diễn văn bản thành các chuỗi số thực DNA và ứng dụng phương pháp DWT và bộ lọc Haar.

Đây là cách tiếp cận hoàn toàn mới để giải quyết bài toán phát hiện sự giống nhau của văn bản. - Đề xuất được quy trình xử lý, xây dựng thuật toán phát hiện sự giống nhau giữa các văn bản bằng cách tính toán khoảng cách Euclid nhỏ nhất từ DNA cần đánh giá đến các DNA nguồn và so sánh với một mức ngưỡng thích hợp để đưa ra kết luận về sự giống nhau giữa văn bản được kiểm tra với văn bản nguồn trong kho dữ liệu. Các kết quả thực nghiệm trên bộ dữ liệu chuẩn của PAN và bộ dữ liệu tiếng Việt thử nghiệm đã chứng minh thuật toán đề xuất đem lại hiệu quả cao trong phát hiện sự giống nhau của văn bản. - Đề xuất được các giải pháp, thuật toán để xử lý dữ liệu lớn hiệu quả.

Từ hướng tiếp cận và phương pháp đề xuất trên, trong luận án đã tính đến xử lý dữ liệu lớn với việc mã hóa dữ liệu văn bản sang dạng tín hiệu số thông qua các chuỗi DNA được sắp xếp theo thứ tự tăng dần cho phép tìm kiếm nhị phân. Đây là một trong những phương pháp tìm kiếm nhanh nhất khi làm việc với dữ liệu lớn. Hơn nữa, DWT cho độ phức tạp tính toán chỉ là hàm đa thức trong mỗi lần lấy mẫu con nên giải pháp đề xuất sẽ càng hiệu quả trong quá trình xử lý dữ liệu lớn. - Xây dựng các bộ dữ liệu tiếng Việt để thực nghiệm, xây dựng hệ thống phát hiện sao chép văn bản và triển khai ứng dụng thử nghiệm tại ĐHĐN mang ý nghĩa thực tiễn cao.

-8- TỔNG QUAN TÌNH HÌNH NGHIÊN CỨU Chương này trình bày cơ sở lý thuyết, kết quả nghiên cứu tổng quan về các vấn đề nghiên cứu trong luận án; thực hiện việc phân tích, đánh giá các công trình nghiên cứu liên quan và chỉ ra một số hạn chế trong lĩnh vực nghiên cứu (phát hiện sao chép hay trùng lặp nội dung văn bản). Trên cơ sở các phân tích, đánh giá sẽ định hướng, đề xuất và xác định các nội dung nghiên cứu sẽ được triển khai. Một số khái niệm sử dụng trong luận án 1) Văn bản Văn bản (Document/Text) là đối tượng nghiên cứu của nhiều ngành khoa học, nhiều lĩnh vực khác nhau, tùy theo góc độ nghiên cứu và mục đích tiếp cận sẽ có nhiều định nghĩa khác nhau về văn bản. Thông thường trong các hệ thống lưu trữ và truy xuất thông tin, văn bản là các bản ghi thông tin, là phương tiện để ghi nhận, lưu giữ và truyền đạt các thông tin từ chủ thể này sang chủ thể khác bằng một ký hiệu hay ngôn ngữ nhất định nào đó.

Văn bản bao gồm các tài liệu, tư liệu, giấy tờ có giá trị pháp lý, mỗi văn bản gồm tập hợp các câu có tính trọn vẹn về nội dung, hoàn chỉnh về hình thức, có tính liên kết chặt chẽ và hướng tới một mục tiêu giao tiếp nhất định [18]. Trong tin học, văn bản là một chuỗi ký tự được mã hóa thành các định dạng có thể đọc được trên máy tính, hay còn gọi là văn bản điện tử. Trong luận án, văn bản được đề cập là đối tượng nghiên cứu chính, là văn bản điện tử ở dạng văn bản thuần (Plain text2), việc xử lý, tính toán sẽ loại bỏ các hình ảnh, công thức, bảng biểu. Hay nói cách khác, các phương pháp đề xuất trong luận án được xử lý trên đối tượng văn bản thuần, từ các văn bản điện tử được lưu trữ dưới dạng các tệp tin.

hay tính toán, xử lý trên các nội dung văn bản được lưu trữ trong CSDL.org/wiki/Plain_text (truy cập tháng 10/2019) -9- 2) Độ tương tự Độ tương tự (Similarity measures) hay độ tương đồng là một khái niệm quan trọng và đã được sử dụng rộng rãi. Các định nghĩa trước đây về độ tương tự được gắn liền trong một ứng dụng cụ thể hoặc một dạng thể hiện của tri thức. Dekang Lin [70] định nghĩa độ tương tự thông qua trực giác (Intuitions): - Trực giác 1: Độ tương tự giữa A và B có liên quan tới sự tương tự (giống nhau) của chúng. Sự tương tự càng nhiều, độ tương tự càng lớn.

- Trực giác 2: Độ tương tự giữa A và B có liên quan tới những sự khác biệt giữa chúng. Càng nhiều sự khác biệt, độ tương tự càng thấp. - Trực giác 3: Độ tương tự lớn nhất giữa A và B đạt được khi A và B giống hệt nhau hay gọi là đồng nhất. Mỗi một độ đo độ tương tự phụ thuộc vào một ứng dụng cụ thể hoặc giả định trong một mô hình miền cụ thể.

Độ tương tự được tính là giá trị nằm trong khoảng [0, 1]. Độ tương tự giữa hai đối tượng bằng 1 thì hai đối tượng đó hoàn toàn giống nhau và nếu độ tương tự bằng 0 thì hai đối tượng đó khác nhau hoàn toàn. 3) Độ tương tự văn bản Độ tương tự văn bản (Text similarity) là mức độ giống nhau của văn bản. Khi so sánh hai đơn vị văn bản (toàn văn bản hoặc một phân đoạn của văn bản) với nhau thì đó là mức độ giống nhau giữa đơn vị văn bản này với đơn vị văn bản kia; so sánh giữa hai văn bản thì đó là mức độ giống nhau giữa văn bản này với văn bản kia; so sánh giữa một văn bản kiểm tra với tập văn bản khác thì đó là mức độ giống nhau giữa văn bản kiểm tra với các văn bản khác… Nói cách khác, tính độ tương tự văn bản là tìm ra tỷ lệ giống nhau của văn bản.

Meuschke and Gipp [80] trình bày việc tính độ tương tự văn bản theo hai hướng: Một là so sánh độ tương tự của các phân đoạn văn bản (Text segment), gọi là tương tự cục bộ và hai là so sánh độ tương tự của toàn bộ văn bản (Full text), gọi là tương tự toàn cục. Để đo độ tương tự văn bản thường dùng là độ tương tự chuỗi (String similarity). Để đo độ tương tự các chuỗi, người ta sử dụng các độ đo khoảng cách để tính độ tương tự chuỗi [14] hoặc dùng các phương pháp đo độ tương tự ngữ nghĩa - 10 - (Semantic similarity) để hiểu được nghĩa của văn bản, thường liên quan đến cơ sở tri thức, các khái niệm, Ontology,. Tóm lại, các văn bản tương tự nhau là những văn bản có tần số từ tương đối giống nhau, vì vậy có thể đo độ tương tự giữa các văn bản hoặc giữa một văn bản với các văn bản khác trong kho dữ liệu thường dựa vào bảng tần số từ.

Trong khai phá văn bản có nhiều độ đo khác nhau để tính toán mức độ tương tự của các văn bản, trong đó độ đo thường được sử dụng nhất là độ đo Cosine. Trong phạm vi đặt ra, luận án tập trung vào các phương pháp đo độ tương tự văn bản mà không xét đến yếu tố ngữ nghĩa của văn bản. Luận án tính toán độ tương tự văn bản dựa trên các phương pháp liên quan đến chuỗi. 4) So khớp văn bản Khái niệm “So khớp” được hiểu theo nhiều cách khác nhau.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Bài luận án mang tiêu đề "Luận Án Về Đánh Giá Mức Độ Giống Nhau Của Văn Bản Tiếng Việt" từ Đại học Đà Nẵng tập trung vào việc phân tích và đánh giá mức độ tương đồng giữa các văn bản tiếng Việt. Nghiên cứu này không chỉ giúp người đọc hiểu rõ hơn về các phương pháp đánh giá văn bản mà còn cung cấp những công cụ hữu ích cho việc phân tích ngôn ngữ, từ đó nâng cao khả năng viết và giao tiếp trong tiếng Việt.

Để mở rộng thêm kiến thức về ngôn ngữ học và văn hóa Việt Nam, bạn có thể tham khảo bài viết "Tiểu luận về văn hóa Việt Nam: So sánh giao tiếp giữa phương Đông và phương Tây", nơi so sánh các phương thức giao tiếp giữa hai nền văn hóa khác nhau. Ngoài ra, bài viết "Luận văn thạc sĩ về đặc điểm ngôn ngữ trong tiêu đề tác phẩm của Lỗ Tấn và phương pháp dịch sang tiếng Việt" sẽ giúp bạn hiểu rõ hơn về ngôn ngữ trong văn học và cách dịch thuật. Cuối cùng, bài viết "Đặc Điểm Ngữ Pháp và Ngữ Nghĩa Câu Tồn Tại Trong Tiếng Việt" sẽ cung cấp cái nhìn sâu sắc về cấu trúc ngữ pháp và ngữ nghĩa trong tiếng Việt, từ đó hỗ trợ cho việc nghiên cứu và phân tích văn bản.

Những tài liệu này không chỉ bổ sung kiến thức mà còn mở ra nhiều góc nhìn mới cho bạn trong lĩnh vực ngôn ngữ học và văn hóa Việt Nam.