Luận án tiến sĩ: Khai phá luồng văn bản với kỹ thuật gom cụm - Đại học Lạc Hồng

Giới thiệu kỹ thuật gom cụm văn bản để phân tích luồng dữ liệu lớn, đặc biệt áp dụng hiệu quả cho việc quản lý và khai phá tri thức từ các luận án tiến sĩ khoa

Trường đại học

Trường Đại học Lạc Hồng

Chuyên ngành

Khoa học máy tính

Người đăng

Ẩn danh

Thể loại

Luận án tiến sĩ

2021

140
1
0

Phí lưu trữ

35 Point

Tóm tắt

I. Tổng quan về khai phá luồng văn bản với kỹ thuật gom cụm

Khai phá luồng văn bản là lĩnh vực nghiên cứu quan trọng trong khoa học máy tính, tập trung vào việc phát hiện và phân tích các chủ đề ẩn trong dữ liệu văn bản liên tục. Luồng văn bản xuất hiện phổ biến trên mạng xã hội, hệ thống tin tức và các diễn đàn trực tuyến. Kỹ thuật gom cụm giúp phân nhóm các tài liệu có nội dung tương tự, từ đó hỗ trợ việc theo dõi xu hướng và phát hiện chủ đề nổi bật. Phương pháp truyền thống sử dụng mô hình chủ đề như LDA hoặc mô hình hỗn hợp dựa trên quy trình Dirichlet. Tuy nhiên, các phương pháp này gặp hạn chế khi xử lý văn bản ngắn và bỏ qua mối quan hệ ngữ nghĩa giữa các từ. Nghiên cứu đề xuất cách tiếp cận mới sử dụng đồ thị từ để biểu diễn văn bản, cải thiện hiệu suất gom cụm đáng kể. Kết quả thực nghiệm trên nhiều tập dữ liệu cho thấy phương pháp mới vượt trội so với các kỹ thuật truyền thống.

1.1. Định nghĩa luồng văn bản và ứng dụng thực tế

Luồng văn bản là chuỗi dữ liệu văn bản xuất hiện liên tục theo thời gian, thường thấy trên mạng xã hội, blog và hệ thống tin tức. Đặc điểm nổi bật của luồng văn bản bao gồm tính thời gian thực, khối lượng lớn và nội dung ngắn gọn. Khai phá luồng văn bản giúp doanh nghiệp theo dõi ý kiến khách hàng, phát hiện khủng hoảng truyền thông và phân tích xu hướng thị trường. Trong lĩnh vực học thuật, kỹ thuật này hỗ trợ phân loại tài liệu nghiên cứu và phát hiện chủ đề nóng trong cộng đồng khoa học. Ứng dụng rộng rãi của luồng văn bản đặt ra yêu cầu cấp thiết về các phương pháp phân tích hiệu quả.

1.2. Vai trò của kỹ thuật gom cụm trong phân tích văn bản

Kỹ thuật gom cụm đóng vai trò trung tâm trong việc tổ chức và khám phá tri thức từ dữ liệu văn bản lớn. Phương pháp này phân nhóm các tài liệu tương tự mà không cần nhãn trước, phù hợp với dữ liệu phi cấu trúc. Trong bối cảnh luồng văn bản, gom cụm giúp phát hiện các cụm chủ đề nổi bật theo thời gian, nhận diện sự thay đổi xu hướng và cô lập thông tin bất thường. Các kỹ thuật phổ biến bao gồm gom cụm dựa trên mật độ, phân hoạch và mô hình hỗn hợp. Sự kết hợp giữa gom cụm và khai phá văn bản mở ra hướng tiếp cận toàn diện cho phân tích dữ liệu lớn.

II. Thách thức và vấn đề trong gom cụm luồng văn bản

Gom cụm luồng văn bản đối mặt nhiều thách thức nghiêm trọng ảnh hưởng đến chất lượng kết quả phân tích. Thách thức đầu tiên liên quan đến văn bản ngắn, đặc biệt phổ biến trên mạng xã hội nơi người dùng đăng tải nội dung vài từ. Số lượng từ hạn chế khiến mô hình chủ đề truyền thống khó suy ra chính xác phân phối đa thức của chủ đề. Thách thức thứ hai là bỏ qua mối quan hệ ngữ nghĩa giữa các từ trong văn bản. Phương pháp truyền thống chỉ xem xét tần suất xuất hiện từ mà không đánh giá sự đồng xuất hiện hay liên kết ngữ nghĩa. Ngoài ra, tính chất thời gian thực của luồng văn bản yêu cầu thuật toán phải xử lý nhanh và cập nhật liên tục. Khối lượng dữ liệu khổng lồ cũng đặt áp lực lên khả năng mở rộng của hệ thống. Các vấn đề này đòi hỏi giải pháp mới vượt qua giới hạn của phương pháp hiện tại.

2.1. Hạn chế của phương pháp dựa trên túi từ truyền thống

Phương pháp túi từ biểu diễn văn bản dưới dạng vector tần suất, bỏ qua hoàn toàn thứ tự và mối liên hệ giữa các từ. Cách tiếp cận này gây mất mát thông tin ngữ nghĩa quan trọng, đặc biệt với văn bản ngắn. Khi tài liệu chỉ chứa vài từ, vector biểu diễn trở nên thưa thớt và kém phân biệt. Mô hình chủ đề truyền thống như LDA dựa trên giả định các từ độc lập có điều kiện, không phản ánh thực tế ngôn ngữ tự nhiên. Hệ quả là hiệu suất gom cụm giảm đáng kể trên dữ liệu văn bản ngắn, dẫn đến các cụm thiếu gắn kết và khó diễn giải.

2.2. Bài toán đánh giá chất lượng cụm trên dữ liệu thời gian thực

Đánh giá chất lượng cụm trên luồng văn bản phức tạp hơn dữ liệu tĩnh do tính chất biến động theo thời gian. Chủ đề trong luồng văn bản có thể trôi dạt, nghĩa là nội dung và từ khóa thay đổi liên tục. Việc xác định số lượng cụm tối ưu cũng là vấn đề nan giải khi dữ liệu liên tục mở rộng. Các thước đo đánh giá truyền thống như độ thuần khiết và chỉ số Rand cần được điều chỉnh cho phù hợp với bối cảnh thời gian thực. Ngoài ra, khả năng cập nhật mô hình mà không cần huấn luyện lại từ đầu là yêu cầu thiết yếu cho hệ thống xử lý luồng dữ liệu lớn.

III. Giải pháp gom cụm dựa trên đồ thị từ và mô hình hỗn hợp

Nghiên cứu đề xuất phương pháp mới kết hợp biểu diễn đồ thị từ với mô hình hỗn hợp để cải thiện gom cụm luồng văn bản. Đồ thị từ biểu diễn văn bản bằng cách xây dựng đồ thị trong đó đỉnh là từ và cạnh thể hiện mối quan hệ đồng xuất hiện hoặc ngữ nghĩa. Cách tiếp cận này bảo toàn thông tin cấu trúc và ngữ nghĩa mà phương pháp túi từ bỏ sót. Mô hình hỗn hợp dựa trên quy trình Dirichlet được áp dụng để phát hiện số lượng cụm tự động mà không cần xác định trước. Kỹ thuật gom cụm bán giám sát sử dụng đồ thị con phổ biến nâng cao khả năng phân loại chính xác. Phương pháp kết hợp giữa biểu diễn đồ thị từ và mô hình hỗn hợp động cho phép theo dõi sự thay đổi chủ đề theo thời gian. Thực nghiệm trên nhiều tập dữ liệu chuẩn chứng minh hiệu quả vượt trội của phương pháp đề xuất, đặc biệt với văn bản ngắn và dữ liệu có chủ đề trôi dạt.

3.1. Biểu diễn văn bản bằng đồ thị từ thay vì túi từ

Đồ thị từ xây dựng cấu trúc liên kết giữa các từ trong văn bản, nơi mỗi đỉnh đại diện cho một từ và mỗi cạnh biểu thị mối quan hệ đồng xuất hiện. Trọng số cạnh phản ánh mức độ liên kết ngữ nghĩa giữa hai từ. Cách biểu diễn này bảo toàn thông tin về thứ tự và mối quan hệ từ mà túi từ bỏ sót. Với văn bản ngắn, đồ thị từ tạo ra biểu diễn phong phú hơn nhờ khai thác mối liên hệ giữa các từ xuất hiện. Phương pháp này cũng hỗ trợ phát hiện từ đồng nghĩa và đa nghĩa thông qua cấu trúc đồ thị, nâng cao chất lượng đặc trưng văn bản cho quá trình gom cụm.

3.2. Áp dụng mô hình hỗn hợp dựa trên quy trình Dirichlet

Mô hình hỗn hợp dựa trên quy trình Dirichlet là kỹ thuật mạnh mẽ cho phép xác định tự động số lượng cụm trong dữ liệu. Quá trình sinh dữ liệu bắt đầu từ phân bố Dirichlet, tạo ra các tham số cụm và sau đó sinh ra các điểm dữ liệu tương ứng. Điểm nổi bật của phương pháp này là khả năng mở rộng số lượng cụm khi dữ liệu mới xuất hiện, phù hợp với tính chất liên tục của luồng văn bản. Kỹ thuật suy luận như Markov Chain Monte Carlo hay biến phân được sử dụng để ước lượng tham số mô hình. Kết hợp với biểu diễn đồ thị từ, mô hình này đạt hiệu suất cao trong việc gom cụm văn bản ngắn và phát hiện chủ đề trôi dạt.

IV. Kết luận và ứng dụng của kỹ thuật gom cụm luồng văn bản

Luận án đã đề xuất và kiểm chứng phương pháp khai phá luồng văn bản hiệu quả dựa trên kỹ thuật gom cụm kết hợp đồ thị từ và mô hình hỗn hợp động. Phương pháp mới vượt qua hạn chế của kỹ thuật truyền thống, đặc biệt trong xử lý văn bản ngắn và theo dõi chủ đề trôi dạt. Đóng góp chính bao gồm cách biểu diễn văn bản bằng đồ thị từ bảo toàn mối quan hệ ngữ nghĩa, kỹ thuật phát hiện cụm từ xu hướng trên luồng văn bản và mô hình gom cụm thích ứng theo thời gian. Kết quả thực nghiệm trên nhiều tập dữ liệu chuẩn cho thấy cải thiện đáng kể về độ chính xác so với phương pháp hiện tại. Hướng phát triển bao gồm áp dụng học sâu để nâng cao biểu diễn đặc trưng và mở rộng cho đa ngôn ngữ. Nghiên cứu có ý nghĩa cả về mặt học thuật lẫn thực tiễn trong thời đại dữ liệu lớn.

4.1. Các đóng góp chính của nghiên cứu

Nghiên cứu đóng góp ba phương diện chính cho lĩnh vực khai phá luồng văn bản. Đầu tiên là phương pháp biểu diễn văn bản bằng đồ thị từ, khắc phục hạn chế mất mát thông tin ngữ nghĩa của túi từ truyền thống. Thứ hai là kỹ thuật phát hiện cụm từ xu hướng, hỗ trợ theo dõi sự biến đổi chủ đề theo thời gian trên luồng dữ liệu liên tục. Thứ ba là mô hình gom cụm kết hợp mô hình hỗn hợp động với biểu diễn đồ thị, cho phép tự động xác định số lượng cụm và cập nhật mô hình khi dữ liệu mới đến. Các đóng góp này được công bố trên tạp chí và hội nghị khoa học uy tín trong lĩnh vực khoa học máy tính.

4.2. Ứng dụng thực tiễn và hướng phát triển tương lai

Phương pháp khai phá luồng văn bản có nhiều ứng dụng thực tiễn quan trọng. Trong truyền thông xã hội, kỹ thuật hỗ trợ theo dõi ý kiến công chúng và phát hiện khủng hoảng truyền thông ở giai đoạn sớm. Trong thương mại điện tử, phân tích đánh giá khách hàng giúp doanh nghiệp hiểu rõ nhu cầu thị trường. Trong lĩnh vực y tế, gom cụm văn bản hỗ trợ phân tích triệu chứng bệnh từ dữ liệu người dùng trực tuyến. Hướng phát triển tương lai bao gồm tích hợp kỹ thuật học sâu để cải thiện biểu diễn đặc trưng văn bản, áp dụng phương pháp học tăng cường cho hệ thống thời gian thực và mở rộng cho dữ liệu đa phương tiện đa ngôn ngữ.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI từ nội dung tài liệu gốc; tài liệu do người dùng đóng góp và được kiểm duyệt trước khi xuất bản. Báo lỗi nội dung.

21/04/2026
Khai phá luồng văn bản với kỹ thuật gom cụm luận án tiến sĩ khoa học máy tính

Trích đoạn nội dung tài liệu

CHƯƠNG 1: GIỚI THIỆU Chương này trình bày bức tranh tổng quan về luận án gồm: Giới thiệu bài toán nghiên cứu và ý nghĩa; Các đóng góp của luận án và ý nghĩa; Phương pháp thực hiện; Cấu trúc của luận án.1 Tổng quan về đề tài luận án 1.1 Bài toán nghiên cứu và ý nghĩa Dữ liệu ngày càng tăng do ngày càng có nhiều mạng xã hội, diễn đàn, phương tiện truyền thông, thiết bị cảm ứng và người dùng điện thoại thông minh cũng đã và đang tạo ra lượng lớn dữ liệu. Số lượng thiết bị được kết nối đang tăng dần và các thiết bị này liên tục tạo ra các luồng dữ liệu [106]. Theo [53], luồng dữ liệu là một chuỗi vô hạn các phần tử đếm được. Các mô hình khác nhau của luồng dữ liệu có các cách tiếp cận khác nhau liên quan đến khả năng thay đổi của luồng và cấu trúc của các phần tử luồng.

Xử lý luồng là việc phân tích các luồng dữ liệu để thu được kết quả mới với dữ liệu đầu vào mới. Thời gian là yêu cầu trọng tâm trong xử lý luồng: trong hầu hết các mô hình luồng, mỗi phần tử luồng được liên kết với một hoặc nhiều nhãn thời gian, ví dụ: nhãn thời gian được xác định khi phần tử được tạo, dựa vào tính hợp lệ của nội dung, hoặc khi phần tử sẵn sàng để xử lý. Gom cụm là một trong các hướng nghiên cứu liên quan đến khai phá luồng dữ liệu. Theo [55], các phương pháp gom cụm thường được sử dụng để hiểu về các nhóm người dùng, tài liệu hoặc các nội dung khác.

Một tập dữ liệu chẳng hạn như một tập hồ sơ chứa đầy các con số và giá trị có thể sẽ rất khó hiểu, và người ta thường có nhu cầu nhóm toàn bộ thành các nhóm nhỏ hơn, mỗi nhóm chứa các mục tương tự với nhau từ đó có thể phân tích và kiểm tra dễ dàng hơn. Phương pháp phổ biến để gom cụm là sử dụng một kho ngữ liệu văn bản chứa các tài liệu với nhiều chủ đề khác nhau. Để phân loại tất cả các tài liệu theo chủ đề từ đó tài liệu có thể được sử dụng và truy xuất nhanh hơn, toàn bộ kho tài liệu có thể được phân tích bằng phương pháp gom cụm, phân tách tài liệu thành các nhóm sao cho tài liệu trong mỗi nhóm có liên quan hay tương đồng với nhau và với các chủ đề của từng nhóm. Là một dạng thức của luồng dữ liệu, luồng văn bản là một loại luồng dữ liệu đặc biệt, trong đó dữ liệu là các tài liệu văn bản đến liên tục [10], luồng văn bản là chuỗi các văn bản được sắp xếp theo thứ tự, đến nhanh chóng và liên tục theo thời gian trong hai 2 dạng chính: tin tức và truyền thông xã hội.

Khai phá văn bản, theo [16], là hoạt động khai thác dữ liệu từ các bộ sưu tập dữ liệu văn bản với mục đích là khám phá kiến thức (hoặc thông tin, mẫu) từ dữ liệu văn bản không có cấu trúc hoặc bán cấu trúc. Vấn đề về khai phá luồng văn bản cũng thu hút nhiều sự quan tâm với nhiều nghiên cứu liên quan như: Xử lý ngôn ngữ tự nhiên, Thu thập thông tin [49], Phát hiện chủ đề, Định nghĩa từ ngữ, Khai phá thông tin, Phân tích mạng xã hội [35], Tóm tắt văn bản [25, 28], Phân tích cảm xúc, Mô hình không gian Vector, Phân lớp văn bản, Gom cụm văn bản, vv… Trong các nghiên cứu về khai phá luồng văn bản, gom cụm luồng văn bản là một vấn đề quan trọng trong cộng đồng nghiên cứu có nhiều ứng dụng như phân nhóm văn bản, sắp xếp tài liệu, phát hiện và theo dõi chủ đề …Theo [47], gom cụm văn bản là tự động nhóm các tài liệu dạng văn bản (ví dụ: tài liệu ở dạng văn bản thuần túy, trang web, email, .) thành các cụm dựa trên sự giống nhau hay tương đồng về nội dung của chúng. Vấn đề gom cụm văn bản có thể được định nghĩa như sau. Cho một tập hợp gồm 𝑛 tài liệu được ký hiệu là 𝐷 = {𝑑1, 𝑑2, … , 𝑑𝑛 } và một số cụm được xác định trước 𝐾 (thường do người dùng thiết lập), 𝐷 được nhóm thành 𝑘 cụm tài liệu Z={𝑧1, 𝑧2, … , 𝑧𝑘 } sao cho các tài liệu trong cùng một cụm tương đồng nhau và các tài liệu khác cụm không tương đồng nhau.

Tùy theo mục đích gom cụm mà sự tương đồng được định nghĩa khác nhau và tùy theo mô hình gom cụm mà cách thức suy luận cụm dành cho tài liệu cũng khác nhau. Khi gom cụm trên luồng văn bản, số lượng cụm sẽ thay đổi theo thời gian vì văn bản đến trên luồng thay đổi. Do đó, không thể xác định trước được số cụm. Hiện nay, gom cụm luồng văn bản là một vấn đề có ý nghĩa trong hoạt động khai phá dữ liệu với nhiều ứng dụng mang tính thực tiễn cao như lọc nhóm tin tức, thu thập văn bản, tổ chức tài liệu, phát hiện và theo dõi chủ đề, gom cụm email.

Ví dụ: trong ứng dụng phát hiện sự kiện xã hội, gom cụm văn bản có thể giúp xác định xu hướng đang được quan tâm hoặc đang được thảo luận thường xuyên về các chủ đề trong các mạng xã hội phổ biến gần đây (như: COVID-19, cuộc chiến thương mại của Trung Quốc Hoa Kỳ,…). Hoặc trong truy xuất văn bản, gom cụm văn bản có thể giúp nhóm các kết quả tìm kiếm có liên quan (dưới dạng tài liệu văn bản) để giúp người dùng dễ dàng rút trích thông tin cần thiết. Gom cụm văn bản ban đầu được phát triển để cải thiện hiệu suất của các công cụ tìm kiếm thông qua phân nhóm trước toàn bộ ngữ liệu. Sau này, gom cụm văn bản sau này cũng đã được được nghiên cứu để duyệt tài liệu kết quả sau khi trích xuất.

Một vài bài toán liên quan đến gom cụm văn bản có thể kể đến:  Cải thiện kết quả rút trích tài liệu bằng cách sử dụng các tài liệu đã được gom cụm.  Phân loại được tài liệu giúp cải thiện quá trình duyệt nội dung các tài liệu văn bản.  Kết quả gom cụm giúp nhận dạng nội dung tin tức giả [33]. 3  Ứng dụng vào dịch văn bản từ ngôn ngữ này sang ngôn ngữ khác.

 Ứng dụng vào lọc thư rác.  Phân tích vấn đề hỗ trợ khách hàng: Xác định các vấn đề hỗ trợ thường xuyên diễn ra. Sau đây là một số ví dụ về ứng dụng vào doanh nghiệp liên quan đến gom cụm văn bản:  Tạo lộ trình sản phẩm (product roadmap): Với kết quả gom cụm văn bản, tất cả các bài đánh giá của khách hàng và đối tượng mục tiêu của doanh nghiệp có thể được phân tích và sử dụng để tạo ra một lộ trình gồm các tính năng và sản phẩm mà họ sẽ yêu thích. Ngoài ra, kết quả gom cụm có thể giúp phân tích các đánh giá của đối thủ cạnh tranh để tìm ra những đối tượng muốn công kích, chống phá.

 Xác định các vấn đề hỗ trợ định kỳ: Nhóm hỗ trợ khách hàng hay được hỏi những câu hỏi giống nhau ngày này qua ngày khác. Tuy nhiên, thật khó để phân tích thực sự những điểm khó khăn mà khách hàng có thể gặp phải khi sử dụng sản phẩm và giải quyết chính xác. Gom cụm văn bản sẽ cho phép người dùng không chỉ xem mức độ thường xuyên (hoặc không thường xuyên) của một vấn đề mà còn có thể giúp xác định gốc rễ của vấn đề.  Tạo bản tin tiếp thị tốt hơn: Một trường hợp sử dụng khác để gom cụm văn bản là trong bản sao tiếp thị.

Một tổ chức có thể đã chạy hàng nghìn quảng cáo khác nhau và có nhiều dữ liệu. Nhưng việc hiểu được ngôn ngữ của quảng cáo tác động đến hiệu suất có thể rất khó. Rất khó để phát hiện các xu hướng trong dữ liệu phi cấu trúc, chẳng hạn như bản tin tiếp thị, đây là nơi mà việc gom cụm văn bản có thể phát huy tác dụng. Kỹ thuật này có thể phân tích và chia nhỏ các chủ đề và từ có tỷ lệ trao đổi cao nhất cho phép tạo bản tin có hiệu quả tiếp thị cao.

Gần đây, chúng ta đang bước vào kỷ nguyên dữ liệu lớn, với sự gia tăng mạnh mẽ của các mạng xã hội trực tuyến có hàng tỷ người dùng tương tác với nhau mỗi ngày. Các phương tiện truyền thông xã hội trực tuyến này đã tạo điều kiện cho sự phát triển và lan truyền nhanh chóng các tin tức trực tuyến và tài nguyên kỹ thuật số tới bất kỳ ai có thể kết nối Internet. Trên thực tế, số lượng lớn nội dung kỹ thuật số do người dùng này tạo ra thường ở dạng văn bản ngắn như: bình luận của người dùng, tweet, bài đăng, … trên Twitter hoặc Facebook, … mang thông tin có giá trị [2, 104] [105] đại diện cho các sự kiện thực tế nóng bỏng, chẳng hạn như bàn luận xã hội về sự lây lan của virus COVID-19, cuộc đụng độ Trung Quốc và Ấn Độ 2020, cuộc chiến thương mại của Trung Quốc và Hoa Kỳ… 4 Khi gom cụm văn bản, văn bản được phân chia thành nhiều cụm khác nhau, mỗi cụm đại diện cho một chủ đề nên ta có thể xem bài toán gom cụm trên luồng văn bản là bài toán nhóm các văn bản đến trên luồng với nhau và xác định chủ đề thích hợp cho từng nhóm văn bản.2 Thách thức của bài toán gom cụm luồng văn bản Từ xưa đến nay, hầu hết các nghiên cứu về gom cụm văn bản chủ yếu tập trung vào các văn bản tĩnh và dài. Trên thực tế, các mô hình được thiết kế cho phương pháp gom cụm truyền thống này không thể áp dụng cho các tập ngữ liệu văn bản có tốc độ thay đổi nhanh chóng, gồm các tài liệu văn bản ngắn như bình luận/bài đăng/microblog trên các mạng xã hội như: Twitters, Facebook,.

gom cụm văn bản ngắn (được áp dụng vào nhiều lĩnh vực như đa dạng hóa kết quả tìm kiếm, phát hiện sự kiện và tóm tắt tài liệu [59], hệ thống khuyến nghị [17]) khó khăn hơn so với phương pháp gom cụm văn bản tĩnh truyền thống do ba đặc tính chính, bao gồm độ dài tài liệu khác nhau (rất ngắn chỉ với vài từ hoặc rất dài), độ rời rạc của đặc trưng dữ liệu văn bản và sự thay đổi nhanh chóng của các chủ đề trong các lô tài liệu văn bản khác nhau (đến tuần tự từ các luồng văn bản).

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ