Nghiên cứu các phương pháp học máy để xác định đặc điểm người dùng trên mạng internet

Tài liệu nghiên cứu Luận án một số phương pháp học máy xác định đặc điểm người dùng trên mạng internet, tổng hợp lý thuyết và thực hành, cung cấp kiến thức chuyên sâu về .

Trường đại học

Trường Đại Học

Chuyên ngành

Công Nghệ Thông Tin

Người đăng

Ẩn danh

Thể loại

Luận Án
142
0
0

Phí lưu trữ

35 Point

Mục lục chi tiết

MỞ ĐẦU

1. CHƯƠNG 1: TỔNG QUAN VỀ XÁC ĐỊNH ĐẶC ĐIỂM NGƯỜI DÙNG

1.1. XÁC ĐỊNH ĐẶC ĐIỂM NGƯỜI DÙNG THÔNG QUA PHÂN TÍCH VĂN BẢN

1.2. Đặc điểm của văn bản trực tuyến

1.3. Các dạng thức trong phân tích tác giả văn bản

1.4. Bố cục của luận án

2. CHƯƠNG 2: XÁC ĐỊNH ĐẶC ĐIỂM TÁC GIẢ BÀI VIẾT DIỄN ĐÀN TIẾNG VIỆT

3. CHƯƠNG 3: DỰ ĐOÁN GIỚI TÍNH KHÁCH HÀNG DỰA TRÊN DỮ LIỆU LỊCH SỬ TRUY CẬP HỆ THỐNG TMĐT

PHỤ LỤC

Tóm tắt

I. MỞ ĐẦU

Sự phát triển mạnh mẽ của Internet đã tạo ra những thay đổi lớn trong xã hội. Người dùng có thể dễ dàng truy cập thông tin mà không cần cung cấp thông tin cá nhân. Điều này tạo ra thách thức cho các nhà cung cấp dịch vụ trong việc cá nhân hóa trải nghiệm người dùng. Luận án này nghiên cứu việc xác định đặc điểm người dùng thông qua phân tích văn bản và hành vi, sử dụng các phương pháp học máy. Việc này không chỉ giúp tối ưu hóa hệ thống mà còn hỗ trợ trong việc điều tra tội phạm trực tuyến.

1.1 Lý do lựa chọn đề tài

Xác định đặc điểm người dùng là mối quan tâm hàng đầu của các nhà cung cấp dịch vụ trên Internet. Việc có thông tin về giới tính, độ tuổi, và nghề nghiệp giúp tối ưu hóa hệ thống và quảng cáo. Hơn nữa, việc xác định đặc điểm người dùng còn hỗ trợ trong điều tra tội phạm trực tuyến. Tuy nhiên, người dùng thường không cung cấp thông tin cá nhân, tạo ra thách thức cho việc xác định đặc điểm. Do đó, nghiên cứu này tập trung vào việc dự đoán từ các dấu vết người dùng để lại trên hệ thống.

1.2 Mục tiêu của luận án

Luận án đặt ra các mục tiêu nghiên cứu như xác định đặc điểm tác giả văn bản trên các bài viết diễn đàn tiếng Việt và nghiên cứu các phương pháp trích chọn đặc trưng mới. Mục tiêu cũng bao gồm việc nghiên cứu xác định đặc điểm người dùng dựa trên hành vi trong các hệ thống TMĐT. Các phương pháp trích chọn đặc trưng hiệu quả sẽ được đề xuất nhằm nâng cao độ chính xác trong việc nhận diện người dùng.

1.3 Phạm vi nghiên cứu

Luận án tập trung vào người dùng Internet, đặc biệt là người dùng của các hệ thống như website, email, và TMĐT. Nghiên cứu sẽ thực hiện trên các văn bản tiếng Việt, một lĩnh vực chưa được khai thác nhiều. Đối với phân tích hành vi, nghiên cứu sẽ dự đoán giới tính khách hàng dựa trên dữ liệu truy cập hệ thống TMĐT, một lĩnh vực có tiềm năng ứng dụng cao.

1.4 Các đóng góp của luận án

Luận án đóng góp vào lĩnh vực xác định đặc điểm tác giả văn bản và người dùng dựa trên hành vi. Nghiên cứu sẽ ứng dụng các loại đặc trưng và phương pháp nhận diện khác nhau, đặc biệt là trên ngôn ngữ tiếng Việt. Đề xuất các phương pháp trích chọn đặc trưng mới sẽ giúp nâng cao độ chính xác trong việc nhận diện người dùng và tác giả văn bản.

1.5 Bố cục của luận án

Luận án được chia thành ba chương chính. Chương 1 khảo sát và đánh giá các công trình nghiên cứu trong lĩnh vực phân tích tác giả văn bản và dự đoán đặc điểm người dùng. Chương 2 trình bày về xác định đặc điểm tác giả bài viết diễn đàn tiếng Việt. Chương 3 mô tả các kết quả nghiên cứu về dự đoán giới tính khách hàng dựa trên dữ liệu lịch sử truy cập hệ TMĐT.

II. TỔNG QUAN VỀ XÁC ĐỊNH ĐẶC ĐIỂM NGƯỜI DÙNG

Chương này trình bày tổng quan về xác định đặc điểm người dùng thông qua phân tích văn bản và hành vi. Các nghiên cứu mới nhất trong hai lĩnh vực này sẽ được đánh giá, tập trung vào các đặc trưng nhận diện và kỹ thuật phân tích. Việc xác định đặc điểm người dùng không chỉ giúp tối ưu hóa trải nghiệm mà còn hỗ trợ trong nhiều lĩnh vực như quảng cáo và điều tra tội phạm.

2.1 Xác định đặc điểm người dùng thông qua phân tích văn bản

Phân tích tác giả văn bản là quá trình phân tích tài liệu để xác định tác giả hoặc các đặc điểm của tác giả. Việc này rất cần thiết trong trường hợp tài liệu không rõ tác giả. Các ứng dụng của phân tích tác giả văn bản bao gồm quảng cáo, phát triển sản phẩm, và điều tra tội phạm. Nghiên cứu đã chỉ ra rằng việc xác định đặc điểm tác giả có thể giúp tối ưu hóa các chiến dịch quảng cáo và hỗ trợ trong việc phát hiện tội phạm.

2.2 Đặc điểm của văn bản trực tuyến

Văn bản trực tuyến có những đặc điểm riêng biệt so với văn bản truyền thống. Chúng thường ngắn gọn và ít tuân thủ quy tắc ngữ pháp. Điều này tạo ra thách thức trong việc phân tích tác giả. Tuy nhiên, số lượng mẫu có thể thu thập dễ dàng hơn từ Internet, giúp cho việc phân tích trở nên khả thi. Các thông tin đi kèm như metadata cũng có thể hỗ trợ trong việc nhận diện tác giả.

2.3 Các dạng thức trong phân tích tác giả văn bản

Nhận diện tác giả là việc xác định một văn bản có phải do một tác giả cụ thể tạo ra hay không. Nghiên cứu đã chỉ ra rằng có nhiều kỹ thuật phân tích khác nhau, từ phương pháp bất biến đơn nhất đến các kỹ thuật học máy. Các phương pháp học máy đã cho thấy hiệu quả cao hơn trong việc phân tích tác giả văn bản, đặc biệt là khi xử lý các tập đặc trưng lớn.

25/01/2025

Trích đoạn nội dung tài liệu

mở đầu cho một phương pháp mới về phân tích tác giả văn bản, dựa trên các thông tin kết hợp từ nhiều khía cạnh khác nhau của văn bản. Mostella và Wallace áp dụng phương pháp phân loại Naïve Bayes, sử dụng các đặc trưng là tần suất của một tập các từ chức năng (là các từ có chức năng ngữ pháp như the, of, about. Nghiên cứu đã cho thấy các kết quả đáng tin cậy và mở ra một giai đoạn mới cho kỹ thuật phân tích tác giả văn bản dựa trên các đặc trưng văn bản và kỹ thuật xây dựng mô hình mới. Ý tưởng cơ bản của phương pháp này là tìm cách biểu diễn các tài liệu như các điểm trong một không gian nào đó.

Sau đó, với tài liệu mới cần phân tích, gán nó cho tác giả có các tài liệu được xem là “gần” tài liệu mới nhất theo một độ đo khoảng cách phù hợp nào đó. Phương pháp này đem lại hiệu quả khá tốt, do vậy nó tiếp tục được sử dụng trong các nghiên cứu gần đây và được thử nghiệm trên các độ đo và tập đặc trưng khác nhau. Điển hình là các phương pháp như Delta của Burrows [18] và sau đó được mở rộng thêm qua các nghiên cứu khác như [19], [42], [43] hay phương pháp so sánh xác xuất gần đúng dựa trên phân phối Laplace của các từ có tần suất cao [9], [102]. Ngoài ra, một số hàm đo độ tương tự khác cũng được nghiên cứu sử dụng làm độ đo phân biệt các tác giả dựa trên các tập đặc trưng khác nhau [20], [37], [53], [101].

Một loại kỹ thuật khác được nghiên cứu bởi Burrows (như trích dẫn trong [47]) ứng dụng kỹ thuật phân tích thành phần chính trên tần suất các từ để phân tích tác giả văn bản. Ý tưởng chính của phương pháp là trực quan hóa sự khác biệt giữa các văn bản được viết các tác giả khác nhau bằng cách “chiếu” các véc tơ tần suất từ có số chiều lớn của các văn bản xuống một không gian con chỉ có hai chiều tạo nên bởi hai thành phần chính. Phương pháp này sau đó được nghiên cứu tiếp bởi [15], và được sử dụng để giải quyết các bài toán về phân tích tác giả cho kết quả tốt [16]. Về khía cạnh xác suất, các phương pháp này đã khai thác sự phụ thuộc thống kê của tần suất các từ trong văn bản.3 Phương pháp học máy Học máy là kỹ thuật có nhiều ưu điểm trong việc phân tích tác giả văn bản và được sử dụng trong hầu hết các nghiên cứu gần đây trong lĩnh vực này.

Sử dụng học máy, các văn bản mẫu sẽ được biểu diễn thành các véc tơ đặc trưng được gán nhãn và các thuật toán học máy sẽ được sử dụng để xây dựng mô hình phân loại, cho phép định ra ranh giới giữa các lớp phân loại (các tác giả hoặc các đặc điểm tác giả). Có nhiều thuật toán học máy được thử nghiệm, trong đó thuật toán SVM được sử dụng nhiều nhất và được chứng minh cho kết quả tốt nhất trong nhiều trường hợp. Nhiều nghiên cứu đã thử nghiệm thuật toán SVM trên các tập đặc trưng khác nhau và đều cho kết quả tốt như nghiên cứu của De Vel [107] nhận diện tác giả email cho kết quả có độ chính xác 85.7%; Corney et al. [23] phân tích xác định giới tính tác giả email độ chính xác 70%; Zheng [118] thực hiện nghiên cứu nhận diện tác giả email và nhóm tin tiếng Anh + tiếng Trung; Zhao và Zobel [116] cải tiến các phương pháp phân tích tác giả để áp dụng cho việc nhận diện tác giả các bản tin trực tuyến trên các diễn đàn tiếng Anh và tiếng Ả rập của các nhóm cực đoan đạt kết quả hơn 90% khi dùng SVM; Koppel et al.

[60] sử dụng SVM để xác định ngôn ngữ gốc của tác giả các bài luận tiếng Anh đạt kết quả có độ chính xác 80%; Koppel et al. [59] đề xuất phương pháp so sánh độ sâu về khác biệt đặc trưng dựa trên thuật toán cơ sở là SVM; Zhang và Zhang [114] và Pham et al. [89] nghiên cứu nhận diện đặc điểm người viết blogs dùng SVM; Peersman et al. [84] sử dụng SVM để dự đoán giới tính và tuổi của các tác giả bài viết trên mạng xã hội của Bỉ với độ chính xác lên tới 88%; Rangel et al.

[93] nghiên cứu việc sử dụng SVM để nhận diện giới tính và tác giả của nhiều loại văn bản trực tuyến khác nhau như blogs, bài viết mạng xã hội, đánh giá sản phẩm v. Ngoài SVM còn có nhiều công trình khác cũng nghiên cứu, ứng dụng các thuật toán học máy khác vào lĩnh vực phân tích tác giả. Zheng et al. [118] thử nghiệm ba thuật toán SVM, Decision Tree, Back Propagation Network (BPN) để phân tích tác giả bản tin và cho kết quả SVM và BPN nhận diện chính xác hơn Decision Tree; Graham et al.

[34] sử dụng mạng nơ ron để phân đoạn văn bản theo 14 phong cách; Argamon et al. [11] sử dụng phương pháp học máy hồi quy đa thức dựa trên xác suất Bayesian Multinomial Regression (BMR) để nhận diện đặc điểm tác giả bài viết blogs cho kết quả có độ chính xác 76% ở giới tính và 77% ở độ tuổi; Iqbal [47] sử dụng kỹ thuật tạo vân chữ viết dựa trên các thuật toán tối đa hóa kỳ vọng (Expectation Maximization), K-Means và trích ra các mẫu thường xuất hiện; Nguyen et al. [77], [78] sử dụng hồi quy logic (Logistic Regression) và hồi quy tuyến tính (Linear Regression) để dự toán tuổi của tác giả bài viết blogs và diễn đàn. Nhìn chung, phương pháp học máy hiện nay đang được các nhà nghiên cứu tập trung khai thác và cải tiến để áp dụng vào lĩnh vực phân tích tác giả văn bản, nhằm ngày càng nâng cao độ chính xác.

Bên cạnh các thuật toán kinh điển, nhiều thuật toán khác đang được nghiên cứu cũng với các kỹ thuật hỗ trợ như chọn lọc đặc trưng (feature selection), thuật toán học máy kết hợp (ensemble learning), thuật toán học sâu (deep learning), v. Mặc dù việc lựa chọn thuật toán học máy phù hợp là một vấn đề quan trọng, nghiên cứu của Koppel et al. [58] cho thấy trong lĩnh vực phân tích tác giả văn bản, việc lựa chọn tập đặc trưng lại có tầm quan trọng cao hơn. Phần tiếp theo sẽ trình bày về các đặc trưng nhận diện được sử dụng phổ biến trong phân tích tác giả văn bản.4 Nhận xét và đánh giá Trong các phương pháp phân tích được trình bày ở trên, học máy là phương pháp được sử dụng phổ biến và ưa chuộng nhất hiện nay trong phân tích tác giả nói riêng và các hoạt động phân tích dữ liệu nói chung.

Qua các kết quả khả quan từ các nghiên cứu trước đây, học máy đã chứng tỏ sức mạnh trong việc thao tác với lượng dữ liệu lớn và đa chiều, mang lại các kết quả chính xác và ngày càng chứng tỏ tiềm năng hơn. Chính vì lý do này, luận án sử dụng học máy như phương pháp nghiên cứu chính cho mục tiêu phân tích tác giả bài viết diễn đàn tiếng Việt.5 Các đặc trưng nhận diện Trong phân tích tác giả văn bản, tập đặc trưng có thể được xem như một hình thức biểu diễn văn bản theo các đặc thù của tác giả. Như đã nói ở trên, các nghiên cứu trong thời kỳ đầu tập trung vào tìm kiếm một đặc trưng duy nhất có tính chất bất biến với một tác giả cụ thể nhưng thay đổi giữa các tác giả khác nhau. Đặc trưng được nghiên cứu nhiều nhất là các đặc trưng về độ phức tạp của văn bản, bao gồm độ dài trung bình từ (theo âm tiết hoặc ký tự), số từ trung bình/câu, hoặc độ phong phú của từ (vocabulary richness), v.

Mặc dù các đặc trưng này chưa chứng tỏ được sự hữu ích khi sử dụng cho phương pháp bất biến đơn nhất, chúng có thể được sử dụng như một đặc trưng bổ sung cho tập đặc trưng của các nghiên cứu dựa trên các phương pháp hiện đại hơn sau này [3], [4], [23], [106], [117]. Khác với phương pháp bất biến đơn nhất, các phương pháp sau này sử dụng một tập các đặc trưng thay vì một đặc trưng duy nhất để phân tích tác giả văn bản. Với một tập đặc trưng được lựa chọn, một văn bản có thể được biểu thị bằng một véc tơ đặc trưng mà mỗi mục giá trị thể hiện tần suất của đặc trưng đó trong văn bản [55]. Rất nhiều loại đặc trưng khác nhau đã được các nhà nghiên cứu phân tích và sử dụng cho các tác vụ phân tích tác giả văn bản, nhưng các kết quả thực nghiệm cho thấy không có tập đặc trưng nào là hoạt động tốt nhất trong mọi trường hợp.

Theo Argamon et al. Các đặc trưng phong cách thể hiện cách thức sử dụng các thành phần của ngôn ngữ mà không liên quan đến nội dung, trong khi đặc trưng dựa trên nội dung chủ yếu thể hiện cách sử dụng các thành phần như các từ ngữ có liên quan đến các nội dung cụ thể. Ngoài ra, trong nghiên cứu này, chúng tôi đề xuất thêm cách phân loại đặc trưng theo tính độc lập hay phụ thuộc vào tập dữ liệu. Các đặc trưng độc lập có thể được lựa chọn mà không cần tham chiếu đến tập dữ liệu, trong khi các đặc trưng phụ thuộc được trích chọn ra từ chính tập dữ liệu huấn luyện mô hình.1 Các đặc trưng theo phong cách Các đặc trưng theo phong cách có thể được chia thành ba loại, bao gồm đặc trưng về từ vựng, đặc trưng về ngữ pháp, và đặc trưng về cấu trúc.

Đặc trưng về từ vựng. Các nghiên cứu về xử lý văn bản nói chung thường thường xem một văn bản như một chuỗi các từ hoặc chuỗi các ký tự. Khi đó, các đặc trưng về từ vựng được sử dụng để phân biệt thói quen sử dụng các ký tự và các từ trong văn bản. Các đặc trưng phổ biến thuộc loại này bao gồm số các ký tự, các từ được dùng, tần suất sử dụng các ký tự, của các loại từ, độ dài từ, độ dài câu [3], [6], [7], [71], [107].

Ngoài ra, các đặc trưng khác như tần suất của các chữ cái, các ký tự đặc biệt, độ phong phú trong cách dùng từ cũng được sử dụng [4], [6], [7], [11], [12], [22], [49]. Đặc trưng độ phong phú của từ đánh giá tính đa dạng của việc dùng từ trong văn bản. Các đặc trưng điển hình của loại này là tỷ lệ số từ phân biệt trên tổng số từ, số từ chỉ xuất hiện 1 lần, số từ chỉ xuất hiện 2 lần v. Tuy nhiên, các đặc trưng này có nhược điểm là phụ thuộc nhiều vào độ dài văn bản.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Bài viết "Nghiên cứu các phương pháp học máy để xác định đặc điểm người dùng trên mạng internet" tập trung vào việc áp dụng các kỹ thuật học máy nhằm phân tích và nhận diện đặc điểm của người dùng trên internet. Nghiên cứu này không chỉ giúp hiểu rõ hơn về hành vi và sở thích của người dùng mà còn mở ra cơ hội tối ưu hóa trải nghiệm người dùng trên các nền tảng trực tuyến. Độc giả sẽ tìm thấy những lợi ích thiết thực từ việc áp dụng các phương pháp học máy, từ đó có thể áp dụng vào các lĩnh vực như marketing, phát triển sản phẩm và cải thiện dịch vụ khách hàng.

Nếu bạn quan tâm đến các yếu tố ảnh hưởng đến quyết định của sinh viên trong lĩnh vực công nghệ thông tin, hãy tham khảo bài viết Các yếu tố ảnh hưởng đến quyết định chọn nơi làm việc của sinh viên công nghệ thông tin tại Đà Nẵng. Bài viết này cũng liên quan đến việc phân tích hành vi người dùng trong môi trường học tập.

Ngoài ra, bạn có thể tìm hiểu thêm về Luận văn thạc sĩ về quản lý giáo dục và ứng dụng công nghệ thông tin trong dạy học ở huyện Phong Điền, TP Cần Thơ, nơi mà công nghệ thông tin được áp dụng để nâng cao chất lượng giáo dục, tương tự như việc áp dụng học máy để cải thiện trải nghiệm người dùng.

Cuối cùng, bài viết Nghiên cứu phát triển kỹ thuật hỗ trợ phát hiện đạo văn trong văn bản tiếng Việt cũng có thể cung cấp cho bạn cái nhìn sâu sắc về việc ứng dụng công nghệ trong việc phân tích và xử lý thông tin, một khía cạnh quan trọng trong nghiên cứu học máy.