CHƯƠNG 1 TỔNG QUAN VỀ XÁC ĐỊNH ĐẶC ĐIỂM NGƯỜI DÙNG Chương này trình bày nghiên cứu khảo sát về xác định đặc điểm người dùng, bao gồm xác định đặc điểm người dùng dựa trên phân tích văn bản và dựa trên phân tích hành vi. Các nghiên cứu mới nhất trong hai lĩnh vực trên sẽ được nghiên cứu và đánh giá, trong đó tập trung vào hai vấn đề là các đặc trưng nhận diện và kỹ thuật phân tích. Bố cục của chương như sau: Phần 1.1 trình bày các khảo sát và đánh giá về các công trình nghiên cứu trong lĩnh vực phân tích tác giả văn bản.2 trình bày các khảo sát về lĩnh vực dự đoán đặc điểm người dùng dựa trên hành vi.3 trình bày về công cụ thực nghiệm WEKA. Cuối cùng, phần 1.4 nêu các vấn đề còn tồn tại và cần được nghiên cứu, giải quyết.1 XÁC ĐỊNH ĐẶC ĐIỂM NGƯỜI DÙNG THÔNG QUA PHÂN TÍCH VĂN BẢN 1.1 Giới thiệu Phân tích tác giả văn bản là quá trình phân tích một tài liệu để có thể đưa ra các kết luận về tác giả của nó.
Việc phân tích tác giả văn bản là cần thiết trong trường hợp có các tài liệu không rõ tác giả và cần phải phân tích để chỉ ra tác giả hoặc chỉ ra các đặc điểm của tác giả. Trước đây, việc phân tích tác giả được áp dụng chủ yếu cho các tác phẩm văn học như sách báo. Tuy nhiên, trong những năm gần đây, sự phát triển của Internet và các kênh trao đổi thông tin trực tuyến đã hình thành nên nhiều loại văn bản điện tử với số lượng lớn như email, blogs, diễn dàn v., trong đó có rất nhiều bài viết không rõ tác giả (do vô tình hoặc cố ý). Trong nhiều trường hợp, việc xác định ra các đặc điểm hoặc phát hiện ra tác giả của các bài viết, nhận xét, bình luận vô danh là rất cần thiết, phục vụ cho nhiều mục đích khác nhau như: 2 Lĩnh vực quảng cáo, bán hàng: Việc xác định các đặc điểm của người dùng giúp cho các thông tin quảng cáo hoặc giới thiệu sản phẩm được hiển thị đúng đối tượng, qua đó thúc đẩy hoạt động tiếp thị, bán hàng trực tuyến.
Lĩnh vực phát triển sản phẩm: Hỗ trợ cho các tổ chức/doanh nghiệp trong việc xác định đặc điểm của những người thích hoặc không thích sản phẩm/dịch vụ của họ thông qua việc xác định tác giả của các bình luận/đánh giá tích cực hoặc tiêu cực. Lĩnh vực tòa án, điều tra tội phạm: Hỗ trợ cho công tác phân xử hoặc phán xét các tranh chấp thông qua việc chứng minh một văn bản nào đó là do một người tạo ra hoặc không phải do một người tạo ra. Ngoài ra, việc xác định được tác giả của các văn bản cũng giúp ích trong một số lĩnh vực quan trọng khác như xác định những tội phạm gửi thông tin nặc danh hoặc giúp phát hiện ra việc sao chép trái phép tài liệu hoặc văn bản. Theo Zheng et al.
[118], lĩnh vực nghiên cứu về phân tích tác giả văn bản có thể chia làm các dạng thức như sau: Nhận diện tác giả: Là việc xác định xem một người có phải là tác giả của một văn bản không thông qua việc phân tích các văn bản khác do người đó tạo ra. Xác định đặc điểm tác giả: Là việc chỉ ra các đặc điểm của người đã tạo ra một văn bản cho trước. Các đặc điểm này có thể là về đặc điểm cá nhân, tính cách, trình độ v. Phát hiện văn bản cùng tác giả (phát hiện sao chép): Là việc so sánh hai hoặc nhiều văn bản xem có phải chúng được tạo ra bởi cùng một tác giả hay không.
Quá trình phân tích tác giả văn bản liên quan đến hai vấn đề chính, đó là kỹ thuật phân tích và tập đặc trưng phân biệt. Có khá nhiều kỹ thuật được sử dụng trong phân tích tác giả văn bản. Koppel [58] phân chia các kỹ thuật ra làm ba loại. Trong thời gian đầu, các kỹ thuật phân 3 tích chủ yếu sử dụng phương pháp bất biến đơn nhất (unitary invariant), trong đó một hàm số học đơn nhất của văn bản được sử dụng để phân biệt các tác giả.
Phương pháp phân tích đa biến (multivariate analysis) được sử dụng sau đó cho phép thực hiện phân tích đa biến theo thống kê dựa trên tần suất các từ và các đặc trưng số khác. Mặc dù các phương pháp này đã đạt được những kết quả khá tốt trong thời gian đầu, nhưng vẫn còn tồn tại những hạn chế, như khả năng xử lý số lượng lớn các đặc điểm hay sự ổn định trên nhiều lĩnh vực. Để giải quyết các vấn đề này, các kỹ thuật học máy đã được nghiên cứu áp dụng. Sự phát triển của các máy tính tốc độ cao đã cho phép các nhà nghiên cứu thực hiện các thực nghiệm phân tích trên các thuật toán học máy phức tạp trên các tập đặc trưng lớn.
Nhiều nghiên cứu về phân tích tác giả văn bản dựa trên các kỹ thuật học máy đã cho ra kết quả tốt, điển hình là các thuật toán như máy véc tơ hỗ trợ (SVM - Support Vector Machine), mạng Bayes (Bayesian Networks), hay cây quyết định (Decision Trees). Nhìn chung, các phương pháp phân tích dựa trên học máy đã có những ưu điểm hơn so với các phương pháp trước đây và các thực nghiệm đã cho thấy kết quả tốt hơn [58]. Tập đặc trưng có thể được xem như một phương pháp biểu diễn văn bản trên khía cạnh phong cách viết hoặc cách sử dụng từ. Với một tập đặc trưng được lựa chọn, một văn bản có thể được biểu diễn bởi một véc tơ đặc trưng, trong đó mỗi thành phần biểu thị tần suất của mỗi đặc trưng trong văn bản hoặc một giá trị biểu thị tính chất đặc thù của văn bản đó [55].
Đã có nhiều tập đặc trưng được thử nghiệm, tuy nhiên không có tập đặc trưng nào là tốt nhất trong mọi trường hợp. Theo Argamon et al. [11], có hai loại đặc trưng chính được sử dụng trong phân tích tác giả văn bản: đặc trưng về phong cách và đặc trưng dựa trên nội dung. Đặc trưng về phong cách bao gồm các đặc trưng liên quan đến cách dùng ký tự, các tính chất từ (lexical), cách sử dụng các cấu trúc ngữ pháp (syntactic), và các đặc trưng về cấu trúc văn bản.
Đặc trưng dựa trên nội dung bao gồm các từ nhất định hoặc các nội dung đặc biệt được sử dụng thường xuyên trong lĩnh vực đó hơn là các lĩnh vực khác. Các từ này có thể được chọn theo phương pháp so sánh ngữ nghĩa hoặc trích chọn dựa trên tần suất xuất hiện trong tập dữ liệu. 4 Các phần tiếp theo sẽ trình bày về đặc điểm của loại văn bản trực tuyến và các khảo sát về các dạng thức, các kỹ thuật, và các tập đặc trưng được sử dụng trong lĩnh vực phân tích tác giả văn bản.2 Đặc điểm của văn bản trực tuyến Văn bản trực tuyến (online documents) hay văn bản điện tử (electronic documents) là các tài liệu viết được trao đổi giữa những người dùng trên mạng Internet. Phương thức trao đổi các tài liệu này có thể là đồng bộ như chat hoặc bất đồng bộ như thư điện tử, diễn đàn.
Việc phân tích tác giả của các tài liệu trực tuyến có nhiều thách thức hơn so với các loại văn bản truyền thống do đặc điểm về cấu tạo và độ dài văn bản [106]. Theo Foertsch (như trích dẫn trong [47]), tài liệu trực tuyến không phải tài liệu viết đơn thuần cũng không phải tài liệu nói đơn thuần mà là một loại tài liệu nằm ở giữa hai loại tài liệu trên. Các loại tài liệu truyền thống như sách, báo, bài luận v. là những loại tài liệu chứa nhiều thông tin hữu ích để phân tích văn phong của tác giả do chúng có độ dài lớn (vài trăm từ cho tới hàng trăm trang).
Ngoài ra, các loại tài liệu này thường được cấu trúc tốt và được viết theo đúng các quy tắc ngữ pháp và cú pháp. Đã có nhiều nghiên cứu thành công trong việc phân tích tác giả của các loại tài liệu này. Các tài liệu trực tuyến thường có độ dài ngắn (vài chục đến vài trăm từ), và thường được viết theo phong cách tự do, ít theo các quy tắc ngữ pháp và cú pháp chính thống. Do đó, việc phân tích các thói quen trong việc viết các tài liệu này của các tác giả là khó khăn hơn nhiều.
Ledger và Merriam (như trích dẫn trong [47]) cho rằng việc phân tích tác giả của các tài liệu có độ dài <500 trang là khó khả thi. Ngoài ra, các tài liệu trực tuyến là các tài liệu tương tác, thường được viết nhằm mục đích duy nhất là biểu thị suy nghĩ của người viết mà ít quan tâm đến các lỗi ngữ pháp và chính tả. Do đó, các phương pháp phân tích dùng cho các loại văn bản trước đây thường phải điều chỉnh cho phù hợp với loại văn bản này. Mặc dù vậy, các loại văn bản trực tuyến cũng có một số ưu điểm trong việc phân tích tác giả.
Đó là số lượng mẫu có thể được thu thập nhiều và dễ dàng hơn do số lượng lớn các tài 5 liệu được trao đổi trên Internet và tính mở của các hệ thống quản lý các tài liệu này. Ngoài ra, một số thông tin đặc trưng như cấu trúc của các tài liệu (lời chào, chữ ký) hoặc các thông tin đi kèm khác (metadata) cũng có thể giúp ích cho việc nhận diện đặc điểm tác giả [106].3 Các dạng thức trong phân tích tác giả văn bản 1.1 Nhận diện tác giả Nhận diện tác giả (authorship attribution) liên quan đến việc xác định một văn bản có phải được tạo ra bởi một tác giả cụ thể hay không hoặc xác định ai trong số một tập hữu hạn tác giả là người đã tạo ra một văn bản cho trước (do vậy, kỹ thuật này còn được gọi là xác định tác giả). Nghiên cứu đầu tiên về nhận diện tác giả được thực hiện từ thế kỷ thứ 19 khi Mendenhall [75] phân tích các vở kịch của Shakespeare. Tuy nhiên, công trình nghiên cứu được xem là thấu đáo nhất trong lĩnh vực này được thực hiện bởi Mosteller và Wallace [76], trong đó hai ông đã phân tích và xác định tác giả của Luận cương Liên bang (Federalist Papers).
Cho đến nay, đã có thêm nhiều công trình nghiên cứu về lĩnh vực này, áp dụng trên nhiều loại văn bản và ứng dụng trong nhiều lĩnh vực khác nhau. Đồng thời, có nhiều loại đặc trưng và phương pháp đã được các nhà nghiên cứu thử nghiệm. De Vel [107] đã nghiên cứu việc nhận diện tác giả của email, sử dụng các đặc trưng về cấu trúc và ngôn ngữ, dùng thuật toán SVM.