ĐẶT VẤN ĐỀ 1. Động lực và mục đích 1. Nghiên cứu về khai phá dữ liệu Blog Công trình nghiên cứu của Craig Macdonald và cộng sự, 2010 [20] cung cấp một bức tranh tổng thể về khai phá dữ liệu Blog. The Text REtrieval Conference (TREC) là một diễn đàn đang phát triển, được Viện Tiêu chuẩn và Công nghệ quốc gia (National Institute of Standards and Technology: NIST1) tổ chức hàng năm từ năm 1992 nhằm tạo thêm các phương tiện cho nghiên cứu thực nghiệm trong những task (bài toán) thu hồi thông tin IR (Information Retrieval).
TREC bao gồm nhiều track (nhánh), mỗi track tập trung vào xây dựng những tổng hợp kiểm tra khác nhau, nhờ đó những hệ thống thu hồi được đánh giá dựa trên khả năng của chúng trong việc xác định những văn bản thích hợp khi thực hiện những truy vấn kiểm tra. Blog track tại TREC được bắt đầu vào năm 2006 với mục đích khám phá những thông tin về hành vi trong thế giới blog. Blog track gồm những bài toán sau: opinion-finding (tìm quan điểm), blog distillation (phân bố blog) và top news identification (định danh các tin tức nổi bật). Về tập dữ liệu, đã có hai tập dữ liệu về blog được thu thập và xây dựng đó là blog06 (được sử dụng trong những năm 2006 - 2008) và blog08 (được sử dụng trong năm 2009).
Thế giới blog phản ánh những sự kiện trong đời sống thực, tại đó những blogger tác giả của những bài viết thảo luận những ý kiến của họ trong những chủ đề mà họ thấy thích thú. Một vài chủ đề có thể thu hút nhiều blogger trong việc đọc nó hay để lại những comment thể hiện ý kiến của họ, một số khác thì ít được thu hút hơn. Trong opinion-finding task được đưa ra tại TREC 2006, mục đích của mỗi truy vấn là xác định ý kiến được thể hiện trong bài viết về một đối tượng nào đó, ví dụ như tên thực thể, địa danh, tổ chức hay là những khái niệm như tên sản phẩm, sự kiện; có thể tóm gọn trong câu hỏi “Mọi người nghĩ thế nào về X?”. Khai phá quan điểm có một lịch sử phát triển lâu dài trong Xử lý ngôn ngữ tự nhiên, tuy nhiên opinion-finding task là một bước đầu nhằm phân tích hiệu quả của khai phá quan điểm.
Có hai phương pháp giải quyết chính cho task này đó là dựa trên phân lớp và dựa trên từ vựng. Mục đích của blog distillation task (lần đầu tại TREC 2007) là giúp những hệ thống có khả năng gợi ý những blog thích hợp với những truy vấn, có khoảng 150 chủ đề blog được tạo ra ở TREC 2007 và có hai phương pháp chính giải quyết task này. Thứ nhất, coi đây như là 1 http://www.html 3 một vấn đề lựa chọn tài nguyên trong thu thập thông tin bị phân tán; mục đích là lựa chọn những tài nguyên càng phù hợp với truy vấn được đưa ra càng tốt. Ở trong blog thì được chia làm hai loại văn bản, đó là văn bản lớn chính là những blog, văn bản nhỏ là những bài viết trên blog.
Thứ hai, coi blog distillation task như vấn đề tìm kiếm một chuyên gia. Mục đích chính của tìm kiếm chuyên gia đó là tìm kiếm những người có kiến thức sâu về những chủ đề được quan tâm, tương tự thế, nhiệm vụ đưa ra những bài viết thích hợp được xem như là xác định những blogger, là những tác giả của những bài viết được quan tâm. Task cuối cùng đó là top news identification task được đưa ra tại TREC 2009, có mục đích đưa ra một gợi ý thứ hạng của những bài mới quan trọng nhất được sử dụng cho những hệ thống dùng dữ liệu blog08. Tính đến TREC 2009 có một vài phương pháp đề xuất giải quyết task này như McCreadie và cộng sự [15] đề suất mô hình dựa trên mô hình Voting Model của C.
Ounis [16]; ngoài ra Y. Lee và cộng sự [14] đề xuất mô hình hóa ngôn ngữ để xếp hạng những bài mới dựa trên độ quan trọng của chúng theo từng ngày, độ quan trọng này được dựa trên những minh chứng rằng bài viết đó được quan tâm nhiều. Như vậy, hai task cuối trên đây có thể được quan niệm bao gói việc phân tích ảnh hưởng trong thế giới blog và từ đó xác định được các thực thể (blogger hoặc các bài viết) có ảnh hưởng cao. Ảnh hưởng trong Blog Phân tích ảnh hưởng là một chủ đề nghiên cứu quan trọng trong khoa học xã hội và càng quan trọng hơn trong các cộng đồng trực tuyến như các mạng xã hội: Facebook, Twitter, các trang thương mại điện tử như Amazon, Netflix, đóng một vai trò quan trọng cuộc sống thường này.
Michinari Momma và cộng sự [24] cho rằng ảnh hưởng xã hội gồm hai thành phần: thứ nhất là hành vi của một đối tượng độc lập, thứ hai là những hành vi đó ảnh hưởng, tác động đến đối tượng khác. Thành phần thứ hai chính là xác định ảnh hưởng của các mối liên kết. Việc xác định những blogger có ảnh hưởng nhất mang lại nhiều lợi ích, như việc tìm ra những cơ hội kinh doanh mới, giả mạo những nghị sự chính trị, những cuộc thảo luận xã hội, những lợi tức xã hội và nhiều ứng dụng khác. Mặt tiêu cực, những blogger có ảnh hưởng có thể làm dao động những ý kiến trong những chiến dịch chính trị, bầu cử và những tác động phản ứng lại chính phủ.
Xác định được những blogger có ảnh hưởng có thể giúp hiểu được những thay đổi, những bẫy giả mạo chính trị hay những điều tương tự, và có những kế hoạch thích hợp, kịp thời, có chuẩn bị trước để ứng phó. Mặt khác, những blogger có ảnh hưởng cũng mang đến sự hỗ trợ và giải 4 pháp, sự tin tưởng cho khách hàng thông qua những kinh nghiệm họ có, về mặt mua bán hay kêu gọi cộng đồng cùng chung tay thực hiện những phong trào mang tính tích cực. Ví dụ, về lĩnh vực mua sắm thì những blogger có ảnh hưởng sẽ ảnh hưởng đến một phần lớn những quyết định mua sắm của những người khác, nhận thức được điều này, các công ty có những chiến dịch maketing thông minh là dựa vào những blogger này. Elkin, 2007 [8] thì có những công ty quảng cáo nắm bắt được điều này và thực hiện việc đặt những quảng cáo lên những trang blog của những blogger có ảnh hưởng.
Theo báo cáo được công bố trên Technorati2 vào 4/5/2007 số lượng blog tăng theo chu trình sáu tháng; Blogpulse3, một trang web theo dõi và xếp hạng các trang blog, vào ngày 12/12/2010 đã theo dõi hơn 150,000 blog và hơn 848,000 bài viết mỗi ngày. Với sự lớn lên nhanh chóng về số lượng blog, blogger và bài viết thì cần phải có những phương pháp mới nhằm xác định được thứ hạng của những blog, blogger, bài viết đó. Mục đích của khóa luận là đề xuất một mô hình nhằm xác định được thứ hạng của những blogger, mà nền tảng là việc tính toán được điểm ảnh hưởng của những bài viết do họ viết. Và việc tìm tập những blogger có ảnh hưởng nhất từ danh sách đã xếp hạng là dễ dàng.
Bài toán xác định ảnh hưởng trên blog Nghiên cứu ảnh hưởng của blogger là tìm ra những blogger có ảnh hưởng nhất trong cộng đồng, từ đó có thể đưa ra những thông tin thiết thực, đáng tin cậy cho con người trong thế giới ảo cũng như thực, phân tích thông tin, đưa ra các tiềm năng kinh doanh, hay những bất ổn trong đời sống xã hội,.Dựa trên những mối quan hệ giữa các blogger, dựa trên các bài đăng của blog, những yếu tố liên quan đến các bài đăng đó, đưa ra đánh giá về độ ảnh hưởng của chúng. Từ những dữ liệu sẵn có, phân tích chúng thành những yếu tố đơn giản hơn, xem xét ảnh hưởng của chúng đối với cộng đồng như thế nào, và đưa ra một đơn vị để đo ảnh hưởng của chúng, tổng hợp lại và dựa trên dữ liệu tổng hợp được để đánh giá. Để đánh giá ảnh hưởng của một blogger dựa vào những bài viết mà họ viết. Có nhiều yếu tố ảnh hưởng đến bài viết.
Một bài viết có thể được nhiều blogger tham chiếu đến thì chứng tỏ bài viết đó có ảnh hưởng vì nó được quan tâm, được nêu ra như 2 http://technorati.com/ 3 http://www.com 5 là một dẫn chứng của bài viết khác. Số comment mà nó nhận được thể hiện sự quan tâm về nội dung, ý tưởng của bài viết và dẫn đến những cuộc thảo luận thể hiện qua comment. Bài viết có tính thuyết phục, có lập luận chặt chẽ, có minh chứng cụ thể sẽ nhận được sự đồng ý, tán thành của người đọc. Bên cạnh đó, cũng không thể không kể đến yếu tố thời gian có thể làm giảm đi sự ảnh hưởng của bài viết.
Tuy nhiên ở trong mô hình của khóa luận không xét đến yếu tố thời gian. 6 Chương 2: CÁC CÔNG TRÌNH NGHIÊN CỨU LIÊN QUAN 2. Phân tích ảnh hưởng trong thế giới blog Những công trình trước đây nghiên cứu về độ ảnh hưởng trong cộng đồng mạng chủ yếu là dựa vào những thống kê, tuy nhiên rất ít công trình thành công theo hướng này. Một giới hạn của những phương pháp thống kê là không xác định trực tiếp được hành vi của người dùng, mà phải gián tiếp hoặc bằng kinh nghiệm, điều này sẽ không chính xác do có nhiều kênh gây nhiễu.
Momma và cộng sự [24] đã đề xuất mô hình xác định ảnh hưởng giữa các blogger trong cộng đồng blog với độ tin cậy cao bằng việc xử lý những file log của web server. Phương pháp này không chỉ xác định được blogger nào có ảnh hưởng mà còn xác định được họ ảnh hưởng ở những chủ đề nào, ảnh hưởng đến những blogger nào. Theo nhóm tác giả, ảnh hưởng xã hội gồm hai thành phần chính đó là suy nghĩ và hành động, suy nghĩ và hành động của người này có thể bị ảnh hưởng bởi suy nghĩ và hành động của những người khác. Dựa trên điều này, ý tưởng chính của mô hình gồm hành động và nguyên nhân.
Hành động chủ yếu trên blog đó là đọc và viết một bài viết. Blogger đọc bài viết do blogger viết, tuy nhiên blogger thường không biết nội dung của trước khi chọn đọc, hoặc là một người rất hay đọc những bài do viết, không bỏ sót bất cứ bài nào, điều này cho thấy hành động đọc không có tác dụng nhiều trong việc xác định ảnh hưởng giữa những blogger. Momma và cộng sự tập trung vào khai thác hành động viết.