Mở đầu 1.1 Tổng quan tình hình nghiên cứu thuộc lĩnh vực đề tài Sự bùng nổ thông tin trong thời đại hiện nay khiến chúng ta đối mặt với vấn đề quá tải thông tin. Do vậy, việc tìm kiếm thông tin một cách nhanh chóng và chính xác ngày càng trở thành một nhu cầu cấp thiết. Một lĩnh vực của khoa học máy tính liên quan nhiều nhất đến việc nghiên cứu và phát triển các kỹ thuật tìm kiếm là truy tìm thông tin (information retrieval). Nói ngắn gọn, đây là một khoa học nền tảng cho các công cụ tìm kiếm.
Lĩnh vực này cung cấp các kỹ thuật nền tảng cho việc xây dựng một hệ thống tìm kiếm thông tin nhằm giúp người dùng tìm được thông tin (thường là tài liệu ở dạng văn bản) thỏa mãn nhu cầu của họ (thường được diễn đạt dưới dạng một truy vấn) từ một nguồn thông tin (thường rất lớn) được lưu trữ trên máy tính [1]. Truy tìm thông tin là một lĩnh vực có một truyền thống thực nghiệm lâu đời. Mặc dù đã bắt đầu từ những năm 1960, vấn đề đánh giá độ chính xác của các hệ thống tìm kiếm vẫn là một chủ đề nóng cho đến hiện nay, với nhiều bài báo được 1 Luan van công bố ở các hội nghị lớn mỗi năm. Để đánh giá một hệ thống truy tìm thông tin, hai tiêu chí chính được sử dụng là mức độ chính xác của kết quả (effectiveness) và thời gian đáp trả của hệ thống (efficiency).
Trong phần lớn các nghiên cứu, việc đánh giá và so sánh thực nghiệm giữa các hệ thống chủ yếu tập trung vào tiêu chí về độ chính xác của kết quả. Độ chính xác của một hệ thống thường được đánh giá theo hai cách: (1) tiến hành nghiên cứu trên những người sử dụng hệ thống để đánh giá chất lượng của quá trình tìm kiếm và kết quả (user based evaluation), hoặc (2) phát triển các bộ sưu tập dữ liệu đánh giá chuẩn (standard test collections) và thử nghiệm một hệ thống trên các tập dữ liệu này để đánh giá chất lượng của kết quả tìm kiếm (system based evaluation) [2]. Cách thứ nhất cho phép chúng ta thấy được hiệu quả thực tế của một hệ thống. Tuy nhiên, do sự tham gia của những người dùng khác nhau, rất khó để có thể so sánh hai hệ thống một cách đáng tin cậy và lặp lại thí nghiệm bằng cách sử dụng phương pháp này.
Chính vì vậy mà cách thứ hai là cách thường được chọn (cho đến hiện nay) trong việc đánh giá kết quả tìm kiếm của một hệ thống tìm kiếm (đặc biệt là trong nghiên cứu). Cách đánh giá này được đề xuất bởi Cleverdon và các cộng sự vào những năm 1960 [3, 4] và thường được gọi là phương pháp đánh giá Cranfield (Cranfield evaluation method). Theo phương pháp này, một bộ sưu tập các tài liệu và các truy vấn sẽ được chọn làm mẫu, sau đó, người ta sẽ đánh giá tất cả các tài liệu ứng với mỗi truy vấn để xác định những tài liệu có liên quan. Một bộ sưu tập đánh giá chuẩn gồm ba thành phần: (1) bộ sưu tập tài liệu (document collection), (2) bộ sưu tập truy vấn (query collection), và (3) các đánh giá về độ liên quan (relevance judgments) cho tất cả các truy vấn.
Một tài liệu được giả định là có liên quan hoặc không có liên quan đến truy vấn (binary relevance) hoặc thể hiện mức độ liên quan theo nhiều cấp (graded relevance). Những đánh giá về sự liên quan cho tất cả các truy vấn sau khi thu thập sẽ được sử dụng để xác định tính chính xác của kết quả trả về (thường xếp hạng các các tài liệu liên quan đến câu truy vấn theo thứ tự giảm dần). Một xếp hạng lý tưởng sẽ đưa tất cả các tài liệu 2 Luan van liên quan lên trên tất cả những tài liệu không liên quan. Phương pháp này được chấp nhận bởi TREC 1 - một hội nghị được tổ chức hằng năm nhằm đánh giá kết quả của các kỹ thuật tìm kiếm.
Chương về đánh giá trong sách của van Rijsbergen [5] là một tài liệu mang tính lịch sử về đo lường độ chính xác trong lĩnh vực truy tìm thông tin. Một nguồn hữu ích khác là cuốn sách của TREC [6], trong đó mô tả các bộ sưu tập thử nghiệm, các thủ tục đánh giá được sử dụng và cách chúng được phát triển. Các bài báo của Saracevic [7] và Mizzaro [8] là một trong các nguồn tốt nhất xem xét lại các vấn đề về sự liên quan (relevance) khi đánh giá hệ thống tìm kiếm. Quá trình thu thập đánh giá liên quan và độ tin cậy của các thí nghiệm được thảo luận trong cuốn sách TREC.
Zobel [9] cho thấy sự không đầy đủ của các đánh giá liên quan (relevance judgments) không ảnh hưởng đến các thí nghiệm, nhưng Buckley và Voorhees [10] cho rằng nếu các đánh giá liên quan thiếu quá nhiều thì nó có thể là vấn đề. Voorhees và Buckley [11] bàn đến số lượng truy vấn cho mỗi bộ sưu tập thử nghiệm để kết quả so sánh có ý nghĩa. Sanderson và Zobel [12] chứng tỏ rằng phép kiểm định ý nghĩa thống kê được sử dụng có thể ảnh hưởng để độ tin cậy của so sánh. Carterette và các cộng sự [13] mô tả một kỹ thuật để thu giảm số đánh giá liên quan cần có để vẫn đảm bảo độ tin cậy khi so sánh các hệ thống.
TREC không những có ảnh hưởng lớn trong việc phổ biến cách tiếp cận dùng bộ sưu tập thử nghiệm để đánh giá độ chính xác của các hệ thống tìm kiếm mà còn có ảnh hưởng lớn đến các độ đo được sử dụng để đánh giá chúng. Nhiều độ đo đã được tạo ra thông qua TREC. Một số độ đo được sử dụng phổ biến là MAP, R-Precision, P@k, DCG, RBP, BPref [6]. Cho trước một bộ sưu tập tài liệu thử nghiệm gồm tập các tài liệu, tập các truy vấn và tập các đánh giá liên quan ứng với mỗi truy vấn, các nhà nghiên cứu có thể sử dụng các độ đo đã đề cập ở trên để tính độ chính xác của phương pháp A và so 1 http://trec.gov/ 3 Luan van sánh nó với độ chính xác của một phương pháp B khác.
Tuy nhiên, kết quả của một so sánh như vậy chỉ cho họ biết phương pháp nào là tốt hơn trên bộ sưu tập tài liệu thử nghiệm cho trước. Về mặt lý thuyết, họ thường muốn mở rộng kết luận của mình đi xa hơn bộ sưu tập tài liệu thử nghiệm được dùng để đánh giá phương pháp. Khi các nhà nghiên cứu báo cáo độ chính xác của hệ thống trên một tập các truy vấn, họ ngầm định rằng họ cũng sẽ thu được các kết quả tương tự trên các tập truy vấn khác. Mục đích dự định của hệ thống là độ hiệu quả của nó cũng tương tự trên các truy vấn khác chứ không chỉ dừng lại ở các truy vấn được dùng để thử nghiệm.
Phân tích thống kê thường được sử dụng để ước lượng độ chính xác của một đại lượng hoặc cung cấp bằng chứng hỗ trợ cho một giả thuyết và là vấn đề rất được quan tâm trong cộng đồng nghiên cứu về truy tìm thông tin [14]. Smucker và các cộng sự [15] đã tiến hành so sánh các phép kiểm định ý nghĩa thống kê khi so sánh các hệ thống tìm kiếm và kết luận rằng randomization, bootstrap, và t-test cho kết quả gần như nhau đồng thời đề xuất không sử dụng Wilcoxon và sign test vì không ổn định và không tương thích với các phép thử nghiệm trên. Dựa trên kết quả này, các tác giả đề xuất sử dụng randomization test nhưng nếu số liệu thống kê được quan tâm là giá trị trung bình thì nên sử dụng t-test vì nó an toàn, ít vi phạm giả định thông thường.2 Tính cấp thiết Truy tìm thông tin được xem là một lĩnh vực thực nghiệm, do đó, các phương pháp (hệ thống) đề xuất cần được thực chứng và so sánh, mọi trực giác đều có thể không đúng. Việc đánh giá và so sánh các phương pháp (hệ thống) sẽ giúp xác định được những phương pháp thực sự tốt để định hình và thúc đẩy sự phát triển của lĩnh vực.
Đánh giá hiệu quả cũng như độ chính xác của hệ thống là một trong những vấn đề quan trọng của lĩnh vực này. Mục tiêu của việc so sánh các phương pháp là để khẳng định được phương 4 Luan van pháp này là thực sự tốt hơn (chứ không phải là tốt hơn do ngẫu nhiên) phương pháp kia trong việc đạt được mục đích dự định của nó. Không có đánh giá, rất khó để có thể biết được phương pháp nào tốt hơn. Tuy nhiên, để làm được điều này cần có một có một nền tảng về phương pháp đánh giá được xây dựng tốt và đáng tin cậy.
Trong đề tài này, chúng tôi tập trung nghiên cứu các vấn đề liên quan đến đánh giá các hệ thống (phương pháp) truy tìm thông tin nhằm thiết lập các nền tảng cho việc so sánh và đánh giá chúng.3 Mục tiêu của nghiên cứu Mục tiêu của nghiên cứu là nghiên cứu tổng quan về lĩnh vực truy tìm thông tin và các kỹ thuật đánh giá và so sánh các hệ thống truy tìm thông tin. Nội dung của nghiên cứu tâp trung vào hai mục tiêu chính sau: • Khảo sát các độ đo để đánh giá và so sánh các hệ thống truy tìm thông tin • Khảo sát các phương pháp đánh giá và so sánh kết quả tìm kiếm của các hệ thống truy tìm thông tin • Các phương pháp thống kê để so sánh hai phương pháp.4 Cách tiếp cận • Tìm hiểu các độ đo để đánh giá và so sánh các hệ thống truy tìm thông tin • Tìm hiểu các phương pháp so sánh kết quả của các hệ thống truy tìm thông tin • Tìm hiểu các phương pháp thống kê để so sánh hai phương pháp.5 Phương pháp nghiên cứu • Phương pháp đọc tài liệu (phần khảo sát các nghiên cứu liên quan) • Phương pháp thực nghiệm (phần đánh giá các phương pháp so sánh) 1.6 Đối tượng và phạm vi nghiên cứu Trong đề tài này, chúng tôi chỉ tập trung vào việc đánh giá các hệ thống (phương pháp) tìm kiếm thông tin cho kho dữ liệu gồm những tài liệu tiếng Anh dạng văn bản (text). Ngoài ra, các đối tượng nghiên cứu khác bao gồm: • Các độ đo để đánh giá và so sánh các hệ thống truy tìm thông tin • Các phương pháp so sánh kết quả của các hệ thống truy tìm thông tin • Các phương pháp thống kê để so sánh hai phương pháp.7 Nội dung nghiên cứu Nội dung công việc cụ thể của nghiên cứu gồm: • Nghiên cứu tổng quan về lĩnh vực truy tìm thông tin để có được kiến thức cơ sở về việc xây dựng một hệ thống tìm kiếm.