Chương 1 trong luận án sẽ trả lời cho vấn đề nghiên cứu 1 Vấn đề nghiên cứu 2: Cơ sở dữ liệu tuần tự cho dự đoán hành vi truy cập Web được xây dựng như thế nào? Nội dung chi tiết của Chương 2 trong luận án sẽ trả lời cho vấn đề nghiên cứu 2 Vấn đề nghiên cứu 3: Làm thế nào để nâng cao độ chính xác cho dự đoán truy cập Web dùng mô hình dự đoán chuỗi tuần tự theo mô hình cây dự đoán nén (Compact Prediction Tree - CPT+) ? Nội dung chi tiết của Chương 3 trong luận án sẽ trả lời cho vấn đề nghiên cứu 3 1 http://www.philippe-fournier-viger.com/spmf/index.php?link=datasets.php 2 Truy cập ngày 29/08/2017 3 Truy cập ngày 22/08/2017 4 Truy cập ngày 25/08/2017 5 Truy cập ngày 12/06/2018 luan an 5 Vấn đề nghiên cứu 4: Làm thế nào để giảm thời gian thực thi dự đoán cho dự đoán truy cập Web dùng mô hình dự đoán chuỗi tuần tự theo mô hình cây dự đoán nén (Compact Prediction Tree - CPT+) ? Nội dung chi tiết của Chương 4 trong luận án sẽ trả lời cho vấn đề nghiên cứu 4 6. Phương pháp nghiên cứu Về hướng tiếp cận, luận án theo hướng tiệp cận Cây dự đoán nén CPT+ (Compact Prediction Tree) để xây dựng các mô hình và giải pháp dự đoán hành vi truy cập web tăng độ chính xác hoặc/và giảm thời gian xử lý. Để mô hình đề xuất dựa trên CPT+ nâng cao hiệu năng cho dự đoán hành vi truy cập Web, nghiên cứu sinh đã nghiên cứu tích hợp thêm giải thuật PageRank và kỹ thuật xử lý chuỗi. Trong quá trình nghiên cứu luận án, nghiên cứu sinh đã sử dụng những phương pháp nghiên cứu như sau: + Phương pháp thu thập dữ liệu: Các bộ dữ liệu click-stream, các bộ dữ liệu Weblog và dữ liệu đặt hàng trong thương mại điện tử được sử dụng trong luận án là dữ liệu thứ cấp và được thu thập từ các nguồn dữ liệu khác nhau có nguồn gốc rõ ràng, khách quan và ghi nhận nhật ký truy cập Web.
+ Phương pháp hỏi ý kiến chuyên gia: Trước và trong thời gian thực hiện luận án, nghiên cứu sinh đã liên hệ với nhiều chuyên gia, các nhà nghiên cứu để được góp ý về tên đề tài cũng như nội dung cần nghiên cứu. Trong đó, vai trò định hướng và góp ý của GS.TS Philippe Fourier Viger 1 là rất quan trọng. + Phương pháp nghiên cứu định lượng: Nghiên cứu sinh tiến hành nghiên cứu thử nghiêm có hệ thống về các hiện tượng quan sát được qua các số liệu thống kê, toán học và thông qua việc phát triển các giải thuật như các giải thuật về xây dựng cơ sở dữ liệu tuần tự, tính toán PageRank, kỹ thuật xử lý chuỗi. 1 Chuyên gia về Data Mining, Big Data, Artificial Intelligence, Pattern Mining, Itemset Mining, Graph Mining, Sequence Prediction, công tác tại Harbin Institute of Technology, China (http://www.philippe-fournier- viger.
luan an 6 + Phương pháp nghiên cứu định tính: Nghiên cứu sinh tiến hành đánh giá các giải pháp đề xuất như so sánh các phương pháp mới và cải tiến cho dự đoán truy cập Web về phương diện thời gian và độ chính xác để xem xét giải pháp đề xuất có phù hợp hay không, chẳng hạn như có ý nghĩa về mặt thống kê hay không. + Phương pháp nghiên cứu phân tích và tổng hợp: Nghiên cứu, tìm hiểu và tổng hợp các lý thuyết liên quan đến đề tài như lý thuyết về dự đoán tuần tự, thuật toán CPT (Compact Prediction tree), thuật toán PageRank. Bên cạnh việc nghiên cứu lý thuyết, nghiên cứu sinh cũng tìm hiểu các nghiên cứu liên quan đến luận án để phân tích điểm yếu, điểm mạnh của các phương pháp dự đoán truy cập Web. Từ việc phân tích và tổng hợp đó, nghiên cứu sinh có cơ sở để đề xuất các giải pháp tốt hơn cho dự đoán truy cập Web so với các tiếp cận thông thường.
Các đóng góp của luận án Các đóng góp cho dự đoán truy cập Web được trình bày trong luận án và các công trình nghiên cứu liên quan của nghiên cứu sinh bao gồm các nội dung chính sau: - Đóng góp thứ nhất: Đề xuất một giải pháp để thiết kế và xây dựng cơ sở dữ liệu tuần tự cho dự đoán truy cập Web. Luận án sử dụng 4 tập dữ liệu được thu thập từ các Website periwinklelecottages.il và inees. Bài toán đặt ra là làm cách nào để tạo ra một cơ sở dữ liệu tuần tự từ tập hợp các tập tin Weblog. Ý tưởng chính của giải pháp là: Trong tập dữ liệu Weblog tìm một mảng chứa các IP khác nhau và một mảng chứa các liên kết khác nhau.
Với mỗi các IP khác nhau có một nhóm các liên kết được truy cập theo thứ tự thời gian. Những nhóm này sẽ là các chuỗi dữ liệu tuần tự của cơ sở dữ liệu tuần tự cần tạo. Hơn nữa, bằng cách phân tích các đặc trưng của dữ liệu Weblog, luận án trình bày làm cách nào để chuyển đổi dữ liệu Weblog thành cơ sở dữ liệu tuần tự bằng một giải thuật tính toán song song và không song song. luan an 7 - Đóng góp thứ hai: Đề xuất một giải pháp để làm giảm thời gian dự đoán cho dự đoán truy cập Web.
Luận án sử dụng năm cơ sở dữ liệu tuần tự để thực hiện. Các cơ sở dữ liệu sử dụng gồm hai cơ sở dữ liệu được tạo ra từ các tập dữ liệu Weblog (thu thập từ các Website (palmviewsanibel.com và inees.org) và ba cơ sở dữ liệu click-stream là KOSARAK, FIFA và MSNBC. Bài toán được đặt ra là làm cách nào để dự đoán một trang kế tiếp theo sao một chuỗi S cho trước trong một cơ sở dữ liệu tuần tự SDB cho trước với một thời gian dự đoán tốt. Để giải quyết vấn đề này, luận án đề xuất năm bước chính: (i) Nhập vào cơ sở SDB và chuỗi tuần tự S; (ii) Loại bỏ các chuỗi tuần tự trong SDB mà không chứa các phần tử của chuỗi tuần tự S.
Với các chuỗi tuần tự mà chứa các phần tử thuộc S, loại bỏ các chuỗi tuần tự trong SDB mà chỉ chứa duy nhất các phần tử của chuỗi tuần tự S ở vị trí cuối cùng. Giải pháp này sẽ làm giảm kích cỡ của cơ sở dữ liệu tuần tự gốc. Dựa vào giải pháp này, thời gian dự đoán trên cơ sở dữ liệu tuần tự thu gọn nhanh hơn thời gian dự đoán của cơ sở dữ liệu gốc (chưa thu gọn). Đối với các tập dữ liệu được thu thập từ các tập tin Weblog, kết quả thử nghiệm trên tập dữ liệu palmviewsanibel.com cho thấy rằng thời gian dự đoán của mô hình đề xuất nhanh hơn 2.7 lần so với thời gian dự đoán của mô hình thông thường mà vẫn đảm bảo độ chính xác.
Tương tự, kết quả thử nghiệm trên tập dữ liệu inees.org chỉ ra rằng thời gian dự đoán của mô hình đề xuất nhanh gần 2 lần so với thời gian dự đoán của mô hình thông thường. Với các tập dữ liệu click-stream, kết quả thử nghiệm trên FIFA, KOSARAK, MSNBC cho thấy rằng thời gian dự đoán của mô hình đề xuất nhanh lần lượt 3 lần, 30 lần, và 103 lần so với thời gian dự đoán của mô hình thông thường mà vẫn đảm bảo độ chính xác. Như vậy thực thi dự đoán trên các tập dữ liệu click-stream hiệu quả hơn nhiều so với thực thi dự đoán trên các tập dữ liệu thu thập từ các tập tin Weblog. - Đóng góp thứ ba: Đề xuất một giải pháp để tăng độ chính xác cho dự đoán truy cập Web.
Luận án sử dụng 3 cơ sở dữ liệu tuần tự để thực hiện giải pháp này. Các luan an 8 cơ sở dữ liệu tuần tự được thu thập từ các tập dữ liệu click-stream: KOSARAK, FIFA và MSNBC. Dựa trên đặc tính của PageRank và giải thuật CPT+, bài toán được đặt ra là làm cách nào để dự đoán một trang kế tiếp theo sau một chuỗi tuần tự cho trước trong một cơ sở dữ liệu tuần tự cho trước với một giải pháp tốt về độ chính xác. Luận án đề xuất 5 bước quan trọng của giải quyết vấn đề này: (i) Nhập vào một cơ sở dữ liệu tuần tự, (ii) Chuyển đổi các liên kết thành các nút của một cơ sở dữ liệu đồ thị, (iii) Tính toán PageRank cho từng nút, (iv) Tính toán trung bình PageRank cho mỗi chuỗi dữ liệu tuần tự, (v) Loại bỏ các chuỗi tuần tự có trung bình Page thấp sao cho độ chính xác của cơ sở dữ liệu thu gọn vẫn cao hơn độ chính xác của cơ sở dữ liệu tuần tự gốc (chưa thu gọn).
Kết quả thử nghiệm cho thấy rằng giải pháp đề xuất cho độ chính xác cao hơn độ chính xác của tiếp cận thông thường khi thực hiện trên các tập dữ liệu khác nhau. Cụ thể là, trên cơ sở dữ liệu tuần tự MSNBC, khi giảm kích cỡ của cơ sở dữ liệu gốc (loại bỏ các chuỗi tuần tự có trung bình PageRank thấp) đến 50%, độ chính xác đã tăng lên đến 25%; trên cơ sở dữ liệu FIFA, khi giảm kích cỡ của cơ sở dữ liệu tuần tự gốc đến 15%, độ chính xác tăng đến 0.013%; trên cơ sở dữ liệu KOSARAK, khi giảm kích cỡ cơ sở dữ liệu tuần tự đến 15% thì độ chính xác tăng lên đến 0. - Đóng góp thứ tư: Đề xuất một mô hình kết hợp giữa tăng độ chính xác và giảm thời gian dự đoán. Luận án sử dụng cơ sở dữ liệu tuần tự KOSARAK, là cơ sở dữ liệu lớn nhất được dùng trong luận án, đề làm dữ liệu đầu vào cho giải pháp này.
Bằng phương pháp kiểm tra chéo K-Fold Check Validation (với K = 10), cơ sở dữ liệu tuần tự KOSARAK đã được chia thành thành 10 phần ngẫu nhiên. Mỗi phần gồm 90% dữ liệu dùng cho huấn luyện và 10% còn lại dùng cho kiểm thử (dự đoán). Kết quả thử nghiệm chỉ ra rằng khi giảm kích cỡ cơ sở dữ liệu tuần tự gốc đến 40% (dùng giải pháp được trình bày trong phần Đóng góp thứ ba), độ chính xác trung bình của giải pháp đề xuất vẫn tốt hơn độ chính xác của tiếp cận thông thường. Tiếp theo, dùng 60% kích cỡ của sơ sở dữ liệu gốc (đã loại bỏ các dữ liệu luan an 9 thừa bằng giải thuật PageRank) để dự đoán bởi giải pháp được trình bày trong Đóng góp thứ hai, kết quả thực nghiệm chứng minh rằng độ chính xác trung bình đã tăng 0.024% và thời gian dự đoán nhanh hơn xấp xỉ 60 lần so với tiếp cận thông thường.
Bố cục của luận án Bố cục luận án gồm có năm chương và một phần kết luận. Cụ thể, trong chương đầu tiên, nghiên cứu sinh trình bày tổng quan về vấn đề cần nghiên cứu.