Chương 1. — Giới thiệu để tài. Dat VAN a5 ốẽ. Định hướng va giải pháp.
Bố cục khóa luận.---ssieetreererterterterttrrtrrtrerrrrerrrrrrrrree Chương 2. Các nghiên cứu liên quan. Hệ khuyến nghị. Các phương pháp tiệp cận.
Ma trận utility. Kỹ thuật truy hổi thông tit. Một số phương pháp truy hồi thông tỉn. Bộ dữ LGU we ssscsscsssssecsssnssesessnssesesssssesesssseessssussessssueseesssuseessssueseessssecessnsesessnsseeess N an 3.
Mô tả tập dữ liệu. Tiền xử lý dữ liệu. Tiền xử ly tap dữ liệu books. Tiền xử lý dữ liệu văn bản mô tả sách.---srseree Ne} Chuong 4.
Thử nghiệm và đánh giá. Phương pháp đánh giá và độ đo sử dụng.ÔÔỎ Hệ thống dé xuat.ssssssssssntnsanssssstistesasieiatiststseiseestassaessesanete w an 02wNan lì na. Các bước triển Khai. Giao diện chính của ứng dụng.ecceeeeeetetriririiirrir 39 Chương 6.
_ Kết luận và hướng phát triỂn. Hướng phát triển.---es2tseerterterrtretrerrertrrrrrerrrrerrrre 42 DANH MỤC HÌNH Hình 2. Ví dụ về một ma trận utili(y.----¿- ¿2£©++2x++2++2x++zx++zxt+rxerxrerxesred 9 Hình 3. Doan dir liệu văn ban mô ta của sách (được khoang đỏ).
Phân bổ rating của uS€T. Giá trị RMSE với tổng số item nhóm Ï. Giá trị RMSE với tổng số item nhóm 2. Giá trị RMSE với tổng số item nhóm 3.
Quá trình xử lý đữ liệu. E* SH HH HH Hư, 37 Hình 5. Quá trình tạo CAC BOTY. Giao diện ứng dụng (1).
-- << 111v HH ng ng 39 Hình 5. Giao diện ứng dụng (2).-- c1 31391191 119111 vn ng ng 40 DANH MỤC BANG Bảng 2. So sánh Skip-gram và CBOÏW. LH HH HH HH 19 Bảng 3.
Ý nghĩa các trường trong tập dữ liệu DOOKS. Các giá tri ở trường language_code trong tập books. Số lượng các giá trị rỗng trong trường languaga_code. Y nghĩa các trường có trong tập ratings.
Kết quả RMSE trung bình của từng mô hình (Nhóm I). Kết quả RMSE trung bình của từng mô hình (Nhóm 2). Kết quả RMSE trung bình của từng mô hình (Nhóm 3). 34 DANH MỤC TỪ VIET TAT STT| Tên viết tắt Tên đầy đủ I | API Application Programming Interface 2 |BoW Bag-of-Words 3 | CBF Content-based Filtering 4 | CBOW Continuous Bag-of-Words 5 |CF Collaborative Filtering 6 |DBOW Distributed Bag-of-Words 7 |DM Distributed Memory 8 | DIM Document-Term Matrix 9 | FN False Negative 10 | FP False Positive 11 | IICF Item-Item Collaborative Filtering 12 |MSE Mean Squared Error 13 |NLTK Natural Language ToolKit 14 |RS Recommender System, Recommendation System 15 |RMSE Root Mean Squared Error 16 | TF-IDF Term Frequency - Inverse Document Frequency 17 | TN True Negative 18 TP True Positive 19 UUCF User-User Collaborative Filtering TÓM TÁT KHÓA LUẬN Recommendation system hay recommender system, hệ khuyến nghị, là hệ thống được xây dựng đề đưa các gợi ý, khuyến nghị cho user dựa trên những dữ liệu đã có sẵn về user hoặc sản phẩm.
Hệ khuyến nghị là bài toán có tính thực tiễn và tính ứng dụng cao, như giải quyết các vấn đề lựa chọn của user như nên mua sản phẩm nào, bài nhạc nào phù hợp với mình hay nên đọc các tin tức gì trong hằng sa số các lựa chọn. Hiện nay, các bài toán này ngày càng trở nên phé biến hơn nhờ sự phát triển thần tốc của các nền tảng số như các trang mạng xã hội TikTok, Instagram hoặc các nền tảng streaming trực tuyến như Netflix, Youtube, v. Information retrieval techniques, hay kỹ thuật truy hôi thông tin, là các kỹ thuật truy xuất thông tin từ các dữ liệu không có cấu trúc cụ thể như hình ảnh, âm thanh hoặc văn ban. Các kỹ thuật này truy xuất các thuộc tinh an của dữ liệu nhằm có thể tái sử dụng các dữ liệu này một cách hiệu quả hơn.
Là một người yêu thích đọc sách, và các hệ thống gợi ý sách thường chỉ áp dụng các thuộc tính cơ bản như đầu mục, tác giả hay thê loại của sách đề đưa ra gợi ý, em cảm thấy có thé đưa ra một giải pháp cải thiện cho các hệ thống gợi ý này bằng cách áp dụng thêm các kỹ thuật truy hồi thông tin lên các đoạn văn bản gợi ý của tựa sách dé xây dựng hệ khuyến nghị. Trong khóa luận này, em sẽ nghiên cứu và áp dụng các kỹ thuật truy hồi thông tin bao gồm: TF-IDF, DOC2VEC và xây dựng một hệ khuyến nghị áp dụng thuật toán Content-based, Collaborative Filtering. Sau đó, thử nghiệm các phương pháp này và so sánh đánh giá độ chính xác và tính tin tin cậy của từng phương pháp. Giới thiệu đề tài 1.
Dat vấn đề Với sự phát triển nhanh chóng của công nghệ, cuộc sống của con người ngày càng được cải thiện và tiện ích. Bây giờ, chúng ta có thể dễ dàng tiếp cận đến nhiều nội dung thông qua internet và một thiết bị truy cập internet. Chỉ cần vài thao tác đơn giản, chúng ta có thể xem phim yêu thích hoặc nghe nhạc. Điều tương tự cũng áp dụng cho việc đọc sách.
Có vô số cuốn sách mà chúng ta có thể tiếp cận thông qua các nền tảng như Amazon Kindle, Google Play Books, v. Tuy tiện lợi, tuy nhiên, việc có quá nhiều cuốn sách cũng gây ra van đề "khủng hoảng thừa" khi người đọc không biết chọn sách nào phù hợp với mình. Để giải quyết vấn để này, các nền tảng đã áp dụng hệ thống gợi ý sách cho user, sử dụng các thuật toán học máy hay được gọi là hệ thống khuyến nghị. Những hệ thống khuyến nghị này đề xuất sách phù hợp cho người đọc, từ đó nâng cao trải nghiệm và cũng mang lại lợi nhuận cho nền tảng đó.
Dữ liệu văn bản có thể được tìm thấy ở mọi nơi, từ các trang web, trang báo điện tử cho đến các trang mạng xã hội và thư viện điện tử. Cùng với sự phô biến của việc số hóa thư viện và sự phát triển của internet và mạng xã hội, dữ liệu văn bản tăng lên với tốc độ nhanh chóng. Dữ liệu văn bản là dạng dữ liệu phi cấu trúc hoặc bán cấu trúc, chứa nhiều thông tin ẩn mà mắt thường không thể nhìn thấy. Tuy nhiên, thông tin này có thê được khám phá thông qua các kỹ thuật khai phá dữ liệu văn bản hoặc truy xuất/thu thập thông tin và được sử dụng bởi các mô hình học máy và trí tuệ nhân tạo.
Nội dung và mô tả của các cuốn sách cũng là một nguồn dữ liệu phong phú. Tuy nhiên, các hệ thống khuyến nghị trên các nền tảng đọc sách thường chỉ dựa trên thé loại sách, tác giả hoặc đánh giá từ user trước đó đề đưa ra gợi ý. Tuy chung quy, những hệ thống khuyến nghị này không sử dụng nội dung hoặc mô tả của cuốn sách để đưa ra gợi ý cho người đọc. Dinh hướng và giải pháp Trong nghiên cứu nay, chúng tôi đã phát triển một hệ thống khuyến nghị bằng cách sử dụng dữ liệu văn bản mô tả từ các đầu sách và rating của user cho các cuén sách, nhằm cung cấp các khuyến nghị mang tính cá nhân hóa đến user.
Dé thực hiện điều nay, chúng tôi đã sử dụng kỹ thuật truy xuất thông tin để xây dựng hồ sơ cho từng cuốn sách dựa trên các đoạn mô tả. Sau đó, chúng tôi sử dụng phương pháp lọc cộng tác cùng với các rating mà user đã đánh giá trước đó để đưa ra các gợi ý phù hợp với từng user. Mục tiêu cuối cùng là để user có thê khám phá ra những cuốn sách phù hợp nhất với sở thích cá nhân mình. Dữ liệu đầu vào sẽ là các đoạn văn mô tả của sách và cũng như là rating của user cho những đầu sách mà user đó đã đọc.
Chúng tôi sẽ tiến hành véc-tơ hóa các đoạn mô tả của các cuốn sách bằng các kỹ thuật truy hồi thông tin như TF-IDF va Doc2Vec. Sau đó, chúng tôi áp dụng mô hình hồi quy, để đưa ra các dự đoán rating nhằm đánh giá sự quan tâm của user đối với từng cuốn sách. Đồng thời cũng sử dụng mô hình hồi quy đã huấn luyện để đưa ra dự đoán rating cho những đầu sách mà người dùng chưa đánh giá. Cuối cùng, chúng tôi sử dụng độ đo Root Mean Squared Error để đánh giá hiệu quả của thuật toán.
Bố cục khóa luận Phần còn lại của báo cáo khóa luận tốt nghiệp này được tổ chức như sau: Ở chương 2, chúng tôi sẽ trình bày các khái niệm tổng quan về các nghiên cứu liên quan được áp dụng như: hệ khuyến nghị, bao gồm khái niệm và các thuật toán tiếp cận. Tiếp theo sẽ trình bày khái niệm tổng quan về các kỹ thuật truy hồi thông tin. Trong báo cáo này, chúng tôi sẽ trình bày khái niệm về các thuật toán Content- based filtering va Collaborative filtering của hệ khuyến nghị, khái niệm và các cách tiếp cận của các kỹ thuật truy hồi thông tin Bag-of-Words, TF-IDF, Word2Vec và Doc2Vec. Chương 3 chúng tôi sẽ trình bày về bộ dữ liệu thực nghiệm trong đề tài này.
Cách thu thập bộ dữ liệu, và sau đó là tiền xử lý dé có thé thu được đữ liệu mong muốn từ tập dữ liệu thô. Chương 4 sẽ trình bày về các mô hình được thử nghiệm, cũng như là các kết quả khi so sánh với một mô hình baseline. Chương 5 trình bày hệ thống được triển khai, bao gồm ứng dụng demo và các bảng vẽ mô tả thuật toán. Ở chương này, chúng tôi cũng sẽ trình bày các kết quả thu được sau khi triển khai thử nghiệm mô hình trên môi trường phát triển.
Cuối cùng trong chương 6, chúng tôi sẽ trình bày các kết luận thu được từ quá trình nghiên cứu, thử nghiệm, xây dựng, và triển khai hệ thống. Từ đó đưa ra các định hướng phát triển tiếp theo cho đề tài này. Cac nghiên cứu liên quan 2. Hệ khuyến nghị 2.
Khái niệm Hệ khuyến nghị (recommender system - RS) là một phương pháp trong hệ thống lọc thông tin (Information filtering), được sử dụng để giải quyết các vấn đề dự đoán sở thích hoặc đánh giá của user đối với những item mà họ chưa từng tương tác hoặc đánh giá trong quá khứ. Hệ khuyến nghị bao gồm hai thành phần chính là người dùng (user) và mục (item), trong đó user là các cá nhân sử dụng và mục là các sản phẩm như sách, bài hát, video, và kế ca là các user khác như tinh năng gợi ý kết bạn hoặc gợi ý theo dõi trên các nền tảng mạng xã hội. Mục tiêu chính của các hệ khuyến nghị là đánh giá và dự đoán mức độ quan tâm của user đối với các item trong hệ thống, từ đó có vạch ra các cách tiếp cận phù hợp nhất cho từng user. Điều này có thê gia tăng trải nghiệm của user, tăng sự tương tác và kéo dai thời gian sử dụng sản phẩm, đồng thời gia tăng doanh thu và hiệu quả của dịch vụ.
Một ví dụ thực tế về hệ thống gợi ý là hệ thống gợi ý sản phẩm được sử dụng bởi Amazon.