Hệ Thống Gợi Ý Sách Dựa Trên Mô Hình Truy Hồi Thông Tin

Khóa luận tốt nghiệp nghiên cứu tốt nghiệp công nghệ thông tin xây dựng hệ thống đề xuất sách cho ứng dụng web áp dụng các mô hình, vận dụng lý thuyết vào thực tế, đề xuất giải

Chuyên ngành

Công Nghệ Thông Tin

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2023

51
2
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: GIỚI THIỆU ĐỀ TÀI

1.1. Đặt vấn đề

1.2. Định hướng và giải pháp

1.3. Bố cục khóa luận

2. CHƯƠNG 2: CÁC NGHIÊN CỨU LIÊN QUAN

2.1. Hệ khuyến nghị

2.1.1. Khái niệm

2.1.2. Các phương pháp tiếp cận

2.1.2.1. Content-based Filtering (CBF)
2.1.2.2. Collaborative Filtering (CF)
2.1.2.2.1. User -user Collaborative Filtering (UUCF)
2.1.2.2.2. Item-item Collaborative Filtering (IICF)

2.1.3. Lợi ích và hạn chế của Collaborative Filtering

2.2. Ma trận utility

3. CHƯƠNG 3: MÔ TẢ TẬP DỮ LIỆU

3.1. Tiền xử lý dữ liệu

3.2. Tiền xử lý tập dữ liệu books

3.3. Tiền xử lý dữ liệu văn bản mô tả sách

4. CHƯƠNG 4: THỬ NGHIỆM VÀ ĐÁNH GIÁ

4.1. Phương pháp đánh giá và độ đo sử dụng

4.2. Hệ thống đề xuất

4.3. Các bước triển khai

4.4. Giao diện chính của ứng dụng

5. CHƯƠNG 5: TRIỂN KHAI HỆ THỐNG

5.1. Ứng dụng demo

5.2. Các bảng vẽ mô tả thuật toán

5.3. Kết quả thử nghiệm mô hình trên môi trường phát triển

6. CHƯƠNG 6: KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

6.1. Kết luận

6.2. Hướng phát triển

Tóm tắt

I. Giới thiệu về Hệ Thống Gợi Ý Sách Dựa Trên Mô Hình Truy Hồi Thông Tin

Hệ thống gợi ý sách dựa trên mô hình truy hồi thông tin là một công cụ mạnh mẽ giúp người dùng tìm kiếm và lựa chọn sách phù hợp với sở thích cá nhân. Với sự phát triển của công nghệ, việc áp dụng các thuật toán truy hồi thông tin vào hệ thống gợi ý sách đã trở thành một xu hướng phổ biến. Hệ thống này không chỉ giúp người dùng tiết kiệm thời gian mà còn nâng cao trải nghiệm đọc sách của họ.

1.1. Khái niệm về Hệ Thống Gợi Ý Sách

Hệ thống gợi ý sách là một ứng dụng sử dụng các thuật toán để phân tích dữ liệu người dùng và nội dung sách nhằm đưa ra các gợi ý phù hợp. Các thuật toán này có thể bao gồm lọc cộng tác và lọc theo nội dung.

1.2. Tầm quan trọng của Hệ Thống Gợi Ý Sách

Hệ thống gợi ý sách giúp người dùng dễ dàng tìm kiếm sách mới, từ đó nâng cao trải nghiệm đọc sách và khuyến khích thói quen đọc sách trong cộng đồng.

II. Vấn Đề và Thách Thức Trong Hệ Thống Gợi Ý Sách

Mặc dù hệ thống gợi ý sách mang lại nhiều lợi ích, nhưng vẫn tồn tại một số vấn đề và thách thức cần giải quyết. Một trong những vấn đề lớn nhất là 'khủng hoảng thừa' khi người dùng phải đối mặt với quá nhiều lựa chọn. Điều này có thể dẫn đến sự khó khăn trong việc quyết định chọn sách nào.

2.1. Khủng hoảng thừa trong lựa chọn sách

Khi có quá nhiều sách để lựa chọn, người dùng có thể cảm thấy choáng ngợp và không biết bắt đầu từ đâu. Hệ thống gợi ý cần phải giúp người dùng vượt qua vấn đề này.

2.2. Độ chính xác của các gợi ý

Độ chính xác của các gợi ý là một yếu tố quan trọng. Nếu hệ thống không đưa ra các gợi ý phù hợp, người dùng có thể cảm thấy thất vọng và không quay lại sử dụng.

III. Phương Pháp Xây Dựng Hệ Thống Gợi Ý Sách Hiệu Quả

Để xây dựng một hệ thống gợi ý sách hiệu quả, cần áp dụng các phương pháp truy hồi thông tin hiện đại. Các phương pháp này bao gồm lọc cộng tác, lọc theo nội dung và các kỹ thuật học máy khác.

3.1. Lọc Cộng Tác Collaborative Filtering

Lọc cộng tác là phương pháp dựa trên hành vi của người dùng để đưa ra gợi ý. Hệ thống sẽ phân tích các đánh giá của người dùng tương tự để tìm ra sách phù hợp.

3.2. Lọc Theo Nội Dung Content based Filtering

Phương pháp này dựa vào nội dung của sách để đưa ra gợi ý. Hệ thống sẽ phân tích các đặc điểm của sách mà người dùng đã thích để tìm ra sách tương tự.

3.3. Kết Hợp Các Phương Pháp

Kết hợp giữa lọc cộng tác và lọc theo nội dung có thể tạo ra một hệ thống gợi ý mạnh mẽ hơn, giúp cải thiện độ chính xác và sự đa dạng của các gợi ý.

IV. Ứng Dụng Thực Tiễn Của Hệ Thống Gợi Ý Sách

Hệ thống gợi ý sách có thể được áp dụng trong nhiều lĩnh vực khác nhau, từ các nền tảng đọc sách trực tuyến đến các thư viện điện tử. Việc áp dụng các mô hình truy hồi thông tin giúp nâng cao trải nghiệm người dùng và tăng cường sự tương tác.

4.1. Ứng dụng trong Nền Tảng Đọc Sách Trực Tuyến

Các nền tảng như Amazon Kindle và Google Play Books đã áp dụng hệ thống gợi ý sách để cải thiện trải nghiệm người dùng và tăng doanh thu.

4.2. Ứng dụng trong Thư Viện Điện Tử

Thư viện điện tử có thể sử dụng hệ thống gợi ý để giúp người dùng tìm kiếm sách dễ dàng hơn, từ đó khuyến khích việc đọc sách trong cộng đồng.

V. Kết Luận và Tương Lai Của Hệ Thống Gợi Ý Sách

Hệ thống gợi ý sách dựa trên mô hình truy hồi thông tin đang ngày càng trở nên quan trọng trong việc nâng cao trải nghiệm đọc sách. Tương lai của hệ thống này hứa hẹn sẽ có nhiều cải tiến với sự phát triển của công nghệ và trí tuệ nhân tạo.

5.1. Xu Hướng Phát Triển

Các công nghệ mới như học sâu và trí tuệ nhân tạo sẽ tiếp tục cải thiện độ chính xác và hiệu quả của hệ thống gợi ý sách.

5.2. Tác Động Đến Thói Quen Đọc Sách

Hệ thống gợi ý sách có thể thay đổi cách mà người dùng tiếp cận và lựa chọn sách, từ đó thúc đẩy thói quen đọc sách trong cộng đồng.

10/07/2025
Khóa luận tốt nghiệp công nghệ thông tin xây dựng hệ thống đề xuất sách cho ứng dụng web áp dụng các mô hình truy hồi thông tin

Trích đoạn nội dung tài liệu

Chương 1. — Giới thiệu để tài. Dat VAN a5 ốẽ. Định hướng va giải pháp.

Bố cục khóa luận.---ssieetreererterterterttrrtrrtrerrrrerrrrrrrrree Chương 2. Các nghiên cứu liên quan. Hệ khuyến nghị. Các phương pháp tiệp cận.

Ma trận utility. Kỹ thuật truy hổi thông tit. Một số phương pháp truy hồi thông tỉn. Bộ dữ LGU we ssscsscsssssecsssnssesessnssesesssssesesssseessssussessssueseesssuseessssueseessssecessnsesessnsseeess N an 3.

Mô tả tập dữ liệu. Tiền xử lý dữ liệu. Tiền xử ly tap dữ liệu books. Tiền xử lý dữ liệu văn bản mô tả sách.---srseree Ne} Chuong 4.

Thử nghiệm và đánh giá. Phương pháp đánh giá và độ đo sử dụng.ÔÔỎ Hệ thống dé xuat.ssssssssssntnsanssssstistesasieiatiststseiseestassaessesanete w an 02wNan lì na. Các bước triển Khai. Giao diện chính của ứng dụng.ecceeeeeetetriririiirrir 39 Chương 6.

_ Kết luận và hướng phát triỂn. Hướng phát triển.---es2tseerterterrtretrerrertrrrrrerrrrerrrre 42 DANH MỤC HÌNH Hình 2. Ví dụ về một ma trận utili(y.----¿- ¿2£©++2x++2++2x++zx++zxt+rxerxrerxesred 9 Hình 3. Doan dir liệu văn ban mô ta của sách (được khoang đỏ).

Phân bổ rating của uS€T. Giá trị RMSE với tổng số item nhóm Ï. Giá trị RMSE với tổng số item nhóm 2. Giá trị RMSE với tổng số item nhóm 3.

Quá trình xử lý đữ liệu. E* SH HH HH Hư, 37 Hình 5. Quá trình tạo CAC BOTY. Giao diện ứng dụng (1).

-- << 111v HH ng ng 39 Hình 5. Giao diện ứng dụng (2).-- c1 31391191 119111 vn ng ng 40 DANH MỤC BANG Bảng 2. So sánh Skip-gram và CBOÏW. LH HH HH HH 19 Bảng 3.

Ý nghĩa các trường trong tập dữ liệu DOOKS. Các giá tri ở trường language_code trong tập books. Số lượng các giá trị rỗng trong trường languaga_code. Y nghĩa các trường có trong tập ratings.

Kết quả RMSE trung bình của từng mô hình (Nhóm I). Kết quả RMSE trung bình của từng mô hình (Nhóm 2). Kết quả RMSE trung bình của từng mô hình (Nhóm 3). 34 DANH MỤC TỪ VIET TAT STT| Tên viết tắt Tên đầy đủ I | API Application Programming Interface 2 |BoW Bag-of-Words 3 | CBF Content-based Filtering 4 | CBOW Continuous Bag-of-Words 5 |CF Collaborative Filtering 6 |DBOW Distributed Bag-of-Words 7 |DM Distributed Memory 8 | DIM Document-Term Matrix 9 | FN False Negative 10 | FP False Positive 11 | IICF Item-Item Collaborative Filtering 12 |MSE Mean Squared Error 13 |NLTK Natural Language ToolKit 14 |RS Recommender System, Recommendation System 15 |RMSE Root Mean Squared Error 16 | TF-IDF Term Frequency - Inverse Document Frequency 17 | TN True Negative 18 TP True Positive 19 UUCF User-User Collaborative Filtering TÓM TÁT KHÓA LUẬN Recommendation system hay recommender system, hệ khuyến nghị, là hệ thống được xây dựng đề đưa các gợi ý, khuyến nghị cho user dựa trên những dữ liệu đã có sẵn về user hoặc sản phẩm.

Hệ khuyến nghị là bài toán có tính thực tiễn và tính ứng dụng cao, như giải quyết các vấn đề lựa chọn của user như nên mua sản phẩm nào, bài nhạc nào phù hợp với mình hay nên đọc các tin tức gì trong hằng sa số các lựa chọn. Hiện nay, các bài toán này ngày càng trở nên phé biến hơn nhờ sự phát triển thần tốc của các nền tảng số như các trang mạng xã hội TikTok, Instagram hoặc các nền tảng streaming trực tuyến như Netflix, Youtube, v. Information retrieval techniques, hay kỹ thuật truy hôi thông tin, là các kỹ thuật truy xuất thông tin từ các dữ liệu không có cấu trúc cụ thể như hình ảnh, âm thanh hoặc văn ban. Các kỹ thuật này truy xuất các thuộc tinh an của dữ liệu nhằm có thể tái sử dụng các dữ liệu này một cách hiệu quả hơn.

Là một người yêu thích đọc sách, và các hệ thống gợi ý sách thường chỉ áp dụng các thuộc tính cơ bản như đầu mục, tác giả hay thê loại của sách đề đưa ra gợi ý, em cảm thấy có thé đưa ra một giải pháp cải thiện cho các hệ thống gợi ý này bằng cách áp dụng thêm các kỹ thuật truy hồi thông tin lên các đoạn văn bản gợi ý của tựa sách dé xây dựng hệ khuyến nghị. Trong khóa luận này, em sẽ nghiên cứu và áp dụng các kỹ thuật truy hồi thông tin bao gồm: TF-IDF, DOC2VEC và xây dựng một hệ khuyến nghị áp dụng thuật toán Content-based, Collaborative Filtering. Sau đó, thử nghiệm các phương pháp này và so sánh đánh giá độ chính xác và tính tin tin cậy của từng phương pháp. Giới thiệu đề tài 1.

Dat vấn đề Với sự phát triển nhanh chóng của công nghệ, cuộc sống của con người ngày càng được cải thiện và tiện ích. Bây giờ, chúng ta có thể dễ dàng tiếp cận đến nhiều nội dung thông qua internet và một thiết bị truy cập internet. Chỉ cần vài thao tác đơn giản, chúng ta có thể xem phim yêu thích hoặc nghe nhạc. Điều tương tự cũng áp dụng cho việc đọc sách.

Có vô số cuốn sách mà chúng ta có thể tiếp cận thông qua các nền tảng như Amazon Kindle, Google Play Books, v. Tuy tiện lợi, tuy nhiên, việc có quá nhiều cuốn sách cũng gây ra van đề "khủng hoảng thừa" khi người đọc không biết chọn sách nào phù hợp với mình. Để giải quyết vấn để này, các nền tảng đã áp dụng hệ thống gợi ý sách cho user, sử dụng các thuật toán học máy hay được gọi là hệ thống khuyến nghị. Những hệ thống khuyến nghị này đề xuất sách phù hợp cho người đọc, từ đó nâng cao trải nghiệm và cũng mang lại lợi nhuận cho nền tảng đó.

Dữ liệu văn bản có thể được tìm thấy ở mọi nơi, từ các trang web, trang báo điện tử cho đến các trang mạng xã hội và thư viện điện tử. Cùng với sự phô biến của việc số hóa thư viện và sự phát triển của internet và mạng xã hội, dữ liệu văn bản tăng lên với tốc độ nhanh chóng. Dữ liệu văn bản là dạng dữ liệu phi cấu trúc hoặc bán cấu trúc, chứa nhiều thông tin ẩn mà mắt thường không thể nhìn thấy. Tuy nhiên, thông tin này có thê được khám phá thông qua các kỹ thuật khai phá dữ liệu văn bản hoặc truy xuất/thu thập thông tin và được sử dụng bởi các mô hình học máy và trí tuệ nhân tạo.

Nội dung và mô tả của các cuốn sách cũng là một nguồn dữ liệu phong phú. Tuy nhiên, các hệ thống khuyến nghị trên các nền tảng đọc sách thường chỉ dựa trên thé loại sách, tác giả hoặc đánh giá từ user trước đó đề đưa ra gợi ý. Tuy chung quy, những hệ thống khuyến nghị này không sử dụng nội dung hoặc mô tả của cuốn sách để đưa ra gợi ý cho người đọc. Dinh hướng và giải pháp Trong nghiên cứu nay, chúng tôi đã phát triển một hệ thống khuyến nghị bằng cách sử dụng dữ liệu văn bản mô tả từ các đầu sách và rating của user cho các cuén sách, nhằm cung cấp các khuyến nghị mang tính cá nhân hóa đến user.

Dé thực hiện điều nay, chúng tôi đã sử dụng kỹ thuật truy xuất thông tin để xây dựng hồ sơ cho từng cuốn sách dựa trên các đoạn mô tả. Sau đó, chúng tôi sử dụng phương pháp lọc cộng tác cùng với các rating mà user đã đánh giá trước đó để đưa ra các gợi ý phù hợp với từng user. Mục tiêu cuối cùng là để user có thê khám phá ra những cuốn sách phù hợp nhất với sở thích cá nhân mình. Dữ liệu đầu vào sẽ là các đoạn văn mô tả của sách và cũng như là rating của user cho những đầu sách mà user đó đã đọc.

Chúng tôi sẽ tiến hành véc-tơ hóa các đoạn mô tả của các cuốn sách bằng các kỹ thuật truy hồi thông tin như TF-IDF va Doc2Vec. Sau đó, chúng tôi áp dụng mô hình hồi quy, để đưa ra các dự đoán rating nhằm đánh giá sự quan tâm của user đối với từng cuốn sách. Đồng thời cũng sử dụng mô hình hồi quy đã huấn luyện để đưa ra dự đoán rating cho những đầu sách mà người dùng chưa đánh giá. Cuối cùng, chúng tôi sử dụng độ đo Root Mean Squared Error để đánh giá hiệu quả của thuật toán.

Bố cục khóa luận Phần còn lại của báo cáo khóa luận tốt nghiệp này được tổ chức như sau: Ở chương 2, chúng tôi sẽ trình bày các khái niệm tổng quan về các nghiên cứu liên quan được áp dụng như: hệ khuyến nghị, bao gồm khái niệm và các thuật toán tiếp cận. Tiếp theo sẽ trình bày khái niệm tổng quan về các kỹ thuật truy hồi thông tin. Trong báo cáo này, chúng tôi sẽ trình bày khái niệm về các thuật toán Content- based filtering va Collaborative filtering của hệ khuyến nghị, khái niệm và các cách tiếp cận của các kỹ thuật truy hồi thông tin Bag-of-Words, TF-IDF, Word2Vec và Doc2Vec. Chương 3 chúng tôi sẽ trình bày về bộ dữ liệu thực nghiệm trong đề tài này.

Cách thu thập bộ dữ liệu, và sau đó là tiền xử lý dé có thé thu được đữ liệu mong muốn từ tập dữ liệu thô. Chương 4 sẽ trình bày về các mô hình được thử nghiệm, cũng như là các kết quả khi so sánh với một mô hình baseline. Chương 5 trình bày hệ thống được triển khai, bao gồm ứng dụng demo và các bảng vẽ mô tả thuật toán. Ở chương này, chúng tôi cũng sẽ trình bày các kết quả thu được sau khi triển khai thử nghiệm mô hình trên môi trường phát triển.

Cuối cùng trong chương 6, chúng tôi sẽ trình bày các kết luận thu được từ quá trình nghiên cứu, thử nghiệm, xây dựng, và triển khai hệ thống. Từ đó đưa ra các định hướng phát triển tiếp theo cho đề tài này. Cac nghiên cứu liên quan 2. Hệ khuyến nghị 2.

Khái niệm Hệ khuyến nghị (recommender system - RS) là một phương pháp trong hệ thống lọc thông tin (Information filtering), được sử dụng để giải quyết các vấn đề dự đoán sở thích hoặc đánh giá của user đối với những item mà họ chưa từng tương tác hoặc đánh giá trong quá khứ. Hệ khuyến nghị bao gồm hai thành phần chính là người dùng (user) và mục (item), trong đó user là các cá nhân sử dụng và mục là các sản phẩm như sách, bài hát, video, và kế ca là các user khác như tinh năng gợi ý kết bạn hoặc gợi ý theo dõi trên các nền tảng mạng xã hội. Mục tiêu chính của các hệ khuyến nghị là đánh giá và dự đoán mức độ quan tâm của user đối với các item trong hệ thống, từ đó có vạch ra các cách tiếp cận phù hợp nhất cho từng user. Điều này có thê gia tăng trải nghiệm của user, tăng sự tương tác và kéo dai thời gian sử dụng sản phẩm, đồng thời gia tăng doanh thu và hiệu quả của dịch vụ.

Một ví dụ thực tế về hệ thống gợi ý là hệ thống gợi ý sản phẩm được sử dụng bởi Amazon.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ