Luận văn: Nghiên cứu thông tin tìm kiếm trên Internet - Một phương pháp mới

Dưới đây là các meta tag cho bài viết "Luận văn vers une approche personnalisée de la recherche dinformations": { "ai_description": "Tìm hiểu phương pháp

Trường đại học

LORIA

Chuyên ngành

Khoa học Máy tính

Tác giả

Ẩn danh

Người đăng

Ẩn danh

Thể loại

Luận văn

2007

75
0
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

TÓM TẮT

TÓM TẮT TIẾNG ANH

DANH MỤC HÌNH VẼ

DANH MỤC BẢNG BIỂU

1. Chương 1: MỞ ĐẦU

1.1. Đặt vấn đề

1.2. Động lực nghiên cứu

1.3. Mục tiêu nghiên cứu

1.3.1. Xác định mục đích công việc

1.4. Môi trường thực tập

2. Chương 2: LỌC DỰA TRÊN NỘI DUNG

2.1. Tổng quan tài liệu

2.2. Phương pháp lọc dựa trên nội dung (FBC)

3. Chương 3: LỌC CỘNG TÁC

3.1. Lọc cộng tác dựa trên bộ nhớ

3.2. Lọc cộng tác dựa trên mô hình

4. Chương 4: KẾT HỢP LỌC DỰA TRÊN NỘI DUNG VÀ LỌC CỘNG TÁC

4.1. FC - FBC tách biệt

4.2. FC - FBC kết hợp

4.3. FBC tài nguyên - FC

4.4. FBC người dùng - FC

5. Chương 5: CÀI ĐẶT VÀ CƠ SỞ DỮ LIỆU

5.1. Công cụ phát triển

5.2. Cấu trúc các bảng trong cơ sở dữ liệu

6. Chương 6: ĐÁNH GIÁ THỰC NGHIỆM

6.1. Độ đo độ chính xác phân lớp

7. Chương 7: KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

Tóm tắt

I. Hướng dẫn cho một phương pháp tìm kiếm thông tin cá nhân hóa

Trong thời đại thông tin ngày nay, tìm kiếm thông tin trên Internet đã trở thành một phần không thể thiếu trong cuộc sống hàng ngày của chúng ta. Tuy nhiên, với lượng thông tin khổng lồ và đa dạng tồn tại trên web, việc tìm kiếm thông tin hiệu quả và chính xác thường là một thách thức. Để giải quyết vấn đề này, một phương pháp tìm kiếm thông tin cá nhân hóa (Personalized Information Retrieval) đã được phát triển.

1.1. Giới thiệu về phương pháp tìm kiếm thông tin cá nhân hóa

Phương pháp tìm kiếm thông tin cá nhân hóa là một phương pháp tìm kiếm thông tin trên Internet dựa trên các đặc điểm và sở thích của mỗi người dùng. Nó nhằm mục đích cung cấp kết quả tìm kiếm phù hợp nhất với nhu cầu và sở thích của mỗi người dùng, thay vì chỉ dựa trên từ khóa tìm kiếm.

1.2. Phương pháp tìm kiếm thông tin cá nhân hóa trong thực tế

Một ví dụ về phương pháp tìm kiếm thông tin cá nhân hóa trong thực tế là hệ thống đề xuất phim của Netflix. Hệ thống này sử dụng các dữ liệu về lịch sử xem phim của mỗi người dùng và các đánh giá phim để đề xuất các phim mà người dùng có thể thích. Điều này giúp người dùng tiết kiệm thời gian tìm kiếm và có thể tìm được phim phù hợp với sở thích của họ dễ dàng hơn.

II. Phương pháp tìm kiếm thông tin cá nhân hóa trong nghiên cứu học thuật

Phương pháp tìm kiếm thông tin cá nhân hóa cũng được áp dụng trong lĩnh vực nghiên cứu học thuật. Nó giúp các nhà nghiên cứu tìm kiếm thông tin một cách hiệu quả hơn và cung cấp kết quả tìm kiếm phù hợp với nhu cầu của họ. Một ví dụ về phương pháp tìm kiếm thông tin cá nhân hóa trong nghiên cứu học thuật là hệ thống đề xuất tài liệu học thuật của Google Scholar. Hệ thống này sử dụng các dữ liệu về lịch sử tìm kiếm và các bài viết đã đọc của mỗi người dùng để đề xuất các bài viết học thuật mà người dùng có thể quan tâm.

2.1. Phương pháp tìm kiếm thông tin cá nhân hóa trong nghiên cứu học thuật

Phương pháp tìm kiếm thông tin cá nhân hóa trong nghiên cứu học thuật thường dựa trên các dữ liệu về lịch sử tìm kiếm và các bài viết đã đọc của mỗi người dùng. Nó giúp các nhà nghiên cứu tìm kiếm thông tin một cách hiệu quả hơn và cung cấp kết quả tìm kiếm phù hợp với nhu cầu của họ.

2.2. Ứng dụng của phương pháp tìm kiếm thông tin cá nhân hóa trong nghiên cứu học thuật

Phương pháp tìm kiếm thông tin cá nhân hóa trong nghiên cứu học thuật có thể được áp dụng trong các lĩnh vực khác nhau, chẳng hạn như khoa học máy tính, y tế, kinh tế, v.v. Nó giúp các nhà nghiên cứu tìm kiếm thông tin một cách hiệu quả hơn và cung cấp kết quả tìm kiếm phù hợp với nhu cầu của họ, giúp họ tiết kiệm thời gian và công sức trong quá trình nghiên cứu.

III. Tương lai của phương pháp tìm kiếm thông tin cá nhân hóa

Phương pháp tìm kiếm thông tin cá nhân hóa đang trở thành một trong những phương pháp tìm kiếm thông tin quan trọng trong thời đại thông tin ngày nay. Nó có thể được áp dụng trong nhiều lĩnh vực khác nhau, từ thương mại điện tử, quảng cáo trên Internet, đến nghiên cứu học thuật và y tế. Tuy nhiên, vẫn còn nhiều vấn đề cần được giải quyết, chẳng hạn như bảo mật dữ liệu cá nhân và quyền riêng tư của người dùng.

3.1. Phát triển của phương pháp tìm kiếm thông tin cá nhân hóa trong tương lai

Phương pháp tìm kiếm thông tin cá nhân hóa đang được phát triển nhanh chóng và có thể sẽ trở thành một trong những phương pháp tìm kiếm thông tin quan trọng trong tương lai. Nó có thể được áp dụng trong nhiều lĩnh vực khác nhau, từ thương mại điện tử, quảng cáo trên Internet, đến nghiên cứu học thuật và y tế.

3.2. Vấn đề cần được giải quyết trong phương pháp tìm kiếm thông tin cá nhân hóa

Vẫn còn nhiều vấn đề cần được giải quyết trong phương pháp tìm kiếm thông tin cá nhân hóa, chẳng hạn như bảo mật dữ liệu cá nhân và quyền riêng tư của người dùng. Cần có các biện pháp bảo vệ dữ liệu cá nhân của người dùng và đảm bảo rằng họ có quyền kiểm soát dữ liệu của mình.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI. Nếu bạn thấy nội dung không chính xác hoặc có vấn đề, vui lòng Báo lỗi nội dung.

14/03/2026
Luận văn vers une approche personnalisée de la recherche dinformations

Trích đoạn nội dung tài liệu

Table des matières Remerciements - Vv Résumé. vil Liste des figures vill Liste des tableaux. Environnement de stage. Revue de la bibliographic.

Kiltrage basé sur le contenu sút BƠ). sod Chapitre 3 Kiltragecollaboratf (F 1. Hiltrage collaboratif basé sur la mémoire. Filtrage collaboratif basé sur un rođẻle.

Combinaison du FBC et du FC. FC —FBC séparé. KC — FBC combiné. FBC ressotgoes FC.4, FBC utilisatewts FỮ.

cuoi dh AS. Outils de đéveloppemnenl.3, Structures des tables dans la base đc đonhée. Métique dexactitude de classification. - - - - - AT ili Chapitre 7.

" " 40 Remerciements Mes remerciements s'adressent naturellement a l'ensemble des membres de l'équipe CORTEX et de l'équipe MAIA au LORIA. Je tiens a remercier sincérement Anne BOYER et Sylvain CASTAGNOS de I'équipe MAIA pour leur disponibilité et pour m'avoir donné des connaissances de base au début ainsi que leur aide au cours de mon stage. Leur avis a été trés utile pour ma mission. Je tiens & remercier chaleuretisement Jean-Charles LAMIREL et Randa KASSAB de I'équipe CORTEX qui m'ont beaucoup guidé dans mon travail chaque fois que le besoin s'en faisait sentir.

Je remercie Jean-Charles LAMIREL d'avoir fait les formalités nécessaires au LORIA. Cela m'a permis d'effectuer cette mission dans les meilleures conditions. Le 5 octobre 2007 DO Minh Chau Anne et moi Jean-Charles et moi — &= Sylvain et moi Randa et moi Résumé Nous nous intéressons a la recherche dinformations sur Internet, dans un contexte « grand public », avec pour objectif’ de déterminer quelles ressources sont pertinentes pour un utilisateur. Nos travaux s'inscrivent dans le domaine des syst3mes de recommandation avec l'objectif de prédirz 1a pertinence dime ressauree web (film, document, page, site w3, blog, vidéo en ligne,.

) pour un uilisalcur particulicr a partir de observation de sen comportement el des évenluelles appréciations (votes numériques, annotations, traces, .) quiil déposc lors de ses consultations. Panmi les lechmiques possiblss, nous avons choisi dans 'équipe CORTEX duliliser le Glirage asé sur le contenu et dans I'équipe MAIA dutiliser le filtrage collaboratif, Ces deux paradigmes ont été appliqués dans le contexte des systémes de prédiction de préférence dlutilisatewr et de recommandation. Le filtrage basé sur le conten orée des prédictions completes et rapides grace ala vitesse des ordinateurs. Le filtrage collaboratif combine les avis des ublisatewrs pour créer des prédictions personnalisées ct précises.

Ces deux paradigmes de filtrage sont tr¢s différents l'un de Fautre et tous les deux ont encore quelques limites. apparait que les deux approches sont complémentaires. Il est donc intéressant d'essayer de les combiner ensemble afin de surmonter ces imttes. Mots clés ; tiltrage collaboratif, filtrage basé sur le contenu, systéme de recommandation, prédiction de préférence d'utilisateur, personnalisé, combinaison, recherche d'informations, base de données vị Figure 35.

Résultat dévaluation selon le Rappel. Résultat devaluation selon la Précision. Liste des tableaux Tabloau 1. Exemple des mols non importants 8 Tableau 2.

Exemple des mols en forme de Stemming 9 ‘Yableau3. sc2siee 128 'Tablsau 5.2Ð Tabloau 6 Table KeyWords. Table Movie_Actor. ‘Table Movie_Country.

Table Movie Genws. Table Movie_KeyWord. Table Movic_Languag: 34 Tableau 13. Lable Movie_ SfernimerSnMAry,.

mg eeeerariee 'Tableau 15. Table Miovie_ StenumerIfe. co eHheHnnHư Ho deư rang Tableau 16. Table Stop Words.

Table Training Ratings. Table sar Mowie. to nhi Liste des figures Figure 1. Matrice des fréquences 7 Figure 2.

Matrice des voles. - - - - - - t0 Figure 3, Valeurs possibles de la corrélation Pearson. - H Figure 4, Espace de reprẻsentation ulisatzurs/ressotuess (K-] Mean. 2 Figure 5, Organisation higrarchique des utilisatews.

Iniliafisation đc Valgorithme 2-Means. Structure générale d'un systéme de fitrage de fil. Modéle de la méthode de combinaison FC-I-BC sépare. Modéle de la méthode de combinaison FC-I'BC combiné 18 Figure 10, Modéle de la méthode de combinaison FBC ressources F.!Ð Figure 11, Modéle de la méthode de combinaison FBC ufilisatowrs— FC.

Modéle de la méthode de combinaison Fusion. Exemple đes đonnées đe la table Actors. Exemple des domnées de la table Counties. Exemple des données de la tabÌ€ GefiEs,.

con eo Figure 16. Exemple des données de la table KeyWords. Figure 17, Exemple des données de la table Languages. Exemple des dormées de la.

table Movie_Actor. Exemple des dormées de la. table Movie_County. Exemple des données de la table Movie_Gente.

33 Figure 21, Exemple des donnes de la table Movie KeyWord.28 Figure 22, Exemple des donnges de la table Movie Language. Exemple dos dormées de la table Movic_Movic. lxemple des données de la table Movie_StemmerSummary. ixemple des données de la table Movie_Stemmertitle 3? Figure 26.

Exemple des données de la table Movies. Figure 27, Exemple des données de la table StemmerSumunati Figure 28. Exemple des dormécs de la. table StermmmerTitles - 39 Figure 29.

Exemple đes đonnées đe la table StopWords. Exemple des données de la table TrainingRatings AL Figure 31, Exemple des données de la table User_Movie. Exemple des données de la table U/Set. tien 42 Figure 33, Relations des tables dans la basc ốc dornécs.

AB Figure 34, Comparaison des trois méthodes de filtzage avec la MAT. - 44 vi Liste des tableaux Tabloau 1. Exemple des mols non importants 8 Tableau 2. Exemple des mols en forme de Stemming 9 ‘Yableau3.

sc2siee 128 'Tablsau 5.2Ð Tabloau 6 Table KeyWords. Table Movie_Actor. ‘Table Movie_Country. Table Movie Genws.

Table Movie_KeyWord. Table Movic_Languag: 34 Tableau 13. Lable Movie_ SfernimerSnMAry,. mg eeeerariee 'Tableau 15.

Table Miovie_ StenumerIfe. co eHheHnnHư Ho deư rang Tableau 16. Table Stop Words. Table Training Ratings.

Table sar Mowie. to nhi Résumé Nous nous intéressons a la recherche dinformations sur Internet, dans un contexte « grand public », avec pour objectif’ de déterminer quelles ressources sont pertinentes pour un utilisateur. Nos travaux s'inscrivent dans le domaine des syst3mes de recommandation avec l'objectif de prédirz 1a pertinence dime ressauree web (film, document, page, site w3, blog, vidéo en ligne,. ) pour un uilisalcur particulicr a partir de observation de sen comportement el des évenluelles appréciations (votes numériques, annotations, traces, .) quiil déposc lors de ses consultations.

Panmi les lechmiques possiblss, nous avons choisi dans 'équipe CORTEX duliliser le Glirage asé sur le contenu et dans I'équipe MAIA dutiliser le filtrage collaboratif, Ces deux paradigmes ont été appliqués dans le contexte des systémes de prédiction de préférence dlutilisatewr et de recommandation. Le filtrage basé sur le conten orée des prédictions completes et rapides grace ala vitesse des ordinateurs. Le filtrage collaboratif combine les avis des ublisatewrs pour créer des prédictions personnalisées ct précises. Ces deux paradigmes de filtrage sont tr¢s différents l'un de Fautre et tous les deux ont encore quelques limites.

apparait que les deux approches sont complémentaires. Il est donc intéressant d'essayer de les combiner ensemble afin de surmonter ces imttes. Mots clés ; tiltrage collaboratif, filtrage basé sur le contenu, systéme de recommandation, prédiction de préférence d'utilisateur, personnalisé, combinaison, recherche d'informations, base de données vị Abstract We are interested in information scarching on the Internet, ina context “goncral public”, in order to determine which resources are relevant for a user, The field of ou work is the recommendation system whose objective is to predict the relevance of a resource Web (film, document, page, w3 site, blog, online video,. ) for a particular user from the observation of his bohaviour and from the possible approciations (tmamerical ratings, anmiotalions, traces, .) which ha deposits at the time of his consultations.

Among the possible techniques, we chose in the team CORTEX to use the content-based filtering and in the team MALA to use the collaborative filtering. These two paradigms have been applied in the context of user preference prediction and recommendation systems. Content-based filtering uses the speed of computers to make complete, fast predictions. Collaborative filtering combines the opinions of humans to make personalized, accurate predictions, ‘These two filtering paradigms are very different from cach other and both have yct some limits.

It appears that these two approaches arz complementary. It is therefore interesting to try combining them together in order to overcome those limits. Key words, collaborative Gltcing, content-based Gillcring, recommendation system, user preference prediction, personabzed, combination, information searching, database vũ Résumé Nous nous intéressons a la recherche dinformations sur Internet, dans un contexte « grand public », avec pour objectif’ de déterminer quelles ressources sont pertinentes pour un utilisateur. Nos travaux s'inscrivent dans le domaine des syst3mes de recommandation avec l'objectif de prédirz 1a pertinence dime ressauree web (film, document, page, site w3, blog, vidéo en ligne,.

) pour un uilisalcur particulicr a partir de observation de sen comportement el des évenluelles appréciations (votes numériques, annotations, traces, .) quiil déposc lors de ses consultations. Panmi les lechmiques possiblss, nous avons choisi dans 'équipe CORTEX duliliser le Glirage asé sur le contenu et dans I'équipe MAIA dutiliser le filtrage collaboratif, Ces deux paradigmes ont été appliqués dans le contexte des systémes de prédiction de préférence dlutilisatewr et de recommandation. Le filtrage basé sur le conten orée des prédictions completes et rapides grace ala vitesse des ordinateurs. Le filtrage collaboratif combine les avis des ublisatewrs pour créer des prédictions personnalisées ct précises.

Ces deux paradigmes de filtrage sont tr¢s différents l'un de Fautre et tous les deux ont encore quelques limites. apparait que les deux approches sont complémentaires. Il est donc intéressant d'essayer de les combiner ensemble afin de surmonter ces imttes. Mots clés ; tiltrage collaboratif, filtrage basé sur le contenu, systéme de recommandation, prédiction de préférence d'utilisateur, personnalisé, combinaison, recherche d'informations, base de données vị Chapitre 1.

Introduction “Vers une approche personnalisée de ta recherche d'informalions 1992][Belkin ct al. Nous avons tes? plusizurs approches qui permettent de définir Te profil individucl de chaque utilisatcur, danalyscr son comparterment et de réagir en fonction de cclui-ci, ou encore de moduler effet de ses décisions passées, ainsi que de lui faire des propositions intelligentes concernant des documents entrants quil n'a jamais consultés. Certaines de ces méthodes ont également fait Vobjet dune premiérs implémentation dims le cadre du. Castagnos cL ul.

Castagnos cl sl. 2003b] basé sure conteru pr pendant. des Himites dues4 son principe, qui de ne prendre on compte que les décisions se rapportart 4 un scul utilisatcur, Cos décisions doivent donc te suffisamment exhaustives pour couvair Tensemble des besoins de l'utilisateur, ce qui savére tre rarement le cas dans la pratique. il est de plus miews adapté au traitement des décisions cours lerme qu’a cel des décisions 4 lang Lerme Ul apparait que les deux approches sont complémentaires et c'est fa raison pour laquelle les recherches actuelles s‘orientent plutdt vers une combinaison des deux types de filttage [}.

Motivation Plusieurs raisons me motivent ả choisir le sujet Premidrement, j'aimerais étudier des algorithmes et des méthodes qui peuvent étre appliqués rapidement et largement dans le réel, surtout dans le développement de logiciel. Mon but est dacquérir des expéricnces de recherche cn informatique ainsi que de nouvelles commaissances sur un domaine spécitique, Deuxitmerent, Je sujet de stage conceme la combinaison dis méthodes dz filtrage @infonnations. Cela a pour but dessayer de trouver une nouvelle solution pour beaucoup de probiémes restés dans le séel, Je souhaite trouver quelque chose nouvelle pour contribuer a la recherche de ce probléme ‘Troisiémement, en effectuant mon stage au LORLA, j'ai des occasions pour profiter un bon environnement de recherche scientifique et de reneontrer des enseignants, des chercheurs inlemnalionaux Quatrismement, j'apprécie le contact avec d'autres cultures st me trouver en terre étrangére. Objectifs Définition du but de travail Le but de ce stage est & Ia fois celui de proposer tester différents types de combinaison mettant en jeu les deux modes de filtrage.

La premiére étape consiste & faire un état do l'art des différentes techniques de Flirage par le contenu et.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ