Luận văn thạc sĩ: Kết hợp phương pháp hình ảnh và gán nhãn cho phân tích dữ liệu

Luận văn thạc sĩ VNU trình bày các phương pháp tiên tiến trong visualisation và lựa chọn thông tin cho phân tích dữ liệu hiệu quả.

Trường đại học

Institut de la Francophonie pour l’Informatique IFI-Hanoi

Chuyên ngành

Informatique

Người đăng

Ẩn danh

Thể loại

Mémoire de fin d’études

2007

75
2
0

Phí lưu trữ

30 Point

Mục lục chi tiết

Remerciements

Résumé

1. Chapitre 1: Introduction générale

1.1. Motivation

1.2. Contexte et Problématique

1.3. Contribution

1.4. Plan du mémoire

2. Chapitre 2: L’état de l’art

2.1. Dimension intrinsèque des données multidimensionnelles

2.2. Visualisation par projection cartographique linéaire

2.3. Visualisation par projection cartographique non linéaire

2.4. Visualisation par l’analyse de graphe

2.5. Étiquetage des clusters

2.6. Étiquetage des clusters par la sélection d’information (variable)

2.7. Traitement de données documentaires multidimensionnels

2.7.1. Représentation de données documentaires

2.7.2. Notion de point de vue

3. Chapitre 3: Combinaison de méthodes avancées de visualisation et de sélection d’information pour la fouille et l’analyse de données

3.1. Nouvelles mesures de qualité du clustering basées sur la distribution d’étiquettes

3.2. Nouvelles stratégies d’étiquetage des clusters

3.2.1. Stratégie locale d’étiquetage des clusters

3.2.2. Stratégie globale d’étiquetage des clusters

3.2.3. Stratégie hybride d’étiquetage des clusters

3.2.4. Stratégie d’étiquetage des clusters par les mesures d’entropie

3.2.5. Étiquetage des clusters par Gain d’Information

3.3. Combinaison des méthodes d’étiquetage des clusters et de visualisation hyperbolique

3.4. Communication multi-vues entre les arbres hyperboliques

3.4.1. Modèle de réseau bayésien pour la communication inter-cartes

3.4.2. Communication multi-vues entre les arbres hyperboliques

3.5. Intégration de graphe à l’hyperbolique

3.6. Organisation des branches de l’hyperbolique

4. Chapitre 4: Expérimentations et évaluations

4.1. Interprétation des résultats du clustering

4.2. Communication multi-vues entre les arbres hyperboliques

4.3. Intégration de modèle de Spring à l’hyperbolique

Annexe A: Description des données pour le Corpus Brevets

A.1. Définition des points de vue

A.2. Analyse des brevets

A.3. Multi-indexation des brevets

Annexe B: Description des données pour le Corpus PASCAL

B.1. Définition des points de vue

B.2. Extrait de données

Bibliographie

Tóm tắt

I. Tổng quan về phương pháp kết hợp hình ảnh và gán nhãn trong phân tích dữ liệu

Phương pháp kết hợp hình ảnh và gán nhãn trong phân tích dữ liệu đang trở thành một xu hướng quan trọng trong lĩnh vực khoa học dữ liệu. Việc sử dụng hình ảnh để trực quan hóa dữ liệu giúp người dùng dễ dàng nhận diện các mẫu và xu hướng trong dữ liệu phức tạp. Gán nhãn dữ liệu là một bước quan trọng trong quá trình phân tích, giúp xác định các đặc điểm chính của dữ liệu. Sự kết hợp giữa hai phương pháp này không chỉ nâng cao khả năng hiểu biết mà còn cải thiện độ chính xác trong việc phân tích dữ liệu.

1.1. Khái niệm về phân tích dữ liệu hình ảnh và gán nhãn

Phân tích dữ liệu hình ảnh liên quan đến việc sử dụng các kỹ thuật để trích xuất thông tin từ hình ảnh. Gán nhãn dữ liệu là quá trình gán các nhãn cho các phần tử trong tập dữ liệu, giúp phân loại và tổ chức thông tin. Sự kết hợp giữa hai phương pháp này tạo ra một công cụ mạnh mẽ cho việc phân tích dữ liệu.

1.2. Lợi ích của việc kết hợp hình ảnh và gán nhãn

Việc kết hợp hình ảnh và gán nhãn mang lại nhiều lợi ích, bao gồm khả năng trực quan hóa dữ liệu tốt hơn, cải thiện khả năng phân tích và giảm thiểu sai sót trong việc gán nhãn. Điều này giúp các nhà phân tích dễ dàng nhận diện các mẫu và xu hướng trong dữ liệu phức tạp.

II. Thách thức trong việc áp dụng phương pháp kết hợp hình ảnh và gán nhãn

Mặc dù phương pháp kết hợp hình ảnh và gán nhãn mang lại nhiều lợi ích, nhưng cũng tồn tại nhiều thách thức. Một trong những thách thức lớn nhất là việc xử lý dữ liệu lớn và phức tạp. Ngoài ra, việc gán nhãn chính xác cho dữ liệu hình ảnh cũng là một vấn đề khó khăn, đặc biệt khi dữ liệu có nhiều chiều và không đồng nhất.

2.1. Vấn đề về dữ liệu lớn và phức tạp

Dữ liệu lớn thường chứa nhiều thông tin không cần thiết, gây khó khăn trong việc phân tích. Việc xử lý và phân tích dữ liệu phức tạp đòi hỏi các kỹ thuật tiên tiến để đảm bảo tính chính xác và hiệu quả.

2.2. Khó khăn trong việc gán nhãn chính xác

Gán nhãn chính xác cho dữ liệu hình ảnh là một thách thức lớn. Các yếu tố như độ phân giải hình ảnh, ánh sáng và góc chụp có thể ảnh hưởng đến khả năng nhận diện và gán nhãn chính xác cho các đối tượng trong hình ảnh.

III. Phương pháp kết hợp hình ảnh và gán nhãn hiệu quả trong phân tích dữ liệu

Để vượt qua các thách thức, nhiều phương pháp đã được phát triển nhằm kết hợp hình ảnh và gán nhãn một cách hiệu quả. Các phương pháp này bao gồm việc sử dụng các thuật toán học máy để tự động hóa quá trình gán nhãn và cải thiện độ chính xác của phân tích dữ liệu.

3.1. Sử dụng machine learning trong gán nhãn dữ liệu

Machine learning cung cấp các công cụ mạnh mẽ để tự động hóa quá trình gán nhãn. Các thuật toán như mạng nơ-ron sâu có thể học từ dữ liệu và cải thiện độ chính xác của việc gán nhãn theo thời gian.

3.2. Kết hợp các phương pháp trực quan hóa dữ liệu

Việc kết hợp các phương pháp trực quan hóa dữ liệu như biểu đồ, đồ thị và hình ảnh giúp người dùng dễ dàng nhận diện các mẫu và xu hướng trong dữ liệu. Điều này không chỉ cải thiện khả năng phân tích mà còn giúp truyền đạt thông tin một cách hiệu quả hơn.

IV. Ứng dụng thực tiễn của phương pháp kết hợp hình ảnh và gán nhãn

Phương pháp kết hợp hình ảnh và gán nhãn đã được áp dụng trong nhiều lĩnh vực khác nhau, từ y tế đến thương mại. Trong y tế, việc phân tích hình ảnh y khoa kết hợp với gán nhãn giúp bác sĩ chẩn đoán bệnh chính xác hơn. Trong thương mại, việc phân tích dữ liệu khách hàng thông qua hình ảnh giúp các doanh nghiệp hiểu rõ hơn về nhu cầu và hành vi của khách hàng.

4.1. Ứng dụng trong y tế

Trong lĩnh vực y tế, việc sử dụng hình ảnh y khoa kết hợp với gán nhãn giúp cải thiện khả năng chẩn đoán và điều trị bệnh. Các bác sĩ có thể sử dụng các công cụ phân tích hình ảnh để phát hiện sớm các bệnh lý.

4.2. Ứng dụng trong thương mại

Trong thương mại, việc phân tích dữ liệu khách hàng thông qua hình ảnh giúp các doanh nghiệp tối ưu hóa chiến lược tiếp thị và nâng cao trải nghiệm khách hàng. Các doanh nghiệp có thể sử dụng dữ liệu hình ảnh để hiểu rõ hơn về hành vi và sở thích của khách hàng.

V. Kết luận và tương lai của phương pháp kết hợp hình ảnh và gán nhãn

Phương pháp kết hợp hình ảnh và gán nhãn trong phân tích dữ liệu đang mở ra nhiều cơ hội mới cho các nhà nghiên cứu và doanh nghiệp. Tương lai của phương pháp này hứa hẹn sẽ mang lại nhiều cải tiến trong việc phân tích và hiểu biết dữ liệu. Việc phát triển các công nghệ mới sẽ tiếp tục nâng cao khả năng của phương pháp này.

5.1. Xu hướng phát triển công nghệ

Công nghệ sẽ tiếp tục phát triển, mang lại nhiều công cụ và phương pháp mới cho việc kết hợp hình ảnh và gán nhãn. Các thuật toán học máy sẽ ngày càng trở nên mạnh mẽ và chính xác hơn.

5.2. Tương lai của phân tích dữ liệu

Phân tích dữ liệu sẽ tiếp tục đóng vai trò quan trọng trong nhiều lĩnh vực. Việc kết hợp hình ảnh và gán nhãn sẽ giúp nâng cao khả năng phân tích và hiểu biết dữ liệu, từ đó tạo ra giá trị cho các tổ chức và doanh nghiệp.

22/07/2025
Luận văn thạc sĩ vnu combinaison de méthodes avancées de visualisation et de sélection dinformation pour la fouille et lanalyse de données

Trích đoạn nội dung tài liệu

Institut de la Francophonie pour l’Informatique INRIA-LORIA, FRANCE IFI Hanoi Combinaison de méthodes avancées de visualisation et de sélection d’information pour la fouille et l’analyse de données Mémoire de fin d’études présentée et soutenue publiquement le 06 Décembre 2007 pour l’obtention du Master de l’Institut de la Francophonie pour l’Informatique – IFI-Hanoi (spécialité informatique) par Anh-Phuong TA Sous la direction de : Jean-Charles LAMIREL Maı̂tre de Conférence, Université Robert Schuman, Strasbourg Laboratoire Lorrain de Recherche en Informatique et ses Applications — UMR 7503 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Résumé La combinaison de méthodes avancées de visualisation et d’étiquetage des clusters joue un rôle important non seulement pour donner un avis global des résultats du clustering, mais aussi pour l’évaluation précise desdits résultats. Mais aujourd’hui encore, aucune solution précise sur la façon de combiner de telles méthodes n’a été proposée. Dans ce rapport, nous présentons une première tentative de combinaison de la visualisation hyperbolique ainsi que de nouvelles approches d’étiquetage afin de visualiser précisément les résultats d’analyses de données issues de méthodes de clustering toutes les fois que les clusters sont à l’origine représentés dans un espace fortement multidimensionnel. Le modèle de visualisation se fonde sur un algorithme hiérarchique qui est employé pour récapituler le contenu de clusters sous forme hiérarchique.

Cet algorithme préserve la densité de données issue de l’espace de description des clusters ori- ginaux. Dans ce mémoire sont présentées différentes stratégies d’étiquetage qui peuvent être employées aussi bien pour décrire le contenu de base des clusters que pour propager précisé- ment les étiquettes dans les différents niveaux de l’hyperbolique résultant. Ce travail s’attache ensuite à améliorer les défauts des méthodes de visualisation hyperbolique en embarquant le modèle de Spring à l’hyperbolique afin de mieux montrer les relations entre les clusters. Plu- sieurs expérimentations sont proposées sur différents types de données documentaires.

Mots-clés : analyse de données multi-vues, fouille de données, clustering numérique, évalua- tion de qualité du clustering, étiquetage des clusters, visualisation hyperbolique, visualisation hiérarchique. Abstract Combining the visualization and the labeling methods plays an important role not only for giving an overall view of the clustering results but also for the precise evaluation of the said results. But at this point, no accurate solution on how to combine such methods has been pro- posed. In this report we present a first attempt of combination of hyperbolic visualization and novel labeling approaches for accurately visualizing data analysis results issued for clustering approach whenever the clusters are originally represented in a highly multidimensional space.

The visualization model relies on a hierarchical algorithm that is used for summarizing the cluster contents in the form on a hypertree in which information on data density issued from the original clusters description space is preserved. The core of this work presents different novel labeling strategies that can be used for describing the basic cluster contents as well as for accurately propagating labels into the different levels of the resulting hypertree. This work then aims to improve the defects of hypertree visualization by embedding the model of Spring to hyperbolic for better showing the relations between the clusters. Several realistic test expe- riments of our proposals are achieved on different kinds of documentary data.

Keywords : multiview data analysis, data mining, clustering, cluster labeling, clustering qua- lity evaluation, hyperbolic visualization, hierarchical visualization. i LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Remerciements Mes premiers remerciements vont à mon encadrant Jean-Charles Lamirel pour le temps qu’il m’a consacré durant ce stage, son soutien, ses conseils scientifiques, sa disponibilité et son aide précieuse pour améliorer et aller jusqu’au bout de ce travail de stage. Il m’a vraiement impressionné de par ses qualités humaines et son esprit ouvert. Je tiens à remercier tous les membre de l’équipe CORTEX : Randa, Maxime, Jéremy pour leur soutien et leur accueil et les membres de l’équipe KIWI, Geoffray, Ilham.

Je tiens à remercier Pascal Cuxac et Claire François de l’INIST pour leurs évaluations. Je tiens à remercier Mohammed Attik, un ancien doctorant de l’équipe Cortex pour sa coopération, sa conversation et son soutien. Je tiens à remercier mes Professeurs de l’IFI, qui m’ont donné des connaissances et m’ont aidé à bien suivre la formation de master de l’IFI. Mes grands remerciement à ma grande famille, en particulier ma femme et mon fils, pour leur encouragement, leurs prières pour réussir ma vie professionnelle.

iii LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Table des matières Liste des figures ix Liste des tableaux xi Liste des algorithmes xiii Chapitre 1 Introduction générale 1.2 Contexte et Problématique .4 Plan du mémoire. 3 Chapitre 2 L’état de l’art 2.1 Dimension intrinsèque des données multidimensionnelles .2 Visualisation par projection cartographique linéaire .3 Visualisation par projection cartographique non linéaire .4 Visualisation par l’analyse de graphe .2 Étiquetage des clusters .2 Étiquetage des clusters par la sélection d’information (variable) .3 Traitement de données documentaires multidimensionnels .1 Représentation de données documentaires. 20 v LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Table des matières 2.2 Notion de point de vue. 25 Chapitre 3 Combinaison de méthodes avancées de visualisation et de sélection d’in- formation pour la fouille et l’analyse de données 3.2 Nouvelles mesures de qualité du clustering basées sur la distribution d’éti- quettes .3 Nouvelles stratégies d’étiquetage des clusters .1 Stratégie locale d’étiquetage des clusters .2 Stratégie globale d’étiquetage des clusters .3 Stratégie hybride d’étiquetage des clusters .4 Stratégie d’étiquetage des clusters par les mesures d’entropie .5 Étiquetage des clusters par Gain d’Information .4 Combinaison des méthodes d’étiquetage des clusters et de visualisation hyperbolique .5 Communication multi-vues entre les arbres hyperboliques .1 Modèle de réseau bayésien pour la communication inter-cartes .2 Communication multi-vues entre les arbres hyperboliques .6 Intégration de graphe à l’hyperbolique .7 Organisation des branches de l’hyperbolique.

41 Chapitre 4 Expérimentations et évaluations 4.1 Interprétation des résultats du clustering .2 Communication multi-vues entre les arbres hyperboliques .3 Intégration de modèle de Spring à l’hyperbolique. 46 Conclusion générale vi LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Annexe A Description des données pour le Corpus Brevets A.2 Analyse des brevets .1 Définition des points de vue .2 Multi-indexation des brevets. 56 Annexe B Description des données pour le Corpus PASCAL B.2 Extrait de données .1 Définition des points de vue. 59 Bibliographie 61 vii LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Liste des figures 1.1 Paradigme de traitement de l’information orienté par les points de vue (MVDA).1 Distribution du « fer à cheval ».2 évolution du volume de sphère en fonction de nombre de dimensions.3 Distribution en « fer à cheval » : (a) Distribution et plan principal trouvé par l’ACP .4 Projection faite par CCA de IR3 à IR2 de la distribution du « fer à cheval ».5 (a) deux points d’un spirale, (b) la distance euclidienne entre ces deux points et (c) la distance curviligne ou géodésique .6 Approximation de la distance curviligne à l’aide du chemin le plus court par l’intermédiaire des liens entre les centroïdes (ici la distance entre les deux centroïdes noircis) .7 CDA : Projection non-linéaire d’un « nœud de tresse »(de dimension 3 à 1) 14 2.8 Isomap : Exemple du « rouleau suisse »(à droite) et de la projection de 20000 échantillons tirés du rouleau par Isomap.9 BibTechMon : réseau de mots baséesur les relations entre eux.

Ce réseau contient 28 nœuds et 131 connexions .10 Deux types de géodésique : un diamètre passant par O et P et un arc de cercle AB orthogonal au cercle unité.11 La visualisation de l’arbre hyperbolique (Hypertree) .1 Cette figure montre le principe d’étiquetage d’arbre hyperbolique par la stratégie F-leaveOneOut .2 La structure de réseau bayésien pour la communication inter-topographies.3 Deux masses de points et leurs connexions par l’élasticité. cij est l’élement de matrice des indices de Jaccard.1 Méthode Dominant d’étiquetage d’arbre hyperbolique .2 Méthode ThemostFrequent d’étiquetage d’arbre hyperbolique .3 Méthode χ2 d’étiquetage d’arbre hyperbolique .4 Étiquetage d’arbre hyperbolique par la moyenne de F-mesure (F-moyenne) 47 4.5 Étiquetage d’arbre hyperbolique par la F-LeaveOneOut. 48 ix LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Liste des figures 4.6 Une part vue de l’arbre qui présente le cluster source activé (en blue) pour la propagation .7 Résultat de la propagation du cluster activé dans le figure 4.6, les clusters en blue sont trouvé par la propagation bayesien .8 Cette figure montre le graphe utilisant le modèle de Spring pour visualiser les relations natureles entre les clusters d’enfants d’un père de l’arbre hyperbolique .1 Exemple de notice de brevet. L’indexation qui a été générée pour ce brevet est matérialisé par le contenu du champ «Final indexation».

Ces termes d’indexation sont préfixés par le nom du point de vue auquel ils sont associés : «adv.» pour le point de vue Avantages, «titre» pour le point de vue Titres, «use» pour le point de vue Utilisations, «soc.» pour le point de vue Déposants. 57 x LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Liste des tableaux 2.1 Tableau de contingences pour l’absence ou la présence d’un terme dans les documents d’une classe .2 Notations de DBHC.1 Ce tableau présente un exemple de 6 clusters (C1 ,. , C6 ) annotés par 7 étiquettes, e1 ,. Le cluster C1 est annoté par les étiquettes e1 , e2 ,e3 ,e4 ,e5.

L’étiquette e4 est présente dans les clusters C1 et C4 .1 Ce tableau présente un exemple d’utilisation de la fonction g (cf.2 Ce tableau présente la comparaison de différentes approches d’étiquetage d’arbre hyperbolique .1 Tableau résumé des caractéristiques résultantes de brevets. 57 xi LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Liste des algorithmes 1 Algorithme de classification hiérarchique orienté par la densité (DBHC). 26 2 Procédure 1 : élimination de classes parents répétées. 26 3 Procédure 2 : éviter les classes recouvrantes.

27 xiii LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Liste des algorithmes xiv LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Chapitre 1 Introduction générale Sommaire 1.2 Contexte et Problématique .4 Plan du mémoire. 3 “ Savoir ce que tout le monde sait, c’est ne rien savoir. Le savoir commence là où commence ce que le monde ignore. ” Remy de Gourmont, “ Promenades philosophiques ” 1.1 Motivation D’un côté, les techniques de visualisation hyperbolique représentent un excellent compromis pour mener à bien de manière parallèle des tâches de fouilles et d’analyse de données.

En effet, ces techniques permettent de répondre à de nombreux problèmes posés par les techniques de visualisation traditionnelles. Elles traitent les problèmes de surcharge cognitive des représentations à base de graphes et ceux liés aux artefacts de représentation des méthodes de projection des données multidimensionnelles sur un plan d’interprétation. Elles permettent de plus d’exploiter les résultats des méthodes de clas- sification très performantes, plutôt que d’utiliser des méthodes moins performantes qui intègrent leur propre fonction de projection. D’un autre côté, l’étude des méthodes d’analyse des étiquettes associées aux classes issues d’une méthode de classification ouvre de nouvelles perspectives en analyse de don- nées.

En effet, les étiquettes qu’il est possible d’associer aux classes peuvent représenter à la fois des propriétés endogènes au processus de classification, et des propriétés exo- gènes, propres aux données qui ont été classifiées. L’analyse de leur distribution dans les 1 LUAN VAN CHAT LUONG download : add luanvanchat@agmail. Introduction générale classes et leur catégorisation permet donc à la fois de résoudre des problèmes de fouille de données, des problèmes de prédiction et des problèmes de filtrage d’information. L’étude de l’optimisation et de la combinaison de ces techniques, qui sont à la fois complémentaires et en synergie l’une avec l’autre dans le contexte général de l’analyse de données, s’avère donc être une voie de recherche extrêmement prometteuse.

Elle doit permettre de résoudre de nombreux problèmes liés à l’analyse des données complexes, comme les données documentaires ou les données bioinformatiques.2 Contexte et Problématique Premièrement, la visualisation des résultats du clustering reste un problème rela- tivement ouvert, malgré l’importance qu’il peut avoir dans la compréhension desdits résultats.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ