UNIVERSITE NATIONALE DU VIETNAM A HANOI (UNVH) INSTITUT FRANCOPHONE INTERNATIONAL (IFT) ZONGO SYLVAIN ANALYSE DE DONNEES TEMPORELLES MASSIVES EN SCIENCE DE L'ENVIRONNEMENT PHAN TiCH DU LIEU THOI GIAN DAI TRA TRONG KHOA HOC MOI TRUGNG Spécialité : Systémes Intelligents ct Multimédia Code : Programme Pilote MEMOIRE DE FIN D’ETUDES DU MASTER. INFORMATIQUE HANOI - 2019 UNIVERSITE NATIONALE DU VIETNAM A HANOI (UNVH) INSTITUT FRANCOPHONE INTERNATIONAL (IFT) ZONGO SYLVAIN ANALYSE DE DONNEES TEMPORELLES MASSIVES EN SCIENCE DE L’ENVIRONNEMENT PHAN TiCH DU LIEU THOI GIAN DAI TRA TRONG KHOA HOC MOI TRUGNG Spécialité : Systémes Intelligents et Multimédia Code : Programme Pilœe MEMOIRE DE FIN D’ETUDES DU MASTER INFORMATIQUE Sous la direction de : Pr. Pierre Gancarski, Professeur d'Informatique, Directeur adjoint d'ICube gancarski®iomistira. Agnts Brand, Muitre de Couférenees, dans ’éguipe SDC agnes.
fr Jon acl aa HANOI - 2019 ATTESTATION SUR L’HONNEUR Tatteste sur Ïhonneur que ce mémoire a été réalisé par moi-méme et que les données et les résultats qui y sont présentés sont exacts et n’ont jamais été publiés ailleurs. La source des informations citées dans ce mémoire a été bien précis LOI CAM DOAN Toi cam đoan là công trình nghiên cứu. Các số kết quả nêu trong Luận văn là trung thực và chưa từng được ai công bồ trong bắt kỳ công trình nào khác, Các thông tin trích dẫn. trong Luận văn đã được chỉ rõ nguồn gốc.
ZONGO SYLVAIN APs Résumé La préservation et/o la restanration du bon état des cours d'ean exigée par la Di- rective Cadre Farropéenne sur ean met en exergue Ta nécessité de disposer doutila opé rationnels ponr aider & Vinterprétation des informations complexes concernant les cours d'eau et leur fonctionnement. En effet, ces outils permettront lévaluation de letfica cité des programmes d’actions engagés, ce qui a conduit a la naissance du projet ANR tresqueau. Le projet Fresqueau a conduit & la création d’une base de données & partir de diverses sources pourtant sur lu qualité physivo: chimique ot biologique des cours d'eau. Le projet ATIQUTEAT est.
am prolongement dn projet ANT Treaqnaan ave pour danble objectifs s'étalant snr deux années académiqnes. Le premier objectif sur lequel nous avons travaillé consistait A implémenter des modles d’apprentiasage pour la construction de clusters pour une analyse rétrospective sur les données cecueillies. Le deuxiéme objec. tif sert, lors de Ja deuxitme année de mettre en veuvre l’approche de clustering sous contrainte proposée par l'’équipe SDC.
Cette analyse étant sur des séries temporelles, il a Ge décii de fai s une unulyse chronvlugigue ot nou chronumdtrigue pour Févalualion de la qualité physic-chimigue cl biologique des cours d'eau, Pour y parvenir lors de mon stage, nons avons procédé A ume étnde des travanx connexes sur Papprentissage non snpervisé des séries temporelles. Une premidre approche a ếtế Vétude des algorithmes tels que DISCAN, TDRSGAN, CITA, SWAP, Kmeans Une seconde approche étudige a été celle hasée sur l'apprentissage non supervisé avec les réseaux de neurones tels que Deep Belief Network (L)BN), les réseaux de neurones convo: lutionnels (RNC) et Deep lemporal Clustering (DTC). AVissue de l'étude réulisée sur les dilfércutes approches rolutives au sujet, ualre cholx ost porté sur Kienny pour sv rapidild ol su rebustesse. Comme de nombreux algorithmes dapprentissage, ume distance de similarité est requise.
distance TW (Dynamic Time Warping) a été appronvée comme érant la mesnre de similariré la. mieux adaptée Mais bien avant Vapplication de Kmeans, plusieurs méthades d'imputation des valeurs mianquantes, de normalisation et de réduction de dimension des données ont, été imple. mentées pour avoir un jeu de données cohérent avec les objectifs du projet Nos Uevaux serviront de base à là scconde phase du projet pour la prochaine année acudémique. Table des figures 1.1 Structnre accueil - - 3 12 Organigramme .1 Flux de données et ley raitements.
Pee ĩ 31 Structure de FoDoMuST .2 Structure [bncounele de TSFRESH. sẻ ằẰ eee .3 Représentation de calcul nvcc la distanec celidienne. OL 44 Formule de DTW .4 Représentation de calenl đe distance avec DTW + 4-6 Représentation du calcul de la moyenne avec DBA .? Architecture de DIC: [11] - : 2 5.1 Données au format arff .2 Données au format csv.3 Processus du cheminement des traitements des données vu cv 5.4 Modnle preprocessing avec ses sous modules et leurs fonctionnalités .5 Module Lixelude avec ses fonctionnalités 36 5.6 Normalisation du jeudedonnécs FONG prio her v2 4 5 10 15 18v avec la méthode MinMax ayce la phase ’imputation par interpolation tem- porelle lindaire, 2 eee 12.7 Nombre de Cluster & former : Comme marqnées en rouge sur la figure les valeurs approximatives 6 et 9 sont les mienx représentatif en terme de nombre de clusters bien distingné & construire. Ainsi nons choisissons le nombre 9 pour Vexpérimentation.
L’expérimentation a été effectuée avec la valeur k—9 ce qui pourrait étre la valeur k—6 car & travers la courbe de coude la valeur k—6 est auasi une valeur qui permet de bien clistinguer les clusters sur notre jou de données.8 Données étiquetécs (cluster id) & la dermitre colonnc. 88 Dédicaces A mes grands-porents Vourma, Yamba, Nobthié et Noaga pour watre amour inexpri- mable et toutes vos bénédictinns qui continuent & me fortifier et & m’animer de force. A mes parents Noaga et N’Gané pour tos encouragements ef vas soutiens qui sont tow jours une bouff Hoxygene qui me ressource dans les moments pénibles, de solitude et de souffrance. Merci d’étre toujours 4 mes cités, par votre présence, vous qui n'avex jamais cossé de me seulenir lout au long de mes cludes, je ne saurai vous oxprimer au profonde gratitude el ma reconnaissance.
iv Table des figures 1.1 Structnre accueil - - 3 12 Organigramme .1 Flux de données et ley raitements. Pee ĩ 31 Structure de FoDoMuST .2 Structure [bncounele de TSFRESH. sẻ ằẰ eee .3 Représentation de calcul nvcc la distanec celidienne. OL 44 Formule de DTW .4 Représentation de calenl đe distance avec DTW + 4-6 Représentation du calcul de la moyenne avec DBA .? Architecture de DIC: [11] - : 2 5.1 Données au format arff .2 Données au format csv.3 Processus du cheminement des traitements des données vu cv 5.4 Modnle preprocessing avec ses sous modules et leurs fonctionnalités .5 Module Lixelude avec ses fonctionnalités 36 5.6 Normalisation du jeudedonnécs FONG prio her v2 4 5 10 15 18v avec la méthode MinMax ayce la phase ’imputation par interpolation tem- porelle lindaire, 2 eee 12.7 Nombre de Cluster & former : Comme marqnées en rouge sur la figure les valeurs approximatives 6 et 9 sont les mienx représentatif en terme de nombre de clusters bien distingné & construire.
Ainsi nons choisissons le nombre 9 pour Vexpérimentation. L’expérimentation a été effectuée avec la valeur k—9 ce qui pourrait étre la valeur k—6 car & travers la courbe de coude la valeur k—6 est auasi une valeur qui permet de bien clistinguer les clusters sur notre jou de données.8 Données étiquetécs (cluster id) & la dermitre colonnc.2 L’apprentissage non supervisé .3 L’apprentissage semi-supervisé. 42 Description de lalgorithms Kmeans .1 Fonconuernent de Kieams. cuc nà 18 43 Distances temporelles "a1 2L 13.2 Limites de DTW et soft-DTW.
: - Chapitre 5 Implềmentations et expérimenrations 28 51 Tmplấmeniation .11 Problime du format des données extraites .12 Premiére solution en ligne de commandes 27 5.3 Solution avec interface graphique.2 Prétraitement des données .1 Pourquoi est-il important Wavoir des dounées propres? .2 Nettovage des données.2 Imputation (remplacement) des valeurs manquantes .4 Visualisation des données - 32 5.6 Ionetionnement du traitement des données au sein de EoDoMul'.3 Lixpérimentations avec quelques jeux de données 35 5.1 Interface Mult{Gube 35 5.2 Btopea de l'cxpérimentation. $6 Chapitre 6 Intégration A FoDoMuST de fonctions externes pour I'ana- lyse de séries 42 61 Scikit-learn. 49 62 Tgleurm : Time series loAtiing .1 Architeclure globule ok ee. 48 Mì Abstract The preservation and/or restoration of the good condition of watercourses reqnired by the Fnropean Warer Framework Directive highlights the need for operational tools to help interpret complex information about waterco ses and their functioning.
hese tools will allow the evaluation of the effectiveness of the action programs undertaken, which led to the birth of the ANRFresqueau project. ‘he Hresqueau project led to the creation of a da labuse [rom various sources on the physico-chemical aud biological quality of watercourses. The ADQUBAU project is an extension of the ANR. Fresqueau project with lwo objec tives spread aver two academic years.
The first objective we worked on was to implement learning models for the constrnation of cl ‘tere for retrospective analysis of the data. I'he second objective is to znplement the constrained clustering approach proposed by the SDC team in the second year. I'his analysis being on time series, he has was decided to do a chronofogical analysis for the evaluation of the physico-chemical and. biological quality of watercourses, To achicve this during ry internship, we conducted a sludy of relaled work on unsu- pervised time series learning.
A first approach was ta study algorithms anch as DRSCAN, TDRSCAN, CHA, SWAP. A second approach studied was the one hased on nnsupervised learning with neural networks such as Deep Belief Network (DRIN}, convo- Iutional neural networks (ANC) and Deep ‘lemporary Clustering (LYI'C) At the end of the study carried out on the different approaches relating to the subject, we chose Knaus for ity speed aud robustaces. Like inaay learning algorithuu, u sinniluc disiuuce ix required. Thus thc DTW (DynumnieTine Warping) distance was approved us the most appropriate similariiy measure, But before the application of Kmeans, sợ eral methods of missing valnes imputation, normalization and data reduction were implemen- ted to have a data set consis ‘ent with the project abjectives Our work will serve as the basis for the second phase of the project for the next academic year Table des figures 1.1 Structnre accueil - - 3 12 Organigramme .1 Flux de données et ley raitements.
Pee ĩ 31 Structure de FoDoMuST .2 Structure [bncounele de TSFRESH. sẻ ằẰ eee .3 Représentation de calcul nvcc la distanec celidienne. OL 44 Formule de DTW .4 Représentation de calenl đe distance avec DTW + 4-6 Représentation du calcul de la moyenne avec DBA .? Architecture de DIC: [11] - : 2 5.1 Données au format arff .2 Données au format csv.3 Processus du cheminement des traitements des données vu cv 5.4 Modnle preprocessing avec ses sous modules et leurs fonctionnalités .5 Module Lixelude avec ses fonctionnalités 36 5.6 Normalisation du jeudedonnécs FONG prio her v2 4 5 10 15 18v avec la méthode MinMax ayce la phase ’imputation par interpolation tem- porelle lindaire, 2 eee 12.7 Nombre de Cluster & former : Comme marqnées en rouge sur la figure les valeurs approximatives 6 et 9 sont les mienx représentatif en terme de nombre de clusters bien distingné & construire. Ainsi nons choisissons le nombre 9 pour Vexpérimentation.
L’expérimentation a été effectuée avec la valeur k—9 ce qui pourrait étre la valeur k—6 car & travers la courbe de coude la valeur k—6 est auasi une valeur qui permet de bien clistinguer les clusters sur notre jou de données.8 Données étiquetécs (cluster id) & la dermitre colonnc. 88 Résumé La préservation et/o la restanration du bon état des cours d'ean exigée par la Di- rective Cadre Farropéenne sur ean met en exergue Ta nécessité de disposer doutila opé rationnels ponr aider & Vinterprétation des informations complexes concernant les cours d'eau et leur fonctionnement. En effet, ces outils permettront lévaluation de letfica cité des programmes d’actions engagés, ce qui a conduit a la naissance du projet ANR tresqueau. Le projet Fresqueau a conduit & la création d’une base de données & partir de diverses sources pourtant sur lu qualité physivo: chimique ot biologique des cours d'eau.
Le projet ATIQUTEAT est. am prolongement dn projet ANT Treaqnaan ave pour danble objectifs s'étalant snr deux années académiqnes.