UNIVERSITE NATIONALE DU VIETNAM, HANOI INSTITUT FRANCOPHONE INTERNATIONAL ELIODOR EDNALSON GUY MIRLIN SYSTEME DE DEDUPLICATION UTILISANT LES TECHNIQUES D’APPRENTISSAGE AUTOMATIQUE HE THONG PHAN TiCH DU LIEU TRUNG LAP SỬ DỤNG KI THUAT MACHINE LEARNING MEMOIRE DE FIN D'ETUDES DU MASTER INFORMATIQUE HANOI - 2018 UNIVERSITE NATIONALE DU VIETNAM, HANO! INSTITUT FRANCOPHONE INTERNATIONAL ELIODOR EDNALSON GUY MIRLIN SYSTEME DE DEDUPLICATION UTILISANT LES TECHNIQUES D’APPRENTISSAGE AUTOMATIQUE HỆ THỐNG PHÂN TÍCH DỮ LIỆU TRÙNG LẶP SỬ DỤNG KĨ THUẬT MACHINE LEARNING Spécialité : Systemes Intelligents et Multimédia Code : Programme Pilote MEMOIRE DE FIN D’ETUDES DU MASTER INFORMATIQUE Sous la direction de : Pierre Bonnet, COO-Orchestra Networks, Expert en SI David Lapetina, Directeur des opérations Orchestra Networks Vietnam - Hanoi HANOI - 2018 Ree Gwe” AAI ON/LEAL ATTERSTATTON SUR. J?abteste sur l’honneur que ce mémoire a éé réalisé par moi-méme et que les données et les résultats qui y sont présentés sont exacts et n’ont jamais été publiés ailleurs. La source des informations cilées dans ce inémoire a clé biew préviséc. LOI CAM BOAN "Tôi cam đoan đây là công trình nghiên cứu của riêng tôi.
Các số liệu, kết quả nêu trong Luận văn là trung thực và chưa từng được ai công bó trong bắt kỳ công trình nào khác. Gác thông tìn trích dẫn trong Luận văn đã dược chỉ rõ nguồn gốc. Signarnre đe Ì'átnđianc Gre ELIODOR EDNALSON GUY MIRLIN Remerciements La réulivation de ce documeut qui couronue ta fin de nole formation de Master, Wau rait été possible sans Pappni direct ou indirect des personnes et des institutions auxqnelles nons tenons ici A exprimer nos sincares remerciements. TI s'agir de: — L'Agence Universitaire de la Francophonie (AUF), pour nous avoir donné Ioppor- tunité de poursuivre nos études de Master 8 I’II'l 4 travers une bourse de mobilité ; — L'Institut Francophone International (LL'l) et de tous les professeurs, pour la qualité de la formation dispensée ; M.
David Lapctina et M. Pierre Bonnet pour m'avoir accucilli au scin de leur équipe et pour leur suivi ct implication personnelle dans la réalisation de mes travaux; — L’ensemble du personnel d’Orchestra. Networks & Hanoi, pour son accueil trés cha- Jeurenyx et ponr les conditions de travail optimales; — Jadresse mes sincares remerciements aux membres de AT Academy Vietnam pour Vhonneur qu’ils mont fait par leur acceptation de participer & évaluation de mon travail Paimerais romercicr toute ma fomille pour leur soutien ct leur amour tout ou long de mes études; Enfin, tous ccux qui de prés ou de loin m’ont apporté leur soution durant ma formation. Remerciements La réulivation de ce documeut qui couronue ta fin de nole formation de Master, Wau rait été possible sans Pappni direct ou indirect des personnes et des institutions auxqnelles nons tenons ici A exprimer nos sincares remerciements.
TI s'agir de: — L'Agence Universitaire de la Francophonie (AUF), pour nous avoir donné Ioppor- tunité de poursuivre nos études de Master 8 I’II'l 4 travers une bourse de mobilité ; — L'Institut Francophone International (LL'l) et de tous les professeurs, pour la qualité de la formation dispensée ; M. David Lapctina et M. Pierre Bonnet pour m'avoir accucilli au scin de leur équipe et pour leur suivi ct implication personnelle dans la réalisation de mes travaux; — L’ensemble du personnel d’Orchestra. Networks & Hanoi, pour son accueil trés cha- Jeurenyx et ponr les conditions de travail optimales; — Jadresse mes sincares remerciements aux membres de AT Academy Vietnam pour Vhonneur qu’ils mont fait par leur acceptation de participer & évaluation de mon travail Paimerais romercicr toute ma fomille pour leur soutien ct leur amour tout ou long de mes études; Enfin, tous ccux qui de prés ou de loin m’ont apporté leur soution durant ma formation.
Résumé La gestion des données de référence coneiste à trouver ou crếcr tt cnregistrorreirt mnigne contenant. tout ce qu’une entreprise on une organisation doit savoir sur une per somne, un emplacement. 1m fournisseur, une autre entreprise ou ime autre entité en particulier. également &ire appelé “master record” on “golden record” Inn fait, la notion de qualité des données, en particulier le probléme de duplication, re- présente un défi trés important pour une bonne gouvernance des données.
La présence de doublons ou de données similaires souléve d‘importantes préoccupations quant & la qualité des données qu’il faut ainsi supprimer La déduplication des enregistrements cst un processus important dans lintégration et le nettoyage des données. Elle permet d'identifier ies enregistrements d'une base de données on provenant de différentes sources qni représentent Ia méme entité du monde réel. Fla assure une meilleure qualité des données résnitantes de ce processus. Ce pro- cessus est utilisé pour créer un "golden record’.
Ainsi, Pextraction de connaissances & partir de ces derniares sera plus précise. Au cours des dernigres années, diverses tech- niques U’approntissage automarique ont été uuilisées pour aborder ec probléme. Sachant gue, le produit EBX d’Orchestva Networks utilise cette approche, notre travail consiste & : — Compares quelques techniques de détection d’euregistrements dupliqués en ulili- sant l'apprentissage automatique et évaluez leurs avantages et leurs inconvénients. — Névelopper im prototype qui combine les meilleures caractéristiques et permet.
de produire une détection d’enregistrements dupliquées améliorées dans EBX. L'approche que nous avons utilisée pour aborder le probléme dans le cadre de notre stage est l'approche d’apprentissage actif. Différentes expériences sont menées sur un ensemble de données pour verifier l’cfficacité de l'algorithme dans la détection des cnrc- gistrements dupliqués. Mots clés : Pribuitement des données, détectivn de doublons, apprentissage auloma- lique, apprentissuge supervisé, apprentissuge non-supervisée, mesure de simuilurité, NLP, classification de texte, traitement du langage naturel, Data quality Management, Dédu- plication, doublone, similaire, record matching, machine learning, clustering, duplicated records, ete.2 Organisation du rapport.
` weve cee ‘Vue d’ensemble 3 2.1 Définition du probléme - : 22 Qualité des données ee eee eee 4 2.3 Nettoyage des données 2. ee a 24 Problémes causés par ley données dupliquées - 4 EBX.1 Pourquei une solution MDM .2 Les fonetionnalités MBX.8 Fiat de PArt 3.1 Mesnres de similarité: revne đe Vexistant 3.1 Te prablềme de la camparaison đes chaines đe caractères .1L1 Mếtriques basếes su des caractéres .112 - Mếtriques basées sur des Tobens(Lexèmes) : 19 3113 Má@triques hybriles .2 Mesures de similaritd uumériques 2. beeee eee Mh 3.2 Delevtion des curegistroments dupliqués 14 3.1 Techniques busées sur dey righes .2 Techniques hasées sur la distance 18 Approches probabilistes. 16 Utilisation dalgorithmes d’apprentissage pour combiner des fonctions de sinilarité.
17 Apprentissage supervisé 17 Appreulissage nou-supervisé 0. AB Apprentissage Actif 20 Synthase. 2 Liste des tableaux 2.1 Lxemple de données dupliquées .1 Fixperimentations : Configuration logicielle et: matérielle : 28 Table des figures Classification des métriques de chaines 10 Chois des attriburs les phis utiles pour me tache de déduptinarion dépen- hà damment du jeu de données en entrée 23 Architecture du systéme propose. 24 Phase de labellisation “Contribution Lumaine?.
: 26 ¬ Page @accenil et de chargement des đonnếes-système implémenté 29 Page de sélection des champs importants-systéme implémenté. 29 wea Phase de labellisation-systéme implémenté Lee. 8Ú Métriques d’évaluation pour le matching exact- A gauche(sur 1 champ)- A droite(sur 3 chumps) sau ¬ e BB Perloriwauce des deux syslimes pour le eu de dótection de duplieulion (mulching Exuet). bbe eee ee eee Seen BB Métriqnes d’évaluation dn aystéme proposé Correspondance approxima: tive(] champ).
bee eee eee ee BB TI Métriqnes d’évaluation du aystéme propasé - Consnmer. 34 12 Lixtrait du fichier CSV généré en sortie d’EBX (appariement flou - 3 colonnes) 34 18 Lixtrait du fichier CSV généré en sortie du systéme proposé(apparfement flou - 3 eolonnes). : af 14 Extrait du fichier CSV gd rổ cũ sortie du sysléme propos¢(upparicmont flow- 3 colounes). - ¬¬ 35 Eixtrait, dn fichier OSV généré en sortie d” FBX appariement flou - 3 colonnes) 3ã Extrait, dn fichier CSV généré en sortie du systéme implémentéfappariement.
be BB Résumé La gestion des données de référence coneiste à trouver ou crếcr tt cnregistrorreirt mnigne contenant. tout ce qu’une entreprise on une organisation doit savoir sur une per somne, un emplacement. 1m fournisseur, une autre entreprise ou ime autre entité en particulier. également &ire appelé “master record” on “golden record” Inn fait, la notion de qualité des données, en particulier le probléme de duplication, re- présente un défi trés important pour une bonne gouvernance des données.
La présence de doublons ou de données similaires souléve d‘importantes préoccupations quant & la qualité des données qu’il faut ainsi supprimer La déduplication des enregistrements cst un processus important dans lintégration et le nettoyage des données. Elle permet d'identifier ies enregistrements d'une base de données on provenant de différentes sources qni représentent Ia méme entité du monde réel. Fla assure une meilleure qualité des données résnitantes de ce processus. Ce pro- cessus est utilisé pour créer un "golden record’.
Ainsi, Pextraction de connaissances & partir de ces derniares sera plus précise. Au cours des dernigres années, diverses tech- niques U’approntissage automarique ont été uuilisées pour aborder ec probléme. Sachant gue, le produit EBX d’Orchestva Networks utilise cette approche, notre travail consiste & : — Compares quelques techniques de détection d’euregistrements dupliqués en ulili- sant l'apprentissage automatique et évaluez leurs avantages et leurs inconvénients. — Névelopper im prototype qui combine les meilleures caractéristiques et permet.
de produire une détection d’enregistrements dupliquées améliorées dans EBX. L'approche que nous avons utilisée pour aborder le probléme dans le cadre de notre stage est l'approche d’apprentissage actif. Différentes expériences sont menées sur un ensemble de données pour verifier l’cfficacité de l'algorithme dans la détection des cnrc- gistrements dupliqués. Mots clés : Pribuitement des données, détectivn de doublons, apprentissage auloma- lique, apprentissuge supervisé, apprentissuge non-supervisée, mesure de simuilurité, NLP, classification de texte, traitement du langage naturel, Data quality Management, Dédu- plication, doublone, similaire, record matching, machine learning, clustering, duplicated records, ete.
Remerciements La réulivation de ce documeut qui couronue ta fin de nole formation de Master, Wau rait été possible sans Pappni direct ou indirect des personnes et des institutions auxqnelles nons tenons ici A exprimer nos sincares remerciements. TI s'agir de: — L'Agence Universitaire de la Francophonie (AUF), pour nous avoir donné Ioppor- tunité de poursuivre nos études de Master 8 I’II'l 4 travers une bourse de mobilité ; — L'Institut Francophone International (LL'l) et de tous les professeurs, pour la qualité de la formation dispensée ; M. David Lapctina et M. Pierre Bonnet pour m'avoir accucilli au scin de leur équipe et pour leur suivi ct implication personnelle dans la réalisation de mes travaux; — L’ensemble du personnel d’Orchestra.
Networks & Hanoi, pour son accueil trés cha- Jeurenyx et ponr les conditions de travail optimales; — Jadresse mes sincares remerciements aux membres de AT Academy Vietnam pour Vhonneur qu’ils mont fait par leur acceptation de participer & évaluation de mon travail Paimerais romercicr toute ma fomille pour leur soutien ct leur amour tout ou long de mes études; Enfin, tous ccux qui de prés ou de loin m’ont apporté leur soution durant ma formation.2 Organisation du rapport. ` weve cee ‘Vue d’ensemble 3 2.1 Définition du probléme - : 22 Qualité des données ee eee eee 4 2.3 Nettoyage des données 2. ee a 24 Problémes causés par ley données dupliquées - 4 EBX.1 Pourquei une solution MDM .2 Les fonetionnalités MBX.8 Fiat de PArt 3.1 Mesnres de similarité: revne đe Vexistant 3.1 Te prablềme de la camparaison đes chaines đe caractères .1L1 Mếtriques basếes su des caractéres .112 - Mếtriques basées sur des Tobens(Lexèmes) : 19 3113 Má@triques hybriles .2 Mesures de similaritd uumériques 2. beeee eee Mh 3.2 Delevtion des curegistroments dupliqués 14 3.1 Techniques busées sur dey righes .2 Techniques hasées sur la distance 18 Approches probabilistes.
16 Utilisation dalgorithmes d’apprentissage pour combiner des fonctions de sinilarité. 17 Apprentissage supervisé 17 Appreulissage nou-supervisé 0. AB Apprentissage Actif 20 Synthase. 2 Résumé La gestion des données de référence coneiste à trouver ou crếcr tt cnregistrorreirt mnigne contenant.