UNIVERSITE NATIONALE DU VIETNAM, HANOI INSTITUT FRANCOPHONE INTERNATIONAL KOUADIO Kouamé Olivier Application de détection / Reconnaissance de texte de scéne pour les malvoyants et / ou les guides touristiques Ung dung phat hiện/nhận dang van ban trong các cảnh chụp cho người khiếm thị và hướng dẫn du lịch Spécialité: Systémes Intelligents et Multimédia Code: Programme pilote MEMOIRE DE FIN D’ETUDES DU MASTER INFORMATIQUE Sous la direction de : Dr. Nayef NIBAL, Ingénieur de recherche Dr. Muhammad Muzzamil LUQMAN, Ingénieur de rechercher Lu et validé, bon pour soutenance ⁄ LQm An 0A0hae--al Mure aye , HANOI - 2018 ATTESTATION SUR L’HONNEUR J’atteste sur l’honneur que ce mémoire a été réalisé par moi-méme et que les données et les résultats qui y sont présentés sont exacts et n’ont jamais été publiés ailleurs. La source des informations citées dans ce mémoire a été bien précisée.
LOI CAM DOAN Tôi cam đoan đây là công trình nghiên cứu của riêng tôi. Các số liệu, kết quả nêu trong Luận văn là trung thực và chưa từng được ai công bố trong bất kỳ công trình nào khác. Các thông tin trích dẫn trong Luận văn đã được chỉ rõ nguồn gốc. KOUADIO Kouamẻ Olivier - 1đ Table des matiéres Table des mat os Lisle des lableaux vi Table des figures vil 1 Introduction générale 1.1 Contexte at Cadre Pétnde 12 Problématiques.
Domaine dapplication 14 Objectifs du stage 18 1ravauxà NéaHseT .8 Planification des trảchen LY Orgonisaliua du rappork. "————— 2 Beat de Park ch.1 Les approches hasées sur des répions - .11 Maximally Stable Extremal Regions (MSER) 212 Siding, Window 2.2 Les approches Lusées sur les 0oinposanls coun:. 221 Stroke Width ‘Iransform ($W'l') 222 Les propriétés géométriques .3 Lea méthodes de classification de composants connexes 281 Méthode de classification er cancade 0.2 Machine & vecteurs de support (SVM). 24 Réseanx de nenranes convalntifs (CNN).6 Réxeuns de avurones couvolulifs profoud {DORN} 26 Les approches hybrldes.7 Tableau de syathése des anticles tu 11 3 Solntion proposée 18 3.1 Description dea diftéremtes phases de mise ex.
place du pipeline 1 4141 Modrle : Teetnre d'image .L2 Module 2 le prê-rdluetmenk. 14 113 Module 3 : Extraction des composants connexes 1 3.14 Module 4 : Fillrage des composunts connexee. l4 315 Madrle 5 : Tape de proupage 14 310 Module 6 : Afficage des buites ceglobankes ( Bounding Boxes) 14 BLT ‘lableau récapitulatif des entrées / sorties dea modules du pipeline 1 3.2 Environnement de travai 14 Remerciements La réalisation de ce document qui couronne la tin de notre formation de Master, n’aurait && poseible sane Vappni direct: on indirect de personnes et dnstiimtions amxqnllas nous tenons ich & axprimer nos sincéres somercicwents, Ds'ugit de — VAgence Universitaira de Ja Nrancophonie (ALI), pont nous avoir donré Foppartimité de poursiivre cous études de Master & "TFT a travers uue bourse. — LInstitut Trancaphone Intemational (IPT) et de tous Jes professenrs, pour les nombreuses connaissances uvquises durant notre formative.
— Mes encadrants du stage au Laboratoire Informatique, Image et Interaction de la Rochelle ( Dr. Nayef NIRAT, ef Dr. Muhammad Mnzzamil LJQMAN ] ponr m’avoir accneilli an sein de lenr éqnipe ef panr Ter suiv! ef implication personuelle daus la réalisaliou de anes travaux, — Tons cenx qri dé prés an de lain m‘ont apporté leur sontien durant natre formation. Résumé Liextraction de texte A base d’images est I'm des domaines de rechercae .es pus dynamiques dans le domaine da la tarhnologie mnltimédia, de nas jours.
1! extraction de texte & partir d'images complexes on phis eolorées ext uu probleme dilfici.e, ar ies données Lextuclles pr6senLes dans les images coulieuuent des inforstations uliles pour Pexplication hab'tuelle, indexation et la strneturation des images. Mextraction de ces intormations implique Ja détection, la localisation, et Ja revonuaiswance da vexte & partir d'une inuage doauée, Tour extraire rapidement, cu texte A partir d'images, nons avons mis er. place, an canrs de ce stage, nn pipelia: complet de Weitcment basé sur des cumposauls connexes qui ideulifient plus proc!stucul les Lextes dans Yimage. Notre pipeline de détection de texte commence par un module de pré-traitement de image entrée.
Fnanite, dana on autre module, nons extrayons les cnmporanta connexes (hinaives: /coulenurs}. Pai dany un autre nous liltrous vey composanls couuexes avec Falgor d'appreulissage supervise SVM pour ne parder que les composants textuels. lìn fin dans ‘e demier madule nons avons en plare un a'garithme pour regruuper les composunts lextuels ex aols eu nous bavanl sur cerlainy paramélres lel que : a distance enclidienne entre. les earactares, 'es no Hans rectilignes et none affichons Ie résultat A ‘a sartie dn pipeline.
Tes fésullals expérincewlaux Uémontrent que la performunes de notre pipe. ue est sup eure ä certaiues approches de la limérature Mots clés : Détection de texte de scéne, reconnaissance de texte de scéne, OCI, accessibilité au texte pour Jee mualvoyanls iv 3.3 Implếmentation du pipeline .2 L'extaction des couspusuuts connexes " WP 4.5 Wltrage des composants connexes.34 Description des données cua " cece es 18 33.3 Validation du madéle. "————— TH nhà ky và .6 Bape de formation des mate (Grouping) - cà - 9 33.7 AHIchage dee boitesenglobanis. co co con nỉ -.
38 3⁄1 Présentation de quelanes réenitats obtenns - - 22 3.5 Analyse des résullals ubtemus. Apport el contribution novatrice : Extraction des vomposanly coumexes couleurs 25 4.1 Description de Vextraction der compasants couleurs. Chafne de couleur RGB - - x 25 43. Extraction des composants aur la chaine Bleu,Veri, ÄoWge.4 Fusion des eomposants de la chaine Bleu, Vert ot Rouge.
36 5 Conclusion générale et perspective 28 Bl Conclusion. "————— TH nhà ky và .3 Aetivite annexes au laboraloieLỒÏ. co co cọ nh nh nen -- 38 Bibliographie 30 Liste des tableaux 14 Plunuing prồvisdonnel dựa tâcues dụ stage 0. ee Qa Tableau de syulheve des articles éludigs( 1/2} 1 22 Vablean de synthase des articles étudiés 12 Tablean récapitnlatif des entrées / sorties des modules du pipeline 15 Tubleun de validation du modéle 18 vi abstract Image-based text extraction is one of the most dynamic areas of research in the field of multimedia technology today.
Extracting text from complex or more colarfal images is a. bnt the textual data ir the mages conlain uscfal iufucmalion for the usual explanation, indexing aud slrucluring of images. Extracling Lhúc information involves detectin; locating, and recognizing text from a given image To quickly extract Lext from inmages, we have set up, during Unis interusaip, a complete pipeline of provesing based om connected components that. more precisely identifies small or large texts in the image.
Onr text detection pipeline begins will a pro-processiug aodule of the input image. Thea, i another cusdule ve extract Ue related components (binaries / colors). ‘hen we filter these related components with the supervised learning algorithm SVM to keep that textnal components. Finally in the last we have implemented an algorithm to group the textual compouenty into words baved ox certain paranelers such as : Use Euclidean disuance between Lhe characters, the rectilinear positions ard we display the result at the exit of the pipeline.
Uxperimental resnits demonstrate thai the perlortnance 0[ var pipeline is superior lo wuine stale-olthe-arl approaches Key Wards : Scene text detection, scene text reongnition, OGR, text. accessibility far the vimally impaired 3.3 Implếmentation du pipeline .2 L'extaction des couspusuuts connexes " WP 4.5 Wltrage des composants connexes.34 Description des données cua " cece es 18 33.3 Validation du madéle. "————— TH nhà ky và .6 Bape de formation des mate (Grouping) - cà - 9 33.7 AHIchage dee boitesenglobanis. co co con nỉ -.
38 3⁄1 Présentation de quelanes réenitats obtenns - - 22 3.5 Analyse des résullals ubtemus. Apport el contribution novatrice : Extraction des vomposanly coumexes couleurs 25 4.1 Description de Vextraction der compasants couleurs. Chafne de couleur RGB - - x 25 43. Extraction des composants aur la chaine Bleu,Veri, ÄoWge.4 Fusion des eomposants de la chaine Bleu, Vert ot Rouge.
36 5 Conclusion générale et perspective 28 Bl Conclusion. "————— TH nhà ky và .3 Aetivite annexes au laboraloieLỒÏ. co co cọ nh nh nen -- 38 Bibliographie 30 Table des figures 1.1 Accessibiite du lexte dans Tes setues uuturelles pour les malvoyauls 31 HluszaliondeBðWT. ¬ 22 Renrésentatian đe mnppression đe compnsant par la †aille đe son aire.
f sonrce : hf†ps ://ima- seitet/MorphoLilM}. - tha 28 Structure de la classitication en eascade |l] .1 Structnre de la classification en cascade et SYM [1] 2.5 Processus de mise en place de SVM [2] .6 Architecture de CNN pour la classification text/non-texo [3| 2.7 Architecture de DONN pour a classification text/uou-text [4] .8 Architecture 3D de VGG-I6 (sontce thiếp ://noa.1 Architecture dit Pipeline propose 14 3. image1: Binarisation POtsu .5 image2 Bimariation dOtu .8 Coordannées des hnites englobantes des eamporants 1 3.7 Illustration de :a classification avec SVM.8 Wustrarion des distances poor Ie groupage[3] .9 Hlustration des distances pour le groupage .10 Ilinstyation de 2atfichage des bnites englohantes ” 3.11 Résultat de detection de texte image 1 23 Aésaltat de détection de texte image 2 28 Résultat de Aétection de texte image | ” -Résaltat de election de Wexle imaged. 3 -Ttêenltat de đótectinn de raxte Ìmage ñ at -Reaultal de detection de xe tuage Ö .1 IDustration de “extraction des composants couleurs 12.
originale Jue buo 44. image 2 chaine verte. 45 chaine rouge 40 originale. 22 AT chaine bue 48 Emage2 chameverie.
" e eens A9 chaine romge 4.10 Iestration de 1a fusion des composonts de chaque diaiux de ewulears vil Remerciements La réalisation de ce document qui couronne la tin de notre formation de Master, n’aurait && poseible sane Vappni direct: on indirect de personnes et dnstiimtions amxqnllas nous tenons ich & axprimer nos sincéres somercicwents, Ds'ugit de — VAgence Universitaira de Ja Nrancophonie (ALI), pont nous avoir donré Foppartimité de poursiivre cous études de Master & "TFT a travers uue bourse. — LInstitut Trancaphone Intemational (IPT) et de tous Jes professenrs, pour les nombreuses connaissances uvquises durant notre formative. — Mes encadrants du stage au Laboratoire Informatique, Image et Interaction de la Rochelle ( Dr. Nayef NIRAT, ef Dr.
Muhammad Mnzzamil LJQMAN ] ponr m’avoir accneilli an sein de lenr éqnipe ef panr Ter suiv! ef implication personuelle daus la réalisaliou de anes travaux, — Tons cenx qri dé prés an de lain m‘ont apporté leur sontien durant natre formation. Liste des tableaux 14 Plunuing prồvisdonnel dựa tâcues dụ stage 0. ee Qa Tableau de syulheve des articles éludigs( 1/2} 1 22 Vablean de synthase des articles étudiés 12 Tablean récapitnlatif des entrées / sorties des modules du pipeline 15 Tubleun de validation du modéle 18 vi Liste des tableaux 14 Plunuing prồvisdonnel dựa tâcues dụ stage 0. ee Qa Tableau de syulheve des articles éludigs( 1/2} 1 22 Vablean de synthase des articles étudiés 12 Tablean récapitnlatif des entrées / sorties des modules du pipeline 15 Tubleun de validation du modéle 18 vi abstract Image-based text extraction is one of the most dynamic areas of research in the field of multimedia technology today.
Extracting text from complex or more colarfal images is a. bnt the textual data ir the mages conlain uscfal iufucmalion for the usual explanation, indexing aud slrucluring of images. Extracling Lhúc information involves detectin; locating, and recognizing text from a given image To quickly extract Lext from inmages, we have set up, during Unis interusaip, a complete pipeline of provesing based om connected components that. more precisely identifies small or large texts in the image.
Onr text detection pipeline begins will a pro-processiug aodule of the input image. Thea, i another cusdule ve extract Ue related components (binaries / colors). ‘hen we filter these related components with the supervised learning algorithm SVM to keep that textnal components.