Luận văn ứng dụng phát hiện nhận dạng văn bản trong các cảnh chụp cho người khiếm thị và hướng dẫn du lịch

Phát triển ứng dụng nhận dạng văn bản trong hình ảnh cho người khiếm thị. Ứng dụng hướng dẫn du lịch cho người khiếm thị thông qua nhận dạng văn bản

Trường đại học

Đại Học Quốc Gia Hà Nội, Viện Quốc Tế Pháp Ngữ

Người đăng

Ẩn danh

Thể loại

Luận văn thạc sĩ

2018

75
1
0

Phí lưu trữ

30 Point

Tóm tắt

I. Giới thiệu về ứng dụng phát hiện nhận dạng văn bản trong các cảnh chụp cho người khiếm thị và hướng dẫn du lịch

Ứng dụng phát hiện nhận dạng văn bản trong các cảnh chụp cho người khiếm thị và hướng dẫn du lịch là một giải pháp công nghệ tiên tiến giúp người dùng có thể đọc và hiểu được văn bản trong các hình ảnh. Được thiết kế đặc biệt cho người khiếm thị, ứng dụng này cũng có ích cho những người muốn có thêm thông tin về địa điểm du lịch.

1.1 Phát hiện văn bản trong các cảnh chụp

Phát hiện văn bản trong các cảnh chụp là một trong những chức năng chính của ứng dụng. Nó giúp người dùng nhận biết và phân biệt các ký tự trong văn bản, ngay cả khi chúng được viết ở các góc độ khác nhau.

1.2 Nhận dạng văn bản trong hướng dẫn du lịch

Nhận dạng văn bản trong hướng dẫn du lịch là một tính năng quan trọng cho những người muốn biết thêm thông tin về địa điểm du lịch. Ứng dụng này giúp người dùng đọc và hiểu được các chỉ dẫn, mô tả và thông tin quan trọng về địa điểm du lịch mà họ đang tham quan.

1.3 Tích hợp công nghệ cho người khiếm thị

Ứng dụng này được thiết kế đặc biệt để hỗ trợ người khiếm thị. Nó sử dụng công nghệ tiên tiến để phát hiện và nhận dạng văn bản trong các cảnh chụp, giúp người dùng có thể đọc và hiểu được thông tin mà không cần đến sự trợ giúp của người khác.

II. Vấn đề và thách thức trong ứng dụng phát hiện nhận dạng văn bản trong các cảnh chụp cho người khiếm thị và hướng dẫn du lịch

Mặc dù ứng dụng phát hiện nhận dạng văn bản trong các cảnh chụp cho người khiếm thị và hướng dẫn du lịch có nhiều lợi ích, nhưng nó cũng phải đối mặt với một số vấn đề và thách thức. Một trong những vấn đề chính là độ chính xác trong phát hiện và nhận dạng văn bản, đặc biệt khi văn bản được viết ở các góc độ khác nhau hoặc khi có ánh sáng yếu.

2.1 Độ chính xác trong phát hiện và nhận dạng văn bản

Độ chính xác trong phát hiện và nhận dạng văn bản là một trong những yếu tố quan trọng để đảm bảo rằng người dùng có thể đọc và hiểu được thông tin một cách chính xác. Tuy nhiên, khi văn bản được viết ở các góc độ khác nhau hoặc khi có ánh sáng yếu, độ chính xác có thể bị giảm sút.

2.2 Tối ưu hóa tốc độ xử lý

Tốc độ xử lý là một yếu tố quan trọng khác để đảm bảo rằng người dùng có thể đọc và hiểu được thông tin một cách nhanh chóng. Tuy nhiên, khi xử lý các cảnh chụp phức tạp hoặc khi có nhiều văn bản trong một cảnh chụp, tốc độ xử lý có thể bị giảm sút.

III. Phương pháp và giải pháp cho ứng dụng phát hiện nhận dạng văn bản trong các cảnh chụp cho người khiếm thị và hướng dẫn du lịch

Để giải quyết các vấn đề và thách thức trong ứng dụng phát hiện nhận dạng văn bản trong các cảnh chụp cho người khiếm thị và hướng dẫn du lịch, các nhà nghiên cứu đã phát triển một số phương pháp và giải pháp. Một trong những phương pháp chính là sử dụng các thuật toán học máy để cải thiện độ chính xác trong phát hiện và nhận dạng văn bản.

3.1 Sử dụng thuật toán học máy

Sử dụng thuật toán học máy là một phương pháp hiệu quả để cải thiện độ chính xác trong phát hiện và nhận dạng văn bản. Các thuật toán học máy có thể học từ các ví dụ trước đó và điều chỉnh chính xác của chúng để phù hợp với các cảnh chụp mới.

3.2 Tối ưu hóa tốc độ xử lý

Tối ưu hóa tốc độ xử lý là một giải pháp quan trọng để đảm bảo rằng người dùng có thể đọc và hiểu được thông tin một cách nhanh chóng. Các nhà nghiên cứu đã phát triển các thuật toán và phương pháp mới để cải thiện tốc độ xử lý của ứng dụng, ngay cả khi xử lý các cảnh chụp phức tạp hoặc khi có nhiều văn bản trong một cảnh chụp.

IV. Ứng dụng thực tế của ứng dụng phát hiện nhận dạng văn bản trong các cảnh chụp cho người khiếm thị và hướng dẫn du lịch

Ứng dụng phát hiện nhận dạng văn bản trong các cảnh chụp cho người khiếm thị và hướng dẫn du lịch có nhiều ứng dụng thực tế. Nó có thể được sử dụng để hỗ trợ người khiếm thị đọc và hiểu được thông tin trong các cảnh chụp, hoặc để hỗ trợ người du lịch tìm hiểu thêm thông tin về địa điểm du lịch mà họ đang tham quan.

4.1 Hỗ trợ người khiếm thị đọc và hiểu thông tin

Ứng dụng này có thể được sử dụng để hỗ trợ người khiếm thị đọc và hiểu được thông tin trong các cảnh chụp. Nó giúp người dùng có thể đọc và hiểu được các chỉ dẫn, mô tả và thông tin quan trọng mà không cần đến sự trợ giúp của người khác.

4.2 Hỗ trợ người du lịch tìm hiểu thêm thông tin

Ứng dụng này cũng có thể được sử dụng để hỗ trợ người du lịch tìm hiểu thêm thông tin về địa điểm du lịch mà họ đang tham quan. Nó giúp người dùng đọc và hiểu được các chỉ dẫn, mô tả và thông tin quan trọng về địa điểm du lịch mà không cần đến sự trợ giúp của người khác.

V. Kết luận và tương lai của ứng dụng phát hiện nhận dạng văn bản trong các cảnh chụp cho người khiếm thị và hướng dẫn du lịch

Ứng dụng phát hiện nhận dạng văn bản trong các cảnh chụp cho người khiếm thị và hướng dẫn du lịch là một giải pháp công nghệ tiên tiến giúp người dùng có thể đọc và hiểu được văn bản trong các hình ảnh. Mặc dù nó vẫn phải đối mặt với một số vấn đề và thách thức, nhưng nó có nhiều tiềm năng để hỗ trợ người khiếm thị và người du lịch trong tương lai.

5.1 Độ chính xác và tốc độ xử lý

Độ chính xác và tốc độ xử lý là hai yếu tố quan trọng để đảm bảo rằng người dùng có thể đọc và hiểu được thông tin một cách chính xác và nhanh chóng. Các nhà nghiên cứu đang tiếp tục phát triển các phương pháp và giải pháp mới để cải thiện độ chính xác và tốc độ xử lý của ứng dụng.

5.2 Tương lai của ứng dụng phát hiện nhận dạng văn bản trong các cảnh chụp cho người khiếm thị và hướng dẫn du lịch

Trong tương lai, ứng dụng phát hiện nhận dạng văn bản trong các cảnh chụp cho người khiếm thị và hướng dẫn du lịch có thể được phát triển thêm để hỗ trợ nhiều ngôn ngữ hơn và có thể được tích hợp với các thiết bị thông minh khác nhau, như điện thoại thông minh hoặc thiết bị wearable.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI từ nội dung tài liệu gốc; tài liệu do người dùng đóng góp và được kiểm duyệt trước khi xuất bản. Báo lỗi nội dung.

14/03/2026
Luận văn ứng dụng phát hiện nhận dạng văn bản trong các cảnh chụp cho người khiếm thị và hướng dẫn du lịch

Trích đoạn nội dung tài liệu

UNIVERSITE NATIONALE DU VIETNAM, HANOI INSTITUT FRANCOPHONE INTERNATIONAL KOUADIO Kouamé Olivier Application de détection / Reconnaissance de texte de scéne pour les malvoyants et / ou les guides touristiques Ung dung phat hiện/nhận dang van ban trong các cảnh chụp cho người khiếm thị và hướng dẫn du lịch Spécialité: Systémes Intelligents et Multimédia Code: Programme pilote MEMOIRE DE FIN D’ETUDES DU MASTER INFORMATIQUE Sous la direction de : Dr. Nayef NIBAL, Ingénieur de recherche Dr. Muhammad Muzzamil LUQMAN, Ingénieur de rechercher Lu et validé, bon pour soutenance ⁄ LQm An 0A0hae--al Mure aye , HANOI - 2018 ATTESTATION SUR L’HONNEUR J’atteste sur l’honneur que ce mémoire a été réalisé par moi-méme et que les données et les résultats qui y sont présentés sont exacts et n’ont jamais été publiés ailleurs. La source des informations citées dans ce mémoire a été bien précisée.

LOI CAM DOAN Tôi cam đoan đây là công trình nghiên cứu của riêng tôi. Các số liệu, kết quả nêu trong Luận văn là trung thực và chưa từng được ai công bố trong bất kỳ công trình nào khác. Các thông tin trích dẫn trong Luận văn đã được chỉ rõ nguồn gốc. KOUADIO Kouamẻ Olivier - 1đ Table des matiéres Table des mat os Lisle des lableaux vi Table des figures vil 1 Introduction générale 1.1 Contexte at Cadre Pétnde 12 Problématiques.

Domaine dapplication 14 Objectifs du stage 18 1ravauxà NéaHseT .8 Planification des trảchen LY Orgonisaliua du rappork. "————— 2 Beat de Park ch.1 Les approches hasées sur des répions - .11 Maximally Stable Extremal Regions (MSER) 212 Siding, Window 2.2 Les approches Lusées sur les 0oinposanls coun:. 221 Stroke Width ‘Iransform ($W'l') 222 Les propriétés géométriques .3 Lea méthodes de classification de composants connexes 281 Méthode de classification er cancade 0.2 Machine & vecteurs de support (SVM). 24 Réseanx de nenranes convalntifs (CNN).6 Réxeuns de avurones couvolulifs profoud {DORN} 26 Les approches hybrldes.7 Tableau de syathése des anticles tu 11 3 Solntion proposée 18 3.1 Description dea diftéremtes phases de mise ex.

place du pipeline 1 4141 Modrle : Teetnre d'image .L2 Module 2 le prê-rdluetmenk. 14 113 Module 3 : Extraction des composants connexes 1 3.14 Module 4 : Fillrage des composunts connexee. l4 315 Madrle 5 : Tape de proupage 14 310 Module 6 : Afficage des buites ceglobankes ( Bounding Boxes) 14 BLT ‘lableau récapitulatif des entrées / sorties dea modules du pipeline 1 3.2 Environnement de travai 14 Remerciements La réalisation de ce document qui couronne la tin de notre formation de Master, n’aurait && poseible sane Vappni direct: on indirect de personnes et dnstiimtions amxqnllas nous tenons ich & axprimer nos sincéres somercicwents, Ds'ugit de — VAgence Universitaira de Ja Nrancophonie (ALI), pont nous avoir donré Foppartimité de poursiivre cous études de Master & "TFT a travers uue bourse. — LInstitut Trancaphone Intemational (IPT) et de tous Jes professenrs, pour les nombreuses connaissances uvquises durant notre formative.

— Mes encadrants du stage au Laboratoire Informatique, Image et Interaction de la Rochelle ( Dr. Nayef NIRAT, ef Dr. Muhammad Mnzzamil LJQMAN ] ponr m’avoir accneilli an sein de lenr éqnipe ef panr Ter suiv! ef implication personuelle daus la réalisaliou de anes travaux, — Tons cenx qri dé prés an de lain m‘ont apporté leur sontien durant natre formation. Résumé Liextraction de texte A base d’images est I'm des domaines de rechercae .es pus dynamiques dans le domaine da la tarhnologie mnltimédia, de nas jours.

1! extraction de texte & partir d'images complexes on phis eolorées ext uu probleme dilfici.e, ar ies données Lextuclles pr6senLes dans les images coulieuuent des inforstations uliles pour Pexplication hab'tuelle, indexation et la strneturation des images. Mextraction de ces intormations implique Ja détection, la localisation, et Ja revonuaiswance da vexte & partir d'une inuage doauée, Tour extraire rapidement, cu texte A partir d'images, nons avons mis er. place, an canrs de ce stage, nn pipelia: complet de Weitcment basé sur des cumposauls connexes qui ideulifient plus proc!stucul les Lextes dans Yimage. Notre pipeline de détection de texte commence par un module de pré-traitement de image entrée.

Fnanite, dana on autre module, nons extrayons les cnmporanta connexes (hinaives: /coulenurs}. Pai dany un autre nous liltrous vey composanls couuexes avec Falgor d'appreulissage supervise SVM pour ne parder que les composants textuels. lìn fin dans ‘e demier madule nons avons en plare un a'garithme pour regruuper les composunts lextuels ex aols eu nous bavanl sur cerlainy paramélres lel que : a distance enclidienne entre. les earactares, 'es no Hans rectilignes et none affichons Ie résultat A ‘a sartie dn pipeline.

Tes fésullals expérincewlaux Uémontrent que la performunes de notre pipe. ue est sup eure ä certaiues approches de la limérature Mots clés : Détection de texte de scéne, reconnaissance de texte de scéne, OCI, accessibilité au texte pour Jee mualvoyanls iv 3.3 Implếmentation du pipeline .2 L'extaction des couspusuuts connexes " WP 4.5 Wltrage des composants connexes.34 Description des données cua " cece es 18 33.3 Validation du madéle. "————— TH nhà ky và .6 Bape de formation des mate (Grouping) - cà - 9 33.7 AHIchage dee boitesenglobanis. co co con nỉ -.

38 3⁄1 Présentation de quelanes réenitats obtenns - - 22 3.5 Analyse des résullals ubtemus. Apport el contribution novatrice : Extraction des vomposanly coumexes couleurs 25 4.1 Description de Vextraction der compasants couleurs. Chafne de couleur RGB - - x 25 43. Extraction des composants aur la chaine Bleu,Veri, ÄoWge.4 Fusion des eomposants de la chaine Bleu, Vert ot Rouge.

36 5 Conclusion générale et perspective 28 Bl Conclusion. "————— TH nhà ky và .3 Aetivite annexes au laboraloieLỒÏ. co co cọ nh nh nen -- 38 Bibliographie 30 Liste des tableaux 14 Plunuing prồvisdonnel dựa tâcues dụ stage 0. ee Qa Tableau de syulheve des articles éludigs( 1/2} 1 22 Vablean de synthase des articles étudiés 12 Tablean récapitnlatif des entrées / sorties des modules du pipeline 15 Tubleun de validation du modéle 18 vi abstract Image-based text extraction is one of the most dynamic areas of research in the field of multimedia technology today.

Extracting text from complex or more colarfal images is a. bnt the textual data ir the mages conlain uscfal iufucmalion for the usual explanation, indexing aud slrucluring of images. Extracling Lhúc information involves detectin; locating, and recognizing text from a given image To quickly extract Lext from inmages, we have set up, during Unis interusaip, a complete pipeline of provesing based om connected components that. more precisely identifies small or large texts in the image.

Onr text detection pipeline begins will a pro-processiug aodule of the input image. Thea, i another cusdule ve extract Ue related components (binaries / colors). ‘hen we filter these related components with the supervised learning algorithm SVM to keep that textnal components. Finally in the last we have implemented an algorithm to group the textual compouenty into words baved ox certain paranelers such as : Use Euclidean disuance between Lhe characters, the rectilinear positions ard we display the result at the exit of the pipeline.

Uxperimental resnits demonstrate thai the perlortnance 0[ var pipeline is superior lo wuine stale-olthe-arl approaches Key Wards : Scene text detection, scene text reongnition, OGR, text. accessibility far the vimally impaired 3.3 Implếmentation du pipeline .2 L'extaction des couspusuuts connexes " WP 4.5 Wltrage des composants connexes.34 Description des données cua " cece es 18 33.3 Validation du madéle. "————— TH nhà ky và .6 Bape de formation des mate (Grouping) - cà - 9 33.7 AHIchage dee boitesenglobanis. co co con nỉ -.

38 3⁄1 Présentation de quelanes réenitats obtenns - - 22 3.5 Analyse des résullals ubtemus. Apport el contribution novatrice : Extraction des vomposanly coumexes couleurs 25 4.1 Description de Vextraction der compasants couleurs. Chafne de couleur RGB - - x 25 43. Extraction des composants aur la chaine Bleu,Veri, ÄoWge.4 Fusion des eomposants de la chaine Bleu, Vert ot Rouge.

36 5 Conclusion générale et perspective 28 Bl Conclusion. "————— TH nhà ky và .3 Aetivite annexes au laboraloieLỒÏ. co co cọ nh nh nen -- 38 Bibliographie 30 Table des figures 1.1 Accessibiite du lexte dans Tes setues uuturelles pour les malvoyauls 31 HluszaliondeBðWT. ¬ 22 Renrésentatian đe mnppression đe compnsant par la †aille đe son aire.

f sonrce : hf†ps ://ima- seitet/MorphoLilM}. - tha 28 Structure de la classitication en eascade |l] .1 Structnre de la classification en cascade et SYM [1] 2.5 Processus de mise en place de SVM [2] .6 Architecture de CNN pour la classification text/non-texo [3| 2.7 Architecture de DONN pour a classification text/uou-text [4] .8 Architecture 3D de VGG-I6 (sontce thiếp ://noa.1 Architecture dit Pipeline propose 14 3. image1: Binarisation POtsu .5 image2 Bimariation dOtu .8 Coordannées des hnites englobantes des eamporants 1 3.7 Illustration de :a classification avec SVM.8 Wustrarion des distances poor Ie groupage[3] .9 Hlustration des distances pour le groupage .10 Ilinstyation de 2atfichage des bnites englohantes ” 3.11 Résultat de detection de texte image 1 23 Aésaltat de détection de texte image 2 28 Résultat de Aétection de texte image | ” -Résaltat de election de Wexle imaged. 3 -Ttêenltat de đótectinn de raxte Ìmage ñ at -Reaultal de detection de xe tuage Ö .1 IDustration de “extraction des composants couleurs 12.

originale Jue buo 44. image 2 chaine verte. 45 chaine rouge 40 originale. 22 AT chaine bue 48 Emage2 chameverie.

" e eens A9 chaine romge 4.10 Iestration de 1a fusion des composonts de chaque diaiux de ewulears vil Remerciements La réalisation de ce document qui couronne la tin de notre formation de Master, n’aurait && poseible sane Vappni direct: on indirect de personnes et dnstiimtions amxqnllas nous tenons ich & axprimer nos sincéres somercicwents, Ds'ugit de — VAgence Universitaira de Ja Nrancophonie (ALI), pont nous avoir donré Foppartimité de poursiivre cous études de Master & "TFT a travers uue bourse. — LInstitut Trancaphone Intemational (IPT) et de tous Jes professenrs, pour les nombreuses connaissances uvquises durant notre formative. — Mes encadrants du stage au Laboratoire Informatique, Image et Interaction de la Rochelle ( Dr. Nayef NIRAT, ef Dr.

Muhammad Mnzzamil LJQMAN ] ponr m’avoir accneilli an sein de lenr éqnipe ef panr Ter suiv! ef implication personuelle daus la réalisaliou de anes travaux, — Tons cenx qri dé prés an de lain m‘ont apporté leur sontien durant natre formation. Liste des tableaux 14 Plunuing prồvisdonnel dựa tâcues dụ stage 0. ee Qa Tableau de syulheve des articles éludigs( 1/2} 1 22 Vablean de synthase des articles étudiés 12 Tablean récapitnlatif des entrées / sorties des modules du pipeline 15 Tubleun de validation du modéle 18 vi Liste des tableaux 14 Plunuing prồvisdonnel dựa tâcues dụ stage 0. ee Qa Tableau de syulheve des articles éludigs( 1/2} 1 22 Vablean de synthase des articles étudiés 12 Tablean récapitnlatif des entrées / sorties des modules du pipeline 15 Tubleun de validation du modéle 18 vi abstract Image-based text extraction is one of the most dynamic areas of research in the field of multimedia technology today.

Extracting text from complex or more colarfal images is a. bnt the textual data ir the mages conlain uscfal iufucmalion for the usual explanation, indexing aud slrucluring of images. Extracling Lhúc information involves detectin; locating, and recognizing text from a given image To quickly extract Lext from inmages, we have set up, during Unis interusaip, a complete pipeline of provesing based om connected components that. more precisely identifies small or large texts in the image.

Onr text detection pipeline begins will a pro-processiug aodule of the input image. Thea, i another cusdule ve extract Ue related components (binaries / colors). ‘hen we filter these related components with the supervised learning algorithm SVM to keep that textnal components.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ