UNIVERSITÉ NATIONALE DU VIETNAM, HANOI INSTITUT FRANCOPHONE INTERNATIONAL (IFI) RIGOBERT OSIAS Résumé textuel et visuel basé sur la transcription des vidéos Tóm tắt bằng văn bản và hình ảnh dựa trên phiên âm video Spécialité : Systèmes Intelligents et Multimédia Code : 8480201.02 MÉMOIRE DE FIN D’ÉTUDES DU MASTER INFORMATIQUE HANOI - 2023 UNIVERSITÉ NATIONALE DU VIETNAM, HANOI INSTITUT FRANCOPHONE INTERNATIONAL (IFI) RIGOBERT OSIAS Résumé textuel et visuel basé sur la transcription des vidéos Tóm tắt bằng văn bản và hình ảnh dựa trên phiên âm video Spécialité : Systèmes Intelligents et Multimédia Code : 8480201.02 MÉMOIRE DE FIN D’ÉTUDES DU MASTER INFORMATIQUE Encadrant : Dr. HỒ Tường Vinh HANOI - 2023 ATTESTATION SUR L’HONNEUR J’atteste sur l’honneur que ce mémoire a été réalisé par moi-même et que les données et les résultats qui y sont présentés sont exacts et n’ont jamais été publiés ailleurs. La source des informations citées dans ce mémoire a été bien précisée. LỜI CAM ĐOAN Tôi cam đoan đây là công trình nghiên cứu của riêng tôi.
Các số liệu, kết quả nêu trong Luận văn là trung thực và chưa từng được ai công bố trong bất kỳ công trình nào khác. Các thông tin trích dẫn trong Luận văn đã được chỉ rõ nguồn gốc. Signature de l’étudiant RIGOBERT OSIAS Remerciements Tout d’abord, je remercie le Seigneur Jésus Christ le Dieu tout puissant de m’avoir donné le courage et la patience nécessaires de mener ce travail à son terme. Je tiens à remercier tout particulièrement mon encadrant PHD.
HO Tuong Vinh, pour l’aide exceptionnelle qu’il m’a apporté, pour sa patience indescriptible et son encouragement. Un très grand remerciement et une très grande reconnaissance sont destinés à ma tendre compagne Mme. Lyse Valerie Louis Osias qui n’a jamais cessé de m’encourager à finir ce travail. Je tiens à dire un grand merci au jury pour avoir lu et évalué mon travail.
Je me sens honoré qu’ils prennent le temps de le faire. Je souhaite aussi remercier l’équipe pédagogique et administrative de l’IFI (Ins- titut Francophone International) pour leurs efforts dans le but de nous offrir une excellente formation. Enfin, j’adresse mes plus sincères remerciements à ma famille : Mes parents, mes sœurs et tous mes proches et amis, qui m’ont accompagné, aidé, soutenu et encouragé tout au long de la réalisation de ce mémoire. Rigobert Osias Table des matières Table des figures vi Liste des tables 0 1 Introduction générale 1 1.1 Contexte et justification du sujet .1 Présentation de la chaı̂ne YouTube SHAMENGO .2 Objectifs du stage .4 Organisation du manuscrit.
4 2 État de l’art 5 2.2 Historique et évolution du contenu vidéo en ligne .1 L’expansion de la vidéo en ligne au cours des années 2000 .2 Le streaming vidéo prend le pas sur le téléchargement de vidéo 7 2.3 L’essor des nouveaux formats de contenu vidéo .4 Le contenu vidéo en ligne en 2023 .5 Tableau récapitulatif de l’historique et évolution du contenu vidéo en ligne .3 Analyse des pratiques actuelles de résumé vidéo .1 Techniques actuelles de résumé de vidéo .1 Fonctionnement du résumé assisté par ordinateur .2 Fonctionnement du résumé automatique .3 Évaluation des résumés vidéo .2 Outils et technologies utilisés pour les résumés textuels et visuels 10 2.4 Présentation de la chaı̂ne YouTube SHAMENGO. 14 ii TABLE DES MATIÈRES 3 Méthodologie 15 3.2 Ressources matérielles et logicielles .3 Description des étapes de collecte de données .1 Provenance des vidéos .2 Collecte des données .4 Explication des critères de sélection des vidéos .5 Techniques utilisées pour le résumé textuel et visuel .1 Introduction et explication de la Méthode 5W1H .2 Raisons du choix de la méthode 5W1H [12] .6 Présentation de l’approche HuggingFace-ALBERT .1 Technologies utilisées pour chacune des étapes .2 Architecture de l’approche HuggingFace-ALBERT .3 Présentation de HuggingFace Transformers for NLP .1 Que sont les Transformers dans l’apprentissage au- tomatique ?[21] .2 Question-Answering avec HuggingFace .4 Présentation du modèle pré-entrainé ALBERT .1 Comparaison BERT avec ALBERT .7 Présentation de l’approche GPT3.1 Architecture de l’approche GPT3.2 Présentation du modèle GPT3. 35 4 Évaluation et résultats 37 4.1 Objectif de l’évaluation .2 Scénario de test .1 Présentation des réponses attendues .2 Interface principale de l’application .3 Interface après exécution .4 Réponse à la question WHO générée par chaque approche .5 Réponse à la question WHAT générée par chaque approche .6 Réponse à la question WHERE générée par chaque approche .7 Réponse à la question WHEN générée par chaque approche .8 Réponse à la question WHY générée par chaque approche .9 Réponse à la question HOW générée par chaque approche .10 Présentation du résumé général .11 Présentation du résumé visuel .1 Similarité sémantique - Score Similarité TF-IDF .2 Similarité sémantique - Score Similarité BERT[9] .4 Référencement des videos évaluées par numéro .5 Résultats - Approche Question-Answering avec HuggingFace-ALBERT 49 4.1 Interprétation des résultats. 50 iii TABLE DES MATIÈRES 4.6 Résultats - Approche Question-Answering avec GPT3.1 Interprétation des résultats.
54 5 Conclusion et Perspectives 57 5. 57 iv Table des figures 2.1 Historique et évolution du contenu vidéo en ligne .2 Chaı̂ne YouTube Shamengo .1 Nombre de vidéos utilisées .2 Liste des vidéos sélectionnées .4 Questions prédéfinies de WHO .5 Questions prédéfinies de WHAT .6 Questions prédéfinies de WHERE .7 Questions prédéfinies de WHEN .8 Questions prédéfinies de WHY .9 Questions prédéfinies de HOW .10 Architecture de l’approche HuggingFace-ALBERT .11 Structure architecturale Encodeur-décodeur[21] .12 Mécanisme d’attention et d’auto-attention[21] .15 Vecteurs de la couche d’auto-attention[21] .16 Détails de comparaison entre BERT et ALBERT[11] .17 Architecture de l’approche GPT3.1 Réponses attendues par l’application .2 Interface principale de l’application .3 Liste déroulante pour la langue de traduction .4 Réponse WHO générée par l’approche ALBERT .5 Réponse WHO générée par l’approche GPT3.6 Réponse WHAT générée par l’approche ALBERT .7 Réponse WHAT générée par l’approche GPT3.8 Réponse WHERE générée par l’approche ALBERT .9 Réponse WHERE générée par l’approche GPT3.10 Réponse WHEN générée par l’approche ALBERT. 42 v TABLE DES FIGURES 4.11 Réponse WHEN générée par l’approche GPT3.12 Réponse WHY générée par l’approche ALBERT .13 Réponse WHY générée par l’approche GPT3.14 Réponse HOW générée par l’approche ALBERT .15 Réponse HOW générée par l’approche GPT3.16 Résumé général général .17 Présentation du résumé visuel .18 Formule de similarité cosine .19 Formule de similarité en pourcentage .20 Référencement des vidéos par numéro .21 Résultats Approche HuggingFace-ALBERT .22 Résultats par catégorie de questions .23 Résultats Approche GPT3.24 Résultats Approche GPT3.5 par catégorie de questions. 55 vi Liste des sigles et acronymes AI Artificial Intelligence NLP Natural Language Processing 5W1H WHO, WHAT, WHERE, WHEN, WHY, HOW QA Question-Answering BERT Bidirectional Encoder Representations from Transformers ALBERT A Lite BERT GPT Generative Pre-trained Transformer LLM Large Language Models TF-IDF Term Frequency-Inverse Document Frequency GPU Graphics Processing Unit TPU Tensor Processing Units TF1 Télévision Française 1 ARTE Association Relative à la Télévision Européenne M6 Métropole Télévision Chapitre 1 Introduction générale L’avènement du numérique a complètement bouleversé notre interaction et notre consommation de l’information, notamment avec la progression exponentielle de l’utilisation des vidéos en ligne.
Cela entraı̂ne un besoin croissant de synthèse de contenus afin de permettre une consommation rapide et efficace. Les résumés vi- suels et textuels des vidéos ont donc fait leur apparition et ont émergé comme des outils fondamentaux, offrant de nouvelles perspectives sur la façon dont nous appré- hendons et assimilons les informations visuelles. La nature et l’impact des résumés visuels et textuels des vidéos sont étudiés en profondeur dans ce mémoire. Ces résumés ne sont pas seulement des condensa- tions de contenu, mais sont une forme de communication multimédia évoluée qui vise à capturer l’essence et la substance des vidéos afin de les rendre accessibles, informatives et attrayantes.
Tout ça est réalisé à travers la réponses aux questions essentielles suivantes : qui, quoi, où, quand, pourquoi, comment. En premier lieu, nous examinerons les méthodes utilisées pour distiller visuelle- ment et textuellement le contenu vidéo. Ensuite, nous présenterons la méthodologie en détail, puis l’étape d’analyse et les résultats dans lequel un scénario de test sera aussi présenté. Ainsi nous concluerons le travail en présentant les perspectives.1 Contexte et justification du sujet Le projet s’inscrit dans le contexte de l’intelligence artificielle, plus précisément du traitement de langage naturel, afin de résumer des vidéos de manière textuelle et visuelle à travers la réponse des questions clés.
Il est essentiel d’avoir des outils performants pour traiter et résumer ces données en raison de la prolifération des contenus multimédias en ligne, en particulier des 1 CHAPITRE 1. INTRODUCTION GÉNÉRALE vidéos. Les utilisateurs sont confrontés à une quantité considérable de vidéos et cherchent des moyens rapides d’obtenir des informations pertinentes. La diversité linguistique des contenus est un défi majeur dans un monde de plus en plus connecté.
La capacité à traiter des vidéos dans plusieurs langues et à en extraire des résumés dans une langue cible est devenue essentielle pour faciliter la diffusion de l’information à l’échelle mondiale.1 Présentation de la chaı̂ne YouTube SHAMENGO La présentation de la chaı̂ne YouTube SHAMENGO est fait dans le but de mieux contextualiser notre travail. Il est vrai que selon le titre du stage, il s’agit de faire le résumé textuel et visuel de vidéos mais nous nous concenterons sur les vidéos YouTube, spécifiquement de la chaı̂ne SHAMENGO. Cette dernière se donne pour devise : Le meilleur de l’innovation verte, sociale et sociétale au service d’un nouvel art de vivre. A travers les vidéos de l’association Shamengo, la promotion est faite pour une panoplie de startups qui proposent des solutions très innovantes et très écologiques.
Á travers ces vidéos des astuces très pratiques peuvent être reproduites par les visionnaires dans leurs activités quotidiennes. Notre choix est justifié d’un côté par le fait que les vidéos de la chaı̂ne soient particulièrement captivantes par la diffusion d’une série d’idées simples et innovantes, d’une autre côté par leur struc- ture simple, pas trop longue et informative, ce qui aide bien sûr dans le processus d’extraction d’informations.2 Objectifs du stage Mettre en place un système qui fait le résumé des vidéos de la chaı̂ne YouTube "Shamengo" de la manière suivante : — Analyser la transcription de la vidéo en question puis extraire les réponses aux questions 5W1H (Who-Qui, what-Quoi, When-Quand, Where-Où, Why- Pourquoi, How-Comment) — Faire l’association des différents segments de la vidéo qui répondent aux ques- tions aux timecodes de la vidéo. Ainsi chaque réponse correspond à une sé- quence de la vidéo — Afficher un résumé textuel général de la vidéo en question — Présenter le résultat final dans une interface web qui prend comme paramètres d’entrée, le lien de la vidéo de la vidéo en question, la langue de la vidéo et la 2 CHAPITRE 1. INTRODUCTION GÉNÉRALE langue de sortie du résumé textuel, qui peut être entre l’anglais, le français et le vietnamien.3 Problématique Il existe plusieurs éléments clés qui composent le problème de la création auto- matisée de résumés vidéo : 1.
Les utilisateurs sont confrontés à une surcharge d’informations en raison de la croissance exponentielle du contenu vidéo en ligne. Il devient un défi majeur d’extraire des informations pertinentes et utiles à partir de vidéos longues et variées. L’automatisation du processus de résumé vidéo doit garantir que les informa- tions extraites sont précises et pertinentes. Comment s’assurer que les segments choisis reflètent correctement le contenu principal de la vidéo ? 3.
Les biais dans la sélection des segments ou la compréhension du contenu peuvent résulter de l’automatisation de la création de résumés vidéo. Com- ment s’assurer que les résumés générés sont impartiaux et équilibrés ? 4. Pour fournir des résumés cohérents et significatifs, l’automatisation de ce pro- cessus doit être capable de comprendre le contexte et l’essence du contenu vidéo.4 Organisation du manuscrit Lorsqu’on effectue des travaux scientifiques, il est nécessaire de définir le plan du document. Fournir un schéma clair du travail effectué, l’état d’avancement est divisé en différents chapitres, comme suit : — Le premier chapitre fait l’introduction générale, présente le contexte de la jus- tification du sujet, les objectifs du stage et les problématiques.