1 _FEBUS _FEBUS LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com INSTITUT FRANCOPHONE INTERNATIONAL,VNU-IFI Stage Master 2 Informatique, LIUPPA – Equipe T2I Université de Pau et des Pays de l’Adour 2018-2019 Master : Systèmes Intelligents Multimédia - Promo 22 ANALYSE DE DONNÉES MULTI-SOURCES (RÉSEAUX SOCIAUX, JOURNAUX,. )LIÉES AU THÈME « MOBILITÉ ET TRANSITION ÉNERGÉTIQUE» Encadrant(e) : Présenter par : Dr. Marie-Noelle BESSAGNET Hugues KANDA MADIMBA Dr. Christian SALLABERRY Edition Septembre 2019 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Table des matières Introduction 1 1 Présentation de Structure d’accueil et Généralités sur le Twitter 3 1.1 LIUPPA le laboratoire de recherche en informatique de l’UPPA .1 Equipes de recherche .2 Caractéristique d’un tweet .3 Domaines d’applications de l’analyse des sentiments .4 Les collectivités locales .4 Sources des Données .5 Approches de la classification des sentiments.
11 2 État de l’art 12 2.1 Les diverses approches d’analyse de sentiment. 12 i LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com ii Table des matières 2.1 Approche basée sur les lexiques .2 Approche apprentissage de la machine .2 Une approche particulière basée sur le modèle BILSTM. 18 3 Collecte de Données et Pré-traitement 21 3.1 Collecte de Données. 25 4 Analyse des Sentiments : Cas Pratique 27 4.1 Lexique de sentiments .1 Description de l’approche .2 Données d’apprentissage et de test.
30 5 Expérimentations et Résultats 31 5.1 Extraction et présentation des descripteurs .3 Phase de Test et Interprétation .1 Phase de Test et Présentation des résultats .2 Présentation des résultats et discussion .1 Pourcentage par rapport au nombre d’opinions (BHNS) .2 Pourcentage par rapport au nombre d’opinions (Funiculaire) .3 Pourcentage par rapport au nombre d’opinions (VELO) .4 Répartition en % de tweets d’opinion par catégorie .5 Répartition en fonction des polarités des opinions .6 Évaluation de la Répartition de tweets des opinions. 40 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Table des matières iii 5.7 Représentation graphique par rapport au tweet avec opinions .8 Représentation de tweets des opinions sous forme d’une droite .9 Représentation graphique d’opinions(2017-2019) .10 Représentation graphique de polarités(2017-2019) .5 Une Application Web Pour le Workflow .1 Extraction des données .2 Résultat de la Prédiction de la Polarité. 48 Conclusion 49 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Table des figures 1.1 scructure du laboratoire .1 Approches d’analyse de sentiment .2 Exemples d’une base de données lexicales .3 Exemples de la polarité .1 Tweets BHNS_FEBUS .1 Exemples de données labélisées .2 Diagramme d’architecture du système proposé .1 Pourcentage par rapport au nombre d’opinions .2 Pourcentage par rapport au nombre d’opinion Funiculaire .3 Pourcentage par rapport au nombre d’opinion VELO .4 Répartition par rapport au tweet d’opinions par catégorie .5 Répartition par rapport à la polarité des opinions .6 Répartition en % au tweet des opinions .7 Répartition cyclique en % au tweet des opinions .8 Représentation des 3 classes .9 Représentation annuelle des opinions .10 Représentation de polarité en 2017. 43 iv LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Table des figures v 5.11 Représentation de polarité en 2018 .12 Représentation de polarité en 2019 .13 Page d’accueil de notre application .14 Page d’extraction des données .15 Résultat d’extraction de données .16 Résultat d’extraction de données.
48 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Liste des sigles et acronymes LSTM Long Short-Term Memory BiLSTM Bidirectional Long Short-Term Memor NN Neural Network RNN Recurrent neural network vi LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Introduction Au cours des dernières années, il y a eu un énorme engouement dans l’utilisation des plates-formes publiques telles que Twitter. Elle est devenue importante dans les médias sociaux pour traiter des sujets aussi variés que l’activisme politique, le commercial, l’éco- nomique,le sportif, le transport et le divertissement. Elle permet aux utilisateurs d’envoyer et de lire des messages courts de 280 caractères appelés "tweets".Il est également intéres- sant d’analyser le contenu de ces tweets pour aider les entreprises, les collectivités dans les choix de politiques territoriales. Ainsi, l’analyse de l’opinion est le processus de détermi- nation du ton d’émotion derrière une série de mots, utilisés pour comprendre les attitudes, les opinions et les émotions exprimées dans une mention en ligne.
Nous souhaitons faire l’analyse de sentiments dans les tweets. Dans le cadre de notre sujet de recherche, nous souhaitons faire d’une part l’extraction de manière automatique sur la plateforme Twitter d’informations relatives à la mobilité et au transport dans l’ag- glomération de la ville de PAU. Nous souhaitons d’autre part analyser l’opinion émise dans ces tweets. Cette analyse permet de faire des statistiques pour aider les collectivités dans les choix de politiques territoriales.
Cette opinion peut être positive, négative, mixposneg (tweet exprimant en debut de message une opinion positive, puis une opinion négative) ou neutre. De nombreux travaux de recherche s’intéressent à l’analyse des opinions dans des tweets écrits en langue française tels que les travaux de [Davide Buscaldi et al, 2018], [Amine Abdaoui et al, 2015], [Simon Jacques, et al,2018] et [Thierry Hamon et al,2015]. L’auteur [Davide Buscaldi et al, 2018], nous présente a travers cet article trois méthodes originales pour la classification thématique et la détection de polarité dans des tweets en français. La première méthode est fondée sur des lexiques (mots et emojis), les n-grammes de caractères et un classificateur à vaste marge (ou SVM), tandis que les deux autres sont des méthodes endogènes fondées sur l’extraction de caractéristiques au grain caractères : un modèle à mémoire à court-terme persistante (ou BiLSTM pour Bidirectionnal Long Short-Term Memory) et perceptron multi-couche d’une part et un modèle de séquences de caractères fermées fréquentes et classificateur SVM d’autre part.
Sentiment analysis of tweets on transport from Île-de France [Simon Jacques, et al,2018]. L’auteur [Amine Abdaoui et al, 2015] a proposé des méthodes supervisées basées sur les machines à vecteurs de support (SVM) utilisant plusieurs types d’attributs comme les n-grammes de mots, les 1 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 2 Introduction n-grammes de caractères, les patrons syntaxiques les plus fréquents, etc. Puis il a également construit et utilisé des lexiques de sentiments et d’émotions spécifiques pour le français. Analyse des émotions, sentiments et opinions exprimés dans les tweets : présentation et résultats de l’édition 2015 du défi fouille de texte [Thierry Hamon et al,2015] Dans ce document, nous allons nous intéresser aux travaux de recherche reposant sur les techniques de machine learning pour affecter une polarité à un tweet, notamment ceux de [Davide Buscaldi.D et al, 2018] dont nous avons pu utiliser les développements.
L’analyse des sentiments relève de plusieurs disciplines en l’occurrence d’une part du traitement automatique de la langage naturelle (Naturel Langage Processing) et d’autre part de l’apprentissage automatique (Machine Learning). Dans ce mémoire, notre objectif consiste à detailler l’analyse des sentiments en adoptant une approche d’apprentissage automatique. Pour ce faire, nous avons re-implémenté la méthode de D.Buscaldi sur le corpus de tweets de DEFT2018.D et al, 2018] sur notre corpus. Les résultats obtenus en terme de précision, rappel et F1-mesure révèlent que la repré- sentation avec un modèle BILSTM est la plus pertinente pour nos travaux.
Le reste du mémoire est organisé en cinq chapitres : nous consacrons un premier cha- pitre pour présenter des généralités sur le domaine de l’analyse des sentiments en particulier twitter comme source d’opinions. Le second chapitre se focalise sur l’état de l’art de l’ana- lyse des sentiments, notamment les travaux inhérents à l’analyse des sentiments twitter. Notre troisième chapitre sera consacré à la collecte de données et au pré-traitement Quant au quatrième chapitre, il sera concentré sur le processus mis en place pour notre travail. Notre cinquième chapitre présente l’expérimention et les résultats de la méthode BILSTM en considérant les phases d’apprentissage et de test.
Nous concluons avec une synthèse de travail et des perspectives. LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Chapitre 1 Présentation de Structure d’accueil et Généralités sur le Twitter 1.1 LIUPPA le laboratoire de recherche en informatique de l’UPPA Le LIUPPA est le laboratoire de recherche en informatique de l’UPPA. Il adresse au sens large les sciences du Numérique. Son projet de recherche est résolument tourné vers les besoins et enjeux d’une société numérique dans laquelle le Web (Web des objets, réseaux sociaux, etc.), et plus généralement les réseaux, ne cessent de prendre de l’ampleur, dans toutes nos activités quotidiennes.
Cela a un impact direct sur les systèmes informatiques qui deviennent de plus en plus complexes avec : des données (dont la masse ne cesse de croître) hétérogènes, multimédias, et fortement délocalisées (cloud), des traitements distribués et sous-traités, des usagers différents (ma- chines, humains) dont les profils et les besoins diffèrent et évoluent. Dans ce contexte, mêmes les interactions avec et entre ces usagers sont à repenser pour permettre une meilleure communication, et une meilleure collaboration. Les solutions que le LIUPPA se propose d’apporter s’inscrivent dans deux domaines complémentaires : sciences et technologies de l’information autour des traitements de l’information (don- née, document, etc.), de la connaissance, et du web, génie logiciel autour de l’ingénierie des modèles, des services et des architectures logicielles, avec des préoccupations transversales liées à la sécurité, au traitement image/signal et à la visualisation, aux systèmes distribués, et à l’interaction et l’adaptation. La figure qui suit synthétise le propos.
3 LUAN VAN CHAT LUONG download : add luanvanchat@agmail. Présentation de Structure d’accueil et Généralités sur le Twitter Figure 1.1 – scructure du laboratoire Le laboratoire est structuré en 2 équipes : MOVIES : est centrée sur le génie logiciel et la modélisation. S’y greffent les thématiques sécurité et visualisation. T2I : est centrée sur le traitement de l’information et des interactions, basé sur des com- pétences de nature diverse (Système d’Information Géographique, architecture logicielle, réseau de capteurs, image).1 Equipes de recherche Le Laboratoire d’Informatique de l’Université de Pau et des Pays de l’Adour est struc- turé autour de deux équipes de recherche : - MOVIES Modélisation, VIsualisation, Exécution et Simulation dont les thématiques de recherche sont : LUAN VAN CHAT LUONG download : add luanvanchat@agmail.
Généralités 5 génie logiciel, modélisation, simulation ,visualisation et sécurité - T2I Traitement des Informations spatiales, temporelles et thématiques pour l’adaptation de l’Interaction au contexte et à l’utilisateur dont les thématiques de recherche sont : Extraction, indexation et recherche d’informations Architectures logicielles pour l’adap- tation dynamique des applications Modèles et scénarios supportant l’adaptation des inter- actions au contexte et à l’usager Ecosystèmes numériques et communautés d’usage 1.2 Généralités Dans cette section, nous définissons quelques concepts de base importants pour notre travail.1 Twitter Premièrement, nous préciserons sur Twitter ses avantages et sa pertinence pour l’ana- lyse des sentiments. Fondée en 2006, Twitter est une plateforme de médias sociaux en ligne gratuite sur laquelle les utilisateurs peuvent envoyer des messages à la communauté Twitter.[Robin Panfili 18 novembre 2016] Ces messages, également appelés tweets, constituent la base de la plate-forme de médias sociaux. Chaque tweet est limité à un certain nombre de caractères. Avant le 7 novembre 2017, les utilisateurs n’étaient en mesure de tweeter qu’avec un maximum de 140 caractères par tweet.
Toutefois, depuis la mise à jour du 7 novembre 2017, la longueur des messages peut varier de 1 à 280 caractères. En outre, le contenu de ces messages contient des opinions, idées, déclarations, etc. Par conséquent, les tweets peuvent varier selon le sujet, tels que les paroles de chansons, les déclarations politiques, les idées, les opinions sur un sujet particulier, etc. Les tweets diffèrent non seulement par leur contenu, mais les personnes qui les écrivent ont des antécédents différents.
Cela signifie que le public de Twitter varie des présidents aux mécaniciens, des acteurs célèbres aux étudiants en arts du secondaire et des PDG aux propriétaires de magasins. En conséquence, le service de micro-blogging Twitter peut collecter des tweets de personnes issues de différents contextes sociaux, culturels, politique, sportifs et économiques. Ensuite, les utilisateurs représentent également différents pays, ce qui signifie que les données peuvent être collectées dans différentes langues.