Luận văn thạc sĩ vnu phân tích dữ liệu đa nguồn mạng xã hội báo chí liên quan đến tính di động và quá độ năng lượng

Luận văn thạc sĩ phân tích vnu phân tích dữ liệu đa nguồn mạng xã hội báo chí liên quan đến tính di động và quá độ năng lượng, đánh giá thực trạng, chỉ ra hạn chế, đề xuất giải

Trường đại học

Institut Francophone International, VNU-IFI

Chuyên ngành

Informatique

Người đăng

Ẩn danh

Thể loại

Luận văn

2018-2019

62
2
0

Phí lưu trữ

30 Point

Mục lục chi tiết

Introduction

1. CHAPITRE 1: Présentation de Structure d’accueil et Généralités sur le Twitter

1.1. LIUPPA le laboratoire de recherche en informatique de l’UPPA

1.2. Généralités

1.3. Twitter

1.4. Caractéristique d’un tweet

1.5. Analyse d’opinion

1.6. Domaines d’applications de l’analyse des sentiments

1.6.1. La politique

1.6.2. Les entreprises

1.6.3. Les clients

1.6.4. Les collectivités locales

1.7. Sources des Données

2. État de l’art

2.1. Les diverses approches d’analyse de sentiment

2.1.1. Approche basée sur les lexiques

2.1.2. Approche apprentissage de la machine

2.1.3. Une approche particulière basée sur le modèle BILSTM

3. Collecte de Données et Pré-traitement

3.1. Collecte de Données

4. Analyse des Sentiments : Cas Pratique

4.1. Lexique de sentiments

4.1.1. Description de l’approche

4.1.2. Données d’apprentissage et de test

5. Expérimentations et Résultats

5.1. Extraction et présentation des descripteurs

5.2. Phase de Test et Présentation des résultats

5.2.1. Pourcentage par rapport au nombre d’opinions (BHNS)

5.2.2. Pourcentage par rapport au nombre d’opinions (Funiculaire)

5.2.3. Pourcentage par rapport au nombre d’opinions (VELO)

5.2.4. Répartition en % de tweets d’opinion par catégorie

5.2.5. Répartition en fonction des polarités des opinions

5.2.6. Évaluation de la Répartition de tweets des opinions

5.2.7. Représentation graphique par rapport au tweet avec opinions

5.2.8. Représentation de tweets des opinions sous forme d’une droite

5.2.9. Représentation graphique d’opinions (2017-2019)

5.2.10. Représentation graphique de polarités (2017-2019)

5.2.11. Une Application Web Pour le Workflow

5.2.11.1. Extraction des données
5.2.11.2. Résultat de la Prédiction de la Polarité

Conclusion

Tóm tắt

I. Tổng Quan Về Phân Tích Dữ Liệu Đa Nguồn Từ Mạng Xã Hội

Phân tích dữ liệu đa nguồn từ mạng xã hội đã trở thành một lĩnh vực quan trọng trong nghiên cứu hiện đại. Với sự phát triển nhanh chóng của các nền tảng như Twitter, Facebook, và Instagram, việc thu thập và phân tích dữ liệu từ những nguồn này giúp hiểu rõ hơn về các xu hướng xã hội, tâm lý người tiêu dùng và các vấn đề chính trị. Đặc biệt, trong bối cảnh tính di động và quá trình chuyển đổi năng lượng, việc phân tích dữ liệu từ mạng xã hội có thể cung cấp những thông tin quý giá cho các nhà hoạch định chính sách và doanh nghiệp.

1.1. Định Nghĩa Phân Tích Dữ Liệu Đa Nguồn

Phân tích dữ liệu đa nguồn là quá trình thu thập, xử lý và phân tích thông tin từ nhiều nguồn khác nhau. Điều này bao gồm việc sử dụng các công cụ và kỹ thuật để khai thác dữ liệu từ mạng xã hội, báo chí, và các nguồn thông tin khác. Mục tiêu là để tạo ra những hiểu biết sâu sắc về các xu hướng và hành vi của người dùng.

1.2. Tầm Quan Trọng Của Mạng Xã Hội Trong Nghiên Cứu

Mạng xã hội cung cấp một lượng lớn dữ liệu về cảm xúc và ý kiến của người dùng. Những thông tin này có thể được sử dụng để phân tích các vấn đề xã hội, chính trị và kinh tế. Việc hiểu rõ cách mà người dùng tương tác và phản ứng trên mạng xã hội có thể giúp các tổ chức đưa ra quyết định chính xác hơn.

II. Thách Thức Trong Phân Tích Dữ Liệu Từ Mạng Xã Hội

Mặc dù phân tích dữ liệu từ mạng xã hội mang lại nhiều lợi ích, nhưng cũng tồn tại nhiều thách thức. Những vấn đề như độ tin cậy của dữ liệu, sự thiên lệch trong thông tin và khó khăn trong việc phân tích ngữ nghĩa là những yếu tố cần được xem xét. Đặc biệt, trong bối cảnh tính di động và chuyển đổi năng lượng, việc hiểu rõ các thách thức này là rất quan trọng.

2.1. Độ Tin Cậy Của Dữ Liệu

Một trong những thách thức lớn nhất trong phân tích dữ liệu từ mạng xã hội là độ tin cậy của thông tin. Dữ liệu có thể bị giả mạo hoặc không chính xác, dẫn đến những kết luận sai lầm. Việc xác minh nguồn gốc và tính xác thực của dữ liệu là rất cần thiết.

2.2. Sự Thiên Lệ Trong Thông Tin

Sự thiên lệch trong thông tin có thể ảnh hưởng đến kết quả phân tích. Các ý kiến và cảm xúc trên mạng xã hội thường không đại diện cho toàn bộ dân số. Do đó, cần có các phương pháp để điều chỉnh và cân bằng dữ liệu.

III. Phương Pháp Phân Tích Dữ Liệu Đa Nguồn Hiệu Quả

Để phân tích dữ liệu đa nguồn từ mạng xã hội một cách hiệu quả, cần áp dụng các phương pháp và công nghệ tiên tiến. Các kỹ thuật như học máy, phân tích ngữ nghĩa và khai thác dữ liệu là những công cụ quan trọng trong quá trình này. Việc kết hợp các phương pháp này sẽ giúp tối ưu hóa kết quả phân tích.

3.1. Sử Dụng Học Máy Trong Phân Tích

Học máy là một trong những công nghệ quan trọng trong phân tích dữ liệu. Các mô hình học máy có thể được sử dụng để phân loại và dự đoán cảm xúc từ dữ liệu mạng xã hội. Việc áp dụng các thuật toán như SVM, Random Forest và Neural Networks có thể cải thiện độ chính xác của phân tích.

3.2. Phân Tích Ngữ Nghĩa Để Hiểu Cảm Xúc

Phân tích ngữ nghĩa giúp hiểu rõ hơn về cảm xúc và ý kiến của người dùng. Các công cụ như NLP (Natural Language Processing) có thể được sử dụng để phân tích văn bản và xác định cảm xúc tích cực, tiêu cực hoặc trung tính trong các tweet và bài viết trên mạng xã hội.

IV. Ứng Dụng Thực Tiễn Của Phân Tích Dữ Liệu Đa Nguồn

Phân tích dữ liệu đa nguồn từ mạng xã hội có nhiều ứng dụng thực tiễn trong các lĩnh vực khác nhau. Từ việc hỗ trợ các quyết định chính trị đến cải thiện dịch vụ khách hàng, những thông tin thu được từ phân tích có thể giúp các tổ chức hoạt động hiệu quả hơn.

4.1. Hỗ Trợ Quyết Định Chính Trị

Các nhà hoạch định chính sách có thể sử dụng phân tích dữ liệu từ mạng xã hội để hiểu rõ hơn về ý kiến của công chúng. Điều này giúp họ đưa ra các quyết định phù hợp với nhu cầu và mong muốn của người dân.

4.2. Cải Thiện Dịch Vụ Khách Hàng

Doanh nghiệp có thể sử dụng phân tích dữ liệu để theo dõi phản hồi của khách hàng về sản phẩm và dịch vụ. Việc này giúp họ cải thiện chất lượng dịch vụ và tăng cường sự hài lòng của khách hàng.

V. Kết Luận Về Tương Lai Của Phân Tích Dữ Liệu Đa Nguồn

Phân tích dữ liệu đa nguồn từ mạng xã hội sẽ tiếp tục phát triển và đóng vai trò quan trọng trong nhiều lĩnh vực. Với sự tiến bộ của công nghệ và các phương pháp phân tích, khả năng thu thập và xử lý dữ liệu sẽ ngày càng trở nên mạnh mẽ hơn. Điều này hứa hẹn sẽ mang lại nhiều cơ hội mới cho nghiên cứu và ứng dụng thực tiễn.

5.1. Xu Hướng Phát Triển Công Nghệ

Công nghệ sẽ tiếp tục phát triển, cho phép thu thập và phân tích dữ liệu một cách nhanh chóng và hiệu quả hơn. Các công nghệ mới như trí tuệ nhân tạo và học sâu sẽ mở ra nhiều khả năng mới trong phân tích dữ liệu.

5.2. Tác Động Đến Các Lĩnh Vực Khác Nhau

Phân tích dữ liệu từ mạng xã hội sẽ có tác động lớn đến nhiều lĩnh vực như kinh tế, chính trị và xã hội. Việc hiểu rõ hơn về hành vi và cảm xúc của người dùng sẽ giúp các tổ chức đưa ra các quyết định chính xác hơn.

22/07/2025
Luận văn thạc sĩ vnu phân tích dữ liệu đa nguồn mạng xã hội báo chí liên quan đến tính di động và quá độ năng lượng

Trích đoạn nội dung tài liệu

1 _FEBUS _FEBUS LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com INSTITUT FRANCOPHONE INTERNATIONAL,VNU-IFI Stage Master 2 Informatique, LIUPPA – Equipe T2I Université de Pau et des Pays de l’Adour 2018-2019 Master : Systèmes Intelligents Multimédia - Promo 22 ANALYSE DE DONNÉES MULTI-SOURCES (RÉSEAUX SOCIAUX, JOURNAUX,. )LIÉES AU THÈME « MOBILITÉ ET TRANSITION ÉNERGÉTIQUE» Encadrant(e) : Présenter par : Dr. Marie-Noelle BESSAGNET Hugues KANDA MADIMBA Dr. Christian SALLABERRY Edition Septembre 2019 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Table des matières Introduction 1 1 Présentation de Structure d’accueil et Généralités sur le Twitter 3 1.1 LIUPPA le laboratoire de recherche en informatique de l’UPPA .1 Equipes de recherche .2 Caractéristique d’un tweet .3 Domaines d’applications de l’analyse des sentiments .4 Les collectivités locales .4 Sources des Données .5 Approches de la classification des sentiments.

11 2 État de l’art 12 2.1 Les diverses approches d’analyse de sentiment. 12 i LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com ii Table des matières 2.1 Approche basée sur les lexiques .2 Approche apprentissage de la machine .2 Une approche particulière basée sur le modèle BILSTM. 18 3 Collecte de Données et Pré-traitement 21 3.1 Collecte de Données. 25 4 Analyse des Sentiments : Cas Pratique 27 4.1 Lexique de sentiments .1 Description de l’approche .2 Données d’apprentissage et de test.

30 5 Expérimentations et Résultats 31 5.1 Extraction et présentation des descripteurs .3 Phase de Test et Interprétation .1 Phase de Test et Présentation des résultats .2 Présentation des résultats et discussion .1 Pourcentage par rapport au nombre d’opinions (BHNS) .2 Pourcentage par rapport au nombre d’opinions (Funiculaire) .3 Pourcentage par rapport au nombre d’opinions (VELO) .4 Répartition en % de tweets d’opinion par catégorie .5 Répartition en fonction des polarités des opinions .6 Évaluation de la Répartition de tweets des opinions. 40 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Table des matières iii 5.7 Représentation graphique par rapport au tweet avec opinions .8 Représentation de tweets des opinions sous forme d’une droite .9 Représentation graphique d’opinions(2017-2019) .10 Représentation graphique de polarités(2017-2019) .5 Une Application Web Pour le Workflow .1 Extraction des données .2 Résultat de la Prédiction de la Polarité. 48 Conclusion 49 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Table des figures 1.1 scructure du laboratoire .1 Approches d’analyse de sentiment .2 Exemples d’une base de données lexicales .3 Exemples de la polarité .1 Tweets BHNS_FEBUS .1 Exemples de données labélisées .2 Diagramme d’architecture du système proposé .1 Pourcentage par rapport au nombre d’opinions .2 Pourcentage par rapport au nombre d’opinion Funiculaire .3 Pourcentage par rapport au nombre d’opinion VELO .4 Répartition par rapport au tweet d’opinions par catégorie .5 Répartition par rapport à la polarité des opinions .6 Répartition en % au tweet des opinions .7 Répartition cyclique en % au tweet des opinions .8 Représentation des 3 classes .9 Représentation annuelle des opinions .10 Représentation de polarité en 2017. 43 iv LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Table des figures v 5.11 Représentation de polarité en 2018 .12 Représentation de polarité en 2019 .13 Page d’accueil de notre application .14 Page d’extraction des données .15 Résultat d’extraction de données .16 Résultat d’extraction de données.

48 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Liste des sigles et acronymes LSTM Long Short-Term Memory BiLSTM Bidirectional Long Short-Term Memor NN Neural Network RNN Recurrent neural network vi LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Introduction Au cours des dernières années, il y a eu un énorme engouement dans l’utilisation des plates-formes publiques telles que Twitter. Elle est devenue importante dans les médias sociaux pour traiter des sujets aussi variés que l’activisme politique, le commercial, l’éco- nomique,le sportif, le transport et le divertissement. Elle permet aux utilisateurs d’envoyer et de lire des messages courts de 280 caractères appelés "tweets".Il est également intéres- sant d’analyser le contenu de ces tweets pour aider les entreprises, les collectivités dans les choix de politiques territoriales. Ainsi, l’analyse de l’opinion est le processus de détermi- nation du ton d’émotion derrière une série de mots, utilisés pour comprendre les attitudes, les opinions et les émotions exprimées dans une mention en ligne.

Nous souhaitons faire l’analyse de sentiments dans les tweets. Dans le cadre de notre sujet de recherche, nous souhaitons faire d’une part l’extraction de manière automatique sur la plateforme Twitter d’informations relatives à la mobilité et au transport dans l’ag- glomération de la ville de PAU. Nous souhaitons d’autre part analyser l’opinion émise dans ces tweets. Cette analyse permet de faire des statistiques pour aider les collectivités dans les choix de politiques territoriales.

Cette opinion peut être positive, négative, mixposneg (tweet exprimant en debut de message une opinion positive, puis une opinion négative) ou neutre. De nombreux travaux de recherche s’intéressent à l’analyse des opinions dans des tweets écrits en langue française tels que les travaux de [Davide Buscaldi et al, 2018], [Amine Abdaoui et al, 2015], [Simon Jacques, et al,2018] et [Thierry Hamon et al,2015]. L’auteur [Davide Buscaldi et al, 2018], nous présente a travers cet article trois méthodes originales pour la classification thématique et la détection de polarité dans des tweets en français. La première méthode est fondée sur des lexiques (mots et emojis), les n-grammes de caractères et un classificateur à vaste marge (ou SVM), tandis que les deux autres sont des méthodes endogènes fondées sur l’extraction de caractéristiques au grain caractères : un modèle à mémoire à court-terme persistante (ou BiLSTM pour Bidirectionnal Long Short-Term Memory) et perceptron multi-couche d’une part et un modèle de séquences de caractères fermées fréquentes et classificateur SVM d’autre part.

Sentiment analysis of tweets on transport from Île-de France [Simon Jacques, et al,2018]. L’auteur [Amine Abdaoui et al, 2015] a proposé des méthodes supervisées basées sur les machines à vecteurs de support (SVM) utilisant plusieurs types d’attributs comme les n-grammes de mots, les 1 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 2 Introduction n-grammes de caractères, les patrons syntaxiques les plus fréquents, etc. Puis il a également construit et utilisé des lexiques de sentiments et d’émotions spécifiques pour le français. Analyse des émotions, sentiments et opinions exprimés dans les tweets : présentation et résultats de l’édition 2015 du défi fouille de texte [Thierry Hamon et al,2015] Dans ce document, nous allons nous intéresser aux travaux de recherche reposant sur les techniques de machine learning pour affecter une polarité à un tweet, notamment ceux de [Davide Buscaldi.D et al, 2018] dont nous avons pu utiliser les développements.

L’analyse des sentiments relève de plusieurs disciplines en l’occurrence d’une part du traitement automatique de la langage naturelle (Naturel Langage Processing) et d’autre part de l’apprentissage automatique (Machine Learning). Dans ce mémoire, notre objectif consiste à detailler l’analyse des sentiments en adoptant une approche d’apprentissage automatique. Pour ce faire, nous avons re-implémenté la méthode de D.Buscaldi sur le corpus de tweets de DEFT2018.D et al, 2018] sur notre corpus. Les résultats obtenus en terme de précision, rappel et F1-mesure révèlent que la repré- sentation avec un modèle BILSTM est la plus pertinente pour nos travaux.

Le reste du mémoire est organisé en cinq chapitres : nous consacrons un premier cha- pitre pour présenter des généralités sur le domaine de l’analyse des sentiments en particulier twitter comme source d’opinions. Le second chapitre se focalise sur l’état de l’art de l’ana- lyse des sentiments, notamment les travaux inhérents à l’analyse des sentiments twitter. Notre troisième chapitre sera consacré à la collecte de données et au pré-traitement Quant au quatrième chapitre, il sera concentré sur le processus mis en place pour notre travail. Notre cinquième chapitre présente l’expérimention et les résultats de la méthode BILSTM en considérant les phases d’apprentissage et de test.

Nous concluons avec une synthèse de travail et des perspectives. LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Chapitre 1 Présentation de Structure d’accueil et Généralités sur le Twitter 1.1 LIUPPA le laboratoire de recherche en informatique de l’UPPA Le LIUPPA est le laboratoire de recherche en informatique de l’UPPA. Il adresse au sens large les sciences du Numérique. Son projet de recherche est résolument tourné vers les besoins et enjeux d’une société numérique dans laquelle le Web (Web des objets, réseaux sociaux, etc.), et plus généralement les réseaux, ne cessent de prendre de l’ampleur, dans toutes nos activités quotidiennes.

Cela a un impact direct sur les systèmes informatiques qui deviennent de plus en plus complexes avec : des données (dont la masse ne cesse de croître) hétérogènes, multimédias, et fortement délocalisées (cloud), des traitements distribués et sous-traités, des usagers différents (ma- chines, humains) dont les profils et les besoins diffèrent et évoluent. Dans ce contexte, mêmes les interactions avec et entre ces usagers sont à repenser pour permettre une meilleure communication, et une meilleure collaboration. Les solutions que le LIUPPA se propose d’apporter s’inscrivent dans deux domaines complémentaires : sciences et technologies de l’information autour des traitements de l’information (don- née, document, etc.), de la connaissance, et du web, génie logiciel autour de l’ingénierie des modèles, des services et des architectures logicielles, avec des préoccupations transversales liées à la sécurité, au traitement image/signal et à la visualisation, aux systèmes distribués, et à l’interaction et l’adaptation. La figure qui suit synthétise le propos.

3 LUAN VAN CHAT LUONG download : add luanvanchat@agmail. Présentation de Structure d’accueil et Généralités sur le Twitter Figure 1.1 – scructure du laboratoire Le laboratoire est structuré en 2 équipes : MOVIES : est centrée sur le génie logiciel et la modélisation. S’y greffent les thématiques sécurité et visualisation. T2I : est centrée sur le traitement de l’information et des interactions, basé sur des com- pétences de nature diverse (Système d’Information Géographique, architecture logicielle, réseau de capteurs, image).1 Equipes de recherche Le Laboratoire d’Informatique de l’Université de Pau et des Pays de l’Adour est struc- turé autour de deux équipes de recherche : - MOVIES Modélisation, VIsualisation, Exécution et Simulation dont les thématiques de recherche sont : LUAN VAN CHAT LUONG download : add luanvanchat@agmail.

Généralités 5 génie logiciel, modélisation, simulation ,visualisation et sécurité - T2I Traitement des Informations spatiales, temporelles et thématiques pour l’adaptation de l’Interaction au contexte et à l’utilisateur dont les thématiques de recherche sont : Extraction, indexation et recherche d’informations Architectures logicielles pour l’adap- tation dynamique des applications Modèles et scénarios supportant l’adaptation des inter- actions au contexte et à l’usager Ecosystèmes numériques et communautés d’usage 1.2 Généralités Dans cette section, nous définissons quelques concepts de base importants pour notre travail.1 Twitter Premièrement, nous préciserons sur Twitter ses avantages et sa pertinence pour l’ana- lyse des sentiments. Fondée en 2006, Twitter est une plateforme de médias sociaux en ligne gratuite sur laquelle les utilisateurs peuvent envoyer des messages à la communauté Twitter.[Robin Panfili 18 novembre 2016] Ces messages, également appelés tweets, constituent la base de la plate-forme de médias sociaux. Chaque tweet est limité à un certain nombre de caractères. Avant le 7 novembre 2017, les utilisateurs n’étaient en mesure de tweeter qu’avec un maximum de 140 caractères par tweet.

Toutefois, depuis la mise à jour du 7 novembre 2017, la longueur des messages peut varier de 1 à 280 caractères. En outre, le contenu de ces messages contient des opinions, idées, déclarations, etc. Par conséquent, les tweets peuvent varier selon le sujet, tels que les paroles de chansons, les déclarations politiques, les idées, les opinions sur un sujet particulier, etc. Les tweets diffèrent non seulement par leur contenu, mais les personnes qui les écrivent ont des antécédents différents.

Cela signifie que le public de Twitter varie des présidents aux mécaniciens, des acteurs célèbres aux étudiants en arts du secondaire et des PDG aux propriétaires de magasins. En conséquence, le service de micro-blogging Twitter peut collecter des tweets de personnes issues de différents contextes sociaux, culturels, politique, sportifs et économiques. Ensuite, les utilisateurs représentent également différents pays, ce qui signifie que les données peuvent être collectées dans différentes langues.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ