UNIVERSITÉ NATIONALE DU VIETNAM, HANOI INSTITUT FRANCOPHONE INTERNATIONAL Application du traitement de langages naturels à la vérification de fiabilité des nouvelles Shilove CELICOURT MÉMOIRE DE FIN D’ÉTUDES DE MASTER EN INFORMATIQUE Spécialité : Système Intelligent et Multimédias HANOI - 21 septembre 2023 UNIVERSITÉ NATIONALE DU VIETNAM, HANOI INSTITUT FRANCOPHONE INTERNATIONAL Shilove CELICOURT Application du traitement de langages naturels à la vérification de fiabilité des nouvelles Spécialité : Système Intelligent et Multimédias MÉMOIRE DE FIN D’ÉTUDES DE MASTER EN INFORMATIQUE HANOI - 21 septembre 2023 ATTESTATION SUR L’HONNEUR Je certifie sur l’honneur que ce mémoire a été rédigé par moi-même, les données Les résultats présentés sont exacts et n’ont pas été rendus publics ailleurs. Les sources d’informations citées dans ce mémoire sont clairement identifiées. Signature de l’étudiant Shilove CELICOURT REMERCIEMENT Tout d’abord, je veux remercier DIEU pour tout ce qu’il a fait pour moi car sans lui rien de tout cela ne serait possible.Je voudrais remercier le responsable du Master Dr. H Tng Vinh, qui est également mon maitre du stage pour son encadrement, ses remarques pertinentes, ses conseils sur la rédaction de mon rapport.Je souhaite ensuite adresser mes remerciements au corps professoral et administratif de l’IFI, pour la qualité de l’enseignement offert et le soutien de l’équipe administrative.
Un grand merci à ma mère, ma grande sœur,et Peterson Bertelot pour leurs conseils, ainsi que pour leur soutien inconditionnel, à la fois moral et économique me permettant préserver et de brûler cette étape.Je saisis également cette occasion pour adresser mes profonds remerciements aux responsables de l’institut de financement FOKAL qui m’ont apporté un soutien sans faille. Shilove CELICOURT 2 Résumé En raison de la grande accessibilité à l’internet, les gens recherchent et consomment des in- formations via les médias sociaux en raison de leur faible coût, de leur facilité d’accès et de la transmission rapide des informations. Cependant, le coût devient cher et dangereux lorsque des non-experts disent n’importe quoi. Ce projet de recherche s’inscrit dans le cadre du problématique de la vérification des fiabili- tés de fausses nouvelles.
L’objectif est de proposer un modèle qui permettera aux lecteurs de vérifier la véracité des nouvelles qu’ils lisent. Notre travail implique de trouver une méthode de classification en nous fondant sur plusieurs approches permettant de bien classer les vraies et les fausses nouvelles. Pour cela, nous avons donc développé une solution à deux phases dont la première consiste à classifier la véracité des nouvelles (fausses ou vraies), et la seconde phase s’occupe de la vérifi- cation de fiabilité de la source d’nformation. Pour ce faire, nous avons appliqué des techniques de traitement de langagage naturel.
Nous avons évalué les performances de nos modèles LSTM et GRU à l’aide d’une métrique de précision, de rappel et de F1-score sur la prédiction de la vérification des fausses nouvelles. Les résultats montrent que les modèles LSTM et GRU à une couche ont une précision de pré- diction élevée (0,988 et 0,987 respectivement), et que l’empilement de couches n’a pas d’impact significatif sur la précision de prédiction. Les modèles à deux couches ont donné des résultats presque identiques aux modèles monocouches. Finalement, nous avons été capables de construire un prototype.
MOTS-CLÉS : Traitement du langage naturel - Vérification des faits et de fia- bilités - Scraping - Fausses nouvelles - Transformateurs - Classification - Évaluation automatique - Apprentissage en profondeur 3 Abstract Due to the wide accessibility of the internet, people seek and consume information via social media because of its low cost, ease of access, and rapid transmission of information. However, the cost becomes expensive and dangerous when non-experts say anything. This research project is part of the problem of verifying the reliability of fake news. The goal is to propose a model that will allow readers to verify the veracity of the news they read.
Our work involves finding a classification method based on several approaches to properly classify real and fake news. For this purpose, we have developed a two-phase solution, the first of which consists in clas- sifying the veracity of the news (false or true), and the second phase deals with the verification of the reliability of the source of information. To do this, we applied natural language processing techniques. We evaluated the performance of our LSTM and GRU models using a precision, recall and F1-score metric on the prediction of fake news verification.
The results show that the single- layer LSTM and GRU models have high prediction accuracy (0.987, respectively), and that stacking layers does not have a significant impact on prediction accuracy. The two-layer models performed almost identically to the single-layer models. Finally, we were able to build a prototype. Keywords : Natural Language Processing - Fact and Reliability Checking - Scra- ping - Fake News - Transformers - Classification - Automatic Evaluation - Deep Learning 4 Table des matières 1 Contexte et problématique 10 1.3 Structure du mémoire.
11 2 Vérification de Fiabilité des Nouvelles : Sans recourir à la techonologie de NLP 12 2.1 Comment peut-on reconnaître la qualité d’une information et discerner le vrai du faux ? .2 Quelle définition donner au terme information ? .3 Quelles sont les différents types d’informations ? .2 Théories du complot .4 Information biaisée ou unilatérale .4 Quelles sont les différents types d’acteurs d’informations ? .2 Activistes et organisations politiques .5 Comment reconnaître les fausses informations ? .1 Avoir un esprit critique .2 Vérifier la source d’information .3 Consultez d’autres reportages concernant l’histoire .4 Vérifier les preuves .5 Titre de l’article .6 Vérifiez qui est l’auteur de l’article .7 Vérifier la date de la publication .8 Vérifier les images .9 Vérifier la qualité du texte .10 Employer la logique et la réflexion critique. 17 3 L’état de l’art sur l’application de traitement de langage naturel pour la véri- fication des faussses nouvelles 18 3.2 Définition donnée au terme fausses nouvelles .1 Sur quelles techniques repose le natural language processing (NLP) ? .2 Comment détecter les fausses nouvelles en utilisant de le NLP (Natural language processing) ? .1 Analyse de sentiment .2 Analyse des mots clés .4 Analyse de la syntaxe .5 Analyse du contenu .3 Quelques approches utilisées pour détecter et vérifier les fausses nouvelles 20 3.1 Approche basée sur la propagation .2 Approche basée sur le style .3 Approche basée sur la source .4 Approche basée sur la distance de mots .5 Approche bidirectionnelle et non directionnelle pour l’encodage de sé- quences de mots .6 Approche basée sur la recherche soutenant les méthodes d’identification des fausses nouvelles .7 Tableau récapitulatif des différentes approches .4 Différentes techniques utilisées pour effectuer une vérification à l’aide du NLP .1 Vérification humaine non-participative .2 Vérification humaine participative .4 Fausses nouvelles sur les médias d’informations traditionnels .5 Fausses nouvelles sur sur les réseaux sociaux .5 Méthode de vérification des fausses nouvelles en applicant la NLP .1 La vérification basée sur l’expertise(FactChecking) .2 Source de vérification d’information .3 Cas des sources anonymes .4 Toute source a ses limites .6 Vérification des fausses nouvelles : les meilleurs outils à utiliser .1 Vérification d’une image .2 Vérification d’une vidéo .8 Synthèse et discusions des travaux connexes. 32 4 Méthodologie de l’Application du NLP à la Vérification de Fiabilité 36 4.3 Outils et Méthode appliqués .4 Prétraitement des données .5 Caractéristiques Contextuelles et Statistiques : Des Clés pour la Vérification de la Fiabilité des Nouvelles .4 Méthodologie pour l’apprentissage. 41 5 Éxpérimantations,Évaluation, Résultats et Discussions 42 5.2 Présentation des données .1 Description détaillée des ensembles de données .2 Préparation des données .3 Nettoyage des Données pour la Vérification de Fiabilité des Nouvelles .1 Étapes de Nettoyage des Données .2 Résultats du Nettoyage .1 Combinaison de données .5 Étapes de nos expériences sur l’ensemble d’apprentissage .1 Combinaison de la répétition de la procédure avec la division des données en ensembles d’entraînement et de test .6 Paramètres expérimentaux montrent combien d’arbres dans la forêt aléatoire .1 Tableau montrant la Précision de détection des classificateurs individuels en s’appuyant sur des caractéristiques statistiques .2 Tableau montrant la Précision de détection des classificateurs individuels en s’appuyant sur des caractéristiques contextuelle .3 Comparaison de précision entre les performances statistiques et contextuelles 50 5.4 Amélioration de la Précision avec des Modèles d’Apprentissage en profon- deur LSTM et GRU .5 L’expérience avec le modèle BERT .7 Étape de la vérifcation .8 Architecture et déploiement .9 Comparaison de la précision de la prédiction de la classification avec les études antérieures utilisées avec ISOT FAKENEWS .10 Limitations de notre cadre proposé .1 Prédiction des vrais nouvelles .2 Prédiction des fausses nouvelles.
59 6 Conclusion et perspectives 63 6. 63 References 64 7 Table des figures 2.1 capture d’écran depuis le site des Décodeurs .2 outils en ligne de vérification des faits (fact-checking) .1 La présentation de notre de jeux de données contenant des vraies informations .2 La présentation de notre de jeux de données contenant des fausses informations .3 Arbres de decision .4 Diagramme des classificateurs individuels pour la classification des fausses nouvelles en s’appuyant sur des caractéristiques statistiques .5 Diagramme des classificateurs individuels pour la classification des fausses nouvelles en s’appuyant sur des caractéristiques contextuelle.6 Diagramme de comparaison de précision entre les performances statistiques et contextuelles.7 Performance des modèles LSTM et GRU à l’aide de caractéristiques statistiques.8 Diagramme de précision de formation et de test du modèle BERT .9 L’architecture technique avec trois étapes .10 Verification d’un article avec des sources fiables. 54 8 Liste des tableaux 3.1 Tableau récapitulatif des différentes approches .2 Synthèse des méthodes sur la détection des fausses nouvelles .1 Description du jeu de données .2 Description des colonnes de nos trois jeu de données .3 Précision des classificateurs individuels pour la classification des fausses nouvelles en s’appuyant sur des caractéristiques statistiques.4 Précision des classificateurs individuels pour la classification des fausses nouvelles en s’appuyant sur des caractéristiques contextuelle.5 Précision de détection des modèles de fausses nouvelles LSTM et GRU à l’aide de fonctionnalités statistiques .6 Modèles LSTM et GRU.7 Précision du modèle BERT.8 Comparaison de précision les modèles LSTM et GRU. 55 9 Chapitre 1 Contexte et problématique La présence de fausses informations sur internet est une nuisance importante, générant une "pollution informationnelle".
Afin de ne pas être trompé par ces fausses nouvelles, il est crucial de comprendre les différents types de désinformation et les raisons qui motivent leur diffusion. La vérification des faits est un moyen efficace d’enquêter sur des affirmations précises, mais il est également important de savoir évaluer la crédibilité de l’information en général. Pour ce faire, il est nécessaire de faire preuve d’esprit critique et de scepticisme sain. Cependant, il est important de ne pas rejeter toutes les informations sans discernement, car cela pourrait nuire à notre capacité à être des citoyens informés.
Ainsi, il est crucial d’être en mesure d’évaluer la crédibilité des informations que nous rencontrons. À cette fin, il est nécessaire de donner aux individus les moyens d’évaluer les fausses nouvelles et de mettre en place des changements structurels qui empêchent leur diffusion. Pour atteindre cet objectif, il est proposé d’utiliser une méthodologie d’apprentissage profond de pointe, plutôt que de se fier uniquement aux stratégies d’intervention basées sur l’apprentissage automatique. De plus, la stratégie la plus durable pour lutter contre l’impact des fausses nouvelles est de donner aux individus les moyens d’évaluer ces informations.
Pour ce faire, il est suggéré d’évaluer le contenu avec des preuves provenant de sources d’information fiables qui soutiennent les hypothèses des articles. La décision finale est laissée à l’utilisateur, ce qui contribue à améliorer l’acceptation car aucune censure réelle n’a lieu. En somme, en combinant une approche basée sur la vérification des faits et des changements structurels avec des outils efficaces pour évaluer la crédibilité de l’information, nous pouvons nous protéger contre la désinformation et faire des choix éclairés.1 Objectif global Notre projet a pour but de créer un modèle qui permettra aux lecteurs de vérifier la véracité des nouvelles qu’ils lisent.