THESE / UNIVERSITE DE BRETAGNE-SUD sous le sceau de l’Université Bretagne Loire Présentée par pour obtenir le titre de VU Hai Hieu DOCTEUR DE L’UNIVERSITE DE BRETAGNE-SUD Préparée dans l’équipe EXPRESSION Mention : Informatique Laboratoire IRISA Ecole doctorale SICMA Thèse soutenue le 29 janvier 2016 devant le jury composé de : Indexation aléatoire et Pierre-François MARTEAU Professeur, université de Bretagne Sud / directeur de thèse Jeanne VILLANEAU similarité inter-phrases MCF, université de Bretagne Sud / co-directrice de thèse Farida SAÏD appliquées au résumé MCF, université de Bretagne Sud / co-directrice de thèse Sophie ROSSET Chercheuse, LIMSI – CNRS / rapporteuse automatique Emmanuel MORIN Professeur, université de Nantes / rapporteur Gwénolé LECORVÉ MCF, université de Rennes 1 / examinateur UNIVERSITE DE BRETANGE-SUD Résumé IRISA EXPRESSION Docteur en informatique Indexation aléatoire et similarité inter-phrases appliquées au résumé automatique par VU Hai Hieu Face à la masse grandissante des données textuelles présentes sur le Web, le résumé automatique d’une collection de documents traitant d’un sujet particulier est de- venu un champ de recherche important du Traitement Automatique des Langues. Les expérimentations décrites dans cette thèse s’inscrivent dans cette perspec- tive. L’évaluation de la similarité sémantique entre phrases est l’élément central des travaux réalisés. Notre approche repose sur la similarité distributionnelle et une vectorisation des termes qui utilise l’encyclopédie Wikipédia comme corpus de référence.
Sur la base de cette représentation, nous avons proposé, évalué et comparé plusieurs mesures de similarité textuelle ; les données de tests utilisées sont celles du défi SemEval 2014 pour la langue anglaise et des ressources que nous avons construites pour la langue française. Les bonnes performances des mesures proposées nous ont amenés à les utiliser dans une tâche de résumé multi- documents, qui met en oeuvre un algorithme de type PageRank. Le système a été évalué sur les données de DUC 2007 pour l’anglais et le corpus RPM2 pour le français. Les résultats obtenus par cette approche simple, robuste et basée sur une ressource aisément disponible dans de nombreuses langues, se sont avérés très encourageants.
Remerciements Je tiens à remercier, en tout premier lieu, mon directeur et mes co-directeurs de thèse, Monsieur le Professeur Pierre-François MARTEAU, Mesdames Jeanne VIL- LANEAU et Farida SAÏD pour m’avoir accueilli, guidé et mis dans les meilleures conditions pour préparer ma thèse au sein de l’équipe EXPRESSION du Labora- toire IRISA, l’Université de Bretagne-Sud. Je tiens à leur exprimer ma gratitude pour leurs qualités pédagogiques et scientifiques, leur franchise, leur sympathie, leur confiance. J’ai appris beaucoup auprès d’eux. Je leur suis également recon- naissant pour leur écoute, leur partage et leur soutien dans les moments difficiles.
J’ai pris un grand plaisir à travailler sous leur direction. Je voudrais aussi remercier les rapporteurs de cette thèse : Madame Sophie ROS- SET, Directrice de Recherche du Laboratoire LIMSI, CNRS et Monsieur le Pro- fesseur Emmanuel MORIN au Laboratoire d’Informatique de Nantes-Atlantique, l’Université de Nantes pour l’intérêt qu’ils ont porté à mon travail. Mes remerciements s’adressent également à Monsieur Gwénolé LECORVÉ de l’Université de Rennes 1 pour avoir accepté d’examiner mon travail et de par- ticiper au jury. Je souhaite remercier tous les membres du laboratoire IRISA, Lab-STICC, EN- SIBS : les enseignants, techniciens, administratifs et doctorants qui m’ont aidé et accompagné dans mon travail durant ces quatre années en France.
Je n’oublie pas non plus tous les amis de France qui nous ont aidés, ma famille et moi : Brigitte ENQUEHARD, Evelyne BOUDOU, Alain BOUDOU, Lucien MOREL, Gildas TRÉGUIER, Sylvain CAILLIBOT., les étudiants vietnamiens et les familles vietnamiennes de Lorient. Pour terminer, je remercie du fond du cœur mes beaux-parents NONG Quoc Chinh - TRAN Thi Doan, mes parents VU The Huan - LE Thi Nhi et tous les membres de ma famille qui m’ont toujours soutenu, tout au long de ma vie, de mes études, sans lesquels je n’en serais pas là aujourd’hui. Ma reconnaissance va surtout à mon épouse NONG Thi Quynh Tram et à nos deux enfants VU Quynh Maı̈ et VU Haı̈ Minh qui sont toujours à mes côtés et me donnent la force de relever les défis. iii Table des matières Résumé ii Remerciements iii Table des matières iv Liste des figures ix Liste des tableaux xi 1 Introduction 1 2 Représentation sémantique d’un terme 5 2.1 Quelques approches de la sémantique lexicale .1 Modèles graphiques .2 Modèles d’espaces vectoriels et modèles neuronaux .3 Modèles géométriques .4 Modèles logico-algébriques .2 Les espaces vectoriels sémantiques .1 Di↵érentes représentations sémantiques .1 Matrice terme-document et similarité entre docu- ments .2 Matrice mot-contexte et similarité entre mots .3 Matrice paire-patron et similarité relationnelle .4 Autres représentations .2 VSM et types de similarité .3 Traitements mathématiques des VSM .1 Construction de la matrice des fréquences brutes .2 Pondération des fréquences brutes .3 Lissage de la matrice .4 Comparaison des vecteurs .5 Algorithmes aléatoires .4 Notre approche pour la représentation des mots.
29 v Table des matières vi 2.1 Wikipédia comme ressource linguistique .2 Random Indexing pondéré. 32 3 Espace sémantique et sélection automatique des articles Wikipédia 35 3.2 Construction du Web crawler .3 Calcul de la relation entre concepts Wikipédia. 38 4 Calculs de similarité entre phrases 43 4.2 Similarité par définition d’un vecteur sémantique de phrase .1 Expérimentations concernant les groupes de deux termes et modification des pondérations .1 Introduction du paramètre ↵ .2 Introduction de deux paramètres : ↵ et .3 Similarité par optimisation des similarités entre termes. 51 5 WikiRI et similarité entre phrases : évaluations 55 5.1 Évaluations du calcul de similarités entre phrases : langue anglaise .1 Les corpus SemEval .2 Étude des paramètres ↵ et (WikiRI1 ) .1 Introduction du paramètre .3 Résultats obtenus par les di↵érentes versions de WikiRI sur les corpus de SemEval 2014 .2 Évaluations du calcul de similarités entre phrases : langue française 61 5.1 Les corpus d’évaluation .2 Résultats obtenus par les di↵érentes versions de WikiRI sur les corpus de langue française .1 WikiRI sur sélection d’articles .2 Comparaison entre WikiRI1 et WikiRI2.
66 6 Application de WikiRI à une tâche de résumé multi-documents 69 6.1 Principes généraux .2 Description de l’algorithme DivRank .3 Expérimentations en langue française .1 Le corpus de tests .2 Les résultats .4 Expérimentations en langue anglaise .1 Les données de test .2 Les résultats de WikiRI1. 78 7 Bilan et perspectives 79 7.1 Objectifs initiaux et déroulement des travaux. 79 Table des matières vii 7.3 Pistes d’amélioration et perspectives. 81 A Liste des publications 85 Bibliographie 87 Table des figures 2.2 Pondération BM 25 .3 Pondération IDF .4 Normalisation pivot de la longueur des documents .5 Structure en noeud-papillon de Wikipédia .1 Valeur de log nNi+1 +1 en fonction du taux de documents qui contiennent le terme pour di↵érentes valeurs de ↵.2 Logarithme décimal du nombre de termes en fonction de leur taux d’apparition dans les articles du Wikipédia français .3 Logarithme décimal du nombre de termes en fonction de leur taux d’apparition dans les articles du Wikipédia anglais .4 Valeurs de l’icf↵, en fonction du taux de documents qui contiennent le terme pour di↵érentes valeurs de avec ↵ = 3.
64 ix Liste des tableaux 2.1 Quelques pondérations tf, idf et normalisations .1 Les 20 articles les plus proches du concept initial épidémie.2 Les 20 articles les plus proches du concept initial conquête spatiale.1 Paires de termes : icf des termes et score de similarité WikiRI.2 Scores de similarité WikiRI entre paires de termes associés.1 Analyse comparative des di↵érents corpus de tests de SemEval.2 Résultats du système avec di↵érentes valeurs du paramètre .3 Résultats obtenus sur les données de SemEval 2014 : corrélations obtenus par WikiRI comparées aux systèmes participants.4 Résultats obtenus sur les données de SemEval 2014 : inter-classement de WikiRI par rapport aux 38 systèmes participants.5 Comparaison des corpus de tests épidémies et conquête spatiale.6 Les scores de similarité d’une phrase de référence avec ses six phrases associées.7 Les scores de similarité de la phrase de référence de la table 5.6 avec ses six phrases associées.8 Les instructions d’annotation pour le choix du score de similarité entre phrases .9 Les coefficients de corrélation entre les scores de chaque annotateur et la moyenne des scores des six autres.10 Résultats de WikiRI avec sélection d’articles sur les corpus français (WikiRIsel ).11 Résultats comparés de WikiRI1 et WikiRIsel sur les deux corpus en langue française, suivant di↵érentes valeurs du paramètre ↵.12 Résultats comparés des di↵érentes versions de WikiRI sur les corpus en langue française.1 Évaluation Rouge-SU2 du résumé de chaque annotateur en fonc- tion des résumés des trois autres.2 Scores rendus par Rouge-SU2 pour les résumés du corpus RPM2 à partir des similarités rendues par WikiRI1 et WikiRI2 et en utilisant DivRank.3 Données concernant le corpus DUC 2007.4 Résultats du système sur les données DUC 2007. 78 xi Chapitre 1 Introduction Actuellement très présente dans de nombreux domaines du Traitement Auto- matique des Langues (TAL), l’utilisation de modèles vectoriels statistiques pour étudier la sémantique repose sur l’hypothèse de la sémantique statistique, selon la- quelle “the statistical patterns of human word usage can be used to figure out what people mean, at least to a level sufficient for information access” (les modèles sta- tistiques de l’usage qui est fait des mots peuvent être utilisés pour comprendre ce que les gens disent, tout au moins suffisamment pour accéder à l’information) 1. Les travaux qui ont été menés au cours de ce doctorat avaient pour objectif initial la réalisation d’un système de résumé automatique concernant un sujet donné à partir d’un ensemble de textes en langue française. Cet objectif a été e↵ectivement atteint comme le montrent les expérimentations décrites à la fin de ce document (cf.
page 69) ; cependant, l’essentiel des travaux a été consacré à la conception d’un sous-module du système consacré à l’évaluation de la similarité entre phrases. En l’occurrence, il s’est agi de mesurer jusqu’à quel point ces phrases ⌧ parlent de la même chose et relatent les mêmes faits ou actes. Nous avons choisi de référencer ce sous-module sous l’appellation WikiRI en référence aux modèles et ressources, introduites ci-après, sur lesquels il est fondé. La tâche qui consiste à mesurer la similarité entre deux phrases ou textes courts (STS : Semantic Textual Similarity) est utilisée, avec des acceptions du mot même de similarité qui peuvent varier sensiblement, dans plusieurs domaines importants du Traitement Automatique des Langues (TAL), au nombre desquels on peut citer la recherche d’informations (Balasubramanian et al.
[2007]), la catégorisation de 1. Cité par Turney et al. (2010) 1 Chapter 1 Introduction 2 textes (Ko et al. [2002]), le résumé de texte (Erkan and Radev [2004]), la traduction automatique, etc.
Comparer les mots ou n-grammes communs entre deux textes constitue une première approche pour mesurer leur similarité (Hirao et al. Cependant, elle ne tient compte, ni des relations sémantiques entre les mots ou groupes de mots d’un même texte, ni de la similarité sémantique entre mots dis- tincts des deux textes (synonymie, paraphrase, etc. Pour pallier ce manque, le TAL peut s’appuyer sur l’hypothèse distributionnelle avancée par des linguistes tels que Harris [1954] et Firth [1957] selon laquelle les mots qui apparaissent dans des contextes similaires ont potentiellement des significations similaires et “You shall know a word by the company it keeps” (on peut connaı̂tre un mot à partir de ses fréquentations). Ainsi, beaucoup d’approches, comme par exemple LSA (Deer- wester et al.
[1990]), s’appuient sur l’étude statistique de gros corpus de la langue. En analyse distributionnelle, le modèle initial consiste à construire des matrices termes⇥contextes dont les éléments sont une mesure de co-occurrence. Les détails de ces représentations sont décrits dans le chapitre 2. Le système global de résumé automatique de textes que nous voulons construire doit être robuste, générique et aisément portable et il doit être utilisable pour la langue française.
Le choix a donc été fait de faire reposer le système WikiRI sur le modèle vectoriel du Generalized Vector Space Model (GVSM) (Wong et al. [1985]) et d’utiliser l’encyclopédie Wikipédia comme ressource linguistique (cf.