Workflows scientifiques sur plusieurs clouds Mémoire de fin d’études Stage effectué à l’ENS de Lyon Laboratoire de l’Informatique du Parallélisme (LIP) pour l’obtention du diplôme de Master Informatique option Système et Réseaux Par DAO Van Toan dvtoan@ifi.vn van-toan.dao@ens-lyon.fr Encadrants : Frédéric DESPREZ (INRIA - Avalon) frederic.fr Jonathan ROUZAUD-CORNABAS (CNRS - CC-IN2P3/LIP - Avalon) jonathan.rouzaud-cornabas@ens-lyon.fr Lyon, Novembre 2013 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Remerciements Je tiens à remercier tous ceux qui m’ont aidé à la réalisation de ce travail. Mes premiers remerciements vont à mes encadrants Fédéric DESPREZ et Jonathan ROUZAUD-CORNABAS à l’École Normale Supérieure de Lyon pour m’avoir donné de nombreux conseils ainsi que des orientations importantes dans l’approche académique et scientifique. J’ai obtenu des connaissances inestimables et de très bonnes compétences dans le domaine de la recherche. De plus, j’aimerais remercier Laurent LEFEVRE qui a présenté ce stage sur son site.
J’aimerais remercier tous les membres de l’équipe AVALON du LIP, pour leur amitié et leur soutien. Je tiens à remercier ensuite tout le personnel et enseignants de l’Institut de la Fran- cophonie pour l’Informatique (IFI) à Hanoi pour leur conseil et le suivi qu’ils m’ont accordé pendant mes études de master. Je tiens également à remercier mes camarades étudiants de l’IFI avec qui j’ai passé de bons moments pendant les périodes de stress et des cours. J’aimerais remercier mes amis de Lyon.
J’adresse un merci particulier à toute ma famille qui malgré la distance n’a cessé de me prêter main forte. LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Résumé Les calculs scientifiques sont compliqués et les données manipulées sont très grandes alors ils nécessitent un grand ensemble de ressources de calcul et de stockage ainsi qu’une méthode pour les utiliser efficacement. La technique dite workflow scientifique est devenue l’un des principaux choix dans la communauté scientifique pour formaliser et structurer les calculs scientifiques. Le but premier du workflow scientifique est de maximiser la performance.
De plus, le concept de cloud computing amène une nouvelle dimension dans la technologie de l’information, grâce à ses avantages, on peut augmen- ter les ressources disponibles avec celles provenent de clouds privés et publiques. De plus, le cloud privé peut facilement renforcer sa performance en tirant parti des clouds publiques, hybride cloud computing. Les workflows ont tout intérêt à tirer parti des environnements multi-clouds. Dans ce rapport, nous nous intéressons aux algorithmes d’ordonnancement pour les workflows scientifiques dans les environnements multi-clouds de type IaaS pour maximi- ser leurs performances d’exécution tout en minimisant son coût et son temps d’exécution.
Pour cela, nous proposons notre solution qui se compose de 3 phases : découpage d’un graphe en sous-graphes (cutting-graph), faire l’allocation des ressources, faire l’ordon- nancement des tâches et des données. Après, notre proposition est validé via simulateur grâce à SimGrid Cloud Broker du projet ANR INFRA SONGS 1 qui a été construit pour simuler Amazon Web Service 2. Les résultats expérimentaux montrent une corrélation entre le temps d’exécution, la distribution des tâches dans des clusters et le coût du workflow, révélant ainsi la néces- sité d’algorithmes qui s’adaptent aux demandes de l’utilisateur. Mots-clés : Le cloud computing, le modèle IaaS, l’environnement multi-clouds, le workflow scientifique, l’algorithme d’ordonnancement, le coût et le makespan, SimGrid Cloud Broker, le simulateur Amazon Web Service.
http ://infra-songs.com/fr/ LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Abstract The scientific applications are complex and manipulated very large datasets. So they require a large set of computing resources and storage as well as a method to use them effectively. The scientific workflow technique has become one of the main choice in the scientific community to formalize and structure scientific computations. The main goal of scientific workflow is to maximize performance.
Furthermore, the cloud computing is a new dimension in the information of technology, thank to its advantages, you can increase the available resources with those coming from private and public cloud compu- ting. In addition, the private cloud computing can easily enhance its performance or its infrastructure through the public cloud computing, hybrid cloud computing. Scientific workflows must take adavantage of multi-clouds environment. In this report, we focus on the scheduling algorithms for the scientific workflows in the IaaS multi-clouds environments to maximize runtime performance while minimizing its costs and execution time.
For this, we propose our solution consists of three phases : cutting a graph into subgraphs, resource provisioning, task allocation. Finally, our pro- posal is validated via the simulator with SimGrid Cloud Broker of the project ANR INFRA SONGS that was built to simulate Amazon Web Service. Experimental results show a correlation between the execution time, the distribution of the tasks in the clusters and the cost of workflow, revealing that algorithms needs to adapt to user’s requirements. Key-words : The cloud computing, the model IaaS, the multi-clouds environment, the scientific workflow, the scheduling algorithm, the cost and the performance, SimGrid Cloud Broker, the simulator Amazon Web Service.
LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Table des matières 1 INTRODUCTION 5 1.2 Objectifs et Domaines d’application .3 Structure du document .4 Présentation de l’environnement de travail. 7 2 LE CLOUD COMPUTING ET LE WORKFLOW SCIENTIFIQUE 8 2.1 LE CLOUD COMPUTING .2 LE WORKFLOW SCIENTIFIQUE .3 SGCB : Simulation d’environnement multi-Clouds avec SimGrid. 15 3 DES ALGORITHMES D’ORDONNANCEMENT DES TÂCHES DU WORKFLOW 16 4 SOLUTION ET RÉLIASATION PRATIQUE 21 4.1 LA SOLUTION PROPOSÉE .2 LE TRAVAIL PRATIQUE. 29 5 EXPÉRIMENTATIONS ET ANALYSES DES RÉSULTATS 31 6 CONCLUSION 39 A La taille de données dans un cluster 44 B Des autres expérimentations 46 1 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Table des figures 2.1 La convergence des avantages du cloud computing.2 Les types de cloud computing.3 Des structures simples du workflow.4 Un workflow simple par DAG.5 Des types de découpage des tâches dans le workflow.6 L’architecture du broker de cloud SIMGRID.1 Un exemple des workflows dans plusieurs clouds.1 Des étapes de l’algorithme de l’ordonnancement dans mon étude.2 Un processus avec des étapes de faire l’ordonnancement.3 Le workflow Montage.4 Le workflow Epigenomics.5 Le workflow Inspiral.1 La distribution des tâches dans des clusters avec Inspiral.2 La distribution des tâches dans des clusters avec Montage.3 La distribution des tâches dans des clusters avec Epigenomics.4 Le prix total, le temps total d’exécution et ratio entre eux du Montage 25 35 5.5 Le prix total, le temps total d’exécution et ratio entre eux du Inspiral 30 36 5.6 Le prix total, le temps total d’exécution et ratio entre eux du Epigenomics 24 .1 La taille de données dans des clusters avec Inspiral.2 La taille de données dans des clusters avec Montage.3 La taille de données dans des clusters avec Epigenomics.1 Le prix total, le temps d’exécution et ratio entre eux du Montage 50 .2 Le prix total, le temps d’exécution et ratio entre eux du Inspiral 50 .3 Le prix total, le temps d’exécution et ratio entre eux du Epigenomics 46 .4 Le prix total, le temps d’exécution et ratio entre eux du Montage 100 .5 Le prix total, le temps d’exécution et ratio entre eux du Inspiral 100.
47 2 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com DAO Van Toan, Promotion 16, Réseaux et Systèmes Communicants, IFI.6 Le prix total, le temps d’exécution et ratio entre eux du Epigenomics 100 47 B.7 Le prix total, le temps d’exécution et ratio entre eux du Montage 1000 .8 Le prix total, le temps d’exécution et ratio entre eux du Inspiral 1000 .9 Le prix total, le temps d’exécution et ratio entre eux du Epigenomics 997 48 3 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Liste des tableaux 2.1 Types de VMs du cloud computing .1 Étude des algorithmes de l’ordonnancement du workflow .2 Une comparaison des algorithmes en basant sur les facteurs différents .1 La relation entre le numéro de clusters et le temps d’exécution. 31 4 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Chapitre 1 INTRODUCTION 1.1 Motivations Dans la réalité, les organismes scientifiques ont besoin d’un système informatique pour exécuter leurs calculs, leurs applications scientifiques et stocker leurs données et ceci dans un grand nombre de domaine scientifique comme : l’astronomie, la bioinforma- tique, la génétique, la physique, la physique nucléaire, etc. Ces calculs et ces applications sont très grands, s’exécutent de manière concurrente et peuvent tirer parti des ressources fournies par les clouds. Pour cela, il y a plusieurs solutions pour construire un environ- nement multi-cloud : – Construire un nouveau système ou reconstruire sur un système existant (le cloud privé a été construit localement en utilisant un logiciel ouvert comme : OpenStack, OpenNebula, Eucalyptus, StratusLab, etc.
– Si l’organisme scientifique a un propre cloud privé, il est alors possible de créer une liaison avec des autres organismes scientifiques, ayant également des clouds privés (federated cloud) ou une combinaison de plusieurs cloud publics (cloud hybrid ). – Utiliser directement plusieurs cloud publics via un logiciel ou une interface com- mune entre eux. Le workflow scientifique est une méthode pour formaliser et structurer les calculs scientifiques. Le but du workflow scientifique est de maximiser la performance, un budget minimale, la sécurité, etc.
Pour le moment, il n’est pas aisé d’utiliser ces workflows dans le cadre du cloud computing, en particulierement dans l’environnement multi-clouds alors qu’ils ont tout intérêt à en tirer parti.2 Objectifs et Domaines d’application L’objectif du stage est d’étudier des algorithmes d’ordonnancement pour les work- flows scientifiques dans les environnements multi-clouds de type IaaS. Nous proposons 5 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com DAO Van Toan, Promotion 16, Réseaux et Systèmes Communicants, IFI. des algorithmes qui sont meilleurs selon différents objectifs comme maximiser la per- formance, minimiser le coût et minimiser le temps d’exécution, etc. et ainsi que nous présentons notre solution.
Les workflows scientifiques sont utilisés dans un grand nombre de projets qui tra- vaillent sur des grands ensembles de données comme : Montage, Epigenomics, LHC Atlas, etc. Dans ce rapport, nous proposons des algorithmes d’ordonnancement pour les workflows dans un environnement multi-clouds pour maximiser la performance, minimi- ser le coût et le temps d’exécution, etc. C’est-à-dire, nous présentons des solutions pour améliorer l’exécution de calculs scientifiques qui nécessitent un grand emsemble avec de ressources qui proviennent d’un environnement dynamique et distribué comme le cloud computing.3 Structure du document Le contenu du rapport se compose de 6 chapitres : – Dans le premier, nous présentons brièvement notre sujet et notre motivation. – Le chapitre 2 présente un état de l’art des travaux en liaison avec notre travail.
Tout d’abord, ce rapport revient sur les définitions du cloud computing, un cloud computing IaaS et hybride, le workflow scientifique et ses problèmes comme la structure, ses caractéristiques, le système de gestion du workflow. De plus, nous présenterons des stratégies pour découper un workflow. Enfin, nous présentons brièvement l’outil de simulation, SIMGRID Cloud Broker (SGCB). – Dans le chapitre 3, nous présenterons une recherche bibliographique contenant une synthèse et une analyse critique combinée des algorithmes d’ordonnancement optimiser pour l’utilisation des clouds par les workflows scientifiques.
Ce rapport présente les algorithmes existants et leurs paramètres particuliés (répondre au problème du temps, du coût, de la performance, etc). – Après, dans le chapitre 4, nous donnons un modèle des étapes de notre algorithme et une considération des stratégies et des algorithmes qui peuvent utiliser pour chacune des étapes. – Ensuite, le chapitre 5, nous introduisons notre extension à SGCB pour supporter les workflows scientifiques. Puis, nous présentons l’expérimentation et donnons notre analyse des résultats.
– Enfin dans la dernière partie du rapport, le chapitre 6, nous résumerons les points faibles et forts de notre algorithmes et concluons notre étude. 6 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com DAO Van Toan, Promotion 16, Réseaux et Systèmes Communicants, IFI.4 Présentation de l’environnement de travail Mon stage de fin d’études de Master a été effectué à l’Ecole Normale Supérieure de Lyon (ENS de Lyon) sous encadrants M. Fédéric DESPREZ et M.