UNIVERSITÉ NATIONALE DU VIETNAM À HANOÏ INSTITUT FRANCOPHONE INTERNATIONAL ADOSSEHOUN Kossi Josue PROPOSER UNE IMPLEMENTATION ET VALIDATION D’UNE IA GENERATIVE POUR LA CREATION DES OBJETS 3D A PARTIR DES DESCRIPTIONS TEXTUELLES DANS LES MODELES GAMA ĐỀ XUẤT MỘT CÁCH TRIỂN KHAI VÀ KIỂM ĐỊNH AI TẠO SINH ĐỂ TẠO RA CÁC ĐỐI TƯỢNG 3D TỪ CÁC MÔ TẢ VĂN BẢN TRONG CÁC MÔ HÌNH GAMA Spécialité : Systèmes Intelligents et Multimédia Code : 8480201.02 MÉMOIRE DE FIN D’ÉTUDE DE MASTER EN INFORMATIQUE HANOÏ-2024 UNIVERSITÉ NATIONALE DU VIETNAM À HANOÏ INSTITUT FRANCOPHONE INTERNATIONAL ADOSSEHOUN Kossi Josue PROPOSER UNE IMPLEMENTATION ET VALIDATION D’UNE IA GENERATIVE POUR LA CREATION DES OBJETS 3D A PARTIR DES DESCRIPTIONS TEXTUELLES DANS LES MODELES GAMA Spécialité : Systèmes Intelligents et Multimédia Code : 8480201.02 MÉMOIRE DE FIN D’ÉTUDE DE MASTER EN INFORMATIQUE Sous la direction de : Alexis Drogoul, Chercheur senior en Informatique, IRD UMMISCO / ACROSS Laboratory, Hanoi Alexis DROGOUL HANOÏ-2024 ATTESTATION SUR L’HONNEUR J’atteste sur l’honneur que ce mémoire a été réalisé par moi-même et que les données et les résultats qui y sont présentés sont exacts et n’ont jamais été publiés ailleurs. La source des informations citées dans ce mémoire a été bien précisée. LỜI CAM ĐOAN Tôi cam đoan đây là công trình nghiên cứu của riêng tôi. Các số liệu, kết quả nêu trong Luận văn là trung thực và chưa từng được ai công bố trong bất kỳ công trình nào khác.
Các thông tin trích dẫn trong Luận văn đã được chỉ rõ nguồn gốc. Signature de l’étudiant ADOSSEHOUN Kossi Josué ADOSSEHOUN Kossi Josue PROPOSER UNE IMPLEMENTATION ET VALIDATION D’UNE IA GENERATIVE POUR LA CREATION DES OBJETS 3D A PARTIR DES DESCRIPTIONS TEXTUELLES DANS LES MODELES GAMA Spécialité : Systèmes Intelligents et Multimédia Code : 8480201.02 MÉMOIRE DE FIN D’ÉTUDE DE MASTER EN INFORMATIQUE Sous la direction de : Alexis Drogoul, Chercheur senior en Informatique, IRD UMMISCO / ACROSS Laboratory, Hanoi HANOÏ-2024 REMERCIEMENTS Je souhaite exprimer ma gratitude la plus profonde envers les personnes qui ont joué un rôle crucial tout au long de la réalisation de ce mémoire et de mon parcours académique. En premier lieu, je tiens à remercier chaleureusement Monsieur Alexis DROGOUL, co- directeur de ACROSS et mon encadrant de stage, pour son encadrement exemplaire, son soutien constant et ses conseils précieux qui ont grandement contribué à mon développement professionnel et personnel durant tout le séjour à ACROSS. Je suis également très reconnaissant envers Messieurs Baptiste Lesquoy, Jean-Daniel Zucker et Aman Berhe pour leurs orientations stratégiques et leur soutien indéfectible qui ont été essentiels à l’avancement de mes recherches.
Un remerciement spécial à Diep Anh PHUNG pour son aide multiforme et à Monsieur Léo BIRE pour sa présence, ses encouragements constants et son écoute attentive tout au long de mon stage. Je voudrais aussi exprimer ma reconnaissance envers l’Institut Francophone International (IFI) de l’Université Nationale du Vietnam à Hanoi. Je remercie particulièrement le corps enseignant pour l’excellence de la formation reçue et le personnel administratif pour leur collaboration efficace et chaleureuse. Je ne saurais oublier de témoigner ma profonde gratitude à ma famille : mes parents, mes frères et sœurs, pour leur soutien moral et financier inébranlable.
Leur amour et leur encouragement ont été les fondations de mes succès. Enfin, je remercie mes amis, particulièrement AGBAM Djibril, DJAHO Guillaume, et Kusiafe Afi Amandine épouse KPODAR, pour leur amitié fidèle et leur soutien continu. Leur présence a enrichi cette aventure académique. À tous, je vous suis infiniment reconnaissant pour tout ce que vous avez apporté dans ma vie.
Dédicace Je dédie ce mémoire à ma mère, AGBEZOUHLON Akoua Antoinette, dont l’amour, le soutien inconditionnel et les sacrifices ont rendu ce voyage possible. Sans elle, rien de ce que j’ai accompli n’aurait été réalisable. Je dédie également ce travail à la mémoire d’un ami cher et regretté, SAKO Kodjo Dieudonné, dont le départ prématuré au cours de ce parcours m’a profondément affecté. Sa mémoire continue d’inspirer et de motiver mon engagement et mes efforts.
À vous deux, avec tout mon amour et ma reconnaissance. Résumé Ce mémoire présente une exploration approfondie de l’intelligence artificielle générative appliquée à la création d’objets 3D à partir de descriptions textuelles. Inséré dans un projet ambitieux de développement d’un jeu sérieux pour l’éducation au développement durable, ce travail utilise les simulations de GAMA combinées à des visualisations immer- sives dans Unity, ciblant des dispositifs de réalité virtuelle comme le Meta Quest 3. Notre approche expérimentale, centrée sur la génération d’objets 3D via des prompts textuels, a été évaluée par des méthodes quantitatives s’appuyant sur les modèles CLIP et des évaluations qualitatives fondées sur la perception humaine.
Les résultats obtenus révèlent que l’association du modèle de diffusion MVDREAM avec le modèle de reconstruction CRM optimise l’utilisation des ressources limitées, réduisant le temps de génération à une moyenne de 20 secondes par objet sous nos dispositifs de test. Ce travail décrit également le développement d’une API qui démocratise l’accès à notre modèle de génération d’ob- jets 3D, conçue pour être intégrée facilement dans des services web avec une interface conviviale. Les perspectives futures envisagent une intégration plus poussée de la simpli- fication des meshes dans nos pipelines et une ouverture accrue de notre technologie à une communauté plus large, augmentant ainsi son impact et son utilité dans des contextes éducatifs et créatifs. Mots-clés : Intelligence Artificielle Générative, Modèles de Diffusion, Reconstruction 3D, GAMA, Unity, Visualisation Immersive.
Abstract This thesis delves into the application of generative artificial intelligence for creating 3D objects from textual descriptions within the framework of a serious game aimed at sustain- able development education. Utilizing GAMA simulations and immersive visualizations in Unity suitable for virtual reality devices like the Meta Quest 3, our experimental approach involved generating 3D objects from textual prompts. These were rigorously evaluated using quantitative analyses based on CLIP models and qualitative evaluations through human perception. The findings demonstrate that integrating the MVDREAM diffusion model with the CRM reconstruction model maximizes efficiency with limited resources, significantly reducing the average generation time to 20 seconds per object under our resources.
Additionally, this thesis outlines the development of an API that enhances ac- cessibility to our 3D object generation model, tailored to be user-friendly and integrable into web services. Looking forward, we envision further embedding mesh simplification directly into our pipelines and broadening the reach of our technology to foster creativity and learning in diverse communities. Keywords: Generative Artificial Intelligence, Diffusion Models, 3D Reconstruction, GAMA, Unity, Immersive Visualization. Table des matières 1 Analyse du sujet 1 1.3 Problématique et objectifs .1 Exploitation des données images 2D .1 Principes Fondamentaux des Modèles de Diffusion .1 le processus de diffusion ou processus direct .2 le processus de diffusion inverse .3 Entrainement du modèle de diffusion .5 Génération d’images : diffusion guidée .2 Les modèles de diffusion 2D pour la reconstruction 3D utilisant le score distillation sampling .2 3D Priors pour la Reconstruction 3D .3 Approches à inférence directe pour la reconstruction 3D.
20 3 Solutions proposées et plan de travail 22 3.1 Génération d’Images 2D à Partir de Descriptions Textuelles : Fine-tuning de Stable Diffusion .1 Objectif, Difficultés rencontrées et solution proposée .3 Finetuning avec Diffusers .2 Reconstruction 3D à partir des images 2D .1 Avantages de l’Adoption de Modèles Pré-entraînés .2 Choix du modèle de reconstruction .3 Architecture de la solution proposée prompt à asset 3D .4 Simplification de maillage .3 Définition de la matrice Q .5 Outils et technologies utilisés. 33 4 Expérimentation et analyse des résultats 34 4.2 Configuration de l’expérimentation .1 Environnement de test .2 Description des datasets utilisés .4 Présentation des résultats .1 Comparaison empirique des résultats de finetuning au modèle stan- dard de Stable Diffusion .1 Résultats visuels obtenus .2 Comparaison de temps de génération moyen d’image .2 Génération des objets 3D à partir des prompts .1 Démonstration des pipelines via Gradio .2 Temps de Génération des Pipelines .3 Résultat de la simplification de mesh des modèles 3D générés.1 Évaluation de l’alignement de l’objet 3D avec le prompt .2 Évaluation de la cohérence géométrique. 51 5 Intégration du meilleur pipeline pour la création d’un service web 53 5.2 Implémentation de l’API .1 Endpoints de l’API .2 Gestion des données .3 Cas d’utilisation de l’API pour la Génération d’Objets 3D .1 Pour tous les développeurs : Exemple de cas python .2 Pour les développeurs Unity : Exemple de cas de C# sous Unity. 59 6 Conclusions et perspectives 61 6.
62 A Analyse du sujet 64 A. 64 B Expérimentation et analyse des résultats 67 B.1 Configuration de l’expérimentation .1 Description des datasets utilisés .2 Présentation des résultats .1 Génération des objets 3D à partir des prompts .1 Démonstration des pipelines via Gradio. 72 i Table des figures 1.1 Architecture du projet SIMPLE .1 Forward diffusion process. Image modified by Ho, Jain et Abbeel 2020 .2 Échantillons latents provenant de programmations linéaire (en haut) et cosinus (en bas), respectivement.
Nichol et Dhariwal 2021 9 2. Image modifiée de l’article Ho, Jain et Abbeel 2020 .4 Architecture UN etsource : Ronneberger, FischerEtBrox2015 .1 Image générée par Stable Diffusion .2 Image générée par Stable Diffusion avec prompt engineering .3 Méthode de CRM Z. Wang et al.4 Méthode de CRM Z. Wang et al.5 Méthode de LRM Hong et al.
2023 sur laquelle est basé Triposr .6 Architecture des pipelines .1 Image générée par le modèle standard .2 Image générée par le modèle finetuné .3 Image générée par le modèle standard .4 Image générée par le modèle finetuné .5 Image générée par le modèle standard .6 Image générée par le modèle finetuné .7 Image 1 à occlusion générée par Stable Diffusion finetuné .8 Image 2 à occlusion générée par Stable Diffusion finetuné .9 Interface Gradio du pipeline Stable Diffusion et TripoSR avec le prompt "A kangoroo with yellow Jacket".10 Interface Gradio du pipeline Stable Diffusion finetuné et tripoSR avec le prompt "A kangoroo".11 Processus de simplification de maillage 3D d’un ours en peluche. À gauche, le prompt initial ; au centre, le modèle 3D généré ; à droite, le résultat après simplification du maillage.12 Distribution des scores moyens par groupe de pipeline.13 Nombre de fois que chaque pipeline est classé premier par groupe d’objet .14 La page évaluation du site web.15 Les dossiers représentés .16 Le nombre de fois que les dossiers à été évolué .17 Analyse inter-dossiers des meilleurs pipelines .18 Analyse inter-dossiers des pires pipelines .1 test en postman de l’API .1 Interface Gradio du pipeline texte à image de MVDream et TripoSR avec le prompt "A kangoroo".2 Interface Gradio du pipeline texte à image de MVDream et CRM avec le prompt "A kangoroo".3 Interface Gradio du pipeline texte à image de Stable Diffusion et CRM avec le prompt "A kangoroo".4 Ensemble de 12 images pour l’objet 3D généré par le prompt "A cactus with pink flowers" .5 Ensemble de 12 images pour l’objet 3D généré par le prompt "An antique wooden rocking horse" .6 Ensemble de 12 images pour l’objet 3D généré par le prompt "A plush teddy bear with a satin bow". 75 iii Liste des tableaux 3.1 Comparaison des Performances des Modèles de Reconstruction 3D sur Notre Machine de Laboratoire .1 Comparaison des temps de génération moyen pour différents modèles de génération d’images.2 Temps de génération moyens pour chaque pipeline de génération d’objets 3D 41 4.3 Évaluation des scores pour divers pipelines de génération d’images, résultat de l’en tête du fichier .4 Comparaison des performances des pipelines de génération d’objets 3D.5 Présentation d’une partie des données d’évaluations des GIFs par pipeline .6 Le DataFrame révisé .7 Résumé des métriques d’évaluation pour chaque meilleur pipeline .8 Résumé des métriques d’évaluation pour chaque pire pipeline. 50 iv Acronymes AR Augmented Reality.
2, 18 CCM canonical coordinates maps. 27 DL Deep Learning. 7 IA Intelligence Artificielle. 1, 2 IAG Intelligence Artificielle Générative.
1, 2, 5, 22 ML Machine Learning. 22 MLP perceptrons multicouches. 15, 27 NERFs champs de radiance neuronaux. 15, 16, 18–20, 28, 32 NGP Instant Neural Graphics Primitives.