UNIVERSITÉ NATIONALE DU VIETNAM, HANOÏ INSTITUT FRANCOPHONE INTERNATIONAL NITCHEU MONKAM JUNIOR CONSTRUCTION DˆUN MODELE IA POUR OPTIMISER LA DESIDENTIFICATION DES RAPPORTS MEDICAUX XAY DUNG MOT MO HINH TRI TUE NHAN TAO DE TOI UU HOA VIỆC LOẠI BO THONG TIN ĐỊNH DANH TRONG CAC BAO CAO Y KHOA MEMOIRE DE FIN D’ETUDES EN MASTER INFORMATIQUE HANOI - 2024 UNIVERSITÉ NATIONALE DU VIETNAM, HANOÏ INSTITUT FRANCOPHONE INTERNATIONAL NITCHEU MONKAM JUNIOR CONSTRUCTION D’UN MODELE IA POUR OPTIMISER LA DESIDENTIFICATION DES RAPPORTS MEDICAUX XAY DUNG MOT MO HINH TRI TUE NHAN TAO DE TOI UU HOA VIEC LOAI BO THONG TIN DINH DANH TRONG CAC BAO CAO Y KHOA Spécialité : Systemes Intelligents et Multimédia Code : Programme Pilote MEMOIRE DE FIN D’ETUDES EN MASTER INFORMATIQUE Dr Tai Duy Nguyen, CTO a T&T, Société à responsabilité limité Software Engineering Manager a Segmed LEE HANOI - 2024 ATTESTATION SUR LˆHONNEUR Jˆatteste sur ’honneur que ce mémoire a été réalisé par moi-méme et que les données et les résultats qui y sont présentés sont exacts et n’ont jamais été publiés ailleurs. La source des informations citées dans ce mémoire a été bien précisée. LOI CAM DOAN Tôi cam đoan đây là công trình nghiên cứu của riêng tôi. Các số liệu, kết qua nêu trong Luận văn là trung thực và chưa từng được ai công bố trong bat kỳ công trình nào khác.
Các thông tin trích dẫn trong Luận văn đã được chỉ rõ nguôn sốc. Signature de Pétudiant 49 NITCHEU MONKAM JUNIOR Auteur : Junior NITCHEU 3 Table des figures FIGURE 2-1: HISTORIQUE DE DEVELOPPEMENT DES METHODES DE DE- IDENTIFICATION CONFORMEMENT A LA HIPAA [14].--------<<<<5 10 FIGURE 2-2: ARCHITECTURE DEEP LEARNING [12] .--- <5 «=5 5+ ++++<<<s<<<s++2 13 FIGURE 2-3: ARCHITECTURE DU MODELE NEURONER [8] .------------ --- 17 FIGURE 2-4: APPROCHE HYBRIDE DE NER [16]|.----- 2-5555 <<<<‡<<<>ss<<e=s2 20 FIGURE 2-5: ARCHITECTURE FINALE AVEC SPACY.ccccccssssscesesseceeesseeecesseeseessaeees 22 FIGURE 2-6: LES PRINCIPAUX COMPOSANTS DU CODE DE L'API CHATGPT ET LES ETAPES IMPLIQUEES DANS LA GENERATION D'UN EXEMPLE ANONYMISE [14]. FIGURE 2-7:PROCESSUS D’ ANONYMISATION DES NOTES CLINIQUES A L'AIDE DE L'API CHATGPT [14]. 24 FIGURE 2-8: MODELE OPTIMAL DE PROMPT CONCU POUR LA DE-IDENTIFICATION 25 FIGURE 2-9:RESULTATS DE LA DE-IDENTIFICATION DES NOTES CLINIQUES AVEC LES LLMs (MODELES DE LANGAGE DE GRANDE TAILLE) [ 14].---- --- 25 FIGURE 2-10:PRESENTATION DE 4 EXEMPLES DE PROMPT MAL CONCUS.
27 FIGURE 3-1: STRUCTURE DU DATA-SET GENERE .ccssccessscessseeesecesecesseeesseeesaees 31 FIGURE 3-2: FLUX DE TRAITEMENT DES DONNEES .::ccessscessseeesseeesecesseeesseeessees 32 FIGURE 3-3: ARCHITECTURE SOLUTION SPACY + DICTIONNAIRE.- + 38 FIGURE 4-1 ETAPE DE CREATION D'UNE CLE API GEMINI.- 55 << <<++<5 54 FIGURE 4-2 RECUPERATION UNE CLE API DEPUIS UNE VARIABLE IĐĐN4I:(9))))9))/)506020 TT :£ŸỔỔỔ. 55 FIGURE 4-3 GESTION DES PARAMETRES DE DE-IDENTIFICATION ET DE- IDENTIFICATION AVEC GEMINI.cccccccsssscesessecesesseccessseeesesseeceesseecesssaeseessaeees 57 FIGURE 4-4 TEXTES DESIDENTIFIE AVEC FINE TUNING DE SPACY+DICTIONNAIRE+RULE BSED. 60 FIGURE 4-5 TEXTE DEDIDENTIFIE AVEC GEMINI 1.-- --«5++ +5 62 FIGURE 4-6 TEMPS DE REPONSE DE SPACY+DICTIONNAIRE+RULES BASED. 65 FIGURE 4-7 TEMPS DE REPONSE DE LA METHODE AVEC GEMINI 1.
65 Auteur : Junior NITCHEU 9 Remerciements Mes remerciements vont a lendroit d’un ensemble de personnes exceptionnelles sans qui la réalisation de ce mémoire n’aurait pas été possible. Qu’ elles trouvent ici l’expression de mes plus sincéres remerciements. Tout d’abord, je tiens à exprimer ma reconnaissance et mes remerciements envers 1’ AUF (Agence Universitaire Francophone) de m’avoir accordé une bourse d’études de Master dans un pays aussi merveilleux que le Vietnam. Je profite également de cette occasion pour remercier le personnel administratif de IFI qui nous a montré son professionnalisme dans certaines situations difficiles que nous avons traversé car notre promotion a subi de plein fouet les difficultés liées a la pandémie de la COVID19.
Je tiens également a manifester ma profonde gratitude et mon admiration a l'endroit de mes encadreurs et plus particulièrement 4 Dr Tuong Vinh HO qui a pu trouver quelques minutes de son temps précieux pour me donner quelques pistes de recherche importantes pour ce projet. En tant que responsable de notre formation, il a été un pilier important dans notre formation a travers non seulement des cours qu’il nous a transmis, mais aussi des conseils qu’il nous prodiguait a l'ensemble de notre promotion et 4 chaque étudiant individuellement. Je n’oublierai surtout pas de remercier le Docteur Simo Rodrigue Willy, médecin a l'Organisation Internationale pour les Migrations (OIM) du Vietnam a Hanoi qui m’a assisté lors de la création d’un data-set fictif pour ce projet. Enfin, je remercie grandement mes parents pour leur soutien sans faille et mes promotionnaires de cette formation a IFI, avec qui j’ai passé des moments inoubliables.
NITCHEU MONKAM JUNIOR Auteur : Junior NITCHEU 4 Résumé La dé-identification des données médicales est essentielle pour garantir la confidentialité des patients tout en permettant l'utilisation de ces données dans des recherches médicales et des applications innovantes. Ce mémoire explore diverses approches pour la dé-identification des rapports médicaux dans un contexte spécifique au Cameroun, un pays représentant une niche de données sous- exploitées. Apres avoir présenté l'état de l'art sur les méthodes existantes, nous avons développé des approches adaptées aux données camerounaises en utilisant des outils comme SpaCy comportant des modẻles tels que “en_core_web_lg” et “en_core_web_sm’’. Notre méthodologie a inclus la génération d'un data-set fictif reflétant les réalités locales et des techniques de fine-tuning appliquées sur nos données fictives au préalable annotées afin d’adapter les modéles aux entités spécifiques du contexte camerounais.
Nous avons utilisé des dictionnaires spécifiques qui ont été associé a des fine-tuning de modèles de Spacy dans le but améliorer la de-identification les valeurs complexes de certaines entités. Nous avons exploré la dé-identification avec des modèles avancés de LLM tel que Gemini 1. Les résultats montrent que les approches combinant SpaCy et des dictionnaires offrent une précision robuste et abordable. Toutefois, le modèle Gemini 1.5 Flash se distingue par ses performances exceptionnelles, atteignant un F1-Score moyen de 98,42 %.
Malgré son cott élevé, cette solution est idéale pour des taches nécessitant une précision critique. Ce mémoire met en lumiére les défis et opportunités liés a la dé-identification des données médicales dans un contexte africain, en posant les bases pour des recherches futures visant a développer des solutions adaptées a la diversité linguistique et culturelle locale. Mots clés : Dé-identification, données médicales, Cameroun, SpaCy, Gemini 1.5 Flash, intelligence artificielle, confidentialité. Auteur : Junior NITCHEU 5 Liste des Tableaux TABLEAU 2-1: RECAPITULATIF DES METHODES UTILISÉES DANS L'ETAT DE L’ ART.
TABLEAU 2-2: RESULTATS DE CHAQUE LABEL PHI PRESENT DANS LE JEU DE. 18 TABLEAU 3-1: COMPARAISON DES DIFFERENTES VERSIONS DE GOOGLE GEMINI. 45 TABLEAU 4-1: COMPARAISON ENTRE GEMINI 1.5 FLASH ET GEMINI 1. 52 TABLEAU 4-2: RESULTATS DES PERFORMANCES DE DE-IDENTIFICATION AVEC SPACY EN MODE ZERO SHOT.c:ccccsssssecseseceseseceessneeceseseesessseeeeeesseeeensaeees 59 TABLEAU 4-3: RESULTATS DES PERFORMANCES DE DE-IDENTIFICATION AVEC FINE- TUNING ET COMBINAISON AVEC UN DICTIONNAIRE.----«<+<++<+ 60 TABLEAU 4-4: RESULTATS DES PERFORMANCES DE DE-IDENTIFICATION AVEC 20000850.
61 TABLEAU 4-5: COMPARAISON DES RESULTATS DES PERFORMANCES DES IMJ33)):35)605589) 0540195507277. 63 TABLEAU 4-6 COMPARAISON DES TEMPS DE REPONSES DES DEUX PRINCIPALES \/39/995522777. 65 Auteur : Junior NITCHEU 10 2.4 INGENIERIE DES PROMPTS DANS LES METHODES BASEES SUR LES LLM.1 Rôle des prompts dans la đé-idenfifiCdfiOH.2 Conception dS POMPE .3 Avantages de l’ingénierie des PrOMPES. SG HH, 27 3 SOLUTION PROPOSEE ET CONTRIBUTION.1 GENERATION D’UN DATA-SET FICTIF RESPECTANT LE CONTEXTE CAMEROUNAIS.- 0G SH Họ TT và 29 3.1 Elément a prendre en compte pour générer le data-set.2 Constitution đụ AAta-Set .2 PRESENTATION DES TECHNIQUES UTILISEES .1 Présentation de SPAcy .2 Utilisation des dictionnaires pour les taches de dé-identification.
Combinaison de Spacy et du dictionnaire pour une meilleure dé- UAENTIPICATION.escccccessececenssceesssseeesesseeeseseeesssseeesesueeseseeecssessesseesaessseaesessagess 35 4 EXPERIMENTATION ET EVALUATION DES RÉSULTATS.1 DE-IDENTIFICATION AVEC SPACY ET UN DICTIONNAIRE.2 DE-IDENTIFICATION AVEC UN DICTIONNAIRE.2 Combinaison Spdcy et đÏCHOHHIT€.ằằàecSS cà sssseessees 50 4.- G- G1 nTH TH TH n nnrh 51 4.1 Choix de la version de Google Gemini pour la de-identification.2 De-identification avec Gemini 1.4 EVALUATION DES RESULTATS .1 Métriques d'évaluation et procède đévalÌuafiOH. Comparaison des différentes méthodes ufIÏiSéêS.3 Comparaison des temps de FẾDOHS€S. e5 55+ 64 5 CONCLUSION ET PERSPECTIVIES. G1 TH TH Tu TH TH HH ngà ó6 5.
Ăn TT HH 67 Auteur : Junior NITCHEU 8 Remerciements Mes remerciements vont a lendroit d’un ensemble de personnes exceptionnelles sans qui la réalisation de ce mémoire n’aurait pas été possible. Qu’ elles trouvent ici l’expression de mes plus sincéres remerciements. Tout d’abord, je tiens à exprimer ma reconnaissance et mes remerciements envers 1’ AUF (Agence Universitaire Francophone) de m’avoir accordé une bourse d’études de Master dans un pays aussi merveilleux que le Vietnam. Je profite également de cette occasion pour remercier le personnel administratif de IFI qui nous a montré son professionnalisme dans certaines situations difficiles que nous avons traversé car notre promotion a subi de plein fouet les difficultés liées a la pandémie de la COVID19.
Je tiens également a manifester ma profonde gratitude et mon admiration a l'endroit de mes encadreurs et plus particulièrement 4 Dr Tuong Vinh HO qui a pu trouver quelques minutes de son temps précieux pour me donner quelques pistes de recherche importantes pour ce projet. En tant que responsable de notre formation, il a été un pilier important dans notre formation a travers non seulement des cours qu’il nous a transmis, mais aussi des conseils qu’il nous prodiguait a l'ensemble de notre promotion et 4 chaque étudiant individuellement. Je n’oublierai surtout pas de remercier le Docteur Simo Rodrigue Willy, médecin a l'Organisation Internationale pour les Migrations (OIM) du Vietnam a Hanoi qui m’a assisté lors de la création d’un data-set fictif pour ce projet. Enfin, je remercie grandement mes parents pour leur soutien sans faille et mes promotionnaires de cette formation a IFI, avec qui j’ai passé des moments inoubliables.
NITCHEU MONKAM JUNIOR Auteur : Junior NITCHEU 4 Abstract The de-identification of medical data is essential to ensure patient confidentiality while allowing the use of such data for medical research and innovative applications. This thesis explores various approaches to the de- identification of medical reports in a context specific to Cameroon, a country representing an underexploited data niche. After presenting the state-of-the-art on existing methods, we developed approaches adapted to Cameroonian data using tools like SpaCy with models such as “encore web lơ” and “en_core_web_sm”. Our methodology included generating a synthetic data-set reflecting local realities and applying fine-tuning techniques to our pre-annotated fictitious data in order to adapt the models to the specific entities of the Cameroonian context.
We also utilized specific dictionaries, which were combined with the fine-tuning of SpaCy models to improve the de- identification of complex entity values. Additionally, we explored de- identification using advanced LLM models such as Gemini 1. The results show that approaches combining SpaCy and dictionaries offer robust and cost-effective accuracy. However, the Gemini 1.5 Flash model stands out for its exceptional performance, achieving an average Fl-Score of 98.
Despite its high cost, this solution is ideal for tasks requiring critical precision. This thesis highlights the challenges and opportunities related to the de- identification of medical data in an African context, laying the groundwork for future research aimed at developing solutions tailored to local linguistic and cultural diversity. Keywords: De-identification, medical data, Cameroon, SpaCy, Gemini 1.5 Flash, artificial intelligence, confidentiality. Auteur : Junior NITCHEU 6 Table des figures FIGURE 2-1: HISTORIQUE DE DEVELOPPEMENT DES METHODES DE DE- IDENTIFICATION CONFORMEMENT A LA HIPAA [14].--------<<<<5 10 FIGURE 2-2: ARCHITECTURE DEEP LEARNING [12] .--- <5 «=5 5+ ++++<<<s<<<s++2 13 FIGURE 2-3: ARCHITECTURE DU MODELE NEURONER [8] .------------ --- 17 FIGURE 2-4: APPROCHE HYBRIDE DE NER [16]|.----- 2-5555 <<<<‡<<<>ss<<e=s2 20 FIGURE 2-5: ARCHITECTURE FINALE AVEC SPACY.ccccccssssscesesseceeesseeecesseeseessaeees 22 FIGURE 2-6: LES PRINCIPAUX COMPOSANTS DU CODE DE L'API CHATGPT ET LES ETAPES IMPLIQUEES DANS LA GENERATION D'UN EXEMPLE ANONYMISE [14].
FIGURE 2-7:PROCESSUS D’ ANONYMISATION DES NOTES CLINIQUES A L'AIDE DE L'API CHATGPT [14]. 24 FIGURE 2-8: MODELE OPTIMAL DE PROMPT CONCU POUR LA DE-IDENTIFICATION 25 FIGURE 2-9:RESULTATS DE LA DE-IDENTIFICATION DES NOTES CLINIQUES AVEC LES LLMs (MODELES DE LANGAGE DE GRANDE TAILLE) [ 14].---- --- 25 FIGURE 2-10:PRESENTATION DE 4 EXEMPLES DE PROMPT MAL CONCUS.