UNIVERSITE NATIONAL DU VIETNAM, HANOI INSTITUT FRANCOPHONE INTERNATIONAL COULIBALY Adama Human action and detect abnormal behavor from camera Hành vi con người và phát hiện hành vi không bình thường từ camera MÉMOIRE DE FIN D’ÉTUDES DE MASTER EN INFORMATIQUE HANOÏ 2020 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com UNIVERSITE NATIONAL DU VIETNAM, HANOI INSTITUT FRANCOPHONE INTERNATIONAL COULIBALY Adama Human action and detect abnormal behavor from camera Hành vi con người và phát hiện hành vi không bình thường từ camera Spécialité : Système Intelligent et multimédia Code : Programme pilote MÉMOIRE DE FIN D’ÉTUDES DE MASTER EN INFORMATIQUE Sous la direction de : — Dr. Phuc Trong Nguyen, Responsable du laboratoire de recherche et développement de IFI – SOLUTION. Lu et approuvé HANOÏ - 2020 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com ATTESTATION SUR L’HONNEUR J’atteste sur l’honneur que ce mémoire a été réalisé par moi-même et que les données et les résultats qui y sont présentés sont exacts et n’ont jamais été pu- bliés ailleurs. La source des informations citées dans ce mémoire a été bien précisée.
LỜI CAM ĐOAN Tôi cam đoan đây là công trình nghiên cứu của riêng tôi. Các số liệu, kết quả nêu trong Luận văn là trung thực và chưa từng được ai công bố trong bất kỳ công trình nào khác. Các thông tin trích dẫn trong Luận văn đã được chỉ rõ nguồn gốc. Signature de l’étudiant COULIBALY Adama 1 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Remerciement Je souhaite avant tout remercier mon encadreur pédagogique de stage M.
NGUYEN Phan Quang responsable du département de logiciel N1 de IFI SOLUTION, à qui je voudrais témoigner toute ma vive gratitude. Je tiens également à remercier Dr. NGUYEN Trong Phuc et M. NGUYEN Khoi, pour le temps qu’ils ont consa- cré à m’apporter les outils méthodologiques indispensables à la conduite de cette recherche.
Leurs exigence m’ont grandement stimulé. Un grand merci également à toute l’équipe de IFI SOLUTION trop nombreux pour les citer, qui ont participé de prêt comme de loin à la réalisation et validation de ce projet. Ce travail n’aurait pu être accompli sans leur effort et leur contribution passionnées. Je voudrais remercier notre responsable de Master Dr Ho Tuong Vinh ainsi que tous les personnels pédagogiques et administratifs de l’Institut Francophone Inter- national, Université National de Vietnam à Hanoi.
Je leur suis reconnaissant de tout cœur pour avoir assuré et amélioré la qualité de notre formation. En particu- lier, je tiens à exprimer ma profonde gratitude à mes parents, à ma famille pour tout leurs efforts à mon éducation, ma santé et bien d’autre chose que je ne peut toute les énuméré, qui m’ont permit d’être là aujourd’hui. J’aimerais aussi exprimer ma gratitude à M. NGUYEN Quang pour son encadrement et ces conseils lors du module Travaux Personnel Encadré durant le Master 1.
Sans oublier mes amis qui ont toujours été là pour moi. Votre soutien inconditionnel et vos encouragements ont été d’une grande aide. Je vous remercie. 2 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Table des figures 1 Violence detection by 3D convolutional networks in ref.
10 2 Le logo de IFI SOLUTION. 12 3 Exemple de Violences. 13 4 Organigramme général de l’approche proposée. 16 5 Le processus général pour la génération de sacs-de-mots audio-visuels.
17 6 Détection des événements anormaux dans les séquences vidéo. 18 7 Processus de fusion multimodale. 19 8 Archtecture basées sur les trames (changements inter-images). 20 9 Une illustration des descripteurs de mouvement binaires locaux.
21 10 L’encodeur spatio-temporel. 23 11 Présentation d’une cellule BiConvLSTM. 26 12 Schéma du codeur spatial. 27 13 L’architecture à cadre unique.
30 14 L’architecture à cadre multiple. 31 15 L’architecture du modèle Darknet-19. 36 21 Graphe de la précisions du modèle à cadre unique. 40 22 Graphe de la perte du modèle à cadre unique.
40 23 Graphe de la précision du modèle à cadre multiple. 41 24 Graphe de la perte du modèle à cadre multiple. 41 25 Détection de non violence dans la vidéo 01. 42 26 Détection de non violence dans la vidéo 02.
43 27 Détection de violence dans la vidéo 01. 43 28 Détection de violence dans la vidéo 02. 44 29 Violence non détecter dans la vidéo 01. 44 30 L’architecture de la solution.
45 3 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Résumé La sécurité des citoyens dans les environnements urbains modernes est un aspect important de la qualité de la vie. La mise en œuvre d’une approche de la vidéo- surveillance basée sur les villes intelligentes dépend en grande partie de la capacité de collecte et de traitement de grandes quantités de données urbaines en direct. L’analyse des données provenant de flux vidéo de surveillance à bande passante élevée fournis par des réseaux de capteurs distribués de grande taille est particu- lièrement difficile. Le sujet de ce stage s’inscrit dans le contexte de la détection automatique du comportement violent à partir de séquences vidéos de surveillance, qui est une des préoccupations majeures dans le domaine de la vision par ordina- teur.
Les domaines d’application pour les systèmes de vision sont nombreux. On peut citer notamment la vidéo surveillance, la recherche et l’indexation automa- tique de vidéos ou encore l’assistance aux personnes âgées et fragiles. Cette tâche reste très problématique par le fait des grandes variations dans la manière de réa- liser les comportements, l’apparence de la personne et les variations des conditions d’acquisition. Le travail réalisé s’inscrit dans le cadre du projet Bahavior Abnormal Detection (Détection de comportement anormal) et fait usage des méthodes de deep lear- ning de la computer vision sur des vidéos issues des caméras de surveillance.
La première tache à faire était d’étudier le domaine de la détection d’anomalie dans une vidéo de surveillance, de mettre en évidence les différences cas possible, ces relations, sa sollicité dans le monde réel. La seconde tache était de proposer une solution au problème en spécifiant un cas d’application bien définir et qui soit un besoin réel dans notre quotidien. Suite à une étude bibliographique approfondir du domaine, en réponse l’objectif re- chercher, nous optons pour la détection de violence dans une vidéo de surveillance. Pour ce faire, nous avons fait usage de la combinaison de réseaux de neurones convolution (CNN), pour l’aspect spatio-temporel afin d’extraire les caractéris- tiques pertinentes ainsi que du réseau de neurones récurrente (RNN) reconnu pour le traitement séquentiel des données, le but d’améliorer les résultats obtenus.
Le modèle mise en place prend suite à notre spécification de domaine, prend en entrée des vidéos pour les modelés CNN, c’est à dire une séquence d’images ex- traire de la vidéo. Ils sont capables de faire une prédiction avec un bon taux de précision et de reconnaı̂tre les comportements violent effectuées par des personne dans une vidéo. Les actions constituant notre base de vidéos sont de deux catégories (Violence et Non-violence), avec lesquelles nous avons fait différentes expérimentations avec la validation sur l’ensemble de nos deux actions et à l’issu des entraı̂nements nous avons obtenons de bon résultats, mais avec certaines confusion dans certaines ac- tions. 4 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Mots clés : réseaux de neurones convolutionnel ; réseaux de neurones récurrente ; l’apprentissage en profondeur ; vision par ordinateur ; détection de comportement anormale ; détection de la violence ; Villes intelligentes 5 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Abstract Citizen security in modern urban environments is an important aspect of the qua- lity of life.
The implementation of a video surveillance approach based on smart cities largely depends on the capacity to collect and process large quantities of live urban data. Analysis of data from high bandwidth surveillance video streams provided by large distributed sensor networks is particularly difficult. The subject of this internship is in the context of automatic detection of violent behavior from surveillance video sequences, which is one of the major concerns in the field of computer vision. The fields of application for vision systems are numerous.
These include video surveillance, automatic search and indexing video or the elderly and frail assistance. This task remains very problematic because of the great variations in the way behaviors achieving, the person appearance of and the variations in the acquisition conditions. The work carried out is part of the Bahavior Abnormal Detection project and makes use of deep learning methods, computer vision methods on videos from sur- veillance cameras. The first task to do was to study the anomaly detection field in a surveillance video, to highlight the differences cases possible, these relationships, its demand in the real world.
The second task was to propose a solution to the problem by specifying a well defined application case which is a real need in our daily life. Following a thorough bibliographic study of the field, in response to the objective sought, we opt for the violence detection in a surveillance video. About it, we used the combination of convolutional neural networks (CNN), for the spatio-temporal aspect in order to extract the relevant characteristics, as well as the recurrent neu- ral network (RNN) recognized for the sequential data processing, the purpose of improving the results obtained. The model implemented follows our domain speci- fication, takes as input videos for CNN models, ie a sequence of images extracted from the video.
They are able to make a prediction with a good rate of accuracy and to recognize violent behavior carried out by people in a video. The actions constituting our video base are of two categories (Violence and No-violence), with which we have made different experiments with validation on all of our two actions and at the end of the training we have obtained good results , but with certain confusion in certain actions. Keywords : Convolutional neural networks ; recurrent neural networks ; deep learning ; computer vision ; detection of abnormal behavior ; detection of violence ; Smart cities. 6 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Acronymes DL : Deep Learning ; CV : Computer Vision ; CNN : Convolution Neuronal Network ; RNN : Recurrent Neuronal Network ; LSTM : Long short-term memory ; LDA : Latent Dirichlet Allocation ; SVM : Support Vector Machine ; 7 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Table des matières 1 Présentation du projet 12 1.1 Contexte du projet .3 Objectifs du stage.
14 2 État de l’art 15 2.1 Détection de violence : .1 L’approche à l’aide de fonctionnalités de bas niveau .2 L’approches à l’aide du descripteur audio-visuel .3 L’approche heuristique du comportement .4 L’approche basées sur fonctionnalités audio .5 L’approche basées sur les trames .6 L’approche basées sur les points d’intérêt .2 Architecture des modèles de la détection de violences .1 Architecture d’encodage spatio-temporel .2 Architecture du codeur spatial. 26 3 Solutions envisagées et contributions 28 3.1 Base de données .1 Collecte de données .2 Nos jeu de données .1 Les modèles à cadre unique .2 Les modèles à cadre multiple .4 Paramètres du modèle .5 Optimisation des modèles .6 Évaluation de nos modèles. 37 4 Résultats et analyses 38 4.1 Outils et environnement de travail .2 Expérimentation du modèle à cadre unique, Darknet19+3FC 40 4.3 Expérimentation du modèle à cadre multiple, Darknet19+CNN+LSTM 41 4.3 Architecture de la solution. 45 8 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 5 CONCLUSION et PERSPECTIVES 47 5.
48 9 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com INTRODUCTION GÉNÉRALE La surveillance vidéo par réseau de capteurs dans les zones urbaines implique de grandes quantités de petits nœuds capables de la détection vidéo. Une approche possible repose sur un nœud central puissant capable de mettre en œuvre des solutions DL en traitant des flux vidéo collectés à partir des nœuds du réseau.