Luận văn thạc sĩ: Phát hiện hành vi bất thường từ camera tại VNU

Luận văn thạc sĩ VNU nghiên cứu hành vi con người và phát hiện hành vi không bình thường từ camera, ứng dụng trong an ninh và giám sát.

Chuyên ngành

Informatique

Người đăng

Ẩn danh

Thể loại

Luận văn thạc sĩ

2020

54
2
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CAM ĐOAN

1. CHƯƠNG 1: PRÉSENTATION DU PROJET

1.1. Contexte du projet

1.2. Problématique

1.3. Objectifs du stage

2. CHƯƠNG 2: ÉTAT DE L’ART

2.1. Détection de violence

2.1.1. L’approche à l’aide de fonctionnalités de bas niveau

2.1.2. L’approches à l’aide du descripteur audio-visuel

2.1.3. L’approche heuristique du comportement

2.1.4. L’approche basées sur fonctionnalités audio

2.1.5. L’approche basées sur les trames

2.1.6. L’approche basées sur les points d’intérêt

2.2. Architecture des modèles de la détection de violences

2.2.1. Architecture d’encodage spatio-temporel

2.2.2. Architecture du codeur spatial

3. CHƯƠNG 3: SOLUTIONS ENVISAGÉES ET CONTRIBUTIONS

3.1. Base de données

3.1.1. Collecte de données

3.1.2. Nos jeu de données

3.2. Les modèles à cadre unique

3.3. Les modèles à cadre multiple

3.4. Paramètres du modèle

3.5. Optimisation des modèles

3.6. Évaluation de nos modèles

4. CHƯƠNG 4: RÉSULTATS ET ANALYSES

4.1. Outils et environnement de travail

4.2. Expérimentation du modèle à cadre unique, Darknet19+3FC

4.3. Expérimentation du modèle à cadre multiple, Darknet19+CNN+LSTM

4.4. Architecture de la solution

5. CHƯƠNG 5: CONCLUSION ET PERSPECTIVES

Tóm tắt

I. Tổng quan về phát hiện hành vi bất thường từ camera giám sát

Phát hiện hành vi bất thường từ camera giám sát là một lĩnh vực nghiên cứu quan trọng trong công nghệ an ninh thông minh. Nghiên cứu này không chỉ giúp nâng cao an toàn công cộng mà còn tối ưu hóa việc sử dụng công nghệ AI trong việc phân tích video. Hệ thống nhận diện hành vi từ camera có khả năng phát hiện các hành vi không bình thường, từ đó cảnh báo kịp thời cho các cơ quan chức năng.

1.1. Tầm quan trọng của camera giám sát trong an ninh

Camera giám sát đóng vai trò quan trọng trong việc bảo vệ an ninh công cộng. Chúng giúp theo dõi và ghi lại các hoạt động trong không gian công cộng, từ đó cung cấp dữ liệu cho việc phân tích hành vi. Việc phát hiện hành vi bất thường từ camera giúp ngăn chặn các sự cố trước khi chúng xảy ra.

1.2. Công nghệ AI trong phát hiện hành vi bất thường

Công nghệ AI, đặc biệt là machine learning, đã được áp dụng rộng rãi trong việc phân tích video từ camera giám sát. Các thuật toán học sâu giúp nhận diện và phân loại các hành vi, từ đó phát hiện các hành vi bất thường một cách chính xác và nhanh chóng.

II. Thách thức trong việc phát hiện hành vi bất thường từ camera

Mặc dù công nghệ phát hiện hành vi bất thường từ camera đã có những bước tiến đáng kể, nhưng vẫn còn nhiều thách thức cần phải vượt qua. Các yếu tố như điều kiện ánh sáng, góc quay và sự đa dạng trong hành vi con người đều ảnh hưởng đến độ chính xác của hệ thống.

2.1. Độ chính xác trong việc nhận diện hành vi

Một trong những thách thức lớn nhất là đảm bảo độ chính xác trong việc nhận diện hành vi. Các hành vi tương tự nhau có thể gây nhầm lẫn cho hệ thống, dẫn đến việc phát hiện sai hoặc bỏ sót hành vi bất thường.

2.2. Tác động của điều kiện môi trường

Điều kiện môi trường như ánh sáng yếu, thời tiết xấu hay sự thay đổi trong bối cảnh có thể làm giảm hiệu suất của hệ thống phát hiện hành vi. Việc phát triển các thuật toán có khả năng hoạt động tốt trong nhiều điều kiện khác nhau là rất cần thiết.

III. Phương pháp phát hiện hành vi bất thường hiệu quả

Để phát hiện hành vi bất thường từ camera, nhiều phương pháp đã được nghiên cứu và áp dụng. Các phương pháp này thường sử dụng các thuật toán học sâu để phân tích video và nhận diện hành vi.

3.1. Sử dụng mạng nơ ron tích chập CNN

Mạng nơ-ron tích chập (CNN) là một trong những phương pháp phổ biến nhất trong việc phân tích video. CNN có khả năng tự động trích xuất các đặc trưng từ hình ảnh, giúp nhận diện hành vi một cách hiệu quả.

3.2. Kết hợp CNN và RNN trong phân tích video

Việc kết hợp mạng nơ-ron tích chập (CNN) với mạng nơ-ron hồi tiếp (RNN) giúp cải thiện khả năng nhận diện hành vi theo thời gian. RNN có khả năng xử lý dữ liệu tuần tự, từ đó giúp nhận diện các hành vi phức tạp hơn.

IV. Ứng dụng thực tiễn của phát hiện hành vi bất thường

Phát hiện hành vi bất thường từ camera không chỉ có ứng dụng trong lĩnh vực an ninh mà còn trong nhiều lĩnh vực khác như giao thông, y tế và quản lý đô thị. Các hệ thống này giúp cải thiện chất lượng cuộc sống và an toàn cho cộng đồng.

4.1. Ứng dụng trong an ninh công cộng

Hệ thống phát hiện hành vi bất thường từ camera giúp cảnh báo kịp thời cho các cơ quan chức năng về các sự cố có thể xảy ra, từ đó nâng cao hiệu quả trong việc bảo vệ an ninh công cộng.

4.2. Ứng dụng trong giao thông thông minh

Trong lĩnh vực giao thông, công nghệ này giúp phát hiện các hành vi lái xe nguy hiểm, từ đó giảm thiểu tai nạn và cải thiện an toàn giao thông.

V. Kết luận và tương lai của phát hiện hành vi bất thường

Phát hiện hành vi bất thường từ camera là một lĩnh vực đang phát triển mạnh mẽ với nhiều tiềm năng ứng dụng. Tương lai của công nghệ này hứa hẹn sẽ mang lại nhiều giải pháp an ninh hiệu quả hơn cho xã hội.

5.1. Xu hướng phát triển công nghệ

Công nghệ phát hiện hành vi bất thường sẽ tiếp tục phát triển với sự hỗ trợ của các thuật toán học sâu và AI. Điều này sẽ giúp cải thiện độ chính xác và khả năng nhận diện hành vi phức tạp hơn.

5.2. Tác động đến xã hội

Việc áp dụng công nghệ phát hiện hành vi bất thường sẽ góp phần nâng cao chất lượng cuộc sống và an toàn cho cộng đồng, đồng thời tạo ra một môi trường sống an toàn hơn cho mọi người.

22/07/2025
Luận văn thạc sĩ vnu human action and detect abnormal behavor from camera hành vi con người và phát hiện hành vi không bình thường từ camera

Trích đoạn nội dung tài liệu

UNIVERSITE NATIONAL DU VIETNAM, HANOI INSTITUT FRANCOPHONE INTERNATIONAL COULIBALY Adama Human action and detect abnormal behavor from camera Hành vi con người và phát hiện hành vi không bình thường từ camera MÉMOIRE DE FIN D’ÉTUDES DE MASTER EN INFORMATIQUE HANOÏ 2020 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com UNIVERSITE NATIONAL DU VIETNAM, HANOI INSTITUT FRANCOPHONE INTERNATIONAL COULIBALY Adama Human action and detect abnormal behavor from camera Hành vi con người và phát hiện hành vi không bình thường từ camera Spécialité : Système Intelligent et multimédia Code : Programme pilote MÉMOIRE DE FIN D’ÉTUDES DE MASTER EN INFORMATIQUE Sous la direction de : — Dr. Phuc Trong Nguyen, Responsable du laboratoire de recherche et développement de IFI – SOLUTION. Lu et approuvé HANOÏ - 2020 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com ATTESTATION SUR L’HONNEUR J’atteste sur l’honneur que ce mémoire a été réalisé par moi-même et que les données et les résultats qui y sont présentés sont exacts et n’ont jamais été pu- bliés ailleurs. La source des informations citées dans ce mémoire a été bien précisée.

LỜI CAM ĐOAN Tôi cam đoan đây là công trình nghiên cứu của riêng tôi. Các số liệu, kết quả nêu trong Luận văn là trung thực và chưa từng được ai công bố trong bất kỳ công trình nào khác. Các thông tin trích dẫn trong Luận văn đã được chỉ rõ nguồn gốc. Signature de l’étudiant COULIBALY Adama 1 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Remerciement Je souhaite avant tout remercier mon encadreur pédagogique de stage M.

NGUYEN Phan Quang responsable du département de logiciel N1 de IFI SOLUTION, à qui je voudrais témoigner toute ma vive gratitude. Je tiens également à remercier Dr. NGUYEN Trong Phuc et M. NGUYEN Khoi, pour le temps qu’ils ont consa- cré à m’apporter les outils méthodologiques indispensables à la conduite de cette recherche.

Leurs exigence m’ont grandement stimulé. Un grand merci également à toute l’équipe de IFI SOLUTION trop nombreux pour les citer, qui ont participé de prêt comme de loin à la réalisation et validation de ce projet. Ce travail n’aurait pu être accompli sans leur effort et leur contribution passionnées. Je voudrais remercier notre responsable de Master Dr Ho Tuong Vinh ainsi que tous les personnels pédagogiques et administratifs de l’Institut Francophone Inter- national, Université National de Vietnam à Hanoi.

Je leur suis reconnaissant de tout cœur pour avoir assuré et amélioré la qualité de notre formation. En particu- lier, je tiens à exprimer ma profonde gratitude à mes parents, à ma famille pour tout leurs efforts à mon éducation, ma santé et bien d’autre chose que je ne peut toute les énuméré, qui m’ont permit d’être là aujourd’hui. J’aimerais aussi exprimer ma gratitude à M. NGUYEN Quang pour son encadrement et ces conseils lors du module Travaux Personnel Encadré durant le Master 1.

Sans oublier mes amis qui ont toujours été là pour moi. Votre soutien inconditionnel et vos encouragements ont été d’une grande aide. Je vous remercie. 2 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Table des figures 1 Violence detection by 3D convolutional networks in ref.

10 2 Le logo de IFI SOLUTION. 12 3 Exemple de Violences. 13 4 Organigramme général de l’approche proposée. 16 5 Le processus général pour la génération de sacs-de-mots audio-visuels.

17 6 Détection des événements anormaux dans les séquences vidéo. 18 7 Processus de fusion multimodale. 19 8 Archtecture basées sur les trames (changements inter-images). 20 9 Une illustration des descripteurs de mouvement binaires locaux.

21 10 L’encodeur spatio-temporel. 23 11 Présentation d’une cellule BiConvLSTM. 26 12 Schéma du codeur spatial. 27 13 L’architecture à cadre unique.

30 14 L’architecture à cadre multiple. 31 15 L’architecture du modèle Darknet-19. 36 21 Graphe de la précisions du modèle à cadre unique. 40 22 Graphe de la perte du modèle à cadre unique.

40 23 Graphe de la précision du modèle à cadre multiple. 41 24 Graphe de la perte du modèle à cadre multiple. 41 25 Détection de non violence dans la vidéo 01. 42 26 Détection de non violence dans la vidéo 02.

43 27 Détection de violence dans la vidéo 01. 43 28 Détection de violence dans la vidéo 02. 44 29 Violence non détecter dans la vidéo 01. 44 30 L’architecture de la solution.

45 3 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Résumé La sécurité des citoyens dans les environnements urbains modernes est un aspect important de la qualité de la vie. La mise en œuvre d’une approche de la vidéo- surveillance basée sur les villes intelligentes dépend en grande partie de la capacité de collecte et de traitement de grandes quantités de données urbaines en direct. L’analyse des données provenant de flux vidéo de surveillance à bande passante élevée fournis par des réseaux de capteurs distribués de grande taille est particu- lièrement difficile. Le sujet de ce stage s’inscrit dans le contexte de la détection automatique du comportement violent à partir de séquences vidéos de surveillance, qui est une des préoccupations majeures dans le domaine de la vision par ordina- teur.

Les domaines d’application pour les systèmes de vision sont nombreux. On peut citer notamment la vidéo surveillance, la recherche et l’indexation automa- tique de vidéos ou encore l’assistance aux personnes âgées et fragiles. Cette tâche reste très problématique par le fait des grandes variations dans la manière de réa- liser les comportements, l’apparence de la personne et les variations des conditions d’acquisition. Le travail réalisé s’inscrit dans le cadre du projet Bahavior Abnormal Detection (Détection de comportement anormal) et fait usage des méthodes de deep lear- ning de la computer vision sur des vidéos issues des caméras de surveillance.

La première tache à faire était d’étudier le domaine de la détection d’anomalie dans une vidéo de surveillance, de mettre en évidence les différences cas possible, ces relations, sa sollicité dans le monde réel. La seconde tache était de proposer une solution au problème en spécifiant un cas d’application bien définir et qui soit un besoin réel dans notre quotidien. Suite à une étude bibliographique approfondir du domaine, en réponse l’objectif re- chercher, nous optons pour la détection de violence dans une vidéo de surveillance. Pour ce faire, nous avons fait usage de la combinaison de réseaux de neurones convolution (CNN), pour l’aspect spatio-temporel afin d’extraire les caractéris- tiques pertinentes ainsi que du réseau de neurones récurrente (RNN) reconnu pour le traitement séquentiel des données, le but d’améliorer les résultats obtenus.

Le modèle mise en place prend suite à notre spécification de domaine, prend en entrée des vidéos pour les modelés CNN, c’est à dire une séquence d’images ex- traire de la vidéo. Ils sont capables de faire une prédiction avec un bon taux de précision et de reconnaı̂tre les comportements violent effectuées par des personne dans une vidéo. Les actions constituant notre base de vidéos sont de deux catégories (Violence et Non-violence), avec lesquelles nous avons fait différentes expérimentations avec la validation sur l’ensemble de nos deux actions et à l’issu des entraı̂nements nous avons obtenons de bon résultats, mais avec certaines confusion dans certaines ac- tions. 4 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Mots clés : réseaux de neurones convolutionnel ; réseaux de neurones récurrente ; l’apprentissage en profondeur ; vision par ordinateur ; détection de comportement anormale ; détection de la violence ; Villes intelligentes 5 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Abstract Citizen security in modern urban environments is an important aspect of the qua- lity of life.

The implementation of a video surveillance approach based on smart cities largely depends on the capacity to collect and process large quantities of live urban data. Analysis of data from high bandwidth surveillance video streams provided by large distributed sensor networks is particularly difficult. The subject of this internship is in the context of automatic detection of violent behavior from surveillance video sequences, which is one of the major concerns in the field of computer vision. The fields of application for vision systems are numerous.

These include video surveillance, automatic search and indexing video or the elderly and frail assistance. This task remains very problematic because of the great variations in the way behaviors achieving, the person appearance of and the variations in the acquisition conditions. The work carried out is part of the Bahavior Abnormal Detection project and makes use of deep learning methods, computer vision methods on videos from sur- veillance cameras. The first task to do was to study the anomaly detection field in a surveillance video, to highlight the differences cases possible, these relationships, its demand in the real world.

The second task was to propose a solution to the problem by specifying a well defined application case which is a real need in our daily life. Following a thorough bibliographic study of the field, in response to the objective sought, we opt for the violence detection in a surveillance video. About it, we used the combination of convolutional neural networks (CNN), for the spatio-temporal aspect in order to extract the relevant characteristics, as well as the recurrent neu- ral network (RNN) recognized for the sequential data processing, the purpose of improving the results obtained. The model implemented follows our domain speci- fication, takes as input videos for CNN models, ie a sequence of images extracted from the video.

They are able to make a prediction with a good rate of accuracy and to recognize violent behavior carried out by people in a video. The actions constituting our video base are of two categories (Violence and No-violence), with which we have made different experiments with validation on all of our two actions and at the end of the training we have obtained good results , but with certain confusion in certain actions. Keywords : Convolutional neural networks ; recurrent neural networks ; deep learning ; computer vision ; detection of abnormal behavior ; detection of violence ; Smart cities. 6 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Acronymes DL : Deep Learning ; CV : Computer Vision ; CNN : Convolution Neuronal Network ; RNN : Recurrent Neuronal Network ; LSTM : Long short-term memory ; LDA : Latent Dirichlet Allocation ; SVM : Support Vector Machine ; 7 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Table des matières 1 Présentation du projet 12 1.1 Contexte du projet .3 Objectifs du stage.

14 2 État de l’art 15 2.1 Détection de violence : .1 L’approche à l’aide de fonctionnalités de bas niveau .2 L’approches à l’aide du descripteur audio-visuel .3 L’approche heuristique du comportement .4 L’approche basées sur fonctionnalités audio .5 L’approche basées sur les trames .6 L’approche basées sur les points d’intérêt .2 Architecture des modèles de la détection de violences .1 Architecture d’encodage spatio-temporel .2 Architecture du codeur spatial. 26 3 Solutions envisagées et contributions 28 3.1 Base de données .1 Collecte de données .2 Nos jeu de données .1 Les modèles à cadre unique .2 Les modèles à cadre multiple .4 Paramètres du modèle .5 Optimisation des modèles .6 Évaluation de nos modèles. 37 4 Résultats et analyses 38 4.1 Outils et environnement de travail .2 Expérimentation du modèle à cadre unique, Darknet19+3FC 40 4.3 Expérimentation du modèle à cadre multiple, Darknet19+CNN+LSTM 41 4.3 Architecture de la solution. 45 8 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 5 CONCLUSION et PERSPECTIVES 47 5.

48 9 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com INTRODUCTION GÉNÉRALE La surveillance vidéo par réseau de capteurs dans les zones urbaines implique de grandes quantités de petits nœuds capables de la détection vidéo. Une approche possible repose sur un nœud central puissant capable de mettre en œuvre des solutions DL en traitant des flux vidéo collectés à partir des nœuds du réseau.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ