Đánh Giá Các Phương Pháp Học Sau Về Phát Hiện Đối Tượng Trên Không Ảnh

Khóa luận đánh giá các phương pháp học sâu trong phát hiện đối tượng trên không ảnh, cung cấp cái nhìn sâu sắc về công nghệ hiện đại.

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2021

76
3
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

1. CHƯƠNG 1: GIỚI THIỆU ĐỀ TÀI

1.1. Phát hiện đối tượng — giới thiệu, thách thức, tiêu chí

1.2. Phát hiện đối tượng trên không ảnh

1.3. Công trình liên quan

1.4. Mục tiêu và đóng góp

1.5. Cấu trúc khóa luận

2. CHƯƠNG 2: CÁC MÔ HÌNH MÁY HỌC LIÊN QUAN

2.1. Mạng nơ-ron tích chập (Convolutional Neural Network — CNN)

2.2. AlexNet

2.3. GoogLeNet

2.4. ResNet

3. CHƯƠNG 3: PHƯƠNG PHÁP THỰC NGHIỆM

3.1. You Only Look Once — YOLO

3.1.1. Backbone của YOLOv4

3.1.2. Neck của YOLOv4

3.1.3. Tổng hợp đặc trưng

3.1.4. Mô đun cải thiện vùng tiếp nhận (receptive field)

3.1.5. Head của YOLOv4

3.1.6. Hàm mục tiêu của YOLOv4

3.1.7. Các cải tiến khác

3.1.7.1. Hàm kích hoạt Mish
3.1.7.2. Tăng cường dữ liệu khảm - mosaic augmentation

3.2. DEtection TRansformer — DETR

3.2.1. Sơ lược kiến trúc

3.2.2. Backbone của DETR

3.2.3. Khái quát hóa positional encoding cho dữ liệu ảnh

3.2.4. Mạng truyền thẳng (Feed Forward Network — FEN)

3.2.5. Độ lỗi dự đoán bộ/tập (set prediction loss) cho bài toán phát hiện đối tượng

3.2.6. Thuật toán Hungary (Hungarian algorithm)

3.2.6.1. Hàm chi phí cho thuật toán Hungary
3.2.6.2. Chi tiết quá trình truyền thẳng của dữ liệu

3.3. Dữ liệu sử dụng

3.4. Quá trình thực nghiệm

3.4.1. Huấn luyện mô hình YOLOv4

3.4.2. Huấn luyện mô hình DETR

3.4.3. Các thí nghiệm nhỏ

3.4.4. Thí nghiệm mô hình chính

4. CHƯƠNG 4: KẾT QUẢ THỰC NGHIỆM

4.1. Kết quả trên tập validation

4.2. Kết quả trên tập test-dev

4.3. Kết quả định tính

5. CHƯƠNG 5: KẾT QUẢ ĐẠT ĐƯỢC VÀ HƯỚNG PHÁT TRIỂN

DANH MỤC HÌNH VẼ

DANH MỤC BẢNG

DANH MỤC TỪ VIẾT TẮT

Tóm tắt

I. Giới thiệu về Đánh Giá Phương Pháp Phát Hiện Đối Tượng Trên Không Ảnh

Phát hiện đối tượng trên không ảnh là một lĩnh vực nghiên cứu quan trọng trong thị giác máy tính. Với sự phát triển của công nghệ UAV, việc phát hiện và phân loại các đối tượng trong ảnh chụp từ trên cao trở nên cần thiết. Các phương pháp hiện tại đang được áp dụng để giải quyết các thách thức trong việc phát hiện đối tượng, bao gồm độ phân giải cao và điều kiện ánh sáng khác nhau. Nghiên cứu này sẽ đánh giá các phương pháp phát hiện đối tượng, từ đó đưa ra những giải pháp tối ưu.

1.1. Tổng quan về phát hiện đối tượng trên không ảnh

Phát hiện đối tượng là quá trình xác định và phân loại các vật thể trong ảnh. Đặc biệt, trong ngữ cảnh không ảnh, các thách thức như độ phân giải cao và cảnh nền phức tạp cần được xem xét.

1.2. Tầm quan trọng của nghiên cứu trong lĩnh vực này

Nghiên cứu về phát hiện đối tượng trên không ảnh không chỉ giúp cải thiện độ chính xác mà còn nâng cao hiệu suất trong các ứng dụng thực tiễn như giám sát giao thông và bảo vệ môi trường.

II. Các Thách Thức Trong Phát Hiện Đối Tượng Trên Không Ảnh

Phát hiện đối tượng trên không ảnh gặp phải nhiều thách thức lớn. Đầu tiên là sự khác biệt về kích thước và hình dạng của các đối tượng trong cùng một lớp. Thứ hai, môi trường chụp ảnh đa dạng với ánh sáng và thời tiết khác nhau cũng gây khó khăn. Cuối cùng, chất lượng ảnh từ UAV thường bị ảnh hưởng bởi nhiều yếu tố như độ phân giải và nhiễu ảnh.

2.1. Sự khác biệt về kích thước và hình dạng

Các đối tượng như xe hơi hay người có thể xuất hiện với nhiều kích thước và hình dạng khác nhau, gây khó khăn cho việc phát hiện chính xác.

2.2. Môi trường chụp ảnh đa dạng

Ảnh chụp từ UAV có thể được thực hiện trong nhiều điều kiện khác nhau, từ ánh sáng mạnh đến ánh sáng yếu, làm giảm độ chính xác của các phương pháp phát hiện.

2.3. Chất lượng ảnh và nhiễu

Chất lượng ảnh từ UAV thường bị ảnh hưởng bởi nhiều yếu tố như độ phân giải thấp và nhiễu, làm cho việc phát hiện đối tượng trở nên khó khăn hơn.

III. Phương Pháp Phát Hiện Đối Tượng Trên Không Ảnh Hiện Nay

Hiện nay, có nhiều phương pháp phát hiện đối tượng được áp dụng cho không ảnh, bao gồm YOLOv4 và DETR. Các phương pháp này đã được chứng minh hiệu quả trong việc phát hiện đối tượng trong các bối cảnh khác nhau. Nghiên cứu này sẽ phân tích chi tiết về các phương pháp này và đánh giá hiệu suất của chúng.

3.1. Phương pháp YOLOv4

YOLOv4 là một trong những phương pháp phát hiện đối tượng nhanh nhất hiện nay, với khả năng xử lý thời gian thực và độ chính xác cao. Nó sử dụng kiến trúc mạng nơ-ron sâu để tối ưu hóa việc phát hiện.

3.2. Phương pháp DETR

DETR là một phương pháp mới sử dụng transformer cho phát hiện đối tượng, không cần đến anchor và các bước hậu xử lý, giúp đơn giản hóa quy trình phát hiện.

3.3. So sánh hiệu suất giữa các phương pháp

Nghiên cứu sẽ so sánh hiệu suất của YOLOv4 và DETR trên bộ dữ liệu VisDrone, từ đó đưa ra những nhận định về ưu nhược điểm của từng phương pháp.

IV. Ứng Dụng Thực Tiễn Của Phát Hiện Đối Tượng Trên Không Ảnh

Phát hiện đối tượng trên không ảnh có nhiều ứng dụng thực tiễn trong các lĩnh vực như giám sát an ninh, quản lý giao thông và nông nghiệp thông minh. Việc áp dụng các phương pháp phát hiện đối tượng giúp nâng cao hiệu quả và độ chính xác trong các hoạt động này.

4.1. Ứng dụng trong giám sát an ninh

Các hệ thống giám sát an ninh sử dụng UAV có thể phát hiện và theo dõi các đối tượng khả nghi, giúp tăng cường an ninh cho các khu vực nhạy cảm.

4.2. Ứng dụng trong quản lý giao thông

Phát hiện đối tượng giúp theo dõi tình hình giao thông, phát hiện tai nạn và điều phối giao thông hiệu quả hơn.

4.3. Ứng dụng trong nông nghiệp thông minh

UAV có thể được sử dụng để giám sát mùa màng, phát hiện sâu bệnh và tối ưu hóa quy trình sản xuất nông nghiệp.

V. Kết Luận và Hướng Phát Triển Tương Lai

Nghiên cứu về phát hiện đối tượng trên không ảnh đã chỉ ra nhiều thách thức và cơ hội. Các phương pháp như YOLOv4 và DETR đã cho thấy tiềm năng lớn trong việc cải thiện độ chính xác và hiệu suất. Hướng phát triển tương lai có thể tập trung vào việc tối ưu hóa các thuật toán và cải thiện khả năng xử lý trong thời gian thực.

5.1. Tóm tắt kết quả nghiên cứu

Kết quả nghiên cứu cho thấy YOLOv4 và DETR đều có những ưu điểm riêng, tuy nhiên cần cải thiện thêm để đáp ứng tốt hơn trong các ứng dụng thực tiễn.

5.2. Hướng phát triển trong tương lai

Nghiên cứu có thể mở rộng sang việc phát triển các mô hình mới, cải thiện khả năng phát hiện trong các điều kiện khó khăn hơn.

10/07/2025
Khóa luận tốt nghiệp khoa học máy tính đánh giá các phương pháp học sâu về phát hiện đối tượng trên không ảnh

Trích đoạn nội dung tài liệu

Chương 1. Giới thiệu để tài. Phát hiện đối tượng — giới thiệu, thách thức, tiêu chí. Phát hiện đối tượng trên không ảnh.

Công trình liên quan. Mục tiêu và đóng góp. Câu trúc khóa luận. Các mô hình máy học liên quan.

Mạng nơ-ron tích chập (Convolutional Neural Network — CNN). LA, ResÌNet. HH rước W co o. Encoder và DecOd€r.

Các độ đo đánh giá và độ lỗi. Mean Absolute Error — MAI. Intersection over Union — IoU. Generalized Intersection over Union — GIoU.

Distance-loU — Dio. | Complete-IoU — CioU. PHƯƠNG PHAP THUC NGHIỆM. You Only Look Once — YOLO.

Backbone của YOLOV4 0. Neck cua YOLOV4. Tổng hop đặc tung. Mô dun cải thiện vùng tiếp nhận (receptive field).

Head của YOLOv4. Hàm mục tiêu của YOIOv4. ¿55c +c xe s+ese+eseeeeeeeeseee 27 3. Các cải tiến khác.

Hàm kích hoạt Mish. Tăng cường dit liệu kham - mosaic augmentation. DEtection TRansformer — DETR. Sơ lược kiến trúc.

Backbone của DETR. Khái quát hóa positional encoding cho dữ liệu ảnh. Mạng truyền thang (Feed Forward Network — FEN). Độ lỗi dự đoán bộ/tập (set prediction loss) cho bài toán phát hiện đối trợng 33 3.

Thuật toán Hungary (Hungarian algorithm). Hàm chi phí cho thuật toán Hungary. Chỉ tiết quá trình truyền thang của dữ liệu. Dữ liệu sử dụng.

Quá trình thực nghiệm. Huấn luyện mô hình YOLOv4. _ Huấn luyện mô hình DETR. Các thí nghiệm nhỏ.

Thí nghiệm mô hình chính. Kết quả thực nghiệm. Kết quả trên tập validation. Kết quả trên tập test-dev.

Kết quả định tính.--222-ccccccrkererrkrerrrrrrrerrrr 53 Chương5. Kết quả dat được. Hướng phát triển.---cccccc+ccccvvvvvrrrrrrrrrrrrrrrerrrrei 60 DANH MỤC HÌNH VE Hình 1.1: Ví dụ về phương pháp cắt ảnh dé phát hiện (nguồn: [29)).1: Kiến trúc mạng AlexNet (nguồn: [15]).3: Biểu diễn một khối bình thường và khối residual (nguồn: [34)).4: Biểu diễn một skip connection trong mạng ResNet (nguồn: [14J).5: Biểu diễn phần phạt của độ đo GIOU .----cccc5555cczcc5s+ l§ Hình 2.6: Biểu diễn phần phạt của độ đo DIoU.1: Tổng quan kiến trúc của YOLOv4, với backbone là CSPDarknet-53, neck gồm PAN và mô đun SPP Hình 3.2: Ví dụ về các giá trị của một anchor (nguôn: [39]) Hình 3.3: Đồ thị của hàm kích hoạt Mish và các hàm khác (nguồn: [40]).4: Ví dụ về mosaie augmentation trên dữ liệu COCO [33].5: Kiến trúc mạng DETR. DETR sử dụng một CNN thông thường đề học biểu diễn hai chiều của một ảnh.

Sau đó nó được thu lại thành biểu diễn một chiều và được bổ sung thêm một positional encoding trước khi truyền vào encoder của transformer. Decoder của transformer sử dụng đầu ra của encoder và một số lượng cố định các positional embedding, gọi là object queries dé đưa ra các embedding đầu ra. Cac embedding đầu ra này được đưa vào FEN dé dự đoán hộp giới hạn và Hình 3.6: Kiến trúc transformer trong DETR. Mỗi lớp trong encoder va decoder có cơ chế attention và một FFN cùng với kết nối residual, dropout và layer normalization.

Encoder với cơ chế self-attention và decoder với hai cơ chế self- attention và encoder-decoder attention. Đầu vào của encoder được học bởi một CNN còn đầu vào của decoder gồm có dau ra của encoder và các object query được học chung với transformer đại diện cho các đối tượng dự đoán. Dự đoán bằng một perceptron 3 lớp và một lớp FC (nguồn: [1]) .7: Phân bố của các lớp trong tập training của VisDrone DET.8: Phân bố của các lớp trong tập validation của VisDrone DET.9: Phân bố của các lớp trong tap test-dev của VisDrone DET.10: Một vài ví du mô phỏng sự da dang của dữ liệu. Mỗi hàng gồm hai hình ảnh về sự khác biệt về các đặc điểm có trong bộ VisDrone DET: vị trí, môi trường (hàng 1); nhiều loại đối tượng (hàng 2); độ dày đặc (hàng 3); điều kiện ánh SAng (HANG 4) Tố.1: Đồ thị mAP@50 của các mô hình DETR ResNet50 sử dụng các loại positional encoding khác nhau.

Kết quả mAP@50 cao nhất của các mô hình lần lượt là 0.2: Đồ thị mAP@50 của các mô hình DETR ResNet50 khi áp dung DIoU vào quá trình huấn luyện. Kết quả mAP@50 cao nhất của các mô hình lần lượt 0,1225 và 0,1101.3: Đồ thị mAP@50 của các mô hình DETR ResNet101 khi sử dụng 1000 và 500 object query. Kết quả mAP@50 cao nhất của các mô hình lần lượt 0,3095 và 0.4: Dé thị mAP@50 của hai mô hình DETR với khi sử dụng hai backbone ResNet-50 và ResNet-101 vào quá trình huấn luyện. Kết quả mAP@50 cao nhất của các mô hình lần lượt 0,1225 và 0,1613.5: Đồ thị mAP@50 của mô hình DETR ResNet-101 trong quá trình huấn luyện đài với 500 epoch.

Kết quả mAP@50 cao nhất của các mô hình lần lượt 01613; 0,2947 và 0,30095. LH HH HH HT HH HH 50 Hình 4.6: Kết quả dự đoán của YOLO: trắng (lớp ignored region va others), xanh lá (hộp dự đoán của mô hình), đỏ (hộp xác thực).7: Kết quả dự đoán của DETR: trắng (lớp ignored region và others), xanh lá (hộp dự đoán của mô hình), đỏ (hộp xác thực).- -¿¿+5+c+<+<cccrexecee 58 DANH MỤC BANG Bang 1.1: Thống kê sơ bộ so sánh các bộ dữ liệu.-------ccccz++ccccvvvce2 4 Bảng 4.1: Kết quả mô hình YOLOV4 trên tap test.2: Kết quả của phương pháp được chọn và các phương pháp hướng cắt ảnh [28], [29] trên validatiOII. 6 << kề 1E HH it52 Bảng 4.3: Kết quả của phương pháp được chọn và phương pháp tốt nhất từ [9] bì ốc ố ố ố ốằ.52 DANH MỤC TU VIET TAT UAV Unmanned Aerial Vehicle NLP Natural Language Processing TTA Test Time Augmentation NNL Negative Log-Likelihood NMS Non-Maximum Suppression mAP Mean Average Precision AR Average Recall FPS Frames Per Second FPN Feature Pyramid Network R-CNN Region based Convolutional Neural Network RNN Recurrent Neural Network LSTM Long Short-Term Memory TÓM TÁT KHÓA LUẬN Phát hiện đối tượng là bài toán định vị và phân loại các vật thể có trong ảnh, mang nhiều ứng dụng trong thực tế. Các mô hình phát hiện đối tượng thường được xây dựng và kiểm chứng dựa trên dữ liệu ảnh thông thường.

Trong khi đó, các ứng dụng thực tế như giám sát giao thông cần phải xử lí dữ liệu ảnh với nhiều thách thức hơn, ví dụ như ảnh chụp từ các thiết bị bay không người lái, vật thể có kích thước nhỏ và tỉ lệ vùng nền lớn. Các phương pháp phát hiện đối tượng trên không ảnh hiện nay gặp phải vấn đề về tốc độ xử lí. Trong nội dung bài khóa luận này, chúng tôi huấn luyện và đánh giá các mô hình YOLOv4 và DETR - các mô hình phát hiện vật thể đã được kiểm chứng hiệu năng trên dữ liệu thông thường - trên dữ liệu ngữ cảnh không ảnh, cụ thé là bộ dữ liệu VisDrone. Kết qua đạt được của YOLOv4 cho độ chính xác cạnh tranh cùng tốc độ vượt trội so với các phương pháp hiện có, gia tăng khả năng ứng dụng và mở rộng các hướng phát triển về sau.

Giới thiệu đề tài May bay không người lái (drone hay UAV) trang bi camera ngày càng được phổ biến do giá thành rẻ dần và có khả năng ứng dụng trong nhiều lĩnh vực, ví dụ như nông nghiệp, chuyển phát nhanh và đặc biệt là giám sát. Việc sử dụng drone cho khả năng giám sát linh hoạt hơn, tiếp cận được những vùng không có camera cố định hay gặp nhiều giới hạn tầm nhìn từ dưới đất. Cũng vì thế, nhu cầu tự động xử lí hình ảnh thu nhập được từ drone dan gia tăng, trong đó bước xử lí nền tảng là phát hiện đối tượng trong ảnh. Phát hiện đối tượng - giới thiệu, thách thức, tiêu chí Phát hiện đối tượng (object detection) là một trong những bài toán tiêu biểu của thị giác máy tính: cho đầu vào là một ảnh cùng với tập các lớp đối tượng được định nghĩa sẵn (ví dụ như người, xe hơi, xe máy.

đầu ra của bài toán là xác định được tất cả các đối tượng có lớp thuộc tập ở trong ảnh. Việc xác định các đối tượng được cụ thê hóa bằng việc tìm hộp giới hạn (bounding box) của từng đối tượng cùng với lớp mà đối tượng thuộc về. Phát hiện đối tượng là bài toán nền tang, làm tiền đề cho những bài toán phức tạp ơn như theo dõi đối tượng (object tracking), phân đoạn hình anh (image segmentation), chú thích hóa hình ảnh (image captioning). với nhiều ứng dụng thực tế, ví du như trong các hệ thống giám sát, lái xe tự động, thị giác robot, truy 6i ảnh và thực tế tăng cường (augmented reality).

Với con người, việc xác định được vật thé trong một khung cảnh là một tác vụ đơn giản, dễ dàng thực hiện được bởi một đứa trẻ. Tuy nhiên, để máy tính có thể phát hiện được như con người gặp nhiều khó khăn và thách thức. Với máy tính một bức ảnh chỉ là một tập hợp của nhiều con SỐ, các điểm ảnh trong nó đều được biểu thị và hiểu với một vai trò như nhau. Các hướng tiếp cận của các nhà nghiên cứu, từ dùng kiến thức con người tạo ra các đặc trưng thủ công (handcrafted feature) hay cho máy tính tự tạo ra đặc trưng dựa trên xác suất và thống kê thông tin của các bộ dữ liệu, nhằm mục đích tăng khả năng hiểu biết của máy tính gần với khả năng hiểu ngữ nghĩa (semantic understanding) của con người, đều gặp những thách thức như sau: - Sự khác biệt của vật thé trong cùng một lớp: xe hơi có thé có nhiều mau son, hình dáng, xuất hiện trong ảnh với nhiều góc chụp (nhìn trực diện, bên hông hay đằng sau.), nhiều kích cỡ so với toàn ảnh tùy theo khoảng cách.

Con người có thể xuất hiện với nhiều dáng đứng, nằm, ngồi khác nhau. Ngoài ra, vật thé bị che khuất cũng gây ra nhiều khó khăn. - Môi trường, cảnh nền đa dang: ảnh có thể được chụp với nhiều góc nhìn, tại những môi trường ngoại cảnh khác biệt (ở trong nhà, sa mạc, đồng cỏ.), với ánh sáng đa dang (sáng, chiều, đêm) hay trong nhiều thời tiết (mưa, nắng.) - Nhiều lớp vật thê khác nhau, ké cả loại có câu trúc có định hay không (như mây, lửa). - Mat mát trong tao anh va thé hiện dữ liệu: chất lượng camera, ảnh bị mờ nhòe, nhiễu anh, mat mát thông tin sau khi nén anh.

Hướng đến máy tính đạt được khả năng phát hiện như con người, một thuật toán phát hiện đối tượng lí tưởng được đánh giá trên hai mục tiêu: độ chính xác và hiệu năng. Phương pháp phải phân lớp và định vị chính xác các đối tượng trong ảnh, xác định qua độ đo AP (Average Precision). Phương pháp cũng phải có hiệu năng cao, cho tốc độ nhanh và tiêu tốn ít chỉ phí tính toán nhằm phục vụ cho các bài toán kế thừa hay đáp ứng hoạt động dưới thời gian thực, xác định qua số ảnh xử lí được trong một giây (FPS). Phát hiện đối tượng trên không ảnh Các bộ dữ liệu ảnh thông thường (PASCAL-VOC [12], MS-COCO [13]) thường được sử dụng dé đánh giá các phương pháp phát hiện đối tượng.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu có tiêu đề Đánh Giá Phương Pháp Phát Hiện Đối Tượng Trên Không Ảnh cung cấp cái nhìn sâu sắc về các phương pháp hiện tại trong việc phát hiện đối tượng từ ảnh không gian. Bài viết phân tích các kỹ thuật khác nhau, từ truyền thống đến hiện đại, và đánh giá hiệu quả của chúng trong việc nhận diện và phân loại đối tượng. Một trong những điểm nổi bật là việc áp dụng công nghệ học sâu, giúp cải thiện độ chính xác và tốc độ xử lý hình ảnh. Độc giả sẽ tìm thấy những lợi ích thiết thực từ việc hiểu rõ các phương pháp này, từ đó có thể áp dụng vào các lĩnh vực như giám sát môi trường, nông nghiệp thông minh và an ninh quốc gia.

Để mở rộng kiến thức của bạn về các công nghệ liên quan, bạn có thể tham khảo tài liệu Tìm hiểu kiến trúc transformer và ứng dụng cho bài toán trả lời câu hỏi. Tài liệu này sẽ giúp bạn hiểu rõ hơn về kiến trúc transformer, một công nghệ tiên tiến có thể được áp dụng trong nhiều lĩnh vực, bao gồm cả việc xử lý hình ảnh và ngôn ngữ tự nhiên.