Phát Hiện Đối Tượng Trong Ảnh Aerial Sử Dụng Kiến Trúc RPN Nhạy Cảm

Khóa luận trình bày phương pháp phát hiện đối tượng trong không ảnh bằng kiến trúc RPN nhạy cảm với hướng, ứng dụng trong khoa học máy tính.

Chuyên ngành

Khoa Học Máy Tính

Người đăng

Ẩn danh

Thể loại

khóa luận tốt nghiệp

2023

94
1
0

Phí lưu trữ

35 Point

Mục lục chi tiết

LỜI CẢM ƠN

LỜI ĐẦU

1. CHƯƠNG 1: TỔNG QUAN

1.1. Động lực nghiên cứu

1.2. Phát biểu bài toán

1.3. Các thách thức

1.4. Mục tiêu và phạm vi nghiên cứu

1.5. Đóng góp của nghiên cứu

1.6. Bố cục của luận văn

2. CHƯƠNG 2: CÁC NGHIÊN CỨU LIÊN QUAN

2.1. Hướng nghiên cứu phát hiện đối tượng có hướng

2.2. Hồi quy hộp giới hạn định hướng (OBB Regression)

2.3. Sự phát triển của phát hiện đối tượng có hướng trong không ảnh

2.4. Cách tiếp cận phụ thuộc hộp neo (Anchor-based approaches)

2.4.1. Phương pháp hai giai đoạn (Two-stage)

2.4.2. Rotated Faster RCNN

2.4.3. Phương pháp một giai đoạn (One-stage)

2.4.4. Rotated RetinaNet

2.4.5. Refined Rotation RetinaNet

2.4.6. Single-shot Alignment Network

2.5. Cách tiếp cận không phụ thuộc hộp neo (Anchor-free approaches)

2.5.1. Các phương pháp dựa trên điểm chính (keypoint-based)

2.5.2. Các phương pháp dựa trên trung tâm (center-based)

2.6. Căn chỉnh đặc trưng trong phát hiện đối tượng

2.7. Phương pháp đề xuất

2.7.1. Tổng quan phương pháp đề xuất

2.7.2. Mạng đề xuất khu vực kết hợp chiến lược neo hỗn hợp

2.7.3. Cơ chế mã hóa giải mã hộp neo

2.7.4. Cơ chế tinh chỉnh hộp neo

2.7.5. Mô-đun tích chập nhận biết hướng (Orientation-aware Convolution)

2.7.6. Đầu R-CNN hộp giới hạn định hướng

2.7.7. Cài đặt chi tiết

2.8. Bộ dữ liệu

2.9. Tiêu chuẩn đánh giá

2.10. Các kết quả chính

2.10.1. So sánh với các phương pháp hiện đại

2.10.2. So sánh độ hiệu quả của mô-đun tích chập nhận biết hướng

2.10.3. Nghiên cứu tác động của từng mô-đun

2.10.4. Một số kết quả trực quan hóa

3. CHƯƠNG 3: KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

DANH MỤC HÌNH

DANH MỤC BẢNG

DANH MỤC TỪ VIẾT TẮT

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Tổng Quan Về Phát Hiện Đối Tượng Trong Ảnh Aerial

Phát hiện đối tượng trong ảnh aerial là một lĩnh vực nghiên cứu quan trọng trong thị giác máy tính. Nó liên quan đến việc xác định và phân loại các đối tượng trong hình ảnh chụp từ trên cao, như từ máy bay hoặc drone. Các ứng dụng của nó rất đa dạng, từ giám sát môi trường đến quản lý đô thị. Việc sử dụng kiến trúc RPN nhạy cảm giúp cải thiện độ chính xác trong việc phát hiện các đối tượng có hướng, điều này rất cần thiết trong các tình huống thực tế.

1.1. Định Nghĩa Phát Hiện Đối Tượng Trong Ảnh Aerial

Phát hiện đối tượng trong ảnh aerial đề cập đến việc xác định vị trí và loại hình của các đối tượng trong hình ảnh chụp từ trên cao. Điều này bao gồm việc sử dụng các kỹ thuật như machine learning và deep learning để phân tích hình ảnh.

1.2. Tầm Quan Trọng Của Phát Hiện Đối Tượng

Phát hiện đối tượng trong ảnh aerial có vai trò quan trọng trong nhiều lĩnh vực như nông nghiệp, bảo vệ môi trường và an ninh quốc gia. Nó giúp cung cấp thông tin chính xác và kịp thời cho các quyết định quan trọng.

II. Các Thách Thức Trong Phát Hiện Đối Tượng Aerial

Phát hiện đối tượng trong ảnh aerial đối mặt với nhiều thách thức, bao gồm hướng tùy ý của đối tượng, biến thể quy mô và nền phức tạp. Những yếu tố này có thể làm giảm độ chính xác của các mô hình phát hiện. Việc hiểu rõ các thách thức này là cần thiết để phát triển các giải pháp hiệu quả.

2.1. Hướng Tùy Ý Của Đối Tượng

Các đối tượng trong ảnh aerial có thể xuất hiện với nhiều hướng khác nhau, điều này gây khó khăn cho việc phát hiện chính xác. Mô hình cần phải được thiết kế để xử lý các hướng khác nhau một cách hiệu quả.

2.2. Biến Thể Quy Mô Trong Ảnh

Khoảng cách từ thiết bị chụp ảnh đến đối tượng có thể thay đổi, dẫn đến sự khác biệt về kích thước trong hình ảnh. Điều này yêu cầu mô hình phải có khả năng nhận diện đối tượng ở nhiều kích thước khác nhau.

2.3. Nền Phức Tạp Trong Ảnh Aerial

Nền của ảnh aerial thường rất phức tạp, với nhiều yếu tố gây nhiễu. Mô hình phát hiện cần phải phân biệt rõ ràng giữa các đối tượng cần quan tâm và các yếu tố không liên quan.

III. Phương Pháp Sử Dụng Kiến Trúc RPN Nhạy Cảm

Kiến trúc RPN nhạy cảm là một trong những phương pháp tiên tiến nhất trong phát hiện đối tượng. Nó cho phép mô hình nhận diện và phân loại các đối tượng có hướng một cách chính xác hơn. Việc áp dụng các kỹ thuật deep learning trong kiến trúc này giúp cải thiện đáng kể hiệu suất phát hiện.

3.1. Cấu Trúc Của Kiến Trúc RPN

Kiến trúc RPN bao gồm các thành phần chính như backbone, neck và head. Mỗi thành phần đóng vai trò quan trọng trong việc trích xuất và xử lý thông tin từ hình ảnh.

3.2. Lợi Ích Của Việc Sử Dụng RPN Nhạy Cảm

Việc sử dụng RPN nhạy cảm giúp cải thiện độ chính xác trong việc phát hiện các đối tượng có hướng. Nó cho phép mô hình xử lý thông tin về hướng một cách hiệu quả hơn.

3.3. So Sánh Với Các Phương Pháp Khác

So với các phương pháp phát hiện đối tượng truyền thống, RPN nhạy cảm cho thấy hiệu suất vượt trội trong việc nhận diện các đối tượng có hướng trong ảnh aerial.

IV. Ứng Dụng Thực Tiễn Của Phát Hiện Đối Tượng Aerial

Phát hiện đối tượng trong ảnh aerial có nhiều ứng dụng thực tiễn, từ giám sát môi trường đến cứu hộ khẩn cấp. Các kết quả nghiên cứu cho thấy mô hình RPN nhạy cảm có thể được áp dụng hiệu quả trong các lĩnh vực này.

4.1. Giám Sát Môi Trường

Mô hình phát hiện đối tượng có thể được sử dụng để giám sát các thay đổi trong môi trường, như sự phát triển đô thị hoặc biến đổi khí hậu.

4.2. Cứu Hộ Khẩn Cấp

Trong các tình huống khẩn cấp, việc phát hiện nhanh chóng các đối tượng như người hoặc phương tiện có thể cứu sống nhiều mạng người.

4.3. Quản Lý Đô Thị

Phát hiện đối tượng trong ảnh aerial giúp các nhà quản lý đô thị có cái nhìn tổng quan về tình hình giao thông và phát triển hạ tầng.

V. Kết Luận Và Tương Lai Của Phát Hiện Đối Tượng Aerial

Phát hiện đối tượng trong ảnh aerial là một lĩnh vực đang phát triển mạnh mẽ. Với sự tiến bộ của công nghệ deep learning và các kiến trúc như RPN nhạy cảm, tương lai của lĩnh vực này hứa hẹn sẽ mang lại nhiều giá trị hơn nữa cho xã hội.

5.1. Tóm Tắt Các Kết Quả Nghiên Cứu

Nghiên cứu đã chỉ ra rằng việc áp dụng kiến trúc RPN nhạy cảm có thể cải thiện đáng kể độ chính xác trong phát hiện đối tượng có hướng.

5.2. Hướng Phát Triển Tương Lai

Trong tương lai, cần tiếp tục nghiên cứu và phát triển các mô hình mới để giải quyết các thách thức hiện tại trong phát hiện đối tượng trong ảnh aerial.

10/07/2025
Khóa luận tốt nghiệp khoa học máy tính phát hiện đối tượng trong không ảnh sử dụng kiến trúc rpn nhạy cảm với hướng

Trích đoạn nội dung tài liệu

ĐẠI HỌC QUOC GIA TP. HO CHÍ MINH TRƯỜNG ĐẠI HỌC CÔNG NGHỆ THÔNG TIN KHOA KHOA HỌC MÁY TÍNH NGUYÊN ĐỨC ANH PHÚC - 20520276 HUYNH VIET TUẦN KIỆT - 20521494 KHÓA LUẬN TÓT NGHIỆP PHAT HIỆN DOI TƯỢNG TRONG KHÔNG ANH SỬ DỤNG KIÊN TRÚC RPN NHẠY CẢM VỚI HUONG Object Detection in aerial image using Orientation-sensitivity RPN CU NHAN NGANH KHOA HOC MAY TINH GIANG VIEN HUONG DAN THS. VO DUY NGUYEN TP. HO CHÍ MINH, 2023 LỜI CẢM ƠN Lời đầu tiên, chúng tôi xin gửi đến hai thầy Th§.

Võ Duy Nguyên và TS. Nguyễn Tan Tran Minh Khang hai chữ “cảm ơn” chân thành nhất. Trong suốt quá trình thực hiện khóa luận, chúng tôi đã được sự quan tâm, giúp đỡ và hướng dẫn rất tận tình và tâm huyết từ hai thầy, những người đã luôn sẵn lòng trả lời mọi câu hỏi, hỗ trợ chúng tôi vượt qua những khó khăn và khám phá tiềm năng bản thân. Sự chỉ bảo của các thầy không chỉ giới hạn ở mặt chuyên môn, mà còn truyền đạt cho chúng tôi nhiều kỹ năng và kiến thức khác, giúp chúng tôi có cái nhìn sâu sắc hơn về cuộc sống, học tập và xã hội.

Từ những kiến thức mà thay truyền đạt, chúng tôi đã nhận ra ý nghĩa và cách thực hiện nghiên cứu khoa học một cách đúng đắn. Thầy đã giúp tôi nhận thức rõ ràng về tầm quan trọng của việc nghiên cứu khoa học, cũng như cách truyền tải nội dung nghiên cứu của mình một cách rõ ràng và hiệu quả đến người đọc và người nghe. Sự quan tâm và hướng dẫn tận tình cùng với những kiến thức các thầy truyền đạt đã trở thành động lực mạnh mẽ giúp tôi hoàn thành khóa luận này. Bên cạnh đó, tôi muốn gửi lời cảm ơn sâu sắc tới nhóm nghiên cứu UIT- Together vì những đóng góp và thảo luận tích cực của các thành viên.

Nhờ sự hỗ trợ và đóng góp ý kiến của các thầy cô, anh chị va bạn bẻ trong nhóm, tôi đã nhận được nhiều ý tưởng mới dé thử nghiệm trong khóa luận của mình. Khoảng thời gian làm việc cùng nhóm này có thé coi là một kỷ niệm đẹp nhất trong cuộc sống sinh viên của tôi, và cũng sẽ là một mốc thời gian đáng nhớ trong cuộc đời cá nhân mỗi chúng tôi. Và cuối cùng, tôi muốn bày tỏ lòng biết ơn đến gia đình, bạn bè và các bạn cùng trang lứa lớp KHMT2020 khóa K15 trường Đại học Công Nghệ Thông Tin. Sự chia sẻ và sự giúp đỡ mà các bạn đã dành cho tôi trong quá trình học tập và cuộc sống thật sự quý giá.

Tôi hy vọng rằng chúng ta sẽ mãi mãi duy trì mối quan hệ đáng quý này. Hy vọng rằng những điều tốt đẹp nhất sẽ luôn tiếp tục đồng hành với tất cả mọi người. ĐẠI HỌC QUOC GIA TP. HO CHÍMINH CONG HÒA XÃ HỘI CHỦ NGHĨA VIET NAM TRƯỜNG ĐẠI HỌC Độc Lập - Tự Do - Hạnh Phúc CÔNG NGHỆ THÔNG TIN ĐÈ CƯƠNG CHI TIẾT TEN DE TAI: PHÁT HIỆN DOI TƯỢNG TRONG KHÔNG ANH SỬ DỤNG KIÊN TRÚC RPN NHẠY CẢM VỚI HƯỚNG TEN DE TÀI TIENG ANH: OBJECT DETECTION IN AERIAL IMAGE USING ORIENTATION-SENSITIVITY RPN Cán bộ hướng dẫn: ThS.

VÕ DUY NGUYEN Thời gian thực hiện: Từ ngày 20/02/2023 đến ngày 26/06/2023. Sinh viên thực hiện: 1. Sinh viên 1 NGUYEN ĐỨC ANH PHÚC - 20520276 Lớp: KHMT2020 Email: 20520276@gm.vn Điện thoại: 0911592002 2. Sinh viên 2 HUYNH VIET TUAN KIỆT - 20521494 Lớp: KHMT2020 Email: 20521494@gm.vn Điện thoại: 0796616454 Nội dung đề tài: 1.

Giới thiệu Phát hiện đối tượng có hướng trong không anh (Oriented Object Detection in Aerial images) dé cập đến tác vụ phát hiện đối tượng trong ảnh chụp từ một vị trí trên cao đồng thời ước lượng hình dạng và hướng của các đối tượng đó trong không gian. Không ảnh thường được chụp từ máy bay, drone, vệ tinh hoặc các nền tảng bay khác và những hình ảnh này cung câp chê độ xem toàn cảnh bê mặt Trái đât, ghi lại nhiêu cảnh quan, khu đô thị, đặc điểm tự nhiên và cấu trúc nhân tạo. Các phương pháp tiếp cận cho bài toán này dựa vào Deep Learning, mục tiêu trích xuất các đặc trưng được căn chỉnh hiệu quả và ước lượng chính xác về hướng của đối tượng trong không ảnh. Thông tin kết quả có thể được sử dụng trong nhiều ứng dụng thực tế, đặc biệt trong lĩnh vực Thị giác Máy Tính (Computer Vision) như giám sát, dự báo thảm họa, cứu hộ khẩn cấp và quản lý đô thị.

Khác với cách biểu diễn đối tượng sử dụng các hộp giới hạn ngang (Horizontal Bounding Boxes), các hộp giới hạn có hướng (Oriented Bounding Boxes) bé sung thêm tham số góc liên quan đến hướng của đối tượng trong quá trình tính toán. Do đó, các mô hình phát hiện đối tượng cho bài toán này yêu cầu có nhiều tham số dé mã hóa thông tin về hướng, điều này dư thừa và cực kì không hiệu quả. Những nghiên cứu về phát hiện đối tượng trong không ảnh trước đây đối mặt với những khó khăn do các đối tượng được chụp từ góc nhìn chim bay thường xuất hiện với hướng tùy ý khác với các đối tượng trong ảnh chụp tự nhiên [1]. Tổng quan, bài toán phát hiện đối tượng trong không ảnh phải đối mặt với một số các thách thức sau: ¢ Hướng tùy ý (Arbitrary orientations): Đối với hình ảnh được chụp từ góc nhìn trên cao, các đối tượng xuất hiện với hướng tùy ý, dẫn đến nhiều thách thức ảnh hưởng đến hiệu suất phát hiện đối tượng chính xác của mô hình.

© Da tilé (Scale variations): Khoảng cách đề lấy mẫu/ thu thập dữ liệu của các thiết bị như Drone/ vệ tinh có thé thay đổi từ vài centimet đến hàng trăm mét, do đó hình ảnh được chụp bởi các cảm biến khác nhau có thể có các biến thể quy mô lớn, đặt ra nhiều thách thức hơn yêu cầu mô hình thích ứng chính xác với kích thước đối tượng. e _ Nền ngoại cánh phức tap (Complex background): Bởi vì sự đa dạng và phức tạp của bề mặt trái đất, các hình ảnh có thể chứa đa dạng các yếu tố ngoại cảnh (background) phức tap, dẫn đến đáng kể các đối tượng nhiễu sẽ can thiệp trong quá trình phát hiện. Nói cách khác, nhiều đối tượng không liên quan sẽ được phát hiện đôi với hình ảnh có nên ngoại cảnh phức tạp, yêu câu mô hình phải phân biệt tôt những đối tượng cần quan tâm và phần còn lại của hình ảnh. Ngoài ra còn rất nhiều thách thức phải đối mặt trong bài toán phát hiện đối tượng có hướng trong không ảnh dé xây dựng được một mô hình hoàn chỉnh có thé phát hiện chính xác và thích ứng hoàn hảo với hướng của đối tượng [2].

Nắm bắt được xu hướng nghiên cứu và giá trị thực tiễn mà bài toán mang lại, chúng tôi quyết định lựa chọn bài toán này để tìm hiểu, nghiên cứu và thực hiện khóa luận tốt nghiỆp. Trong nghiên cứu này, chúng tôi đề xuất một mô hình chất lượng cao có tính nhạy cảm về hướng thực hiện cho bài toán phát hiện đối tượng có hướng trong không ảnh, với mục tiêu sẽ giải quyết được các thách thức mà bài toán phải đối mặt, đồng thời cải thiện độ chính xác của mô hình dé xuất trên các bộ dữ liệu không ảnh tiêu chuẩn. Phát biểu bài toán Bài toán phát hiện đối tượng có hướng trong không ảnh biểu diễn các đối tượng xuất hiện trong hình ảnh sứ dụng các hộp giới hạn có hướng (Oriented Bounding Box) và đồng thời cho biết nhãn lớp (class) cũng như độ tin cậy (confidence score) của đối tượng đã được biểu diễn. ¢ Input: Hình ảnh được chụp từ góc nhìn trên cao với một hay nhiều đối tượng (hoặc không có đối tượng).

Không ảnh là ảnh được thu thập từ các ứng dụng hỗ trợ theo dõi từ trên cao (Drone, vệ tỉnh, flycam,. Trong đó các đối tượng được quan tâm sẽ được phát hiện đồng thời ước lượng chính xác hướng của chúng. ¢ Output: Đầu ra của bài toán bao gồm tập các hộp giới hạn có hướng (Oriented Bounding Boxes) xác định vị trí và hướng mỗi đối tượng xuất hiện trong hình ảnh đầu vào. Ngoài ra, đầu ra cũng bao gồm nhãn/ lớp (class) của đối tượng và điểm tin cậy (confidence score) cho biết xác suất tin cậy đối tượng hiện diện ở vị trí và hướng đã cho.

Có thé thấy ngoài việc phát hiện và xác định chính xác hướng của đối tượng trong hình ảnh. Các mô hình trong bài toán phát hiện đối tượng có hướng trong không ảnh còn phải xác định được chính xác nhãn/ lớp thuộc về đối tượng đó trong điều kiện ảnh chụp từ trên cao và kích thước của các đối tượng là cực kì nhỏ. Đối tượng, phạm vi nghiên cứu ¢ = Miền dữ liệu: Ảnh chụp từ các thiết bị hỗ trợ thu thập từ trên không như Drone, vệ tinh,. e Dé liệu thực nghiệm: + Bộ dữ liệu DOTA-vI [3]: DOTA-v1 là bộ dữ liệu quy mô lớn cung cấp cho bài toán phát hiện đối tượng trong không ảnh, bao gồm 15 lớp đối tượng, 2806 hình ảnh và 188282 trường hợp được gán nhãn.

+ Bộ dữ liệu dự kiến: HRSC2016, DIOR-R 4. Mục tiêu của đề tài Mục tiêu đề tài hướng tới bao gồm: — Nghiên cứu và khảo sát các mô hình Deep Learning hiện có áp dụng cho bài toán phát hiện đối tượng có hướng trong không ảnh. Phân tích chỉ tiết các module có thé tận dụng để nâng cao hiệu suất phát hiện. Đề xuất phương pháp xử lí nhạy cảm với những đặc trưng có hướng và sinh ra các đề xuất chất lượng cao cho bài toán phát hiện đối tượng có hướng trong không ảnh.

Thực nghiệm đánh giá hiệu suất của mô hình đề xuất trên các bộ dữ liệu tiêu chuẩn cho bài toán phát hiện đối tượng có hướng trong không ảnh. Triển khai chương trình ứng dụng thực tế cho mô hình đã được đề xuất. Nội dung nghiên cứu cúa đề tài Nội dung nghiên cứu của đề tài chia làm bốn phần: Tim hiéu tổng quan về các cách tiếp cận cho bài toán phát hiện đối tượng có hướng trong không ảnh. Nghiên cứu các kiến trúc rời Tạc (backbones, necks, heads) có thể tận dụng để nâng cao hiệu suất bài toán áp dụng trên các đối tượng có hướng trong các mô hình Deep Learning tiền nhiệm.

"Thực hiện cài đặt các phương pháp phát hiện đối tượng có hướng với các cách tiếp cận khác nhau như One-stage, Two-stage hay Transformer-based đề so sánh và đối chiếu kết quả. Tổng hợp kết quả khảo sát, phân tích cụ thể các kiến trúc bên trong mô hình để tìm ra những ưu, nhược điềm cho từng thành phần.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ