Chương 1 Giới thiệu chung về bài toán nhận dạng đối tượng trên ảnh viễn thám Viễn thám (Remote sensing) được hiểu là việc thu thập thông tin về một đối tượng, một khu vực hoặc một hiện tượng thông qua việc phân tích tư liệu thu nhận được bằng phương tiện mà không tiếp xúc trực tiếp với đối tượng, khu vực hoặc hiện tượng được nghiên cứu. Phương tiện thường sử dụng là sóng điện từ để chuyển tải thông tin từ vật cần nghiên cứu tới thiết bị thu nhận thông tin. Cụ thể hơn, viễn thám là việc nghiên cứu đối tượng bằng giải đoán và tách lọc thông tin từ dữ liệu ảnh chụp từ xa, chẳng hạn ảnh hàng không hoặc ảnh vệ tinh. Viễn thám được sử dụng trong nhiều lĩnh vực, bao gồm địa lý, khảo sát đất đai và hầu hết các ngành Khoa học Trái đất.
Thuật ngữ viễn thám (Remote sensing) - điều tra từ xa, xuất hiện từ năm 1960 do một nhà địa lý người Mỹ là E.Pruit đặt ra (Thomas, 1999). Ngày nay kỹ thuật viễn thám đã được phát triển và ứng dụng rất nhanh và rất hiệu quả trong nhiều lĩnh vực. Như vậy viễn thám là thông qua kỹ thuật hiện đại không tiếp cận với đối tượng mà xác định nó qua thông tin ảnh chụp từ xa trên không. Để có thể sử dụng được dữ liệu viễn thám ta phải có khả năng tách thông tin có ý nghĩa từ ảnh.
Đó là nhiệm vụ của việc xử lý ảnh viễn thám. Nói cách khác là phải diễn giải và phân tích ảnh viễn thám. Phân tích ảnh viễn thám là thực hiện nhận biết, đo các đối tượng khác nhau trong ảnh để tách thông tin hữu ích về chúng. Xử lý ảnh số viễn thám là thực hiện một loạt thủ tục bao gồm lập khuôn mẫu, hiệu chỉnh dữ liệu, nâng cao chất lượng để dễ dàng giải đoán hay phân lớp tự động các đối tượng bằng máy tính.
Để có thể xử lý số 1 ảnh viễn thám, dữ liệu phải được thu thập dưới dạng số phù hợp và lưu trữ trong máy tính. Đồng thời phải có phần cứng, phần mềm phù hợp, nói cách khác phải có hệ thống phân tích ảnh phù hợp. Bài toán nhận diện đối tượng trên ảnh viễn thám là một trong những bài toán quan trọng trong lĩnh vực xử lý ảnh và thị giác máy tính. Nó đặt ra thách thức trong việc phân tích và xử lý hình ảnh đa dạng từ các nguồn viễn thám khác nhau như vệ tinh, máy bay không người lái.
Bài toán này thường được áp dụng trong nhiều lĩnh vực khác nhau, bao gồm quản lý tài nguyên đất đai, giám sát môi trường, bảo vệ động vật hoang dã, kiểm soát chất lượng nước và nông nghiệp. Nó cho phép chúng ta nhận biết và phân tích các đối tượng trên bề mặt trái đất như cây trồng, rừng, đất trống, đường, công trình xây dựng, mặt nước. Để giải quyết bài toán nhận diện đối tượng trên ảnh viễn thám, các kỹ thuật xử lý ảnh và học máy được áp dụng để tạo ra các thuật toán phức tạp để phát hiện và phân loại các đối tượng. Trong luận văn này sẽ tập trung đề cập đến một số mô hình máy học sâu và cải tiến một số mô hình máy học nhằm nâng cao kết quả nhận dạng đối tượng trên ảnh viễn thám.1 Các lớp bài toán thường gặp trong nhận dạng đối tượng ảnh viễn thám Nhắm đến việc giới thiệu các bài toán phổ biến trong lĩnh vực nhận dạng đối tượng trên ảnh viễn thám.
Việc sử dụng các kỹ thuật và phương pháp nhận dạng đối tượng trên ảnh viễn thám giúp cho việc phân tích và xử lý dữ liệu trở nên nhanh chóng và chính xác hơn, từ đó đem lại nhiều lợi ích cho các ứng dụng thực tiễn. Chương này sẽ giới thiệu về các lớp bài toán phổ biến trong nhận dạng đối tượng trên ảnh viễn thám bao gồm phân đoạn ảnh, phân loại ảnh, nhận dạng cạnh, phát hiện đối tượng. Ngoài ra, chương cũng sẽ giải thích chi tiết về mỗi lớp bài toán, cung cấp ví dụ và ứng dụng của chúng trong thực tiễn.1 Bài toán phân đoạn ảnh Bài toán phân đoạn ảnh (Image segmentation) trong nhận diện ảnh viễn thám là một trong những lớp bài toán quan trọng nhất. Bài toán này nhằm tìm cách phân chia ảnh thành các vùng khác nhau, mỗi vùng chứa các đối tượng tương tự nhau.
2 Phân đoạn ảnh có thể được sử dụng để xác định các khu vực đất trống, đất canh tác, đất rừng, đất ngập nước và các vùng khác trong ảnh viễn thám. Bằng cách phân đoạn ảnh, chúng ta có thể xác định vị trí của các đối tượng như rừng, đường, đồng cỏ, sông, hồ, v. từ đó giúp cho việc phân tích và xử lý ảnh trở nên dễ dàng và chính xác hơn. Để giải quyết bài toán phân đoạn ảnh trong nhận dạng ảnh viễn thám, có nhiều phương pháp được áp dụng như: phân đoạn dựa trên màu sắc, phân đoạn dựa trên hình dạng, phân đoạn dựa trên đặc trưng, phân đoạn dựa trên mô hình, v.
Một số ứng dụng của bài toán phân đoạn ảnh trong nhận dạng ảnh viễn thám bao gồm phân tích và giám sát sự biến đổi đất đai, phân tích các đối tượng trên bề mặt của trái đất, giám sát và theo dõi rừng, xác định đường bờ biển, v. Tuy nhiên, bài toán phân đoạn ảnh trong nhận dạng ảnh viễn thám cũng đặt ra một số thách thức, bao gồm độ phức tạp của dữ liệu, độ phân giải, cấu trúc và hình dạng của đối tượng. Do đó, việc lựa chọn phương pháp và công cụ phù hợp để giải quyết bài toán phân đoạn ảnh rất quan trọng để đảm bảo kết quả chính xác và hiệu quả. Bài toán phân đoạn ảnh bằng học sâu (Deep Learning based Image Segmentation) là một trong những phương pháp hiệu quả để giải quyết bài toán phân đoạn ảnh trong nhận dạng ảnh viễn thám.
Phương pháp này sử dụng các mô hình học sâu như Convolutional Neural Networks (CNN) để học và dự đoán phân đoạn ảnh. Một số mô hình học sâu phổ biến được sử dụng trong bài toán phân đoạn ảnh bao gồm: • U-Net: Đây là một trong những mô hình đầu tiên được sử dụng cho bài toán phân đoạn ảnh bằng học sâu. Nó sử dụng kiến trúc Encoder-Decoder với các kết nối tắt (Skip conection) để kết hợp thông tin từ các tầng Encoder và Decoder. • Mask R-CNN: Đây là một mô hình học sâu sử dụng trong bài toán phân đoạn ảnh và phát hiện đối tượng.
Nó kết hợp các lớp phân đoạn và phát hiện đối tượng bằng cách sử dụng một mạng CNN để trích xuất đặc trưng và một mô hình R-CNN để phát hiện và phân đoạn. • DeepLab: Đây là một mô hình phân đoạn ảnh sử dụng mạng ResNet và Atrous Spatial Pyramid Pooling (ASPP) để xác định kết quả phân đoạn. ASPP cho phép mô hình xem các vùng ảnh ở nhiều tỷ lệ và kết hợp các thông tin đó để phân đoạn. Phương pháp bài toán phân đoạn ảnh bằng học sâu có nhiều ưu điểm, bao gồm khả năng phát hiện và phân đoạn các vùng ảnh phức tạp, khả năng tự động học và tinh chỉnh các đặc trưng, độ chính xác cao hơn so với các phương pháp truyền thống.
Tuy nhiên, điều 3 quan trọng là việc sử dụng dữ liệu huấn luyện đủ lớn và đa dạng để đảm bảo kết quả chính xác và hiệu quả.2 Bài toán phân loại ảnh Bài toán phân loại ảnh (Image Classification) trong nhận diện ảnh viễn thám là quá trình phân loại ảnh thành các lớp đã được xác định trước. Mục đích của việc phân loại ảnh là giúp các nhà nghiên cứu và chuyên gia dễ dàng đưa ra các quyết định và dự đoán về các đối tượng, đặc tính của một khu vực hoặc một vùng đất nào đó. Bài toán phân loại ảnh bằng học sâu (Deep Learning Image Classification) là một trong những phương pháp tiên tiến nhất trong nhận diện ảnh viễn thám. Nó sử dụng các mạng neural truyền thống hoặc mạng neural sâu (Deep Neural Network - DNN) để học các đặc trưng trên ảnh và phân loại chúng vào các lớp đã được định nghĩa trước đó.
Các bước chính để giải quyết bài toán phân loại ảnh bằng học sâu bao gồm: • Chuẩn bị dữ liệu: Bao gồm việc chuẩn hóa và tiền xử lý dữ liệu, tạo ra các tập dữ liệu huấn luyện, xác nhận và kiểm tra. • Xây dựng mô hình DNN: sử dụng các kiến trúc mạng neural như Convolutional Neural Networks (CNN), ResNet, EfficientNet, v. để học các đặc trưng trên ảnh và phân loại chúng vào các lớp đã được định nghĩa trước đó. • Huấn luyện mô hình: sử dụng tập dữ liệu huấn luyện để đào tạo mô hình và điều chỉnh các tham số để đạt được hiệu suất tốt nhất.
• Đánh giá mô hình: sử dụng tập xác nhận và kiểm tra để đánh giá hiệu suất của mô hình và kiểm tra xem nó có đáp ứng được yêu cầu của bài toán hay không. Một số kiến trúc mạng neural sử dụng trong bài toán phân loại ảnh bao gồm: • Mạng nơ ron tích chập (Convolutional Neural Networks - CNN): đây là kiến trúc mạng neural được sử dụng phổ biến nhất trong bài toán phân loại ảnh. Kiến trúc này được thiết kế để học các đặc trưng tại các vùng ảnh khác nhau và từ đó phân loại chúng vào các lớp đã được định nghĩa trước đó. • Residual Network (ResNet): là một kiến trúc mạng neural sâu được đề xuất để giải quyết vấn đề mất thông tin khi mạng neural sâu trở nên quá sâu.
4 • EfficientNet: là một kiến trúc mạng neural mới nhất được đề xuất để giảm kích thước mô hình và tăng độ chính xác. Bài toán phân loại ảnh bằng học sâu có nhiều ứng dụng trong thực tế như phân loại các loại cây trồng, phân loại đất đai, phân loại thực vật, phân loại mây, phân loại đám mây, phân loại đường bộ, phân loại đường ray, phân loại nước và phân loại các vùng sạch hoặc ô nhiễm.3 Bài toán nhận dạng cạnh Bài toán nhận dạng cạnh (Edge Detection) trong nhận diện ảnh viễn thám là quá trình phát hiện các ranh giới giữa các vùng khác nhau trên ảnh. Các cạnh có thể được định nghĩa là sự thay đổi đột ngột của độ sáng giữa hai vùng trên ảnh. Mục đích của bài toán nhận dạng cạnh trong nhận diện ảnh viễn thám là phát hiện và định vị các cạnh giữa các vùng khác nhau trên ảnh, từ đó giúp phân tích và hiểu được bức ảnh đó.
Bài toán này có thể giúp xác định đường bờ biển, đường biên giới, các con đường, đường ray, sông và các đối tượng khác trong ảnh viễn thám.