Nghiên Cứu và Ứng Dụng Centroid Triplet Loss cho Bài Toán Nhận Dạng Lại Người

Luận văn tốt nghiệp toán học nghiên cứu tốt nghiệp khoa học máy tính tìm hiểu và áp dụng centroid triplet loss cho bài toán person re, điều tra thực trạng, phân tích số liệu, đề

Chuyên ngành

Công nghệ thông tin

Người đăng

Ẩn danh

Thể loại

khóa luận

2023

79
2
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

TÓM TẮT KHÓA LUẬN

1. CHƯƠNG 1: TỔNG QUAN

1.1. Đặt vấn đề

1.2. Mục tiêu và phạm vi

1.3. Đóng góp của khóa luận

1.4. Cấu trúc khóa luận

1.5. Kết chương

2. CHƯƠNG 2: BÀI TOÁN PERSON RE-ID VÀ CÁC NGHIÊN CỨU LIÊN QUAN

2.1. Mở đầu

2.2. Giới thiệu bài toán person re-ID

2.3. Các hướng tiếp cận

2.3.1. Local feature learning

2.3.2. Generative adversarial learning

2.3.3. Deep metric learning

3. CHƯƠNG 3: CENTROID TRIPLET LOSS ÁP DỤNG TRONG BÀI TOÁN PERSON RE-ID

3.1. Tổng quan về Centroid triplet loss (CTL)

3.2. Triplet loss và những hạn chế

3.3. Áp dụng CTL cho bài toán person re-ID

4. CHƯƠNG 4: THỰC NGHIỆM VÀ ĐÁNH GIÁ

4.1. Mở đầu

4.2. Xây dựng tập dữ liệu

4.2.1. Quá trình thu thập dữ liệu

4.2.2. Quá trình tiền xử lý dữ liệu

4.3. Một số độ đo đánh giá

4.3.1. Đường cong CMC (Cumulative Matching Characteristics)

4.4. Kết quả thực nghiệm và đánh giá

4.4.1. Phân tích định lượng

5. CHƯƠNG 5: KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

5.1. Kết luận

5.2. Hướng phát triển

TÀI LIỆU THAM KHẢO

DANH SÁCH HÌNH VẼ

DANH SÁCH BẢNG

DANH MỤC TỪ VIẾT TẮT

Tóm tắt

I. Tổng quan về Nghiên cứu Centroid Triplet Loss trong Nhận dạng lại người

Nghiên cứu về Centroid Triplet Loss trong lĩnh vực nhận dạng lại người (Person Re-ID) đang thu hút sự chú ý lớn từ cộng đồng nghiên cứu. Với sự phát triển nhanh chóng của công nghệ giám sát, việc nhận diện và theo dõi người qua nhiều camera trở thành một thách thức lớn. Centroid Triplet Loss là một phương pháp cải tiến cho hàm triplet loss, giúp tối ưu hóa quá trình học và nâng cao độ chính xác trong việc nhận diện. Bài viết này sẽ cung cấp cái nhìn tổng quan về phương pháp này và ứng dụng của nó trong thực tiễn.

1.1. Ứng dụng của Centroid Triplet Loss trong Nhận dạng khuôn mặt

Phương pháp Centroid Triplet Loss được áp dụng rộng rãi trong việc nhận dạng khuôn mặt. Nó giúp cải thiện độ chính xác bằng cách tối ưu hóa khoảng cách giữa các đặc trưng của khuôn mặt trong không gian đặc trưng. Việc này giúp phân loại chính xác hơn các hình ảnh của cùng một người từ nhiều góc độ khác nhau.

1.2. Tại sao Centroid Triplet Loss lại quan trọng trong lĩnh vực này

Với sự gia tăng của các hệ thống giám sát thông minh, Centroid Triplet Loss trở thành một công cụ quan trọng trong việc cải thiện hiệu suất của các mô hình nhận diện. Nó giúp giảm thiểu các lỗi nhận diện do sự thay đổi trong điều kiện ánh sáng và góc nhìn, từ đó nâng cao độ tin cậy của hệ thống.

II. Thách thức trong Nhận dạng lại người và Giải pháp Centroid Triplet Loss

Bài toán nhận dạng lại người gặp nhiều thách thức, bao gồm sự thay đổi về ngoại hình, chất lượng hình ảnh và sự tương đồng giữa các đối tượng khác nhau. Centroid Triplet Loss được phát triển để giải quyết những vấn đề này bằng cách tối ưu hóa khoảng cách giữa các đặc trưng của hình ảnh. Phương pháp này không chỉ giúp cải thiện độ chính xác mà còn giảm thiểu thời gian xử lý.

2.1. Các vấn đề chính trong Nhận dạng lại người

Một trong những vấn đề lớn nhất trong nhận dạng lại người là sự thay đổi về ngoại hình. Các yếu tố như trang phục, kiểu tóc và ánh sáng có thể làm giảm độ chính xác của mô hình. Centroid Triplet Loss giúp giảm thiểu những ảnh hưởng này bằng cách tối ưu hóa các đặc trưng của hình ảnh.

2.2. Giải pháp từ Centroid Triplet Loss

Phương pháp Centroid Triplet Loss cung cấp một cách tiếp cận mới để tối ưu hóa các đặc trưng của hình ảnh. Bằng cách sử dụng các centroid để đại diện cho các nhóm hình ảnh, phương pháp này giúp cải thiện độ chính xác trong việc phân loại và nhận diện người.

III. Phương pháp áp dụng Centroid Triplet Loss trong Nhận dạng lại người

Việc áp dụng Centroid Triplet Loss trong nhận dạng lại người bao gồm nhiều bước quan trọng. Đầu tiên, cần thu thập dữ liệu hình ảnh từ nhiều nguồn khác nhau. Sau đó, các mô hình học sâu sẽ được huấn luyện để tối ưu hóa hàm mất mát. Cuối cùng, kết quả sẽ được đánh giá để xác định hiệu suất của mô hình.

3.1. Quy trình thu thập và xử lý dữ liệu

Quy trình thu thập dữ liệu bao gồm việc chụp hình ảnh từ nhiều camera khác nhau. Sau đó, các hình ảnh này sẽ được xử lý để loại bỏ nhiễu và chuẩn hóa kích thước. Điều này giúp đảm bảo rằng dữ liệu đầu vào cho mô hình là đồng nhất và chất lượng cao.

3.2. Huấn luyện mô hình với Centroid Triplet Loss

Mô hình sẽ được huấn luyện bằng cách sử dụng Centroid Triplet Loss để tối ưu hóa khoảng cách giữa các đặc trưng của hình ảnh. Quá trình này giúp mô hình học cách phân biệt các đối tượng khác nhau một cách hiệu quả hơn.

IV. Kết quả nghiên cứu và ứng dụng thực tiễn của Centroid Triplet Loss

Kết quả nghiên cứu cho thấy rằng Centroid Triplet Loss có thể cải thiện đáng kể độ chính xác trong nhận dạng lại người. Các thử nghiệm trên tập dữ liệu thực tế cho thấy mô hình sử dụng phương pháp này có hiệu suất cao hơn so với các phương pháp truyền thống. Điều này mở ra nhiều cơ hội ứng dụng trong các lĩnh vực như an ninh và giám sát.

4.1. Kết quả thực nghiệm trên tập dữ liệu

Các thử nghiệm cho thấy rằng mô hình sử dụng Centroid Triplet Loss đạt được độ chính xác cao hơn 10% so với các mô hình khác. Điều này chứng tỏ rằng phương pháp này có thể cải thiện hiệu suất nhận diện trong các điều kiện thực tế.

4.2. Ứng dụng trong thực tiễn

Phương pháp Centroid Triplet Loss đã được áp dụng trong nhiều hệ thống giám sát an ninh, giúp cải thiện khả năng nhận diện và theo dõi đối tượng. Điều này không chỉ nâng cao hiệu quả công việc mà còn giảm thiểu rủi ro trong các tình huống an ninh.

V. Kết luận và hướng phát triển tương lai của Centroid Triplet Loss

Tóm lại, Centroid Triplet Loss là một phương pháp hứa hẹn trong lĩnh vực nhận dạng lại người. Nó không chỉ giải quyết được nhiều thách thức hiện tại mà còn mở ra hướng đi mới cho các nghiên cứu trong tương lai. Việc tiếp tục cải tiến và phát triển phương pháp này sẽ giúp nâng cao hiệu suất của các hệ thống nhận diện.

5.1. Tương lai của Centroid Triplet Loss

Với sự phát triển không ngừng của công nghệ, Centroid Triplet Loss có thể được cải tiến để đáp ứng tốt hơn các yêu cầu trong thực tiễn. Các nghiên cứu tiếp theo có thể tập trung vào việc tối ưu hóa thuật toán và mở rộng ứng dụng của nó.

5.2. Đề xuất nghiên cứu tiếp theo

Các nghiên cứu tiếp theo nên xem xét việc kết hợp Centroid Triplet Loss với các phương pháp học sâu khác để cải thiện độ chính xác và hiệu suất. Điều này có thể mở ra nhiều cơ hội mới trong lĩnh vực nhận diện và theo dõi người.

10/07/2025
Khóa luận tốt nghiệp khoa học máy tính tìm hiểu và áp dụng centroid triplet loss cho bài toán person re identification

Trích đoạn nội dung tài liệu

Mở đầu Để hiểu rõ bài toán person re-ID, ta cần làm rõ các khái niệm liên quan, đồng thời tìm hiểu một số phương pháp tiếp cận hiện nay. Vì vậy, trong chương này, tôi sẽ giới thiệu một số khái niệm cơ bản đồng thời khảo sát các hướng tiếp cận để giải quyết bài toán.2 Giới thiệu bài toán person re-ID Person re-Id là nhiệm vụ liên kết hình ảnh của cùng một người được chụp từ các máy ảnh khác nhau hoặc cùng một máy ảnh trong các thời điểm khác nhau. Mục tiêu của bài toán person re-ID là tìm kiếm sự xuất hiện một người từ nhiều camera tại những thời điểm khác nhau. Person re-ID được ứng dụng để giải quyết các bài toán trong các lĩnh vực an ninh như: theo dõi mục tiêu qua nhiều camera,.

Dé theo dõi mục tiêu trên nhiều camera với phương pháp thủ công là huy động nhân lực để theo dõi cần nhiều thời gian và công sức. Do đó cần có phương pháp thực hiện công việc này một cách tự động, đó là lý do person re-ID ngày càng được quan tâm và nghiên cứu. Bài toán person re-ID có hai hướng tiếp cận phổ biến là: phương pháp học các đặc điểm nổi bật của người trong hình ảnh và các phương pháp học dựa việc học cách biểu diễn các đặc trưng ảnh. Các hướng tiếp cận này sẽ được thảo luận cụ thể trong các mục tiếp theo.

Các hướng tiếp cận Dựa trên việc học các đặc điểm phân biệt của người trong ảnh, bài toán person re-ID có hai hướng tiếp cận chính hiện nay [1]: phương pháp hoc dựa trên các đặc điểm nổi bật và phương pháp học cách biểu diễn các đặc trưng ảnh. Phương pháp học các đặc điểm nổi bật của người trong ảnh chủ yếu tập trung vào việc thiết kế các chiến lược giúp tìm kiếm các vùng nổi bật của một hình ảnh người từ đó tìm kiếm các hình ảnh của cùng một người bằng cách so sánh độ tương đồng của các vùng này. Phương pháp này thường sử dụng khi góc nhìn về các hình ảnh của cùng một người có sự thay đổi không lớn, các đặc điểm hình dáng bên ngoài của các người khác nhau là tương đối khác nhau. Nhưng khi khi góc nhìn thay đổi đủ lớn, các đặc tính hình dáng có nhiều điểm tương đồng hoặc miễn ảnh nền của các hình ảnh khá giống nhau thì phương pháp này thường cho kết quả không tốt.

Dựa trên sự phát triển của các mạng thần kinh sâu, rất nhiều phương pháp dựa trên phương pháp học các biểu diễn tính năng của hình ảnh đã ra đời và ngày càng có các kết quả tốt hơn: * Local Feature Learning: phương pháp nay học đặc điểm cục bộ ở theo từng phần sau đó kết hợp để tạo thành một biểu diễn kết hợp cho mỗi hình ảnh người. * Generative Adversarial Learning: hoc cách biểu diễn các đặc trưng của hình ảnh với đa dạng ngữ cảnh, học các đặc điểm ngoại cảnh của hình ảnh này để làm ngoại cảnh cho hình ảnh khác hoặc trích xuất các đặc điểm bat biên. * Deep Metric Learning: Ý tưởng của phương pháp này là việc thiết kế các hàm mất mát tốt hơn để đào tạo mô hình. Các hàm mat mát phổ biến đối với peron Re-ID bao gồm: classification loss, verification loss, contrastive loss, triplet loss and quadruplet loss.

Các mô hình có hiệu xuất tốt thường sử dụng kết hợp các hàm mất mát(hàm loss) lại với nhau để tận dụng ưu điểm và hạn chế các ưu điểm của nhau. Local feature learning Generative Học các đặc adversarial trưng learning Deep metric learning Hình 2.1: Các hướng tiếp cận phổ biến hiện nay cho bài toán Person Re-ID Ở các phần tiếp theo chúng tôi sẽ nêu chỉ tiết về các phương pháp được đề xuất ở trong các hướng tiếp cận, các hướng này tập trung vào việc xây dựng các mạng dựa trên ý tưởng về mạng của học sâu.1 Local feature learning Dựa trên các đặc điểm được trích xuất từ hình ảnh người, các phương pháp person Re-ID có thể được phân thành các phương pháp dựa trên học đặc điểm toàn cục và phương pháp dựa trên học đặc điểm cục bộ. Các phương pháp học đặc trưng toàn cục thường trích xuất một đặc trưng cụ thể của hình ảnh người [4], phương pháp này rất khó nắm bắt thông tin, những đặc điểm chỉ tiết về người trong ảnh. Do đó, làm thế nào để trích xuất các đặc điểm phân biệt cục bộ của hình ảnh người với sự khác biệt tinh tế trở thành một van dé đáng quan tâm: « Phương pháp dựa trên học tập tính năng cục bộ nhằm mục dich học các tính năng phân biệt dành cho hình ảnh người và đảm bảo sự liên kết của từng tính năng địa phương.

Chú thích thủ công hoặc mạng thần kinh thường được sử dụng để tự động tập trung vào các vùng cục bộ nhất định với thông tin chính và trích xuất các đặc trưng phân biệt từ các vùng này. * Các phương pháp được sử dụng phổ biến gồm: chia hình ảnh thành các được xác định dé học các đặc trưng từng ving[5](Predefined stripe seg- mentation), kết hợp học các Fearture maps 6 nhiều tỷ lệ khác nhau[6](Multi- scale fusion), học việc tìm ra các khu vực có tác động lớn hơn trên các FM và tập trung mô hình vào các bộ phận cục bộ có tính phân biệt của ngoại hình cơ thể để điều chỉnh khác biệt giữa các hình ảnh cùng một người, loại bỏ nhiễu từ background[7] (soft attention), khai thác ngữ nghĩa dành cho hình ảnh người [8] và học đặc trưng toàn cục kết hợp với các đặc trưng cục bộ. Nhìn chung, phương pháp Predefined stripe segmentation là phương pháp phân đoạn khó và yêu cầu độ liên kết hình ảnh cao. Với sự thay đổi của chế độ xem camera cảnh thực và tư thế của người đi bộ, chiến lược phân đoạn cố định không thể giải quyết tốt van dé các đặc điểm phân biệt của người phân bố rất khác nhau ở từng hình anh.

Phương pháp Multi-scale fusion có thể tìm hiểu các tín hiệu sâu hơn của hình ảnh người đi bộ, nhưng sẽ có các tính năng dư thừa và xung đột khi kết hợp ở các tỷ lệ khác nhau. Soft attention chi tập trung vào các đặc điểm cục bộ của hình ảnh người và rất dễ bỏ qua các đặc điểm nổi bật của các khu vực ngoài đặc điểm của người trong ảnh. Phương pháp trích xuất ngữ nghĩa có thể định vị chính xác các đặc điểm cục bộ của người đi bộ bằng cách học thông tin cấu trúc của tư thế người đi bộ, nhưng nó yêu cầu tính toán bổ sung các mô hình học thông tin về các tư thế. Phương pháp học đặc trưng toàn cầu kết hợp cục bộ có thể sử dụng hiệu quả các lợi thế bổ sung của các đặc trưng toàn cục và cục bộ và là một trong những phương pháp phổ biến được các nhà nghiên cứu sử dụng để cải thiện hiệu suất mô hình, tuy nhiên việc xây dựng các mô hình mạng để phân chia các vùng phục vụ cho việc học các đặc điểm từng vùng và kết hợp với các đặc điểm toàn cục là rất khó khăn và có thể tốn nhiều chi phí.2 Generative adversarial learning Năm 2014, mang GAN xuất hiện và tao hình ảnh là một trong những ứng dung quan trọng của GAN được sử dụng cho bài toán person Re-ID.

Trong giai đoạn đào tạo, bộ tạo G4 chuyển đổi hình ảnh A thành hình ảnh B với nhiễu ngẫu nhiên, trình tao Gg chuyển đổi hình ảnh B thành hình anh A va bộ phân biệt Dg xác định xem hình ảnh được tạo B có gần giống với hình ảnh gốc B (thật hay giả ). Bộ tạo Generator và bộ phân biệt Discriminator được sử dụng cho đến khi mô hình hội tụ bằng cách giảm thiểu giá trị hàm loss của bộ phân biệt va L¿ loss. Có nghiên cứu đã sử dụng GAN để chuyển đổi kiểu hình ảnh hoặc thống nhất các kiểu hình ảnh khác nhau để giảm thiểu sự khác biệt về kiểu hình ảnh giữa 10 Taal cc ca ¬ i lỊ Discriminator De Real or Puke ? Hình 2.2: Sơ đồ quy trình làm việc của GAN để tạo hình anh[1]. các bộ dữ liệu khác nhau hoặc trong cùng một bộ dữ liệu [10].

Một số công trình đã sử dụng GAN để tổng hợp hình ảnh người với tư thé, ánh sáng và độ phân giải khác nhau nhằm bổ sung thêm cho bộ dữ liệu nhằm nâng cao khả năng khái quát hóa của mô hình [11] với các trường hợp khác nhau. Các phương pháp này có thể giảm bớt hạn chế về số lượng dif liệu không đủ cho việc đào tạo hoặc tạo sự đa dạng hình ảnh về độ phân giải hình ảnh, các hình ảnh với lượng ánh sáng khác nhau, góc độ xem ảnh qua camera và biến thể tư thé người trong ảnh. Với các đặc điểm và ứng dụng của GAN, [1] chia các phương pháp person Re-ID dựa trên ứng dụng việc tạo ảnh từ GAN thành ba loại: học chuyển kiểu hình ảnh-hình ảnh, tăng cường dữ liệu va học tính năng bắt biến. s Đối với các phương pháp chuyển kiểu hình ảnh-hình ảnh, GAN đã sử dụng background, độ phân giải, ánh sáng và các đặc điểm của hình ảnh khác nhau và kết hợp các đặc điểm này sang các hình ảnh khác để tạo sự đa dạng về bối cảnh cho các hình ảnh của cùng một người.

« Đối với các phương pháp tăng cường dữ liệu, các nhà nghiên cứu tập trung nâng cao chất lượng dữ liệu, tạo sự đa dạng về mẫu được tạo bởi GAN để 11 mở rộng tập dif liệu đã được sử dung để tăng khả năng học các biểu diễn tính năng. « Đối với phương pháp học các tính năng học bất biến, GAN được sử dụng để học học các tính năng liên quan đến việc nhận diện danh tính của một người không phụ thuộc vào nhiễu (giảm sự phụ thuộc về tư thế, ánh sáng, độ phân giải,. của hình ảnh). Với hiệu quả tuyệt vời của GAN trong việc tạo ảnh từ ảnh gốc, các mô hình học cách biểu diễn tính năng sẽ có tính tổng quát hơn trong việc biểu diễn các tính năng của ảnh.

Tuy nhiên, cũng có những rủi ro gặp phải khi việc trình tạo ảnh của GAN tạo ra các ảnh không có giá trị cao trong việc học các đặc điểm, hoặc vô tình tạo ra các nhiễu cho tập dữ liệu do kết hợp nhiều yếu tố.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ