Luận văn thạc sĩ về hệ thống phát hiện người đi bộ sử dụng mô hình YOLOv5 cải tiến

Luận văn thạc sĩ kỹ thuật nghiên cứu kỹ thuật viễn thông hệ thống phát hiện người đi bộ sử dụng mô hình yolov5 cải tiến, khảo sát thực trạng, phân tích nguyên nhân, đề xuất giải

Trường đại học

Trường Đại Học Bách Khoa

Người đăng

Ẩn danh

Thể loại

luận văn thạc sĩ

2024

137
6
1

Phí lưu trữ

35 Point

Tóm tắt

I. Tổng quan về đề tài

Đề tài 'Hệ thống phát hiện người đi bộ bằng mô hình YOLOv5 cải tiến' tập trung vào việc phát triển và cải thiện mô hình YOLOv5 nhằm nâng cao chất lượng phát hiện người đi bộ. Việc phát hiện người đi bộ là một thách thức lớn trong lĩnh vực thị giác máy tính, đặc biệt trong các tình huống đông người. Mô hình YOLOv5, với khả năng phát hiện nhanh chóng và chính xác, đã trở thành một trong những lựa chọn hàng đầu cho các ứng dụng thực tế như giám sát video và xe tự lái. Đề tài này không chỉ nghiên cứu lý thuyết mà còn thực hiện trên kit Jetson, cho thấy tính ứng dụng cao của mô hình trong thực tế.

1.1 Lý do chọn đề tài

Việc phát hiện người đi bộ là một vấn đề quan trọng trong nhận diện vật thể, có ứng dụng rộng rãi trong các hệ thống giao thông thông minh và an ninh. Mô hình YOLOv5 được chọn vì nó cung cấp sự cân bằng giữa độ chính xác và tốc độ phát hiện. Nghiên cứu này nhằm cải thiện khả năng phát hiện trong các tình huống phức tạp, nơi mà người đi bộ có thể chồng lấn lên nhau. Điều này không chỉ giúp nâng cao hiệu suất của hệ thống mà còn góp phần vào sự phát triển của công nghệ nhận diện trong các ứng dụng thực tế.

1.2 Thách thức trong thuật toán phát hiện người đi đường

Một trong những thách thức lớn nhất trong việc phát hiện người đi bộ là sự đa dạng về màu sắc và kiểu dáng quần áo. Các phụ kiện như túi xách hay ba lô cũng có thể làm thay đổi hình dạng của người đi bộ. Hơn nữa, trong các tình huống đông người, việc phát hiện chính xác người đi bộ trở nên khó khăn hơn do sự chồng lấn. Đề tài này hướng đến việc cải thiện khả năng phát hiện trong những tình huống này bằng cách kết hợp thông tin toàn diện và cục bộ, từ đó nâng cao độ chính xác của hệ thống.

II. Cơ sở lý thuyết

Chương này sẽ phân tích các khái niệm cơ bản liên quan đến mô hình YOLOv5 và các phiên bản trước đó. Mô hình YOLO đã trở thành một trong những cấu trúc phổ biến nhất cho phát hiện đối tượng trong thời gian thực. Các chỉ số như Precision, Recall và mAP sẽ được sử dụng để đánh giá hiệu suất của mô hình. Việc hiểu rõ về các thuật toán như Non-Max Suppression (NMS) và Intersection over Union (IoU) là rất quan trọng để cải thiện khả năng phát hiện. Chương này cũng sẽ đề cập đến các phương pháp tập trung trong thị giác máy tính, như Global Attention MechanismEfficient Channel Attention, nhằm tối ưu hóa quá trình phát hiện.

2.1 Tình hình nghiên cứu ngoài nước

Nghiên cứu về phát hiện người đi bộ đã thu hút sự quan tâm lớn từ cộng đồng khoa học. Nhiều nghiên cứu đã chỉ ra rằng các mô hình dựa trên học sâu, đặc biệt là YOLO, có khả năng phát hiện nhanh chóng và chính xác. Các nghiên cứu gần đây đã tập trung vào việc cải thiện độ chính xác và tốc độ của các mô hình này, với nhiều phương pháp mới được đề xuất. Việc áp dụng các mô hình này trong các lĩnh vực như xe tự lái và giám sát video đã chứng minh tính khả thi và hiệu quả của chúng.

2.2 Mạng Yolo Network

Mạng YOLO đã trải qua nhiều phiên bản, từ YOLOv1 đến YOLOv5, với mỗi phiên bản đều có những cải tiến đáng kể. YOLOv5, với cấu trúc mạng tối ưu và khả năng xử lý nhanh, đã trở thành lựa chọn hàng đầu cho nhiều ứng dụng thực tế. Chương này sẽ phân tích chi tiết về cấu trúc của YOLOv5, bao gồm các thành phần chính như Backbone, Head và các mô-đun tập trung. Việc hiểu rõ về cấu trúc này sẽ giúp trong việc phát triển và cải thiện mô hình cho các ứng dụng cụ thể.

III. Mô hình đề xuất cho mô đun Global Attention Mechanism

Mô-đun Global Attention Mechanism (GAM) được đề xuất nhằm cải thiện khả năng phát hiện của mô hình YOLOv5. Mô-đun này tập trung vào việc tối ưu hóa thông tin toàn diện từ các vùng khác nhau trong ảnh, giúp tăng cường độ chính xác trong việc phát hiện người đi bộ. Việc tích hợp GAM vào YOLOv5 không chỉ cải thiện độ chính xác mà còn giúp mô hình hoạt động hiệu quả hơn trong các tình huống phức tạp. Các thử nghiệm cho thấy rằng việc sử dụng GAM đã mang lại kết quả khả quan, với độ chính xác cao hơn so với các mô hình trước đó.

3.1 Đề xuất cho mạng Global Attention Mechanism

Đề xuất cho mô-đun GAM bao gồm việc sử dụng các kỹ thuật học sâu để tối ưu hóa quá trình phát hiện. Mô-đun này sẽ phân tích các đặc trưng toàn diện từ ảnh đầu vào, từ đó cải thiện khả năng phát hiện trong các tình huống đông người. Việc áp dụng GAM vào YOLOv5 đã cho thấy sự cải thiện đáng kể về độ chính xác và tốc độ phát hiện, giúp mô hình hoạt động hiệu quả hơn trong các ứng dụng thực tế.

3.2 Cấu trúc mới cho GAM

Cấu trúc mới cho mô-đun GAM được thiết kế để tối ưu hóa quá trình xử lý thông tin. Việc sử dụng các lớp shuffle và thay đổi hàm kích hoạt đã giúp cải thiện khả năng phát hiện của mô hình. Các thử nghiệm cho thấy rằng cấu trúc mới này không chỉ tăng cường độ chính xác mà còn giảm thiểu thời gian xử lý, từ đó nâng cao hiệu suất của hệ thống. Điều này cho thấy rằng việc cải tiến cấu trúc mô-đun là rất cần thiết để đáp ứng yêu cầu ngày càng cao trong lĩnh vực phát hiện người đi bộ.

09/02/2025

Trích đoạn nội dung tài liệu

CHƯƠNG 1: TỔNG QUAN VỀ ĐỀ TÀI Hiện nay lý thuyết và công nghệ xử lý ảnh và AI – Artifical Intelligence - Trí tuệ nhân tạo và đặc biệt hơn là Deep Learning (DL) - học sâu đã không còn quá xa lạ đối với cuộc sống con người, mặc dù chưa hoàn thiện nhưng nó vẫn là khía cạnh cần thiết để có thể hỗ trợ và giúp đời sống con người tiện lợi hơn. Nhận diện vật thể là một thách thức trong lĩnh vực thị giác máy tính. Trong những năm gần đây với sự phát triển nhanh chóng của DL, các vấn đề đã được nghiên cứu chuyên sâu và đã cho những kết quả vượt trội về nhận diện vật thể và những vấn đề liện quan như phân loại vật thể, định vị và phân đoạn vật thể Một phần được xem quan trọng nhất trong việc nhận dạng vật thể đó là nhận dạng người đi đường. Có nhiều ứng dụng điển hình cho việc áp dụng nó như hệ thống xe tự lái, hệ thống tự động lái xe vào bãi đỗ, theo dõi và phân tích lượng xe trên đường để đưa ra tín hiệu hợp lý cho đèn giao thông, hệ thống camera giám sát ở những khu dân cư.1 Lý do chọn đề tài Tổng quan hơn, thì nhận dang người đi đường luôn là một vấn đề khó trong nhận dạng vật thể.

Trong nhận dạng vật thể nói chung và nhận diện người đi đường nói riêng thì các đối tượng sẽ được phân loại bằng hai cách chính. Phân loại thứ nhất là 1 chặng hoặc 2 chặng để phát hiện vật thể. Với phương pháp 2 chặng thì nó sẽ tập trung chính vào việc chọn 1 số vùng có khả năng chứa vật thể thông qua những cấu trúc phức tạp. Đối với 1 chặng thì sẽ tập trung vào toàn các vùng và đưa ra xác suất vật thể đó là gì trong 1 luồng của cấu trúc.

Trên thực tế thì độ chính xác của hệ thống áp dụng phương pháp 2 chặng sẽ cao hơn, nhưng thời gian đáp ứng sẽ thấp hơn rất nhiều. Đồng thời với sự phát triển của phương pháp 1 chặng thì đôi lúc độ chính xác đạt vượt qua phương pháp 2 chặng nhưng tốc độ đáp ứng vẫn nhanh hơn rất nhiều. Hiện nay Yolo là một phương pháp nhận diện vật thể 1 chặng rất tốt. So sánh về hiệu năng giữa Yolo và Fast-RCNN – phương pháp 2 chặng thì độ chính xác trung bình là 63.4 và 70 tương ứng nhưng tốc độ đáp ứng của Yolo thì nhanh hơn 300 lần so với Fast-RCNN [1].

1 Hệ thống phát hiện người đi bộ sử dụng mô hình Yolov5 cải tiến GVHD: PGS.TS Trương Quang Vinh 1.2 Thách thức trong thuật toán phát hiện người đi đường Một trong những biến số thay đổi nhiều nhất khi giải quyết bài toán nhận dạng người đi đường đó là màu sắc và các loại quần áo của người đi bộ. Thêm vào đó một số phụ kiện có thể làm thay đổi hình dạng người đi đường như túi xách, ba lô hoặc bao tay. Ngoài ra rất nhiều trường hợp việc người đi bộ xuất hiện nhiều và chồng lấn lên nhau trong một vùng hình ảnh như hình 1.1: Frame ảnh chứ người đi đường chống lấn lên nhau được phát hiện bằng việc trích xuất thông tin toàn bộ và cục bộ [2] Các phương pháp trước đây để phát hiện người đi bộ đã sử dụng diện mạo toàn bộ cơ thể, hình dáng chân dung, hoặc một tập hợp các đặc trưng cục bộ. Đến ngày nay, chưa có phương pháp nào đã được đánh giá để phát hiện người đi bộ trong các tình huống đông người với sự chồng chéo trong vùng hình ảnh, mặc dù những loại tình huống này thường xuyên xảy ra trong các ứng dụng thực tế.

Mục tiêu là làm cho hệ thống có thể cải thiện số lượng phát hiện người đi bộ bị chồng lấn có trong frame ảnh. Các hệ thống hiệu quả phải tận dụng các ưu điểm của nhiều phương pháp, sử dụng cả diện mạo và dấu hiệu hình dạng, và tích hợp cả thông tin global và local (toàn diện và cục bộ).3 Nội dung Luận Văn Từ nghiên cứu tổng quan và tình hình nghiên cứu ngoài nước, đề tài thực hiện trong luận văn này là: 2 Hệ thống phát hiện người đi bộ sử dụng mô hình Yolov5 cải tiến GVHD: PGS.TS Trương Quang Vinh ❖ Phát triển và cải thiện mô hình Yolov5 để tăng chất lượng phát hiện người đi bộ của hệ thống. ❖ Hiện thực giải thuật trên kit Jetson (hoặc là GPU).4 Đóng góp của Luận Văn Đóng góp chính của Luận Văn sẽ là việc đưa ra thuật toán mới cho mô-đun tập trung là M-GAM và M-ECA. Từ đó sẽ đưa ra cấu trúc mới cho mô hình Yolo phiên bản 5.

Chương 3,4, và 5 sẽ trình bày chi tiết về thuật toán. Chương 6 và 7 sẽ trình bày kết quả và quá trình thực hiện trên kit Jetson Orin Nano.5 Cấu trúc Luận Văn Nội dung của Luận Văn sẽ được chia thành 8 chương. Chương 2 sẽ phân tích về cơ sở lý thuyết gồm cấu trúc, lịch sử của mạng Yolo và cấu trúc tập trung trong thị giác máy tính. Chương 3 sẽ đưa ra đề xuất về mô-đun tập trung GAM.

Chương 4 sẽ đưa ra đề xuất cho mô-đun tập trung M-ECA. Chương 5 sẽ đề xuất cấu trúc của mạng Yolo mới. Chương 6 sẽ trình bày kết quả về hiệu quả của phương thức mới thông qua các chỉ số Precesion, Recall, mAP. Đồng thời so sánh, phân tích kết quả đạt được với các bài báo cũng như version Yolo khác.

Chương 7 sẽ nghiên cứu và hiện thực giải thuật đó trên GPU đồng thời đo đạc runtime của thuật toán với kit Jetson NVIDIA. Chương 8 sẽ đưa ra phần mở rộng các ứng dụng có thể áp dụng kết quả của Luận Văn trong thực tế và các hướng phát triển của nó. 3 Hệ thống phát hiện người đi bộ sử dụng mô hình Yolov5 cải tiến GVHD: PGS.TS Trương Quang Vinh CHƯƠNG 2: CƠ SỞ LÝ THUYẾT YOLO đã trở thành một cấu trúc thường được ứng dụng cho các hệ thống phát hiện đối tượng thời gian thực cho robot, xe không người lái và ứng dụng giám sát video. Trong chương 2, sẽ phân tích toàn diện về sự tiến triển của YOLO, xem xét về các đổi mới và đóng góp trong mỗi phiên bản từ YOLO gốc đến YOLOv5.

Bắt đầu bằng cách mô tả các chỉ số tiêu chuẩn và quy trình xử lý sau đó sẽ thảo luận về những thay đổi chính trong kiến trúc mạng trong mỗi phiên bản. Đồng thời cũng nêu lên cơ sở lý thuyết của cơ chế tập trung, tích hợp vào mạng nơ-ron.1 Tình hình nghiên cứu ngoài nước Xem xét một số nguồn tài liệu từ nước ngoài, dưới đây là một số nhận xét và tổng hợp từ các tài liệu tham khảo liện quan đến việc sử dung Yolo phát hiện người đi bộ. Trong tài liệu Adaptive Fusion of Multi Scale YOLO for Pedestrian Detection [3] của tác giả Hsu và Lin đưa ra thách thức chính là độ chính xác và đa dạng về tỷ lệ hình ảnh nhận được về mô hình nhận diện người đi đường. Trong bài báo này chúng ta sẽ nghiên cứu theo hướng sẽ nhận diện vật thể trong khung hình rồi đưa ra thuật toán chia để trị để giải quyết vấn đề nói trên.

Như chúng ta thấy hình 2.1a là 1 mẫu thử cơ bản trong trạng thái bình thường, hình 2.1b đước trải dài gấp 3 lần hình 2.1d được thay đổi tỷ lệ. Chúng ta thấy vấn đề ở đây là đối tượng người đi bộ trong hình ảnh bị thay đổi quá lớn thậm chí không thể phát hiện được sau khi thay đổi tỷ lệ. Đồng thới những ngưới đi bộ có trang phục giống với hình nền của ảnh thì dường như bị mất thông tin trong quá trình phát hiện vật thể. Để giải quyết tình trạng này thì tác giả sẽ đưa ra model mới lấy nền tảng trên Yolov4.

Đầu vào của hệ thống là chiều dài và rộng của hình ảnh, sau đó thay đổi tỷ lệ lại và truyền thông tin đó vào mạng lưới nhận dạng đối tượng (CNN Model) như hình 2. Tiếp theo sẽ chia nhỏ những đối tượng không chồng lấn. Cuối cùng dùng bộ thích nghi để dung hợp 2 hình ảnh con lại và đưa ra hình ảnh cuối cùng với hiệu năng cao hơn. 4 Hệ thống phát hiện người đi bộ sử dụng mô hình Yolov5 cải tiến GVHD: PGS.TS Trương Quang Vinh Hình 2.1: Hình ảnh chứa người đi bộ bị co giãn khi qua mạng nơ-ron Đầu tiên hệ thống sẽ lấy thông tin của khung ảnh sau đó tỷ lệ hình ảnh sẽ được thay đổi.

Tiếp tục khung ảnh đó sẽ được đưa vào convolution neural network (CNN). Từ kết quả nhận dạng các bouding box, hệ thống sẽ phân mảnh thành các ảnh con với tỷ lệ khác nhau. Ảnh con sẽ chứa dối tượng mà không chồng lấn với nhau (trong hệ thống, hình xanh lá cây sẽ có chồng lấn, hình xanh dương không chồng lấn). Thuật toán được mô tả trong hình 2.

5 Hệ thống phát hiện người đi bộ sử dụng mô hình Yolov5 cải tiến GVHD: PGS.TS Trương Quang Vinh Hình 2.2: Ảnh được thay đổi kích thước sau đó được chia ra thành 2 ảnh con trước khi qua bộ thích nghi tương ứng Sau đó các hình ảnh con này được tiếp tục chuyển vào CNN để tiếp tục nhận diện các đặc điểm của vật thể. Cuối cùng bộ thích nghi dung hợp (Multi resolution adaptive fusion) được sử dụng để kết hợp 2 ảnh con lại và cho ra kết quả cuối cùng (góc trái).3: Kết quả đạt được khi sử dụng phương pháp mới Kết quả cho thấy độ chính xác trung bình mAP sẽ được cải thiện từ 87.4% so với Yolov3, 90.5% so với Yolov4 sẽ tăng lên 91.6% so với mô hình mới. Kết quả ở hình 2.3 được huấn luyện và đánh giá trên cùng một tập dữ liệu VOC [3]. 6 Hệ thống phát hiện người đi bộ sử dụng mô hình Yolov5 cải tiến GVHD: PGS.TS Trương Quang Vinh Thêm vào đó bài báo Deep-Learning Based Pedestrian Direction Detection for Anti-collision of Intelligent Self-propelled Vehicles [5] của Lin và các cộng sự đưa ra vấn đề cần phát hiện người đi bộ đồng thời phải phát hiện ra được hướng đi của người đi bộ.

Mục đích của việc này là để triển khai mô hình trên một robot trong trung tâm thương mại giúp cho robot có thể tránh được người đi bộ trong quá trình vận hành. Trong bài bào này Lin và các cộng sự của mình đã cải thiện Yolov2. Đề xuất là đưa ra một mạng mới Yolo-PD với trọng số nhẹ (leightweights) bằng việc giàm các lớp trong mô hình Yolov2 xuống để cải thiện tốc độ xử lý thời gian thực nhưng đồng thời chỉ số precision phải được cải thiện.4 mô tả dataset khi được đánh mã, sẽ có 6 hướng Back, Right, Front Right, Front, Front Left, Left.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Bài viết "Hệ thống phát hiện người đi bộ bằng mô hình YOLOv5 cải tiến trong luận văn thạc sĩ kỹ thuật viễn thông" trình bày một hệ thống tiên tiến sử dụng mô hình YOLOv5 để phát hiện người đi bộ, nhằm nâng cao độ chính xác và hiệu suất trong các ứng dụng an toàn giao thông. Bài viết không chỉ giải thích chi tiết về cách thức hoạt động của mô hình mà còn nêu rõ những cải tiến so với các phiên bản trước, từ đó mang lại lợi ích lớn cho các nhà nghiên cứu và kỹ sư trong lĩnh vực nhận diện đối tượng.

Nếu bạn quan tâm đến các ứng dụng khác trong lĩnh vực nhận diện, hãy khám phá thêm về nghiên cứu và phát triển chương trình nhận diện xe ô tô và người đi bộ, nơi bạn sẽ tìm thấy những thông tin bổ ích về công nghệ nhận diện trong giao thông. Ngoài ra, bài viết về nhận dạng thông số của rôbôt bằng giải thuật PSO cũng sẽ giúp bạn hiểu rõ hơn về ứng dụng của các thuật toán trong việc nhận diện và điều khiển. Cuối cùng, đừng bỏ lỡ luận văn thạc sĩ khoa học máy tính rút trích nét đối tượng, nơi bạn có thể tìm hiểu thêm về các phương pháp rút trích và nhận diện đối tượng trong hình ảnh. Những tài liệu này sẽ mở rộng kiến thức của bạn về công nghệ nhận diện và ứng dụng của nó trong thực tiễn.