CHƯƠNG 1: TỔNG QUAN VỀ ĐỀ TÀI Hiện nay lý thuyết và công nghệ xử lý ảnh và AI – Artifical Intelligence - Trí tuệ nhân tạo và đặc biệt hơn là Deep Learning (DL) - học sâu đã không còn quá xa lạ đối với cuộc sống con người, mặc dù chưa hoàn thiện nhưng nó vẫn là khía cạnh cần thiết để có thể hỗ trợ và giúp đời sống con người tiện lợi hơn. Nhận diện vật thể là một thách thức trong lĩnh vực thị giác máy tính. Trong những năm gần đây với sự phát triển nhanh chóng của DL, các vấn đề đã được nghiên cứu chuyên sâu và đã cho những kết quả vượt trội về nhận diện vật thể và những vấn đề liện quan như phân loại vật thể, định vị và phân đoạn vật thể Một phần được xem quan trọng nhất trong việc nhận dạng vật thể đó là nhận dạng người đi đường. Có nhiều ứng dụng điển hình cho việc áp dụng nó như hệ thống xe tự lái, hệ thống tự động lái xe vào bãi đỗ, theo dõi và phân tích lượng xe trên đường để đưa ra tín hiệu hợp lý cho đèn giao thông, hệ thống camera giám sát ở những khu dân cư.1 Lý do chọn đề tài Tổng quan hơn, thì nhận dang người đi đường luôn là một vấn đề khó trong nhận dạng vật thể.
Trong nhận dạng vật thể nói chung và nhận diện người đi đường nói riêng thì các đối tượng sẽ được phân loại bằng hai cách chính. Phân loại thứ nhất là 1 chặng hoặc 2 chặng để phát hiện vật thể. Với phương pháp 2 chặng thì nó sẽ tập trung chính vào việc chọn 1 số vùng có khả năng chứa vật thể thông qua những cấu trúc phức tạp. Đối với 1 chặng thì sẽ tập trung vào toàn các vùng và đưa ra xác suất vật thể đó là gì trong 1 luồng của cấu trúc.
Trên thực tế thì độ chính xác của hệ thống áp dụng phương pháp 2 chặng sẽ cao hơn, nhưng thời gian đáp ứng sẽ thấp hơn rất nhiều. Đồng thời với sự phát triển của phương pháp 1 chặng thì đôi lúc độ chính xác đạt vượt qua phương pháp 2 chặng nhưng tốc độ đáp ứng vẫn nhanh hơn rất nhiều. Hiện nay Yolo là một phương pháp nhận diện vật thể 1 chặng rất tốt. So sánh về hiệu năng giữa Yolo và Fast-RCNN – phương pháp 2 chặng thì độ chính xác trung bình là 63.4 và 70 tương ứng nhưng tốc độ đáp ứng của Yolo thì nhanh hơn 300 lần so với Fast-RCNN [1].
1 Hệ thống phát hiện người đi bộ sử dụng mô hình Yolov5 cải tiến GVHD: PGS.TS Trương Quang Vinh 1.2 Thách thức trong thuật toán phát hiện người đi đường Một trong những biến số thay đổi nhiều nhất khi giải quyết bài toán nhận dạng người đi đường đó là màu sắc và các loại quần áo của người đi bộ. Thêm vào đó một số phụ kiện có thể làm thay đổi hình dạng người đi đường như túi xách, ba lô hoặc bao tay. Ngoài ra rất nhiều trường hợp việc người đi bộ xuất hiện nhiều và chồng lấn lên nhau trong một vùng hình ảnh như hình 1.1: Frame ảnh chứ người đi đường chống lấn lên nhau được phát hiện bằng việc trích xuất thông tin toàn bộ và cục bộ [2] Các phương pháp trước đây để phát hiện người đi bộ đã sử dụng diện mạo toàn bộ cơ thể, hình dáng chân dung, hoặc một tập hợp các đặc trưng cục bộ. Đến ngày nay, chưa có phương pháp nào đã được đánh giá để phát hiện người đi bộ trong các tình huống đông người với sự chồng chéo trong vùng hình ảnh, mặc dù những loại tình huống này thường xuyên xảy ra trong các ứng dụng thực tế.
Mục tiêu là làm cho hệ thống có thể cải thiện số lượng phát hiện người đi bộ bị chồng lấn có trong frame ảnh. Các hệ thống hiệu quả phải tận dụng các ưu điểm của nhiều phương pháp, sử dụng cả diện mạo và dấu hiệu hình dạng, và tích hợp cả thông tin global và local (toàn diện và cục bộ).3 Nội dung Luận Văn Từ nghiên cứu tổng quan và tình hình nghiên cứu ngoài nước, đề tài thực hiện trong luận văn này là: 2 Hệ thống phát hiện người đi bộ sử dụng mô hình Yolov5 cải tiến GVHD: PGS.TS Trương Quang Vinh ❖ Phát triển và cải thiện mô hình Yolov5 để tăng chất lượng phát hiện người đi bộ của hệ thống. ❖ Hiện thực giải thuật trên kit Jetson (hoặc là GPU).4 Đóng góp của Luận Văn Đóng góp chính của Luận Văn sẽ là việc đưa ra thuật toán mới cho mô-đun tập trung là M-GAM và M-ECA. Từ đó sẽ đưa ra cấu trúc mới cho mô hình Yolo phiên bản 5.
Chương 3,4, và 5 sẽ trình bày chi tiết về thuật toán. Chương 6 và 7 sẽ trình bày kết quả và quá trình thực hiện trên kit Jetson Orin Nano.5 Cấu trúc Luận Văn Nội dung của Luận Văn sẽ được chia thành 8 chương. Chương 2 sẽ phân tích về cơ sở lý thuyết gồm cấu trúc, lịch sử của mạng Yolo và cấu trúc tập trung trong thị giác máy tính. Chương 3 sẽ đưa ra đề xuất về mô-đun tập trung GAM.
Chương 4 sẽ đưa ra đề xuất cho mô-đun tập trung M-ECA. Chương 5 sẽ đề xuất cấu trúc của mạng Yolo mới. Chương 6 sẽ trình bày kết quả về hiệu quả của phương thức mới thông qua các chỉ số Precesion, Recall, mAP. Đồng thời so sánh, phân tích kết quả đạt được với các bài báo cũng như version Yolo khác.
Chương 7 sẽ nghiên cứu và hiện thực giải thuật đó trên GPU đồng thời đo đạc runtime của thuật toán với kit Jetson NVIDIA. Chương 8 sẽ đưa ra phần mở rộng các ứng dụng có thể áp dụng kết quả của Luận Văn trong thực tế và các hướng phát triển của nó. 3 Hệ thống phát hiện người đi bộ sử dụng mô hình Yolov5 cải tiến GVHD: PGS.TS Trương Quang Vinh CHƯƠNG 2: CƠ SỞ LÝ THUYẾT YOLO đã trở thành một cấu trúc thường được ứng dụng cho các hệ thống phát hiện đối tượng thời gian thực cho robot, xe không người lái và ứng dụng giám sát video. Trong chương 2, sẽ phân tích toàn diện về sự tiến triển của YOLO, xem xét về các đổi mới và đóng góp trong mỗi phiên bản từ YOLO gốc đến YOLOv5.
Bắt đầu bằng cách mô tả các chỉ số tiêu chuẩn và quy trình xử lý sau đó sẽ thảo luận về những thay đổi chính trong kiến trúc mạng trong mỗi phiên bản. Đồng thời cũng nêu lên cơ sở lý thuyết của cơ chế tập trung, tích hợp vào mạng nơ-ron.1 Tình hình nghiên cứu ngoài nước Xem xét một số nguồn tài liệu từ nước ngoài, dưới đây là một số nhận xét và tổng hợp từ các tài liệu tham khảo liện quan đến việc sử dung Yolo phát hiện người đi bộ. Trong tài liệu Adaptive Fusion of Multi Scale YOLO for Pedestrian Detection [3] của tác giả Hsu và Lin đưa ra thách thức chính là độ chính xác và đa dạng về tỷ lệ hình ảnh nhận được về mô hình nhận diện người đi đường. Trong bài báo này chúng ta sẽ nghiên cứu theo hướng sẽ nhận diện vật thể trong khung hình rồi đưa ra thuật toán chia để trị để giải quyết vấn đề nói trên.
Như chúng ta thấy hình 2.1a là 1 mẫu thử cơ bản trong trạng thái bình thường, hình 2.1b đước trải dài gấp 3 lần hình 2.1d được thay đổi tỷ lệ. Chúng ta thấy vấn đề ở đây là đối tượng người đi bộ trong hình ảnh bị thay đổi quá lớn thậm chí không thể phát hiện được sau khi thay đổi tỷ lệ. Đồng thới những ngưới đi bộ có trang phục giống với hình nền của ảnh thì dường như bị mất thông tin trong quá trình phát hiện vật thể. Để giải quyết tình trạng này thì tác giả sẽ đưa ra model mới lấy nền tảng trên Yolov4.
Đầu vào của hệ thống là chiều dài và rộng của hình ảnh, sau đó thay đổi tỷ lệ lại và truyền thông tin đó vào mạng lưới nhận dạng đối tượng (CNN Model) như hình 2. Tiếp theo sẽ chia nhỏ những đối tượng không chồng lấn. Cuối cùng dùng bộ thích nghi để dung hợp 2 hình ảnh con lại và đưa ra hình ảnh cuối cùng với hiệu năng cao hơn. 4 Hệ thống phát hiện người đi bộ sử dụng mô hình Yolov5 cải tiến GVHD: PGS.TS Trương Quang Vinh Hình 2.1: Hình ảnh chứa người đi bộ bị co giãn khi qua mạng nơ-ron Đầu tiên hệ thống sẽ lấy thông tin của khung ảnh sau đó tỷ lệ hình ảnh sẽ được thay đổi.
Tiếp tục khung ảnh đó sẽ được đưa vào convolution neural network (CNN). Từ kết quả nhận dạng các bouding box, hệ thống sẽ phân mảnh thành các ảnh con với tỷ lệ khác nhau. Ảnh con sẽ chứa dối tượng mà không chồng lấn với nhau (trong hệ thống, hình xanh lá cây sẽ có chồng lấn, hình xanh dương không chồng lấn). Thuật toán được mô tả trong hình 2.
5 Hệ thống phát hiện người đi bộ sử dụng mô hình Yolov5 cải tiến GVHD: PGS.TS Trương Quang Vinh Hình 2.2: Ảnh được thay đổi kích thước sau đó được chia ra thành 2 ảnh con trước khi qua bộ thích nghi tương ứng Sau đó các hình ảnh con này được tiếp tục chuyển vào CNN để tiếp tục nhận diện các đặc điểm của vật thể. Cuối cùng bộ thích nghi dung hợp (Multi resolution adaptive fusion) được sử dụng để kết hợp 2 ảnh con lại và cho ra kết quả cuối cùng (góc trái).3: Kết quả đạt được khi sử dụng phương pháp mới Kết quả cho thấy độ chính xác trung bình mAP sẽ được cải thiện từ 87.4% so với Yolov3, 90.5% so với Yolov4 sẽ tăng lên 91.6% so với mô hình mới. Kết quả ở hình 2.3 được huấn luyện và đánh giá trên cùng một tập dữ liệu VOC [3]. 6 Hệ thống phát hiện người đi bộ sử dụng mô hình Yolov5 cải tiến GVHD: PGS.TS Trương Quang Vinh Thêm vào đó bài báo Deep-Learning Based Pedestrian Direction Detection for Anti-collision of Intelligent Self-propelled Vehicles [5] của Lin và các cộng sự đưa ra vấn đề cần phát hiện người đi bộ đồng thời phải phát hiện ra được hướng đi của người đi bộ.
Mục đích của việc này là để triển khai mô hình trên một robot trong trung tâm thương mại giúp cho robot có thể tránh được người đi bộ trong quá trình vận hành. Trong bài bào này Lin và các cộng sự của mình đã cải thiện Yolov2. Đề xuất là đưa ra một mạng mới Yolo-PD với trọng số nhẹ (leightweights) bằng việc giàm các lớp trong mô hình Yolov2 xuống để cải thiện tốc độ xử lý thời gian thực nhưng đồng thời chỉ số precision phải được cải thiện.4 mô tả dataset khi được đánh mã, sẽ có 6 hướng Back, Right, Front Right, Front, Front Left, Left.