Tổng quan nghiên cứu

Thống kê từ Tổ chức Y tế Thế giới ghi nhận hơn 1,35 triệu người tử vong do tai nạn giao thông mỗi năm trên toàn cầu, trong đó người đi bộ chiếm khoảng 23% tổng số thương vong. Nhận diện người đi bộ (Pedestrian Detection) giữ vai trò then chốt trong việc xây dựng các hệ thống giao thông thông minh, xe tự hành và camera giám sát an ninh công cộng. Tuy nhiên, bài toán thị giác máy tính này đối mặt với nhiều thách thức nghiêm trọng do người đi bộ thường xuyên bị che khuất một phần, mật độ tập trung đông đúc dẫn đến hiện tượng chồng lấn hình thể, cùng sự biến thiên liên tục về trang phục, tỷ lệ khung hình và điều kiện ánh sáng môi trường.

Về mặt giải thuật, các mô hình phát hiện hai giai đoạn như Faster R-CNN đạt độ chính xác tương đối cao nhưng tốc độ phản hồi rất chậm, không đáp ứng được yêu cầu thời gian thực của các thiết bị di động. Ngược lại, kiến trúc phát hiện một giai đoạn tiêu biểu như YOLOv5 sở hữu tốc độ xử lý nhanh hơn tới 300 lần so với các mô hình hai giai đoạn truyền thống, song vẫn gặp hạn chế lớn về độ chính xác khi phát hiện các đối tượng người đi bộ bị che khuất hoặc có kích thước thay đổi đột ngột.

Mục tiêu cụ thể của nghiên cứu là phát triển một kiến trúc YOLOv5 cải tiến thông qua việc tích hợp các mô-đun cơ chế chú ý mới gồm M-ECA và M-GAM nhằm tăng cường chất lượng trích xuất đặc trưng không gian và kênh. Đồng thời, đề tài hiện thực hóa giải thuật tối ưu trên kit phần cứng nhúng biên NVIDIA Jetson Orin Nano để đánh giá độ trễ và độ chính xác thực tế. Phạm vi nghiên cứu được thực hiện từ năm 2023 đến tháng 1 năm 2024 tại Trường Đại học Bách Khoa – ĐHQG-HCM, sử dụng tập dữ liệu chuẩn Penn-Fudan Pedestrian kết hợp kiểm thử video giao thông. Kết quả nghiên cứu mang lại ý nghĩa thực tiễn to lớn khi giúp cải thiện chỉ số mAP thêm hơn 2,8% so với mô hình gốc và duy trì tốc độ suy luận ổn định trên 32 khung hình trên giây.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng dựa trên nền tảng của lý thuyết mạng nơ-ron tích chập sâu và kiến trúc nhận diện vật thể một giai đoạn YOLO. Mạng YOLO phân chia hình ảnh đầu vào thành lưới S × S ô và dự đoán đồng thời tọa độ hộp bao (bounding box), điểm tin cậy (confidence score) cùng xác suất phân loại lớp đối tượng.

Trong không gian lý thuyết thị giác máy tính, cơ chế tập trung (Attention Mechanism) đóng vai trò điều chỉnh trọng số đặc trưng động, mô phỏng cách hệ thống thị giác người tập trung vào các vùng ảnh nổi bật. Hai mô hình tập trung trọng tâm được khai thác gồm:

  • Cơ chế chú ý kênh hiệu quả (Efficient Channel Attention - ECA): Tận dụng phép tích chập một chiều cục bộ kích thước k để nắm bắt tương tác giữa các kênh mà không làm giảm chiều dữ liệu.
  • Cơ chế chú ý toàn cục (Global Attention Mechanism - GAM): Giảm thiểu sự phân tán thông tin và khuếch đại biểu diễn đặc trưng toàn cục trên cả chiều không gian và chiều kênh.

Nghiên cứu ứng dụng 5 khái niệm cốt lõi: Chỉ số tương đồng giao trên hợp (IoU), thuật toán triệt tiêu phi cực đại (NMS) với ngưỡng chọn lọc 0,5, hàm tổn thất hồi quy Complete IoU (CIoU Loss), hộp mỏ neo (Anchor Box) đa tỷ lệ và hàm kích hoạt phi tuyến H-swish thay thế hàm ReLU truyền thống để tối ưu hóa đạo hàm gradient.

Phương pháp nghiên cứu

Nghiên cứu sử dụng tập dữ liệu Penn-Fudan Pedestrian Dataset gồm 170 hình ảnh chụp từ nhiều góc độ khác nhau với 345 đối tượng người đi bộ được gán nhãn chi tiết. Phương pháp lấy mẫu ngẫu nhiên phân tầng được thực hiện với tỷ lệ phân chia chuẩn mực: 80% dữ liệu dùng cho huấn luyện (136 ảnh) và 20% dữ liệu dùng cho kiểm định (34 ảnh). Quy trình tiền xử lý qua nền tảng Roboflow áp dụng kỹ thuật tăng cường dữ liệu: xoay góc từ -15 độ đến +15 độ và cắt ngẫu nhiên 50% khung hình nhằm nhân rộng tính đa dạng cho tập mẫu huấn luyện.

Phương pháp phân tích dựa trên việc can thiệp cấu trúc mạng YOLOv5:

  • Thay thế các khối C3 trong Backbone bằng mô-đun kết hợp C3-ECA để tăng khả năng học trọng số kênh quan trọng với chi phí tham số thấp.
  • Tích hợp mô-đun M-GAM cải tiến có bổ sung lớp Channel Shuffle vào phần Head (PANet) nhằm liên kết đặc trưng không gian đa tỷ lệ và khắc phục hiện tượng mất dấu khi người đi bộ chồng lấn.

Timeline nghiên cứu kéo dài 10 tháng: giai đoạn huấn luyện 100 epoch trên môi trường điện toán đám mây Google Colab trang bị GPU công suất cao, sau đó chuyển đổi mô hình sang định dạng tối ưu và thực nghiệm đo lường runtime trực tiếp trên kit nhúng NVIDIA Jetson Orin Nano.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Quá trình kiểm nghiệm mô hình YOLOv5 cải tiến trên tập dữ liệu kiểm tra và video thực tế đã mang lại 4 phát hiện khoa học quan trọng:

  1. Mô-đun C3-ECA kết hợp hàm kích hoạt H-swish nâng cao độ chính xác Precision đạt mức 89,4% và độ bao phủ Recall đạt 87,6%, tăng lần lượt 3,5% và 2,8% so với mô hình YOLOv5 gốc.
  2. Cấu trúc M-GAM giúp cải thiện rõ rệt khả năng nhận diện người đi bộ bị che khuất trong khung cảnh phức tạp, đưa chỉ số mAP@0.5 tổng thể đạt 91,6%, vượt trội hơn mức 87,4% của YOLOv3 và 90,5% của YOLOv4 trên cùng tập dữ liệu thực nghiệm.
  3. Đồ thị hàm tổn thất Loss Function hội tụ ổn định sau 85 epoch, nhanh hơn 15 epoch so với kiến trúc ban đầu. Đường cong F1-Confidence Score đạt giá trị đỉnh 0,88 tại ngưỡng tin cậy 0,55, chứng minh sự cân bằng tối ưu giữa Precision và Recall.
  4. Khi triển khai trên phần cứng nhúng biên Jetson Orin Nano, thuật toán cải tiến đạt tốc độ xử lý thực tế 34 khung hình trên giây (FPS) đối với luồng video độ phân giải cao, với mức tiêu thụ điện năng trung bình duy trì dưới 12W.

Thảo luận kết quả

Hiệu năng vượt trội của mô hình xuất phát từ việc loại bỏ sự suy giảm thông tin qua các tầng tích chập sâu nhờ cơ chế phân bổ trọng số động. Việc bổ sung lớp Channel Shuffle trong mô-đun M-GAM giúp các kênh đặc trưng trao đổi thông tin chéo liên tục, cho phép mạng nhận diện chính xác các đường nét cơ thể người đi bộ ngay cả khi màu sắc trang phục bị hòa lẫn vào hậu cảnh hoặc bị che khuất bởi hành lý, phương tiện khác.

So sánh với nghiên cứu của tác giả Gou và các cộng sự năm 2022 khi sử dụng YOLOv5 thuần cho bối cảnh đông đúc chỉ đạt Precision và Recall dao động ở mức 71%, kiến trúc đề xuất trong luận văn này đã nâng cao độ chính xác lên hơn 18%. Dữ liệu thực nghiệm được trực quan hóa thông qua bảng ma trận nhầm lẫn (Confusion Matrix) và biểu đồ đường cong F1-Score đối chiếu giữa hai khung giờ ánh sáng ban ngày và ánh sáng ban trưa, thể hiện rõ tính ổn định cao của hệ thống trước sự biến đổi cường độ sáng môi trường.

Đề xuất và khuyến nghị

  1. Tích hợp thuật toán theo dõi đa đối tượng Deep SORT: Đề xuất các kỹ sư phần mềm thị giác máy tính tích hợp thuật toán Deep SORT hoặc ByteTrack vào sau luồng phát hiện của YOLOv5 cải tiến trong vòng 6 tháng tới, nhằm duy trì ID theo dõi đối tượng liên tục với mục tiêu chỉ số MOTA đạt trên 68% khi người đi bộ bị che khuất hoàn toàn trong thời gian ngắn.
  2. Thực hiện lượng tử hóa mô hình sang chuẩn INT8: Khuyến nghị các nhóm phát triển AI biên ứng dụng bộ công cụ NVIDIA TensorRT để lượng tử hóa trọng số mô hình từ FP32/FP16 sang INT8 trong quý 3 năm 2024, nhằm tăng tốc độ xử lý đạt mốc trên 50 FPS trên các phần cứng nhúng công suất thấp.
  3. Mở rộng quy mô tập dữ liệu đa điều kiện thời tiết: Các cơ quan nghiên cứu giao thông cần phối hợp thu thập và gán nhãn bổ sung khoảng 5.000 hình ảnh người đi bộ trong điều kiện ban đêm, trời mưa và sương mù dày đặc trong vòng 12 tháng, hướng tới mục tiêu nâng cao mAP môi trường thiếu sáng từ 74% lên trên 86%.
  4. Chuẩn hóa hạ tầng giám sát giao thông thông minh: Đề xuất các đơn vị quản lý đô thị đầu tư nâng cấp hệ thống camera IP có độ phân giải tối thiểu 1080p kết hợp bộ xử lý biên GPU tại các giao lộ trọng điểm giai đoạn 2024-2026, nhằm giảm thiểu khoảng 25% nguy cơ va chạm giữa phương tiện giao thông và người đi bộ.

Đối tượng nên tham khảo luận văn

  1. Kỹ sư thị giác máy tính và lập trình AI nhúng: Nắm vững kỹ thuật tùy biến kiến trúc mạng YOLO, tích hợp các khối Attention Mechanism (M-GAM, M-ECA) và quy trình chuyển đổi triển khai mô hình học sâu lên phần cứng biên NVIDIA Jetson.
  2. Nhà phát triển hệ thống xe tự hành và ADAS: Khai thác thuật toán phát hiện người đi bộ thời gian thực với độ trễ cực thấp dưới 30ms để tích hợp vào các phân hệ phanh tự động khẩn cấp (AEB) và cảnh báo tiền va chạm (FCW).
  3. Chuyên gia quy hoạch và vận hành đô thị thông minh: Tham khảo giải pháp đếm và phân tích lưu lượng người đi bộ tự động qua camera giám sát để tối ưu hóa chu kỳ đèn tín hiệu giao thông tại các nút giao phức tạp.
  4. Học viên cao học và nghiên cứu sinh chuyên ngành Viễn thông - Điện tử: Sử dụng luận văn như một tài liệu tham khảo chuẩn mực về phương pháp nghiên cứu thực nghiệm, kỹ thuật tăng cường dữ liệu và quy trình đánh giá mô hình học sâu toàn diện.

Câu hỏi thường gặp

Mô hình YOLOv5 cải tiến có điểm gì khác biệt so với các phiên bản YOLO gốc? Mô hình cải tiến thay thế khối C3 tiêu chuẩn trong Backbone bằng khối C3-ECA sử dụng hàm kích hoạt H-swish, đồng thời tích hợp mô-đun M-GAM bổ sung lớp Channel Shuffle vào phần Head. Cải tiến này giúp tăng cường khả năng trích xuất đặc trưng toàn cục và cục bộ, nâng cao mAP thêm 2,8% mà không làm tăng đáng kể kích thước mô hình.

Tại sao luận văn lựa chọn kit NVIDIA Jetson Orin Nano để thử nghiệm phần cứng? Jetson Orin Nano sở hữu kiến trúc GPU Ampere với hiệu năng tính toán AI lên đến 40 TOPS và bộ nhớ chia sẻ tốc độ cao. Phần cứng này cung cấp khả năng xử lý song song vượt trội, cho phép chạy mô hình ở tốc độ 34 FPS thời gian thực với mức tiêu thụ điện năng chỉ khoảng 10W đến 15W, rất phù hợp cho các thiết bị di động.

Thuật toán xử lý trường hợp người đi bộ bị che khuất hoặc chồng lấn ra sao? Mô-đun M-GAM cải tiến giúp mô hình duy trì sự chú ý đồng thời trên cả chiều không gian và chiều kênh. Kết hợp với hàm tổn thất CIoU và thuật toán NMS tối ưu, hệ thống phân biệt chính xác các vùng biên của từng cá thể, giảm thiểu tỷ lệ bỏ sót đối tượng bị che khuất xuống dưới 12% so với mức 25% ở các mô hình truyền thống.

Kỹ thuật tăng cường dữ liệu trên Roboflow đóng góp như thế nào vào kết quả huấn luyện? Các phép biến đổi gồm xoay ảnh từ -15 độ đến +15 độ và cắt ngẫu nhiên 50% diện tích giúp tăng độ phong phú của dữ liệu mẫu gấp 3 lần. Điều này giúp mạng nơ-ron học được các đặc trưng bất biến của người đi bộ dưới nhiều góc quan sát, ngăn ngừa hiện tượng quá khớp (overfitting) và giúp hàm mất mát hội tụ nhanh hơn 15 epoch.

Hệ thống có thể hoạt động tốt trong điều kiện ánh sáng thay đổi giữa các thời điểm trong ngày không? Các thử nghiệm thực tế đối chiếu giữa khung giờ sáng và khung giờ trưa cho thấy mô hình duy trì độ ổn định nhận diện cao. Sự kết hợp giữa chuẩn hóa Batch Normalization và hàm kích hoạt H-swish giúp hệ thống thích ứng linh hoạt với độ tương phản cao và hiện tượng bóng đổ, giữ vững độ chính xác Precision trên mức 88%.

Kết luận

  • Luận văn đã thiết kế và hiện thực thành công kiến trúc YOLOv5 cải tiến tích hợp hai mô-đun chú ý M-ECA và M-GAM.
  • Nâng cao hiệu năng nhận diện người đi bộ với độ chính xác Precision đạt 89,4%, Recall đạt 87,6% và mAP@0.5 đạt 91,6%.
  • Đẩy nhanh tốc độ hội tụ của hàm tổn thất Loss Function và tối ưu hóa đường cong F1-Score tại ngưỡng tin cậy 0,55.
  • Triển khai thành công trên phần cứng nhúng NVIDIA Jetson Orin Nano với tốc độ suy luận thời gian thực 34 FPS.
  • Cung cấp giải pháp kỹ thuật khả thi giải quyết triệt để bài toán người đi bộ bị che khuất và chồng lấn trong môi trường giao thông phức tạp.

Đóng góp chính của luận văn là hoàn thiện cấu trúc mạng học sâu tối ưu hóa cho bài toán nhận diện người đi bộ và kiểm chứng thành công trên phần cứng biên. Kế hoạch tiếp theo trong quý 4 năm 2024 là tích hợp giải thuật theo dõi đối tượng Deep SORT và lượng tử hóa INT8 trên TensorRT. Các tổ chức, doanh nghiệp và nhà nghiên cứu quan tâm có thể khai thác mã nguồn và mô hình đề xuất để ứng dụng trực tiếp vào các giải pháp an toàn giao thông đô thị và hệ thống xe tự hành thông minh.