Hệ Thống Phát Hiện và Theo Dõi Người Trên SOC-FPGA

Luận văn tốt nghiệp kỹ thuật nghiên cứu tốt nghiệp kỹ thuật máy tính hệ thống phát hiện theo dõi người trên soc fpga, điều tra thực trạng, phân tích số liệu, đề xuất biện pháp cải

Chuyên ngành

Kỹ thuật máy tính

Người đăng

Ẩn danh

Thể loại

Khóa luận

2024

76
5
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CẢM ƠN

MỞ ĐẦU

1. CHƯƠNG 1: GIỚI THIỆU TỔNG QUAN ĐỀ TÀI

1.1. Các nghiên cứu liên quan

1.2. Mục tiêu của đề tài

2. CHƯƠNG 2: CƠ SỞ LÝ THUYẾT

2.1. Kria KV260 Vision AI Starter Kit

2.2. Deep-learning Processing Unit

2.3. Mạng nơ-ron tích chập (Convolutional Neural Network - CNN)

2.4. Lớp tích chập

2.5. Hàm kích hoạt

2.6. Qui trình

3. CHƯƠNG 3: PHƯƠNG PHÁP ĐỀ XUẤT VÀ QUÁ TRÌNH HIỆN THỰC ĐỀ TÀI

3.1. Phương pháp đề xuất

3.2. Mô hình đề xuất

3.3. Tập dữ liệu huấn luyện và tăng cường dữ liệu

3.4. Vitis Video Analytics SDK

3.5. Hiện thực và hoàn thiện đề tài

3.5.1. Chuyển đổi mô hình sang TensorFlow

3.5.2. Lượng tử hóa mô hình

3.5.3. Biên dịch mô hình và hiện thực xuống Kria KV260

3.5.4. Gửi dữ liệu lên máy chủ

3.6. Siamese Network và thuật toán tương đồng

3.6.1. Kết quả huấn luyện trên phần mềm

3.6.2. Mô hình YOLOv3-Tiny

3.6.3. Mô hình Siamese Network

3.6.4. Kết quả hiện thực trên Kria KV260

4. CHƯƠNG 4: KẾT QUẢ

5. CHƯƠNG 5: KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN TIẾP THEO

5.1. Những khó khăn gặp phải

5.2. Hướng phát triển tiếp theo

DANH MỤC HÌNH

DANH MỤC BẢNG

DANH MỤC TỪ VIẾT TẮT

Tóm tắt

I. Giới thiệu tổng quan về Hệ Thống Phát Hiện và Theo Dõi Người Trên SOC FPGA

Hệ thống phát hiện và theo dõi người trên SOC-FPGA đang trở thành một trong những giải pháp tiên tiến trong lĩnh vực giám sát an ninh. Với sự phát triển của công nghệ FPGA và các mô hình học sâu, hệ thống này không chỉ giúp nâng cao độ chính xác trong việc nhận diện mà còn tối ưu hóa hiệu suất xử lý. Việc tích hợp các công nghệ mới vào hệ thống giúp giải quyết nhiều vấn đề trong việc theo dõi và quản lý an ninh.

1.1. Tổng quan về công nghệ SOC FPGA trong giám sát

Công nghệ SOC-FPGA cho phép tích hợp nhiều chức năng trong một thiết bị duy nhất, giúp giảm thiểu chi phí và tăng hiệu suất. Hệ thống này có khả năng xử lý dữ liệu video từ nhiều nguồn khác nhau, mang lại giải pháp giám sát hiệu quả.

1.2. Lợi ích của việc phát hiện và theo dõi người

Việc phát hiện và theo dõi người giúp nâng cao an ninh, giảm thiểu rủi ro và tăng cường khả năng phản ứng nhanh chóng trong các tình huống khẩn cấp. Hệ thống này còn hỗ trợ trong việc phân tích hành vi và quản lý đám đông.

II. Vấn đề và thách thức trong phát hiện người trên SOC FPGA

Mặc dù hệ thống phát hiện và theo dõi người trên SOC-FPGA mang lại nhiều lợi ích, nhưng vẫn tồn tại một số thách thức lớn. Các vấn đề như độ chính xác trong điều kiện ánh sáng khác nhau, sự đa dạng của đối tượng và tốc độ xử lý là những yếu tố cần được giải quyết.

2.1. Độ chính xác trong điều kiện thực tế

Độ chính xác của hệ thống phụ thuộc vào nhiều yếu tố như ánh sáng, góc quay và sự hiện diện của nhiều người. Việc cải thiện độ chính xác trong các điều kiện này là một thách thức lớn.

2.2. Tốc độ xử lý và hiệu suất hệ thống

Hệ thống cần có khả năng xử lý nhanh chóng để đáp ứng yêu cầu giám sát thời gian thực. Việc tối ưu hóa hiệu suất trên SOC-FPGA là điều cần thiết để đảm bảo hệ thống hoạt động hiệu quả.

III. Phương pháp phát hiện và theo dõi người trên SOC FPGA

Để giải quyết các thách thức trong việc phát hiện và theo dõi người, nhiều phương pháp đã được đề xuất. Các mô hình học sâu như YOLO và SSD được sử dụng để cải thiện độ chính xác và tốc độ xử lý của hệ thống.

3.1. Sử dụng mô hình YOLO cho phát hiện người

Mô hình YOLO (You Only Look Once) cho phép phát hiện đối tượng trong thời gian thực với độ chính xác cao. Việc áp dụng YOLO trên SOC-FPGA giúp tối ưu hóa hiệu suất và giảm thiểu độ trễ.

3.2. Ứng dụng SSD trong theo dõi người

Mô hình SSD (Single Shot MultiBox Detector) cung cấp khả năng phát hiện đối tượng nhanh chóng và hiệu quả. Việc kết hợp SSD với SOC-FPGA giúp cải thiện khả năng theo dõi trong các tình huống phức tạp.

IV. Ứng dụng thực tiễn của hệ thống phát hiện và theo dõi người

Hệ thống phát hiện và theo dõi người trên SOC-FPGA đã được áp dụng trong nhiều lĩnh vực khác nhau, từ an ninh công cộng đến quản lý giao thông. Những ứng dụng này không chỉ giúp nâng cao hiệu quả giám sát mà còn tiết kiệm chi phí.

4.1. Ứng dụng trong an ninh công cộng

Hệ thống giám sát an ninh công cộng sử dụng công nghệ SOC-FPGA giúp phát hiện và theo dõi người trong các khu vực đông đúc, từ đó nâng cao an ninh và giảm thiểu tội phạm.

4.2. Quản lý giao thông thông minh

Hệ thống phát hiện người có thể được áp dụng trong quản lý giao thông, giúp theo dõi và điều phối lưu lượng giao thông một cách hiệu quả, giảm thiểu ùn tắc và tai nạn.

V. Kết luận và hướng phát triển tương lai của hệ thống

Hệ thống phát hiện và theo dõi người trên SOC-FPGA đã chứng minh được tính khả thi và hiệu quả trong nhiều ứng dụng thực tiễn. Tuy nhiên, vẫn còn nhiều cơ hội để cải tiến và phát triển hệ thống trong tương lai.

5.1. Đánh giá hiệu suất và cải tiến

Việc đánh giá hiệu suất của hệ thống là cần thiết để xác định các điểm yếu và cải tiến. Các nghiên cứu tiếp theo có thể tập trung vào việc tối ưu hóa thuật toán và phần cứng.

5.2. Hướng phát triển công nghệ mới

Công nghệ mới như trí tuệ nhân tạo và học máy có thể được tích hợp vào hệ thống để nâng cao khả năng phát hiện và theo dõi, mở ra nhiều cơ hội ứng dụng trong tương lai.

10/07/2025
Khóa luận tốt nghiệp kỹ thuật máy tính hệ thống phát hiện theo dõi người trên soc fpga

Trích đoạn nội dung tài liệu

Chương 1: Giới thiệu tổng quan đề tài Cung cấp cái nhìn tong quát về dé tai, các giải pháp nghiên cứu trước đây, và đánh giá điểm mạnh, điểm yếu của những giải pháp đó. Qua đó giúp định vị vấn đề và cơ sở lý luận của nghiên cứu. ¢ Chương 2: Cơ sở lý thuyết Tập trung các nên tảng lý thuyết áp dụng trong dé tài, bao gồm các mô hình học sâu và các công nghệ liên quan với các khái niệm, phương pháp và hình ảnh minh họa nhằm cung cấp kiến thức cơ bản và nền tảng cho việc hiểu và triển khai các phương pháp trong đề tài. e_ Chương 3: Phương pháp đề xuất và thực hiện đề tài Mô tả chỉ tiết mô hình đề xuất cho hệ thống phát hiện và theo dõi người.

Bao gồm lý do lựa chọn mô hình và các bước cụ thé dé hiện thực mô hình trên Kria KV260 Vision AI Starter Kit. Trình bày chỉ tiết quá trình hiện thực xuống KV260, cách thức lay luéng RTSP từ các IP Camera, lượng tử hóa, biên dich mô hình, chuyên đôi và gửi dữ liệu sau khi xử lý từ board lên máy chủ cũng như giải thuật tương đồng để nhận diện từng người. e Chương 4: Kết qua Tổng kết và đánh giá kết quả thực nghiệm của hệ thống. Kết quả khi huấn luyện trên Google Colab sẽ được soi sánh với kết quả khi triển khai trên Kria KV260 Vision AI Starter Kit.

Ngoài ra, chương này còn đánh giá hiệu suất hệ thống dựa trên các yếu tố như tài nguyên sử dụng, năng lượng tiêu thụ, và nhiệt độ hoạt động, qua đó chứng minh tính kha thi và hiệu quả của giải pháp. e _ Chương 5: Kết luận và hướng phát triển Đưa ra kết luận chung về những đóng góp của đề tài, đánh giá những việc đã làm và những thách thức còn tổn tại. Định hướng cho các nghiên cứu tiếp theo, đề xuât các cải tiên và mở rộng khả năng ứng dụng của hệ thông trong tương lai. Giới thiệu tổng quan đề tài 1.

Giới thiệu Trong bối cảnh tiến bộ nhanh chóng của trí tuệ nhân tạo, mạng nơ-ron tích chập (Convolutional Neural Networks - CNNs) đã trở thành công cụ cốt lõi cho nhiều ứng dụng nhận diện đối tượng, đặc biệt trong các hệ thống xử lý hình ảnh và video. Đề tài khóa luận này tập trung vào hiện thực hóa mạng nơ-ron tích chập trên nền tảng phần cứng KV260, nhằm phát triển một hệ thống nhận diện và theo dõi người theo một hướng tiếp cận mới. KV260 Vision AI Starter Kit, với kha năng tích hợp Deep-learning Processing Unit (DPU) cua Xilinx, mang dén tiém năng xử lý vượt trội cho các tac vụ học sâu. Đề tài này tận dụng sức mạnh của DPU dé triển khai và chạy CNN trực tiếp trên thiết bị, điều này không chỉ nâng cao khả năng xử lý các mô hình học sâu, mà còn giải quyết những hạn chế về tài nguyên và năng lượng mà các hệ thống truyền thong phải đối mặt.

KV260 cho phép tích hợp các mô hình AI trực tiếp vào quy trình xử lý, cung cấp khả năng nhận diện đối tượng nhanh chóng mà không cần đến các cơ sở hạ tầng máy chủ mạnh mẽ. Các thách thức của dự án bao gồm tối ưu hóa hiệu năng của CNN để hoạt động hiệu quả trên DPU, đồng thời duy trì độ chính xác cao trong nhận diện người khi thay đổi ánh sáng, góc quay, và sự hiện diện của nhiều người trong cùng một khung hình. Việc tối ưu này không những được thực hiện trên phần cứng của KV260 mà còn các điều chỉnh phần mềm ở máy chủ quản ly cơ sở dit liệu dé hệ thống có thể hoạt động én định. Các nghiên cứu liên quan Có nhiều mô hình phổ biến để tiếp cận đến hệ thống phát hiện người như YOLOv3 được tác giả [7] nghiên cứu và cải thiện mô hình YOLOv3 bằng cách sử dụng cấu trúc Darknet Residual kết hợp các đặc trưng nông và sâu trên các đặc trưng của quá trình mẫu hóa (sampling) dé có được lớp nhận diện đa quy mô (multi-scale 4 detection layer).

Theo cách này, một lớp tổng hợp của các kích thước khác nhau của thông tin vi trí mục tiêu và thông tin ngữ cảnh được trích xuất. Độ nhận diện chính xác (prediction accuracy) của đối tượng có kích thước khác nhau đã được cải thiện khi tăng số lượng multi-scale fusion layer lên. Đồng thời mô-đun Spatial Pyramid Pooling (SPP) sẽ được sử dụng dé dung hợp các đặc trưng đạt được ở các quy mô khác nhau để cải thiện độ nhận diện chính xác (detection accuracy). Kết quả khi sử dụng mô hình lên tập VOC dataset thì YOLOv3 đạt được 79.54% so với mô hình YOLOv3-Multi được tác giả cải tiến.

Trong một công trình [8], tác giả đã ứng dụng mô hình YOLOv4-Tiny vào hệ thống tự động theo dõi người đi bộ trong đám đông. Tác giả đã hiện thực mô hình trên phần mềm và so sánh với các mô hình YOLO khác đề so sánh hiệu suất của các mô hình. Sau khi huấn luyện các mô hình bằng tập đữ liệu UCSD Pedestrian và so sánh các mô hình thì thấy mAP của mô hình YOLOv4-Tiny là 73% lớn hơn 4% so với mô hình YOLOv3 và lớn hơn 10% so với mô hình YOLOv2. Ở một bài báo khác, tác giả Shu-an Liu và các cộng sự [9] nghiên cứu và tiếp cận việc nhận diện người qua việc ứng dụng mô hình SSD.

Sau khi tác giả khảo sát các mô hình và so sánh các mô hình thì thấy khi so sánh với mô hình Faster-RCNN thì thấy SSD có tốc độ tốt hơn và khi so sánh với mô hình YOLO thì thấy mô hình SSD có độ chính xác mAP lớn hơn đáng kể. Nhưng khi hiện thực nhận diện người thì độ chính xác của SSD lại không được tốt đặc biệt là những đối tượng nhỏ. Dé giải quyết việc đó tác giả đã cải thiện mô hình SSD dựa trên thông tin ngữ cảnh (context information) bằng cách trích xuất đặc trưng nông (shallow features) trong mạng SSD, hợp nhất các ý nghĩa của các đặc trưng trong lớp tích chập với ý nghĩa sâu của các đặc trưng và sau đó nhận diện kích thước của người đi bộ trong tam ảnh. Tinh năng Pre-selection boxes được thiết kế lại với kích thước khung hình khác nhau, cải thiện kết quả kiểm tra mô hình SSD vượt trội hơn so với mô hình SSD tiêu chuẩn.

Kết quả sau khi ứng dụng mô hình trên tập dataset INRIA cho thấy mô hình của tác giả có tỉ lệ sai số (missing rate) khi nhận diện là 9,8% cao hơn 2.3% so với mô hình SSD tiêu chuân. Trong một công trình khác, tác giả và các cộng sự [10] đã cải tiến kiến trúc mạng của mô hình YOLO và đề xuất kiến trúc mạng YOLO-R. Ba lớp Passthrough (bao gồm Route layer và Reorg layer) được thêm vào mô hình YOLO tiêu chuẩn. Vai trò của chúng là kết nối các đặc trưng của người đi bộ lớp nông với các đặc trưng của người đi bộ lớp sâu và liên kết độ phân giải lớn và bé đặc trưng của người đi bộ.

Công trình này còn thay đối số lớp của lớp Passthrough kết ni trong mô hình YOLO tiêu chuẩn từ layer 16 đến layer 12 đề tăng khả năng trích xuất thông tin của các đặc trưng nông. Mô hình cải thiện này được thử trên tập dataset INRIA, kết quả cho thay công trình nay cải thiện được độ nhận diện chính xác (detection accuracy) của người di bộ, giảm FDR (False Detection Rate) va MDR (Missed Detection Rate), tốc độ nhận diện là 25 fps và độ mat mát trung bình (Average Loss) là 0. Mục tiêu của dé tài Dé giải quyết bài toán nhận diện và theo dõi người được quay từ nhiêu camera khác nhau, trong khóa luận này, nhóm đưa ra 3 mục tiêu chính: 1. Lựa chọn, huấn luyện, lượng tử hóa mô hình máy học có kích thước nhẹ, phù hợp dé triển khai lên DPU của Kria KV260 Vision AI Starter Kit với tập dữ liệu tùy chỉnh với tiêu chí có thể bao quát cụ thể các trường hợp dựa vào góc quay, ánh sáng, thời tiết và tư thế người đa dạng, mục tiêu accuracy >= 90% 2.

Biên dịch mô hình và hiện thực xuống Kria KV260, đánh giá hiệu suất mô hình trên KV260 so với trên phần mềm. Tối ưu hiệu suất bằng các công nghệ từ Xilinx và các thư viện mã nguôn mở. Gửi các khung hình và thông tin bounding box của đối tượng lên máy chủ dé thiết lập cơ sở đữ liệu sau quá trình xử lý ở KV260. Sử dụng giải thuật tương đồng dé định danh từng người và phân loại cơ sở dữ liệu.

Cuối cùng sẽ là thiết kế một trang web cơ bản bằng HTML cho người dùng sử dụng. Kria KV260 Vision AI Starter Kit Kria KV260 Vision AI Starter Kit là một sản phẩm phan cứng đột phá được phát triển bởi Xilinx, dành riêng cho các ứng dụng trí tuệ nhân tạo (AI) và thị giác máy tính. Được tích hợp các tính năng tiên tiến và tích hợp chặt chẽ với các giải pháp phát triển ứng dụng, KV260 đem đến một nền tảng mạnh mẽ cho phép triển khai và thử nghiệm các ứng dụng AI một cách dễ dàng và nhanh chóng [11]. J4 Micro-USB J11 Connector UART/JTAG MicroSD DS1-DS6 Power Status LEDs TER J8 Ắ | IAS Connector SOM Module h with Fansinl‹ SW2 Reset Button gi cm oy SWT1 Firmware = Update Button mm.

J7 _ _—_" IAS Connec tor DS36 les oO = _ L—Ì Ệ PS Status LED J13 = Fan Power DS35 jo Heartbeat LED DS34 PS Done LED XaKTS0072221 Hình 2. Kria KV260 Vision AI Starter Kit Kria KV260 Vision AI Starter Kit được xây dựng trên nền tảng FPGA Xilinx Zynq UltraScale+, tích hợp nhiều khối phần cứng (Hình 2.1) và phần mềm dé hỗ trợ các tác vụ AI: + SoC (System on Chip): KV260 sử dụng Zynq UltraScale+ MPSoC, kết hop giữa các thành phần xử lý hệ thống như CPU ARM Cortex-A53, bộ xử lý thời gian thực ARM Cortex-R5, và các đơn vị xử ly FPGA có thé cấu hình lại. Kiến trúc SoC này mang lại sự linh hoạt và hiệu suất cao cho các ứng dụng AI. + Deep-learning Processing Unit (DPU): là thành phần chuyên biệt, tăng tốc các tác vụ học sâu với hiệu suất cao và tiêu thụ năng lượng thấp.

DPU giúp xử lý các mạng nơ-ron tích chập (CNN) và các mô hình học sâu khác hiệu quả. + Bộ nhớ: Hỗ trợ nhiều loại bộ nhớ bao gồm DDR4, LPDDR4, và bộ nhớ ngoài đề tối ưu hóa khả năng lưu trữ và truy cập dữ liệu trong các tác vụ học sâu và xử lý video. + Giao diện kết kối: Hỗ trợ nhiều giao diện kết nối như USB, Ethernet, HDMI, MIPI CSI-2, giúp dé dàng tích hợp với các thiết bị ngoại vi và cảm biến hình ảnh.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu với tiêu đề Hệ Thống Phát Hiện và Theo Dõi Người Trên SOC-FPGA trình bày một giải pháp công nghệ tiên tiến trong việc phát hiện và theo dõi người, sử dụng nền tảng FPGA (Field-Programmable Gate Array). Hệ thống này không chỉ giúp nâng cao khả năng giám sát mà còn tối ưu hóa hiệu suất xử lý dữ liệu, mang lại lợi ích lớn cho các ứng dụng an ninh và giám sát. Độc giả sẽ tìm thấy những thông tin hữu ích về cách thức hoạt động của hệ thống, cũng như các ứng dụng thực tiễn trong lĩnh vực an ninh.

Để mở rộng kiến thức về các hệ thống giám sát và công nghệ liên quan, bạn có thể tham khảo thêm tài liệu Luận văn thạc sĩ hệ thống thông tin quản lý đánh giá các nhân tố ảnh hưởng đến việc sử dụng hệ thống camera giám sát hành vi đối tượng, nơi phân tích các yếu tố ảnh hưởng đến việc sử dụng hệ thống camera giám sát. Bên cạnh đó, tài liệu Luận văn thạc sĩ quản lý khoa học và công nghệ nâng cao hiệu quả khai thác phương tiện kỹ thuật giám sát an ninh trong ngành công an nghiên cứu hệ thống camera giám sát an ninh công cộng do bộ công an đầu tư triển khai sẽ cung cấp cái nhìn sâu sắc về việc cải thiện hiệu quả giám sát an ninh công cộng. Cuối cùng, bạn cũng có thể tìm hiểu về Giải pháp nhận diện người xâm nhập nhà trạm viễn thông, tài liệu này sẽ giúp bạn hiểu rõ hơn về các giải pháp nhận diện và bảo vệ an ninh trong các cơ sở hạ tầng viễn thông. Những tài liệu này sẽ giúp bạn mở rộng kiến thức và hiểu biết về các công nghệ giám sát hiện đại.