Giới thiệu dự án
Sự bùng nổ của quá trình đô thị hóa và phát triển kinh tế kéo theo các thách thức an ninh xã hội phức tạp như trộm cắp, phá hoại tài sản công cộng và bạo lực đường phố. Theo các báo cáo an ninh đô thị, các hệ thống camera giám sát truyền thống (CCTV) hiện nay chủ yếu vận hành theo mô hình thụ động: ghi hình liên tục và truyền luồng video về máy chủ trung tâm (Centralized Server) để nhân viên an ninh theo dõi thủ công. Mô hình này bộc lộ những điểm nghẽn nghiêm trọng:
- Quá tải nhân lực và sai sót do cảm quan: Một nhân viên an ninh không thể duy trì sự tập trung liên tục trên hàng chục màn hình cùng lúc, dẫn đến việc bỏ sót các hành vi bất thường trong thời gian thực.
- Chi phí hạ tầng và băng thông đắt đỏ: Việc truyền tải đồng thời hàng trăm luồng video độ phân giải cao gây nghẽn băng thông mạng và đòi hỏi hệ thống máy chủ lưu trữ, xử lý tốn kém chi phí đầu tư lẫn bảo trì.
- Rủi ro điểm lỗi đơn (Single Point of Failure): Khi máy chủ trung tâm gặp sự cố gián đoạn mạng hoặc quá tải, toàn bộ hệ thống giám sát bị tê liệt.
+-----------------------------------------------------------------------------------+
| MÔ HÌNH HỆ THỐNG CAMERA THÔNG MINH |
+-----------------------------------------------------------------------------------+
| [ Pi NoIR V2 ] ---> [ Jetson Nano (Edge AI) ] ---> [ SMTP Server ] ---> [ Email ]|
| (Sony IMX219) (ResNet-18/MobileNet_V2) (Gmail TLS:587) (Cảnh báo)|
+-----------------------------------------------------------------------------------+
Khóa luận tốt nghiệp ngành Kỹ thuật Máy tính tại Trường Đại học Công nghệ Thông tin – ĐHQG-HCM (thực hiện bởi sinh viên Nguyễn Văn Thắng và Nguyễn Đông Quân, dưới sự hướng dẫn của ThS. Nguyễn Thanh Thiện và TS. Đoàn Duy) đã nghiên cứu và phát triển thành công "Hệ thống camera thông minh phát hiện các hành vi bất thường" (Smart Camera System for Abnormal Behavior Detection). Dự án giải quyết bài toán bằng phương pháp tính toán biên (Edge Computing), tích hợp trực tiếp các mô hình Học sâu (Deep Learning) vào thiết bị phần cứng nhúng để phân tích cục bộ và phát cảnh báo tự động.
Mục tiêu dự án
- Nghiên cứu và hiện thực hóa mô hình học sâu tối ưu trên phần cứng nhúng: Đánh giá hiệu năng của các kiến trúc 2D CNN (ResNet-18, MobileNet_V2) và 3D CNN (ResNet-3D-18) cho bài toán phân loại ảnh đa lớp và phân loại video thời gian thực.
- Xây dựng bộ dữ liệu tổng hợp phù hợp bối cảnh thực tế tại Việt Nam: Kết hợp dữ liệu chuẩn quốc tế với dữ liệu camera thực tế tại Việt Nam về các hành vi trộm cắp xe máy, bẻ gương ô tô.
- Triển khai hoàn chỉnh hệ thống biên (Edge AI System): Vận hành mô hình trên máy tính nhúng NVIDIA Jetson Nano kết hợp cảm biến Camera Pi NoIR V2, đảm bảo mức tiêu thụ năng lượng thấp (<5W).
- Xây dựng cơ chế cảnh báo thời gian thực: Tích hợp giao thức SMTP gửi thư điện tử kèm bằng chứng hình ảnh tức thì đến người quản trị khi phát hiện sự cố.
Phạm vi và chỉ số kỳ vọng
- Môi trường ứng dụng: Đường phố, bãi đỗ xe, cửa hàng tiện lợi, siêu thị, trung tâm thương mại.
- Tập hành vi nhận dạng: Đánh nhau (Fighting), Trộm cắp xe máy (Stealing Motor), Trộm gương ô tô (Stealing Car Mirror), Phá hoại tài sản/Vẽ bậy (Vandalism) và Trạng thái bình thường (Normal).
- Chỉ số đo lường mục tiêu: Độ chính xác phân loại đạt tối thiểu 70%, tốc độ xử lý khung hình đạt trên 15 FPS trên kit nhúng, thời gian phát cảnh báo dưới 3 giây.
Phân tích và thiết kế giải pháp
Phân tích hiện trạng
| Tiêu chí so sánh |
Hệ thống CCTV truyền thống |
Giải pháp Server-Cloud AI |
Hệ thống Edge AI Camera (Đề xuất) |
| Cơ chế phát hiện |
Thủ công (Nhân viên theo dõi) |
AI xử lý tại Centralized Cloud |
AI xử lý cục bộ tại máy tính nhúng (Edge) |
| Băng thông mạng |
Rất cao (Stream 1080p liên tục) |
Rất cao (Stream video về Cloud) |
Rất thấp (Chỉ gửi cảnh báo & ảnh bằng chứng) |
| Độ trễ cảnh báo |
Phụ thuộc phản xạ con người |
2 – 5 giây (phụ thuộc đường truyền) |
Tức thời (<1.5 giây tại biên) |
| Tính bảo mật |
Dễ rò rỉ luồng video qua mạng |
Rủi ro lưu trữ đám mây tập trung |
Dữ liệu xử lý tại chỗ, tăng tính riêng tư |
| Chi phí vận hành |
Chi phí nhân sự giám sát cao |
Phí thuê server, API, băng thông lớn |
Chi phí đầu tư một lần thấp, tiết kiệm điện |
Phân loại yêu cầu theo mô hình MoSCoW
- Must Have (Bắt buộc): Nhận diện chính xác 4 nhóm hành vi bất thường trọng điểm; xử lý trực tiếp trên kit nhúng NVIDIA Jetson Nano; gửi cảnh báo qua Email có đính kèm ảnh chụp sự kiện.
- Should Have (Nên có): Tích hợp phương pháp phân tích chuỗi không gian - thời gian 3D CNN (ResNet-3D-18); thuật toán lọc nhiễu khung hình (Anti-flickering) tránh báo động giả.
- Could Have (Có thể có): Mở rộng kênh thông báo đa nền tảng (Telegram Bot, Push Notification di động).
- Won't Have (Chưa thực hiện): Nhận diện khuôn mặt danh tính đối tượng hoặc truy vết đa camera (Multi-camera Re-ID).
Thiết kế hệ thống
Kiến trúc hệ thống bao gồm 3 khối chức năng liên kết chặt chẽ:
- Khối thu nhận dữ liệu (Input Module): Module Camera Pi NoIR V2 (cảm biến Sony IMX219 8MP) thu nhận chuỗi khung hình qua giao tiếp CSI tốc độ cao.
- Khối xử lý biên (Edge Processing Core): NVIDIA Jetson Nano Developer Kit thực thi tiền xử lý ảnh (Resize, CenterCrop, Normalize) và chạy suy luận (Inference) qua framework PyTorch được tăng tốc bằng nhân CUDA.
- Khối cảnh báo (Alert Notification Module): Module dịch vụ mạng xử lý đóng gói gói tin MIME và kích hoạt giao thức SMTP qua cổng TLS 587 của Gmail Server.
graph TD
A[Camera Pi NoIR V2\nSony IMX219 8MP] -->|CSI Bus / 30 FPS| B[OpenCV Video Capture Engine]
B -->|Tách Frame / Tensor Conversion| C[Pre-processing Pipeline\nResize 224x224, Normalize]
C -->|Tensor Feed| D{Mô hình Học sâu\nResNet-18 / MobileNet_V2}
D -->|Phân lớp đa hành vi| E[Decision & Anti-Flickering Logic]
E -->|Khung hình Bình thường| F[Tiếp tục ghi nhận / Bỏ qua]
E -->|Hành vi Bất thường Xác thực| G[Alert Module\nPython SMTPLIB Engine]
G -->|TLS Port 587 / SMTP| H[Google Gmail Server]
H -->|Gửi Email Cảnh báo Tức thì| I[Nhân viên An ninh / Quản trị viên]
Bảng thông số công nghệ (Technology Stack)
| Thành phần |
Công nghệ / Phần cứng |
Phiên bản / Thông số kỹ thuật |
Vai trò trong hệ thống |
| Máy tính nhúng |
NVIDIA Jetson Nano |
Quad-Core ARM A57 @ 1.43GHz, 128-core Maxwell GPU, 4GB LPDDR4 |
Phần cứng xử lý suy luận Deep Learning tại biên |
| Cảm biến Camera |
Raspberry Pi NoIR V2 |
Sony IMX219 8MP, CSI Interface, Không lọc hồng ngoại (NoIR) |
Ghi nhận hình ảnh quang học ngày và đêm |
| Hệ điều hành |
Linux Ubuntu |
Ubuntu 18.04 LTS (NVIDIA JetPack SDK 4.4 / L4T) |
Nền tảng điều khiển phần cứng và trình điều khiển GPU |
| Deep Learning |
PyTorch |
PyTorch v1.4.0 with CUDA Acceleration |
Xây dựng, huấn luyện và tối ưu mô hình CNN |
| Thị giác máy tính |
OpenCV |
OpenCV 4.1.x (Python / C++ API) |
Đọc luồng video, tiền xử lý ma trận điểm ảnh |
| Môi trường Train |
Google Colaboratory |
Intel Xeon @ 2.3GHz, 13GB RAM, Tesla K80 12GB VRAM |
Huấn luyện mô hình song song trên đám mây |
| Giao thức mạng |
SMTP / MIME |
RFC 5321 Standard, Port 587 (TLS Encryption) |
Truyền phát cảnh báo tự động qua Internet |
Phương pháp nghiên cứu và Huấn luyện (Methodology)
Quy trình phát triển được chia thành 4 giai đoạn rõ ràng:
- Chuẩn bị và tiền xử lý dữ liệu: Chuẩn hóa toàn bộ dữ liệu từ 2 bộ dữ liệu mở CityScene, UCF-Crime và tập dữ liệu thu thập thực tế tại Việt Nam. Tách video thành các chuỗi ảnh định dạng RGB.
- Kỹ thuật biến đổi không gian (Data Augmentation): Áp dụng phép cắt trung tâm (Center Crop), thu phóng kích thước về $224 \times 224$ pixels, chuẩn hóa giá trị điểm ảnh theo phân phối chuẩn ImageNet (Mean: $[0.485, 0.456, 0.406]$, Std: $[0.229, 0.224, 0.225]$) trước khi nạp vào Tensor PyTorch.
- Huấn luyện mô hình (Model Training): Huấn luyện trên Google Colab trong 10 Epochs sử dụng thuật toán tối ưu Adam/SGD, hàm mất mát Cross-Entropy Loss.
- Đánh giá và tối ưu phần cứng: Đóng gói trọng số
save_weights.pth, nạp lên Jetson Nano và kiểm thử tốc độ suy luận (FPS) cùng độ chính xác thực tế.
Triển khai và kết quả thực nghiệm
Phân tích bộ dữ liệu huấn luyện
Hệ thống được huấn luyện trên Bộ dữ liệu tổng hợp (Custom Synthesized Dataset) gồm 5 nhóm hành vi với 2.435 video, phân bổ thành 186.666 khung hình độc lập:
| Tên lớp hành vi (Class) |
Nguồn dữ liệu gốc |
Số lượng video |
Tập Train (Frames) |
Tập Val (Frames) |
Tập Test (Frames) |
| Fighting (Đánh nhau) |
CityScene + UCF-Crime |
314 |
10.992 |
2.279 |
2.390 |
| Normal Event (Bình thường) |
CityScene + UCF-Crime |
1.708 |
101.059 |
12.998 |
20.334 |
| Stealing Motor (Bẻ khóa xe) |
Thu thập thực tế tại VN |
139 |
6.730 |
688 |
720 |
| Stealing Car Mirror (Bẻ gương) |
Thu thập thực tế tại VN |
91 |
15.817 |
779 |
1.000 |
| Vandalism (Phá hoại/Vẽ bậy) |
UCF-Crime + Tự thu thập |
183 |
9.099 |
842 |
939 |
| TỔNG CỘNG |
— |
2.435 |
143.697 |
17.586 |
25.383 |
Cấu trúc mã nguồn cốt lõi
1. Tiền xử lý dữ liệu và cấu hình suy luận mô hình (PyTorch)
import torch
import torchvision.transforms as transforms
from torchvision.models import resnet18, mobilenet_v2
import cv2
from PIL import Image
# Thiết lập thiết bị tính toán (CUDA Core trên Jetson Nano)
device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
# Định nghĩa Pipeline biến đổi khung hình đầu vào
transform_pipeline = transforms.Compose([
transforms.Resize((224, 224)),
transforms.CenterCrop(224),
transforms.ToTensor(),
transforms.Normalize(mean=[0.485, 0.456, 0.406],
std=[0.229, 0.224, 0.225])
])
# Khởi tạo mô hình phân loại đa lớp ResNet-18 (5 Classes)
def build_model(num_classes=5, weights_path="weights/resnet18_best.pth"):
model = resnet18(pretrained=False)
num_ftrs = model.fc.in_features
model.fc = torch.nn.Linear(num_ftrs, num_classes)
model.load_state_dict(torch.load(weights_path, map_location=device))
model.to(device)
model.eval()
return model
2. Kỹ thuật chống báo động giả (Anti-Flickering) & Gửi email cảnh báo (SMTP)
import smtplib
from email.mime.multipart import MIMEMultipart
from email.mime.text import MIMEText
from email.mime.image import MIMEImage
class SmartAlarmSystem:
def __init__(self, sender_email, sender_password, receiver_email):
self.sender = sender_email
self.password = sender_password
self.receiver = receiver_email
self.consecutive_abnormal_frames = 0
self.THRESHOLD_FRAMES = 5 # Cơ chế chống flickering: yêu cầu 5 frame liên tiếp
def process_detection(self, predicted_class, frame_bgr):
# 0: Fighting, 1: Normal, 2: Stealing_Motor, 3: Stealing_Car_Mirror, 4: Vandalism
if predicted_class != 1: # Khác Normal
self.consecutive_abnormal_frames += 1
if self.consecutive_abnormal_frames >= self.THRESHOLD_FRAMES:
self.trigger_email_alert(predicted_class, frame_bgr)
self.consecutive_abnormal_frames = 0 # Reset sau khi kích hoạt
else:
self.consecutive_abnormal_frames = max(0, self.consecutive_abnormal_frames - 1)
def trigger_email_alert(self, class_id, frame_bgr):
class_names = ["Fighting", "Normal", "Stealing Motor", "Stealing Car Mirror", "Vandalism"]
event_name = class_names[class_id]
msg = MIMEMultipart()
msg['Subject'] = f"[CẢNH BÁO AN NINH] Phát hiện hành vi: {event_name}"
msg['From'] = self.sender
msg['To'] = self.receiver
body = f"Hệ thống Smart Camera phát hiện hành vi bất thường: {event_name}. Vui lòng kiểm tra."
msg.attach(MIMEText(body, 'plain'))
# Mã hóa và đính kèm ảnh bằng chứng trực tiếp từ RAM
_, img_encoded = cv2.imencode('.jpg', frame_bgr)
image_attachment = MIMEImage(img_encoded.tobytes(), name="evidence.jpg")
msg.attach(image_attachment)
# Gửi qua máy chủ SMTP Gmail với TLS
with smtplib.SMTP("smtp.gmail.com", 587) as server:
server.starttls()
server.login(self.sender, self.password)
server.send_message(msg)
Kiểm thử và Đánh giá hiệu năng
Thực nghiệm đo lường hiệu năng suy luận độc lập trên kit nhúng NVIDIA Jetson Nano với các tập dữ liệu khác nhau ghi nhận các kết quả:
| Mô hình Học sâu |
Tập dữ liệu thử nghiệm |
Độ chính xác (Accuracy %) |
Tốc độ suy luận (FPS trên Jetson Nano) |
Mức chiếm dụng VRAM |
| ResNet-18 |
UCF-Crime (4 lớp) |
71.4% |
~25 FPS |
~480 MB |
| ResNet-18 |
CityScene (4 lớp) |
73.2% |
~25 FPS |
~480 MB |
| ResNet-18 |
Bộ dữ liệu tổng hợp (5 lớp) |
76.8% |
~24.5 FPS |
~490 MB |
| MobileNet_V2 |
UCF-Crime (4 lớp) |
68.9% |
~36 FPS |
~310 MB |
| MobileNet_V2 |
CityScene (4 lớp) |
70.1% |
~36 FPS |
~310 MB |
| MobileNet_V2 |
Bộ dữ liệu tổng hợp (5 lớp) |
74.5% |
~35.2 FPS |
~320 MB |
| ResNet-3D-18 |
Video Dataset (16 frames) |
72.0% |
~8 - 10 FPS |
~1.650 MB |
Tốc độ thực thi (FPS) trên NVIDIA Jetson Nano:
MobileNet_V2 : [==================================] 35.2 FPS (Nhanh nhất)
ResNet-18 : [========================] 24.5 FPS (Cân bằng nhất)
ResNet-3D-18 : [=========] 9.0 FPS (Xử lý chuỗi 16 frames)
Phân tích chuyên sâu
- ResNet-18: Cho điểm cân bằng xuất sắc nhất giữa độ chính xác ($76.8%$) và tốc độ xử lý ($24.5$ FPS — đáp ứng chuẩn thời gian thực cho camera giám sát). Khối kết nối tắt (Skip Connections) giúp giải quyết triệt để vấn đề tiêu biến đạo hàm (Vanishing Gradient) trong quá trình huấn luyện mạng nơ-ron sâu.
- MobileNet_V2: Nhờ cấu trúc tích chập tách biệt theo chiều sâu (Depthwise Separable Convolution) và Linear Bottlenecks, mô hình đạt tốc độ vượt trội ($35.2$ FPS) với dung lượng bộ nhớ nhẹ, thích hợp triển khai trên các thiết bị nhúng có tài nguyên hạn chế hơn.
- ResNet-3D-18: Khai thác đặc trưng không gian - thời gian (Spatio-temporal) thông qua bộ lọc 3D trượt trên 16 frame liên tiếp. Mặc dù độ trích xuất hành động liên tục rất tốt, mô hình này đòi hỏi khối lượng tính toán lớn, làm suy giảm tốc độ xử lý xuống dưới 10 FPS trên Jetson Nano.
Đổi mới và đóng góp kỹ thuật
- Kiến trúc Edge AI độc lập hóa hoàn toàn: Chuyển đổi toàn bộ khối phân tích học sâu về phía thiết bị biên (Edge). Dự án loại bỏ 100% chi phí duy trì máy chủ Cloud đắt đỏ, giải phóng hơn 90% áp lực băng thông mạng (chỉ truyền metadata và ảnh bằng chứng khi có sự kiện), đảm bảo quyền riêng tư của dữ liệu giám sát.
- Bản địa hóa dữ liệu huấn luyện cho thực tế Việt Nam: Bổ sung và gán nhãn thủ công các lớp hành vi thực tế có tần suất cao tại đô thị Việt Nam (bẻ khóa trộm xe máy, vặt gương ô tô) vào bộ dữ liệu tổng hợp, giúp nâng cao độ nhạy nhận diện ngoại cảnh trong nước lên $76.8%$.
- Cơ chế lọc rung dao động (Anti-Flickering Algorithm): Ứng dụng cửa sổ trượt phân tích chuỗi xác suất liên tiếp, khắc phục hiện tượng nhảy nhãn ngẫu nhiên của các mô hình 2D CNN trên từng khung hình độc lập, giảm thiểu 85% tỉ lệ cảnh báo sai (False Alarm).
Ứng dụng thực tế và triển khai
Kịch bản triển khai thực tế
- Bãi giữ xe thông minh và Tòa nhà chung cư: Giám sát liên tục các góc khuất, tự động kích hoạt cảnh báo khi xuất hiện đối tượng bẻ khóa xe máy hoặc bẻ trộm phụ tùng ô tô.
- Hệ thống cửa hàng tiện lợi và siêu thị: Phát hiện kịp thời các hành vi xô xát, đánh nhau giữa khách hàng hoặc hành vi trộm cắp tài sản trên quầy kệ.
- Không gian công cộng đô thị (Smart City): Phát hiện các hành vi xịt sơn phá hoại công trình kiến trúc, vẽ bậy trên tường công cộng hoặc phương tiện giao thông.
journey
title Quy trình vận hành thực tế tại Bãi đỗ xe thông minh
section Ghi nhận
Pi NoIR V2 thu luồng video 30 FPS: 5: Camera
OpenCV chuyển đổi thành Tensor: 5: Edge Core
section Phân tích
Jetson Nano thực thi ResNet-18: 4: Edge Core
Bộ đệm Anti-Flickering xác thực >5 frames: 5: Edge Core
section Cảnh báo
Tạo gói tin MIME đính kèm ảnh bằng chứng: 5: Edge Core
Gửi qua SMTP Gmail TLS 587: 5: Network
Bảo vệ nhận Email cảnh báo trên điện thoại: 5: An ninh
Phân tích Hiệu quả Đầu tư (Cost-Benefit & ROI Analysis)
- Chi phí phần cứng một điểm giám sát: ~3.000.000 VNĐ (Bao gồm NVIDIA Jetson Nano, Camera Pi NoIR V2, nguồn 5V/4A, thẻ nhớ MicroSD tốc độ cao và vỏ tản nhiệt).
- So sánh vận hành: Tiết kiệm hàng chục triệu đồng chi phí thuê máy chủ Cloud GPU (tối thiểu 15-20 triệu VNĐ/năm/camera đối với các giải pháp AI Server truyền thống). Năng lượng tiêu thụ thực tế chỉ khoảng 5W – 10W, cho phép hệ thống vận hành liên tục 24/7 với chi phí điện năng dưới 20.000 VNĐ/tháng.
Hạn chế và hướng phát triển
Hạn chế kỹ thuật hiện tại
- Môi trường ánh sáng phức tạp: Mặc dù Camera Pi NoIR V2 loại bỏ kính lọc hồng ngoại giúp bắt sáng tốt hơn vào ban đêm, việc nhận diện trong bóng tối hoàn toàn vẫn cần bổ sung đèn LED hồng ngoại rời.
- Giới hạn tài nguyên huấn luyện: Giới hạn phiên làm việc 12 giờ của Google Colab phiên bản miễn phí hạn chế khả năng huấn luyện các mô hình 3D CNN sâu hơn trong nhiều Epochs.
- Hiện tượng che khuất (Occlusion): Khi đám đông quá dày đặc, các đặc trưng hành vi bị che khuất dẫn đến suy giảm độ chính xác nhận diện.
Hướng phát triển đề xuất
- Tối ưu hóa mô hình với NVIDIA TensorRT: Chuyển đổi trọng số PyTorch sang định dạng ONNX và biên dịch sang TensorRT Engine (FP16/INT8 Precision) để tăng tốc độ suy luận của ResNet-18 lên trên 45 FPS trên Jetson Nano.
- Tích hợp mô hình phát hiện và bám vết đối tượng: Kết hợp thuật toán YOLOv8 Nano + ByteTrack để đóng khung tọa độ (Bounding Box) chính xác của từng đối tượng trước khi phân loại hành vi.
- Đa dạng hóa giao thức cảnh báo: Tích hợp giao thức MQTT kết nối trực tiếp với trung tâm điều khiển Smart Home / Smart City và gửi tin nhắn tức thời qua Webhook Telegram / Zalo Bot.
Đối tượng hưởng lợi
- Sinh viên & Học viên ngành Kỹ thuật Máy tính / AI: Nguồn tài liệu tham khảo thực chiến về quy trình triển khai mô hình Deep Learning từ nghiên cứu lý thuyết đến phần cứng nhúng thực tế.
- Kỹ sư phát triển hệ thống nhúng (Embedded/Edge Developers): Mẫu kiến trúc tích hợp tối ưu giữa PyTorch, OpenCV và nhân đồ họa GPU CUDA trên nền tảng kiến trúc ARM.
- Doanh nghiệp & Đơn vị an ninh: Giải pháp công nghệ chi phí thấp, tính ứng dụng cao, dễ dàng thương mại hóa và lắp đặt phân tán trên diện rộng.
- Nhà nghiên cứu thị giác máy tính: Cơ sở dữ liệu hành vi bất thường thực tế tại Việt Nam cùng phương pháp đánh giá so sánh trực quan giữa mô hình 2D và 3D CNN.
Câu hỏi thường gặp
1. Cần chuẩn bị cấu hình phần cứng tối thiểu nào để tự triển khai lại hệ thống này?
Bạn cần một kit NVIDIA Jetson Nano Developer Kit (bản 4GB B01), một nguồn cấp DC 5V/4A (chân cắm Barrel Jack để đảm bảo cấp đủ dòng cho GPU ở chế độ 10W MAXN), một module Camera Pi NoIR V2 (Sony IMX219) kết nối qua cáp dẹt CSI, cùng một thẻ nhớ MicroSD tối thiểu 32GB (tốc độ đọc ghi chuẩn UHS-I Class 10 trở lên).
2. Thuật toán xử lý thế nào để loại bỏ tình trạng báo động giả (False Alarms)?
Hệ thống sử dụng cơ chế cửa sổ lọc trượt Anti-Flickering. Thay vì kích hoạt cảnh báo ngay khi một khung hình đơn lẻ bị gắn nhãn bất thường, hệ thống yêu cầu mô hình phải dự đoán hành vi bất thường liên tục trong tối thiểu 5 khung hình liên tiếp ($N \ge 5$). Cơ chế này loại bỏ hoàn toàn các nhiễu thoáng qua do góc quay hoặc bóng chuyển động.
3. Hệ thống có thể tích hợp với các đầu ghi hoặc camera IP sẵn có qua mạng LAN không?
Hoàn toàn có thể. Thay vì đọc hình ảnh trực tiếp từ giao tiếp phần cứng CSI của Camera Pi, ta chỉ cần thay đổi đường dẫn nguồn nạp khung hình trong OpenCV sang luồng giao thức RTSP (cv2.VideoCapture("rtsp://admin:password@ip_address:554/stream1")). Jetson Nano sẽ đóng vai trò như một Edge AI Gateway phân tích luồng RTSP từ camera IP hiện hữu.
4. Tại sao đồ án lại lựa chọn ResNet-18 và MobileNet_V2 thay vì các mô hình hiện đại hơn như ResNet-50 hay Vision Transformer?
NVIDIA Jetson Nano sở hữu 128 nhân Maxwell với năng lực xử lý FP16 đạt 472 GFLOPs. Các kiến trúc nặng như ResNet-50 hay Vision Transformer đòi hỏi tài nguyên tính toán và dung lượng bộ nhớ vượt mức 4GB RAM của kit, dẫn đến hiện tượng nghẽn cổ chai và sụt giảm FPS nghiêm trọng ($<5$ FPS). ResNet-18 và MobileNet_V2 mang lại sự cân bằng tối ưu nhất giữa độ chính xác ($>74%$) và tốc độ xử lý mượt mà ($25 - 35$ FPS) trong điều kiện vận hành tại biên.
5. Chi phí triển khai và thời gian hoàn vốn (ROI) của hệ thống ra sao?
Với chi phí đầu tư ban đầu khoảng 3 triệu đồng cho mỗi điểm giám sát độc lập, hệ thống không phát sinh phí duy trì dịch vụ định kỳ. So với phương án thuê Cloud AI (trung bình $15 - 30$ USD/tháng/camera) hoặc thuê nhân sự tuần tra trực tiếp, hệ thống giúp chủ đầu tư đạt điểm hoàn vốn (ROI) chỉ sau 4 đến 6 tháng vận hành thực tế.
Kết luận
Đồ án khóa luận tốt nghiệp "Hệ thống camera thông minh phát hiện các hành vi bất thường" của nhóm tác giả tại Trường Đại học Công nghệ Thông tin – ĐHQG-HCM đã chứng minh tính khả thi và hiệu quả vượt trội của việc ứng dụng Trí tuệ nhân tạo tại biên (Edge AI) trong lĩnh vực an ninh trật tự. Bằng việc kết hợp hài hòa giữa phần cứng nhúng tối ưu (NVIDIA Jetson Nano, Pi NoIR V2) và các kiến trúc mạng nơ-ron tích chập (ResNet-18, MobileNet_V2), hệ thống đạt độ chính xác nhận diện 76.8% ở tốc độ xử lý thời gian thực ~25 FPS, đồng thời tự động phát tín hiệu cảnh báo qua Email có đính kèm ảnh bằng chứng một cách tin cậy.
Giải pháp mở ra tiềm năng ứng dụng to lớn trong việc xây dựng các đô thị thông minh (Smart City), tự động hóa quy trình an ninh tại các bãi giữ xe, tòa nhà công cộng và chuỗi bán lẻ hiện đại. Đây là nền tảng nghiên cứu thực nghiệm vững chắc, sẵn sàng để tiếp tục nâng cấp và thương mại hóa thành các sản phẩm thương mại hoàn chỉnh trong tương lai.