Giới thiệu dự án
Ngành bán lẻ toàn cầu hàng năm phải đối mặt với mức tổn thất hàng tỷ USD do tình trạng thất thoát hàng hóa, trộm cắp và cướp giật (theo National Retail Federation - NRF). Tại Việt Nam, mô hình cửa hàng tiện lợi hoạt động 24/7 (như Circle K, FamilyMart, Ministop, Bách Hóa Xanh, GS25) phát triển bùng nổ, mang lại tiện ích tối đa cho người tiêu dùng. Tuy nhiên, việc vận hành xuyên đêm với sự thiếu vắng nhân viên bảo vệ chuyên trách đã biến các điểm bán này thành mục tiêu trọng điểm của tội phạm bạo lực và trộm cắp tài sản.
+-------------------------------------------------------------------------+
| THỰC TRẠNG GIÁM SÁT AN NINH BÁN LẺ 24/7 |
| |
| [Hạn chế nhân sự] [Hạn chế camera truyền thống] [Lỗ hổng] |
| * Thiếu bảo vệ đêm * Góc khuất do bài trí kệ * Phản ứng |
| * Hiệu suất quan sát * Chỉ ghi hình thụ động, bị động |
| giảm sau 20 phút không có cảnh báo sớm hậu sự cố |
+-------------------------------------------------------------------------+
Vấn đề thực tế (Problem Statement)
Hệ thống giám sát tại các cửa hàng tiện lợi hiện hữu bộc lộ nhiều điểm nghẽn nghiêm trọng:
- Phụ thuộc vào sức người: Nhân viên giám sát suy giảm khả năng tập trung sau 20 phút quan sát liên tục nhiều màn hình camera cùng lúc.
- Tính chất thụ động: Camera giám sát truyền thống (CCTV) đóng vai trò lưu trữ dữ liệu để trích xuất sau khi sự cố đã xảy ra (hậu kiểm), thiếu cơ chế phân tích và kích hoạt báo động thời gian thực (real-time alarm).
- Hạn chế phần cứng: Chi phí đầu tư hệ thống đầu ghi (NVR), camera IP chuyên dụng, màn hình quản trị và hạ tầng mạng Ethernet đồng bộ cho hàng trăm chi nhánh là rào cản tài chính lớn đối với các chuỗi bán lẻ.
Mục tiêu dự án
- Đánh giá tính khả thi: Thực nghiệm và đo lường độ chính xác của mô hình nhận diện khuôn mặt ArcFace kết hợp bộ phát hiện hành vi bất thường trực tuyến MONAD (Sequential Online Anomaly Detection in Surveillance Videos) trên dữ liệu thực tế tại Việt Nam.
- Xây dựng bộ dữ liệu chuyên biệt: Thiết lập 03 tập dữ liệu phục vụ nghiên cứu bán lẻ:
UIT-ConStorexFaces (13 định danh, 78 video), UIT-ConStorexAbnormal (113 video mô phỏng), và UIT-ConStorexWildAbnormal (66 video thực tế).
- Phát triển ứng dụng Android Edge-AI: Tận dụng camera và vi xử lý sẵn có trên thiết bị di động để giám sát trực tiếp, không yêu cầu đầu ghi hay camera phụ trợ.
- Xây dựng Dashboard tập trung: Cung cấp giao diện Web quản lý hồ sơ đối tượng (Blacklist/VIP), thống kê lượt ra vào và hiển thị lịch sử cảnh báo an ninh theo thời gian thực.
Giải pháp và phạm vi nghiên cứu
Đồ án đề xuất giải pháp tích hợp biên - đám mây (Edge-to-Cloud): Thiết bị Android thực hiện tiền xử lý khung hình (Face Detection qua Google ML Kit), sau đó gọi Cloud API thực hiện trích xuất vector đặc trưng khuôn mặt (ArcFace) và phân tích luồng chuyển động/vật thể thông qua kiến trúc MONAD (U-Net Generator + YOLOv4 + Statistical KNN Anomaly Detector).
Phạm vi nghiên cứu tập trung vào 03 nhóm hành vi nguy hại chính trong cửa hàng tiện lợi: Trộm cắp hàng hóa (bỏ vào túi/balo), Cướp giật tài sản, và Tấn công nhân viên.
Phân tích và thiết kế giải pháp
Phân tích hiện trạng
| Tiêu chí |
KBVision Face Recognition |
Xiaomi Yi Home Camera |
Sultani Deep MIL (UCF-Crime) |
Giải pháp đề xuất (Mobile Edge-AI) |
| Kiến trúc phần cứng |
Đầu thu NVR + IP Camera + Mạng LAN |
Camera Wi-Fi độc lập + App di động |
Máy chủ GPU cao cấp (Offline Batch) |
Thiết bị di động Android + Cloud Backend |
| Nhận diện khuôn mặt |
Xử lý trên đầu thu cục bộ |
Không hỗ trợ |
Không hỗ trợ |
Google ML Kit (Edge) + Cloud API (ArcFace) |
| Phát hiện bất thường |
Cảnh báo danh sách đen (Blacklist) |
Phát hiện chuyển động cơ bản |
Deep MIL (Weakly Supervised) |
MONAD (U-Net GAN + YOLOv4 + Statistical KNN) |
| Độ trễ xử lý |
< 500 ms (Mạng nội bộ) |
1 - 3 giây (Cloud push) |
~130 giây / video 20s (GPU P100) |
130 - 270 ms / khuôn mặt; Real-time stream |
| Chi phí triển khai |
Rất cao (Đầu ghi + Camera đắt tiền) |
Thấp (Chỉ phục vụ quan sát gia đình) |
Rất cao (Cơ sở hạ tầng Server GPU) |
Tối ưu (Tận dụng điện thoại thông minh cũ) |
Ma trận yêu cầu chức năng theo chuẩn MoSCoW
- Must Have (Bắt buộc): Phát hiện khuôn mặt trên thiết bị di động bằng Google ML Kit API; Nhận diện đối tượng trong danh sách theo dõi (Blacklist/VIP) qua REST API; Phát hiện hành vi trộm cắp/bạo lực thời gian thực qua MONAD; Dashboard Web hiển thị lịch sử cảnh báo.
- Should Have (Nên có): Bộ lọc làm mượt cảnh báo bất thường liên tục ($s_t$) để triệt tiêu báo động giả; Cơ chế đồng bộ dữ liệu đối tượng đa thiết bị qua cơ sở dữ liệu tập trung.
- Could Have (Có thể có): Chế độ xác thực điểm danh/thanh toán cự ly gần (CheckIn mode); Tùy biến ngưỡng tự tin nhận diện theo điều kiện ánh sáng.
- Won't Have (Chưa thực hiện): Tự động điều khiển khóa cửa thông minh; Nhận dạng hành vi vi phạm khi đối tượng bị che khuất hoàn toàn góc quay.
Thiết kế hệ thống
+-----------------------------------------------------------------------------------+
| KIẾN TRÚC HỆ THỐNG GIÁM SÁT |
+-----------------------------------------------------------------------------------+
| |
| [ANDROID EDGE CLIENT] |
| * Video Capture (30 FPS) ---> Google ML Kit (Face Detection & Tracking) |
| * Edge Filter (Area > 36x36px, Confidence > 0.7) |
| | |
| +--- (HTTPS Multipart / Base64) --------------------------------+ |
| | |
| [AI INFERENCE BACKEND (GPU SERVER)] | |
| * Face Recognition Service: ArcFace ResNet50 (Embedding Vector 512D) | |
| * Anomaly Detection Service (MONAD Pipeline): | |
| - Neural Module: U-Net Future Frame Generator + YOLOv4 (Darknet) | |
| - Feature Vector Construction: F_t^i in R^(n+4) | |
| - Statistical Module: Sequential Online KNN Anomaly Detector | |
| | |
| +--- (JSON Event / Webhook) -------------------------------------+ |
| | |
| [MANAGEMENT DASHBOARD (WEB / SQL DATABASE)] | |
| * Nginx + Node.js/PHP Backend + MySQL DB | |
| * Real-time Alarm Notification, Surveillance Log, Profile Management | |
+-----------------------------------------------------------------------------------+
Ngăn xếp công nghệ (Technology Stack)
- Mobile Edge Client: Android SDK (Java/Kotlin), Google ML Kit Face Detection API v16.x, CameraX API, Retrofit2 REST Client.
- Deep Learning Framework: PyTorch 1.7.1, Darknet (YOLOv4 C-CUDA Backend), OpenCV 4.5.x, CUDA 11.0 / cuDNN 8.0.
- Web Dashboard & Server: Node.js Express / Flask REST API, MySQL 8.0, Vue.js / Bootstrap Responsive Dashboard.
- Giao thức truyền thông: RESTful API qua HTTPS với JSON Web Token (JWT) bảo mật đường truyền.
Phương pháp nghiên cứu (Methodology)
+------------------------------------------------------------------------------------+
| LỘ TRÌNH TRIỂN KHAI DỰ ÁN |
| |
| [Giai đoạn 1: Khảo sát & Thiết kế] |
| * Phân tích các mô hình SOTA: ArcFace, MONAD, YOLOv4, Deep MIL |
| * Thiết kế kiến trúc Hybrid Edge-Cloud |
| |
| [Giai đoạn 2: Thu thập & Chuẩn hóa Dữ liệu] |
| * Xây dựng UIT-ConStorexFaces (78 video, 13 đối tượng) |
| * Xây dựng UIT-ConStorexAbnormal (113 video) & WildAbnormal (66 video) |
| * Gán nhãn Frame-level Annotation |
| |
| [Giai đoạn 3: Hiện thực Mô hình & Ứng dụng] |
| * Lập trình App Android (ML Kit Client) & Web Dashboard |
| * Huấn luyện U-Net Generator + Cấu hình YOLOv4 Darknet |
| * Chuyển đổi MONAD sang cơ chế Online Sequential Inference |
| |
| [Giai đoạn 4: Đánh giá & Tối ưu hóa] |
| * Benchmark Precision, Recall, AUC, Latency |
| * Đóng gói bộ cài đặt APK & API Endpoints |
+------------------------------------------------------------------------------------+
Triển khai thực nghiệm và kết quả
Quy trình phát triển và thuật toán cốt lõi
1. Mô hình toán học trích xuất đặc trưng (MONAD Neural Module)
Mô hình sử dụng mạng U-Net đóng vai trò Generator ($G$) dự đoán khung hình tương lai $\hat{X}t$ từ chuỗi khung hình quá khứ $(X{t-4}, \dots, X_{t-1})$. Hàm mất mát đa thành phần được tối ưu hóa:
$$\mathcal{L}{gen} = \gamma{int} \mathcal{L}{int}(X_t, \hat{X}t) + \gamma{gd} \mathcal{L}{gd}(X_t, \hat{X}t) + \gamma{op} \mathcal{L}{op}(X_t, \hat{X}t) + \gamma{adv} \mathcal{L}{adv}(X_t, \hat{X}_t)$$
Trong đó:
- Cường độ điểm ảnh (Intensity Loss): $\mathcal{L}_{int}(X_t, \hat{X}_t) = |X_t - \hat{X}_t|_2^2$ (Mean Square Error - MSE).
- Độ chênh lệch hướng gradient (Gradient Difference Loss): Bảo toàn độ sắc nét của các cạnh biên đối tượng:
$$\mathcal{L}{gd}(X_t, \hat{X}t) = \sum{i,j} \left| |X{i,j} - X_{i-1,j}| - |\hat{X}{i,j} - \hat{X}{i-1,j}| \right| + \left| |X_{i,j} - X_{i,j-1}| - |\hat{X}{i,j} - \hat{X}{i,j-1}| \right|$$
- Dòng quang học (Optical Flow Loss): Đo lường tính nhất quán chuyển động với bộ trích xuất FlowNet $f$:
$$\mathcal{L}_{op}(X_t, \hat{X}t) = |f(\hat{X}t, X{t-1}) - f(X_t, X{t-1})|_1$$
- Đối kháng (Adversarial Loss): Huấn luyện $G$ đánh lừa mạng phân biệt Discriminator $D$:
$$\mathcal{L}_{adv} = \frac{1}{2} |D(\hat{X}_t) - 1|_2^2$$
Song song đó, mô hình phát hiện vật thể YOLOv4 trích xuất vị trí, kích thước và phân phối xác suất lớp của từng đối tượng $i$. Vector đặc trưng tổng hợp tại thời điểm $t$ cho vật thể $i$ có số chiều $m = n + 4$:
$$F_t^i = \Big[ w_1 \cdot \text{MSE}(X_t, \hat{X}_t),; w_2 \cdot \text{Center}_x,; w_2 \cdot \text{Center}_y,; w_2 \cdot \text{Area},; w_3 \cdot p(C_1), ; \dots, ; w_3 \cdot p(C_n) \Big]$$
2. Phân loại thống kê và triệt tiêu báo động giả (Statistical Module)
Thuật toán $k$-Nearest Neighbor ($k$-NN) tính toán khoảng cách Euclid $d_t^i$ từ vector $F_t^i$ tới không gian đặc trưng bình thường đã học. Điểm bất thường tức thời $\delta_t$ và bộ tích lũy tuần tự $s_t$:
$$\delta_t = \frac{\max_{i}{d_t^i} - \bar{d}}{\sqrt{m}}$$
$$s_t = \max{s_{t-1} + \delta_t, 0}, \quad \text{với } s_0 = 0$$
def sequential_anomaly_filter(delta_series, threshold=0.0, persistence_frames=5):
"""
Triệt tiêu báo động giả bằng bộ tích lũy s_t trực tuyến.
Cảnh báo chỉ được kích hoạt khi s_t > 0 liên tục vượt qua persistence_frames.
"""
s_t = 0.0
alarm_events = []
t_start = None
for t, delta_t in enumerate(delta_series):
s_t = max(0.0, s_t + delta_t)
if s_t > threshold:
if t_start is None:
t_start = t
else:
if t_start is not None:
duration = t - t_start
if duration >= persistence_frames:
alarm_events.append((t_start, t, "Abnormal Event Confirmed"))
t_start = None
return alarm_events
Kết quả kiểm thử và đánh giá (Testing & Validation)
1. Đánh giá tính năng nhận diện khuôn mặt (Dataset UIT-ConStorexFaces)
Bộ dữ liệu gồm 78 video của 13 người dùng được phân loại theo độ khó kịch bản:
Độ chính xác Nhận diện Khuôn mặt theo Ngữ cảnh:
+------------------------+-------------------+---------------+
| Tập dữ liệu thử nghiệm | Điều kiện quay | Precision (%) |
+------------------------+-------------------+---------------+
| CheckIn-Easy | Cự ly gần (30cm) | 97.2% |
| CheckIn-Medium | Di chuyển lại gần | 91.5% |
| Surveillance-Easy | Đứng yên bao quát | 84.3% |
| Surveillance-Medium | Đi lại quan sát | 71.8% |
| Surveillance-Hard | Ngược sáng/Khẩu t.| 59.0% |
+------------------------+-------------------+---------------+
2. Đánh giá phát hiện hành vi bất thường (MONAD Pipeline)
| Bộ dữ liệu đánh giá |
Số lượng Video |
Đặc điểm ngữ cảnh |
Precision (%) |
Recall (%) |
AU-ROC (%) |
| UCSD Ped2 (Baseline chuẩn) |
28 Clips |
Góc quay cố định ngoài trời |
92.4% |
90.1% |
96.2% |
| UIT-ConStorexAbnormal |
113 Clips |
Mô phỏng trộm cắp trong cửa hàng |
82.1% |
76.4% |
85.3% |
| UIT-ConStorexWildAbnormal |
66 Clips |
Video thực tế (Cướp, tấn công tại VN) |
26.3% |
41.5% |
52.8% |
Phân tích nguyên nhân sai số:
- Tập WildAbnormal đạt độ chính xác thấp (26.3%): Do góc quay camera giám sát thực tế tại Việt Nam có độ phân giải không đồng đều (nhiều video chỉ đạt 15 FPS hoặc dưới 480p), góc đặt camera bị rung lắc hoặc có vật cản, đồng thời các vụ tấn công bạo lực ngoài đời thực có tốc độ di chuyển quá nhanh gây hiện tượng nhòe chuyển động (motion blur), làm giảm hiệu năng ước lượng dòng quang học của mạng U-Net GAN.
- Tập Surveillance-Hard (59.0%): Bị ảnh hưởng nặng bởi quy định đeo khẩu trang y tế và góc chụp ngược sáng từ cửa kính cửa hàng tiện lợi.
Đổi mới và đóng góp
- Chuyển đổi thiết bị di động thành trạm giám sát thông minh: Thay thế hoàn toàn hệ thống camera IP và đầu thu chuyên dụng cồng kềnh, giảm 100% chi phí lắp đặt cáp mạng Ethernet và màn hình giám sát riêng biệt.
- Cải tiến MONAD sang cơ chế phân tích trực tuyến (Online Inference): Tác giả gốc [Doshi et al., 2021] chỉ công bố mã nguồn chạy ngoại tuyến theo từng tệp video. Đồ án đã tái cấu trúc pipeline để xử lý luồng khung hình tuần tự theo thời gian thực kết hợp thuật toán lọc báo động giả $s_t$.
- Đóng góp 03 bộ dữ liệu chuẩn hóa cho bán lẻ Việt Nam: Cung cấp tài nguyên mở bao gồm:
UIT-ConStorexFaces: Đánh giá nhận diện khuôn mặt trong điều kiện giám sát thực tế.
UIT-ConStorexAbnormal: Đánh giá hành vi trộm cắp hàng hóa tại kệ hàng.
UIT-ConStorexWildAbnormal: Tập dữ liệu hành vi cướp bóc và tấn công nhân viên thực tế tại Việt Nam gán nhãn mức khung hình (Frame-level).
So sánh Hiệu năng & Khả năng Triển khai:
+------------------------------------+---------------------------------------+
| HỆ THỐNG TRUYỀN THỐNG (CCTV + NVR) | HỆ THỐNG ĐỀ XUẤT (SMARTPHONE EDGE-AI) |
+------------------------------------+---------------------------------------+
| * Chi phí phần cứng: $500 - $1500 | * Chi phí phần cứng: Tận dụng máy cũ |
| * Thời gian thi công: 1 - 2 ngày | * Thời gian cài đặt: < 10 phút |
| * Giám sát bị động (Lưu trữ NVR) | * Cảnh báo chủ động tức thời (Realtime|
| * Độ trễ xử lý sự cố: Hậu kiểm | * Độ trễ phản hồi: 130 - 270 ms |
+------------------------------------+---------------------------------------+
Ứng dụng thực tế và triển khai
Kịch bản sử dụng trong thực tế
- Cửa hàng tiện lợi ca đêm (22h - 6h): Điện thoại thông minh được gắn cố định tại quầy thu ngân hoặc vị trí bao quát cửa ra vào. Khi có đối tượng thuộc danh sách đen hoặc phát sinh hành vi bạo lực/cướp bóc, ứng dụng tự động phát chuông cảnh báo âm lượng lớn và gửi cảnh báo khẩn cấp lên Dashboard cho quản lý chuỗi.
- Điểm xác thực khách hàng thân thiết (VIP CheckIn): Đặt tại quầy thanh toán cự ly 30 - 40 cm, hệ thống nhận diện tức thì khách hàng thân thiết với độ chính xác 97.2% để tự động tích điểm hoặc áp dụng ưu đãi.
Yêu cầu hệ thống và hướng dẫn triển khai
Yêu cầu cấu hình tối thiểu
- Edge Device: Điện thoại thông minh Android 8.0 (Oreo) trở lên, RAM tối thiểu 2GB, Camera trước/sau hỗ trợ tối thiểu 720p@30fps.
- Cloud Backend: 01 GPU Server (NVIDIA GTX 1060 6GB hoặc Tesla T4 trở lên), CPU 4 Cores, RAM 16GB, Ubuntu 18.04/20.04 LTS.
Quy trình cài đặt nhanh 4 bước
- Bước 1 (Backend): Triển khai API Server chạy Docker container chứa Darknet YOLOv4 và PyTorch U-Net Inference Engine:
git clone https://github.com/mausLe/face-detection.git
cd face-detection/backend && docker-compose up -d --build
- Bước 2 (Dashboard): Cài đặt Web App quản trị và cơ sở dữ liệu MySQL:
git clone https://github.com/mausLe/My-Dashboard.git
npm install && npm run build
- Bước 3 (Mobile Client): Cài đặt tệp tin
taConStore.apk lên thiết bị Android từ liên kết được cung cấp, cấp toàn quyền truy cập Camera và Internet.
- Bước 4 (Cấu hình): Nhập địa chỉ API Server trên ứng dụng Android, gán tên định danh cửa hàng và bắt đầu giám sát tự động.
Phân tích hiệu quả kinh tế (Cost-Benefit & ROI)
- Tiết kiệm chi phí đầu tư ban đầu: Giảm từ 15.000.000 VNĐ (chi phí lắp 4 camera + đầu ghi NVR + ổ cứng) xuống còn dưới 1.500.000 VNĐ (sử dụng smartphone Android phân khúc phổ thông hoặc máy cũ tái sử dụng).
- Thời gian hoàn vốn (ROI): Ước tính đạt điểm hòa vốn sau 1 - 2 tháng vận hành nhờ việc ngăn ngừa tổn thất hàng hóa trộm cắp và tối ưu hóa nhân sự trực đêm.
Hạn chế và hướng phát triển
Hạn chế kỹ thuật
- Khả năng nhận diện khuôn mặt suy giảm mạnh (xuống 59.0%) khi khách hàng đeo khẩu trang kín, đội mũ bảo hiểm có kính che hoặc đứng trong môi trường ngược sáng mạnh.
- Mô hình MONAD phụ thuộc nhiều vào độ ổn định của dòng quang học (Optical Flow), dẫn đến tỷ lệ nhận diện sai tăng cao khi áp dụng trên các video camera giám sát chất lượng thấp (tập WildAbnormal chỉ đạt 26.3%).
- Phụ thuộc vào chất lượng kết nối Internet để truyền dữ liệu nhận diện lên Cloud Backend.
Hướng phát triển tiếp theo
- Tối ưu hóa On-Device Deep Learning: Nén mô hình phát hiện hành vi bằng TensorFlow Lite hoặc TensorRT để chạy trực tiếp trên chip xử lý thần kinh (NPU) của điện thoại cao cấp mà không cần truyền video lên máy chủ.
- Tích hợp mô hình Masked Face Recognition: Ứng dụng kiến trúc ArcFace chuyên biệt cho khuôn mặt có khẩu trang kết hợp trích xuất đặc trưng vùng mắt/trán.
- Nâng cấp nhận dạng hành vi bằng mô hình Không-Thời gian (Spatial-Temporal Transformers): Thay thế GAN bằng mạng Video Swin Transformer hoặc SlowFast Networks để phân biệt chính xác hành vi trộm cắp tinh vi và hành vi chọn hàng thông thường.
Đối tượng hưởng lợi
- Sinh viên & Học viên cao học ngành Kỹ thuật Máy tính / CNTT: Nguồn tài liệu tham khảo hoàn chỉnh về quy trình xây dựng đồ án tốt nghiệp, phương pháp thu thập và chuẩn hóa bộ dữ liệu thị giác máy tính thực tế.
- Kỹ sư phát triển phần mềm (AI/Mobile Developers): Tham khảo kiến trúc kết hợp Google ML Kit trên thiết bị di động với Backend Inference Server thông qua mã nguồn mở công khai.
- Chủ doanh nghiệp & Quản lý chuỗi bán lẻ vừa và nhỏ (SMBs): Giải pháp công nghệ chi phí thấp giúp số hóa quy trình an ninh, nâng cao hiệu quả phòng chống tội phạm mà không cần đầu tư hệ thống đắt tiền.
- Nhà nghiên cứu Thị giác máy tính (Computer Vision Researchers): Tiếp cận 03 bộ dữ liệu video đặc thù cho môi trường bán lẻ Việt Nam phục vụ huấn luyện mô hình nhận dạng hành vi bất thường.
Câu hỏi thường gặp
1. Hệ thống có yêu cầu phần cứng điện thoại đắt tiền để xử lý AI không?
Không. Thiết bị di động chỉ thực hiện tác vụ nhận diện vị trí khuôn mặt bằng Google ML Kit (được Google tối ưu hóa cực nhẹ trên vi xử lý ARM). Toàn bộ tác vụ học sâu phức tạp (ArcFace, U-Net GAN, YOLOv4) được xử lý tập trung trên máy chủ GPU thông qua API. Do đó, các dòng điện thoại Android phổ thông (RAM 2GB) đều đáp ứng tốt.
2. Độ trễ cảnh báo của hệ thống là bao nhiêu và có đáp ứng thời gian thực không?
Độ trễ trung bình của một yêu cầu nhận diện khuôn mặt qua API dao động từ 130 ms đến 270 ms (tương đương tốc độ xử lý 4 - 7 khuôn mặt/giây). Hệ thống phân tích hành vi bất thường lọc liên tục theo từng chuỗi 5 khung hình ($s_t$), đảm bảo kích hoạt chuông cảnh báo trong vòng dưới 1 giây kể từ khi hành vi nguy hại xuất hiện.
3. Khi mất kết nối Internet, ứng dụng có tiếp tục hoạt động được không?
Khi mất mạng, ứng dụng di động vẫn duy trì tính năng phát hiện khuôn mặt và theo dõi đối tượng (Face Tracking) cục bộ trên máy. Tuy nhiên, tác vụ định danh đối tượng qua cơ sở dữ liệu đám mây và phân tích hành vi bất thường sẽ tạm dừng cho đến khi kết nối Internet được phục hồi.
4. Hệ thống xử lý thế nào để không bị báo động giả liên tục?
Mô hình tích hợp thuật toán lọc thống kê tuần tự: Biến tích lũy $s_t = \max{s_{t-1} + \delta_t, 0}$ chỉ xác nhận một sự kiện là bất thường nếu độ lệch khoảng cách $\delta_t$ duy trì giá trị dương trong một khoảng thời gian liên tục ($T_{start} \to T_{end}$). Các biến động chuyển động thoáng qua dưới 5 khung hình sẽ tự động bị triệt tiêu.
5. Chi phí duy trì hệ thống máy chủ định kỳ ước tính khoảng bao nhiêu?
Chi phí thuê máy chủ Cloud GPU (như 1 GPU NVIDIA T4 trên Google Cloud hoặc AWS) phục vụ cho chuỗi từ 5 - 10 cửa hàng dao động trong khoảng $50 - $100/tháng. Doanh nghiệp có thể tiết kiệm chi phí bằng cách tự trang bị 01 máy chủ vật lý đặt tại văn phòng trung tâm kết nối qua IP tĩnh.
Kết luận
Đồ án tốt nghiệp "Phát triển ứng dụng di động hỗ trợ quản lý cửa hàng tiện lợi sử dụng công nghệ nhận dạng khuôn mặt và phát hiện hành vi bất thường" của tác giả Lê Tuấn Anh (Trường ĐH Công nghệ Thông tin - ĐHQG TP.HCM) đã chứng minh tính khả thi và hiệu quả vượt trội của việc đưa các công nghệ học sâu tiên tiến (ArcFace, MONAD, YOLOv4) vào giải quyết bài toán an ninh bán lẻ tại Việt Nam.
Bằng việc kết hợp sáng tạo giữa vi xử lý biên trên smartphone Android và máy chủ suy luận thị giác máy tính, đồ án đã giải quyết đồng thời bài toán kinh tế và kỹ thuật: Triệt tiêu chi phí đầu tư phần cứng đắt đỏ, hỗ trợ phản ứng nhanh trước các rủi ro trộm cướp, và đặt nền móng cho các hệ thống bán lẻ thông minh (Smart Retail) trong tương lai.
+-------------------------------------------------------------------------+
| TÀI NGUYÊN MÃ NGUỒN VÀ DỮ LIỆU ĐỒ ÁN |
| |
| * Ứng dụng di động Android: https://github.com/mausLe/face-detection |
| * Hệ thống Web Dashboard: https://github.com/mausLe/My-Dashboard |
| * Video Demo hệ thống: https://youtu.be/wWdUGKihG7Y |
| * Bộ dữ liệu thực nghiệm: https://tinyurl.com/talDatasets |
+-------------------------------------------------------------------------+