Giới thiệu dự án
Theo thống kê từ Tổ chức Y tế Thế giới (WHO), té ngã là nguyên nhân hàng đầu gây chấn thương không cố ý ở người cao tuổi, chiếm hơn 50% các ca nhập viện do tai nạn sinh hoạt gia đình, trong đó hơn 60% trường hợp không được cấp cứu kịp thời trong "khung giờ vàng" do sống một mình hoặc người thân vắng nhà. Song song đó, các vấn đề an ninh gia đình và hành vi bạo lực gia đình/bạo hành trẻ nhỏ khi thiếu vắng sự giám sát trực tiếp đang trở thành bài toán nhức nhối trong xã hội hiện đại.
Các hệ thống camera an ninh truyền thống (CCTV) hiện nay phần lớn chỉ hoạt động như một công cụ ghi hình thụ động (passive surveillance) hoặc sử dụng các bộ lọc phát hiện chuyển động thô sơ dựa trên biến đổi pixel (pixel-level motion detection), dẫn đến tỷ lệ báo động giả (false positive rate) lên tới trên 70%. Khi sự cố nguy hiểm như té ngã hoặc bạo lực xảy ra, người dùng chỉ có thể xem lại video sau khi hậu quả đáng tiếc đã phát sinh.
Đề tài "Xây dựng ứng dụng di động tích hợp với camera giám sát tại nhà để phát hiện mối nguy hiểm tiềm ẩn qua mô hình học sâu" (HomeCamera) do sinh viên Lê Anh Thư (Khoa Hệ thống Thông tin, Trường Đại học Công nghệ Thông tin - ĐHQG-HCM) thực hiện dưới sự hướng dẫn của PGS.TS Nguyễn Đình Thuân và KS. Nguyễn Minh Nhựt, được xây dựng nhằm giải quyết triệt để bài toán giám sát chủ động theo thời gian thực.
+-----------------------------------------------------------------------------------+
| MỤC TIÊU DỰ ÁN |
+-----------------------------------------------------------------------------------+
| 1. Nghiên cứu, thực nghiệm và đánh giá các kiến trúc học sâu (Deep Learning) |
| chuyên sâu cho bài toán nhận dạng hành vi người: CNN, LSTM, Transformer AcT, |
| SVC kết hợp OpenPose trích xuất khung xương, và các mô hình phát hiện đối |
| tượng đơn pha (Single-shot) thế hệ mới YOLOv8, YOLO-NAS. |
| 2. Xây dựng giải pháp truyền phát video trực tiếp thời gian thực với độ trễ siêu |
| thấp (< 500ms) thông qua giao thức WebRTC kết hợp Media Server Mediasoup. |
| 3. Phát triển ứng dụng di động Android Native tương tác trực tiếp với Camera, |
| tự động nhận cảnh báo đẩy (Push Notification) kèm hình ảnh snapshot sự cố. |
| 4. Đóng gói hệ thống hoàn chỉnh từ khâu thu nhận tín hiệu IP Camera, phân tích |
| luồng dữ liệu tại Server AI đến phản hồi tức thì cho người dùng cuối. |
+-----------------------------------------------------------------------------------+
Dự án tiếp cận giải pháp bằng mô hình kiến trúc lai Client-Server xử lý luồng streaming phân tán. Hệ thống sử dụng camera IP chuẩn RTSP truyền hình ảnh về Server xử lý trung tâm; tại đây, các mô hình học sâu đã tối ưu hóa thực hiện suy luận liên tục trên từng khung hình và đẩy cảnh báo tức thời qua Firebase Cloud Messaging (FCM) đến thiết bị di động Android.
- Chỉ số kỳ vọng: Tốc độ xử lý đạt $\ge 25\text{ FPS}$, độ chính xác phát hiện té ngã và hành vi bạo lực đạt $\ge 88%$, độ trễ truyền phát WebRTC $\le 300\text{ ms}$.
- Phạm vi nghiên cứu: Giám sát môi trường trong nhà (Indoor Home Surveillance), tập trung vào hai bài toán cốt lõi: phát hiện người té ngã (Human Fall Detection) và phát hiện hành vi bạo lực (Violence Detection). Hệ thống thử nghiệm dựa trên hai tập dữ liệu chuẩn: Fall Human Dataset và Real Life Violence Situation Dataset.
Phân tích và thiết kế giải pháp
Phân tích hiện trạng
Khảo sát các giải pháp camera giám sát thông minh thương mại trên thị trường cho thấy sự phân hóa rõ rệt giữa tính năng và chi phí:
| Tiêu chí |
EZVIZ |
Yoosee |
Wyze Cam v3 |
Arlo Pro 4 |
HomeCamera (Đề xuất) |
| Giao thức truyền phát |
RTSP / P2P Cloud |
Cloudlink P2P |
P2P Streaming |
Cloud Streaming |
WebRTC (Mediasoup P2P/SFU) |
| Độ trễ truyền hình ảnh |
1.5s - 3.0s |
2.0s - 4.0s |
1.0s - 2.5s |
1.5s - 3.0s |
< 300ms |
| Công nghệ AI áp dụng |
Motion / Human Shape |
Motion Detection thô |
Motion / Sound |
Cloud AI Detection |
YOLOv8 / OpenPose + Transformer |
| Phát hiện té ngã/bạo lực |
Không hỗ trợ |
Không hỗ trợ |
Không hỗ trợ |
Giới hạn (Gói trả phí) |
Chuyên sâu thời gian thực (Local/Dedicated AI) |
| Chi phí thuê bao Cloud |
Bắt buộc để lưu sự kiện |
Miễn phí (Chứa quảng cáo) |
Yêu cầu gói Cam Plus |
Rất cao ($4.99 - $14.99/tháng) |
Tự lưu trữ, không phí duy trì |
| Bảo mật luồng video |
Mã hóa tiêu chuẩn |
Kém, bảo mật yếu |
Mã hóa tiêu chuẩn |
Mã hóa cấp ngân hàng |
Mã hóa đầu cuối SRTP/DTLS |
Phân tích yêu cầu hệ thống theo mô hình MoSCoW:
- Must-have (Bắt buộc): Truyền phát video trực tiếp qua WebRTC; Nhận diện tự động tư thế té ngã và hành vi bạo lực; Gửi cảnh báo tức thời qua Notification; Lưu trữ hình ảnh và lịch sử sự kiện nguy hiểm.
- Should-have (Nên có): Điều khiển luồng camera từ xa; Xem lại lịch sử video vi phạm; Hỗ trợ đàm thoại 2 chiều qua micro/loa camera.
- Could-have (Có thể có): Tùy chỉnh vùng cảnh báo (Region of Interest - ROI); Cấu hình ngưỡng tin cậy (Confidence threshold) linh hoạt theo từng camera.
- Won't-have (Chưa triển khai): Nhận diện khuôn mặt 3D phân cấp; Tích hợp hệ thống nhà thông minh qua Apple HomeKit/Matter trong phiên bản hiện tại.
Thiết kế hệ thống
Kiến trúc hệ thống HomeCamera được tổ chức theo mô hình phân tầng module hóa, đảm bảo khả năng mở rộng và chịu tải:
graph TD
A["IP Camera (RTSP Stream)"] -->|"RTSP/H.264"| B["AI Ingestion & Processing Worker"]
B -->|"Frame Decode (OpenCV)"| C{"AI Detection Engine"}
C -->|"Inference"| D1["YOLOv8 Detection"]
C -->|"Skeleton Extraction"| D2["OpenPose + LSTM/Transformer"]
D1 -->|"Hazard Detected"| E["Event Manager & Alert Service"]
D2 -->|"Hazard Detected"| E
B -->|"Media Stream"| F["WebRTC Server (Mediasoup)"]
E -->|"Store Metadata/Snapshots"| G[("Database & File Storage")]
E -->|"Push Notification"| H["Firebase Cloud Messaging (FCM)"]
F <-->|"WebRTC (SRTP/DTLS) < 300ms"| I["Android Client Application"]
H -->|"Alert Payload"| I
G <-->|"RESTful API / JSON"| I
Technology Stack và phiên bản chi tiết:
- Deep Learning & Computer Vision: Python 3.10, PyTorch v2.1.0, Ultralytics YOLOv8 (v8.1.0), OpenPose C++ / Python API v1.7.0, OpenCV v4.8.0, Scikit-learn v1.3.0.
- Backend & Streaming Infrastructure: Node.js v18 LTS, Mediasoup v3.12, FastAPI v0.109.0, Gunicorn/Uvicorn, Redis v7.0 (Signaling & Cache).
- Mobile Client: Android Native (Java 17 / Android SDK 33 - Android 13+), WebRTC Android SDK (M110), Retrofit2, Glide, Firebase SDK.
- Cơ sở dữ liệu: SQLite / PostgreSQL v15, MinIO / Local Object Storage lưu trữ snapshot sự cố.
Thiết kế Cơ sở dữ liệu:
Hệ thống sử dụng mô hình cơ sở dữ liệu quan hệ tối ưu hóa cho truy vấn lịch sử cảnh báo:
-- Bảng định danh người dùng
CREATE TABLE Users (
user_id SERIAL PRIMARY KEY,
username VARCHAR(50) UNIQUE NOT NULL,
password_hash VARCHAR(255) NOT NULL,
email VARCHAR(100) UNIQUE NOT NULL,
full_name VARCHAR(100),
fcm_token VARCHAR(255),
created_at TIMESTAMP DEFAULT CURRENT_TIMESTAMP
);
-- Bảng quản lý thiết bị Camera
CREATE TABLE Cameras (
camera_id SERIAL PRIMARY KEY,
user_id INT REFERENCES Users(user_id) ON DELETE CASCADE,
camera_name VARCHAR(100) NOT NULL,
rtsp_url VARCHAR(255) NOT NULL,
location VARCHAR(100),
status VARCHAR(20) DEFAULT 'ACTIVE',
created_at TIMESTAMP DEFAULT CURRENT_TIMESTAMP
);
-- Bảng lưu trữ kết quả phát hiện mối nguy hiểm
CREATE TABLE DetectedResults (
event_id SERIAL PRIMARY KEY,
camera_id INT REFERENCES Cameras(camera_id) ON DELETE CASCADE,
hazard_type VARCHAR(50) NOT NULL, -- 'FALL_DETECTED' hoặc 'VIOLENCE_DETECTED'
confidence_score FLOAT NOT NULL,
snapshot_path VARCHAR(255) NOT NULL,
detected_time TIMESTAMP DEFAULT CURRENT_TIMESTAMP,
is_confirmed BOOLEAN DEFAULT FALSE
);
Thiết kế API Endpoints chính:
POST /api/v1/auth/login: Xác thực người dùng, trả về JWT Access Token.
GET /api/v1/cameras: Lấy danh sách camera thuộc quyền quản lý của người dùng.
POST /api/v1/webrtc/transport/create: Khởi tạo WebRTC Transport trên Mediasoup Server.
POST /api/v1/webrtc/consume: Yêu cầu consume luồng video thời gian thực từ Camera chỉ định.
GET /api/v1/events/history?camera_id={id}&limit=50: Truy vấn danh sách lịch sử cảnh báo nguy hiểm kèm snapshot URL.
Methodology
Dự án áp dụng quy trình phát triển phần mềm theo mô hình Agile Scrum kết hợp nghiên cứu khoa học thực nghiệm (Empirical Research), chia làm 4 giai đoạn chính (16 tuần):
Tuần 01 - 04 [Phase 1]: Thu thập dataset, tiền xử lý, huấn luyện và đánh giá mô hình AI.
Tuần 05 - 08 [Phase 2]: Phân tích Usecase, thiết kế kiến trúc hệ thống, xây dựng CSDL.
Tuần 09 - 12 [Phase 3]: Xây dựng hạ tầng WebRTC Media Server với Mediasoup và pipeline AI.
Tuần 13 - 16 [Phase 4]: Lập trình ứng dụng Android, tích hợp hệ thống, kiểm thử và tối ưu hóa.
Implementation và kết quả
Development process
Quá trình triển khai tập trung vào việc hiện thực hóa các giải thuật phân loại chuỗi động tác và phát hiện đối tượng:
1. Mô hình dựa trên trích xuất khung xương (Pose-based Classification)
OpenPose trích xuất 25 điểm khớp nối cơ thể (Body Keypoints bao gồm: Nose, Neck, Shoulders, Elbows, Wrists, Hips, Knees, Ankles,...). Chuỗi tọa độ $X_t = { (x_i, y_i, c_i) }_{i=1}^{25}$ qua các khung hình liên tiếp được đưa vào các mạng phân loại:
- LSTM (Long Short-Term Memory): Giải quyết hiện tượng triệt tiêu đạo hàm (Vanishing Gradient) thông qua 3 cổng điều khiển:
$$\text{Forget Gate: } f_t = \sigma(W_f \cdot [h_{t-1}, x_t] + b_f)$$
$$\text{Input Gate: } i_t = \sigma(W_i \cdot [h_{t-1}, x_t] + b_i)$$
$$\text{Candidate Cell State: } \tilde{C}t = \tanh(W_c \cdot [h{t-1}, x_t] + b_c)$$
$$\text{Cell State Update: } C_t = f_t \odot C_{t-1} + i_t \odot \tilde{C}t$$
$$\text{Output Gate: } o_t = \sigma(W_o \cdot [h{t-1}, x_t] + b_o)$$
$$\text{Hidden State: } h_t = o_t \odot \tanh(C_t)$$
- Transformer AcT (Action Transformer): Sử dụng cơ chế Self-Attention đa đầu (Multi-Head Self-Attention) để nắm bắt mối quan hệ không gian - thời gian giữa các khớp trong chuỗi chuyển động dài:
$$\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V$$
2. Mô hình phát hiện đối tượng đơn pha YOLOv8
YOLOv8 sử dụng kiến trúc CSPNet (Cross Stage Partial Network) tại Backbone, kết hợp Path Aggregation Network (PAN) tại Neck và Decoupled Head phân tách độc lập nhánh phân loại (Classification) và hồi quy tọa độ (Bounding Box Regression) sử dụng hàm mất mát SIoU/CIoU.
import cv2
import torch
from ultralytics import YOLO
class HazardDetectionPipeline:
def __init__(self, model_path: str, conf_threshold: float = 0.65):
# Nạp mô hình YOLOv8 đã fine-tune trên dữ liệu té ngã & bạo lực
self.model = YOLO(model_path)
self.conf_threshold = conf_threshold
self.classes = ['Normal', 'Fall_Detected', 'Violence_Detected']
def process_frame(self, frame):
"""
Xử lý từng khung hình video từ WebRTC/RTSP stream
"""
results = self.model.predict(
source=frame,
conf=self.conf_threshold,
device='0' if torch.cuda.is_available() else 'cpu',
verbose=False
)
detected_hazards = []
for r in results:
boxes = r.boxes
for box in boxes:
cls_id = int(box.cls[0])
conf = float(box.conf[0])
label = self.classes[cls_id]
if label in ['Fall_Detected', 'Violence_Detected']:
coords = box.xyxy[0].tolist()
detected_hazards.append({
"hazard_type": label,
"confidence": round(conf, 4),
"bbox": coords
})
return detected_hazards
Testing và validation
Nghiên cứu áp dụng kỹ thuật 5-Fold Cross-Validation trên tập dữ liệu đã qua tiền xử lý, chuẩn hóa độ phân giải, tăng cường dữ liệu (Data Augmentation: Random Crop, Horizontal Flip, Brightness Adjustment).
Kết quả so sánh thực nghiệm trên tập dữ liệu Hành động Bạo lực (Violence Dataset):
| Thuật toán / Mô hình | Accuracy (%) | Precision (%) | Recall (%) | F1-Score (%) | Inference Time (CPU) | Inference Time (GPU RTX 3060) |
| :--- | :--- | :--- | :--- | :--- | :--- |
| OpenPose + SVC (RBF Kernel) | 78.42% | 76.50% | 79.10% | 77.78% | 185 ms / frame | 42 ms / frame |
| OpenPose + CNN | 82.15% | 80.90% | 83.20% | 82.03% | 210 ms / frame | 38 ms / frame |
| OpenPose + LSTM | 86.70% | 85.40% | 87.10% | 86.24% | 240 ms / frame | 35 ms / frame |
| OpenPose + Transformer AcT | 89.35% | 88.60% | 89.80% | 89.20% | 290 ms / frame | 31 ms / frame |
| YOLOv8 (Fine-tuned) | 92.80% | 91.75% | 93.20% | 92.47% | 45 ms / frame | 11 ms / frame (~90 FPS) |
Kết quả so sánh thực nghiệm trên tập dữ liệu Tư thế Té ngã (Fall Dataset):
| Mô hình |
Accuracy (%) |
Precision (%) |
Recall (%) |
F1-Score (%) |
mAP@0.5 (%) |
| OpenPose + LSTM |
88.20% |
87.10% |
89.50% |
88.28% |
- |
| OpenPose + Transformer |
90.45% |
89.80% |
91.20% |
90.49% |
- |
| YOLO-NAS |
91.60% |
90.80% |
92.10% |
91.44% |
93.10% |
| YOLOv8 |
94.15% |
93.50% |
94.80% |
94.14% |
95.60% |
Hiệu năng hệ thống tổng thể (End-to-End Benchmark):
- Độ trễ truyền luồng WebRTC Video: 210ms - 280ms (Mạng Wi-Fi gia đình tiêu chuẩn)
- Thời gian từ khi AI phát hiện sự cố đến khi Mobile nhận Push Alert: 650ms - 900ms
- Tải CPU trên thiết bị máy chủ: Chiếm trung bình 18% (Server GPU RTX 3060)
- Tỷ lệ phát hiện đúng (True Positive Rate) trong môi trường thử nghiệm thực tế: 91.5%
Kết quả đạt được
Hệ thống đã hoàn thiện toàn diện các module chức năng:
- Phát trực tiếp video từ camera an ninh với độ trễ thấp thông qua WebRTC.
- Phát hiện tự động hành vi té ngã và bạo lực với độ chính xác trên 92%.
- Ứng dụng Android chạy ổn định, giao diện Material Design trực quan, nhận cảnh báo đẩy tức thì có đính kèm ảnh chụp sự kiện.
- Cung cấp tính năng quản lý danh sách camera, xem lại lịch sử vi phạm được phân loại theo mốc thời gian rõ ràng.
Đổi mới và đóng góp
- Tích hợp sâu WebRTC vào quy trình xử lý AI thời gian thực: Thay vì sử dụng chuẩn HLS (độ trễ 6 - 15 giây) hoặc RTMP (độ trễ 2 - 4 giây), việc tích hợp Mediasoup SFU WebRTC giúp giảm độ trễ hiển thị xuống dưới 300ms, cho phép phản ứng tức thì khi xảy ra sự cố nguy kịch.
- Loại bỏ sự phụ thuộc vào cảm biến đeo (Wearable-free Monitoring): Khắc phục nhược điểm lớn nhất của các thiết bị phát hiện té ngã đeo tay (người già thường quên sạc pin, quên đeo, hoặc cảm thấy bất tiện) bằng cách sử dụng hoàn toàn thị giác máy tính không xâm lấn.
- So sánh đa diện giữa Pose-based và Single-shot Object Detection: Đưa ra phân tích thực nghiệm chuyên sâu chứng minh YOLOv8 vượt trội về tốc độ suy luận gấp 4-6 lần so với chuỗi xử lý 2 giai đoạn OpenPose + LSTM/Transformer trên cùng điều kiện phần cứng.
- Đóng góp mã nguồn và tài liệu học thuật: Cung cấp kiến trúc tham chiếu hoàn chỉnh cho sinh viên, kỹ sư ngành Hệ thống Thông tin và Trí tuệ Nhân tạo tại ĐHQG-HCM trong việc hiện thực hóa các bài toán AI Edge-to-Cloud.
Ứng dụng thực tế và triển khai
Kịch bản sử dụng thực tế
+-----------------------------------------------------------------------------------+
| KỊCH BẢN 1: GIÁM SÁT NGƯỜI CAO TUỔI TẠI GIA ĐÌNH |
| Cụ già 75 tuổi bị trượt chân ngã trong phòng khách khi người thân đi làm. |
| -> Camera ghi nhận -> YOLOv8 kích hoạt nhãn 'Fall_Detected' (Conf: 94.8%) |
| -> Hệ thống lưu snapshot -> Gửi Push Notification rung chuông khẩn cấp đến điện |
| thoại con cái trong vòng 0.8 giây -> Người thân mở Live WebRTC xác nhận và |
| gọi cứu hộ y tế kịp thời trong khung giờ vàng. |
+-----------------------------------------------------------------------------------+
| KỊCH BẢN 2: BẢO VỆ TRẺ NHỎ TẠI NHÀ TRẺ / TRƯỜNG MẦM NON |
| Phát hiện sớm các hành vi xô xát, bạo lực giữa học sinh hoặc hành vi bạo hành |
| từ người giám sát. Cảnh báo lập tức gửi đến ban quản lý để can thiệp trước khi |
| xảy ra thương tích nghiêm trọng. |
+-----------------------------------------------------------------------------------+
Chiến lược triển khai và Yêu cầu phần cứng
Cấu hình máy chủ triển khai AI Server (Dành cho 4 - 8 luồng Camera đồng thời):
- CPU: Intel Core i5-11400 / AMD Ryzen 5 5600X trở lên
- GPU: NVIDIA GeForce GTX 1660 Super (6GB VRAM) hoặc RTX 3060 (12GB VRAM)
- RAM: 16GB DDR4 3200MHz
- Băng thông mạng: Tối thiểu 30 Mbps Upload/Download
- Hệ điều hành: Ubuntu Server 22.04 LTS, Docker Engine v24.0+
Cấu hình thiết bị đầu cuối Camera & Mobile:
- Camera: Chuẩn kết nối RTSP/ONVIF, độ phân giải 1080p @ 25fps, hỗ trợ Night Vision
- Thiết bị di động: Android 8.0 (API Level 26) trở lên, RAM tối thiểu 3GB
Phân tích Chi phí - Lợi ích (Cost-Benefit Analysis)
- Chi phí: Đầu tư máy chủ mini cục bộ hoặc thuê VPS GPU Cloud (~$25 - $40/tháng cho 4 camera).
- Lợi ích kinh tế: Tiết kiệm hơn 80% so với chi phí thuê nhân viên điều dưỡng túc trực 24/7 (khoảng 8 - 15 triệu VNĐ/tháng), loại bỏ hoàn toàn phí thuê bao đám mây định kỳ của các hãng camera quốc tế.
Hạn chế và hướng phát triển
Hạn chế kỹ thuật
- Vấn đề che khuất (Occlusion): Khi đối tượng bị bàn ghế, tủ che khuất hơn 60% cơ thể, độ chính xác nhận diện giảm khoảng 18%.
- Môi trường ánh sáng cực yếu: Trong điều kiện bóng tối hoàn toàn không có đèn hồng ngoại (Infrared), mô hình thị giác bị nhiễu hạt dẫn đến bỏ sót sự kiện.
- Hạ tầng mạng phụ thuộc: Băng thông yếu (< 2 Mbps) làm tăng hiện tượng rớt khung hình (packet loss) của giao thức WebRTC.
Hướng phát triển tương lai
- Tối ưu hóa Edge AI bằng Lượng tử hóa (Quantization): Áp dụng TensorRT và INT8 Quantization để triển khai mô hình trực tiếp trên các vi xử lý nhúng giá rẻ như NVIDIA Jetson Orin Nano hoặc Raspberry Pi 5.
- Mở rộng tập hành vi bất thường: Tích hợp mô hình nhận diện các mối nguy hiểm khác như cháy nổ (Fire & Smoke Detection), đột nhập trái phép (Intrusion Detection), hoặc trèo lan can nguy hiểm ở trẻ nhỏ.
- Tích hợp âm thanh đa phương thức (Multimodal Audio-Visual AI): Kết hợp mô hình nhận diện tiếng thét, tiếng đổ vỡ âm thanh với hình ảnh để nâng cao độ tin cậy, giảm tỷ lệ cảnh báo sai xuống dưới 1%.
Đối tượng hưởng lợi
+------------------------------------------------------------------------------------+
| 1. SINH VIÊN & NGHIÊN CỨU SINH |
| - Tiếp cận mã nguồn mẫu về tích hợp WebRTC với Deep Learning Pipeline. |
| - Tham khảo phương pháp luận đánh giá 5-Fold Cross-Validation và ma trận lỗi. |
+------------------------------------------------------------------------------------+
| 2. KỸ SƯ PHÁT TRIỂN HỆ THỐNG (DEVELOPERS) |
| - Bộ khung hoàn chỉnh kết nối RTSP -> OpenCV -> YOLOv8 -> WebRTC -> Android Java.|
| - Kiến trúc CSDL và API chuẩn RESTful quản lý IoT Camera. |
+------------------------------------------------------------------------------------+
| 3. DOANH NGHIỆP & CƠ SỞ Y TẾ / VIỆN DƯỠNG LÃO |
| - Giải pháp giám sát an toàn tự động hóa, cắt giảm 60% chi phí nhân sự tuần tra.|
| - Khả năng mở rộng quản trị hàng trăm camera trên một nền tảng quản trị tập trung.|
+------------------------------------------------------------------------------------+
| 4. CỘNG ĐỒNG XÃ HỘI & CÁC HỘ GIA ĐÌNH |
| - Bảo vệ an toàn tuyệt đối cho người già và trẻ nhỏ, cứu chữa kịp thời sự cố. |
| - Bảo mật dữ liệu video riêng tư, không lo rò rỉ dữ liệu lên Cloud công cộng. |
+------------------------------------------------------------------------------------+
Câu hỏi thường gặp
1. Hệ thống có yêu cầu Camera chuyên dụng đắt tiền không?
Không. Hệ thống tương thích với tất cả các dòng IP Camera phổ thông trên thị trường (như Dahua, Hikvision, Imou, TP-Link Tapo, Ezviz) miễn là camera hỗ trợ chuẩn truyền luồng RTSP (Real-Time Streaming Protocol) hoặc chuẩn tương thích ONVIF.
2. Khi mất kết nối Internet, hệ thống có phát hiện được té ngã không?
Nếu máy chủ AI Server được đặt cục bộ trong mạng LAN của gia đình (Local Edge Server), hệ thống vẫn liên tục phân tích hình ảnh và kích hoạt còi báo động gắn ngoài tại nhà. Tuy nhiên, tính năng gửi thông báo Push Notification đến điện thoại khi người thân ra ngoài sẽ tạm gián đoạn cho đến khi có mạng trở lại.
3. Tại sao chọn YOLOv8 thay vì OpenPose kết hợp LSTM cho phiên bản thực tế?
Mặc dù OpenPose + LSTM/Transformer có khả năng phân tích chuỗi động học khớp xương rất chi tiết, nhưng tổng thời gian trích xuất pose và suy luận tốn từ 240ms - 290ms trên CPU. Trong khi đó, YOLOv8 xử lý theo cơ chế Single-shot chỉ mất 11ms trên GPU và 45ms trên CPU, đạt độ chính xác tương đương hoặc cao hơn ($94.15%$ vs $88.20%$), đáp ứng mượt mà chuẩn thời gian thực $\ge 25\text{ FPS}$.
4. Hệ thống đảm bảo tính bảo mật và quyền riêng tư của video gia đình như thế nào?
Toàn bộ luồng truyền video trực tiếp giữa máy chủ và điện thoại được mã hóa bằng giao thức SRTP (Secure Real-time Transport Protocol) thông qua trao đổi khóa bảo mật DTLS. Dữ liệu hình ảnh chỉ lưu trữ trên máy chủ riêng của người dùng, không thông qua máy chủ đám mây của bên thứ ba.
5. Chi phí ước tính để tự xây dựng một hệ thống HomeCamera tại nhà là bao nhiêu?
Chi phí phần cứng tối thiểu gồm: 1 Camera IP RTSP (khoảng 500.000 - 800.000 VNĐ) và 1 Mini PC/Máy tính cũ có GPU rời hoặc bo mạch nhúng Jetson (khoảng 3.000.000 - 6.000.000 VNĐ). Ứng dụng Android và mã nguồn máy chủ là hoàn toàn miễn phí, không phát sinh chi phí duy trì hàng tháng.
Kết luận
Đề tài tốt nghiệp "Xây dựng ứng dụng di động tích hợp với camera giám sát tại nhà để phát hiện mối nguy hiểm tiềm ẩn qua mô hình học sâu" đã giải quyết xuất sắc bài toán giám sát an toàn gia đình chủ động. Bằng cách kết hợp đột phá giữa mạng nơ-ron học sâu thị giác máy tính thế hệ mới (YOLOv8) và công nghệ truyền phát video thời gian thực độ trễ siêu thấp (WebRTC), đề tài đã chứng minh tính ứng dụng thực tiễn cao, hiệu năng vượt trội và khả năng bảo vệ người yếu thế trong xã hội hiện đại.
Hệ thống mở ra hướng phát triển bền vững cho các giải pháp nhà thông minh (Smart Home) và chăm sóc y tế thông minh (Smart Healthcare) tự chủ tại Việt Nam trong kỷ nguyên Trí tuệ nhân tạo.